Skip to content
ความปลอดภัยและจริยธรรม

Anthropic เปิดเผยรายละเอียดวิธีการทดสอบเจาะระบบ AI ของบริษัท

Anthropic outlined red teaming methods it has used to test AI systems and proposed steps for standardizing safety testing.

โดย DigitalNeuron Deskอ่าน 1 นาที

คำตอบโดยย่อ

Anthropic อธิบายวิธีการทดสอบแบบเรดทีมและข้อเสนอแนะเชิงนโยบายไว้อย่างไรบ้าง?

Anthropic detailed several methods it has used to test AI systems, including expert-led, automated, multilingual, multimodal, crowdsourced and community testing. The company also described converting qualitative findings into automated evaluations and urged policymakers to fund standards, support independent testing bodies, certify professional services and facilitate vetted third-party access.

ประเด็นสำคัญ

  • Anthropic outlined expert-led, automated, multilingual, multimodal, crowdsourced and community-based approaches to red teaming AI systems.
  • บริษัทระบุว่าใช้การทดสอบช่องโหว่ของนโยบายร่วมกับผู้เชี่ยวชาญภายนอก เพื่อตรวจสอบความเสี่ยงที่อยู่ภายใต้นโยบายการใช้งานของบริษัท
  • Anthropic described an iterative process that turns qualitative testing by experts into quantitative, automated evaluations.
  • บริษัทเสนอให้มีมาตรฐานทางเทคนิค องค์กรทดสอบอิสระ การรับรองบริการเรดทีมระดับมืออาชีพ และการเปิดให้บุคคลที่สามซึ่งผ่านการตรวจสอบเข้าถึงระบบปัญญาประดิษฐ์ได้

Anthropic เผยแพร่ภาพรวมวิธีการเรดทีมมิงที่บริษัทใช้ทดสอบระบบ AI โดยอธิบายประโยชน์และความท้าทาย พร้อมเสนอมาตรการเพื่อสนับสนุนให้การทดสอบความปลอดภัยมีมาตรฐานมากขึ้น

บริษัทนิยามเรดทีมมิงว่าเป็นการทดสอบเชิงปรปักษ์ที่ออกแบบมาเพื่อค้นหาช่องโหว่ที่อาจเกิดขึ้นในระบบเทคโนโลยี โดยระบุว่าเทคนิคและแนวปฏิบัติที่ไม่สอดคล้องกันทำให้ยากต่อการเปรียบเทียบความปลอดภัยของระบบ AI แต่ละระบบอย่างเป็นกลาง

การทดสอบความเสี่ยงเฉพาะด้านโดยผู้เชี่ยวชาญ

Anthropic ระบุว่า ในงานเฉพาะสาขา บริษัทเชิญผู้เชี่ยวชาญในแต่ละด้านมาร่วมค้นหาและประเมินช่องโหว่ภายในสาขาของตน สำหรับความเสี่ยงด้านความน่าเชื่อถือและความปลอดภัย บริษัทใช้การทดสอบช่องโหว่เชิงนโยบาย ซึ่งเป็นกระบวนการเชิงคุณภาพอย่างละเอียดที่ดำเนินการร่วมกับผู้เชี่ยวชาญภายนอกในประเด็นที่ครอบคลุมอยู่ในนโยบายการใช้งานของบริษัท

บริษัทระบุชื่อ Thorn, Institute for Strategic Dialogue และ Global Project Against Hate and Extremism ว่าเป็นองค์กรส่วนหนึ่งที่ร่วมดำเนินงานเกี่ยวกับความปลอดภัยของเด็ก ความสุจริตของการเลือกตั้ง และการปลุกระดมให้มีแนวคิดสุดโต่ง

Anthropic ระบุว่า การทดสอบภัยคุกคามจาก AI แนวหน้ามุ่งเน้นความเสี่ยงด้านเคมี ชีวภาพ รังสี และนิวเคลียร์ ความมั่นคงปลอดภัยทางไซเบอร์ และความเสี่ยงจาก AI ที่ทำงานได้โดยอัตโนมัติเป็นหลัก ผู้เชี่ยวชาญภายนอกอาจทดสอบ Claude เวอร์ชันที่เปิดให้ใช้งานแล้วในสภาพแวดล้อมที่ออกแบบให้สะท้อนการใช้งานจริง หรือทำงานกับเวอร์ชันที่ไม่ได้ใช้เชิงพาณิชย์ซึ่งมีมาตรการลดความเสี่ยงแตกต่างกัน

บริษัทยังอธิบายว่าการทดสอบหลายภาษาและหลายวัฒนธรรมเป็นแนวทางแก้ปัญหาที่งานเรดทีมมิงส่วนใหญ่กระจุกตัวอยู่ในภาษาอังกฤษและมุมมองของผู้ที่อาศัยอยู่ในสหรัฐอเมริกา โดยยกตัวอย่างโครงการที่ร่วมกับ Infocomm Media Development Authority ของสิงคโปร์และ AI Verify Foundation ซึ่งครอบคลุมภาษาอังกฤษ ทมิฬ จีนกลาง และมลายู ตลอดจนประเด็นที่เกี่ยวข้องกับผู้ใช้ในสิงคโปร์

วิธีการอัตโนมัติและหลายรูปแบบ

Anthropic ระบุว่ากำลังศึกษาวิธีนำโมเดลมาเสริมการทดสอบด้วยมนุษย์ วิธีการอัตโนมัติของบริษัทใช้โมเดลเรดทีมสร้างการโจมตีที่มีแนวโน้มจะทำให้เกิดพฤติกรรมเป้าหมาย จากนั้นนำผลลัพธ์ดังกล่าวไปปรับแต่งโมเดลบลูทีมเพื่อเพิ่มความทนทานต่อการโจมตีในลักษณะคล้ายกัน บริษัทระบุว่าสามารถทำกระบวนการนี้ซ้ำเพื่อพัฒนาแนวทางการโจมตีรูปแบบใหม่

สำหรับ Claude 3 ซึ่งรับข้อมูลภาพและสร้างคำตอบเป็นข้อความ Anthropic ระบุว่า ทีมความน่าเชื่อถือและความปลอดภัยได้ทดสอบความเสี่ยงจากภาพและข้อความก่อนเปิดให้ใช้งาน ผู้ทดสอบเรดทีมจากภายนอกยังประเมินด้วยว่าโมเดลสามารถปฏิเสธข้อมูลภาพและข้อความที่เป็นอันตรายได้ดีเพียงใด

นอกจากนี้ Anthropic ยังอธิบายถึงการทดสอบแบบระดมความร่วมมือจากสาธารณชนและชุมชน โดยระบุว่าผู้ปฏิบัติงานผ่านแพลตฟอร์มออนไลน์เข้าร่วมการวิจัยภายใต้การควบคุมก่อนเปิดตัว Claude บริษัทยังกล่าวด้วยว่า ในการแข่งขัน Generative Red Teaming Challenge ปี 2023 ที่ AI Village ของ DEF CON มีผู้คนนับพันจากหลากหลายช่วงวัยและสาขาวิชา รวมถึงผู้เข้าร่วมที่ไม่มีพื้นฐานด้านเทคนิค ร่วมทดสอบโมเดลที่ Anthropic และห้องปฏิบัติการอื่น ๆ จัดเตรียมไว้

จากการทดสอบเชิงคุณภาพสู่การประเมินผล

บริษัทอธิบายกระบวนการทำซ้ำเป็นรอบ โดยเริ่มจากผู้เชี่ยวชาญเฉพาะด้านกำหนดแบบจำลองภัยคุกคามและทดสอบค้นหาจุดอ่อนของระบบ จากนั้นผู้ทดสอบจะกำหนดรูปแบบมาตรฐานสำหรับอินพุตที่ได้ผล ก่อนใช้โมเดลภาษาสร้างรูปแบบแปรผันนับร้อยหรือนับพัน Anthropic ระบุว่าได้นำกระบวนการนี้ไปพัฒนาการประเมินที่ปรับขยายได้สำหรับความเสี่ยงด้านความมั่นคงแห่งชาติและการทดสอบความสุจริตของการเลือกตั้ง

Anthropic แนะนำให้ผู้กำหนดนโยบายสนับสนุนเงินทุนสำหรับมาตรฐานทางเทคนิคและแนวปฏิบัติร่วม สนับสนุนหน่วยงานภาครัฐและองค์กรไม่แสวงหากำไรที่ทำหน้าที่ทดสอบอย่างเป็นอิสระ ส่งเสริมบริการเรดทีมมิงโดยผู้เชี่ยวชาญที่ผ่านการรับรอง และอำนวยความสะดวกให้กลุ่มภายนอกที่ผ่านการตรวจสอบสามารถเข้ามาทดสอบได้ นอกจากนี้ยังเรียกร้องให้บริษัทต่าง ๆ เชื่อมโยงข้อกำหนดด้านเรดทีมมิงเข้ากับนโยบายที่กำกับดูแลการพัฒนาโมเดลต่อเนื่องหรือการเปิดตัวโมเดล

ที่มา: ประกาศ “Challenges in red teaming AI systems” ของ Anthropic เผยแพร่เมื่อวันที่ 12 มิถุนายน 2024

คำถามที่พบบ่อย

What is AI red teaming?
Anthropic อธิบายว่าเรดทีมมิงคือการทดสอบเชิงปฏิปักษ์ที่มุ่งค้นหาช่องโหว่ที่อาจเกิดขึ้นในระบบเทคโนโลยี
Which risks does Anthropic examine through expert red teaming?
บริษัทระบุว่างานครอบคลุมประเด็นด้านนโยบายความน่าเชื่อถือและความปลอดภัย ตลอดจนภัยคุกคามแนวหน้า ซึ่งรวมถึงความเสี่ยงด้านเคมี ชีวภาพ รังสีและนิวเคลียร์ ความมั่นคงปลอดภัยไซเบอร์ และความเสี่ยงจากปัญญาประดิษฐ์ที่ทำงานได้โดยอัตโนมัติ
How does Anthropic use models for automated red teaming?
Anthropic ระบุว่า โมเดลหนึ่งจะสร้างการโจมตีที่มุ่งกระตุ้นให้เกิดพฤติกรรมเป้าหมาย ขณะที่อีกโมเดลได้รับการปรับแต่งเพิ่มเติมโดยใช้ผลลัพธ์เหล่านั้น เพื่อให้ทนทานต่อการโจมตีลักษณะเดียวกันมากขึ้น กระบวนการนี้สามารถทำซ้ำเพื่อพัฒนาช่องทางการโจมตีเพิ่มเติมได้
What policy measures did Anthropic recommend?
Anthropic เรียกร้องให้กำหนดมาตรฐานด้านเงินทุนและจัดตั้งหน่วยงานทดสอบอิสระ พัฒนาบริการเรดทีมมิงระดับมืออาชีพที่ผ่านการรับรอง อำนวยความสะดวกให้บุคคลที่สามซึ่งผ่านการตรวจสอบเข้ามาทดสอบ และเชื่อมโยงแนวปฏิบัติด้านเรดทีมมิงเข้ากับเงื่อนไขในการขยายขนาดหรือเผยแพร่โมเดล

แหล่งข้อมูล

  1. Challenges in red teaming AI systems \ AnthropicAnthropic
แท็กanthropicclaudered-teamingai-safetymodel-evaluationspolicy

อ่านเพิ่มเติม

Anthropic เปิดรายละเอียดมาตรการคุ้มครอง Claude ก่อนการเลือกตั้งสหรัฐฯ

Anthropic เปิดเผยมาตรการที่มุ่งป้องกันการใช้ Claude ในทางที่ผิดเกี่ยวกับการเลือกตั้ง ซึ่งรวมถึงข้อจำกัดด้านการหาเสียง การล็อบบี้ และข้อมูลเท็จ ระบบบังคับใช้อัตโนมัติที่มีมนุษย์ตรวจสอบ การทดสอบเจาะจงเพื่อค้นหาช่องโหว่ และการประเมินผลในวงกว้าง นอกจากนี้ บริษัทยังนำคำถามเกี่ยวกับการเลือกตั้งไปยังข้อมูลการลงคะแนนเสียงที่เป็นปัจจุบัน และระบุวันที่สิ้นสุดขอบเขตความรู้ของ Claude ไว้ในพรอมต์ระบบ

อ่าน 7 นาที

Anthropic เปิดเผยรายละเอียดกรอบการประเมินอันตรายจาก AI

Anthropic เปิดเผยว่า บริษัทได้พัฒนากรอบการทำงานเพื่อประเมินอันตรายที่อาจเกิดจาก AI ในห้ามิติ ได้แก่ ผลกระทบทางกายภาพ จิตใจ เศรษฐกิจ สังคม และความเป็นอิสระของบุคคล บริษัทระบุว่าใช้กรอบนี้ควบคู่กับนโยบายการขยายขีดความสามารถอย่างรับผิดชอบ เพื่อประกอบการกำหนดนโยบายการใช้งาน การประเมินผล การตรวจจับ และการบังคับใช้มาตรการต่างๆ รวมถึงกับความสามารถในการใช้งานคอมพิวเตอร์และ Claude 3.7 Sonnet

อ่าน 7 นาที

Anthropic เปิดเผยรายละเอียดการใช้ Claude ในทางที่ผิดเพื่อปฏิบัติการโน้มน้าวความคิดเห็น การฉ้อโกง และมัลแวร์

Anthropic รายงานว่ามีผู้ไม่หวังดีนำ Claude ไปใช้ในปฏิบัติการโน้มน้าวความคิดเห็น ความพยายามที่เกี่ยวข้องกับข้อมูลรับรองกล้องวงจรปิดที่รั่วไหล แคมเปญฉ้อโกงด้านการสมัครงาน และการพัฒนามัลแวร์ บริษัทระบุว่าได้ระงับบัญชีที่เกี่ยวข้องทั้งหมด พร้อมใช้เทคนิควิเคราะห์บทสนทนาและระบบจำแนกประเภทเพื่อตรวจจับ สืบสวน และสกัดกั้นกิจกรรมดังกล่าว

อ่าน 7 นาที