Skip to content
ความปลอดภัยและจริยธรรม

Anthropic เปิดเผยรายละเอียดกรอบการประเมินอันตรายจาก AI

Anthropic เปิดเผยว่า บริษัทกำลังเผยแพร่กรอบการทำงานที่อยู่ระหว่างการพัฒนา ซึ่งใช้ประเมินอันตรายจาก AI ในห้ามิติ เพื่อเสริมนโยบายการขยายขีดความสามารถอย่างรับผิดชอบ

โดย DigitalNeuron Deskอ่าน 1 นาที

คำตอบโดยย่อ

Anthropic ประกาศกรอบการทำงานใดสำหรับประเมินอันตรายจาก AI?

Anthropic เปิดเผยว่า บริษัทได้พัฒนากรอบการทำงานเพื่อประเมินอันตรายที่อาจเกิดจาก AI ในห้ามิติ ได้แก่ ผลกระทบทางกายภาพ จิตใจ เศรษฐกิจ สังคม และความเป็นอิสระของบุคคล บริษัทระบุว่าใช้กรอบนี้ควบคู่กับนโยบายการขยายขีดความสามารถอย่างรับผิดชอบ เพื่อประกอบการกำหนดนโยบายการใช้งาน การประเมินผล การตรวจจับ และการบังคับใช้มาตรการต่างๆ รวมถึงกับความสามารถในการใช้งานคอมพิวเตอร์และ Claude 3.7 Sonnet

ประเด็นสำคัญ

  • Anthropic เผยแพร่กรอบการประเมินอันตรายจาก AI ในห้ามิติ ได้แก่ ผลกระทบทางกายภาพ จิตใจ เศรษฐกิจ สังคม และความเป็นอิสระของบุคคล
  • บริษัทระบุว่า กรอบการทำงานนี้เสริมนโยบายการขยายขีดความสามารถอย่างรับผิดชอบ ซึ่งมุ่งเน้นความเสี่ยงระดับหายนะ ด้วยการครอบคลุมอันตรายที่อาจเกิดขึ้นในวงกว้างขึ้น
  • สำหรับความสามารถในการใช้งานคอมพิวเตอร์ Anthropic ระบุว่า บริษัทพบความเสี่ยงเกี่ยวกับซอฟต์แวร์การเงินและเครื่องมือสื่อสาร และตอบสนองด้วยการกำหนดเกณฑ์การบังคับใช้ที่เข้มงวดยิ่งขึ้น พร้อมใช้เทคนิคการสรุปแบบลำดับชั้น
  • Anthropic ระบุว่า การนำกรอบการทำงานนี้ไปใช้กับ Claude 3.7 Sonnet ช่วยลดการปฏิเสธที่ไม่จำเป็นลง 45% โดยยังคงมาตรการป้องกันเนื้อหาที่เป็นอันตรายไว้
  • บริษัทระบุว่า แนวทางนี้ยังอยู่ระหว่างการพัฒนา และเชิญชวนนักวิจัยกับผู้เชี่ยวชาญด้านนโยบายจากภายนอกให้เข้ามาร่วมมือ

Anthropic เปิดเผยกรอบการประเมินอันตราย

Anthropic เปิดเผยว่า บริษัทกำลังเผยแพร่แนวทางที่อยู่ระหว่างการพัฒนาในการประเมินและบรรเทาอันตรายหลากหลายรูปแบบที่อาจเกิดจากระบบ AI ของบริษัท ตั้งแต่ความเสี่ยงระดับหายนะ เช่น ภัยคุกคามทางชีวภาพ ไปจนถึงข้อกังวลด้านความปลอดภัยของเด็ก ข้อมูลบิดเบือน และการฉ้อโกง

บริษัทระบุว่า กรอบการทำงานนี้เสริมนโยบายการขยายขีดความสามารถอย่างรับผิดชอบ ซึ่งมุ่งเน้นเฉพาะความเสี่ยงระดับหายนะ ด้วยการพิจารณาผลกระทบประเภทอื่นๆ ในวงกว้างขึ้น Anthropic อธิบายว่าแนวทางดังกล่าวยังอยู่ระหว่างการพัฒนา และการเปิดเผยครั้งนี้เป็นการนำเสนอแนวคิดในปัจจุบันซึ่งจะพัฒนาต่อไป

อันตรายห้ามิติ

Anthropic ระบุว่า บริษัทประเมินผลกระทบที่อาจเกิดขึ้นตามมิติพื้นฐานห้าประการ ได้แก่

  • ผลกระทบทางกายภาพ: ผลต่อสุขภาพและความเป็นอยู่ที่ดีของร่างกาย
  • ผลกระทบทางจิตใจ: ผลต่อสุขภาพจิตและการทำงานด้านการรู้คิด
  • ผลกระทบทางเศรษฐกิจ: ผลกระทบทางการเงินและประเด็นเกี่ยวกับทรัพย์สิน
  • ผลกระทบทางสังคม: ผลต่อชุมชน สถาบัน และระบบที่ใช้ร่วมกัน
  • ผลกระทบต่อความเป็นอิสระของบุคคล: ผลต่อการตัดสินใจและเสรีภาพส่วนบุคคล

สำหรับแต่ละมิติ บริษัทระบุว่าจะพิจารณาปัจจัยต่างๆ ซึ่งรวมถึงโอกาสที่จะเกิดขึ้น ขนาดของผลกระทบ กลุ่มประชากรที่ได้รับผลกระทบ ระยะเวลา ความสัมพันธ์เชิงสาเหตุ ระดับที่เทคโนโลยีมีส่วนทำให้เกิดอันตราย และความเป็นไปได้ในการบรรเทาผลกระทบ

Anthropic ระบุว่า บริษัทบริหารความเสี่ยงที่พบผ่านกรอบการทำงานนี้ด้วยมาตรการหลายประการร่วมกัน ได้แก่ นโยบายการใช้งาน การประเมินผล เช่น การทดสอบโดยทีมแดงและการทดสอบเชิงปฏิปักษ์ทั้งก่อนและหลังเปิดตัว เทคนิคการตรวจจับที่มุ่งค้นหาการใช้งานในทางที่ผิด และการบังคับใช้มาตรการตั้งแต่การปรับแก้พรอมต์ไปจนถึงการระงับบัญชี

ตัวอย่างที่ยกมา

Anthropic ยกตัวอย่างการนำกรอบการทำงานนี้ไปใช้สองกรณี

สำหรับความสามารถในการใช้งานคอมพิวเตอร์ ซึ่งเปิดให้โมเดลโต้ตอบกับส่วนติดต่อของคอมพิวเตอร์ได้ บริษัทระบุว่าได้ตรวจสอบความเสี่ยงที่เกี่ยวข้องกับซอฟต์แวร์การเงินและแพลตฟอร์มธนาคาร ซึ่งระบบอัตโนมัติที่ไม่ได้รับอนุญาตอาจเอื้อให้เกิดการฉ้อโกงหรือการบิดเบือน ตลอดจนเครื่องมือสื่อสารที่อาจถูกใช้เพื่อปฏิบัติการชักจูงแบบมุ่งเป้าหรือฟิชชิง Anthropic ระบุว่า การวิเคราะห์นี้ทำให้บริษัทกำหนดเกณฑ์การบังคับใช้ที่เข้มงวดยิ่งขึ้น และใช้การสรุปแบบลำดับชั้น ซึ่งเป็นแนวทางที่บริษัทระบุว่าช่วยให้ตรวจจับอันตรายได้โดยยังคงรักษามาตรฐานความเป็นส่วนตัว

บริษัทยังอธิบายงานเกี่ยวกับสิ่งที่เรียกว่า ขอบเขตการตอบสนองของโมเดล ซึ่งครอบคลุมวิธีที่โมเดลจัดการคำขอซึ่งอยู่ระหว่างสิ่งที่ไม่เป็นอันตรายอย่างชัดเจนกับสิ่งที่เป็นอันตรายอย่างชัดเจน Anthropic ระบุว่า โมเดลที่ได้รับการฝึกให้ช่วยเหลือผู้ใช้มากขึ้นอาจมีแนวโน้มแสดงพฤติกรรมที่เป็นอันตราย ขณะที่โมเดลซึ่งให้ความสำคัญกับการไม่ก่ออันตรายมากเกินไปอาจปฏิเสธการให้ข้อมูลแม้คำขอนั้นจะไม่เป็นอันตราย สำหรับ Claude 3.7 Sonnet บริษัทระบุว่าได้ประเมินคำขอประเภทต่างๆ ตลอดช่วงดังกล่าว และปรับเปลี่ยนวิธีที่โมเดลจัดการพรอมต์ที่กำกวม โดยให้ความสำคัญกับคำตอบที่ปลอดภัยและเป็นประโยชน์มากกว่าการปฏิเสธ Anthropic ระบุว่า การดำเนินการนี้ช่วยลดการปฏิเสธที่ไม่จำเป็นลง 45% ขณะเดียวกันยังคงมาตรการป้องกันเนื้อหาที่เป็นอันตรายไว้อย่างเข้มแข็ง บริษัทระบุว่า การวิเคราะห์ในลักษณะนี้ยังช่วยกำหนดจุดเน้นของการประเมินด้านความปลอดภัยสำหรับกลุ่มที่บริษัทเห็นว่าอาจเผชิญความเสี่ยงสูงขึ้น ซึ่งรวมถึงเด็ก ชุมชนชายขอบ และบุคคลที่อยู่ในภาวะวิกฤต

ยังคงอยู่ระหว่างการพัฒนา

Anthropic ระบุว่า แนวทางในการทำความเข้าใจและรับมือกับอันตรายนี้เป็นหนึ่งในองค์ประกอบของยุทธศาสตร์ด้านความปลอดภัยในภาพรวม และคาดว่าจะเกิดความท้าทายใหม่ๆ เมื่อระบบ AI มีความสามารถเพิ่มขึ้น บริษัทเชิญชวนนักวิจัย ผู้เชี่ยวชาญด้านนโยบาย และพันธมิตรในอุตสาหกรรมให้ร่วมมือกันในงานนี้ โดยติดต่อได้ที่อีเมล usersafety@anthropic.com

แหล่งที่มา: Anthropic, "แนวทางของเราในการทำความเข้าใจและรับมือกับอันตรายจาก AI" เผยแพร่เมื่อวันที่ 21 เมษายน 2025

คำถามที่พบบ่อย

กรอบการประเมินอันตรายของ Anthropic ครอบคลุมมิติใดบ้าง?
Anthropic ระบุว่า กรอบการทำงานนี้ครอบคลุมห้ามิติ ได้แก่ ผลกระทบทางกายภาพ จิตใจ เศรษฐกิจ สังคม และความเป็นอิสระของบุคคล โดยแต่ละมิติยังพิจารณาปัจจัยเพิ่มเติม เช่น โอกาสที่จะเกิดขึ้น ขนาดของผลกระทบ และกลุ่มประชากรที่ได้รับผลกระทบ
กรอบการทำงานนี้เกี่ยวข้องกับนโยบายการขยายขีดความสามารถอย่างรับผิดชอบของ Anthropic อย่างไร?
Anthropic ระบุว่า กรอบการประเมินอันตรายนี้เสริมนโยบายการขยายขีดความสามารถอย่างรับผิดชอบ ซึ่งมุ่งเน้นเฉพาะความเสี่ยงระดับหายนะ โดยช่วยให้บริษัทประเมินผลกระทบประเภทอื่นๆ ได้กว้างขึ้น
Anthropic กล่าวถึง Claude 3.7 Sonnet และการปฏิเสธคำขอไว้อย่างไร?
Anthropic ระบุว่า การนำกรอบการทำงานนี้ไปใช้กับ Claude 3.7 Sonnet ช่วยปรับปรุงการจัดการพรอมต์ที่กำกวม ส่งผลให้การปฏิเสธที่ไม่จำเป็นลดลง 45% ขณะที่บริษัทยังคงมาตรการป้องกันเนื้อหาที่เป็นอันตรายไว้อย่างเข้มแข็ง
Anthropic ใช้เครื่องมือใดในการบังคับใช้แนวทางบรรเทาอันตราย?
Anthropic ระบุว่า บริษัทใช้นโยบายการใช้งาน การประเมินก่อนและหลังเปิดตัวซึ่งรวมถึงการทดสอบโดยทีมแดง เทคนิคตรวจจับการใช้งานในทางที่ผิด และการบังคับใช้มาตรการตั้งแต่การปรับแก้พรอมต์ไปจนถึงการระงับบัญชี

แหล่งข้อมูล

  1. Understanding and addressing AI harms \ AnthropicAnthropic
แท็กanthropicclaudeai-safetyresponsible-scaling-policyharm-assessmentclaude-3.7-sonnet

อ่านเพิ่มเติม

Anthropic เปิดเผยรายละเอียดการใช้ Claude ในทางที่ผิดเพื่อปฏิบัติการโน้มน้าวความคิดเห็น การฉ้อโกง และมัลแวร์

Anthropic รายงานว่ามีผู้ไม่หวังดีนำ Claude ไปใช้ในปฏิบัติการโน้มน้าวความคิดเห็น ความพยายามที่เกี่ยวข้องกับข้อมูลรับรองกล้องวงจรปิดที่รั่วไหล แคมเปญฉ้อโกงด้านการสมัครงาน และการพัฒนามัลแวร์ บริษัทระบุว่าได้ระงับบัญชีที่เกี่ยวข้องทั้งหมด พร้อมใช้เทคนิควิเคราะห์บทสนทนาและระบบจำแนกประเภทเพื่อตรวจจับ สืบสวน และสกัดกั้นกิจกรรมดังกล่าว

อ่าน 7 นาที

Anthropic launches $5 million AI wellbeing research grant program

Anthropic เปิดตัวโครงการทุนมูลค่า 5 ล้านดอลลาร์สหรัฐสำหรับการวิจัยอิสระเกี่ยวกับผลกระทบของ AI ต่อสุขภาวะของผู้ใช้ ผู้ได้รับทุนที่ได้รับการคัดเลือกจะได้รับเงินทุนโดยตรง สิทธิ์เข้าถึงโมเดลของ Anthropic และการสนับสนุนทางเทคนิค พร้อมกับพัฒนาเครื่องมือประเมินแบบโอเพนซอร์สอย่างเป็นอิสระ กำหนดส่งใบสมัครคือวันที่ 21 กันยายน และมีกำหนดส่งคำเชิญให้ยื่นข้อเสนอฉบับสมบูรณ์ภายในวันที่ 5 ตุลาคม

อ่าน 2 นาที

วิเคราะห์: prompt injection คือปัญหาเรื่องสิทธิ์การเข้าถึง ไม่ใช่ปัญหาเรื่องถ้อยคำ และการมองมันเป็นปัญหาเรื่องถ้อยคำนี่เองที่ทำให้ช่องโหว่นี้ยังคงถูกเจาะได้อยู่เสมอ

โมเดลภาษาไม่สามารถแยกแยะระหว่างคำสั่งกับข้อมูลได้อย่างน่าเชื่อถือ เพราะทั้งสองอย่างเข้ามาในรูปของสายอักขระโทเคนเดียวกัน นี่คือคุณสมบัติเชิงโครงสร้าง ไม่ใช่ข้อบกพร่องของโมเดลใดโมเดลหนึ่ง ดังนั้นจึงไม่มีพรอมป์ระบบใดที่จะปิดช่องโหว่นี้ได้ การวางระบบที่ป้องกันได้จริงต้องมองทุกอินพุตที่เอเจนต์อ่านว่าอาจเป็นภัยคุกคาม และจำกัดขอบเขตสิ่งที่เอเจนต์ได้รับอนุญาตให้ทำ ได้แก่ การจำกัดขอบเขตเครื่องมือให้แคบ การใช้ข้อมูลรับรองแยกตามเซสชัน การให้มนุษย์อนุมัติก่อนดำเนินการที่ย้อนกลับไม่ได้ และการจำกัดช่องทางออกของข้อมูล เพื่อให้การโจมตีแบบ injection ที่สำเร็จนั้นสร้างความเสียหายเพียงเล็กน้อย ไม่ใช่หายนะร้ายแรง

อ่าน 18 นาที