Skip to content
ความปลอดภัยและจริยธรรม

Anthropic และ NNSA ร่วมพัฒนาระบบจำแนกเพื่อสกัดการใช้ Claude ในทางที่ผิดด้านนิวเคลียร์

Anthropic ระบุว่าได้ร่วมมือกับ NNSA และห้องปฏิบัติการแห่งชาติของกระทรวงพลังงานสหรัฐฯ พัฒนาระบบจำแนกที่ช่วยตรวจจับบทสนทนาที่เกี่ยวข้องกับนิวเคลียร์ซึ่งน่ากังวลบน Claude

โดย DigitalNeuron Deskอ่าน 1 นาที

คำตอบโดยย่อ

Anthropic ประกาศอะไรเกี่ยวกับมาตรการป้องกันด้านนิวเคลียร์สำหรับ AI?

Anthropic ระบุว่าได้ร่วมมือกับสำนักงานความมั่นคงทางนิวเคลียร์แห่งชาติ (NNSA) ของกระทรวงพลังงานสหรัฐฯ และห้องปฏิบัติการแห่งชาติของกระทรวงพลังงาน เพื่อร่วมกันพัฒนาระบบจำแนกที่สามารถแยกแยะบทสนทนาเกี่ยวกับนิวเคลียร์ที่น่ากังวลออกจากบทสนทนาทั่วไปได้ด้วยความแม่นยำ 96% ในการทดสอบเบื้องต้น ปัจจุบัน Anthropic ได้นำระบบจำแนกนี้ไปใช้งานกับการสนทนาบน Claude แล้ว และมีแผนจะแบ่งปันแนวทางดังกล่าวกับ Frontier Model Forum

ประเด็นสำคัญ

  • Anthropic ระบุว่าได้ร่วมมือกับ NNSA ตั้งแต่เดือนเมษายน เพื่อประเมินความเสี่ยงด้านการแพร่ขยายอาวุธนิวเคลียร์จากโมเดลของตน
  • Anthropic ระบุว่าได้ร่วมพัฒนาระบบจำแนกกับ NNSA และห้องปฏิบัติการแห่งชาติของกระทรวงพลังงาน ซึ่งสามารถแยกแยะบทสนทนาเกี่ยวกับนิวเคลียร์ที่น่ากังวลออกจากบทสนทนาทั่วไปได้ด้วยความแม่นยำ 96% ในการทดสอบเบื้องต้น
  • Anthropic ระบุว่าระบบจำแนกนี้ถูกนำไปใช้งานกับการสนทนาบน Claude แล้ว โดยเป็นส่วนหนึ่งของระบบที่ครอบคลุมกว่าในการตรวจจับการใช้งานในทางที่ผิด
  • Anthropic ระบุว่าข้อมูลจากการใช้งานช่วงแรกบ่งชี้ว่าระบบจำแนกนี้ทำงานได้ดีกับบทสนทนาจริงบน Claude
  • Anthropic มีแผนจะแบ่งปันแนวทางนี้กับ Frontier Model Forum เพื่อให้ผู้พัฒนา AI รายอื่นสามารถวางมาตรการป้องกันในลักษณะเดียวกันร่วมกับ NNSA

Anthropic ระบุว่าได้ร่วมพัฒนาระบบจำแนกกับสำนักงานความมั่นคงทางนิวเคลียร์แห่งชาติ (NNSA) ของกระทรวงพลังงานสหรัฐฯ และห้องปฏิบัติการแห่งชาติของกระทรวงพลังงาน โดยระบบนี้ออกแบบมาเพื่อตรวจจับการใช้โมเดล Claude ในทางที่ผิดที่เกี่ยวข้องกับนิวเคลียร์

ตามข้อมูลของ Anthropic บริษัทเริ่มทำงานร่วมกับ NNSA ตั้งแต่เดือนเมษายนที่ผ่านมา เพื่อประเมินความเสี่ยงด้านการแพร่ขยายอาวุธนิวเคลียร์จากโมเดลของตน Anthropic ระบุว่าเทคโนโลยีนิวเคลียร์มีลักษณะใช้ได้สองทางโดยธรรมชาติ เนื่องจากหลักฟิสิกส์เดียวกันที่ใช้ขับเคลื่อนเครื่องปฏิกรณ์นิวเคลียร์ก็สามารถถูกนำไปใช้ในทางที่ผิดเพื่อพัฒนาอาวุธได้ และข้อมูลที่เกี่ยวข้องกับอาวุธนิวเคลียร์นั้นมีความอ่อนไหวเป็นพิเศษ ทำให้การประเมินความเสี่ยงเป็นเรื่องยากหากบริษัทเอกชนต้องดำเนินการเพียงลำพัง

ระบบจำแนกทำหน้าที่อะไร

Anthropic อธิบายว่าระบบจำแนกนี้เป็นระบบ AI ที่จัดหมวดหมู่เนื้อหาโดยอัตโนมัติ ซึ่งถูกสร้างขึ้นเพื่อแยกแยะระหว่างบทสนทนาเกี่ยวกับนิวเคลียร์ที่น่ากังวลกับบทสนทนาทั่วไปที่ไม่เป็นอันตราย บริษัทระบุว่าระบบนี้มีความแม่นยำถึง 96% ในการทดสอบเบื้องต้น

Anthropic ระบุว่าได้นำระบบจำแนกนี้ไปใช้งานกับการสนทนาบน Claude แล้ว โดยเป็นส่วนหนึ่งของระบบที่ครอบคลุมกว่าในการตรวจจับการใช้โมเดลในทางที่ผิด และข้อมูลจากการใช้งานช่วงแรกบ่งชี้ว่าระบบจำแนกนี้ทำงานได้ดีกับบทสนทนาจริงบน Claude

การแบ่งปันแนวทาง

Anthropic ระบุว่ามีแผนจะแบ่งปันแนวทางนี้กับ Frontier Model Forum ซึ่งเป็นองค์กรอุตสาหกรรมของบริษัท AI แนวหน้า ด้วยความหวังว่าความร่วมมือนี้จะเป็นต้นแบบให้ผู้พัฒนา AI รายอื่นนำไปใช้เพื่อวางมาตรการป้องกันในลักษณะเดียวกันร่วมกับ NNSA

บริษัทระบุว่าความพยายามนี้สะท้อนถึงความร่วมมือระหว่างภาครัฐและเอกชน ซึ่งผสานจุดแข็งที่เกื้อกูลกันระหว่างภาคอุตสาหกรรมและภาครัฐ เพื่อรับมือกับความเสี่ยงที่เกี่ยวข้องกับโมเดล AI แนวหน้า

Anthropic ระบุว่ารายละเอียดทั้งหมดเกี่ยวกับความร่วมมือกับ NNSA และการพัฒนามาตรการป้องกันนี้สามารถดูได้ที่บล็อก Frontier Red Team ของบริษัทที่ red.anthropic.com ซึ่งบริษัทระบุว่าเป็นแหล่งรวมงานวิจัยเกี่ยวกับความหมายของโมเดล AI แนวหน้าต่อความมั่นคงของชาติ

แหล่งข้อมูล: Anthropic, "Developing nuclear safeguards for AI through public-private partnership," เผยแพร่เมื่อ 21 ส.ค. 2025

คำถามที่พบบ่อย

Anthropic ร่วมมือกับใครในความพยายามครั้งนี้?
Anthropic ระบุว่าได้ร่วมมือกับสำนักงานความมั่นคงทางนิวเคลียร์แห่งชาติ (NNSA) ของกระทรวงพลังงานสหรัฐฯ และห้องปฏิบัติการแห่งชาติของกระทรวงพลังงาน
ความร่วมมือนี้ก่อให้เกิดผลลัพธ์อะไร?
Anthropic ระบุว่าความร่วมมือนี้ก่อให้เกิดระบบจำแนก ซึ่งเป็นระบบ AI ที่จัดหมวดหมู่เนื้อหาโดยอัตโนมัติ สามารถแยกแยะบทสนทนาเกี่ยวกับนิวเคลียร์ที่น่ากังวลออกจากบทสนทนาทั่วไปได้ด้วยความแม่นยำ 96% ในการทดสอบเบื้องต้น
ระบบจำแนกนี้ถูกนำไปใช้งานจริงแล้วหรือยัง?
Anthropic ระบุว่าได้นำระบบจำแนกนี้ไปใช้งานกับการสนทนาบน Claude แล้ว โดยเป็นส่วนหนึ่งของระบบที่ครอบคลุมกว่าในการตรวจจับการใช้โมเดลในทางที่ผิด
Anthropic มีแผนจะทำอะไรต่อไป?
Anthropic ระบุว่าจะแบ่งปันแนวทางนี้กับ Frontier Model Forum ซึ่งเป็นองค์กรอุตสาหกรรมของบริษัท AI แนวหน้า เพื่อให้ความร่วมมือนี้เป็นต้นแบบสำหรับผู้พัฒนา AI รายอื่นที่ทำงานร่วมกับ NNSA

แหล่งข้อมูล

  1. Developing nuclear safeguards for AI through public-private partnership \ AnthropicAnthropic
แท็กanthropicclaudenuclear-safeguardsnnsanational-securityfrontier-red-team

อ่านเพิ่มเติม

Anthropic ระบุว่าแล็บ AI สามแห่งใช้บัญชีปลอมเพื่อสกัดองค์ความรู้จาก Claude

Anthropic said DeepSeek, Moonshot and MiniMax conducted industrial-scale campaigns to extract Claude’s capabilities through distillation. The company said the labs generated more than 16 million exchanges using about 24,000 fraudulent accounts, targeting capabilities including reasoning, tool use and coding. Anthropic described new detection, intelligence-sharing, access-control and countermeasure efforts.

อ่าน 5 นาที

Anthropic เปิดเผยว่า Claude เข้าถึงองค์กรสามแห่งระหว่างการประเมินด้านไซเบอร์

Anthropic ระบุว่าโมเดล Claude สามตัวเข้าถึงองค์กรสามแห่งโดยไม่ได้รับอนุญาต ระหว่างการประเมินด้านความปลอดภัยไซเบอร์ที่เชื่อมต่ออินเทอร์เน็ตโดยผิดพลาด บริษัทพบการรันงานที่ได้รับผลกระทบ 6 ครั้งจากการตรวจสอบทั้งหมด 141,006 ครั้ง จึงระงับการประเมินด้านไซเบอร์ทั้งหมด แจ้งพันธมิตรด้านการประเมินและองค์กรที่ได้รับผลกระทบ พร้อมเริ่มดำเนินการแก้ไข

อ่าน 7 นาที

Anthropic ประกาศมาตรการป้องกันที่ลูกค้าควบคุมได้สำหรับการใช้งาน Claude ระดับองค์กร

Anthropic ประกาศเปิดตัว Enterprise Frontier Safeguards ซึ่งเป็นโซลูชันแบบเลือกใช้งานเองที่จัดเก็บข้อมูลการตรวจสอบไว้บนโครงสร้างพื้นฐานคลาวด์ที่ลูกค้าควบคุม และใช้ระบบอัตโนมัติในการตรวจจับการใช้งานในทางที่ผิดร้ายแรง บริษัทระบุว่า EFS ไม่จำเป็นต้องให้พนักงานของ Anthropic ตรวจสอบข้อมูลด้วยตนเอง ไม่มีค่าใช้จ่ายจาก Anthropic และจะเริ่มทยอยเปิดให้ใช้งานเป็นระยะในช่วงปลายฤดูใบไม้ร่วงนี้

อ่าน 6 นาที