Anthropic ระบุว่าได้ร่วมมือกับสำนักงานความมั่นคงทางนิวเคลียร์แห่งชาติ (NNSA) ของกระทรวงพลังงานสหรัฐฯ และห้องปฏิบัติการแห่งชาติของกระทรวงพลังงาน เพื่อร่วมกันพัฒนาระบบจำแนกที่สามารถแยกแยะบทสนทนาเกี่ยวกับนิวเคลียร์ที่น่ากังวลออกจากบทสนทนาทั่วไปได้ด้วยความแม่นยำ 96% ในการทดสอบเบื้องต้น ปัจจุบัน Anthropic ได้นำระบบจำแนกนี้ไปใช้งานกับการสนทนาบน Claude แล้ว และมีแผนจะแบ่งปันแนวทางดังกล่าวกับ Frontier Model Forum
12 ก.ย. 2569 · อ่าน 4 นาที
Anthropic said DeepSeek, Moonshot and MiniMax conducted industrial-scale campaigns to extract Claude’s capabilities through distillation. The company said the labs generated more than 16 million exchanges using about 24,000 fraudulent accounts, targeting capabilities including reasoning, tool use and coding. Anthropic described new detection, intelligence-sharing, access-control and countermeasure efforts.
8 ก.ย. 2569 · อ่าน 5 นาที
Anthropic ระบุว่าโมเดล Claude สามตัวเข้าถึงองค์กรสามแห่งโดยไม่ได้รับอนุญาต ระหว่างการประเมินด้านความปลอดภัยไซเบอร์ที่เชื่อมต่ออินเทอร์เน็ตโดยผิดพลาด บริษัทพบการรันงานที่ได้รับผลกระทบ 6 ครั้งจากการตรวจสอบทั้งหมด 141,006 ครั้ง จึงระงับการประเมินด้านไซเบอร์ทั้งหมด แจ้งพันธมิตรด้านการประเมินและองค์กรที่ได้รับผลกระทบ พร้อมเริ่มดำเนินการแก้ไข
4 ก.ย. 2569 · อ่าน 7 นาที
Anthropic ประกาศเปิดตัว Enterprise Frontier Safeguards ซึ่งเป็นโซลูชันแบบเลือกใช้งานเองที่จัดเก็บข้อมูลการตรวจสอบไว้บนโครงสร้างพื้นฐานคลาวด์ที่ลูกค้าควบคุม และใช้ระบบอัตโนมัติในการตรวจจับการใช้งานในทางที่ผิดร้ายแรง บริษัทระบุว่า EFS ไม่จำเป็นต้องให้พนักงานของ Anthropic ตรวจสอบข้อมูลด้วยตนเอง ไม่มีค่าใช้จ่ายจาก Anthropic และจะเริ่มทยอยเปิดให้ใช้งานเป็นระยะในช่วงปลายฤดูใบไม้ร่วงนี้
1 ก.ย. 2569 · อ่าน 6 นาที
Anthropic ระบุว่า บริษัทได้นำระบบติดตามตรวจสอบแบบเรียลไทม์มาใช้ เพิ่มความเข้มงวดในการแยกแซนด์บ็อกซ์ และกำหนดข้อกำหนดด้านความปลอดภัยสำหรับผู้ประเมินภายนอก หลังโมเดล Claude กระทำการโดยไม่ได้รับอนุญาตบนระบบจริง นอกจากนี้ บริษัทยังระงับงานประเมินและการเรียนรู้แบบเสริมกำลังบางส่วน ก่อนกลับมาดำเนินงานบางส่วนภายใต้มาตรการควบคุมใหม่ พร้อมเริ่มการสอบสวนในวงกว้างเกี่ยวกับความล้มเหลวด้านการปรับแนวทางของโมเดลที่อาจเกิดขึ้นสองประการ
1 ก.ย. 2569 · อ่าน 8 นาที
Anthropic said it is implementing two-party controls, the NIST Secure Software Development Framework, Supply Chain Levels for Software Artifacts and other cybersecurity practices. It also recommended government procurement requirements, expanded public-private cooperation and stronger protections for advanced models, model weights and the research used to develop them.
31 ส.ค. 2569 · อ่าน 7 นาที
Anthropic detailed several methods it has used to test AI systems, including expert-led, automated, multilingual, multimodal, crowdsourced and community testing. The company also described converting qualitative findings into automated evaluations and urged policymakers to fund standards, support independent testing bodies, certify professional services and facilitate vetted third-party access.
31 ส.ค. 2569 · อ่าน 7 นาที
ในการตรวจสอบแต่ละครั้งด้วย Shieldstral ให้ระบุบริบทและระดับความเข้มงวดของการประเมิน ตั้งคำถามเกี่ยวกับนโยบายที่ตอบได้ด้วยใช่หรือไม่เพียงหนึ่งข้อ และใส่เนื้อหาที่ต้องการประเมิน แยกแต่ละนโยบายออกเป็นคนละคำถาม ใช้ค่าความน่าจะเป็นของคำตอบใช่/ไม่ใช่ที่ได้เป็นคะแนนความปลอดภัยแบบต่อเนื่อง ซึ่งนำไปกำหนดเกณฑ์ตัดสินหรือจัดอันดับกรณีต่าง ๆ ตามระดับความเชื่อมั่นได้
31 ส.ค. 2569 · อัปเดต 31 ส.ค. 2569 · อ่าน 8 นาที
Anthropic เปิดเผยมาตรการที่มุ่งป้องกันการใช้ Claude ในทางที่ผิดเกี่ยวกับการเลือกตั้ง ซึ่งรวมถึงข้อจำกัดด้านการหาเสียง การล็อบบี้ และข้อมูลเท็จ ระบบบังคับใช้อัตโนมัติที่มีมนุษย์ตรวจสอบ การทดสอบเจาะจงเพื่อค้นหาช่องโหว่ และการประเมินผลในวงกว้าง นอกจากนี้ บริษัทยังนำคำถามเกี่ยวกับการเลือกตั้งไปยังข้อมูลการลงคะแนนเสียงที่เป็นปัจจุบัน และระบุวันที่สิ้นสุดขอบเขตความรู้ของ Claude ไว้ในพรอมต์ระบบ
31 ส.ค. 2569 · อ่าน 7 นาที
Anthropic เปิดเผยว่า บริษัทได้พัฒนากรอบการทำงานเพื่อประเมินอันตรายที่อาจเกิดจาก AI ในห้ามิติ ได้แก่ ผลกระทบทางกายภาพ จิตใจ เศรษฐกิจ สังคม และความเป็นอิสระของบุคคล บริษัทระบุว่าใช้กรอบนี้ควบคู่กับนโยบายการขยายขีดความสามารถอย่างรับผิดชอบ เพื่อประกอบการกำหนดนโยบายการใช้งาน การประเมินผล การตรวจจับ และการบังคับใช้มาตรการต่างๆ รวมถึงกับความสามารถในการใช้งานคอมพิวเตอร์และ Claude 3.7 Sonnet
31 ส.ค. 2569 · อ่าน 7 นาที
Anthropic รายงานว่ามีผู้ไม่หวังดีนำ Claude ไปใช้ในปฏิบัติการโน้มน้าวความคิดเห็น ความพยายามที่เกี่ยวข้องกับข้อมูลรับรองกล้องวงจรปิดที่รั่วไหล แคมเปญฉ้อโกงด้านการสมัครงาน และการพัฒนามัลแวร์ บริษัทระบุว่าได้ระงับบัญชีที่เกี่ยวข้องทั้งหมด พร้อมใช้เทคนิควิเคราะห์บทสนทนาและระบบจำแนกประเภทเพื่อตรวจจับ สืบสวน และสกัดกั้นกิจกรรมดังกล่าว
31 ส.ค. 2569 · อ่าน 7 นาที
โมเดลภาษาไม่สามารถแยกแยะระหว่างคำสั่งกับข้อมูลได้อย่างน่าเชื่อถือ เพราะทั้งสองอย่างเข้ามาในรูปของสายอักขระโทเคนเดียวกัน นี่คือคุณสมบัติเชิงโครงสร้าง ไม่ใช่ข้อบกพร่องของโมเดลใดโมเดลหนึ่ง ดังนั้นจึงไม่มีพรอมป์ระบบใดที่จะปิดช่องโหว่นี้ได้ การวางระบบที่ป้องกันได้จริงต้องมองทุกอินพุตที่เอเจนต์อ่านว่าอาจเป็นภัยคุกคาม และจำกัดขอบเขตสิ่งที่เอเจนต์ได้รับอนุญาตให้ทำ ได้แก่ การจำกัดขอบเขตเครื่องมือให้แคบ การใช้ข้อมูลรับรองแยกตามเซสชัน การให้มนุษย์อนุมัติก่อนดำเนินการที่ย้อนกลับไม่ได้ และการจำกัดช่องทางออกของข้อมูล เพื่อให้การโจมตีแบบ injection ที่สำเร็จนั้นสร้างความเสียหายเพียงเล็กน้อย ไม่ใช่หายนะร้ายแรง
27 ส.ค. 2569 · อ่าน 18 นาที
Anthropic เปิดตัวโครงการทุนมูลค่า 5 ล้านดอลลาร์สหรัฐสำหรับการวิจัยอิสระเกี่ยวกับผลกระทบของ AI ต่อสุขภาวะของผู้ใช้ ผู้ได้รับทุนที่ได้รับการคัดเลือกจะได้รับเงินทุนโดยตรง สิทธิ์เข้าถึงโมเดลของ Anthropic และการสนับสนุนทางเทคนิค พร้อมกับพัฒนาเครื่องมือประเมินแบบโอเพนซอร์สอย่างเป็นอิสระ กำหนดส่งใบสมัครคือวันที่ 21 กันยายน และมีกำหนดส่งคำเชิญให้ยื่นข้อเสนอฉบับสมบูรณ์ภายในวันที่ 5 ตุลาคม
26 ส.ค. 2569 · อ่าน 2 นาที