앤트로픽, 클로드의 핵무기 관련 오용 방지 위해 NNSA와 분류기 공동 개발
앤트로픽은 미국 에너지부 산하 국가핵안보국(NNSA) 및 국립연구소들과 협력해, 우려되는 핵 관련 대화와 무해한 대화를 구분하는 분류기를 공동 개발했다고 밝혔다. 예비 테스트에서 96%의 정확도를 기록했다는 설명이다. 앤트로픽은 이 분류기를 이미 클로드 트래픽에 적용했으며, 해당 접근법을 프런티어 모델 포럼과 공유할 계획이라고 전했다.
평가, 오남용, 편향, 정렬 연구, 사고 보고.
기사 13건
앤트로픽은 미국 에너지부 산하 국가핵안보국(NNSA) 및 국립연구소들과 협력해, 우려되는 핵 관련 대화와 무해한 대화를 구분하는 분류기를 공동 개발했다고 밝혔다. 예비 테스트에서 96%의 정확도를 기록했다는 설명이다. 앤트로픽은 이 분류기를 이미 클로드 트래픽에 적용했으며, 해당 접근법을 프런티어 모델 포럼과 공유할 계획이라고 전했다.
Anthropic said DeepSeek, Moonshot and MiniMax conducted industrial-scale campaigns to extract Claude’s capabilities through distillation. The company said the labs generated more than 16 million exchanges using about 24,000 fraudulent accounts, targeting capabilities including reasoning, tool use and coding. Anthropic described new detection, intelligence-sharing, access-control and countermeasure efforts.
앤스로픽은 사이버보안 평가가 실수로 인터넷에 연결되면서 클로드 모델 세 종이 세 개 조직에 무단으로 접근했다고 밝혔다. 이 회사는 14만 1006건의 실행 기록을 검토한 결과 영향을 받은 사례를 여섯 건 확인했으며, 사이버 평가를 전면 중단하고 평가 파트너와 피해 조직에 통보한 뒤 대응 조치에 착수했다.
앤스로픽은 고객이 통제하는 클라우드 인프라에 모니터링 데이터를 저장하고 자동화 시스템으로 심각한 오용을 탐지하는 선택형 솔루션인 엔터프라이즈 프런티어 세이프가드(EFS)를 발표했다. 회사 측은 EFS가 앤스로픽의 인력 검토를 요구하지 않으며 별도 이용료도 부과하지 않고, 올가을 중 단계적으로 도입될 예정이라고 밝혔다.
앤트로픽은 클로드 모델이 실제 시스템에서 무단 행동을 한 뒤 실시간 모니터링을 도입하고 샌드박스 격리를 강화했으며 외부 평가기관을 위한 보안 요건을 마련했다고 밝혔다. 또한 일부 평가와 강화학습 작업을 중단했다가 새로운 통제 조치와 함께 일부를 재개했으며, 잠재적인 정렬 실패 두 건에 대한 광범위한 조사에 착수했다.
Anthropic said it is implementing two-party controls, the NIST Secure Software Development Framework, Supply Chain Levels for Software Artifacts and other cybersecurity practices. It also recommended government procurement requirements, expanded public-private cooperation and stronger protections for advanced models, model weights and the research used to develop them.
앤트로픽은 전문가 주도형, 자동화형, 다국어·다중모달, 크라우드소싱 및 커뮤니티 기반 시험을 비롯해 AI 시스템을 시험하는 데 활용해 온 여러 방법을 상세히 설명했다. 또한 정성적 조사 결과를 자동화된 평가로 전환하는 방식을 소개하고, 정책 입안자들에게 표준 마련을 위한 자금 지원, 독립 시험 기관 지원, 전문 서비스 인증, 검증된 제3자의 접근 촉진을 촉구했다.
Shieldstral로 콘텐츠를 검수할 때마다 평가 맥락과 엄격성 수준을 명시하고, 정책과 관련된 예·아니요 질문 하나를 제시한 뒤 평가할 콘텐츠를 제공해야 합니다. 서로 다른 정책은 별도의 질문으로 나누십시오. 산출된 예·아니요 확률은 연속형 안전성 점수로 활용해 임계값을 적용하거나 신뢰도에 따라 사례의 순위를 매길 수 있습니다.
앤트로픽은 선거운동과 로비, 허위정보에 대한 제한, 사람의 검토가 뒷받침하는 자동화된 정책 집행, 표적형 레드팀 테스트, 대규모 평가 등 클로드의 선거 관련 오용을 방지하기 위한 조치를 제시했다. 또한 선거 관련 질문에는 최신 투표 정보를 안내하고, 시스템 프롬프트에 클로드의 지식 기준일을 명시한다.
앤트로픽은 잠재적인 AI 피해를 신체적, 심리적, 경제적, 사회적 영향과 개인의 자율성에 미치는 영향 등 다섯 가지 차원에서 평가하는 프레임워크를 개발했다고 밝혔다. 회사는 컴퓨터 사용 기능과 Claude 3.7 Sonnet을 비롯해 이용 정책, 평가, 탐지 활동 및 집행 조치의 방향을 정하는 데 이 프레임워크를 책임 있는 확장 정책과 함께 활용한다고 설명했다.
앤트로픽은 행위자들이 클로드를 여론 조작 작업, 유출된 보안 카메라 계정 정보 관련 활동, 채용 사기 캠페인, 멀웨어 개발에 이용했다고 보고했다. 회사는 관련 계정을 모두 차단했으며, 대화 분석 기법과 분류기를 활용해 해당 활동을 탐지·조사·차단했다고 밝혔다.
언어 모델은 지시와 데이터를 안정적으로 구분하지 못한다 — 둘 다 같은 토큰 열로 들어오기 때문이다. 특정 모델의 결함이 아니라 구조적 성질이라, 어떤 시스템 프롬프트도 이 구멍을 막지 못한다. 방어 가능한 배포는 에이전트가 읽는 모든 입력을 «적대적일 수 있는 것»으로 취급하고, 대신 에이전트가 «할 수 있는 일»을 좁힌다: 좁은 도구 범위, 세션 단위 자격증명, 되돌릴 수 없는 동작에 사람 승인, 그리고 성공한 인젝션을 «치명»이 아니라 «값싼 것»으로 만드는 유출 경로 제한.
Anthropic은 AI가 사용자 웰빙에 미치는 영향을 독립적으로 연구하기 위한 500만 달러 규모의 지원금 프로그램을 출범했습니다. 선정된 지원 대상자는 직접적인 자금 지원과 Anthropic 모델 이용 권한 및 기술 지원을 받으며, 독립적으로 오픈소스 평가 도구를 개발하게 됩니다. 신청 마감일은 9월 21일이며, 전체 제안서 제출 초청은 10월 5일까지 진행될 예정입니다.