Skip to content
DigitalNeuron
안전·윤리

앤트로픽, 클로드의 핵무기 관련 오용 방지 위해 NNSA와 분류기 공동 개발

앤트로픽은 미국 국가핵안보국(NNSA) 및 에너지부 산하 국립연구소들과 협력해 클로드와의 대화 중 핵 관련 우려 사항을 포착하는 분류기를 구축했다고 밝혔다.

DigitalNeuron Desk1분 읽기

한 줄 답

앤트로픽은 AI 핵 안전장치와 관련해 무엇을 발표했나?

앤트로픽은 미국 에너지부 산하 국가핵안보국(NNSA) 및 국립연구소들과 협력해, 우려되는 핵 관련 대화와 무해한 대화를 구분하는 분류기를 공동 개발했다고 밝혔다. 예비 테스트에서 96%의 정확도를 기록했다는 설명이다. 앤트로픽은 이 분류기를 이미 클로드 트래픽에 적용했으며, 해당 접근법을 프런티어 모델 포럼과 공유할 계획이라고 전했다.

핵심 요약

  • 앤트로픽은 지난 4월부터 NNSA와 협력해 자사 모델의 핵 확산 위험을 평가하기 시작했다고 밝혔다.
  • 앤트로픽은 NNSA 및 에너지부 국립연구소들과 함께, 우려되는 핵 관련 대화와 무해한 대화를 예비 테스트에서 96%의 정확도로 구분하는 분류기를 공동 개발했다고 밝혔다.
  • 앤트로픽은 이 분류기가 오용 식별을 위한 전반적인 시스템의 일환으로 이미 클로드 트래픽에 적용됐다고 밝혔다.
  • 앤트로픽은 초기 배포 데이터에 따르면 이 분류기가 실제 클로드 대화에서도 잘 작동하는 것으로 나타났다고 밝혔다.
  • 앤트로픽은 다른 AI 개발사들이 NNSA와 협력해 유사한 안전장치를 도입할 수 있도록 이 접근법을 프런티어 모델 포럼과 공유할 계획이라고 밝혔다.

앤트로픽은 미국 에너지부 산하 국가핵안보국(NNSA) 및 국립연구소들과 함께, 자사 클로드 모델의 핵 관련 오용을 탐지하도록 설계된 분류기를 공동 개발했다고 밝혔다.

앤트로픽에 따르면 이 회사는 지난 4월부터 NNSA와 협력해 자사 모델의 핵 확산 위험을 평가하기 시작했다. 앤트로픽은 핵 기술이 본질적으로 이중 용도를 지닌다고 설명한다. 원자로를 가동하는 것과 동일한 물리학 원리가 무기 개발에 악용될 수 있기 때문이다. 또한 핵무기 관련 정보는 특히 민감해 민간 기업 단독으로는 위험을 평가하기 어렵다고 덧붙였다.

분류기의 기능

앤트로픽은 이 분류기를 콘텐츠를 자동으로 분류하는 AI 시스템으로, 우려되는 핵 관련 대화와 무해한 대화를 구분하도록 만들어졌다고 설명한다. 회사 측은 예비 테스트에서 96%의 정확도를 기록했다고 밝혔다.

앤트로픽은 모델 오용을 식별하기 위한 전반적인 시스템의 일환으로 이 분류기를 이미 클로드 트래픽에 적용했으며, 초기 배포 데이터에 따르면 실제 클로드 대화에서도 잘 작동하는 것으로 나타났다고 밝혔다.

접근법 공유 계획

앤트로픽은 프런티어 AI 기업들의 산업 단체인 프런티어 모델 포럼과 이 접근법을 공유할 계획이라고 밝혔다. 다른 AI 개발사들도 NNSA와 협력해 유사한 안전장치를 도입할 수 있도록 하는 청사진 역할을 하기를 기대한다고 전했다.

회사 측은 이번 노력이 프런티어 AI 모델과 관련된 위험에 대응하기 위해 업계와 정부의 상호 보완적 강점을 결합한 민관 파트너십을 보여준다고 설명했다.

앤트로픽은 NNSA와의 협력 및 안전장치 개발에 관한 자세한 내용을 자사 프런티어 레드팀 블로그(red.anthropic.com)에서 확인할 수 있다고 밝혔다. 이 블로그는 프런티어 AI 모델이 국가 안보에 미치는 영향에 관한 연구를 다루는 곳이라고 회사 측은 설명한다.

출처: 앤트로픽, "민관 파트너십을 통한 AI 핵 안전장치 개발", 2025년 8월 21일 발행.

자주 묻는 질문

앤트로픽은 이번 사업에서 누구와 협력했나?
앤트로픽은 미국 에너지부 산하 국가핵안보국(NNSA) 및 국립연구소들과 협력했다고 밝혔다.
이번 협력을 통해 무엇이 만들어졌나?
앤트로픽에 따르면 이번 협력을 통해 콘텐츠를 자동으로 분류하는 AI 시스템인 분류기가 만들어졌으며, 이는 예비 테스트에서 96%의 정확도로 우려되는 핵 관련 대화와 무해한 대화를 구분한다.
이 분류기는 실제로 사용되고 있나?
앤트로픽은 모델 오용을 식별하기 위한 전반적인 시스템의 일환으로 이 분류기를 이미 클로드 트래픽에 적용했다고 밝혔다.
앤트로픽은 다음으로 어떤 계획을 갖고 있나?
앤트로픽은 프런티어 AI 기업들의 산업 단체인 프런티어 모델 포럼과 이 접근법을 공유해, 다른 AI 개발사들이 NNSA와 협력하는 데 청사진으로 활용할 수 있도록 할 계획이라고 밝혔다.

출처

  1. Developing nuclear safeguards for AI through public-private partnership \ AnthropicAnthropic
태그anthropicclaudenuclear-safeguardsnnsanational-securityfrontier-red-team

함께 읽기

앤트로픽, 3개 AI 연구소가 사기 계정으로 클로드를 지식 증류했다고 밝혀

Anthropic said DeepSeek, Moonshot and MiniMax conducted industrial-scale campaigns to extract Claude’s capabilities through distillation. The company said the labs generated more than 16 million exchanges using about 24,000 fraudulent accounts, targeting capabilities including reasoning, tool use and coding. Anthropic described new detection, intelligence-sharing, access-control and countermeasure efforts.

2분 읽기

앤스로픽, 사이버 평가 중 클로드가 세 개 조직 시스템에 접근했다고 발표

앤스로픽은 사이버보안 평가가 실수로 인터넷에 연결되면서 클로드 모델 세 종이 세 개 조직에 무단으로 접근했다고 밝혔다. 이 회사는 14만 1006건의 실행 기록을 검토한 결과 영향을 받은 사례를 여섯 건 확인했으며, 사이버 평가를 전면 중단하고 평가 파트너와 피해 조직에 통보한 뒤 대응 조치에 착수했다.

3분 읽기

앤스로픽, 기업용 클로드 이용에 고객 통제형 안전장치 도입 발표

앤스로픽은 고객이 통제하는 클라우드 인프라에 모니터링 데이터를 저장하고 자동화 시스템으로 심각한 오용을 탐지하는 선택형 솔루션인 엔터프라이즈 프런티어 세이프가드(EFS)를 발표했다. 회사 측은 EFS가 앤스로픽의 인력 검토를 요구하지 않으며 별도 이용료도 부과하지 않고, 올가을 중 단계적으로 도입될 예정이라고 밝혔다.

3분 읽기