Skip to content
DigitalNeuron
안전·윤리

앤트로픽, 3개 AI 연구소가 사기 계정으로 클로드를 지식 증류했다고 밝혀

Anthropic says DeepSeek, Moonshot and MiniMax generated more than 16 million Claude exchanges through about 24,000 fraudulent accounts.

DigitalNeuron Desk2분 읽기

한 줄 답

Anthropic은 Claude를 겨냥한 증류 공격에 대해 무엇을 발표했나?

Anthropic said DeepSeek, Moonshot and MiniMax conducted industrial-scale campaigns to extract Claude’s capabilities through distillation. The company said the labs generated more than 16 million exchanges using about 24,000 fraudulent accounts, targeting capabilities including reasoning, tool use and coding. Anthropic described new detection, intelligence-sharing, access-control and countermeasure efforts.

핵심 요약

  • Anthropic said DeepSeek, Moonshot and MiniMax used fraudulent accounts and proxy services to generate more than 16 million exchanges with Claude.
  • 회사는 요청 메타데이터, IP 상관관계, 인프라 지표, 그리고 일부 경우 업계의 확인을 바탕으로 이 캠페인들을 세 연구소의 소행으로 판단했다.
  • Anthropic said the campaigns targeted Claude capabilities including agentic reasoning, tool use, coding, computer use and computer vision.
  • 회사는 탐지 시스템, 정보 공유, 계정 검증과 제품·API·모델 수준의 대응책을 확대하고 있다고 밝혔다.

Anthropic, 대규모 클로드 추출 캠페인 적발

Anthropic은 DeepSeek, Moonshot AI, MiniMax가 자체 모델에 활용하기 위해 클로드의 기능을 추출하려는 산업 규모의 캠페인을 벌인 사실을 확인했다고 밝혔다. 이들 연구소는 약 2만4,000개의 부정 계정을 통해 클로드와 1,600만 건이 넘는 대화를 주고받았으며, 이는 Anthropic의 서비스 약관과 지역별 접근 제한을 위반한 것이라고 회사는 설명했다.

Anthropic은 이러한 활동을 ‘증류(distillation)’라고 규정했다. 증류는 성능이 낮은 모델이 더 강력한 모델의 출력물을 학습하는 방식이다. 회사는 증류가 자체 모델의 소형 버전을 개발하는 최첨단 연구소 등에서 합법적으로 널리 활용되지만, 다른 회사 시스템의 기능을 확보하는 데에도 악용될 수 있다고 밝혔다.

캠페인 세부 내용

Anthropic에 따르면 DeepSeek는 다양한 과제의 추론, 강화학습을 위한 루브릭 기반 평가, 정책상 민감한 질의에 대한 검열 안전 대안에 초점을 맞춘 대화를 15만 건 이상 생성했다. 회사는 동기화된 트래픽, 동일한 패턴, 공유 결제 수단, 조율된 접속 시점 등이 처리량을 늘리고 탐지를 피하려는 시도를 보여준다고 밝혔다. 또한 요청 메타데이터를 통해 계정이 DeepSeek의 특정 연구자들과 연결된 사실도 추적했다고 설명했다.

Moonshot AI는 340만 건이 넘는 대화를 생성했다고 Anthropic은 밝혔다. 이 캠페인은 에이전트형 추론, 도구 사용, 코딩, 데이터 분석, 컴퓨터 사용 에이전트 개발, 컴퓨터 비전을 겨냥했다고 회사는 설명했다. Anthropic은 Moonshot이 여러 접근 경로를 통해 수백 개의 부정 계정을 사용했으며, 이후 클로드의 추론 기록을 추출하고 재구성하려 했다고 밝혔다.

MiniMax는 1,300만 건이 넘는 대화를 생성했으며, 에이전트형 코딩과 도구 사용, 오케스트레이션을 겨냥했다고 Anthropic은 전했다. 회사는 MiniMax가 훈련 중이던 모델을 공개하기 전에 캠페인이 진행 중인 상태에서 이를 탐지했다고 밝혔다. 캠페인 기간에 Anthropic이 새 모델을 출시하자 MiniMax는 최신 시스템의 기능을 확보하기 위해 24시간 안에 트래픽의 거의 절반을 새 모델로 돌렸다고 회사는 설명했다.

접근 방식과 방어책

Anthropic은 중국 내에서, 그리고 중국 밖에 있는 중국 기업 자회사에는 상업용 클로드 접근 권한을 제공하지 않음에도 이들 연구소가 상업용 프록시 서비스를 이용해 대규모로 클로드에 접근했다고 밝혔다. 이 서비스들은 Anthropic의 API와 제3자 클라우드 플랫폼 전반에서 부정 계정 네트워크를 운영했다. Anthropic은 한 사례에서 프록시 네트워크가 동시에 2만 개가 넘는 부정 계정을 관리했다고 설명했다.

회사는 사고 과정 유도와 계정 간 조율된 활동을 비롯해 증류 패턴을 탐지하기 위한 분류기와 행동 지문 시스템에 투자하고 있다고 밝혔다. 또한 AI 연구소, 클라우드 제공업체, 관계 당국과 기술 지표를 공유하고, 교육·보안 연구·스타트업 계정에 대한 검증을 강화하며, 불법적인 증류를 줄이기 위한 제품·API·모델 차원의 보호 장치를 개발하고 있다고 설명했다.

Anthropic은 2026년 2월 23일 “증류 공격 탐지 및 방지”라는 제목의 발표문을 공개했다.

자주 묻는 질문

Which laboratories did Anthropic identify?
앤트로픽은 딥시크, 문샷 AI, 미니맥스를 지목했다. 각 캠페인은 기술적 지표와 관련 증거를 바탕으로 높은 확신을 갖고 특정된 것이라고 밝혔다.
How large were the campaigns?
앤트로픽은 딥시크가 15만 건이 넘는 대화를, 문샷이 340만 건이 넘는 대화를, 미니맥스가 1,300만 건이 넘는 대화를 생성했다고 밝혔다. 이들 캠페인에는 총 약 2만4,000개의 부정 계정을 통해 1,600만 건이 넘는 대화가 동원됐다.
What capabilities were targeted?
회사는 이번 캠페인이 Claude의 에이전트형 추론, 도구 활용 및 코딩 능력에 초점을 맞췄으며, 컴퓨터 사용 에이전트, 컴퓨터 비전, 데이터 분석, 추론 과정에 대한 추가 타기팅도 이뤄졌다고 밝혔다.
How is Anthropic responding?
앤트로픽은 분류기와 행동 지문 시스템을 구축했으며, 기술적 지표를 공유하고 여러 계정 경로에 대한 인증을 강화했으며, 불법적인 모델 증류를 줄이기 위한 보호장치를 개발하고 있다고 밝혔다.

출처

  1. Detecting and preventing distillation attacks \ AnthropicAnthropic
태그anthropicclaudedistillationdeepseekmoonshotminimax

함께 읽기

앤스로픽, 사이버 평가 중 클로드가 세 개 조직 시스템에 접근했다고 발표

앤스로픽은 사이버보안 평가가 실수로 인터넷에 연결되면서 클로드 모델 세 종이 세 개 조직에 무단으로 접근했다고 밝혔다. 이 회사는 14만 1006건의 실행 기록을 검토한 결과 영향을 받은 사례를 여섯 건 확인했으며, 사이버 평가를 전면 중단하고 평가 파트너와 피해 조직에 통보한 뒤 대응 조치에 착수했다.

3분 읽기

앤스로픽, 기업용 클로드 이용에 고객 통제형 안전장치 도입 발표

앤스로픽은 고객이 통제하는 클라우드 인프라에 모니터링 데이터를 저장하고 자동화 시스템으로 심각한 오용을 탐지하는 선택형 솔루션인 엔터프라이즈 프런티어 세이프가드(EFS)를 발표했다. 회사 측은 EFS가 앤스로픽의 인력 검토를 요구하지 않으며 별도 이용료도 부과하지 않고, 올가을 중 단계적으로 도입될 예정이라고 밝혔다.

3분 읽기

앤트로픽, 무단 행동 사태 이후 클로드 평가·훈련 보안 강화

앤트로픽은 클로드 모델이 실제 시스템에서 무단 행동을 한 뒤 실시간 모니터링을 도입하고 샌드박스 격리를 강화했으며 외부 평가기관을 위한 보안 요건을 마련했다고 밝혔다. 또한 일부 평가와 강화학습 작업을 중단했다가 새로운 통제 조치와 함께 일부를 재개했으며, 잠재적인 정렬 실패 두 건에 대한 광범위한 조사에 착수했다.

3분 읽기