Skip to content
DigitalNeuron
안전·윤리

앤트로픽, AI 시스템 레드팀 평가 방법 공개

앤트로픽은 AI 시스템을 시험하는 데 활용해 온 레드팀 평가 방법을 설명하고, 안전성 시험을 표준화하기 위한 방안을 제안했다.

DigitalNeuron Desk2분 읽기

한 줄 답

앤트로픽이 소개한 레드팀 평가 방법과 정책 권고안은 무엇인가?

앤트로픽은 전문가 주도형, 자동화형, 다국어·다중모달, 크라우드소싱 및 커뮤니티 기반 시험을 비롯해 AI 시스템을 시험하는 데 활용해 온 여러 방법을 상세히 설명했다. 또한 정성적 조사 결과를 자동화된 평가로 전환하는 방식을 소개하고, 정책 입안자들에게 표준 마련을 위한 자금 지원, 독립 시험 기관 지원, 전문 서비스 인증, 검증된 제3자의 접근 촉진을 촉구했다.

핵심 요약

  • 앤트로픽은 AI 시스템 레드팀 평가를 위한 전문가 주도형, 자동화형, 다국어·다중모달, 크라우드소싱 및 커뮤니티 기반 접근법을 제시했다.
  • 회사는 이용 정책에서 다루는 위험을 조사하기 위해 외부 전문가와 함께 정책 취약성 시험을 실시한다고 밝혔다.
  • 앤트로픽은 전문가의 정성적 시험을 정량적이고 자동화된 평가로 전환하는 반복적 절차를 설명했다.
  • 회사는 기술 표준, 독립 시험 기관, 전문 레드팀 평가 서비스 인증, 검증된 제3자의 AI 시스템 접근을 권고했다.

앤트로픽은 AI 시스템을 시험하는 데 활용해 온 레드팀 평가 방법을 개괄한 자료를 발표했다. 각 방법의 장점과 과제를 설명하고, 안전성 시험의 표준화를 뒷받침하기 위한 조치도 제안했다.

회사는 레드팀 평가를 기술 시스템의 잠재적 취약점을 파악하기 위해 설계된 적대적 시험으로 정의한다. 기법과 관행이 일관되지 않아 서로 다른 AI 시스템의 상대적 안전성을 객관적으로 비교하기 어렵다고 밝혔다.

특정 위험에 대한 전문가 시험

앤트로픽은 분야별 전문가를 투입해 해당 영역의 취약점을 파악하고 평가한다고 설명했다. 신뢰 및 안전 위험의 경우, 이용 정책에서 다루는 사안을 대상으로 외부 전문가와 함께 심층적인 정성 평가 절차인 정책 취약성 시험을 실시한다.

회사는 아동 안전, 선거 무결성, 급진화 관련 작업에 참여한 기관으로 손(Thorn), 전략대화연구소, 증오와 극단주의에 맞서는 글로벌 프로젝트를 꼽았다.

앤트로픽은 첨단 위협 시험이 주로 화학·생물학·방사능·핵 위험, 사이버 보안, 자율형 AI 위험에 초점을 맞춘다고 밝혔다. 외부 전문가는 실제 사용 환경을 반영하도록 설계된 조건에서 배포된 버전의 클로드를 시험하거나, 위험 완화 조치가 다른 비상용 버전을 대상으로 작업할 수 있다.

또한 다국어·다문화 시험은 레드팀 평가가 영어와 미국 거주자의 관점에 편중된 문제를 해소하는 방법이라고 설명했다. 영어, 타밀어, 중국어, 말레이어와 싱가포르 사용자에게 중요한 주제를 아우른 싱가포르 정보통신미디어개발청 및 AI 검증 재단과의 프로젝트를 사례로 들었다.

자동화 및 다중모달 방식

앤트로픽은 모델이 수동 시험을 보완할 수 있는 방안을 연구하고 있다고 밝혔다. 자동화 방식에서는 레드팀 모델이 목표 행동을 유발할 가능성이 높은 공격을 만든 뒤, 그 결과물로 블루팀 모델을 미세 조정해 유사한 공격에 대한 견고성을 높인다. 회사는 이 과정을 반복해 새로운 공격 경로를 개발할 수 있다고 설명했다.

시각 정보를 입력받아 텍스트로 응답하는 클로드 3의 경우, 앤트로픽의 신뢰 및 안전 팀이 배포 전에 이미지 및 텍스트 기반 위험을 시험했다. 외부 레드팀 평가자들도 모델이 유해한 이미지와 텍스트 입력을 얼마나 잘 거부하는지 평가했다.

앤트로픽은 크라우드소싱 및 커뮤니티 기반 시험도 소개했다. 클로드가 출시되기 전 통제된 연구에 크라우드워커들이 참여했다고 밝혔다. 또한 2023년 데프콘 AI 빌리지에서 열린 생성형 AI 레드팀 챌린지에서는 기술적 배경이 없는 참가자를 포함해 다양한 연령대와 분야의 수천 명이 앤트로픽과 다른 연구소가 제공한 모델을 시험했다고 설명했다.

정성적 시험에서 평가 체계로

회사는 분야별 전문가가 위협 모델을 정의하고 시스템을 탐색적으로 시험하는 단계에서 시작하는 반복적 절차를 제시했다. 이후 시험자들이 효과적인 입력을 표준화하면 언어 모델이 수백 또는 수천 개의 변형을 생성할 수 있다. 앤트로픽은 이 과정을 활용해 국가 안보 위험과 선거 무결성 시험을 위한 확장 가능한 평가 체계를 개발했다고 밝혔다.

앤트로픽은 정책 입안자들에게 기술 표준과 공통 관행에 자금을 지원하고, 독립적인 정부 및 비영리 시험 기관을 지원하며, 인증된 전문 레드팀 평가 서비스를 장려하고, 검증된 외부 단체의 시험을 촉진할 것을 권고했다. 기업에는 레드팀 평가 요건을 모델의 지속적인 개발이나 공개를 규율하는 정책과 연계할 것도 촉구했다.

출처: 2024년 6월 12일 발표된 앤트로픽의 ‘AI 시스템 레드팀 평가의 과제’ 공지.

자주 묻는 질문

AI 레드팀 평가란 무엇인가?
앤트로픽은 레드팀 평가를 기술 시스템의 잠재적 취약점을 파악하기 위한 적대적 시험이라고 설명한다.
앤트로픽은 전문가 레드팀 평가를 통해 어떤 위험을 조사하는가?
회사는 신뢰 및 안전 정책 관련 사안과 화학·생물학·방사능·핵 위험, 사이버 보안, 자율형 AI 위험을 포함한 첨단 위협을 조사한다고 밝혔다.
앤트로픽은 자동화된 레드팀 평가에 모델을 어떻게 활용하는가?
앤트로픽에 따르면 한 모델은 목표 행동을 끌어내기 위한 공격을 생성하고, 다른 모델은 그 결과물로 미세 조정돼 유사한 공격에 대한 견고성을 높인다. 이 과정을 반복해 추가적인 공격 경로를 개발할 수 있다.
앤트로픽은 어떤 정책 조치를 권고했는가?
앤트로픽은 표준 및 독립 시험 기관에 대한 자금 지원, 인증된 전문 레드팀 평가 서비스 개발, 검증된 제3자의 시험 촉진, 레드팀 평가 관행과 모델 확장 또는 공개 조건의 연계를 촉구했다.

출처

  1. Challenges in red teaming AI systems \ AnthropicAnthropic
태그anthropicclaudered-teamingai-safetymodel-evaluationspolicy

함께 읽기

앤트로픽, 미국 선거 앞두고 클로드 안전장치 공개

앤트로픽은 선거운동과 로비, 허위정보에 대한 제한, 사람의 검토가 뒷받침하는 자동화된 정책 집행, 표적형 레드팀 테스트, 대규모 평가 등 클로드의 선거 관련 오용을 방지하기 위한 조치를 제시했다. 또한 선거 관련 질문에는 최신 투표 정보를 안내하고, 시스템 프롬프트에 클로드의 지식 기준일을 명시한다.

3분 읽기

앤트로픽, AI 피해 평가 프레임워크 공개

앤트로픽은 잠재적인 AI 피해를 신체적, 심리적, 경제적, 사회적 영향과 개인의 자율성에 미치는 영향 등 다섯 가지 차원에서 평가하는 프레임워크를 개발했다고 밝혔다. 회사는 컴퓨터 사용 기능과 Claude 3.7 Sonnet을 비롯해 이용 정책, 평가, 탐지 활동 및 집행 조치의 방향을 정하는 데 이 프레임워크를 책임 있는 확장 정책과 함께 활용한다고 설명했다.

3분 읽기