Skip to content
DigitalNeuron
안전·윤리

앤트로픽, AI 피해 평가 프레임워크 공개

앤트로픽은 책임 있는 확장 정책을 보완하기 위해 AI 피해를 다섯 가지 차원에서 평가하는 발전 중인 프레임워크를 공개한다고 밝혔다.

DigitalNeuron Desk2분 읽기

한 줄 답

앤트로픽이 발표한 AI 피해 평가 프레임워크는 무엇인가?

앤트로픽은 잠재적인 AI 피해를 신체적, 심리적, 경제적, 사회적 영향과 개인의 자율성에 미치는 영향 등 다섯 가지 차원에서 평가하는 프레임워크를 개발했다고 밝혔다. 회사는 컴퓨터 사용 기능과 Claude 3.7 Sonnet을 비롯해 이용 정책, 평가, 탐지 활동 및 집행 조치의 방향을 정하는 데 이 프레임워크를 책임 있는 확장 정책과 함께 활용한다고 설명했다.

핵심 요약

  • 앤트로픽은 AI 피해를 신체적, 심리적, 경제적, 사회적 영향과 개인의 자율성에 미치는 영향 등 다섯 가지 차원에서 평가하는 프레임워크를 공개했다.
  • 회사는 이 프레임워크가 재앙적 위험에 중점을 둔 책임 있는 확장 정책을 보완해 더 광범위한 잠재적 피해를 다룬다고 밝혔다.
  • 앤트로픽은 컴퓨터 사용 기능과 관련해 금융 소프트웨어와 통신 도구를 둘러싼 위험을 파악했으며, 이에 대응해 집행 기준을 강화하고 계층적 요약 기법을 도입했다고 밝혔다.
  • 앤트로픽은 Claude 3.7 Sonnet에 이 프레임워크를 적용한 결과 유해 콘텐츠에 대한 안전장치를 유지하면서 불필요한 거부를 45% 줄였다고 밝혔다.
  • 회사는 이 접근법이 여전히 발전 중이라며 외부 연구자와 정책 전문가에게 협력을 요청했다.

앤트로픽, 피해 평가 프레임워크 제시

앤트로픽은 생물학적 위협과 같은 재앙적 위험부터 아동 안전, 허위 정보, 사기 등의 우려에 이르기까지 자사의 AI 시스템에서 발생할 수 있는 다양한 잠재적 피해를 평가하고 완화하는 발전 중인 접근법을 공개한다고 밝혔다.

회사는 이 프레임워크가 재앙적 위험에 중점을 둔 책임 있는 확장 정책을 보완해 다른 유형의 영향까지 폭넓게 살펴본다고 설명했다. 앤트로픽은 이 접근법이 여전히 발전 중이라며 앞으로도 계속 다듬어 나갈 현재의 구상을 공개하는 것이라고 밝혔다.

피해의 다섯 가지 차원

앤트로픽은 잠재적 영향을 다음과 같은 다섯 가지 기본 차원에서 평가한다고 밝혔다.

  • 신체적 영향: 신체 건강과 안녕에 미치는 영향
  • 심리적 영향: 정신 건강과 인지 기능에 미치는 영향
  • 경제적 영향: 재정적 결과와 재산 관련 문제
  • 사회적 영향: 공동체, 제도 및 공동 시스템에 미치는 영향
  • 개인의 자율성에 미치는 영향: 개인의 의사결정과 자유에 미치는 영향

회사는 각 차원에서 발생 가능성, 규모, 영향을 받는 집단, 지속 기간, 인과관계, 피해에 대한 기술의 기여도, 완화 가능성 등의 요인을 고려한다고 밝혔다.

앤트로픽은 이 프레임워크를 통해 파악된 위험을 이용 정책, 출시 전후에 시행하는 레드팀 활동 및 적대적 테스트 등의 평가, 오용을 식별하기 위한 탐지 기법, 프롬프트 수정부터 계정 차단에 이르는 집행 조치를 조합해 관리한다고 밝혔다.

적용 사례

앤트로픽은 이 프레임워크를 적용한 사례 두 가지를 제시했다.

모델이 컴퓨터 인터페이스와 상호작용할 수 있도록 하는 컴퓨터 사용 기능의 경우, 회사는 무단 자동화가 사기나 조작을 조장할 수 있는 금융 소프트웨어 및 은행 플랫폼 관련 위험과 표적 영향 공작이나 피싱에 악용될 수 있는 통신 도구 관련 위험을 검토했다고 밝혔다. 앤트로픽은 이러한 분석을 토대로 집행 기준을 한층 엄격하게 설정하고 계층적 요약 기법을 활용하게 됐다고 설명했다. 이 기법을 통해 개인정보 보호 기준을 유지하면서도 피해를 탐지할 수 있다는 것이다.

회사는 명백히 무해한 요청과 명백히 유해한 요청 사이에 놓인 요구를 모델이 처리하는 방식을 포괄하는 이른바 모델 응답 경계에 관한 작업도 설명했다. 앤트로픽은 더 유용하도록 훈련된 모델은 유해한 행동 쪽으로 기울 수 있는 반면, 무해성에 지나치게 치중한 모델은 요청이 무해한 경우에도 정보 제공을 거부할 수 있다고 밝혔다. 회사는 Claude 3.7 Sonnet을 대상으로 이 스펙트럼에 걸친 다양한 유형의 요청을 평가하고, 모호한 프롬프트를 처리하는 방식을 거부보다 안전하고 유용한 답변을 우선하도록 변경했다고 설명했다. 앤트로픽은 그 결과 유해 콘텐츠에 대한 강력한 안전장치를 유지하면서 불필요한 거부를 45% 줄였다고 밝혔다. 또한 이러한 분석은 아동, 소외된 공동체, 위기 상황에 놓인 개인 등 위험이 상대적으로 클 수 있다고 판단한 집단을 대상으로 안전성 평가의 중점을 어디에 둘지 정하는 데에도 활용된다고 설명했다.

여전히 발전 중

앤트로픽은 피해를 이해하고 대처하는 이러한 접근법이 회사의 광범위한 안전 전략을 구성하는 요소 중 하나라며, AI 시스템의 역량이 향상됨에 따라 새로운 과제가 등장할 것으로 예상한다고 밝혔다. 회사는 연구자, 정책 전문가, 업계 협력사에 이 작업에 동참해 달라고 요청하며 연락처로 usersafety@anthropic.com을 제시했다.

출처: 앤트로픽, "AI 피해를 이해하고 대처하는 우리의 접근법," 2025년 4월 21일 발행.

자주 묻는 질문

앤트로픽의 피해 프레임워크는 어떤 차원을 다루는가?
앤트로픽은 이 프레임워크가 신체적, 심리적, 경제적, 사회적 영향과 개인의 자율성에 미치는 영향 등 다섯 가지 차원을 다루며, 각 차원에서 발생 가능성, 규모, 영향을 받는 집단 등의 추가 요인을 고려한다고 밝혔다.
이 프레임워크는 앤트로픽의 책임 있는 확장 정책과 어떤 관계가 있는가?
앤트로픽은 피해 프레임워크가 재앙적 위험에 중점을 둔 책임 있는 확장 정책을 보완해 다른 유형의 영향을 보다 폭넓게 평가할 수 있게 한다고 밝혔다.
앤트로픽은 Claude 3.7 Sonnet의 답변 거부에 관해 무엇이라고 밝혔는가?
앤트로픽은 Claude 3.7 Sonnet에 이 프레임워크를 적용해 모호한 프롬프트 처리 방식을 개선했으며, 유해 콘텐츠에 대한 강력한 안전장치를 유지하면서 불필요한 거부를 45% 줄였다고 밝혔다.
앤트로픽은 피해 완화 접근법을 집행하기 위해 어떤 수단을 사용하는가?
앤트로픽은 이용 정책, 레드팀 활동을 비롯한 출시 전후 평가, 오용 탐지 기법, 프롬프트 수정부터 계정 차단에 이르는 집행 조치를 활용한다고 밝혔다.

출처

  1. Understanding and addressing AI harms \ AnthropicAnthropic
태그anthropicclaudeai-safetyresponsible-scaling-policyharm-assessmentclaude-3.7-sonnet

함께 읽기

앤트로픽, 500만 달러 규모의 AI 웰빙 연구 지원 프로그램 출범

Anthropic은 AI가 사용자 웰빙에 미치는 영향을 독립적으로 연구하기 위한 500만 달러 규모의 지원금 프로그램을 출범했습니다. 선정된 지원 대상자는 직접적인 자금 지원과 Anthropic 모델 이용 권한 및 기술 지원을 받으며, 독립적으로 오픈소스 평가 도구를 개발하게 됩니다. 신청 마감일은 9월 21일이며, 전체 제안서 제출 초청은 10월 5일까지 진행될 예정입니다.

3분 읽기

분석: 프롬프트 인젝션은 «권한» 문제다 — «문구» 문제로 다루니 계속 뚫린다

언어 모델은 지시와 데이터를 안정적으로 구분하지 못한다 — 둘 다 같은 토큰 열로 들어오기 때문이다. 특정 모델의 결함이 아니라 구조적 성질이라, 어떤 시스템 프롬프트도 이 구멍을 막지 못한다. 방어 가능한 배포는 에이전트가 읽는 모든 입력을 «적대적일 수 있는 것»으로 취급하고, 대신 에이전트가 «할 수 있는 일»을 좁힌다: 좁은 도구 범위, 세션 단위 자격증명, 되돌릴 수 없는 동작에 사람 승인, 그리고 성공한 인젝션을 «치명»이 아니라 «값싼 것»으로 만드는 유출 경로 제한.

7분 읽기