Skip to content
DigitalNeuron
안전·윤리

앤트로픽, 미국 선거 앞두고 클로드 안전장치 공개

앤트로픽은 클로드의 선거 관련 오용을 제한하기 위한 정책과 집행 체계, 테스트, 투표 정보 안내 조치를 제시했다.

DigitalNeuron Desk2분 읽기

한 줄 답

앤트로픽이 클로드에 도입한다고 발표한 선거 관련 안전장치는 무엇인가?

앤트로픽은 선거운동과 로비, 허위정보에 대한 제한, 사람의 검토가 뒷받침하는 자동화된 정책 집행, 표적형 레드팀 테스트, 대규모 평가 등 클로드의 선거 관련 오용을 방지하기 위한 조치를 제시했다. 또한 선거 관련 질문에는 최신 투표 정보를 안내하고, 시스템 프롬프트에 클로드의 지식 기준일을 명시한다.

핵심 요약

  • 앤트로픽은 자사 제품을 정치 선거운동과 로비, 표적형 정치 캠페인, 투표 권유, 정치자금 모금에 사용하는 것을 금지한다.
  • 회사는 선거 관련 오용에 대응하기 위해 자동화된 정책 집행과 사람의 검토를 활용하고, 극단적인 경우 계정을 정지한다고 밝혔다.
  • 앤트로픽은 선거 허위정보와 정치적 형평성, 유해한 질문에 대한 응답 거부, 유권자 프로파일링 수법을 대상으로 클로드를 테스트한다.
  • 투표 정보를 찾는 클로드 사용자는 비영리단체 데모크라시 웍스가 운영하는 초당파적 정보원인 터보보트를 방문할 수 있는 선택지를 제공받는다.

앤트로픽은 2024년 11월 5일 치러지는 미국 연방·주·지방 선거를 앞두고 클로드의 선거 관련 오용을 제한하기 위한 정책과 기술적 통제, 테스트 방안을 제시했다.

회사는 2023년 7월부터 자사 도구의 잠재적 오용을 탐지하고 완화하며 사용자에게 신뢰할 수 있는 선거 정보를 안내하기 위한 조치를 시행해 왔다고 밝혔다. 이번 발표에는 정책상 제한, 집행 관행, 평가, 투표 정보 안내 등 그간의 활동이 요약됐다.

정치적 이용 제한

앤트로픽은 지난 5월 이용 정책을 개정해 금지되는 선거 및 투표 관련 용도를 명확히 했다고 밝혔다. 회사는 자사 제품을 정치 선거운동과 로비에 사용하는 것을 금지한다. 이에 따라 클로드를 이용해 후보자나 정당, 쟁점을 홍보하거나 표적형 정치 캠페인을 벌이고, 투표를 권유하거나 정치자금을 요청할 수 없다.

이 정책은 선거법과 후보자 및 관련 주제에 관한 허위정보 생성도 금지한다. 앤트로픽은 클로드를 투표 기계를 공격하거나 개표 또는 투표 결과 인증을 방해하는 데 사용할 수 없다고 밝혔다.

클로드는 이미지나 오디오, 동영상이 아닌 텍스트를 생성한다. 앤트로픽은 이러한 한계로 인해 제품을 통한 선거 관련 딥페이크 생성 위험이 없다고 설명했다.

정책 집행과 테스트

앤트로픽은 정책 집행에 자동화 시스템을 활용하고 사람의 검토를 통해 해당 시스템을 감사한다고 밝혔다. 집행 방식에는 claude.ai의 프롬프트 수정, 자사 API 이용 사례 감사, 극단적인 경우 계정 정지 등이 포함된다.

또한 아마존웹서비스와 구글 클라우드 플랫폼을 통해 앤트로픽 모델에 접근하는 사용자와 관련된 선거 피해를 식별하고 완화하기 위해 두 회사와 협력하고 있다.

앤트로픽은 선거 관련 프롬프트에 초점을 맞춘 표적형 레드팀 테스트를 정기적으로 실시한다고 밝혔다. 외부 분야별 전문가와 함께 진행하는 정책 취약성 테스트를 통해 허위정보와 편향, 적대적 악용도 점검한다. 이 과정에는 관련 질문을 선정하고 모델의 답변을 문서화하며, 유해한 요청을 거부하는 등의 안전 개입이 이루어지는지 기록하는 작업이 포함된다.

앤트로픽에 따르면 자동화된 평가를 통해 시스템을 대규모로 테스트한다. 테스트에서는 후보자와 주제 전반에 대한 정치적 형평성, 유해한 선거 관련 질문에 대한 응답 거부, 허위정보와 유권자 프로파일링 수법에 대한 저항력을 살핀다. 회사는 이러한 작업에서 나온 결과를 정책과 집행 절차, 모델을 개선하는 데 반영한다고 밝혔다.

투표 정보와 투명성

앤트로픽은 자사 모델의 훈련 주기가 실시간 선거 정보를 제공할 만큼 빈번하지 않다고 밝혔다. 이에 따라 선거 관련 질문에는 사용자를 최신의 신뢰할 수 있는 투표 정보원으로 안내한다.

클로드에서 투표 정보를 묻는 사용자에게는 비영리단체 데모크라시 웍스가 운영하는 초당파적 정보원인 터보보트(TurboVote)를 방문할 수 있는 선택지를 팝업으로 제공한다. 앤트로픽은 터보보트에 최근 연방 및 주 선거 출마 후보자의 이름과 주민투표 안건이 추가됐다고 밝혔다.

회사는 클로드의 시스템 프롬프트도 업데이트해 지식 기준일을 명시했다. 앤트로픽은 선거 관련 작업에 사용한 자동화 평가 일부를 공개하고, 인공지능의 역량과 위험에 관한 제3자 평가에 자금을 지원하는 사업도 시작했다고 밝혔다.

앤트로픽은 한 해 동안 정책 입안자와 시민사회단체, 업계 관계자들을 만나고 미국 선거일에 앞서 발생할 수 있는 선거 관련 악용에 대비해 시나리오 계획을 수립했다고 밝혔다.

출처: 2024년 10월 8일 발행된 앤트로픽의 “미국 선거 대비 태세” 발표.

자주 묻는 질문

클로드를 정치 선거운동에 사용할 수 있는가?
앤트로픽은 자사 정책에 따라 제품을 정치 선거운동과 로비에 사용하는 것을 금지한다고 밝혔다. 제한 대상에는 후보자와 정당, 쟁점 홍보, 표적형 정치 캠페인, 투표 권유, 정치자금 요청이 포함된다.
앤트로픽은 선거 관련 오용을 어떻게 감시하는가?
회사는 자동화된 정책 집행과 사람의 검토를 병행한다고 밝혔다. 집행 방식에는 claude.ai의 프롬프트 수정, 자사 API 이용 사례 감사, 극단적인 경우 계정 정지 등이 포함된다.
앤트로픽은 선거 안전장치를 어떻게 테스트하는가?
앤트로픽은 표적형 레드팀 테스트, 외부 분야별 전문가와 함께하는 정책 취약성 테스트, 여러 선거 관련 위험을 다루는 자동화 평가를 실시한다고 밝혔다.
클로드는 투표 정보를 찾는 사용자를 어디로 안내하는가?
앤트로픽은 비영리단체 데모크라시 웍스가 운영하는 초당파적 정보원인 터보보트로 사용자를 안내하는 선택지를 팝업으로 구현했다. 회사는 터보보트에 연방 및 주 선거 후보자의 이름과 주민투표 안건이 추가됐다고 밝혔다.

출처

  1. U.S. elections readiness \ AnthropicAnthropic
태그anthropicclaudeelectionsai-safetymisinformationusage-policy

함께 읽기

앤트로픽, AI 피해 평가 프레임워크 공개

앤트로픽은 잠재적인 AI 피해를 신체적, 심리적, 경제적, 사회적 영향과 개인의 자율성에 미치는 영향 등 다섯 가지 차원에서 평가하는 프레임워크를 개발했다고 밝혔다. 회사는 컴퓨터 사용 기능과 Claude 3.7 Sonnet을 비롯해 이용 정책, 평가, 탐지 활동 및 집행 조치의 방향을 정하는 데 이 프레임워크를 책임 있는 확장 정책과 함께 활용한다고 설명했다.

3분 읽기

앤트로픽, 500만 달러 규모의 AI 웰빙 연구 지원 프로그램 출범

Anthropic은 AI가 사용자 웰빙에 미치는 영향을 독립적으로 연구하기 위한 500만 달러 규모의 지원금 프로그램을 출범했습니다. 선정된 지원 대상자는 직접적인 자금 지원과 Anthropic 모델 이용 권한 및 기술 지원을 받으며, 독립적으로 오픈소스 평가 도구를 개발하게 됩니다. 신청 마감일은 9월 21일이며, 전체 제안서 제출 초청은 10월 5일까지 진행될 예정입니다.

3분 읽기