Skip to content
DigitalNeuron
Sicherheit & Ethik

Anthropic erläutert seine Methoden für Red-Teaming von KI-Systemen

Anthropic outlined red teaming methods it has used to test AI systems and proposed steps for standardizing safety testing.

Von DigitalNeuron Desk3 Min. Lesezeit

Kurze Antwort

Welche Red-Teaming-Methoden und politischen Empfehlungen beschrieb Anthropic?

Anthropic detailed several methods it has used to test AI systems, including expert-led, automated, multilingual, multimodal, crowdsourced and community testing. The company also described converting qualitative findings into automated evaluations and urged policymakers to fund standards, support independent testing bodies, certify professional services and facilitate vetted third-party access.

Das Wichtigste

  • Anthropic outlined expert-led, automated, multilingual, multimodal, crowdsourced and community-based approaches to red teaming AI systems.
  • Das Unternehmen erklärte, es setze gemeinsam mit externen Fachleuten Tests auf Richtlinienlücken ein, um Risiken zu untersuchen, die von seinen Nutzungsrichtlinien erfasst werden.
  • Anthropic described an iterative process that turns qualitative testing by experts into quantitative, automated evaluations.
  • Das Unternehmen empfahl technische Standards, unabhängige Prüforganisationen, eine Zertifizierung professioneller Red-Teaming-Dienste sowie einen kontrollierten Zugang vertrauenswürdiger Dritter zu KI-Systemen.

Anthropic hat einen Überblick über die von dem Unternehmen zur Prüfung von KI-Systemen eingesetzten Red-Teaming-Methoden veröffentlicht. Darin beschreibt es deren Vorteile und Herausforderungen und schlägt Maßnahmen vor, die stärker standardisierte Sicherheitstests fördern sollen.

Das Unternehmen definiert Red Teaming als adversarielle Prüfung, mit der potenzielle Schwachstellen technologischer Systeme aufgedeckt werden sollen. Uneinheitliche Methoden und Praktiken erschwerten einen objektiven Vergleich der relativen Sicherheit verschiedener KI-Systeme.

Fachkundige Prüfung spezifischer Risiken

Anthropic zufolge werden für die domänenspezifische Arbeit Fachleute hinzugezogen, die Schwachstellen in ihren jeweiligen Fachgebieten ermitteln und bewerten. Bei Risiken im Bereich Vertrauen und Sicherheit setzt das Unternehmen auf Policy Vulnerability Testing, ein umfassendes qualitatives Verfahren, das gemeinsam mit externen Fachleuten zu Themen durchgeführt wird, die unter seine Nutzungsrichtlinie fallen.

Zu den Organisationen, die an der Arbeit zu Kinderschutz, Wahlintegrität und Radikalisierung beteiligt waren, zählt das Unternehmen Thorn, das Institute for Strategic Dialogue und das Global Project Against Hate and Extremism.

Die Tests zu neuartigen Bedrohungen konzentrieren sich Anthropic zufolge vor allem auf chemische, biologische, radiologische und nukleare Risiken sowie auf Cybersicherheitsrisiken und Risiken durch autonome KI. Externe Fachleute können bereitgestellte Versionen von Claude unter Bedingungen testen, die eine reale Nutzung abbilden sollen, oder mit nicht kommerziellen Versionen arbeiten, die über andere Maßnahmen zur Risikominderung verfügen.

Das Unternehmen bezeichnete zudem mehrsprachige und multikulturelle Tests als eine Möglichkeit, der bisherigen Konzentration seiner Red-Teaming-Arbeit auf die englische Sprache und die Perspektiven von Menschen aus den Vereinigten Staaten entgegenzuwirken. Als Beispiel nannte es ein gemeinsames Projekt mit Singapurs Infocomm Media Development Authority und der AI Verify Foundation, das Englisch, Tamil, Mandarin und Malaiisch sowie für Nutzerinnen und Nutzer in Singapur relevante Themen umfasste.

Automatisierte und multimodale Methoden

Anthropic prüft nach eigenen Angaben, wie Modelle manuelle Tests ergänzen können. Bei seinem automatisierten Verfahren erzeugt ein Red-Team-Modell Angriffe, die mit hoher Wahrscheinlichkeit ein bestimmtes Verhalten hervorrufen. Anschließend wird ein Blue-Team-Modell anhand dieser Ergebnisse feinabgestimmt, damit es ähnlichen Angriffen besser standhält. Dieser Zyklus könne wiederholt werden, um neue Angriffsvektoren zu entwickeln.

Claude 3 kann visuelle Informationen verarbeiten und Textantworten erzeugen. Nach Angaben von Anthropic testete das Team für Vertrauen und Sicherheit deshalb vor der Bereitstellung sowohl bild- als auch textbezogene Risiken. Externe Red Teams bewerteten ebenfalls, wie zuverlässig die Modelle schädliche Bild- und Texteingaben zurückwiesen.

Darüber hinaus beschrieb Anthropic Tests, die auf Crowdsourcing und der Beteiligung von Gemeinschaften beruhen. Noch vor der Veröffentlichung von Claude hätten Crowdworker an kontrollierten Forschungsarbeiten teilgenommen. Das Unternehmen verwies außerdem darauf, dass Tausende Menschen unterschiedlichen Alters und aus verschiedenen Fachrichtungen, darunter auch Personen ohne technischen Hintergrund, während der Generative Red Teaming Challenge 2023 im AI Village der DEF CON Modelle von Anthropic und anderen Laboren testeten.

Von qualitativen Tests zu Evaluationen

Das Unternehmen skizzierte einen iterativen Prozess, bei dem zunächst Fachleute ein Bedrohungsmodell definieren und ein System gezielt untersuchen. Anschließend standardisieren die Testenden wirksame Eingaben, woraufhin ein Sprachmodell Hunderte oder Tausende Varianten erzeugen kann. Anthropic zufolge wurde dieses Vorgehen genutzt, um skalierbare Evaluationen für nationale Sicherheitsrisiken und die Prüfung der Wahlintegrität zu entwickeln.

Anthropic empfahl politischen Entscheidungsträgern, technische Standards und gemeinsame Verfahren zu finanzieren, unabhängige staatliche und gemeinnützige Prüfstellen zu unterstützen, zertifizierte professionelle Red-Teaming-Dienste zu fördern und Tests durch überprüfte externe Gruppen zu erleichtern. Zudem forderte das Unternehmen andere Anbieter auf, Anforderungen an das Red Teaming mit Richtlinien zur weiteren Modellentwicklung oder Veröffentlichung zu verknüpfen.

Quelle: Anthropics Mitteilung „Challenges in red teaming AI systems“, veröffentlicht am 12. Juni 2024.

Häufige Fragen

What is AI red teaming?
Anthropic beschreibt Red Teaming als eine Form adversarialer Tests, mit denen potenzielle Schwachstellen in einem technologischen System aufgedeckt werden sollen.
Which risks does Anthropic examine through expert red teaming?
Das Unternehmen erklärte, seine Arbeit umfasse Richtlinienfragen zu Vertrauen und Sicherheit sowie neuartige Bedrohungen im Zusammenhang mit chemischen, biologischen, radiologischen und nuklearen Risiken, Cybersicherheit und Risiken autonomer KI.
How does Anthropic use models for automated red teaming?
Anthropic erklärte, ein Modell generiere Angriffe, die ein bestimmtes Zielverhalten hervorrufen sollen, während ein anderes anhand dieser Ausgaben gezielt weitertrainiert werde, um ähnlichen Angriffen besser standzuhalten. Der Prozess könne wiederholt werden, um weitere Angriffsvektoren zu entwickeln.
What policy measures did Anthropic recommend?
Anthropic forderte Finanzierungsstandards und unabhängige Prüfinstitutionen, den Aufbau zertifizierter professioneller Red-Teaming-Dienste, die Unterstützung überprüfter Tests durch Dritte sowie die Verknüpfung von Red-Teaming-Verfahren mit den Bedingungen für die Skalierung oder Veröffentlichung von Modellen.

Quellen

  1. Challenges in red teaming AI systems \ AnthropicAnthropic
Schlagwörteranthropicclaudered-teamingai-safetymodel-evaluationspolicy

Passend dazu

Anthropic erläutert Schutzmaßnahmen für Claude im Vorfeld der US-Wahlen

Anthropic stellte Maßnahmen vor, die den wahlbezogenen Missbrauch von Claude verhindern sollen. Dazu zählen Beschränkungen für Wahlkampf, Lobbyarbeit und Falschinformationen, eine automatisierte Durchsetzung mit nachgelagerter menschlicher Überprüfung, gezielte Red-Team-Tests sowie groß angelegte Evaluierungen. Zudem verweist das Unternehmen bei wahlbezogenen Anfragen auf aktuelle Wahlinformationen und nennt in Claudes System-Prompt den Wissensstichtag des Modells.

2 Min. Lesezeit

Anthropic erläutert seinen Rahmen zur Bewertung von KI-Schäden

Anthropic teilte mit, einen Rahmen entwickelt zu haben, der potenzielle KI-Schäden anhand von fünf Dimensionen bewertet: körperliche, psychologische, wirtschaftliche und gesellschaftliche Auswirkungen sowie Folgen für die individuelle Autonomie. Nach Angaben des Unternehmens wird der Rahmen ergänzend zu seiner Responsible Scaling Policy eingesetzt und fließt in seine Nutzungsrichtlinien, Bewertungen, Erkennungsmaßnahmen und Durchsetzungsmaßnahmen ein, unter anderem für die Computernutzung und Claude 3.7 Sonnet.

3 Min. Lesezeit

Anthropic legt Einflussoperationen, Betrug und Malware-Missbrauch von Claude offen

Anthropic berichtete, dass Akteure Claude für eine Einflussoperation, eine Aktivität im Zusammenhang mit geleakten Zugangsdaten von Sicherheitskameras, eine Betrugskampagne bei der Personalvermittlung sowie die Entwicklung von Malware genutzt hätten. Das Unternehmen erklärte, die zugehörigen Konten gesperrt und zur Erkennung, Untersuchung und Bekämpfung der Aktivitäten Techniken zur Gesprächsanalyse sowie Klassifikatoren eingesetzt zu haben.

2 Min. Lesezeit