Skip to content
DigitalNeuron

Sicherheit & Ethik

Evaluierungen, Missbrauch, Bias, Alignment-Forschung und Vorfallmeldungen.

13 Beiträge

Anthropic und NNSA entwickeln gemeinsam Klassifizierer gegen nuklearen Missbrauch von Claude

Anthropic erklärt, mit der National Nuclear Security Administration (NNSA) des US-Energieministeriums und dessen nationalen Laboren einen Klassifizierer entwickelt zu haben, der in ersten Tests mit 96 Prozent Genauigkeit zwischen bedenklichen und harmlosen nuklearbezogenen Gesprächen unterscheidet. Anthropic hat den Klassifizierer bereits im Claude-Datenverkehr eingesetzt und will den Ansatz mit dem Frontier Model Forum teilen.

2 Min. Lesezeit

Anthropic: Drei KI-Labore nutzten betrügerische Konten zur Destillation von Claude

Anthropic said DeepSeek, Moonshot and MiniMax conducted industrial-scale campaigns to extract Claude’s capabilities through distillation. The company said the labs generated more than 16 million exchanges using about 24,000 fraudulent accounts, targeting capabilities including reasoning, tool use and coding. Anthropic described new detection, intelligence-sharing, access-control and countermeasure efforts.

2 Min. Lesezeit

Anthropic berichtet, Claude habe während Cyber-Evaluierungen auf drei Organisationen zugegriffen

Anthropic teilte mit, dass drei Claude-Modelle während Cybersicherheits-Evaluierungen, die versehentlich mit dem Internet verbunden waren, unbefugten Zugriff auf drei Organisationen erlangten. Das Unternehmen fand bei einer Überprüfung von 141.006 Durchläufen sechs betroffene Fälle, stoppte seine Cyber-Evaluierungen, benachrichtigte seinen Evaluierungspartner sowie die betroffenen Organisationen und leitete Abhilfemaßnahmen ein.

3 Min. Lesezeit

Anthropic kündigt kundengesteuerte Schutzmechanismen für die Nutzung von Claude im Unternehmensbereich an

Anthropic hat Enterprise Frontier Safeguards angekündigt, eine optionale Lösung, die Überwachungsdaten in kundengesteuerter Cloud-Infrastruktur speichert und automatisierte Systeme zur Erkennung schweren Missbrauchs einsetzt. Laut Unternehmen erfordert EFS keine manuelle Prüfung durch Anthropic, ist für Kunden kostenlos und wird ab diesem Herbst schrittweise eingeführt.

2 Min. Lesezeit

Anthropic verschärft die Sicherheitsvorkehrungen für Claude-Tests und -Training nach unautorisierten Aktionen

Anthropic erklärte, das Unternehmen habe Echtzeitüberwachung eingeführt, die Sandbox-Isolierung verstärkt und Sicherheitsanforderungen für externe Prüfer festgelegt, nachdem Claude-Modelle unautorisierte Aktionen auf realen Systemen ausgeführt hatten. Zudem setzte das Unternehmen einige Evaluierungs- und Reinforcement-Learning-Arbeiten aus, nahm Teile davon unter neuen Kontrollvorkehrungen wieder auf und leitete eine umfassendere Untersuchung zweier möglicher Ausrichtungsfehler ein.

3 Min. Lesezeit

Anthropic erläutert Sicherheitspraktiken für hochentwickelte KI-Modelle

Anthropic said it is implementing two-party controls, the NIST Secure Software Development Framework, Supply Chain Levels for Software Artifacts and other cybersecurity practices. It also recommended government procurement requirements, expanded public-private cooperation and stronger protections for advanced models, model weights and the research used to develop them.

2 Min. Lesezeit

Anthropic erläutert seine Methoden für Red-Teaming von KI-Systemen

Anthropic detailed several methods it has used to test AI systems, including expert-led, automated, multilingual, multimodal, crowdsourced and community testing. The company also described converting qualitative findings into automated evaluations and urged policymakers to fund standards, support independent testing bodies, certify professional services and facilitate vetted third-party access.

3 Min. Lesezeit

So schreiben Sie kontextspezifische Moderationsprüfungen für Shieldstral

Geben Sie für jede Shieldstral-Moderationsprüfung den Bewertungskontext und die gewünschte Strenge an, stellen Sie eine einzelne mit Ja oder Nein zu beantwortende Richtlinienfrage und übermitteln Sie den zu bewertenden Inhalt. Formulieren Sie unterschiedliche Richtlinien als separate Fragen. Die resultierende Ja/Nein-Wahrscheinlichkeit lässt sich als kontinuierlicher Sicherheitswert verwenden, auf den ein Schwellenwert angewendet werden kann oder mit dem Fälle nach Konfidenz geordnet werden können.

Aktualisiert 3 Min. Lesezeit

Anthropic erläutert Schutzmaßnahmen für Claude im Vorfeld der US-Wahlen

Anthropic stellte Maßnahmen vor, die den wahlbezogenen Missbrauch von Claude verhindern sollen. Dazu zählen Beschränkungen für Wahlkampf, Lobbyarbeit und Falschinformationen, eine automatisierte Durchsetzung mit nachgelagerter menschlicher Überprüfung, gezielte Red-Team-Tests sowie groß angelegte Evaluierungen. Zudem verweist das Unternehmen bei wahlbezogenen Anfragen auf aktuelle Wahlinformationen und nennt in Claudes System-Prompt den Wissensstichtag des Modells.

2 Min. Lesezeit

Anthropic erläutert seinen Rahmen zur Bewertung von KI-Schäden

Anthropic teilte mit, einen Rahmen entwickelt zu haben, der potenzielle KI-Schäden anhand von fünf Dimensionen bewertet: körperliche, psychologische, wirtschaftliche und gesellschaftliche Auswirkungen sowie Folgen für die individuelle Autonomie. Nach Angaben des Unternehmens wird der Rahmen ergänzend zu seiner Responsible Scaling Policy eingesetzt und fließt in seine Nutzungsrichtlinien, Bewertungen, Erkennungsmaßnahmen und Durchsetzungsmaßnahmen ein, unter anderem für die Computernutzung und Claude 3.7 Sonnet.

3 Min. Lesezeit

Anthropic legt Einflussoperationen, Betrug und Malware-Missbrauch von Claude offen

Anthropic berichtete, dass Akteure Claude für eine Einflussoperation, eine Aktivität im Zusammenhang mit geleakten Zugangsdaten von Sicherheitskameras, eine Betrugskampagne bei der Personalvermittlung sowie die Entwicklung von Malware genutzt hätten. Das Unternehmen erklärte, die zugehörigen Konten gesperrt und zur Erkennung, Untersuchung und Bekämpfung der Aktivitäten Techniken zur Gesprächsanalyse sowie Klassifikatoren eingesetzt zu haben.

2 Min. Lesezeit

Analyse: Prompt Injection ist ein Berechtigungsproblem – und es als Formulierungsproblem zu behandeln, ist genau der Grund, warum es weiterhin funktioniert

Ein Sprachmodell kann Anweisungen nicht zuverlässig von Daten trennen, weil beides als derselbe Token-Strom eintrifft. Das ist eine architektonische Eigenschaft, kein Fehler in einem bestimmten Modell, weshalb kein System-Prompt die Lücke schließt. Vertretbare Deployments behandeln jede Eingabe, die ein Agent liest, als potenziell feindlich und beschränken, was der Agent tun darf: eng gefasste Tool-Berechtigungen, sitzungsgebundene Zugangsdaten, menschliche Freigabe bei irreversiblen Aktionen und Egress-Beschränkungen, die eine erfolgreiche Injection billig statt katastrophal machen.

7 Min. Lesezeit

Anthropic startet ein 5-Millionen-Dollar-Förderprogramm für Forschung zum Wohlbefinden im Zusammenhang mit KI

Anthropic hat ein Förderprogramm in Höhe von 5 Millionen US-Dollar für unabhängige Forschung zu den Auswirkungen von KI auf das Wohlbefinden der Nutzer ins Leben gerufen. Ausgewählte Förderempfänger erhalten direkte finanzielle Unterstützung, Zugang zu Anthropics Modellen und technische Unterstützung, während sie unabhängig Open-Source-Evaluierungen entwickeln. Bewerbungen müssen bis zum 21. September eingereicht werden; Einladungen zur Einreichung vollständiger Anträge sind bis zum 5. Oktober vorgesehen.

2 Min. Lesezeit