Skip to content
DigitalNeuron
Agenten & Automatisierung

AWS erläutert, wie AgentCore Evaluations und der DevOps-Agent produktive KI-Agenten überwachen

AWS hat in einem Blogbeitrag erläutert, wie AgentCore Evaluations und der AWS DevOps Agent zusammenwirken, um die Qualität von KI-Agenten und die Infrastruktur im Produktivbetrieb zu überwachen.

Von DigitalNeuron Desk2 Min. Lesezeit

Kurze Antwort

Was hat AWS zur Überwachung produktiv eingesetzter KI-Agenten mit AgentCore Evaluations und dem DevOps Agent angekündigt?

AWS hat in einem Blogbeitrag beschrieben, wie AgentCore Evaluations und der AWS DevOps Agent zusammenarbeiten, um KI-Agenten im produktiven Einsatz zu überwachen. Laut AWS bewertet AgentCore Evaluations Live-Interaktionen von Agenten hinsichtlich Qualitätsproblemen, während der DevOps Agent Infrastrukturfehler über Servicegrenzen hinweg nachverfolgt. AWS demonstrierte den Ansatz anhand eines Flugbuchungssystems mit vier Agenten.

Das Wichtigste

  • Laut AWS können Tools zur Infrastrukturüberwachung wie Amazon CloudWatch zwar zeigen, dass ein System korrekt ausgeführt wurde, verraten aber nicht, ob ein KI-Agent einem Nutzer tatsächlich geholfen hat, sein Ziel zu erreichen.
  • AWS hat ein produktives Flugbuchungssystem mit vier spezialisierten Agenten entwickelt, um zu zeigen, wie sich Amazon Bedrock AgentCore Evaluations mit dem AWS DevOps Agent kombinieren lässt.
  • Laut AWS bewertet AgentCore Evaluations fortlaufend Live-Interaktionen von Agenten, um falsche Tool-Auswahlen, gescheiterte Aufgaben und Qualitätseinbußen zu erkennen, die Infrastrukturkennzahlen nicht abbilden.
  • AWS zufolge spürt der DevOps Agent Fehler eigenständig über Servicegrenzen hinweg auf, indem er IAM-Richtlinien, Aufrufprotokolle und Orchestrierungs-Traces miteinander abgleicht – ganz ohne manuelle Untersuchung.
  • AWS weist darauf hin, dass Amazon Bedrock API-Zugriff auf Foundation-Modelle von Anthropic, Meta, Mistral und Amazon bietet und dass die AgentCore-Laufzeitumgebung eine integrierte Observability durch OpenTelemetry-Instrumentierung mitbringt.

AWS hat in einem Blogbeitrag erläutert, wie sich zwei eigene Tools, Amazon Bedrock AgentCore Evaluations und AWS DevOps Agent, kombinieren lassen, um KI-Agenten im Produktivbetrieb zu überwachen.

Das Problem, das AWS beschreibt

Laut AWS treten bei Multi-Agenten-Systemen im Produktivbetrieb Fehler auf, die klassisches Monitoring nicht erfasst. Das Unternehmen nennt zwei Beispiele: einen Agenten, der sein Foundation Model nicht aufrufen kann und wegen einer fehlenden Berechtigung in AWS Identity and Access Management (IAM) eine leere Antwort zurückgibt, ohne dass dabei ein 500er-Fehler ausgelöst wird, sowie einen Supervisor-Agenten mit unzureichend abgegrenztem Prompt, der beginnt, 20 Prozent der Anfragen an den falschen Spezialisten weiterzuleiten, während die Infrastrukturmetriken davon unberührt bleiben.

Infrastruktur-Monitoring-Tools wie Amazon CloudWatch könnten laut AWS zwar bestätigen, dass ein System korrekt ausgeführt wurde, zeigten aber nicht, ob ein Agent einem Nutzer tatsächlich geholfen hat, sein Ziel zu erreichen. Das Unternehmen schreibt, ein Agent könne Amazon Bedrock erfolgreich aufrufen, jedes Tool fehlerfrei nutzen und trotzdem eine Antwort liefern, die am eigentlichen Bedürfnis des Nutzers vorbeigeht. AWS beschreibt zudem einen Fall, in dem ein Buchungsagent keine Reservierungen mehr abschließt, obwohl die Logs erfolgreiche Tool-Ausführungen zeigen – der Fehler trat drei Aufrufe tief in einer Kette auf, die keine Exception nach außen gab.

Diese Probleme verschärften sich laut AWS in Multi-Agenten-Systemen, in denen eine einzelne Anfrage einen Supervisor-Agenten auslöst, der Aufgaben an mehrere Spezialisten mit jeweils eigenen Tools und Modellaufrufen verteilt. Es gebe in der Regel keinen festen Ausführungsgraphen, den man instrumentieren könne, so AWS, und Fehler könnten an mehreren Übergabepunkten auftreten, ohne sich vorhersehbar durch das System fortzupflanzen.

Das System, das AWS gebaut hat

Um dem zu begegnen, hat AWS eigenen Angaben zufolge ein produktives Flugbuchungssystem mit vier spezialisierten Agenten entwickelt, das Amazon Bedrock AgentCore Evaluations zur kontinuierlichen Bewertung der Agentenqualität mit AWS DevOps Agent zur autonomen Untersuchung von Infrastrukturvorfällen kombiniert.

AWS beschreibt Amazon Bedrock AgentCore als Plattform, um Agenten in beliebigem Framework und mit beliebigem Modell im großen Maßstab zu bauen, zu verbinden und zu optimieren. Innerhalb dieser Plattform bewerte AgentCore Evaluations laufende Interaktionen kontinuierlich und erkenne so falsche Tool-Auswahl, gescheiterte Aufgaben und Qualitätsregressionen, die Infrastrukturmetriken vollständig übersähen. AWS DevOps Agent wiederum verfolge Fehler autonom über Servicegrenzen hinweg und bringe IAM-Richtlinien, Aufruf-Logs und Orchestrierungs-Traces ohne manuelle Untersuchung miteinander in Verbindung. Zusammen sollen diese beiden Ebenen laut AWS zeigen, ob ein Agent korrekt funktioniert und ob die zugrunde liegende Infrastruktur ihn trägt.

Zentrale eingesetzte Technologien

AWS nennt mehrere Dienste, auf denen das System aufbaut:

  • Amazon Bedrock stellt API-Zugriff auf Foundation Models von Anthropic, Meta, Mistral und Amazon bereit und treibt das Sprachverständnis im Flugbuchungssystem an.
  • Die AgentCore-Runtime übernimmt die Orchestrierung der Agenten und verwaltet den Lebenszyklus der Interaktionen, mit integrierter Observability durch OpenTelemetry-Instrumentierung.
  • Das Fullstack AgentCore Solution Template (FAST) wird als Teil der Implementierung erwähnt, wobei der Blogbeitrag seine Rolle im vorliegenden Auszug nicht vollständig erläutert.

Quelle: AWS Machine Learning Blog, „Monitoring production agent lifecycle with AWS DevOps Agent and AgentCore Evaluations“, veröffentlicht am 11. September 2026.

Häufige Fragen

Welches Problem greift AWS in diesem Blogbeitrag auf?
Laut AWS können Multi-Agenten-Systeme im Produktivbetrieb auf Weisen versagen, die klassisches Monitoring nicht erfasst – etwa wenn ein Agent aufgrund einer fehlenden IAM-Berechtigung eine leere Antwort liefert, ohne dass ein Fehler ausgelöst wird, oder wenn ein übergeordneter „Supervisor“-Agent Anfragen falsch weiterleitet, während die Infrastrukturmetriken unauffällig bleiben.
Was sind AgentCore Evaluations?
AWS beschreibt es als eine Funktion, die live ablaufende Agenten-Interaktionen fortlaufend bewertet, um falsche Tool-Auswahlen, gescheiterte Aufgaben und Qualitätseinbußen zu erkennen, die sich mit klassischen Infrastruktur-Metriken nicht erfassen lassen.
Was ist der AWS DevOps Agent?
AWS zufolge verfolgt das System Fehler eigenständig über Servicegrenzen hinweg und bringt dabei IAM-Richtlinien, Aufruf-Protokolle und Orchestrierungs-Traces ohne manuelle Untersuchung miteinander in Verbindung.
Welches Beispiel führte AWS an, um diesen Ansatz zu veranschaulichen?
AWS hat ein produktives Buchungssystem für eine Fluggesellschaft mit vier spezialisierten Agenten entwickelt, um zu zeigen, wie die beiden Überwachungsebenen zusammenspielen.

Quellen

  1. Monitoring production agent lifecycle with AWS DevOps Agent and AgentCore Evaluations | Artificial IntelligenceAmazon Web Services (AWS)
Schlagwörterawsamazon-bedrockagentcoreai-agentsobservabilitydevops

Passend dazu

AWS stellt multimodalen, mit Bedrock AgentCore entwickelten WhatsApp-Bestellassistenten vor

AWS veröffentlichte eine technische Anleitung zur Bereitstellung eines Assistenten für Restaurantbestellungen auf WhatsApp, der Amazon Bedrock AgentCore und Modelle von Amazon Nova 2 nutzt. Die Architektur unterstützt Textnachrichten, Sprachnachrichten und Anrufe über eine einzige Geschäftsnummer sowie einen kanalübergreifend gemeinsam genutzten Speicher und ein gemeinsames Backend für Speisekarten, Warenkörbe, Bestellungen und Standorte.

2 Min. Lesezeit

AWS stellt die auf Bedrock AgentCore basierende Investment-Workbench von Heurist Finance vor

AWS hat eine Fallstudie veröffentlicht, die beschreibt, wie Heurist Finance auf Amazon Bedrock AgentCore eine KI-gestützte Arbeitsplattform für Investments entwickelt hat. Laut AWS bündelt das System Markt- und alternative Daten, Unternehmensberichte, Nachrichten, Portfoliokonstruktion, Szenarioanalysen und die Überwachung von Positionen in einer Chat-Anwendung. AgentCore-Dienste übernehmen dabei Identitätsverwaltung, Speicher, Codeausführung, Zahlungen und Beobachtbarkeit.

2 Min. Lesezeit