AWS says its Amazon Bedrock AgentCore platform supports MCP Apps, a Model Context Protocol extension that renders interactive HTML widgets inside AI hosts like ChatGPT and Claude. AWS demonstrated the capability with a sample app called Unicorn Rentals, showing browsing, booking, viewing, and returning rentals through AgentCore's runtime and gateway.
AWS hat in einem Blogbeitrag beschrieben, wie AgentCore Evaluations und der AWS DevOps Agent zusammenarbeiten, um KI-Agenten im produktiven Einsatz zu überwachen. Laut AWS bewertet AgentCore Evaluations Live-Interaktionen von Agenten hinsichtlich Qualitätsproblemen, während der DevOps Agent Infrastrukturfehler über Servicegrenzen hinweg nachverfolgt. AWS demonstrierte den Ansatz anhand eines Flugbuchungssystems mit vier Agenten.
Skild AI hat S1 vorgestellt, ein Basismodell für Roboter, das neue, mehrstufige Aufgaben aus einer einzigen Videodemonstration lernt, ohne dass ein erneutes Training nötig ist. Aufbauend auf NVIDIAs Technologien Isaac Lab, Cosmos, Omniverse und TensorRT gelang S1 laut Skild bei neuen Aufgaben in 66 % der Schritte der Erfolg, gegenüber 9 % bei einem vergleichbaren System. Zudem habe das Unternehmen eine jährliche Umsatzrate von 100 Millionen US-Dollar erreicht.
Mistral described a project with a European energy operator that migrated 40,000 lines of Fortran 77 from a physics-intensive reservoir simulator to C++. The company said it built a numerical parity harness, used agents to document the codebase, and settled on workflows combining coder, tester and reviewer agents with human checkpoints.
AWS hat eine Fallstudie veröffentlicht, die beschreibt, wie Heurist Finance auf Amazon Bedrock AgentCore eine KI-gestützte Arbeitsplattform für Investments entwickelt hat. Laut AWS bündelt das System Markt- und alternative Daten, Unternehmensberichte, Nachrichten, Portfoliokonstruktion, Szenarioanalysen und die Überwachung von Positionen in einer Chat-Anwendung. AgentCore-Dienste übernehmen dabei Identitätsverwaltung, Speicher, Codeausführung, Zahlungen und Beobachtbarkeit.
Databricks says Zepto built a dual-loop evaluation framework for customer support agents using Databricks and MLflow. The system combines development testing, production monitoring, execution traces, golden datasets and deployment quality gates. According to Databricks, the agents fully manage more than 80% of support tickets with human oversight.
AWS veröffentlichte eine technische Anleitung zur Bereitstellung eines Assistenten für Restaurantbestellungen auf WhatsApp, der Amazon Bedrock AgentCore und Modelle von Amazon Nova 2 nutzt. Die Architektur unterstützt Textnachrichten, Sprachnachrichten und Anrufe über eine einzige Geschäftsnummer sowie einen kanalübergreifend gemeinsam genutzten Speicher und ein gemeinsames Backend für Speisekarten, Warenkörbe, Bestellungen und Standorte.
Anthropics Leitfaden definiert Prompt Engineering als Context Engineering neu: Statt alles anzuhäufen, wird für jeden Turn die kleinstmögliche Menge an hochwertigen Tokens kuratiert. In eigenen Auswertungen verbesserte das automatische Löschen veralteter Tool-Ergebnisse zusammen mit einer externen Memory-Datei eine Suchaufgabe um 39 Prozent und senkte den Tokenverbrauch über 100 Turns um 84 Prozent.
A Skill lives or dies on one field: the description, written in third person, stating what it does and when to use it. Keep SKILL.md under 500 lines and reference files one level deep, test on every model you plan to use it with, and never install a Skill from a source you don't trust.
Entwickler, die KI-Agenten erstellen möchten, können den fünftägigen Kurs von Google und Kaggle im eigenen Tempo absolvieren. Arbeiten Sie die Codelabs, technischen Whitepaper und Notebooks durch und entwickeln Sie anschließend ein Abschlussprojekt, das Agentendesign, Sicherheit und Cloud-Bereitstellung abdeckt. Nutzen Sie Kaggles Discord für Hilfe bei der Fehlersuche und für Lerngruppen.
Anthropic hat Partnerschaften im Bereich der Biowissenschaften mit dem Allen Institute und dem Howard Hughes Medical Institute angekündigt. Das HHMI wird gemeinsam mit Anthropic spezialisierte Laboragenten entwickeln, während das Allen Institute an koordinierten Multi-Agenten-Systemen für wissenschaftliche Analysen, experimentelle Planung und weitere Forschungsaufgaben mitwirkt. Beide Partnerschaften sollen zudem in die breiteren Fähigkeiten von Claude im Bereich der Biowissenschaften einfließen.
Ein Harness ist der Code um das Modell: Er stellt Kontext bereit, führt die Tool‑Call‑Schleife aus, streamt Ereignisse, komprimiert lange Sitzungen und hält irreversible Aktionen hinter menschlicher Genehmigung. OpenAI veröffentlichte den Codex‑Harness — codex exec, den app‑server und das SDK — unter Apache‑2.0, sodass jedes Unternehmen diesen gleichen Agenten‑Schleifen in seiner eigenen Software einbetten kann, während es weiterhin für das Modell dahinter zahlt.
Ein KI-Agent ist ein Sprachmodell, dem Werkzeuge zum Aufrufen, ein Ziel und die Erlaubnis gegeben wurden, mehrere Schritte zu gehen, ohne dazwischen einen Menschen zu fragen. Ein Chatbot beantwortet eine Frage und hört auf; ein Agent handelt weiter, bis er das Ziel für erreicht hält oder sein Budget aufgebraucht ist.
Demos laufen einmal einen kurzen Happy Path mit einem menschlichen Beobachter. Die Produktion läuft Tausende von Variationen unbeaufsichtigt, wobei sich die Fehlerraten pro Schritt summieren und ein unbegrenzter Berechtigungsumfang eine falsche Entscheidung in einen Vorfall verwandelt. Die Deployments, die funktionieren, verengen den Umfang, überprüfen jeden Schritt kostengünstig und sperren jede irreversible Aktion.