Skip to content
DigitalNeuron
Open-Source-KI

Analyse: OpenAI hat das Codex‑Harness open‑source veröffentlicht — was ein Harness ist und was 'open' abdeckt

Die Ausführungsebene um ein Codemodell ist jetzt Apache-2.0. Das ändert, was Teams einbetten können, und ändert nicht, was sie bezahlen. Eine Lektüre auf Entwickler‑Ebene des Releases.

Von DigitalNeuron Desk6 Min. Lesezeit

Kurze Antwort

Was ist ein KI-Agent-Harness, und was hat OpenAI tatsächlich open-sourced?

Ein Harness ist die Ausführungsebene um ein Modell: Er hält die Aufgabe, verwaltet den Kontext über einen langen Lauf, ruft Tools auf, streamt Ereignisse, ermöglicht Unterbrechungen und leitet Genehmigungen an einen Menschen weiter. OpenAI veröffentlichte seinen Codex‑Harness — die nicht‑interaktive CLI, das SDK und den app‑server — unter Apache-2.0, sodass er geforkt und in kommerzielle Produkte eingebettet werden kann. Die Modellgewichte wurden nicht veröffentlicht; der Harness ruft weiterhin eine kostenpflichtige API auf, sodass die Lizenzkosten null und die Betriebskosten nicht null sind.

Das Wichtigste

  • Das Geschirr – nicht das Modell – ist der Teil, den die meisten Teams schlecht neu aufgebaut haben, und es ist jetzt unter einer permissiven Lizenz verfügbar.
  • Apache-2.0 deckt den Ausführungscode ab. Gewichte, gehostetes Inferencing und die Marke liegen außerhalb davon.
  • OpenAI berichtet, dass ein Benchmark von 13,3 % auf 38,3 % steigt, allein durch Änderungen am Harness; behandeln Sie die Richtung als das Ergebnis und die Zahl als von dem Anbieter gemeldet.
  • Drittanbieter- und lokale Modelle können konfiguriert werden, aber nur über das Responses-Wire-Format – ein Chat Completions-Endpunkt wird nicht angehängt.
  • Budget in drei Schichten: Lizenz (null), Infrastruktur (dein), Tokens (das Einzige, das mit der Nutzung skaliert)

Seit zwei Jahren liegt die interessante Ingenieurskunst bei KI-Codierungswerkzeugen nicht im Modell. Sie liegt in der Schicht, die es umgibt: dem Ding, das entscheidet, was in das Kontextfenster kommt, wann ein Werkzeug aufgerufen wird, was zu tun ist, wenn ein Befehl hängt, und wann gestoppt und ein Mensch gefragt werden muss. Jedes ernsthafte Team hat eines gebaut. Die meisten haben es zweimal gebaut, weil der erste Versuch keine langlaufenden Aufgaben überstand.

Am 20. August veröffentlichte OpenAI seine Version dieser Schicht unter Apache-2.0. Die Ankündigung präsentierte sie als Plattform-Umzug – externe Unternehmen können den Agenten nun in ihre eigene Software einbetten, anstatt Benutzer in ein Allzweck-Chatfenster zu schicken. Für Entwickler ist die nützlichere Frage enger gefasst: Was ist tatsächlich in der Box und was deckt die Lizenz ab?

Was ein Harness tut

Die Motor-und-Chassis-Metapher in der Berichterstattung ist so weit zutreffend, wie sie geht, aber sie verbirgt die spezifische Arbeit. Zerlegt man ein Harness, tut es sechs Dinge gleichzeitig, von denen keines das Modell für sich selbst tut:

  • Halten der Aufgabe. Ein Modell beantwortet eine Anfrage. Ein Harness hält ein Ziel über Dutzende von Anfragen hinweg am Leben und entscheidet, wann es erreicht ist.
  • Kontextverwaltung. Lange Läufe überschreiten jedes Kontextfenster. Etwas muss zusammenfassen, fallen lassen, neu abrufen und die Argumentation über die Grenze hinweg bewahren. Macht man es grob, vergisst der Agent die Einschränkung, die Sie ihm vor vierzig Schritten gegeben haben.
  • Werkzeugverteilung. Definieren der Werkzeuge, Validieren von Argumenten, Ausführen unter einer Sandbox und Zurückspeisen von Ergebnissen in einer Form, auf die das Modell reagieren kann.
  • Streaming von Ereignissen. Ein Lauf, der sechs Minuten dauert, muss lesbar sein, während er stattfindet, nicht nur am Ende.
  • Unterbrechbarkeit. Sauberes Stoppen mitten im Lauf, Speichern des Zustands, späteres Fortsetzen – der Unterschied zwischen einer Demo und etwas, das eine Person laufen lässt.
  • Weiterleitung von Genehmigungen. Welche Aktionen automatisch fortgesetzt werden, welche für einen Menschen stoppen und wie diese Entscheidung aufgezeichnet wird.

Diese Liste ist der Grund, warum Harness-Arbeit Benchmark-Zahlen überhaupt beeinflusst. OpenAI berichtet, dass allein Harness-Änderungen – beibehaltene Argumentation und Kontextkomprimierung – ein Modell von 13,3 % auf 38,3 % bei ARC-AGI-3 gebracht haben, mit einer sechsfachen Reduzierung des Token-Verbrauchs durch das Harness-Design. Von Anbietern gemeldete Zahlen zu einer eigenen Veröffentlichung des Anbieters verdienen den üblichen Abschlag, und der Benchmark ist eng gefasst. Die Richtung ist immer noch die Erkenntnis, die es wert ist, beibehalten zu werden: Dieselben Gewichte erzeugen materiell unterschiedliche Ergebnisse, abhängig von der umgebenden Maschinerie, und diese Maschinerie ist dort, wo der verbleibende Ingenieurshebel liegt.

Was "Open Source" hier abdeckt

Diese Veröffentlichung ist wirklich permissiv, und das Label verbirgt immer noch eine Grenze, die für die Planung wichtig ist.

Apache-2.0 auf dem Harness bedeutet, dass Sie es forken, modifizieren, die Modifikationen privat halten und das Ergebnis in einem geschlossenen kommerziellen Produkt – einschließlich eines White-Label-Produkts – vertreiben können, vorbehaltlich der Namensnennungs- und Hinweispflichten. Es gibt keinen Copyleft-Auslöser, was der praktische Unterschied zwischen diesem und einer AGPL-Veröffentlichung ist: Eine AGPL-Ausführungsschicht würde die Offenlegung erzwingen, sobald Sie sie über ein Netzwerk bereitstellen, und das allein disqualifiziert eine Komponente für die meisten White-Label-Roadmaps.

Was die Lizenz nicht abdeckt, ist ebenso klar. Die Gewichte wurden nicht veröffentlicht; das Harness ist offen, die Intelligenz, die es aufruft, nicht. Markenrechte werden durch Apache-2.0 nicht gewährt, daher ist die Veröffentlichung eines Produkts, das sich Codex nennt, eine separate Frage von der Veröffentlichung eines auf Codex basierenden Produkts. Und eine permissive Lizenz für einen Client sagt nichts über die Bedingungen des Dienstes aus, mit dem er sich verbindet. Wenn die Unterscheidung zwischen einer offenen Lizenz und offenen Gewichten in Ihrer Beschaffungsprüfung eine Rolle spielt, lohnt es sich, was die Labels tatsächlich bedeuten vor der Prüfung zu lesen, nicht währenddessen.

Die Einschränkung, auf die die meisten Teams zuerst stoßen werden

Das Harness ist nicht an einen Anbieter gebunden. Ein benutzerdefinierter Anbieter leitet es an jeden kompatiblen Endpunkt – die API eines Wettbewerbers, ein Gateway oder ein Modell, das auf Ihrer eigenen Hardware läuft.

Die strategische Lesart dieser Einschränkung ist unkompliziert. Portabilität existiert, und sie läuft über ein Wire-Format, das der Anbieter kontrolliert und bereits einmal geändert hat. Jeder, der dies als Versicherung gegen Lock-in betrachtet, sollte davon ausgehen, dass der Shim eine wartbare Komponente und keine einmaligen Kosten sind.

Was es kostet

Drei Ebenen, und nur eine davon skaliert:

EbeneKostenAnmerkungen
Harness-LizenzNullApache-2.0. Kostenlos forken und einbetten.
InfrastrukturIhreEin Rust-Binärpaket und ein npm-Paket. Es läuft dort, wo Sie bereits Dinge ausführen.
Modell-TokensAbgerechnetDurch diese Veröffentlichung unverändert. Das Harness macht Aufrufe; etwas berechnet dafür.

Die veröffentlichten Tarife für die aktuelle Produktlinie von OpenAI liegen bei etwa 5 US-Dollar pro Million Eingabe-Tokens und 30 US-Dollar pro Million Ausgabe für die Top-Stufe, wobei der gecachte Input um eine Größenordnung günstiger ist und die mittleren und leichten Stufen weit darunter liegen. Diese Zahlen sind nur die halbe Rechnung. Ein Agentenlauf ist keine einzelne Anfrage – es sind Dutzende, die jeweils angesammelten Kontext tragen, was genau das Muster ist, das Einheitspreise sinken lässt, während Rechnungen steigen.

Für jeden, der eine Bereitstellung budgetiert, ergeben sich zwei Konsequenzen. Erstens wird die Cache-Trefferquote auf dem stabilen Präfix die Rechnung dominieren; ein Harness, das die Spitze des Prompts zwischen den Durchgängen neu mischt, kann die Kosten ohne Fehlschlag einer einzelnen Anfrage leise vervielfachen. Messen Sie es, bevor Sie von einer Preisliste extrapolieren. Zweitens verengt sich die sitzbasierte Route eher, als dass sie sich erweitert – Codex-Sitze sind für neue Geschäftsarbeitsbereiche seit dem 24. Juni 2026 nicht mehr verfügbar, was API-Schlüssel für die meisten Teams, die jetzt beginnen, zum praktischen Weg macht.

Bevor Sie es einbetten

Ein Harness erbt Ihre Berechtigungen. Die Checkliste, die wichtig ist, ist kurz und betrifft meist nicht das Modell:

  • Sandbox-Haltung. Nur-Lese-, Arbeitsbereich-Schreib- und Vollzugriff sind bedeutsam unterschiedliche Explosiionsradien. Wählen Sie den engsten, den die Aufgabe tatsächlich benötigt.
  • Genehmigungsrichtlinie. Die Automatisierung von Genehmigungen ist der Punkt, an dem ein Agent nicht mehr überprüfbar ist. Entscheiden Sie, welche Aktionsklassen niemals automatisch sind.
  • Prompt-Injection. Alles, was der Agent liest, kann Anweisungen enthalten, die an ihn gerichtet sind. Die Verteidigung ist ein kleinerer Berechtigungssatz, kein besseres System-Prompt.
  • Audit-Trail. Wenn der Agent in ein gemeinsames Repository oder die Daten eines Kunden schreibt, muss die Aufzeichnung dessen, was er getan hat und welcher Mensch es genehmigt hat, die Sitzung überdauern.
  • Namensnennungspflichten. Apache-2.0 verlangt, dass die Hinweisedatei mit abgeleiteten Produkten, einschließlich White-Label-Produkten, mitgeliefert wird.

Wo das landet

GitHub, JetBrains und Cisco haben Codex bereits in ihre eigenen Produkte integriert, und ein US-Steuerberatungsunternehmen berichtet von der Bearbeitung von 7.000 Einreichungen mit etwa einem Drittel weniger Vorbereitungszeit. Das Muster bei diesen Bereitstellungen ist dasselbe: Der Agent erscheint innerhalb der Software, die die Leute bereits verwenden, anstatt in einem separaten Chatfenster. Das ist das eigentliche Plattformargument, und es beschränkt sich nicht auf das Codieren – dieselbe Ausführungsschicht funktioniert für Sicherheits-Triage, Support, Vertrieb und Marketingoperationen, weshalb die interessante Adoption im nächsten Jahr wahrscheinlich in Abteilungen stattfinden wird, die noch nie ein Terminal geöffnet haben.

Für Ingenieurteams ist die kurzfristige Frage profaner. Sie haben fast sicher eine selbst entwickelte Version dieser Schleife irgendwo in Ihrem Stack, unter Zeitdruck geschrieben. Es lohnt sich jetzt zu fragen, ob sie weiterhin Ihre sein sollte.

Häufige Fragen

Macht das Open-Sourcing des Harness Codex frei ausführbar?
Nein. Das Harness kann kostenlos kopiert, modifiziert und eingebettet werden. Jeder Lauf sendet weiterhin Tokens an ein Modell, das pro Token abrechnet, sei es eine gehostete API oder von Ihnen selbst betriebene Hardware.
Kann der Harness ein Modell steuern, das nicht von OpenAI stammt?
Ja, über einen benutzerdefinierten Modell-Provider-Eintrag, der auf einen beliebigen Endpunkt zeigt, der das Responses-Wire-Format spricht, einschließlich lokaler Server. Die Unterstützung für das ältere Chat Completions-Format wurde im Februar 2026 entfernt, daher benötigen viele OpenAI-kompatible Gateways einen Übersetzungs-Shim.
Was erlaubt Apache-2.0, was eine Copyleft-Lizenz nicht erlauben würde?
Du kannst es forken, es modifizieren, deine Änderungen privat behalten und es in einem geschlossenen oder white-labelled kommerziellen Produkt einsetzen, mit Attributions- und Hinweispflichten, aber ohne Verpflichtung, deinen Quellcode zu veröffentlichen.
Ist ein Harness dasselbe wie ein Agentenframework?
Überlappend, aber nicht identisch. Frameworks beschreiben meistens, wie man Schritte zusammensetzt. Ein Harness ist die Laufzeit, die sie tatsächlich ausführt — Kontextverwaltung, Tool‑Dispatch, Streaming, Unterbrechungen, Genehmigungen und Sitzungszustand.

Quellen

  1. Codex — repository and licence — OpenAI
  2. Codex as a platform: build on the open agent harness — OpenAI
  3. Advanced configuration — custom model providers — OpenAI
  4. API pricing — OpenAI
Schlagwörteragentsharnesslicensingapache-2.0developer toolsinference cost

Passend dazu

Open Weights vs. Open Source bei KI: was die Bezeichnungen wirklich bedeuten

Open Weights heißt, dass die trainierte Modelldatei heruntergeladen und selbst betrieben werden kann — unter der Lizenz, die der Herausgeber gewählt hat. Open Source ist ein strengerer rechtlicher Standard, der Freiheit zur Nutzung, Untersuchung, Änderung und Weitergabe ohne Einsatzbeschränkungen verlangt. Viele verbreitete Modelle sind Open Weights, aber nicht Open Source.

3 Min. Lesezeit

Analyse: OpenAI hat das Gerüst open-sourced, nicht das Modell — und das ist die Strategie

Ein Harness ist der Code um das Modell: Er stellt Kontext bereit, führt die Tool‑Call‑Schleife aus, streamt Ereignisse, komprimiert lange Sitzungen und hält irreversible Aktionen hinter menschlicher Genehmigung. OpenAI veröffentlichte den Codex‑Harness — codex exec, den app‑server und das SDK — unter Apache‑2.0, sodass jedes Unternehmen diesen gleichen Agenten‑Schleifen in seiner eigenen Software einbetten kann, während es weiterhin für das Modell dahinter zahlt.

5 Min. Lesezeit

Analyse: Wie weit liegen Open-Weight-Modelle wirklich zurück?

Auf gängigen Benchmarks liegen die besten Open-Weight-Modelle nun nahe an den kommerziellen Spitzenmodellen, und für viele Routineaufgaben ist der Unterschied nicht spürbar. Die verbleibenden Lücken zeigen sich in der Zuverlässigkeit über lange Zeiträume, der Werkzeugnutzung, sehr langen Kontexten und der Abstimmung der Sicherheit – und in der operativen Arbeit, sie selbst zu betreiben.

3 Min. Lesezeit