Analyse: OpenAI hat das Gerüst open-sourced, nicht das Modell — und das ist die Strategie
Die Ausführungsebene von Codex ist jetzt Apache-2.0. Die Veröffentlichung verwandelt ein Agentenprodukt in eine eingebettbare Komponente, und verschiebt die interessante ingenieurtechnische Frage vom Prompt in die Schleife darum.
Kurze Antwort
Was ist ein KI-Agent-Harness, und warum ist das Open‑Sourcing des Codex‑Harness durch OpenAI wichtig?
Ein Harness ist der Code um das Modell: Er stellt Kontext bereit, führt die Tool‑Call‑Schleife aus, streamt Ereignisse, komprimiert lange Sitzungen und hält irreversible Aktionen hinter menschlicher Genehmigung. OpenAI veröffentlichte den Codex‑Harness — codex exec, den app‑server und das SDK — unter Apache‑2.0, sodass jedes Unternehmen diesen gleichen Agenten‑Schleifen in seiner eigenen Software einbetten kann, während es weiterhin für das Modell dahinter zahlt.
Das Wichtigste
- Der Gurt — nicht das Modell — ist die Schicht, die die meisten Teams schlecht neu aufgebaut haben. OpenAI standardisierte ihn und stellte ihn unter einer permissiven Lizenz zur Verfügung.
- OpenAI berichtet, dass dasselbe Modell durch reine Harness‑Änderungen von 13,3 % auf 38,3 % beim ARC-AGI-3 steigt. Lesen Sie das als Hinweis darauf, dass Scaffolding eine erstklassige Variable ist, nicht als Modelergebnis.
- Apache-2.0 ist die Produktentscheidung. Eine Copyleft-Lizenz hätte genau das Einbetten — Cisco, GitHub, JetBrains — blockiert, das die Veröffentlichung ermöglicht.
- Das Modell bleibt geschlossen. Die Schicht, die sowieso kommodifiziert werden sollte, zu öffnen, während der gemessene Teil geschlossen bleibt, ist ein bewusster und vertrauter Aufbau.
- Die Einbettung von Agenten in Software für betriebliche Anwendungen verschiebt die schwierige Frage von der Integration zur Genehmigung: Was darf diese Sache tun, und wer genehmigt sie?
Es gibt eine Version dieser Geschichte, die wie eine routinemäßige Open-Source-Veröffentlichung wirkt, und eine Version, die so wirkt, als würde OpenAI dem Markt mitteilen, wo es den Wert von Agenten tatsächlich sieht. Die zweite ist näher dran.
Am 20. August veröffentlichte das Unternehmen die Maschinerie hinter Codex – den codex exec Kommandozeilenbefehl, den app-server Ausführungsservice und das Codex SDK – unter Apache-2.0 im openai/codex Repository. Das Modell wurde nicht bewegt. Alles um das Modell herum wurde bewegt.
Ein Harness ist der Teil, den niemand vorführt
Anbieter führen Modelle vor. Teams liefern Harnesses aus.
Das Harness ist der Code, der eine Textvervollständigung in erledigte Arbeit umwandelt. Es entscheidet, welchen Kontext das Modell in dieser Runde sieht, führt die Tool-Aufrufe aus, die das Modell anfordert, streamt Ergebnisse, sobald sie eintreffen, verhindert, dass eine lange Sitzung ihr Fenster überläuft, erlaubt einer Person, einen Lauf mitten im Prozess zu unterbrechen, und hält irreversible Aktionen hinter einem Genehmigungsgate.
| Das Modell entscheidet | Das Harness entscheidet |
|---|---|
| was der nächste Schritt sein soll | was das Modell bei der Entscheidung sehen kann |
| welches Werkzeug aufgerufen werden soll | ob dieser Aufruf zulässig ist und was passiert, wenn er fehlschlägt |
| wann es fertig ist | wann es trotzdem aufhören soll – Schritte, Wanduhrzeit, Ausgaben |
| nichts über Konsequenzen | was eine Person zur Genehmigung aufgefordert wird und was protokolliert wird |
Jeder, der einen Agenten-Prototyp in die Produktion gebracht hat, hat eine Version davon geschrieben, normalerweise zweimal, normalerweise beim ersten Mal schlecht. Das ist es, was OpenAI jetzt standardisiert und verschenkt hat.
Wenn das Modell der Motor ist, ist das Harness das Chassis, das Getriebe und die Bremsen. Niemand kauft ein Auto, indem er nur Motoren vergleicht, und die letzten zwei Jahre der Agentenbeschaffung waren fast genau das.
Die Zahl, die jeder zitieren wird
OpenAI berichtet, dass allein Änderungen am Harness – die Beibehaltung der Schlussfolgerung über Schritte hinweg und die Komprimierung des Kontexts – dasselbe Modell von 13,3 % auf 38,3 % bei ARC-AGI-3 bewegt haben, zusammen mit einer etwa sechsfachen Reduzierung des Token-Verbrauchs.
Das ist eine beeindruckende Zahl, und es lohnt sich, präzise zu sein, was sie aussagt und was nicht.
Was sie aussagt: Das Gerüst ist eine erstklassige Variable. Ein Team, das zwei Modelle mit seinem eigenen Harness vergleicht, misst drei Dinge – zwei Modelle und ein Gerüst – und berichtet hauptsächlich über das Gerüst. Veröffentlichte Modellbewertungen ohne veröffentlichtes Harness sind nach diesen Erkenntnissen kaum lesbar.
Was sie nicht aussagt: dass die gleiche Marge in Ihrem Produkt wartet. Ein Harness, das gegen einen Benchmark abgestimmt ist, ist teilweise auf diesen Benchmark abgestimmt, und eine Reihe von Denkaufgaben ist keine Abstimmungswarteschlange.
Die nützliche Lesart liegt dazwischen. Wenn Sie heute schlechte Ergebnisse von einem Spitzenmodell erzielen, sollte die Annahme jetzt sein, dass Ihre Schleife falsch ist, bevor Ihr Modell es ist.
Die Lizenz ist die Ankündigung
Apache-2.0 ist hier keine Fußnote. Es ist die Substanz.
Eine Copyleft-Lizenz hätte dieses Harness für genau die Kunden unbrauchbar gemacht, für die die Einführung konzipiert wurde – Unternehmen, die es in ein kommerzielles Produkt kompilieren möchten, ohne zu veröffentlichen, was sie darum herum gewickelt haben. Cisco betreibt das Codex SDK innerhalb von App Builder, einem Teil von Cisco Cloud Control. GitHub und JetBrains integrieren den Agenten in den Editor, den ein Entwickler bereits geöffnet hat, anstatt in einem separaten Fenster. Thrive Holdings und Crete haben einen Workflow zur Steuererstellung mit der Überprüfung durch Praktiker entwickelt; Berichte rund um die Einführung beziffern ihn auf etwa 7.000 Einreichungen mit einer um etwa ein Drittel reduzierten Bearbeitungszeit.
Keine davon sind Chatbot-Implementierungen. Alle sind dieselbe Agentenschleife, die die Benutzeroberfläche eines anderen trägt.
Und der Teil, der nicht offen ist, bleibt fest verschlossen: das Modell. Die Schicht zu öffnen, die ohnehin zum Gemeingut werden sollte, während die abgerechnete Schicht geschlossen bleibt, ist eine gut erprobte Form – gut erprobt, weil sie funktioniert. Jedes eingebettete Harness ist ein Client mit einer angehängten Abrechnungsbeziehung.
Die Frage verschiebt sich von der Integration zur Berechtigung
Das Model Context Protocol hat bereits einen Großteil der Connector-Arbeit von kundenspezifischem Klebstoff in jeder Anwendung auf wiederverwendbare Server verlagert, die einmal gewartet werden. Ein standardmäßiges, offenes Harness bewegt den Großteil dessen, was übrig geblieben ist.
Was übrig bleibt, ist kein kleineres Problem. Es ist ein anderes, und es gehört demjenigen, der das Produkt besitzt, anstatt demjenigen, der das Modell besitzt:
- Umfang. Was darf dieser Agent tun – lesen, schreiben, ausgeben, senden, löschen – und wird das zur Laufzeit durchgesetzt und nicht in einem Prompt angefordert?
- Gates. Welche Aktionen erfordern eine Person, und sieht diese Person genug, um tatsächlich zu beurteilen, oder klickt sie auf eine Zusammenfassung zur Genehmigung?
- Nicht vertrauenswürdige Eingaben. Ein Agent, der Kunden-E-Mails, Ticketkörper, Webseiten oder Pull-Request-Kommentare liest, liest angreifergesteuerten Text. Die Abhilfe ist die Berechtigungsgrenze, nicht bessere Anweisungen.
- Abruf. Können Sie nach einem Vorfall einem Prüfer gegenüber aus einem Protokoll beantworten: „Was hat es tatsächlich getan“?
Ein offenes Harness erzwingt diese Fragen früher, was eine Verbesserung darstellt. Es beantwortet keine davon.
Wo es sich verbreitet und wo es stagniert
Die Erwartung, die mit dieser Veröffentlichung verbunden ist, ist, dass Agenten aus der Entwicklerwerkzeugkiste in Konsolen für Sicherheit, Support, Vertrieb und Marketing wandern. Vieles davon wird geschehen, und seine Form ist aus dem, was bereits funktioniert hat, vorhersehbar.
Die Implementierungen, die Bestand haben, teilen eine günstige Verifizierung. Das Codieren kam zuerst, weil Tests ein automatisches Urteil liefern. Die Steuererstellung qualifiziert sich aus demselben Grund: Eine Steuererklärung stimmt entweder zu oder nicht, und ein Praktiker überprüft die Ausnahmen und nicht das Ganze. Support-Triage, Rechnungsabgleich, Beweiserhebung – dieselbe Familie.
Diejenigen, die ins Stocken geraten, sind diejenigen, bei denen eine Person die gesamte Ausgabe lesen muss, um zu wissen, ob sie richtig ist. Dort hat der Agent Tipparbeit gespart, aber keine Arbeit, und kein Harness behebt das.
Was wir beobachten
- Portabilität. Ob Teams tatsächlich Nicht-OpenAI-Modelle über diese Schleife ausführen oder ob die Standardeinstellungen sie leise zu einem Vertriebskanal machen.
- Standard-Governance. Genehmigungsgates, Budgets und Protokollierung, die standardmäßig mitgeliefert werden, werden zum Fundament der Branche. Diejenigen, die standardmäßig ausgeschaltet sind, werden zu den Vorfallberichten der Branche.
- Wo die Standardisierung als nächstes landet. Die Tool-Exposition wurde bei MCP standardisiert. Die Ausführung wird jetzt standardisiert. Berechtigung und Prüfung sind die offensichtlichen nächsten Ebenen, und niemand hat sie beansprucht.
- Die Anzeigetafel. Wenn eine Gerüständerung zwanzig Punkte wert ist, müssen Benchmark-Tabellen beginnen, das Harness neben dem Modell zu melden, oder aufhören, als Modellergebnisse zitiert zu werden.
Die Schlagzeile ist, dass OpenAI den Kern von Codex Open Source gemacht hat. Die beständigere Veränderung ist, dass „welches Modell“ eine kleinere Frage geworden ist als letzte Woche, und „was darf es tun“ eine größere.
Häufige Fragen
- Was genau hat OpenAI veröffentlicht?
- Die Ausführungseinheit hinter Codex, im openai/codex Repository unter Apache-2.0: der codex exec Befehlszeile, der app-server-Ausführungsdienst und das Codex SDK. Die Modellgewichte wurden nicht veröffentlicht.
- Macht das Codex frei?
- Nein. Der Harness ist kostenlos nutzbar, modifizierbar und kommerziell einsetzbar. Jeder Durchlauf ruft weiterhin ein Modell über eine kostenpflichtige API auf, weshalb der Harness genau deshalb ohne Weitergabe von etwas geöffnet werden konnte.
- Wird der Gurt Modelle anderer Unternehmen ausführen?
- Die Schnittstellen sind generisch, aber die Defaults, die Kontextstrategie und die Feinabstimmung wurden für OpenAI-Modelle entwickelt. Betrachte die Portabilität über verschiedene Modelle als etwas, das du in deinem eigenen Workload messen solltest, anstatt als Garantie, die dir die Lizenz bietet.
- Was bedeutet die Angabe von 13,3 % bis 38,3 % eigentlich?
- Zwei Durchläufe desselben Modells, die sich nur in der Art unterscheiden, wie die Schleife darum gebaut wurde, erzielten auf einer Benchmark fast dreimal unterschiedliche Punktzahlen. Das ist ein starkes Argument dafür, dass Scaffolding ingenieurtechnische Aufmerksamkeit verdient. Das ist keine Garantie, dass Ihre Anwendung denselben Spielraum gewinnt, weil ein Harness, der gegen eine Benchmark optimiert ist, teilweise auf diese Benchmark abgestimmt ist.
- Was sollte ein Unternehmen vor der Einbettung eines Agents in sein Produkt prüfen?
- Vier Dinge, in der Reihenfolge: was der Agent tun darf und ob das vom Runtime-Enforcement erzwungen wird, anstatt in einem Prompt angefordert; welche Aktionen einen Menschen erfordern und ob dieser Mensch genug sieht, um zu urteilen; was passiert, wenn der Agent angreifersteuerbare Texte wie Kundene-Mails oder Ticket-Bodies liest; und ob man nachträglich aus einem Log «what did it actually do» beantworten kann.
Quellen
- Codex as a platform: build on the open agent harness — OpenAI
- openai/codex — the Codex CLI, app-server and SDK — GitHub
- OpenAI Open Sources Codex Harness Framework — Open Source For You
- 오픈AI, 코덱스 하네스 오픈소스 공개 — 솔루션뉴스
- Model Context Protocol — MCP