การวิเคราะห์: โอเพ่นเอไอ เผยแพร่ชุดเครื่องมือแบบเปิดแหล่งที่มา, ไม่ใช่โมเดล — และนั่นคือกลยุทธ์
ชั้นการทำงานของ Codex ปัจจุบันใช้ Apache-2.0. การปล่อยครั้งนี้ทำให้ผลิตภัณฑ์เอเจนท์กลายเป็นส่วนประกอบที่ฝังได้ และย้ายคำถามที่น่าสนใจด้านวิศวกรรมจากโพรมต์ไปยังวงจรรอบ ๆ มัน.
คำตอบโดยย่อ
อะไรคือ AI agent harness และทำไมการ open-sourcing ของ Codex's harness ของ OpenAI จึงสำคัญ?
ชุดควบคุมเป็นโค้ดรอบ ๆ โมเดล: มันประกอบรวมบริบท, รันลูปการเรียกเครื่องมือ, สตรีมเหตุการณ์, บีบอัดเซสชันยาว, และเก็บการกระทำที่ไม่สามารถยกเลิกไว้ภายใต้การอนุมัติของมนุษย์ OpenAI ได้ปล่อยชุดควบคุมของ Codex — codex exec, แอปพลิเคชันเซิร์ฟเวอร์และ SDK — ภายใต้ใบอนุญาต Apache-2.0 ดังนั้นบริษัทใด ๆ สามารถฝังลูปตัวแทนเดียวกันนี้ในซอฟต์แวร์ของตนเองได้ พร้อมทั้งยังต้องจ่ายค่าโมเดลที่อยู่เบื้องหลัง
ประเด็นสำคัญ
- ชั้นวาง — ไม่ใช่โมเดล — เป็นชั้นที่ทีมส่วนใหญ่กำลังสร้างใหม่ได้ไม่ดี. โอเพ่นเอไอทำให้มาตรฐานและให้ไปภายใต้ใบอนุญาตแบบกว้างขวาง.
- OpenAI รายงานว่าโมเดลเดียวกันนี้ทำให้คะแนน ARC-AGI-3 เพิ่มจาก 13.3% เป็น 38.3% เพียงแค่การเปลี่ยนแฮนด์ช์เท่านั้น. อ่านสิ่งนี้เป็นหลักฐานว่าการสร้างโครงสร้างเป็นตัวแปรระดับแรก ไม่ใช่ผลลัพธ์ของโมเดล.
- Apache-2.0 เป็นการตัดสินใจของผลิตภัณฑ์ หากใช้สัญญาอนุญาตแบบ copyleft จะขวางการฝังตัว — Cisco, GitHub, JetBrains — ที่การปล่อยออกแบบมีขึ้นเพื่อให้เป็นไปได้.
- โมเดลล์ยังคงปิดอยู่ การเปิดเผยชั้นที่จะถูกทำให้เป็นสินค้าเป็นอย่างอื่นอยู่แล้ว แม้ส่วนที่วัดปริมาณจะยังคงปิดอยู่ เป็นรูปแบบที่ตั้งใจและคุ้นเคย
- การฝังตัวเอเจนต์ในซอฟต์แวร์ธุรกิจทำให้คำถามที่ยากย้ายจากการบูรณาการไปยังการอนุญาต: สิ่งนี้ได้รับอนุญาตให้ทำอะไร และใครเป็นผู้อนุญาต?
มีเรื่องเล่าเวอร์ชันหนึ่งที่อ่านเหมือนการเปิดตัวโอเพนซอร์สตามปกติ และอีกเวอร์ชันที่อ่านเหมือน OpenAI กำลังบอกตลาดว่ามูลค่าที่แท้จริงของเอเจนต์อยู่ที่ใด เวอร์ชันหลังใกล้เคียงความจริงมากกว่า
เมื่อวันที่ 20 สิงหาคม บริษัทได้เผยแพร่กลไกเบื้องหลัง Codex — คำสั่ง codex exec ในบรรทัดคำสั่ง, บริการประมวลผล app-server, และ Codex SDK — ภายใต้ใบอนุญาต Apache-2.0 ในที่เก็บ openai/codex โมเดลไม่ได้ถูกย้ายไปไหน ทุกอย่างรอบๆ โมเดลต่างหากที่ถูกย้าย
Harness คือส่วนที่ไม่มีใครสาธิต
ผู้ขายสาธิตโมเดล ทีมงานส่งมอบ Harness
Harness คือโค้ดที่เปลี่ยนการเติมข้อความเป็นงานที่สำเร็จ มันตัดสินใจว่าบริบทใดที่โมเดลจะเห็นในเทิร์นนี้ ประมวลผลการเรียกใช้เครื่องมือที่โมเดลร้องขอ สตรีมผลลัพธ์กลับมาเมื่อเกิดขึ้น ป้องกันไม่ให้เซสชันยาวเกินขอบเขตหน้าต่าง อนุญาตให้บุคคลขัดจังหวะระหว่างการทำงาน และเก็บการกระทำที่แก้ไขไม่ได้ไว้เบื้องหลังประตูอนุมัติ
| โมเดลตัดสินใจ | Harness ตัดสินใจ |
|---|---|
| ขั้นตอนต่อไปควรเป็นอะไร | โมเดลสามารถมองเห็นอะไรได้บ้างขณะตัดสินใจ |
| จะเรียกใช้เครื่องมือใด | การเรียกใช้นั้นได้รับอนุญาตหรือไม่ และจะเกิดอะไรขึ้นเมื่อล้มเหลว |
| เมื่อเสร็จสิ้น | เมื่อใดควรหยุดอยู่ดี — ขั้นตอน, เวลาจริง, ค่าใช้จ่าย |
| ไม่มีผลกระทบต่อผลที่ตามมา | บุคคลจะถูกขอให้อนุมัติอะไร และจะบันทึกอะไรไว้ |
ใครก็ตามที่นำต้นแบบเอเจนต์ไปใช้งานจริงได้เขียนโค้ดเวอร์ชันนี้ขึ้นมาแล้ว มักจะเขียนสองครั้ง และมักจะเขียนได้ไม่ดีในครั้งแรก นั่นคือสิ่งที่ OpenAI ได้ทำให้เป็นมาตรฐานและแจกจ่ายให้แล้ว
ถ้าโมเดลคือเครื่องยนต์ Harness คือโครงรถ เกียร์ และเบรก ไม่มีใครซื้อรถโดยเปรียบเทียบเฉพาะเครื่องยนต์ และการจัดซื้อเอเจนต์ในช่วงสองปีที่ผ่านมาก็เป็นเช่นนั้นเกือบทั้งหมด
ตัวเลขที่ทุกคนจะอ้างถึง
OpenAI รายงานว่าการเปลี่ยนแปลง Harness เพียงอย่างเดียว — การรักษาการให้เหตุผลข้ามขั้นตอนและการบีบอัดบริบท — ทำให้โมเดลเดียวกันมีประสิทธิภาพจาก 13.3% เป็น 38.3% บน ARC-AGI-3 พร้อมกับการลดการใช้โทเค็นลงประมาณหกเท่า
เป็นตัวเลขที่น่าประทับใจ และควรจะแม่นยำเกี่ยวกับสิ่งที่มันบอกและไม่บอก
สิ่งที่มันบอก: โครงสร้างเป็นตัวแปรชั้นหนึ่ง ทีมที่ทำการวัดประสิทธิภาพโมเดลสองตัวผ่าน Harness ของตนเองกำลังวัดสามสิ่ง — โมเดลสองตัวและโครงสร้างหนึ่งตัว — และส่วนใหญ่กำลังรายงานเกี่ยวกับโครงสร้าง คะแนนโมเดลที่เผยแพร่โดยไม่มี Harness ที่เผยแพร่ จากหลักฐานนี้ แทบจะอ่านไม่ออก
สิ่งที่มันไม่ได้บอก: ว่าส่วนต่างเดียวกันนั้นรออยู่ในผลิตภัณฑ์ของคุณ Harness ที่ปรับแต่งให้เข้ากับเกณฑ์มาตรฐานนั้น ส่วนหนึ่งถูกปรับแต่งให้เข้ากับเกณฑ์มาตรฐานนั้น และชุดปริศนาการให้เหตุผลไม่ใช่คิวการกระทบยอด
การอ่านที่มีประโยชน์อยู่ระหว่างทั้งสอง หากคุณได้รับผลลัพธ์ที่ไม่ดีจากโมเดลแนวหน้าในวันนี้ สิ่งที่ควรคิดก่อนคือลูปของคุณผิดก่อนที่โมเดลของคุณจะผิด
ใบอนุญาตคือการประกาศ
Apache-2.0 ไม่ใช่เชิงอรรถที่นี่ มันคือสาระสำคัญ
ใบอนุญาตแบบ Copyleft จะทำให้ Harness นี้ไม่สามารถใช้งานได้สำหรับลูกค้าที่เปิดตัวนี้สร้างขึ้นมาโดยเฉพาะ — บริษัทที่ต้องการคอมไพล์เป็นผลิตภัณฑ์เชิงพาณิชย์โดยไม่ต้องเผยแพร่สิ่งที่พวกเขาห่อหุ้มไว้ Cisco รัน Codex SDK ภายใน App Builder ซึ่งเป็นส่วนหนึ่งของ Cisco Cloud Control GitHub และ JetBrains วางเอเจนต์ไว้ภายในโปรแกรมแก้ไขที่นักพัฒนาเปิดอยู่แล้ว แทนที่จะอยู่ในหน้าต่างแยกต่างหาก Thrive Holdings และ Crete สร้างเวิร์กโฟลว์การเตรียมภาษีโดยมีผู้เชี่ยวชาญตรวจสอบอยู่ภายในลูป การรายงานเกี่ยวกับการเปิดตัวนี้ระบุว่ามีการยื่นเอกสารประมาณ 7,000 ฉบับ โดยเวลาเตรียมการลดลงประมาณหนึ่งในสาม
เหล่านี้ไม่ใช่การปรับใช้แชทบอท ทั้งหมดนี้คือลูปเอเจนต์เดียวกันที่สวมอินเทอร์เฟซของผู้อื่น
และส่วนที่ยังคงปิดสนิทคือโมเดล การเปิดเลเยอร์ที่จะกลายเป็นสินค้าโภคภัณฑ์อยู่แล้ว ในขณะที่เลเยอร์ที่คิดค่าบริการยังคงปิดอยู่ เป็นรูปแบบที่คุ้นเคย — คุ้นเคยเพราะมันได้ผล Harness ที่ฝังไว้แต่ละอันคือไคลเอนต์ที่มีความสัมพันธ์ในการเรียกเก็บเงินแนบมาด้วย
คำถามเปลี่ยนจากการรวมระบบเป็นการอนุญาต
Model Context Protocol ได้ย้ายงานส่วนใหญ่ของการเชื่อมต่อจากกาวที่สร้างขึ้นเองในทุกแอปพลิเคชันไปยังเซิร์ฟเวอร์ที่นำกลับมาใช้ใหม่ได้ซึ่งดูแลรักษาเพียงครั้งเดียว Harness แบบเปิดที่เป็นมาตรฐานจะย้ายส่วนที่เหลือส่วนใหญ่ไป
สิ่งที่เหลืออยู่ไม่ใช่ปัญหาที่เล็กกว่า มันเป็นปัญหาที่แตกต่างออกไป และเป็นของใครก็ตามที่เป็นเจ้าของผลิตภัณฑ์ แทนที่จะเป็นของใครก็ตามที่เป็นเจ้าของโมเดล:
- ขอบเขต เอเจนต์นี้ได้รับอนุญาตให้ทำอะไร — อ่าน, เขียน, ใช้จ่าย, ส่ง, ลบ — และสิ่งนั้นถูกบังคับใช้ในขณะทำงาน แทนที่จะร้องขอในพรอมต์หรือไม่?
- ประตู การดำเนินการใดบ้างที่ต้องใช้บุคคล และบุคคลนั้นเห็นเพียงพอที่จะตัดสินใจได้จริงหรือไม่ หรือพวกเขากำลังคลิกอนุมัติบนสรุป?
- อินพุตที่ไม่น่าเชื่อถือ เอเจนต์ที่อ่านอีเมลลูกค้า เนื้อหาตั๋ว หน้าเว็บ หรือความคิดเห็นของ pull request กำลังอ่านข้อความที่ผู้โจมตีควบคุมได้ การบรรเทาคือขอบเขตการอนุญาต ไม่ใช่คำแนะนำที่ดีกว่า
- การเรียกคืน หลังเกิดเหตุการณ์ คุณสามารถตอบคำถาม «มันทำอะไรไปจริงๆ» จากบันทึก ต่อหน้าผู้ตรวจสอบได้หรือไม่?
Harness แบบเปิดบังคับให้คำถามเหล่านี้เกิดขึ้นเร็วขึ้น ซึ่งเป็นการปรับปรุง มันไม่ได้ตอบคำถามใดๆ เหล่านี้
ที่ที่มันแพร่กระจาย และที่ที่มันหยุดนิ่ง
ความคาดหวังที่แนบมากับการเปิดตัวนี้คือเอเจนต์จะย้ายออกจากเครื่องมือสำหรับนักพัฒนาไปสู่คอนโซลด้านความปลอดภัย การสนับสนุน การขาย และการตลาด ส่วนใหญ่จะเกิดขึ้น และรูปร่างของมันสามารถคาดการณ์ได้จากสิ่งที่เคยได้ผลมาแล้ว
การปรับใช้ที่คงอยู่จะมีการตรวจสอบที่ถูกกว่า การเขียนโค้ดไปก่อนเพราะการทดสอบให้ผลลัพธ์อัตโนมัติ การเตรียมภาษีมีคุณสมบัติเดียวกันด้วยเหตุผลเดียวกัน: การคืนภาษีจะกระทบยอดหรือไม่ก็ไม่ และผู้เชี่ยวชาญจะตรวจสอบข้อยกเว้นแทนที่จะเป็นทั้งหมด การคัดกรองการสนับสนุน การกระทบยอดใบแจ้งหนี้ การรวบรวมหลักฐาน — ตระกูลเดียวกัน ส่วนที่หยุดนิ่งคือส่วนที่บุคคลต้องอ่านผลลัพธ์ทั้งหมดเพื่อทราบว่าถูกต้องหรือไม่ ที่นั่นเอเจนต์ช่วยประหยัดการพิมพ์ ไม่ใช่งาน และไม่มี Harness ใดที่จะแก้ไขสิ่งนั้นได้
สิ่งที่เรากำลังจับตาดู
- การพกพา ว่าทีมต่างๆ จะรันโมเดลที่ไม่ใช่ OpenAI ผ่านลูปนี้จริงหรือไม่ หรือค่าเริ่มต้นจะทำให้มันกลายเป็นช่องทางการจัดจำหน่ายอย่างเงียบๆ
- ค่าเริ่มต้นของการกำกับดูแล ประตูอนุมัติ งบประมาณ และการบันทึกที่เปิดใช้งานโดยค่าเริ่มต้นจะกลายเป็นพื้นฐานของอุตสาหกรรม สิ่งที่ปิดใช้งานโดยค่าเริ่มต้นจะกลายเป็นรายงานอุบัติเหตุของอุตสาหกรรม
- มาตรฐานจะไปถึงที่ไหนต่อไป การเปิดเผยเครื่องมือถูกทำให้เป็นมาตรฐานที่ MCP การประมวลผลกำลังถูกทำให้เป็นมาตรฐานในขณะนี้ การอนุญาตและการตรวจสอบเป็นเลเยอร์ถัดไปที่ชัดเจน และยังไม่มีใครอ้างสิทธิ์
- กระดานคะแนน หากการเปลี่ยนแปลงโครงสร้างมีค่า 25 คะแนน ตารางเกณฑ์มาตรฐานต้องเริ่มรายงาน Harness ควบคู่ไปกับโมเดล หรือหยุดถูกอ้างว่าเป็นผลลัพธ์ของโมเดล
หัวข้อข่าวคือ OpenAI ได้เปิดซอร์สโค้ดหลักของ Codex การเปลี่ยนแปลงที่ยั่งยืนกว่าคือ «โมเดลใด» กลายเป็นคำถามที่เล็กกว่าเมื่อสัปดาห์ที่แล้ว และ «มันได้รับอนุญาตให้ทำอะไร» กลายเป็นคำถามที่ใหญ่ขึ้น
คำถามที่พบบ่อย
- OpenAI ได้เปิดตัวอะไรออกมากันแน่?
- กลไกการทำงานของ Codex อยู่ในคลังข้อมูล openai/codex ภายใต้ใบอนุญาต Apache-2.0: คำสั่ง codex exec command line, บริการการทำงานของแอปพลิเคชันเซิร์ฟเวอร์, และ Codex SDK. น้ำหนักของโมเดลไม่ได้ถูกเผยแพร่.
- สิ่งนี้ทำให้ Codex ฟรีหรือ?
- ไม่. แฮร์เนสสามารถใช้งานได้ฟรี ทำการแก้ไขและฝังเชิงพาณิชย์ได้ ทุกการรันยังเรียกโมเดลผ่านอินเทอร์เฟซการประยุกต์ที่ต้องชำระเงิน ซึ่งเป็นเหตุผลที่ทำให้แฮร์เนสสามารถเปิดเผยได้โดยไม่ต้องให้ข้อมูลอะไรเลย
- เครื่องมือจะรันโมเดลของบริษัทอื่นๆ ได้หรือไม่?
- อินเทอร์เฟซเป็นแบบจำลองทั่วไป แต่ค่าเริ่มต้น กลยุทธ์บริบทและการปรับแต่งถูกสร้างขึ้นจากโมเดลของ โอเพนเอไอ. พิจารณาการพกพาโมเดลข้ามแบบเป็นสิ่งที่ต้องวัดในงานของคุณเอง แทนที่จะถือเป็นข้อรับประกันที่สัญญาให้คุณ
- คำว่า 13.3% ถึง 38.3% ที่แสดงหมายถึงอะไรจริงๆ?
- สองรอบการรันโมเดลเดียวกัน ที่แตกต่างเพียงวิธีการสร้างลูป์รอบ ๆ มันนี้ ได้คะแนนแตกต่างกันถึงสามเท่าในแบนช์มาร์กหนึ่ง เป็นข้อโต้แย้งที่แข็งแรงว่าการสร้างโครงสร้าง (scaffolding) ควรได้รับความสนใจในด้านวิศวกรรม ไม่ใช่คำมั่นสัญญาว่าอุปกรณ์ของคุณจะได้รับขอบเขตเดียวกัน เนื่องจากการตั้งค่าชุดทดสอบให้เหมาะกับแบนช์มาร์ก ทำให้ส่วนหนึ่งของมันถูกตั้งค่าไปตามแบนช์มาร์กนั้น
- บริษัทควรตรวจสอบอะไรบ้างก่อนที่จะนำเอเจนต์มาผสานเข้ากับผลิตภัณฑ์ของตน?
- สี่สิ่ง, ในลำดับ: สิ่งที่เอเจนต์ได้รับอนุญาตให้ทำและว่ามันถูกบังคับใช้โดยรันไทม์แทนที่จะถูกขอในคำสั่ง; ซึ่งการกระทำใดต้องการคนและว่าคนนั้นเห็นว่าพอเพียงเพื่อตัดสิน; สิ่งที่เกิดขึ้นเมื่อเอเจนต์อ่านข้อความที่ควบคุมโดยผู้โจมตีเช่นอีเมลลูกค้าหรือเนื้อหาตั๋ว; และว่าคุณสามารถตอบ «what did it actually do» จากลอกรายงานหลังได้หรือไม่.
แหล่งข้อมูล
- Codex as a platform: build on the open agent harness — OpenAI
- openai/codex — the Codex CLI, app-server and SDK — GitHub
- OpenAI Open Sources Codex Harness Framework — Open Source For You
- 오픈AI, 코덱스 하네스 오픈소스 공개 — 솔루션뉴스
- Model Context Protocol — MCP