การวิเคราะห์: OpenAI เปิดแหล่งโค้ดของ Codex harness — อะไรคือ harness และ 'open' ครอบคลุมอะไร
ชั้นการทำงานรอบๆ โมเดลการเขียนโค้ดตอนนี้เป็น Apache-2.0. สิ่งนี้เปลี่ยนสิ่งที่ทีมสามารถฝังได้ และไม่เปลี่ยนสิ่งที่พวกเขาต้องจ่าย. มุมมองระดับผู้พัฒนาของการปล่อยเวอร์ชัน.
คำตอบโดยย่อ
อะไรคือ AI agent harness และ OpenAI จริงๆ แล้วได้เปิด-source อะไร?
A harness เป็นชั้นการทำงานรอบ ๆ โมเดล: มันถือภารกิจ จัดการบริบทในการทำงานนาน ๆ เรียกใช้เครื่องมือ สตรีมเหตุการณ์ อนุญาตการหยุดทำงาน และส่งมอบการอนุมัติให้กับมนุษย์. OpenAI ได้เผยแพร่ Codex harness ของตน — non-interactive CLI, SDK และ app-server — ภายใต้ Apache-2.0 เพื่อให้สามารถแยกและฝังในผลิตภัณฑ์เชิงพาณิชย์ได้. น้ำหนักโมเดลไม่ได้ถูกเผยแพร่; harness ยังเรียกใช้ API ที่ต้องเสียค่าใช้จ่าย ดังนั้นค่าใช้จ่ายใบอนุญาตเป็นศูนย์และค่าใช้จ่ายในการดำเนินการไม่ใช่ศูนย์.
ประเด็นสำคัญ
- ชิ้นส่วนที่ทีมส่วนใหญ่กำลังสร้างใหม่ไม่ดีคือแฮร์เนส — ไม่ใช่โมเดล — และตอนนี้มีให้ใช้งานภายใต้ใบอนุญาตแบบกว้างขวาง
- Apache-2.0 ครอบคลุมการรันโค้ด การสร้างแบบจำลอง การให้บริการแบบ Hosted inference และเครื่องหมายการค้า อยู่ภายนอกเหนือจากมัน
- OpenAI รายงานว่า ช่วงการประเมินผลเปลี่ยนแปลงเพียงอย่างเดียวของ harness ทำให้คะแนนเพิ่มจาก 13.3% เป็น 38.3%; ให้ทิศทางของการเปลี่ยนแปลงเป็นผลการค้นพบ และตัวเลขเป็นที่รายงานโดยผู้จัดจำหน่าย.
- สามารถกำหนดค่าโมเดลของบุคคลที่สามและโมเดลท้องถิ่นได้ แต่จะทำได้ผ่านรูปแบบการตอบสนอง (Responses wire format) เท่านั้น — จุดสิ้นสุดการสนทนา (Chat Completions endpoint) จะไม่สามารถแนบได้
- งบประมาณในสามชั้น: ลิขสิทธิ์ (ศูนย์), โครงสร้างพื้นฐาน (ของคุณ), ท็อเคน (ตัวเดียวที่ขยายตัวตามการใช้งาน).
ตลอดสองปีที่ผ่านมา วิศวกรรมที่น่าสนใจในเครื่องมือเขียนโค้ด AI ไม่ได้อยู่ที่ตัวโมเดล แต่อยู่ที่เลเยอร์ที่ห่อหุ้มมันอยู่: สิ่งที่ตัดสินใจว่าจะใส่อะไรลงในหน้าต่างบริบท เมื่อใดควรเรียกใช้เครื่องมือ จะทำอย่างไรเมื่อคำสั่งค้าง และเมื่อใดควรหยุดและขอความช่วยเหลือจากมนุษย์ ทุกทีมที่จริงจังได้สร้างสิ่งนี้ขึ้นมา หลายทีมสร้างมันขึ้นมาสองครั้ง เพราะความพยายามครั้งแรกไม่สามารถรองรับงานที่ใช้เวลานานได้
เมื่อวันที่ 20 สิงหาคม OpenAI ได้เปิดตัวเวอร์ชันของเลเยอร์นั้นภายใต้ใบอนุญาต Apache-2.0 การประกาศนี้ถูกนำเสนอในฐานะการเคลื่อนไหวของแพลตฟอร์ม — บริษัทภายนอกสามารถฝังเอเจนต์ลงในซอฟต์แวร์ของตนเองได้แล้ว แทนที่จะส่งผู้ใช้ไปยังหน้าต่างแชทอเนกประสงค์ สำหรับนักพัฒนา คำถามที่น่าจะเป็นประโยชน์มากกว่าคือ: มีอะไรอยู่ในกล่องบ้าง และใบอนุญาตครอบคลุมอะไรบ้าง?
สิ่งที่ฮาร์เนสทำ
อุปมาอุปไมยระหว่างเครื่องยนต์และแชสซีในการครอบคลุมนั้นถูกต้องเท่าที่ไปถึง แต่ก็ซ่อนงานที่เฉพาะเจาะจงไว้ หากถอดฮาร์เนสออก มันจะทำงานหกอย่างพร้อมกัน ซึ่งไม่มีสิ่งใดที่โมเดลทำได้ด้วยตัวเอง:
- การรักษาภารกิจ โมเดลตอบสนองต่อคำขอ ฮาร์เนสจะรักษาเป้าหมายให้มีชีวิตอยู่ตลอดคำขอหลายสิบรายการและตัดสินใจว่าเมื่อใดจะบรรลุเป้าหมาย
- การจัดการบริบท การทำงานระยะยาวเกินกว่าหน้าต่างบริบทใดๆ บางสิ่งบางอย่างต้องสรุป ละทิ้ง ดึงข้อมูลใหม่ และรักษาการให้เหตุผลข้ามขอบเขต หากทำอย่างหยาบๆ เอเจนต์จะลืมข้อจำกัดที่คุณให้ไว้เมื่อสี่สิบขั้นตอนที่แล้ว
- การกระจายเครื่องมือ การกำหนดเครื่องมือ การตรวจสอบความถูกต้องของอาร์กิวเมนต์ การดำเนินการภายใต้แซนด์บ็อกซ์ และการป้อนผลลัพธ์กลับในรูปแบบที่โมเดลสามารถดำเนินการได้
- การสตรีมเหตุการณ์ การทำงานที่ใช้เวลาหกนาทีจะต้องสามารถอ่านได้ในขณะที่เกิดขึ้น ไม่ใช่แค่ตอนจบ
- การขัดจังหวะได้ การหยุดทำงานอย่างสะอาดกลางคัน การรักษาข้อมูลสถานะ การกลับมาทำงานต่อในภายหลัง — ความแตกต่างระหว่างการสาธิตกับสิ่งที่บุคคลจะปล่อยให้ทำงาน
- การกำหนดเส้นทางการอนุมัติ การดำเนินการใดที่จะดำเนินการโดยอัตโนมัติ การดำเนินการใดที่จะหยุดเพื่อขอความช่วยเหลือจากมนุษย์ และการตัดสินใจนั้นจะถูกบันทึกไว้อย่างไร
รายการนั้นคือเหตุผลที่งานฮาร์เนสขยับตัวเลขเกณฑ์มาตรฐานได้เลย OpenAI รายงานว่าการเปลี่ยนแปลงฮาร์เนสเพียงอย่างเดียว — การรักษาการให้เหตุผลและการบีบอัดบริบท — ทำให้โมเดลจาก 13.3% เป็น 38.3% บน ARC-AGI-3 โดยลดการใช้โทเค็นลงหกเท่าจากการออกแบบฮาร์เนส ตัวเลขที่รายงานโดยผู้ขายเกี่ยวกับการเปิดตัวของผู้ขายเองสมควรได้รับการลดหย่อนตามปกติ และเกณฑ์มาตรฐานนั้นแคบ ทิศทางยังคงเป็นการค้นพบที่ควรค่าแก่การรักษา: น้ำหนักเดียวกันให้ผลลัพธ์ที่แตกต่างกันอย่างมาก ขึ้นอยู่กับกลไกที่อยู่รอบๆ และกลไกนั้นคือที่ที่การใช้ประโยชน์ทางวิศวกรรมที่เหลืออยู่
สิ่งที่ "โอเพนซอร์ส" ครอบคลุมที่นี่
การเปิดตัวนี้มีความยืดหยุ่นอย่างแท้จริง และป้ายกำกับยังคงซ่อนขอบเขตที่สำคัญสำหรับการวางแผน
Apache-2.0 บนฮาร์เนสหมายความว่าคุณสามารถแยกมัน แก้ไขมัน เก็บการแก้ไขเป็นส่วนตัว และจัดส่งผลลัพธ์ภายในผลิตภัณฑ์เชิงพาณิชย์แบบปิด — รวมถึงผลิตภัณฑ์ที่ติดฉลากขาว — โดยอยู่ภายใต้ข้อกำหนดในการอ้างอิงและแจ้งให้ทราบ ไม่มีตัวกระตุ้น copyleft ซึ่งเป็นความแตกต่างในทางปฏิบัติระหว่างสิ่งนี้กับการเปิดตัว AGPL: เลเยอร์การดำเนินการ AGPL จะบังคับให้เปิดเผยทันทีที่คุณให้บริการผ่านเครือข่าย และนั่นเพียงอย่างเดียวก็ทำให้ส่วนประกอบไม่เหมาะสมสำหรับแผนงานฉลากขาวส่วนใหญ่
สิ่งที่ใบอนุญาตไม่ครอบคลุมก็ชัดเจนเช่นกัน น้ำหนักไม่ได้ถูกเปิดเผย ฮาร์เนสเป็นโอเพน แต่ปัญญาที่มันเรียกใช้นั้นไม่ใช่ สิทธิ์เครื่องหมายการค้าไม่ได้ถูกมอบให้โดย Apache-2.0 ดังนั้นการจัดส่งผลิตภัณฑ์ที่เรียกตัวเองว่า Codex จึงเป็นคำถามที่แยกต่างหากจากการจัดส่งผลิตภัณฑ์ที่สร้างขึ้นบน Codex และใบอนุญาตที่ยืดหยุ่นบนไคลเอ็นต์ไม่ได้บอกอะไรเกี่ยวกับเงื่อนไขของบริการที่มันเชื่อมต่อ หากความแตกต่างระหว่างใบอนุญาตแบบเปิดและน้ำหนักแบบเปิดมีผลในการตรวจสอบการจัดซื้อของคุณ ควรค่าแก่การอ่าน ความหมายของป้ายกำกับจริงๆ ก่อนการตรวจสอบ ไม่ใช่ระหว่างนั้น
ข้อจำกัดที่ทีมส่วนใหญ่จะเจอเป็นอันดับแรก
ฮาร์เนสไม่ได้ถูกเชื่อมติดกับผู้ให้บริการรายเดียว ผู้ให้บริการแบบกำหนดเองจะชี้ไปที่จุดปลายที่เข้ากันได้ — API ของคู่แข่ง เกตเวย์ หรือโมเดลที่ทำงานบนฮาร์ดแวร์ของคุณเอง
การอ่านเชิงกลยุทธ์ของข้อจำกัดนั้นตรงไปตรงมา การพกพามีอยู่จริง และมันทำงานผ่านรูปแบบการเชื่อมต่อที่ผู้ขายควบคุมและได้เปลี่ยนแปลงไปแล้วครั้งหนึ่งแล้ว ใครก็ตามที่ปฏิบัติต่อสิ่งนี้เป็นการประกันต่อการถูกล็อคอินควรสมมติว่า shim เป็นส่วนประกอบที่ได้รับการบำรุงรักษา ไม่ใช่ต้นทุนครั้งเดียว
ค่าใช้จ่าย
สามเลเยอร์ และมีเพียงเลเยอร์เดียวที่ปรับขนาดได้:
| เลเยอร์ | ค่าใช้จ่าย | หมายเหตุ |
|---|---|---|
| ใบอนุญาตฮาร์เนส | ศูนย์ | Apache-2.0 แยกและฝังได้อย่างอิสระ |
| โครงสร้างพื้นฐาน | ของคุณ | ไบนารี Rust และแพ็คเกจ npm มันทำงานในที่ที่คุณรันสิ่งต่างๆ อยู่แล้ว |
| โทเค็นโมเดล | คิดตามมิเตอร์ | ไม่เปลี่ยนแปลงโดยการเปิดตัวนี้ ฮาร์เนสทำการเรียก; บางสิ่งจะถูกเรียกเก็บเงินสำหรับสิ่งเหล่านั้น |
อัตราที่เผยแพร่สำหรับสายผลิตภัณฑ์ปัจจุบันของ OpenAI อยู่ที่ประมาณ 5 ดอลลาร์ต่ออินพุตโทเค็นหนึ่งล้านรายการ และ 30 ดอลลาร์ต่อเอาต์พุตหนึ่งล้านรายการสำหรับระดับสูงสุด โดยอินพุตที่แคชมีราคาถูกกว่าหนึ่งเท่า และระดับกลางและระดับเบาต่ำกว่านั้นมาก ตัวเลขเหล่านั้นเป็นเพียงครึ่งหนึ่งของการคำนวณ การทำงานของเอเจนต์ไม่ใช่หนึ่งคำขอ — มันคือหลายสิบรายการ แต่ละรายการมีบริบทสะสม ซึ่งเป็นรูปแบบที่ทำให้ ราคาต่อหน่วยลดลงในขณะที่บิลเพิ่มขึ้น
สองผลที่ตามมาสำหรับใครก็ตามที่กำลังจัดทำงบประมาณสำหรับการใช้งาน: ประการแรก อัตราการตีของแคชบนส่วนหน้าคงที่ จะเป็นตัวกำหนดบิลส่วนใหญ่ ฮาร์เนสที่สับเปลี่ยนส่วนบนของพรอมต์ระหว่างเทิร์นสามารถเพิ่มต้นทุนเป็นหลายเท่าได้อย่างเงียบๆ โดยไม่ทำให้คำขอใดล้มเหลว วัดผลก่อนที่จะประมาณการจากตารางอัตรา ประการที่สอง เส้นทางที่คิดตามจำนวนที่นั่งกำลังแคบลง ไม่ใช่กว้างขึ้น — ที่นั่ง Codex ไม่พร้อมให้บริการสำหรับพื้นที่ทำงานธุรกิจใหม่ตั้งแต่ 24 มิถุนายน 2026 ซึ่งทำให้คีย์ API เป็นเส้นทางที่ใช้งานได้จริงสำหรับทีมส่วนใหญ่ที่เริ่มต้นตอนนี้
ก่อนที่คุณจะฝังมัน
ฮาร์เนสจะสืบทอดสิทธิ์ของคุณ เช็คลิสต์ที่สำคัญนั้นสั้นและส่วนใหญ่ไม่เกี่ยวกับโมเดล:
- ท่าทีของแซนด์บ็อกซ์ การอ่านอย่างเดียว การเขียนพื้นที่ทำงาน และการเข้าถึงเต็มรูปแบบ มีรัศมีระเบิดที่แตกต่างกันอย่างมีความหมาย เลือกที่แคบที่สุดที่งานต้องการจริงๆ
- นโยบายการอนุมัติ การทำให้การอนุมัติเป็นอัตโนมัติคือจุดที่เอเจนต์หยุดการตรวจสอบได้ ตัดสินใจว่าการดำเนินการประเภทใดที่ไม่เคยเป็นอัตโนมัติ
- การฉีดพรอมต์ สิ่งใดก็ตามที่เอเจนต์อ่านอาจมีคำแนะนำที่มุ่งเป้าไปที่มัน การป้องกันคือชุดสิทธิ์ที่เล็กลง ไม่ใช่พรอมต์ระบบที่ดีกว่า
- เส้นทางการตรวจสอบ หากเอเจนต์เขียนไปยังที่เก็บข้อมูลที่ใช้ร่วมกันหรือข้อมูลของลูกค้า บันทึกสิ่งที่มันทำและมนุษย์คนใดที่อนุญาตจะต้องอยู่รอดเซสชัน
- ภาระผูกพันในการอ้างอิง Apache-2.0 กำหนดให้ไฟล์แจ้งต้องเดินทางไปพร้อมกับผลิตภัณฑ์ที่ดัดแปลง รวมถึงผลิตภัณฑ์ที่ติดฉลากขาวด้วย
ที่นี่อยู่ที่ไหน
GitHub, JetBrains และ Cisco ได้ฝัง Codex ไว้ในผลิตภัณฑ์ของตนเองแล้ว และบริษัทบริการด้านภาษีของสหรัฐฯ รายงานว่าประมวลผลการยื่นเอกสาร 7,000 รายการ โดยใช้เวลาเตรียมการน้อยลงประมาณหนึ่งในสาม รูปแบบในการใช้งานเหล่านั้นเหมือนกัน: เอเจนต์ปรากฏขึ้นภายในซอฟต์แวร์ที่ผู้คนใช้เป็นประจำ แทนที่จะอยู่ในหน้าต่างแชทแยกต่างหาก นั่นคือข้อโต้แย้งแพลตฟอร์มที่แท้จริง และไม่ได้จำกัดอยู่แค่การเขียนโค้ด — เลเยอร์การดำเนินการเดียวกันนี้ใช้ได้กับการคัดกรองความปลอดภัย การสนับสนุน การขาย และการดำเนินงานด้านการตลาด ซึ่งเป็นเหตุผลว่าทำไมการนำไปใช้ที่น่าสนใจในช่วงปีหน้าจึงน่าจะอยู่ในแผนกที่ไม่เคยเปิดเทอร์มินัลเลย
สำหรับทีมวิศวกรรม คำถามระยะสั้นนั้นเป็นเรื่องธรรมดามากขึ้น คุณเกือบจะแน่ใจว่ามีเวอร์ชันของลูปนี้ที่สร้างขึ้นเองอยู่ที่ไหนสักแห่งในสแต็กของคุณ เขียนขึ้นภายใต้กำหนดเวลา ตอนนี้ควรค่าแก่การถามว่าควรจะเป็นของคุณต่อไปหรือไม่
คำถามที่พบบ่อย
- การเปิดซอร์สโค้ดของฮาร์เนสทำให้ Codex สามารถใช้งานได้ฟรีหรือไม่?
- ไม่. แฮร์สซ์สามารถคัดลอก, แก้ไขและฝังได้ ทุกการรันยังคงส่งโทเคนไปยังโมเดลที่คิดค่าโทเคน ไม่ว่าจะเป็น API ที่เป็นโฮสต์หรืออุปกรณ์ที่คุณดำเนินการเอง
- เครื่องมือนี้สามารถขับเคลื่อนโมเดลที่ไม่ใช่ของ OpenAI ได้หรือไม่?
- ใช่ ผ่านรายการผู้ให้บริการโมเดลแบบกำหนดเองที่ชี้ไปยังจุดปลายใดๆ ที่รองรับรูปแบบการสื่อสาร Responses รวมถึงเซิร์ฟเวอร์ภายใน การรองรับรูปแบบ Chat Completions แบบเก่าถูกลบออกในเดือนกุมภาพันธ์ 2026 ดังนั้นเกตเวย์ที่เข้ากันได้กับ OpenAI จำนวนมากจึงต้องการตัวแปล
- Apache-2.0 อนุญาตอะไรที่สัญญาอนุญาตแบบ copyleft จะไม่ยอมให้ทำ?
- คุณสามารถแยกโค้ด, แก้ไข, เก็บการเปลี่ยนแปลงส่วนตัว และส่งมันไปใช้ในผลิตภัณฑ์เชิงพาณิชย์ที่ปิดหรือมีการตีตราใหม่, โดยมีข้อกำหนดการให้เครดิตและแจ้งเตือน แต่ไม่มีข้อกำหนดให้เผยแหล่งที่มาของโค้ด.
- สายรัดเป็นสิ่งเดียวกับเฟรมเวิร์กเอเจนต์หรือไม่?
- ทับซ้อนกันแต่ไม่เหมือนกัน เฟรมเวิร์กส่วนใหญ่อธิบายวิธีการจัดลำดับขั้นตอนต่างๆ ฮาร์เนสคือรันไทม์ที่ดำเนินการจริง — การจัดการบริบท การกระจายเครื่องมือ การสตรีม การขัดจังหวะ การอนุมัติ และสถานะเซสชัน
แหล่งข้อมูล
- Codex — repository and licence — OpenAI
- Codex as a platform: build on the open agent harness — OpenAI
- Advanced configuration — custom model providers — OpenAI
- API pricing — OpenAI