Skip to content
เอเจนต์และระบบอัตโนมัติ

การวิเคราะห์: โอเพ่นเอไอ เผยแพร่ชุดเครื่องมือแบบเปิดแหล่งที่มา, ไม่ใช่โมเดล — และนั่นคือกลยุทธ์

ชั้นการทำงานของ Codex ปัจจุบันใช้ Apache-2.0. การปล่อยครั้งนี้ทำให้ผลิตภัณฑ์เอเจนท์กลายเป็นส่วนประกอบที่ฝังได้ และย้ายคำถามที่น่าสนใจด้านวิศวกรรมจากโพรมต์ไปยังวงจรรอบ ๆ มัน.

โดย DigitalNeuron Deskอ่าน 1 นาที

คำตอบโดยย่อ

อะไรคือ AI agent harness และทำไมการ open-sourcing ของ Codex's harness ของ OpenAI จึงสำคัญ?

ชุดควบคุมเป็นโค้ดรอบ ๆ โมเดล: มันประกอบรวมบริบท, รันลูปการเรียกเครื่องมือ, สตรีมเหตุการณ์, บีบอัดเซสชันยาว, และเก็บการกระทำที่ไม่สามารถยกเลิกไว้ภายใต้การอนุมัติของมนุษย์ OpenAI ได้ปล่อยชุดควบคุมของ Codex — codex exec, แอปพลิเคชันเซิร์ฟเวอร์และ SDK — ภายใต้ใบอนุญาต Apache-2.0 ดังนั้นบริษัทใด ๆ สามารถฝังลูปตัวแทนเดียวกันนี้ในซอฟต์แวร์ของตนเองได้ พร้อมทั้งยังต้องจ่ายค่าโมเดลที่อยู่เบื้องหลัง

ประเด็นสำคัญ

  • ชั้นวาง — ไม่ใช่โมเดล — เป็นชั้นที่ทีมส่วนใหญ่กำลังสร้างใหม่ได้ไม่ดี. โอเพ่นเอไอทำให้มาตรฐานและให้ไปภายใต้ใบอนุญาตแบบกว้างขวาง.
  • OpenAI รายงานว่าโมเดลเดียวกันนี้ทำให้คะแนน ARC-AGI-3 เพิ่มจาก 13.3% เป็น 38.3% เพียงแค่การเปลี่ยนแฮนด์ช์เท่านั้น. อ่านสิ่งนี้เป็นหลักฐานว่าการสร้างโครงสร้างเป็นตัวแปรระดับแรก ไม่ใช่ผลลัพธ์ของโมเดล.
  • Apache-2.0 เป็นการตัดสินใจของผลิตภัณฑ์ หากใช้สัญญาอนุญาตแบบ copyleft จะขวางการฝังตัว — Cisco, GitHub, JetBrains — ที่การปล่อยออกแบบมีขึ้นเพื่อให้เป็นไปได้.
  • โมเดลล์ยังคงปิดอยู่ การเปิดเผยชั้นที่จะถูกทำให้เป็นสินค้าเป็นอย่างอื่นอยู่แล้ว แม้ส่วนที่วัดปริมาณจะยังคงปิดอยู่ เป็นรูปแบบที่ตั้งใจและคุ้นเคย
  • การฝังตัวเอเจนต์ในซอฟต์แวร์ธุรกิจทำให้คำถามที่ยากย้ายจากการบูรณาการไปยังการอนุญาต: สิ่งนี้ได้รับอนุญาตให้ทำอะไร และใครเป็นผู้อนุญาต?

มีเรื่องเล่าเวอร์ชันหนึ่งที่อ่านเหมือนการเปิดตัวโอเพนซอร์สตามปกติ และอีกเวอร์ชันที่อ่านเหมือน OpenAI กำลังบอกตลาดว่ามูลค่าที่แท้จริงของเอเจนต์อยู่ที่ใด เวอร์ชันหลังใกล้เคียงความจริงมากกว่า

เมื่อวันที่ 20 สิงหาคม บริษัทได้เผยแพร่กลไกเบื้องหลัง Codex — คำสั่ง codex exec ในบรรทัดคำสั่ง, บริการประมวลผล app-server, และ Codex SDK — ภายใต้ใบอนุญาต Apache-2.0 ในที่เก็บ openai/codex โมเดลไม่ได้ถูกย้ายไปไหน ทุกอย่างรอบๆ โมเดลต่างหากที่ถูกย้าย

Harness คือส่วนที่ไม่มีใครสาธิต

ผู้ขายสาธิตโมเดล ทีมงานส่งมอบ Harness

Harness คือโค้ดที่เปลี่ยนการเติมข้อความเป็นงานที่สำเร็จ มันตัดสินใจว่าบริบทใดที่โมเดลจะเห็นในเทิร์นนี้ ประมวลผลการเรียกใช้เครื่องมือที่โมเดลร้องขอ สตรีมผลลัพธ์กลับมาเมื่อเกิดขึ้น ป้องกันไม่ให้เซสชันยาวเกินขอบเขตหน้าต่าง อนุญาตให้บุคคลขัดจังหวะระหว่างการทำงาน และเก็บการกระทำที่แก้ไขไม่ได้ไว้เบื้องหลังประตูอนุมัติ

โมเดลตัดสินใจHarness ตัดสินใจ
ขั้นตอนต่อไปควรเป็นอะไรโมเดลสามารถมองเห็นอะไรได้บ้างขณะตัดสินใจ
จะเรียกใช้เครื่องมือใดการเรียกใช้นั้นได้รับอนุญาตหรือไม่ และจะเกิดอะไรขึ้นเมื่อล้มเหลว
เมื่อเสร็จสิ้นเมื่อใดควรหยุดอยู่ดี — ขั้นตอน, เวลาจริง, ค่าใช้จ่าย
ไม่มีผลกระทบต่อผลที่ตามมาบุคคลจะถูกขอให้อนุมัติอะไร และจะบันทึกอะไรไว้

ใครก็ตามที่นำต้นแบบเอเจนต์ไปใช้งานจริงได้เขียนโค้ดเวอร์ชันนี้ขึ้นมาแล้ว มักจะเขียนสองครั้ง และมักจะเขียนได้ไม่ดีในครั้งแรก นั่นคือสิ่งที่ OpenAI ได้ทำให้เป็นมาตรฐานและแจกจ่ายให้แล้ว

ถ้าโมเดลคือเครื่องยนต์ Harness คือโครงรถ เกียร์ และเบรก ไม่มีใครซื้อรถโดยเปรียบเทียบเฉพาะเครื่องยนต์ และการจัดซื้อเอเจนต์ในช่วงสองปีที่ผ่านมาก็เป็นเช่นนั้นเกือบทั้งหมด

ตัวเลขที่ทุกคนจะอ้างถึง

OpenAI รายงานว่าการเปลี่ยนแปลง Harness เพียงอย่างเดียว — การรักษาการให้เหตุผลข้ามขั้นตอนและการบีบอัดบริบท — ทำให้โมเดลเดียวกันมีประสิทธิภาพจาก 13.3% เป็น 38.3% บน ARC-AGI-3 พร้อมกับการลดการใช้โทเค็นลงประมาณหกเท่า

เป็นตัวเลขที่น่าประทับใจ และควรจะแม่นยำเกี่ยวกับสิ่งที่มันบอกและไม่บอก

สิ่งที่มันบอก: โครงสร้างเป็นตัวแปรชั้นหนึ่ง ทีมที่ทำการวัดประสิทธิภาพโมเดลสองตัวผ่าน Harness ของตนเองกำลังวัดสามสิ่ง — โมเดลสองตัวและโครงสร้างหนึ่งตัว — และส่วนใหญ่กำลังรายงานเกี่ยวกับโครงสร้าง คะแนนโมเดลที่เผยแพร่โดยไม่มี Harness ที่เผยแพร่ จากหลักฐานนี้ แทบจะอ่านไม่ออก

สิ่งที่มันไม่ได้บอก: ว่าส่วนต่างเดียวกันนั้นรออยู่ในผลิตภัณฑ์ของคุณ Harness ที่ปรับแต่งให้เข้ากับเกณฑ์มาตรฐานนั้น ส่วนหนึ่งถูกปรับแต่งให้เข้ากับเกณฑ์มาตรฐานนั้น และชุดปริศนาการให้เหตุผลไม่ใช่คิวการกระทบยอด

การอ่านที่มีประโยชน์อยู่ระหว่างทั้งสอง หากคุณได้รับผลลัพธ์ที่ไม่ดีจากโมเดลแนวหน้าในวันนี้ สิ่งที่ควรคิดก่อนคือลูปของคุณผิดก่อนที่โมเดลของคุณจะผิด

ใบอนุญาตคือการประกาศ

Apache-2.0 ไม่ใช่เชิงอรรถที่นี่ มันคือสาระสำคัญ

ใบอนุญาตแบบ Copyleft จะทำให้ Harness นี้ไม่สามารถใช้งานได้สำหรับลูกค้าที่เปิดตัวนี้สร้างขึ้นมาโดยเฉพาะ — บริษัทที่ต้องการคอมไพล์เป็นผลิตภัณฑ์เชิงพาณิชย์โดยไม่ต้องเผยแพร่สิ่งที่พวกเขาห่อหุ้มไว้ Cisco รัน Codex SDK ภายใน App Builder ซึ่งเป็นส่วนหนึ่งของ Cisco Cloud Control GitHub และ JetBrains วางเอเจนต์ไว้ภายในโปรแกรมแก้ไขที่นักพัฒนาเปิดอยู่แล้ว แทนที่จะอยู่ในหน้าต่างแยกต่างหาก Thrive Holdings และ Crete สร้างเวิร์กโฟลว์การเตรียมภาษีโดยมีผู้เชี่ยวชาญตรวจสอบอยู่ภายในลูป การรายงานเกี่ยวกับการเปิดตัวนี้ระบุว่ามีการยื่นเอกสารประมาณ 7,000 ฉบับ โดยเวลาเตรียมการลดลงประมาณหนึ่งในสาม

เหล่านี้ไม่ใช่การปรับใช้แชทบอท ทั้งหมดนี้คือลูปเอเจนต์เดียวกันที่สวมอินเทอร์เฟซของผู้อื่น

และส่วนที่ยังคงปิดสนิทคือโมเดล การเปิดเลเยอร์ที่จะกลายเป็นสินค้าโภคภัณฑ์อยู่แล้ว ในขณะที่เลเยอร์ที่คิดค่าบริการยังคงปิดอยู่ เป็นรูปแบบที่คุ้นเคย — คุ้นเคยเพราะมันได้ผล Harness ที่ฝังไว้แต่ละอันคือไคลเอนต์ที่มีความสัมพันธ์ในการเรียกเก็บเงินแนบมาด้วย

คำถามเปลี่ยนจากการรวมระบบเป็นการอนุญาต

Model Context Protocol ได้ย้ายงานส่วนใหญ่ของการเชื่อมต่อจากกาวที่สร้างขึ้นเองในทุกแอปพลิเคชันไปยังเซิร์ฟเวอร์ที่นำกลับมาใช้ใหม่ได้ซึ่งดูแลรักษาเพียงครั้งเดียว Harness แบบเปิดที่เป็นมาตรฐานจะย้ายส่วนที่เหลือส่วนใหญ่ไป

สิ่งที่เหลืออยู่ไม่ใช่ปัญหาที่เล็กกว่า มันเป็นปัญหาที่แตกต่างออกไป และเป็นของใครก็ตามที่เป็นเจ้าของผลิตภัณฑ์ แทนที่จะเป็นของใครก็ตามที่เป็นเจ้าของโมเดล:

  • ขอบเขต เอเจนต์นี้ได้รับอนุญาตให้ทำอะไร — อ่าน, เขียน, ใช้จ่าย, ส่ง, ลบ — และสิ่งนั้นถูกบังคับใช้ในขณะทำงาน แทนที่จะร้องขอในพรอมต์หรือไม่?
  • ประตู การดำเนินการใดบ้างที่ต้องใช้บุคคล และบุคคลนั้นเห็นเพียงพอที่จะตัดสินใจได้จริงหรือไม่ หรือพวกเขากำลังคลิกอนุมัติบนสรุป?
  • อินพุตที่ไม่น่าเชื่อถือ เอเจนต์ที่อ่านอีเมลลูกค้า เนื้อหาตั๋ว หน้าเว็บ หรือความคิดเห็นของ pull request กำลังอ่านข้อความที่ผู้โจมตีควบคุมได้ การบรรเทาคือขอบเขตการอนุญาต ไม่ใช่คำแนะนำที่ดีกว่า
  • การเรียกคืน หลังเกิดเหตุการณ์ คุณสามารถตอบคำถาม «มันทำอะไรไปจริงๆ» จากบันทึก ต่อหน้าผู้ตรวจสอบได้หรือไม่?

Harness แบบเปิดบังคับให้คำถามเหล่านี้เกิดขึ้นเร็วขึ้น ซึ่งเป็นการปรับปรุง มันไม่ได้ตอบคำถามใดๆ เหล่านี้

ที่ที่มันแพร่กระจาย และที่ที่มันหยุดนิ่ง

ความคาดหวังที่แนบมากับการเปิดตัวนี้คือเอเจนต์จะย้ายออกจากเครื่องมือสำหรับนักพัฒนาไปสู่คอนโซลด้านความปลอดภัย การสนับสนุน การขาย และการตลาด ส่วนใหญ่จะเกิดขึ้น และรูปร่างของมันสามารถคาดการณ์ได้จากสิ่งที่เคยได้ผลมาแล้ว

การปรับใช้ที่คงอยู่จะมีการตรวจสอบที่ถูกกว่า การเขียนโค้ดไปก่อนเพราะการทดสอบให้ผลลัพธ์อัตโนมัติ การเตรียมภาษีมีคุณสมบัติเดียวกันด้วยเหตุผลเดียวกัน: การคืนภาษีจะกระทบยอดหรือไม่ก็ไม่ และผู้เชี่ยวชาญจะตรวจสอบข้อยกเว้นแทนที่จะเป็นทั้งหมด การคัดกรองการสนับสนุน การกระทบยอดใบแจ้งหนี้ การรวบรวมหลักฐาน — ตระกูลเดียวกัน ส่วนที่หยุดนิ่งคือส่วนที่บุคคลต้องอ่านผลลัพธ์ทั้งหมดเพื่อทราบว่าถูกต้องหรือไม่ ที่นั่นเอเจนต์ช่วยประหยัดการพิมพ์ ไม่ใช่งาน และไม่มี Harness ใดที่จะแก้ไขสิ่งนั้นได้

สิ่งที่เรากำลังจับตาดู

  • การพกพา ว่าทีมต่างๆ จะรันโมเดลที่ไม่ใช่ OpenAI ผ่านลูปนี้จริงหรือไม่ หรือค่าเริ่มต้นจะทำให้มันกลายเป็นช่องทางการจัดจำหน่ายอย่างเงียบๆ
  • ค่าเริ่มต้นของการกำกับดูแล ประตูอนุมัติ งบประมาณ และการบันทึกที่เปิดใช้งานโดยค่าเริ่มต้นจะกลายเป็นพื้นฐานของอุตสาหกรรม สิ่งที่ปิดใช้งานโดยค่าเริ่มต้นจะกลายเป็นรายงานอุบัติเหตุของอุตสาหกรรม
  • มาตรฐานจะไปถึงที่ไหนต่อไป การเปิดเผยเครื่องมือถูกทำให้เป็นมาตรฐานที่ MCP การประมวลผลกำลังถูกทำให้เป็นมาตรฐานในขณะนี้ การอนุญาตและการตรวจสอบเป็นเลเยอร์ถัดไปที่ชัดเจน และยังไม่มีใครอ้างสิทธิ์
  • กระดานคะแนน หากการเปลี่ยนแปลงโครงสร้างมีค่า 25 คะแนน ตารางเกณฑ์มาตรฐานต้องเริ่มรายงาน Harness ควบคู่ไปกับโมเดล หรือหยุดถูกอ้างว่าเป็นผลลัพธ์ของโมเดล

หัวข้อข่าวคือ OpenAI ได้เปิดซอร์สโค้ดหลักของ Codex การเปลี่ยนแปลงที่ยั่งยืนกว่าคือ «โมเดลใด» กลายเป็นคำถามที่เล็กกว่าเมื่อสัปดาห์ที่แล้ว และ «มันได้รับอนุญาตให้ทำอะไร» กลายเป็นคำถามที่ใหญ่ขึ้น

คำถามที่พบบ่อย

OpenAI ได้เปิดตัวอะไรออกมากันแน่?
กลไกการทำงานของ Codex อยู่ในคลังข้อมูล openai/codex ภายใต้ใบอนุญาต Apache-2.0: คำสั่ง codex exec command line, บริการการทำงานของแอปพลิเคชันเซิร์ฟเวอร์, และ Codex SDK. น้ำหนักของโมเดลไม่ได้ถูกเผยแพร่.
สิ่งนี้ทำให้ Codex ฟรีหรือ?
ไม่. แฮร์เนสสามารถใช้งานได้ฟรี ทำการแก้ไขและฝังเชิงพาณิชย์ได้ ทุกการรันยังเรียกโมเดลผ่านอินเทอร์เฟซการประยุกต์ที่ต้องชำระเงิน ซึ่งเป็นเหตุผลที่ทำให้แฮร์เนสสามารถเปิดเผยได้โดยไม่ต้องให้ข้อมูลอะไรเลย
เครื่องมือจะรันโมเดลของบริษัทอื่นๆ ได้หรือไม่?
อินเทอร์เฟซเป็นแบบจำลองทั่วไป แต่ค่าเริ่มต้น กลยุทธ์บริบทและการปรับแต่งถูกสร้างขึ้นจากโมเดลของ โอเพนเอไอ. พิจารณาการพกพาโมเดลข้ามแบบเป็นสิ่งที่ต้องวัดในงานของคุณเอง แทนที่จะถือเป็นข้อรับประกันที่สัญญาให้คุณ
คำว่า 13.3% ถึง 38.3% ที่แสดงหมายถึงอะไรจริงๆ?
สองรอบการรันโมเดลเดียวกัน ที่แตกต่างเพียงวิธีการสร้างลูป์รอบ ๆ มันนี้ ได้คะแนนแตกต่างกันถึงสามเท่าในแบนช์มาร์กหนึ่ง เป็นข้อโต้แย้งที่แข็งแรงว่าการสร้างโครงสร้าง (scaffolding) ควรได้รับความสนใจในด้านวิศวกรรม ไม่ใช่คำมั่นสัญญาว่าอุปกรณ์ของคุณจะได้รับขอบเขตเดียวกัน เนื่องจากการตั้งค่าชุดทดสอบให้เหมาะกับแบนช์มาร์ก ทำให้ส่วนหนึ่งของมันถูกตั้งค่าไปตามแบนช์มาร์กนั้น
บริษัทควรตรวจสอบอะไรบ้างก่อนที่จะนำเอเจนต์มาผสานเข้ากับผลิตภัณฑ์ของตน?
สี่สิ่ง, ในลำดับ: สิ่งที่เอเจนต์ได้รับอนุญาตให้ทำและว่ามันถูกบังคับใช้โดยรันไทม์แทนที่จะถูกขอในคำสั่ง; ซึ่งการกระทำใดต้องการคนและว่าคนนั้นเห็นว่าพอเพียงเพื่อตัดสิน; สิ่งที่เกิดขึ้นเมื่อเอเจนต์อ่านข้อความที่ควบคุมโดยผู้โจมตีเช่นอีเมลลูกค้าหรือเนื้อหาตั๋ว; และว่าคุณสามารถตอบ «what did it actually do» จากลอกรายงานหลังได้หรือไม่.

แหล่งข้อมูล

  1. Codex as a platform: build on the open agent harness — OpenAI
  2. openai/codex — the Codex CLI, app-server and SDK — GitHub
  3. OpenAI Open Sources Codex Harness Framework — Open Source For You
  4. 오픈AI, 코덱스 하네스 오픈소스 공개 — 솔루션뉴스
  5. Model Context Protocol — MCP
แท็กcodexharnessopen-sourceagentsapache-2.0enterprise

อ่านเพิ่มเติม

หน้าต่างบริบทของเอเจนต์ AI คือ 'งบประมาณ' ไม่ใช่ 'สมุดบันทึก' — นี่คือวิธีที่ Anthropic ใช้จ่ายมัน

แนวทางของ Anthropic ปรับกรอบความคิดจาก 'วิศวกรรมพรอมป์' ไปสู่ 'วิศวกรรมบริบท' นั่นคือการคัดสรรชุดโทเคนที่มีนัยสำคัญสูงในจำนวนน้อยที่สุดสำหรับแต่ละรอบการทำงาน แทนที่จะสะสมทุกอย่างไว้ ในการทดสอบภายในของบริษัทเอง การล้างผลลัพธ์เก่าจากเครื่องมือโดยอัตโนมัติ ร่วมกับไฟล์หน่วยความจำภายนอก ช่วยเพิ่มประสิทธิภาพงานค้นหาได้ถึง 39% และลดการใช้โทเคนลง 84% ตลอด 100 รอบการสนทนา

อ่าน 8 นาที

AI Agent คืออะไร และแตกต่างจาก Chatbot อย่างไร

เอเจนต์ AI คือแบบจำลองภาษาที่ได้รับเครื่องมือที่สามารถเรียกใช้ได้ เป้าหมายที่ต้องบรรลุ และได้รับอนุญาตให้ดำเนินการหลายขั้นตอนโดยไม่ต้องขออนุญาตจากมนุษย์ในแต่ละขั้นตอน แชทบอทจะตอบคำถามและหยุดทำงาน เอเจนต์จะทำงานต่อไปจนกว่าจะตัดสินว่าบรรลุเป้าหมายแล้ว หรือจนกว่าจะหมดงบประมาณ

อ่าน 10 นาที

การวิเคราะห์: สิ่งที่จริงๆ แล้วเปลี่ยนไปเมื่อเอเจนต์ AI ย้ายจากการสาธิตสู่การผลิต

Demos ทำการรันเส้นทางสุขสันต์สั้น ๆ หนึ่งครั้งโดยมีมนุษย์สังเกต Production รันหลายพันแบบโดยไม่มีการดูแล ที่ซึ่งอัตราข้อผิดพลาดในแต่ละขั้นตอนสะสมและขอบเขตสิทธิ์ที่ไม่จำกัดทำให้การตัดสินใจผิดพลาดกลายเป็นเหตุการณ์ การปรับใช้ที่ประสบความสำเร็จจะจำกัดขอบเขต ตรวจสอบแต่ละขั้นตอนอย่างถูกวิธีโดยค่าใช้จ่ายต่ำ และกั้นการกระทำที่ไม่สามารถยกเลิกได้ทุกครั้ง

อ่าน 9 นาที