AWS เปิดตัวเครื่องมือทดสอบมาตรฐานแบบโอเพนซอร์สเพื่อเปรียบเทียบโมเดล OpenAI บน Bedrock
AWS เผยแพร่เครื่องมือทดสอบมาตรฐานแบบโอเพนซอร์สพร้อมบล็อกโพสต์ที่ประเมินโมเดล OpenAI บน Amazon Bedrock เทียบกับโมเดลพื้นฐานของ OpenAI API ในด้านต้นทุน จำนวนรอบการทำงานของเอเจนต์ และคุณภาพของงานที่ส่งมอบ
คำตอบโดยย่อ
AWS ประกาศอะไรเกี่ยวกับการเปรียบเทียบโมเดล OpenAI บน Amazon Bedrock?
AWS เผยแพร่บล็อกโพสต์และเปิดซอร์สเครื่องมือทดสอบมาตรฐานชื่อ openai-on-aws/benchmarks-openai ซึ่งเปรียบเทียบโมเดล OpenAI สามตัวบน Amazon Bedrock กับโมเดลพื้นฐานของ OpenAI API สองตัว โดยพิจารณาต้นทุนต่อคำตอบที่ถูกต้อง ต้นทุนของเอเจนต์ที่ทำงานหลายรอบ และคุณภาพงานระดับมืออาชีพที่ประเมินด้วยเกณฑ์ให้คะแนน แทนที่จะดูเพียงราคาต่อโทเคนเท่านั้น
ประเด็นสำคัญ
- AWS เปิดซอร์สเครื่องมือทดสอบมาตรฐานชื่อ openai-on-aws/benchmarks-openai ซึ่งรันโค้ดชุดเดียวกันของ OpenAI Responses API กับทั้งโมเดลบน Amazon Bedrock และโมเดลบน OpenAI API
- เครื่องมือนี้ประเมินโมเดล OpenAI สามตัวบน Amazon Bedrock (gpt-5.6-luna, gpt-5.6-terra, gpt-5.6-sol) เทียบกับโมเดลจาก OpenAI API สองตัวที่คุ้มค่าด้านต้นทุน (gpt-5.4-mini, gpt-5.4-nano) ซึ่ง AWS ระบุว่าเป็นโมเดลพื้นฐานยอดนิยมที่เน้นความคุ้มค่า ไม่ใช่โมเดลรุ่นเดียวกันโดยตรง
- AWS ระบุว่าการประเมินพิจารณาต้นทุนต่อคำตอบที่ถูกต้อง ต้นทุนของวิถีการทำงานของเอเจนต์แบบหลายรอบ และประสิทธิภาพในงานส่งมอบระดับมืออาชีพที่ให้คะแนนด้วยเกณฑ์การประเมิน แทนที่จะอาศัยการเปรียบเทียบราคาต่อโทเคนเพียงอย่างเดียว
- AWS ระบุว่าโมเดลบน Amazon Bedrock รันโดยปิดการใช้งานโหมดการให้เหตุผล ขณะที่โมเดลจาก OpenAI API รันด้วยการตั้งค่าเริ่มต้น และอธิบายว่าผลลัพธ์สะท้อนรูปแบบการใช้งานจริง มิใช่การวัดความสามารถโดยธรรมชาติของโมเดลภายใต้การควบคุมตัวแปร
- การให้คะแนนในเครื่องมือนี้ผสมผสานการตรวจสอบแบบกำหนดตายตัวเข้ากับโมเดลผู้ตัดสินที่เป็น LLM คือ gpt-5.5 โดยใช้พรอมป์ที่ตรึงค่าไว้ตายตัว และ AWS รายงานขนาดกลุ่มตัวอย่างอยู่ระหว่าง 48 ถึง 198 รายการต่อชุดทดสอบ
AWS เผยแพร่บทความบนบล็อก Artificial Intelligence ของบริษัท อธิบายถึงชุดเครื่องมือเปรียบเทียบประสิทธิภาพแบบโอเพนซอร์สสำหรับเปรียบเทียบโมเดล OpenAI ที่ให้บริการบน Amazon Bedrock กับโมเดล OpenAI ที่เรียกใช้งานโดยตรงผ่าน OpenAI API บทความนี้ระบุชื่อผู้เขียนจาก AWS ได้แก่ Nick McCarthy, Sharadha Kandasubramanian, Sudeesh Sasidharan และ Saurabh Trikande
AWS ระบุว่าโดยทั่วไปองค์กรต่าง ๆ มักเปรียบเทียบโมเดลด้วยตัวเลขดอลลาร์ต่อล้านโทเคน ซึ่งเป็นตัวเลขที่ปรากฏอยู่บนหน้าราคาของทุกแห่ง แต่ตามที่บทความระบุ ตัวเลขดังกล่าวมองข้ามปัจจัยที่ส่งผลต่อต้นทุนจริง ได้แก่ ความถี่ที่โมเดลให้คำตอบที่ถูกต้อง จำนวนโทเคนที่ใช้ไปกว่าจะได้คำตอบนั้น และสำหรับงานประเภทเอเจนต์ จำนวนรอบการสนทนาที่ต้องใช้ เนื่องจากในแต่ละรอบจะต้องส่งประวัติการสนทนาที่ขยายตัวขึ้นเรื่อย ๆ กลับไปใหม่ทุกครั้ง
ชุดเครื่องมือทดสอบและโมเดลที่นำมาประเมิน
AWS ระบุว่าบริษัทได้สร้างและเปิดเผยชุดเครื่องมือทดสอบดังกล่าวในรูปแบบโอเพนซอร์ส เผยแพร่ภายใต้ชื่อ openai-on-aws/benchmarks-openai ซึ่งรันโค้ดชุดเดียวกันคือ OpenAI Responses API เทียบกันระหว่าง Amazon Bedrock และ OpenAI API โดยสลับเฉพาะแบ็กเอนด์และรหัสโมเดล ขณะที่ตรรกะการประเมินผลยังคงเดิมทุกประการ
บทความระบุว่าชุดเครื่องมือนี้ประเมินโมเดลทั้งหมด 5 ตัว ได้แก่
- โมเดล OpenAI บน Amazon Bedrock จำนวน 3 ตัว: gpt-5.6-luna, gpt-5.6-terra และ gpt-5.6-sol
- โมเดล OpenAI API จำนวน 2 ตัว: gpt-5.4-mini และ gpt-5.4-nano
AWS อธิบายว่าโมเดล OpenAI API ทั้งสองตัวเป็นทางเลือกพื้นฐานที่เน้นความคุ้มค่าด้านต้นทุนซึ่งหลายทีมงานใช้อยู่แล้ว ไม่ใช่โมเดลรุ่นเทียบเท่าโดยตรงกับโมเดลบน Bedrock โดยวางกรอบการเปรียบเทียบไว้ที่คำถามว่าโมเดลรุ่นใหม่บน Bedrock คุ้มค่าพอที่จะย้ายจาก mini หรือ nano หรือไม่
ขอบเขตของการประเมิน
AWS ระบุว่าชุดเครื่องมือนี้ตอบคำถามสำคัญสามข้อ ได้แก่ คำตอบที่ถูกต้องมีต้นทุนเท่าใดแทนที่จะดูเพียงต้นทุนต่อโทเคน การสนทนาแบบหลายรอบของเอเจนต์มีต้นทุนเท่าใดในเมื่อจำนวนรอบสามารถเป็นตัวแปรหลักที่กำหนดค่าใช้จ่าย และโมเดลสามารถผลิตงานที่มืออาชีพยอมรับได้หรือไม่ โดยทดสอบกับงานส่งมอบตามลักษณะอาชีพจริง ไม่ใช่คำถามแบบทดสอบทั่วไป
AWS ระบุว่าการประเมินนี้วัดทั้งความแม่นยำและต้นทุนของการเรียกใช้งานครั้งเดียวในโจทย์คณิตศาสตร์ระดับการแข่งขัน AIME โจทย์วิทยาศาสตร์ระดับบัณฑิตศึกษา GPQA Diamond และ MMLU-Pro ควบคู่ไปกับการสนทนาแบบหลายรอบของเอเจนต์ในงานวิจัยเว็บแบบสด และงานส่งมอบระดับมืออาชีพที่ให้คะแนนตามเกณฑ์ การให้คะแนนผสมผสานการตรวจสอบแบบกำหนดตายตัวเข้ากับผู้ตัดสินที่เป็น LLM คือ gpt-5.5 ซึ่ง AWS ระบุว่าไม่ใช่หนึ่งในโมเดลที่ถูกประเมินในครั้งนี้ โดยใช้พรอมต์ที่ตรึงไว้ตายตัวซึ่งค่าแฮชถูกบันทึกไว้ในไฟล์ผลลัพธ์แต่ละไฟล์
AWS ระบุว่าทุกครั้งที่รันชุดเครื่องมือนี้ จะมีการบันทึกไฟล์ผลลัพธ์แบบระบุเวลาในรูปแบบ JSON และตัวเลขรวมถึงกราฟทุกรายการในบทความถูกสร้างขึ้นจากไฟล์เหล่านั้นในขั้นตอนการประมวลผล ทั้งนี้ เอกสารต้นฉบับที่ได้รับมาไม่ได้รวมผลลัพธ์ด้านความแม่นยำ ต้นทุน หรือผลการทดสอบเฉพาะเจาะจงที่ชุดเครื่องมือนี้สร้างขึ้น
ที่มา: AWS Machine Learning Blog, "Beyond the price per token: Choosing the right OpenAI model on Amazon Bedrock for your workload," เผยแพร่เมื่อวันที่ 11 กันยายน 2026
คำถามที่พบบ่อย
- openai-on-aws/benchmarks-openai คืออะไร?
- เป็นเครื่องมือทดสอบมาตรฐานแบบโอเพนซอร์สที่ AWS ระบุว่ารันโค้ดชุดเดียวกันของ OpenAI Responses API กับทั้งโมเดล OpenAI ที่ให้บริการบน Amazon Bedrock และกับ OpenAI API เพื่อให้ผู้ใช้สามารถทำการทดสอบซ้ำกับภาระงานของตนเองได้
- การทดสอบมาตรฐานของ AWS เปรียบเทียบโมเดลใดบ้าง?
- AWS เปรียบเทียบโมเดล OpenAI สามตัวบน Amazon Bedrock ได้แก่ gpt-5.6-luna, gpt-5.6-terra และ gpt-5.6-sol กับโมเดลจาก OpenAI API สองตัว คือ gpt-5.4-mini และ gpt-5.4-nano ซึ่งเรียกว่าเป็นโมเดลพื้นฐานที่คุ้มค่าด้านต้นทุนและใช้งานกันอย่างแพร่หลาย
- AWS ระบุว่าวัดอะไรนอกเหนือจากราคาต่อโทเคน?
- AWS ระบุว่าวัดต้นทุนของคำตอบที่ถูกต้องในชุดทดสอบมาตรฐาน ได้แก่ AIME, GPQA Diamond และ MMLU-Pro รวมถึงต้นทุนของวิถีการทำงานของเอเจนต์แบบหลายรอบในงานวิจัยเว็บแบบเรียลไทม์ และประสิทธิภาพในงานส่งมอบระดับมืออาชีพที่ให้คะแนนด้วยเกณฑ์การประเมิน
- AWS รันโมเดลที่นำมาเปรียบเทียบด้วยการตั้งค่าเดียวกันหรือไม่?
- ไม่ AWS ระบุว่าโมเดลบน Amazon Bedrock รันโดยปิดการใช้งานโหมดการให้เหตุผล ขณะที่โมเดลพื้นฐานจาก OpenAI API รันด้วยการตั้งค่าเริ่มต้น และอธิบายว่าการเปรียบเทียบนี้สะท้อนรูปแบบการใช้งานจริง มิใช่การทดสอบความสามารถโดยธรรมชาติของโมเดลภายใต้การควบคุมตัวแปร