Skip to content
เครื่องมือและผลิตภัณฑ์

AWS เปิดตัวเครื่องมือทดสอบมาตรฐานแบบโอเพนซอร์สเพื่อเปรียบเทียบโมเดล OpenAI บน Bedrock

AWS เผยแพร่เครื่องมือทดสอบมาตรฐานแบบโอเพนซอร์สพร้อมบล็อกโพสต์ที่ประเมินโมเดล OpenAI บน Amazon Bedrock เทียบกับโมเดลพื้นฐานของ OpenAI API ในด้านต้นทุน จำนวนรอบการทำงานของเอเจนต์ และคุณภาพของงานที่ส่งมอบ

โดย DigitalNeuron Deskอ่าน 1 นาที

คำตอบโดยย่อ

AWS ประกาศอะไรเกี่ยวกับการเปรียบเทียบโมเดล OpenAI บน Amazon Bedrock?

AWS เผยแพร่บล็อกโพสต์และเปิดซอร์สเครื่องมือทดสอบมาตรฐานชื่อ openai-on-aws/benchmarks-openai ซึ่งเปรียบเทียบโมเดล OpenAI สามตัวบน Amazon Bedrock กับโมเดลพื้นฐานของ OpenAI API สองตัว โดยพิจารณาต้นทุนต่อคำตอบที่ถูกต้อง ต้นทุนของเอเจนต์ที่ทำงานหลายรอบ และคุณภาพงานระดับมืออาชีพที่ประเมินด้วยเกณฑ์ให้คะแนน แทนที่จะดูเพียงราคาต่อโทเคนเท่านั้น

ประเด็นสำคัญ

  • AWS เปิดซอร์สเครื่องมือทดสอบมาตรฐานชื่อ openai-on-aws/benchmarks-openai ซึ่งรันโค้ดชุดเดียวกันของ OpenAI Responses API กับทั้งโมเดลบน Amazon Bedrock และโมเดลบน OpenAI API
  • เครื่องมือนี้ประเมินโมเดล OpenAI สามตัวบน Amazon Bedrock (gpt-5.6-luna, gpt-5.6-terra, gpt-5.6-sol) เทียบกับโมเดลจาก OpenAI API สองตัวที่คุ้มค่าด้านต้นทุน (gpt-5.4-mini, gpt-5.4-nano) ซึ่ง AWS ระบุว่าเป็นโมเดลพื้นฐานยอดนิยมที่เน้นความคุ้มค่า ไม่ใช่โมเดลรุ่นเดียวกันโดยตรง
  • AWS ระบุว่าการประเมินพิจารณาต้นทุนต่อคำตอบที่ถูกต้อง ต้นทุนของวิถีการทำงานของเอเจนต์แบบหลายรอบ และประสิทธิภาพในงานส่งมอบระดับมืออาชีพที่ให้คะแนนด้วยเกณฑ์การประเมิน แทนที่จะอาศัยการเปรียบเทียบราคาต่อโทเคนเพียงอย่างเดียว
  • AWS ระบุว่าโมเดลบน Amazon Bedrock รันโดยปิดการใช้งานโหมดการให้เหตุผล ขณะที่โมเดลจาก OpenAI API รันด้วยการตั้งค่าเริ่มต้น และอธิบายว่าผลลัพธ์สะท้อนรูปแบบการใช้งานจริง มิใช่การวัดความสามารถโดยธรรมชาติของโมเดลภายใต้การควบคุมตัวแปร
  • การให้คะแนนในเครื่องมือนี้ผสมผสานการตรวจสอบแบบกำหนดตายตัวเข้ากับโมเดลผู้ตัดสินที่เป็น LLM คือ gpt-5.5 โดยใช้พรอมป์ที่ตรึงค่าไว้ตายตัว และ AWS รายงานขนาดกลุ่มตัวอย่างอยู่ระหว่าง 48 ถึง 198 รายการต่อชุดทดสอบ

AWS เผยแพร่บทความบนบล็อก Artificial Intelligence ของบริษัท อธิบายถึงชุดเครื่องมือเปรียบเทียบประสิทธิภาพแบบโอเพนซอร์สสำหรับเปรียบเทียบโมเดล OpenAI ที่ให้บริการบน Amazon Bedrock กับโมเดล OpenAI ที่เรียกใช้งานโดยตรงผ่าน OpenAI API บทความนี้ระบุชื่อผู้เขียนจาก AWS ได้แก่ Nick McCarthy, Sharadha Kandasubramanian, Sudeesh Sasidharan และ Saurabh Trikande

AWS ระบุว่าโดยทั่วไปองค์กรต่าง ๆ มักเปรียบเทียบโมเดลด้วยตัวเลขดอลลาร์ต่อล้านโทเคน ซึ่งเป็นตัวเลขที่ปรากฏอยู่บนหน้าราคาของทุกแห่ง แต่ตามที่บทความระบุ ตัวเลขดังกล่าวมองข้ามปัจจัยที่ส่งผลต่อต้นทุนจริง ได้แก่ ความถี่ที่โมเดลให้คำตอบที่ถูกต้อง จำนวนโทเคนที่ใช้ไปกว่าจะได้คำตอบนั้น และสำหรับงานประเภทเอเจนต์ จำนวนรอบการสนทนาที่ต้องใช้ เนื่องจากในแต่ละรอบจะต้องส่งประวัติการสนทนาที่ขยายตัวขึ้นเรื่อย ๆ กลับไปใหม่ทุกครั้ง

ชุดเครื่องมือทดสอบและโมเดลที่นำมาประเมิน

AWS ระบุว่าบริษัทได้สร้างและเปิดเผยชุดเครื่องมือทดสอบดังกล่าวในรูปแบบโอเพนซอร์ส เผยแพร่ภายใต้ชื่อ openai-on-aws/benchmarks-openai ซึ่งรันโค้ดชุดเดียวกันคือ OpenAI Responses API เทียบกันระหว่าง Amazon Bedrock และ OpenAI API โดยสลับเฉพาะแบ็กเอนด์และรหัสโมเดล ขณะที่ตรรกะการประเมินผลยังคงเดิมทุกประการ

บทความระบุว่าชุดเครื่องมือนี้ประเมินโมเดลทั้งหมด 5 ตัว ได้แก่

  • โมเดล OpenAI บน Amazon Bedrock จำนวน 3 ตัว: gpt-5.6-luna, gpt-5.6-terra และ gpt-5.6-sol
  • โมเดล OpenAI API จำนวน 2 ตัว: gpt-5.4-mini และ gpt-5.4-nano

AWS อธิบายว่าโมเดล OpenAI API ทั้งสองตัวเป็นทางเลือกพื้นฐานที่เน้นความคุ้มค่าด้านต้นทุนซึ่งหลายทีมงานใช้อยู่แล้ว ไม่ใช่โมเดลรุ่นเทียบเท่าโดยตรงกับโมเดลบน Bedrock โดยวางกรอบการเปรียบเทียบไว้ที่คำถามว่าโมเดลรุ่นใหม่บน Bedrock คุ้มค่าพอที่จะย้ายจาก mini หรือ nano หรือไม่

ขอบเขตของการประเมิน

AWS ระบุว่าชุดเครื่องมือนี้ตอบคำถามสำคัญสามข้อ ได้แก่ คำตอบที่ถูกต้องมีต้นทุนเท่าใดแทนที่จะดูเพียงต้นทุนต่อโทเคน การสนทนาแบบหลายรอบของเอเจนต์มีต้นทุนเท่าใดในเมื่อจำนวนรอบสามารถเป็นตัวแปรหลักที่กำหนดค่าใช้จ่าย และโมเดลสามารถผลิตงานที่มืออาชีพยอมรับได้หรือไม่ โดยทดสอบกับงานส่งมอบตามลักษณะอาชีพจริง ไม่ใช่คำถามแบบทดสอบทั่วไป

AWS ระบุว่าการประเมินนี้วัดทั้งความแม่นยำและต้นทุนของการเรียกใช้งานครั้งเดียวในโจทย์คณิตศาสตร์ระดับการแข่งขัน AIME โจทย์วิทยาศาสตร์ระดับบัณฑิตศึกษา GPQA Diamond และ MMLU-Pro ควบคู่ไปกับการสนทนาแบบหลายรอบของเอเจนต์ในงานวิจัยเว็บแบบสด และงานส่งมอบระดับมืออาชีพที่ให้คะแนนตามเกณฑ์ การให้คะแนนผสมผสานการตรวจสอบแบบกำหนดตายตัวเข้ากับผู้ตัดสินที่เป็น LLM คือ gpt-5.5 ซึ่ง AWS ระบุว่าไม่ใช่หนึ่งในโมเดลที่ถูกประเมินในครั้งนี้ โดยใช้พรอมต์ที่ตรึงไว้ตายตัวซึ่งค่าแฮชถูกบันทึกไว้ในไฟล์ผลลัพธ์แต่ละไฟล์

AWS ระบุว่าทุกครั้งที่รันชุดเครื่องมือนี้ จะมีการบันทึกไฟล์ผลลัพธ์แบบระบุเวลาในรูปแบบ JSON และตัวเลขรวมถึงกราฟทุกรายการในบทความถูกสร้างขึ้นจากไฟล์เหล่านั้นในขั้นตอนการประมวลผล ทั้งนี้ เอกสารต้นฉบับที่ได้รับมาไม่ได้รวมผลลัพธ์ด้านความแม่นยำ ต้นทุน หรือผลการทดสอบเฉพาะเจาะจงที่ชุดเครื่องมือนี้สร้างขึ้น

ที่มา: AWS Machine Learning Blog, "Beyond the price per token: Choosing the right OpenAI model on Amazon Bedrock for your workload," เผยแพร่เมื่อวันที่ 11 กันยายน 2026

คำถามที่พบบ่อย

openai-on-aws/benchmarks-openai คืออะไร?
เป็นเครื่องมือทดสอบมาตรฐานแบบโอเพนซอร์สที่ AWS ระบุว่ารันโค้ดชุดเดียวกันของ OpenAI Responses API กับทั้งโมเดล OpenAI ที่ให้บริการบน Amazon Bedrock และกับ OpenAI API เพื่อให้ผู้ใช้สามารถทำการทดสอบซ้ำกับภาระงานของตนเองได้
การทดสอบมาตรฐานของ AWS เปรียบเทียบโมเดลใดบ้าง?
AWS เปรียบเทียบโมเดล OpenAI สามตัวบน Amazon Bedrock ได้แก่ gpt-5.6-luna, gpt-5.6-terra และ gpt-5.6-sol กับโมเดลจาก OpenAI API สองตัว คือ gpt-5.4-mini และ gpt-5.4-nano ซึ่งเรียกว่าเป็นโมเดลพื้นฐานที่คุ้มค่าด้านต้นทุนและใช้งานกันอย่างแพร่หลาย
AWS ระบุว่าวัดอะไรนอกเหนือจากราคาต่อโทเคน?
AWS ระบุว่าวัดต้นทุนของคำตอบที่ถูกต้องในชุดทดสอบมาตรฐาน ได้แก่ AIME, GPQA Diamond และ MMLU-Pro รวมถึงต้นทุนของวิถีการทำงานของเอเจนต์แบบหลายรอบในงานวิจัยเว็บแบบเรียลไทม์ และประสิทธิภาพในงานส่งมอบระดับมืออาชีพที่ให้คะแนนด้วยเกณฑ์การประเมิน
AWS รันโมเดลที่นำมาเปรียบเทียบด้วยการตั้งค่าเดียวกันหรือไม่?
ไม่ AWS ระบุว่าโมเดลบน Amazon Bedrock รันโดยปิดการใช้งานโหมดการให้เหตุผล ขณะที่โมเดลพื้นฐานจาก OpenAI API รันด้วยการตั้งค่าเริ่มต้น และอธิบายว่าการเปรียบเทียบนี้สะท้อนรูปแบบการใช้งานจริง มิใช่การทดสอบความสามารถโดยธรรมชาติของโมเดลภายใต้การควบคุมตัวแปร

แหล่งข้อมูล

  1. Beyond the price per token: Choosing the right OpenAI model on Amazon Bedrock for your workload | Artificial IntelligenceAmazon Web Services (AWS)
แท็กawsamazon-bedrockopenaibenchmarkingopen-sourcemodel-evaluation

อ่านเพิ่มเติม

AWS Details AI Product Tagging System Built With SageMaker Serverless Model Customization

AWS published a technical walkthrough describing how to build a product tagging system by customizing the Qwen3-8B open-weight model with SageMaker serverless model customization, using supervised fine-tuning and reinforcement learning with verifiable rewards, then deploying the result to SageMaker Asynchronous Inference for catalog enrichment.

อ่าน 2 นาที

Databricks เปิดเผยรายละเอียดข้อกำหนด Apache Iceberg ใหม่ 2 ฉบับ เพื่อการกำกับดูแลข้ามแคตตาล็อก

Databricks says the Apache Iceberg community has adopted two new specifications, read restrictions and catalog labels, to the Iceberg REST Catalog. Read restrictions let catalogs delegate policy enforcement to trusted engines, while catalog labels let catalogs exchange governance metadata, such as PII tags, across federated systems like Unity Catalog and Snowflake.

อ่าน 7 นาที

แอปเดสก์ท็อป Amazon Quick เปิดให้ใช้งานทั่วไปแล้ว

AWS ประกาศว่าแอปพลิเคชันเดสก์ท็อป Amazon Quick เปิดให้ใช้งานทั่วไปแล้วบน macOS และ Windows นอกจากนี้บริษัทยังระบุว่ากำลังเพิ่มฟีดกิจกรรมใหม่ให้กับประสบการณ์ใช้งานบนมือถือทั้ง iOS และ Android ซึ่งจะรวมอีเมล ปฏิทิน ระบบ CRM และข้อความแชทไว้ในมุมมองเดียวที่จัดลำดับความสำคัญให้

อ่าน 4 นาที