Skip to content
โมเดลและงานวิจัย

มาตรฐาน

eval · evaluation set · leaderboard

กล่าวโดยย่อ

แบนช์มาร์กคือชุดงานที่กำหนดไว้ล่วงหน้าพร้อมคำตอบที่รู้จัก ใช้เพื่อให้คะแนนและเปรียบเทียบโมเดล การประเมินผลแบบสาธารณะให้การประเมินความสามารถโดยประมาณ แต่ถูกออกแบบมาเพื่อการฝึกข้อมูลอย่างหนัก จึงเสี่ยงต่อการปนเปื้อนข้อมูลฝึก และมีลักษณะเป็นปัญหาสั้น ๆ ที่กำหนดชัดเจน แทนที่จะเป็นงานผลิตจริง

Benchmark ที่มีอยู่เพราะการเปรียบเทียบโมเดลจำเป็นต้องมีมาตรฐานร่วมกัน และจริงๆ แล้วก็เป็นประโยชน์อย่างมากสำหรับเรื่องนั้น: พวกเขาสร้างการจัดอันดับโดยประมาณและตรวจจับการถดถอยที่ใหญ่

พวกเขายังล้มเหลวในรูปแบบที่คาดเดาได้ ทั้งหมดมาจากพลวัตเดียว — เมื่อตัวเลขกลายเป็นเป้าหมาย มันก็ไม่ใช่การวัดอีกต่อไป

  • Contamination. Public benchmarks are on the public web, and training corpora are scraped from the public web.
  • Optimisation pressure. Vendors tune against the benchmarks they will be judged on. This is rational and it inflates scores relative to untested capability.
  • Task shape. Short, single-turn, unambiguous, with one correct answer. Little production work looks like that.
  • Selective reporting. Every launch shows the benchmarks it wins.
  • Saturation. Once every credible model scores above 90%, the remaining differences are noise.

ทางเลือกไม่ใช่การละทิ้ง benchmark แต่ให้เพิ่ม benchmark ของคุณเอง เข้ามาไม่กี่ร้อยคำขอจริงจากการจราจรของคุณเอง โดยมีคำตอบที่ถูกต้องซึ่งคนที่เข้าใจด้านนั้นเห็นพ้องกันและให้คะแนนแบบเดียวกันทุกครั้ง ชุดข้อมูลนี้ตอบคำถามที่คุณจริงๆ มี — โมเดลไหนดีกว่าสำหรับงานนี้ — และเป็นชุดเดียวที่ยังคงอยู่เมื่อมีการอัปเกรดโมเดล

ทีมที่สร้างแบบนี้เป็นประจำพบว่า ordering ต่างจาก leaderboard บางครั้งในทางที่เอื้อต่อโมเดลที่ถูกกว่า

คำถามที่พบบ่อย

ทำไมผู้ชนะการประเมินมาตรฐานถึงทำให้ผิดหวังในการผลิตบางครั้ง?
เกณฑ์การประเมินส่งเสริมงานสั้น ๆ ที่ชัดเจนและทำได้ในรอบเดียว ส่วนงานผลิตจริงมีความยาว ซับซ้อน หลายรอบ และเป็นการต่อสู้ที่แข่งขันกัน ทั้งนี้ ความสัมพันธ์ระหว่างสองสิ่งนี้จริงแต่หลวม
benchmark contamination คืออะไร?
คำถามและคำตอบของ Benchmark ที่ปรากฏในข้อมูลฝึกของโมเดล มักเกิดขึ้นเพราะถูกเผยแพร่บนอินเทอร์เน็ต การประเมินที่ปนเปื้อนจึงวัดการเรียกคืนมากกว่าความสามารถจริง และไม่สามารถปฏิเสธได้ทั้งหมด

ดูเพิ่มเติม

อัปเดตล่าสุด 22 ส.ค. 2569

อ่านในภาษา