Skip to content
โมเดลและงานวิจัย

โมเดลหลายรูปแบบ

multimodal · vision-language model · VLM

กล่าวโดยย่อ

โมเดลแบบหลายประสาท (multimodal) สามารถประมวลผลอินพุตหลายประเภทในคำขอเดียวกัน โดยส่วนใหญ่คือข้อความร่วมกับรูปภาพ และในปัจจุบันกำลังรองรับเสียงและวิดีโอเพิ่มมากขึ้น การแปลงอินพุตที่ไม่ใช่ข้อความให้เป็นรูปแบบการแทนภายในเดียวกับโทเคน ทำให้ภาพหนึ่งภาพสามารถใช้ส่วนใหญ่ของช่วงบริบทได้

โมเดล multimodal จัดการกับข้อมูลหลายประเภทในคำขอเดียว — ถามเกี่ยวกับกราฟ แปลงเสียงเป็นข้อความและตอบคำถาม หรืออ่านภาพถ่ายหน้าจอข้อความข้อผิดพลาด

ในเชิงกลไก ข้อมูลที่ไม่ใช่ข้อความจะถูกส่งผ่าน encoder ที่สร้างเวกเตอร์ในพื้นที่เดียวกับที่โมเดลภาษาใช้ จากมุมมองของโมเดลแล้วมีลำดับเดียว ภาพเพียงแค่ปรากฏเป็นบล็อกของตำแหน่งภายใน

ซึ่งมีผลโดยตรงต่อการใช้งานเชิงปฏิบัติ: ภาพใช้พื้นที่คอนเท็กซ์ ภาพหน้าจอความละเอียดสูงอาจใช้พื้นที่คอนเท็กซ์เท่ากับหลายหน้าของข้อความ และค่าใช้จ่ายก็เท่ากัน

การทำ downscaling ก่อนส่งมักเป็นการประหยัดที่ไม่เสียความแม่นยำโดยไม่มีค่าใช้จ่าย สำหรับงานที่ไม่ต้องการรายละเอียดที่ซับซ้อน

ความสามารถมีความแตกต่างในรูปแบบที่ควรทดสอบมากกว่าการสมมติ การอ่านข้อความในรูปภาพ การอธิบายฉาก และการตีความแผนภูมิ เป็นทักษะที่แตกต่างกันโดยมีความเชื่อถือได้ที่แตกต่างกัน

ตารางหนาแน่น เขียนมือ และแผนภูมิที่ต้องการค่าที่แม่นยำเพื่อหาคำตอบ ยังเป็นจุดอ่อน — โมเดลอาจสร้างตัวเลขที่มั่นใจแต่จริงๆ แล้วถูกอ่านผิด

คำถามที่พบบ่อย

บริบทของหน้าต่างรูปภาพใช้ไปเท่าใด
ขึ้นอยู่กับความละเอียดและวิธีการเข้ารหัสของผู้ให้บริการ แต่การจับภาพหน้าจอแบบเต็มหน้ามักมีค่าใช้จ่ายหลายพันโทเคนขึ้นไป ตรวจสอบสูตรของผู้ให้บริการก่อนส่งภาพจำนวนมาก
โมเดลหลายโมดัลสามารถสร้างภาพได้หรือไม่ พร้อมกับการอ่านภาพ?
การอ่านและการสร้างเป็นความสามารถที่แยกกันออกไป หลายโมเดลสามารถรับภาพเป็นอินพุตได้แต่ให้ผลลัพธ์เป็นข้อความเท่านั้น การสร้างภาพมักเป็นโมเดลที่แยกออกไป โดยบางครั้งอาจถูกเรียกใช้เป็นเครื่องมือ

ดูเพิ่มเติม

อัปเดตล่าสุด 22 ส.ค. 2569

อ่านในภาษา