โมเดลหลายรูปแบบ
multimodal · vision-language model · VLM
กล่าวโดยย่อ
โมเดลแบบหลายประสาท (multimodal) สามารถประมวลผลอินพุตหลายประเภทในคำขอเดียวกัน โดยส่วนใหญ่คือข้อความร่วมกับรูปภาพ และในปัจจุบันกำลังรองรับเสียงและวิดีโอเพิ่มมากขึ้น การแปลงอินพุตที่ไม่ใช่ข้อความให้เป็นรูปแบบการแทนภายในเดียวกับโทเคน ทำให้ภาพหนึ่งภาพสามารถใช้ส่วนใหญ่ของช่วงบริบทได้
โมเดล multimodal จัดการกับข้อมูลหลายประเภทในคำขอเดียว — ถามเกี่ยวกับกราฟ แปลงเสียงเป็นข้อความและตอบคำถาม หรืออ่านภาพถ่ายหน้าจอข้อความข้อผิดพลาด
ในเชิงกลไก ข้อมูลที่ไม่ใช่ข้อความจะถูกส่งผ่าน encoder ที่สร้างเวกเตอร์ในพื้นที่เดียวกับที่โมเดลภาษาใช้ จากมุมมองของโมเดลแล้วมีลำดับเดียว ภาพเพียงแค่ปรากฏเป็นบล็อกของตำแหน่งภายใน
ซึ่งมีผลโดยตรงต่อการใช้งานเชิงปฏิบัติ: ภาพใช้พื้นที่คอนเท็กซ์ ภาพหน้าจอความละเอียดสูงอาจใช้พื้นที่คอนเท็กซ์เท่ากับหลายหน้าของข้อความ และค่าใช้จ่ายก็เท่ากัน
การทำ downscaling ก่อนส่งมักเป็นการประหยัดที่ไม่เสียความแม่นยำโดยไม่มีค่าใช้จ่าย สำหรับงานที่ไม่ต้องการรายละเอียดที่ซับซ้อน
ความสามารถมีความแตกต่างในรูปแบบที่ควรทดสอบมากกว่าการสมมติ การอ่านข้อความในรูปภาพ การอธิบายฉาก และการตีความแผนภูมิ เป็นทักษะที่แตกต่างกันโดยมีความเชื่อถือได้ที่แตกต่างกัน
ตารางหนาแน่น เขียนมือ และแผนภูมิที่ต้องการค่าที่แม่นยำเพื่อหาคำตอบ ยังเป็นจุดอ่อน — โมเดลอาจสร้างตัวเลขที่มั่นใจแต่จริงๆ แล้วถูกอ่านผิด
คำถามที่พบบ่อย
- บริบทของหน้าต่างรูปภาพใช้ไปเท่าใด
- ขึ้นอยู่กับความละเอียดและวิธีการเข้ารหัสของผู้ให้บริการ แต่การจับภาพหน้าจอแบบเต็มหน้ามักมีค่าใช้จ่ายหลายพันโทเคนขึ้นไป ตรวจสอบสูตรของผู้ให้บริการก่อนส่งภาพจำนวนมาก
- โมเดลหลายโมดัลสามารถสร้างภาพได้หรือไม่ พร้อมกับการอ่านภาพ?
- การอ่านและการสร้างเป็นความสามารถที่แยกกันออกไป หลายโมเดลสามารถรับภาพเป็นอินพุตได้แต่ให้ผลลัพธ์เป็นข้อความเท่านั้น การสร้างภาพมักเป็นโมเดลที่แยกออกไป โดยบางครั้งอาจถูกเรียกใช้เป็นเครื่องมือ