โมเดลภาษาขนาดใหญ่ (LLM)
LLM · foundation model
กล่าวโดยย่อ
โมเดลภาษาขนาดใหญ่คือเครือข่ายประสาทที่มีพารามิเตอร์หลายพันล้านตัว ซึ่งถูกฝึกด้วยชุดข้อความขนาดใหญ่เพื่อทำนาย token ถัดไปในลำดับ หนึ่งเป้าหมายเดียวที่ทำได้เพียงพอในระดับขนาดใหญ่ จะทำให้สามารถตอบคำถาม เขียนโค้ด แปลภาษา และสรุปสาระสำคัญได้ — แม้ว่าจะไม่ได้ถูกฝึกมาเพื่อทำอย่างนั้นโดยตรง
ขนาดใหญ่ของโมเดลภาษาถูกฝึกด้วยงานเดียว: รับลำดับโทเคนแล้วทำนายโทเคนถัดไป หากทำซ้ำบนขนาดใหญ่ของชุดข้อมูล โมเดลพารามิเตอร์จะเริ่มเข้ารหัสไวยากรณ์ ความจริง รูปแบบการคิด ความเป็นมาตรฐานของโค้ด และสไตล์การเขียนของมนุษย์จำนวนมากที่สะสมมา
โมเดล LLM สมัยใหม่ส่วนใหญ่ใช้สถาปัตยกรรม transformer ที่มีกลไกการให้ความสนใจ (attention) ทำให้ทุกตำแหน่งในข้อมูลอินพุตสามารถส่งอิทธิพลต่อตำแหน่งอื่นได้ ทำให้ความสอดคล้องในระยะไกลเป็นไปได้ และทำให้การคำนวณเพิ่มขึ้นตามความยาวของลำดับ
การฝึกทำในหลายขั้นตอน Pre-training บนข้อความกว้างขวางสร้างความสามารถพื้นฐาน ตามด้วย Post-training — การปรับแต่งแบบมีผู้ดูแลโดยใช้ตัวอย่าง แล้วการเรียนรู้แบบเสริมแรงจากข้อเสนอแนะของมนุษย์หรือ AI — ทำให้ตัวทำนายข้อความกลายเป็นสิ่งที่ทำตามคำสั่งและปฏิเสธคำขอที่เป็นอันตราย
สองคุณลักษณะที่สำคัญในทางปฏิบัติคือ โมเดลเป็น stateless (ไร้สถานะ) — มันจำความจำอะไรไม่ได้ระหว่างคำขอ ยกเว้นสิ่งที่คุณใส่ใน context window และเป็น probabilistic — คำสั่งเดียวกันอาจให้ผลลัพธ์ที่แตกต่างกัน และความมั่นใจในสไตล์ของมันไม่ได้บ่งบอกถึงความถูกต้อง
คำถามที่พบบ่อย
- LLM เข้าใจสิ่งที่มันเขียนหรือไม่?
- มันไม่มีความเชื่อหรือเจตนาแบบมนุษย์ แต่สามารถจำลองโครงสร้างสถิติของภาษาได้ดีจนผลลัพธ์มักถูกต้องและเป็นประโยชน์ — แม้ว่าจะให้ข้อมูลที่มั่นใจผิดเมื่อโครงสร้างชี้ไปในทิศทางที่ผิดก็ตาม
- อะไรทำให้โมเดลภาษาเป็น “ขนาดใหญ่”?
- จำนวนพารามิเตอร์ ปริมาณข้อมูลฝึกอบรม และการคำนวณฝึกอบรม ล้วนมากกว่ารุ่นก่อนหน้าอย่างมาก โดยไม่มีเกณฑ์ทางการ; คำว่า “ขนาดใหญ่” เป็นคำเปรียบเทียบ และฐานอ้างอิงยังคงเคลื่อนที่ต่อเนื่อง