Skip to content
โมเดลและงานวิจัย

โมเดลภาษาขนาดใหญ่ (LLM)

LLM · foundation model

กล่าวโดยย่อ

โมเดลภาษาขนาดใหญ่คือเครือข่ายประสาทที่มีพารามิเตอร์หลายพันล้านตัว ซึ่งถูกฝึกด้วยชุดข้อความขนาดใหญ่เพื่อทำนาย token ถัดไปในลำดับ หนึ่งเป้าหมายเดียวที่ทำได้เพียงพอในระดับขนาดใหญ่ จะทำให้สามารถตอบคำถาม เขียนโค้ด แปลภาษา และสรุปสาระสำคัญได้ — แม้ว่าจะไม่ได้ถูกฝึกมาเพื่อทำอย่างนั้นโดยตรง

ขนาดใหญ่ของโมเดลภาษาถูกฝึกด้วยงานเดียว: รับลำดับโทเคนแล้วทำนายโทเคนถัดไป หากทำซ้ำบนขนาดใหญ่ของชุดข้อมูล โมเดลพารามิเตอร์จะเริ่มเข้ารหัสไวยากรณ์ ความจริง รูปแบบการคิด ความเป็นมาตรฐานของโค้ด และสไตล์การเขียนของมนุษย์จำนวนมากที่สะสมมา

โมเดล LLM สมัยใหม่ส่วนใหญ่ใช้สถาปัตยกรรม transformer ที่มีกลไกการให้ความสนใจ (attention) ทำให้ทุกตำแหน่งในข้อมูลอินพุตสามารถส่งอิทธิพลต่อตำแหน่งอื่นได้ ทำให้ความสอดคล้องในระยะไกลเป็นไปได้ และทำให้การคำนวณเพิ่มขึ้นตามความยาวของลำดับ

การฝึกทำในหลายขั้นตอน Pre-training บนข้อความกว้างขวางสร้างความสามารถพื้นฐาน ตามด้วย Post-training — การปรับแต่งแบบมีผู้ดูแลโดยใช้ตัวอย่าง แล้วการเรียนรู้แบบเสริมแรงจากข้อเสนอแนะของมนุษย์หรือ AI — ทำให้ตัวทำนายข้อความกลายเป็นสิ่งที่ทำตามคำสั่งและปฏิเสธคำขอที่เป็นอันตราย

สองคุณลักษณะที่สำคัญในทางปฏิบัติคือ โมเดลเป็น stateless (ไร้สถานะ) — มันจำความจำอะไรไม่ได้ระหว่างคำขอ ยกเว้นสิ่งที่คุณใส่ใน context window และเป็น probabilistic — คำสั่งเดียวกันอาจให้ผลลัพธ์ที่แตกต่างกัน และความมั่นใจในสไตล์ของมันไม่ได้บ่งบอกถึงความถูกต้อง

คำถามที่พบบ่อย

LLM เข้าใจสิ่งที่มันเขียนหรือไม่?
มันไม่มีความเชื่อหรือเจตนาแบบมนุษย์ แต่สามารถจำลองโครงสร้างสถิติของภาษาได้ดีจนผลลัพธ์มักถูกต้องและเป็นประโยชน์ — แม้ว่าจะให้ข้อมูลที่มั่นใจผิดเมื่อโครงสร้างชี้ไปในทิศทางที่ผิดก็ตาม
อะไรทำให้โมเดลภาษาเป็น “ขนาดใหญ่”?
จำนวนพารามิเตอร์ ปริมาณข้อมูลฝึกอบรม และการคำนวณฝึกอบรม ล้วนมากกว่ารุ่นก่อนหน้าอย่างมาก โดยไม่มีเกณฑ์ทางการ; คำว่า “ขนาดใหญ่” เป็นคำเปรียบเทียบ และฐานอ้างอิงยังคงเคลื่อนที่ต่อเนื่อง

ดูเพิ่มเติม

อัปเดตล่าสุด 22 ส.ค. 2569

อ่านในภาษา