Skip to content
โมเดลและงานวิจัย

การผสมผสานผู้เชี่ยวชาญ (MoE)

MoE · sparse model

กล่าวโดยย่อ

Mixture of experts แบ่งส่วนของเครือข่ายเป็นหลายส่วนย่อยที่ทำงานในเชิงเส้นขนานกัน และใช้ตัว router ส่ง token แต่ละตัวผ่านเฉพาะส่วนย่อยบางส่วนเท่านั้น การนับจำนวนพารามิเตอร์ทั้งหมดยังคงมาก แต่การคำนวณต่อ token ยังคงน้อย ทำให้หลายโมเดลขนาดใหญ่สามารถให้บริการได้ในราคาที่ต่ำกว่าขนาดที่คาดไว้

ในโมเดลแบบหนาแน่น ทุกพารามิเตอร์มีส่วนร่วมในการประมวลผลทุก token. ในโมเดลแบบ mixture-of-experts (MoE) บางชั้นจะถูกแทนที่ด้วยชุดของ experts ที่ทำงานใน parallel และเครือข่าย router ขนาดเล็กจะเลือกว่า token แต่ละตัวจะผ่านผ่าน experts ใดสองหรือสามตัว

จุดสำคัญคือ economics. โมเดลอาจมีพารามิเตอร์รวมหลายร้อยพันล้านตัว แต่อาจมีการเปิดใช้งานเพียงแค่หลายสิบพันล้านตัวต่อ token. ความจุเพิ่มขึ้นตามจำนวนพารามิเตอร์ทั้งหมด; ค่าใช้จ่ายในการคำนวณเพิ่มขึ้นตามส่วนที่ถูกใช้งานจริง

ข้อแลกเปลี่ยนคือเรื่องหน่วยความจำ. ทั้งหมดของ experts ต้องอยู่ในหน่วยความจำและสามารถเข้าถึงได้ ดังนั้นความต้องการของฮาร์ดแวร์จึงตามจำนวนพารามิเตอร์ทั้งหมด แม้ว่าการคำนวณจะอิงตามจำนวนที่ถูกใช้งานจริง. ทำให้โมเดล MoE มีความน่าสนใจสำหรับผู้ดำเนินการที่ทำงานระดับใหญ่ แต่กลับทำให้ผู้ที่พยายามใส่โมเดลลงใน accelerator เดียวเป็นเรื่องที่ยุ่งยาก

การฝึกฝนก็มีความท้าทายของ riêngมัน: หาก router ส่ง token ส่วนใหญ่ไปยัง experts ที่ชอบเพียงไม่กี่ตัว ตัวอื่น ๆ จะไม่ได้รับการเรียนรู้ที่เป็นประโยชน์. โอเปอเรชัน load-balancing ถูกออกแบบมาเพื่อป้องกันสิ่งนี้และเพิ่มปัญหาการปรับตั้งค่าที่โมเดลแบบ dense ไม่มี.

คำถามที่พบบ่อย

ทำไมโมเดล MoE จึงรายงานจำนวนพารามิเตอร์สองค่า?
พารามิเตอร์รวมของโมเดลหมายถึงจำนวนพารามิเตอร์ทั้งหมด ส่วนพารามิเตอร์ที่ใช้งานต่อโทเคนหมายถึงจำนวนที่ถูกใช้ในแต่ละโทเคน การคำนวณค่าใช้จ่ายจะติดตามจำนวนที่ใช้งาน ส่วนความต้องการหน่วยความจำจะติดตามจำนวนรวม
MoE โมเดลแย่กว่าโมเดลหนาแน่นหรือไม่?
ไม่ได้โดยธรรมชาติ แต่ให้ความจุต่อหน่วยการคำนวณมากขึ้น โดยแลกกับความต้องการหน่วยความจำที่สูงขึ้นและการฝึกที่ซับซ้อนมากขึ้น เพราะตัวจัดเส้นทางต้องเรียนรู้การกระจายงานอย่างเท่าเทียม

ดูเพิ่มเติม

อัปเดตล่าสุด 22 ส.ค. 2569

อ่านในภาษา