การผสมผสานผู้เชี่ยวชาญ (MoE)
MoE · sparse model
กล่าวโดยย่อ
Mixture of experts แบ่งส่วนของเครือข่ายเป็นหลายส่วนย่อยที่ทำงานในเชิงเส้นขนานกัน และใช้ตัว router ส่ง token แต่ละตัวผ่านเฉพาะส่วนย่อยบางส่วนเท่านั้น การนับจำนวนพารามิเตอร์ทั้งหมดยังคงมาก แต่การคำนวณต่อ token ยังคงน้อย ทำให้หลายโมเดลขนาดใหญ่สามารถให้บริการได้ในราคาที่ต่ำกว่าขนาดที่คาดไว้
ในโมเดลแบบหนาแน่น ทุกพารามิเตอร์มีส่วนร่วมในการประมวลผลทุก token. ในโมเดลแบบ mixture-of-experts (MoE) บางชั้นจะถูกแทนที่ด้วยชุดของ experts ที่ทำงานใน parallel และเครือข่าย router ขนาดเล็กจะเลือกว่า token แต่ละตัวจะผ่านผ่าน experts ใดสองหรือสามตัว
จุดสำคัญคือ economics. โมเดลอาจมีพารามิเตอร์รวมหลายร้อยพันล้านตัว แต่อาจมีการเปิดใช้งานเพียงแค่หลายสิบพันล้านตัวต่อ token. ความจุเพิ่มขึ้นตามจำนวนพารามิเตอร์ทั้งหมด; ค่าใช้จ่ายในการคำนวณเพิ่มขึ้นตามส่วนที่ถูกใช้งานจริง
ข้อแลกเปลี่ยนคือเรื่องหน่วยความจำ. ทั้งหมดของ experts ต้องอยู่ในหน่วยความจำและสามารถเข้าถึงได้ ดังนั้นความต้องการของฮาร์ดแวร์จึงตามจำนวนพารามิเตอร์ทั้งหมด แม้ว่าการคำนวณจะอิงตามจำนวนที่ถูกใช้งานจริง. ทำให้โมเดล MoE มีความน่าสนใจสำหรับผู้ดำเนินการที่ทำงานระดับใหญ่ แต่กลับทำให้ผู้ที่พยายามใส่โมเดลลงใน accelerator เดียวเป็นเรื่องที่ยุ่งยาก
การฝึกฝนก็มีความท้าทายของ riêngมัน: หาก router ส่ง token ส่วนใหญ่ไปยัง experts ที่ชอบเพียงไม่กี่ตัว ตัวอื่น ๆ จะไม่ได้รับการเรียนรู้ที่เป็นประโยชน์. โอเปอเรชัน load-balancing ถูกออกแบบมาเพื่อป้องกันสิ่งนี้และเพิ่มปัญหาการปรับตั้งค่าที่โมเดลแบบ dense ไม่มี.
คำถามที่พบบ่อย
- ทำไมโมเดล MoE จึงรายงานจำนวนพารามิเตอร์สองค่า?
- พารามิเตอร์รวมของโมเดลหมายถึงจำนวนพารามิเตอร์ทั้งหมด ส่วนพารามิเตอร์ที่ใช้งานต่อโทเคนหมายถึงจำนวนที่ถูกใช้ในแต่ละโทเคน การคำนวณค่าใช้จ่ายจะติดตามจำนวนที่ใช้งาน ส่วนความต้องการหน่วยความจำจะติดตามจำนวนรวม
- MoE โมเดลแย่กว่าโมเดลหนาแน่นหรือไม่?
- ไม่ได้โดยธรรมชาติ แต่ให้ความจุต่อหน่วยการคำนวณมากขึ้น โดยแลกกับความต้องการหน่วยความจำที่สูงขึ้นและการฝึกที่ซับซ้อนมากขึ้น เพราะตัวจัดเส้นทางต้องเรียนรู้การกระจายงานอย่างเท่าเทียม