การปรับแต่ง
SFT · supervised fine-tuning · LoRA
กล่าวโดยย่อ
การปรับแต่งต่อเนื่องคือการฝึกโมเดลที่ถูกฝึกมาแล้วต่อด้วยชุดข้อมูลเฉพาะงานที่มีขนาดเล็กกว่า เพื่อปรับน้ำหนักให้ผลลัพธ์สอดคล้องกับรูปแบบ เสียง หรือทักษะที่จำกัดเฉพาะได้อย่างเชื่อถือได้ มันเป็นวิธีที่ไม่เหมาะสมในการสอนข้อเท็จจริง เนื่องจากข้อเท็จจริงมีการเปลี่ยนแปลงและควรได้รับการจัดหาจากการเรียกข้อมูลเมื่อต้องการ
Fine-tuning เริ่มจากโมเดลที่พูดภาษานั้นอยู่แล้วและปรับน้ำหนักของมันให้เอียงไปยังพฤติกรรมเฉพาะ คำถามที่ควรถามก่อนเริ่มต้นคือ: ปัญหาของฉันคือความรู้หรือพฤติกรรม? หากโมเดลไม่รู้หมวดหมู่สินค้าของคุณ การ fine-tuning เป็นเครื่องมือที่ไม่เหมาะสม — เพราะหมวดหมู่สินค้ามีการเปลี่ยนแปลงทุกสัปดาห์และการฝึกใหม่ทำไม่ได้ ใช้ retrieval. หากโมเดลรู้มากมายแต่ไม่สามารถส่งออก JSON schema ของคุณอย่างสม่ำเสมอ ใช้สไตล์ของบ้านคุณ หรือประยุกต์ใช้การจำแนกประเภทภายในของคุณ การ fine-tuning ทำได้ดีและราคาถูก
การ fine-tuning แบบ
คำถามที่พบบ่อย
- ผมต้องการตัวอย่างกี่ตัวเพื่อทำการ fine-tune?
- สำหรับรูปแบบและน้ำเสียง ตัวอย่างคุณภาพสูงจำนวนไม่กี่ร้อยตัวอย่างมักจะดีกว่าตัวอย่างที่มีสัญญาณรบกวนจำนวนหลายหมื่นตัวอย่าง ความสม่ำเสมอในชุดข้อมูลฝึกอบรมมีความสำคัญมากกว่าปริมาณ
- LoRA คืออะไร?
- Low-Rank Adaptation ใช้การฝึกโดยเพิ่มพารามิเตอร์จำนวนเล็กน้อยแทนการอัปเดตโมเดลทั้งหมด มันมีค่าใช้จ่ายน้อยกว่า สร้างไฟล์อแดปเตอร์ขนาดเล็กแทนการคัดลอกโมเดลทั้งหมด และเหมาะสำหรับงานปรับแต่งส่วนใหญ่