การจัดแนว
RLHF · post-training · safety tuning
กล่าวโดยย่อ
การจัดแนวเป็นกระบวนการปรับพฤติกรรมของโมเดลที่ได้รับการฝึกแล้ว ให้ทำตามคำสั่ง บอกความจริงเท่าที่ทำได้ และปฏิเสธคำขอที่เป็นอันตราย กระบวนการนี้เกิดขึ้นหลังจากการฝึกเบื้องต้น โดยส่วนใหญ่ทำผ่านการฝึกแบบมีผู้ดูแล (supervised fine-tuning) บนตัวอย่างต่าง ๆ และการเรียนรู้แบบเสริมแรง (reinforcement learning) จากข้อเสนอแนะของมนุษย์หรือ AI
โมเดลที่ออกมาจากการฝึกฝนเบื้องต้นจะทำนายข้อความ มันไม่ทำตามคำสั่ง ไม่ได้ให้ความสำคัญกับความจริงมากกว่าความน่าจะเป็น และไม่มีแนวคิดเกี่ยวกับสิ่งที่ควรปฏิเสธ การปรับแนว (Alignment) คือสิ่งที่ทำให้โมเดลกลายเป็นผู้ช่วย
กระบวนการมาตรฐานมีสองขั้นตอน การปรับละเอียดแบบมีผู้สอน (Supervised fine-tuning) ฝึกฝนจากตัวอย่างการตอบสนองที่ดีที่คัดสรรมา การปรับให้เหมาะสมตามความชอบ (Preference optimisation) — RLHF หรือวิธีการต่างๆ เช่น DPO ที่ข้ามขั้นตอนของโมเดลให้คะแนน (reward model) — ฝึกฝนโมเดลให้เลือกการตอบสนองที่ผู้คนให้คะแนนสูงกว่า
แนวทางตามหลักการ (Constitutional approaches) ใช้ชุดหลักการที่เขียนขึ้นมาแทนที่การติดป้ายกำกับโดยมนุษย์ส่วนใหญ่: โมเดลจะวิจารณ์และแก้ไขผลลัพธ์ของตนเองเทียบกับกฎที่ระบุไว้ ทำให้เกิดข้อมูลความชอบในวงกว้าง
มีข้อจำกัดสองประการที่ควรทำความเข้าใจให้ชัดเจน การปรับแนวเป็น พฤติกรรม ไม่ใช่ความรู้ (behavioural, not epistemic) — มันทำให้โมเดลทำงานอย่างมีประโยชน์และปฏิเสธอย่างเหมาะสม มันไม่ได้ให้กลไกในการรู้ว่าข้อความนั้นจริงหรือไม่ ซึ่งเป็นเหตุผลว่าทำไม การหลอน (hallucination) จึงยังคงอยู่ และมันเป็น ข้อโต้แย้ง (contested): ค่านิยมของใคร การปฏิเสธแบบใด และความระมัดระวังมากน้อยเพียงใดก่อนที่โมเดลจะไร้ประโยชน์ เป็นคำถามที่ไม่มีคำตอบทางเทคนิค
โปรแกรมการวิจัยขยายขอบเขตไปไกลกว่าพฤติกรรมของผลิตภัณฑ์ — การตีความ (interpretability) การประเมินความสามารถที่เป็นอันตราย (evaluation of dangerous capabilities) การกำกับดูแลที่ปรับขนาดได้ (scalable oversight) — แต่ในการใช้งานเชิงพาณิชย์ คำว่า "ปรับแนวแล้ว (aligned)" มักจะหมายถึงความหมายที่แคบกว่าที่อธิบายไว้ข้างต้น
คำถามที่พบบ่อย
- RLHF คืออะไร?
- การเรียนรู้แบบ Reinforcement จากข้อเสนอแนะของมนุษย์: คนจะจัดอันดับคำตอบของโมเดลที่แตกต่างกัน; โมเดลรางวัลถูกฝึกจากอันดับเหล่านั้น; และโมเดลถูกปรับแต่งให้ทำงานตามอันดับนั้น การเปลี่ยนแปลงบางส่วนจะใช้การจัดอันดับของ AI แทนการจัดอันดับของมนุษย์
- การจัดแนวทำให้โมเดลมีความสามารถลดลงหรือไม่?
- มันอาจเกิดขึ้นที่ขอบเขต — การปฏิเสธที่ระมัดระวังเกินจำเป็นต่อคำขอที่ไม่เป็นอันตรายเป็นเรื่องปกติ การสร้างสมดุลระหว่างความช่วยเหลือและความระมัดระวังเป็นการตั้งค่าที่ชัดเจน ไม่ใช่เรื่องบังเอิญ