tag: Policy Optimization

เทคนิค GRPO: ปรับจูนโมเดล 350M ให้สร้างข้อมูลแบบโครงสร้างได้แม่นยำใน 100 ขั้นตอน

เทคนิค GRPO: ปรับจูนโมเดล 350M ให้สร้างข้อมูลแบบโครงสร้างได้แม่นยำใน 100 ขั้นตอน

เจาะลึกการใช้ Group Relative Policy Optimization (GRPO) เพื่อ Fine-tuning โมเดลภาษาขนาดเล็กให้รองรับ Structured Outputs ได้อย่างมีประสิทธิภาพด้วยการฝึกฝนเพียง 100 ขั้นตอน