เทคนิค GRPO: ปรับจูนโมเดล 350M ให้สร้างข้อมูลแบบโครงสร้างได้แม่นยำใน 100 ขั้นตอนtag: Fine-tuning, GRPO, Language Models, Policy Optimization, Structured OutputsSep 3, 2026 · By: TanasakPเจาะลึกการใช้ Group Relative Policy Optimization (GRPO) เพื่อ Fine-tuning โมเดลภาษาขนาดเล็กให้รองรับ Structured Outputs ได้อย่างมีประสิทธิภาพด้วยการฝึกฝนเพียง 100 ขั้นตอน