ปฏิวัติการฝึก AI ด้วย Tunix: เมื่อ AI Agent ช่วยทำ Post-training แบบอัตโนมัติบน Google TPUs
11 ก.ย. 2026
ลองจินตนาการถึงการเข้านอนหลังจากเขียนข้อกำหนดในไฟล์ Markdown เพียงฉบับเดียว แล้วตื่นขึ้นมาพบว่า AI Agent ได้ทำการทดลอง LLM Fine-tuning ให้คุณหลายสิบรายการตลอดทั้งคืน ไม่ว่าจะเป็นการค้นหา LoRA ranks ที่เหมาะสมที่สุด, การปรับแต่ง Learning rate, การจูน Batch sizes ไปจนถึงการ Commit ทุกการปรับปรุงที่ผ่านการตรวจสอบแล้วลงใน Git โดยอัตโนมัติ
สิ่งนี้ไม่ใช่เรื่องเพ้อฝันอีกต่อไป เมื่อต้นปีที่ผ่านมา โปรเจกต์ autoresearch ได้แสดงให้เห็นว่า Autonomous LLM Agents สามารถสำรวจกระบวนการ Pre-training ซ้ำๆ ใน Loop ที่จบในตัวเองได้ ด้วยแรงบันดาลใจนี้ เราจึงสร้าง autofinetune ซึ่งเป็นการประยุกต์ใช้ Autonomous Research Loops กับกระบวนการ LLM Post-training ทั้งแบบ Supervised Fine-Tuning (SFT) และ Reinforcement Learning ผ่าน GRPO โดยใช้ AI Stack แบบครบวงจรของ Google ตั้งแต่ Tunix, Gemma, Cloud TPUs ที่ควบคุมด้วย Antigravity CLI และ Gemini Flash 3.7
ในบทความนี้ เราจะพาไปสำรวจว่า Autonomous Research Loop สำหรับ Post-training ทำงานอย่างไร พร้อมเจาะลึกกรณีศึกษาการทำ LLM Finetuning ในสถานการณ์จริง
ปรับเปลี่ยนวงจรการฝึก AI จากแรงมือสู่ระบบอัตโนมัติ
การทำ Post-training แบบดั้งเดิมมักประกอบด้วยวงจรที่ต้องทำซ้ำด้วยมือ ตั้งแต่การตั้งสมมติฐาน เช่น "การเพิ่ม attn_vec_einsum ใน LoRA target modules จะช่วยเพิ่มความแม่นยำหรือไม่?" ไปจนถึงการแก้ไขสคริปต์ไฮเปอร์พารามิเตอร์ รันงานบน Accelerator ตรวจสอบกราฟ Loss และบันทึกผลลง Spreadsheet ซึ่งเป็นขั้นตอนที่ใช้เวลาและแรงงานมหาศาล
จากแนวทางของ autoresearch เราสามารถทำให้ขั้นตอนเหล่านี้เป็นอัตโนมัติได้ด้วยพลังของ AI Agents ผ่าน 3 ขั้นตอนหลัก:
- ออกแบบ Arena (
program.md): มนุษย์กำหนด Loop, เงื่อนไขขอบเขต, เกณฑ์การประเมิน และข้อจำกัดต่างๆ - จัดเตรียมโค้ด (
run.py): สร้างสคริปต์ Finetuning ที่สะอาดและจบในตัวเองเพียงไฟล์เดียว - ปล่อยให้ Agent ทำงาน: Agent จะทำตามคำแนะนำใน
program.mdโดยจะแก้ไขโค้ด, รัน Training job, วัดผล Metric ที่กำหนด, เก็บผลงานที่ชนะ หรือย้อนคืนการตั้งค่าที่ทำให้ประสิทธิภาพลดลง พร้อมบันทึกผลลัพธ์ในresults.tsvโดยอัตโนมัติ
กรณีศึกษาที่ 1: การเพิ่มประสิทธิภาพ SFT สำหรับ FunctionGemma
ในการทดลองแรกของ autofinetune เราได้ขยายผลจากการตั้งค่า SFT แบบเดิมที่เคยนำเสนอใน blog ก่อนหน้า เพื่อปรับปรุงโมเดล google/functiongemma-270m-it บนชุดข้อมูล google/mobile-actions
การทดลองนี้ใช้ Cloud TPU v5e-1 ซึ่งสามารถรันการทดลองอัตโนมัติได้ถึง 20 ครั้งในเวลาเพียงไม่กี่ชั่วโมง โดยมีเป้าหมายหลักคือความแม่นยำ (Accuracy) ในการสร้าง Function call ซึ่ง Agent ได้รับอนุญาตให้ปรับเปลี่ยนค่า LoRA, Learning rates, Optimizers (เช่น AdamW/Muon) และ Batch size ได้ แต่ห้ามเปลี่ยนชุดข้อมูลหรือโครงสร้างหลักของโมเดล
ผลลัพธ์จากเส้นทาง (Trajectory) ใน sample_runs/SFT_results.tsv แสดงให้เห็นว่า Agent สามารถไต่ระดับประสิทธิภาพขึ้นไปได้อย่างต่อเนื่องผ่านการปรับแต่งค่าต่างๆ โดยอัตโนมัติ เพื่อให้ได้โมเดลที่สร้าง Function calls ได้ถูกต้องที่สุด
กรณีศึกษาที่ 2: การจูน Reinforcement Learning ที่ซับซ้อน
สำหรับการทดสอบที่ท้าทายยิ่งขึ้น เราได้นำ ตัวอย่าง GRPO อย่างเป็นทางการ จาก Tunix มาทำ Autonomous RL Finetuning กับโมเดล Gemma 3 1B เพื่อฝึกทักษะทางคณิตศาสตร์บนชุดข้อมูล GSM8K ซึ่งการทำ Reinforcement Learning นั้นมีความยากกว่ามากเนื่องจากความไวของ Hyperparameter และความไม่เสถียรของระบบ
ในการทดลองบน Cloud TPU v6e-1 นี้ เราใช้เวลา 2-3 วันสำหรับการรัน 40 ครั้ง โดยกำหนดตัวชี้วัดเป้าหมายเป็น Post_RL_metric (ผลรวมของความแม่นยำทางตัวเลขและรูปแบบการตอบ) ผลลัพธ์ที่บันทึกไว้ใน sample_runs/RL_results.tsv พบว่า Agent สามารถค้นหาการกำหนดค่า LoRA, Rollout temperature, KL penalty และ System prompt ที่ดีกว่าเดิม ส่งผลให้ Reward รวมเพิ่มขึ้นได้ประมาณ 10%
โปรเจกต์นี้แสดงให้เห็นถึงศักยภาพของ AI Agents ในการพลิกโฉมเวิร์กโฟลว์ LLM Finetuning ให้กลายเป็นระบบอัตโนมัติที่มีประสิทธิภาพ ผู้ที่สนใจสามารถตรวจสอบโค้ด ตัวอย่างการรัน และเทมเพลตได้ที่ autofinetune GitHub repository

ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
