ปฏิวัติการฝึก AI ด้วย Tunix: เมื่อ AI Agent ช่วยทำ Post-training แบบอัตโนมัติบน Google TPUs

· By: TanasakP

11 ก.ย. 2026

ลองจินตนาการถึงการเข้านอนหลังจากเขียนข้อกำหนดในไฟล์ Markdown เพียงฉบับเดียว แล้วตื่นขึ้นมาพบว่า AI Agent ได้ทำการทดลอง LLM Fine-tuning ให้คุณหลายสิบรายการตลอดทั้งคืน ไม่ว่าจะเป็นการค้นหา LoRA ranks ที่เหมาะสมที่สุด, การปรับแต่ง Learning rate, การจูน Batch sizes ไปจนถึงการ Commit ทุกการปรับปรุงที่ผ่านการตรวจสอบแล้วลงใน Git โดยอัตโนมัติ

สิ่งนี้ไม่ใช่เรื่องเพ้อฝันอีกต่อไป เมื่อต้นปีที่ผ่านมา โปรเจกต์ autoresearch ได้แสดงให้เห็นว่า Autonomous LLM Agents สามารถสำรวจกระบวนการ Pre-training ซ้ำๆ ใน Loop ที่จบในตัวเองได้ ด้วยแรงบันดาลใจนี้ เราจึงสร้าง autofinetune ซึ่งเป็นการประยุกต์ใช้ Autonomous Research Loops กับกระบวนการ LLM Post-training ทั้งแบบ Supervised Fine-Tuning (SFT) และ Reinforcement Learning ผ่าน GRPO โดยใช้ AI Stack แบบครบวงจรของ Google ตั้งแต่ Tunix, Gemma, Cloud TPUs ที่ควบคุมด้วย Antigravity CLI และ Gemini Flash 3.7

ในบทความนี้ เราจะพาไปสำรวจว่า Autonomous Research Loop สำหรับ Post-training ทำงานอย่างไร พร้อมเจาะลึกกรณีศึกษาการทำ LLM Finetuning ในสถานการณ์จริง

ปรับเปลี่ยนวงจรการฝึก AI จากแรงมือสู่ระบบอัตโนมัติ

การทำ Post-training แบบดั้งเดิมมักประกอบด้วยวงจรที่ต้องทำซ้ำด้วยมือ ตั้งแต่การตั้งสมมติฐาน เช่น "การเพิ่ม attn_vec_einsum ใน LoRA target modules จะช่วยเพิ่มความแม่นยำหรือไม่?" ไปจนถึงการแก้ไขสคริปต์ไฮเปอร์พารามิเตอร์ รันงานบน Accelerator ตรวจสอบกราฟ Loss และบันทึกผลลง Spreadsheet ซึ่งเป็นขั้นตอนที่ใช้เวลาและแรงงานมหาศาล

จากแนวทางของ autoresearch เราสามารถทำให้ขั้นตอนเหล่านี้เป็นอัตโนมัติได้ด้วยพลังของ AI Agents ผ่าน 3 ขั้นตอนหลัก:

  1. ออกแบบ Arena (program.md): มนุษย์กำหนด Loop, เงื่อนไขขอบเขต, เกณฑ์การประเมิน และข้อจำกัดต่างๆ
  2. จัดเตรียมโค้ด (run.py): สร้างสคริปต์ Finetuning ที่สะอาดและจบในตัวเองเพียงไฟล์เดียว
  3. ปล่อยให้ Agent ทำงาน: Agent จะทำตามคำแนะนำใน program.md โดยจะแก้ไขโค้ด, รัน Training job, วัดผล Metric ที่กำหนด, เก็บผลงานที่ชนะ หรือย้อนคืนการตั้งค่าที่ทำให้ประสิทธิภาพลดลง พร้อมบันทึกผลลัพธ์ใน results.tsv โดยอัตโนมัติ

กรณีศึกษาที่ 1: การเพิ่มประสิทธิภาพ SFT สำหรับ FunctionGemma

ในการทดลองแรกของ autofinetune เราได้ขยายผลจากการตั้งค่า SFT แบบเดิมที่เคยนำเสนอใน blog ก่อนหน้า เพื่อปรับปรุงโมเดล google/functiongemma-270m-it บนชุดข้อมูล google/mobile-actions

การทดลองนี้ใช้ Cloud TPU v5e-1 ซึ่งสามารถรันการทดลองอัตโนมัติได้ถึง 20 ครั้งในเวลาเพียงไม่กี่ชั่วโมง โดยมีเป้าหมายหลักคือความแม่นยำ (Accuracy) ในการสร้าง Function call ซึ่ง Agent ได้รับอนุญาตให้ปรับเปลี่ยนค่า LoRA, Learning rates, Optimizers (เช่น AdamW/Muon) และ Batch size ได้ แต่ห้ามเปลี่ยนชุดข้อมูลหรือโครงสร้างหลักของโมเดล

ผลลัพธ์จากเส้นทาง (Trajectory) ใน sample_runs/SFT_results.tsv แสดงให้เห็นว่า Agent สามารถไต่ระดับประสิทธิภาพขึ้นไปได้อย่างต่อเนื่องผ่านการปรับแต่งค่าต่างๆ โดยอัตโนมัติ เพื่อให้ได้โมเดลที่สร้าง Function calls ได้ถูกต้องที่สุด

กรณีศึกษาที่ 2: การจูน Reinforcement Learning ที่ซับซ้อน

สำหรับการทดสอบที่ท้าทายยิ่งขึ้น เราได้นำ ตัวอย่าง GRPO อย่างเป็นทางการ จาก Tunix มาทำ Autonomous RL Finetuning กับโมเดล Gemma 3 1B เพื่อฝึกทักษะทางคณิตศาสตร์บนชุดข้อมูล GSM8K ซึ่งการทำ Reinforcement Learning นั้นมีความยากกว่ามากเนื่องจากความไวของ Hyperparameter และความไม่เสถียรของระบบ

ในการทดลองบน Cloud TPU v6e-1 นี้ เราใช้เวลา 2-3 วันสำหรับการรัน 40 ครั้ง โดยกำหนดตัวชี้วัดเป้าหมายเป็น Post_RL_metric (ผลรวมของความแม่นยำทางตัวเลขและรูปแบบการตอบ) ผลลัพธ์ที่บันทึกไว้ใน sample_runs/RL_results.tsv พบว่า Agent สามารถค้นหาการกำหนดค่า LoRA, Rollout temperature, KL penalty และ System prompt ที่ดีกว่าเดิม ส่งผลให้ Reward รวมเพิ่มขึ้นได้ประมาณ 10%

โปรเจกต์นี้แสดงให้เห็นถึงศักยภาพของ AI Agents ในการพลิกโฉมเวิร์กโฟลว์ LLM Finetuning ให้กลายเป็นระบบอัตโนมัติที่มีประสิทธิภาพ ผู้ที่สนใจสามารถตรวจสอบโค้ด ตัวอย่างการรัน และเทมเพลตได้ที่ autofinetune GitHub repository

Source: Google Developers Blog
ดูแลงานแปลและเรียบเรียงโดย TanasakP
ปฏิวัติการฝึก AI ด้วย Tunix: เมื่อ AI Agent ช่วยทำ Post-training แบบอัตโนมัติบน Google TPUs

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร