นักวิจัย UC Berkeley เปิดตัว CUA-Lite แพลตฟอร์ม Open Source ครบวงจรสำหรับ AI สาย Computer-Use Agents

ทีมวิจัยจาก UC Berkeley เปิดตัว CUA-Lite แพลตฟอร์มเปิดสำหรับ Computer-use agents (CUAs) ที่มุ่งเน้นการแก้ปัญหาด้านโครงสร้างพื้นฐานมากกว่าตัวโมเดล โดยปกติแล้ว การฝึกฝนและทำ Benchmark ของ CUA จำเป็นต้องใช้ 4 ส่วนประกอบสำคัญ ได้แก่ agent, สภาพแวดล้อม, ร่องรอยข้อมูล (trace) และเฟรมเวิร์กการประเมิน ซึ่งมักจะกระจัดกระจายและทำงานร่วมกันได้ยาก
CUA-Lite จึงถูกสร้างขึ้นเพื่อรวมองค์ประกอบเหล่านี้ไว้ภายใต้ Action Space, Data Schema และชุดคำสั่งเดียวที่รองรับทั้งระบบเดสก์ท็อป เบราว์เซอร์ และมือถือ ช่วยให้นักพัฒนาสามารถติดตั้งสแต็กทั้งหมดได้ง่ายๆ ด้วยคำสั่ง uv sync --all-extras บน Python 3.12 โดยตัว Sandbox มีน้ำหนักเบาและรันบน Docker ได้ทันทีโดยไม่ต้องพึ่งพา /dev/kvm ทำให้ใช้งานบน Cloud instance หรือ CI runner ได้อย่างสะดวก
ภาษีของ VM และวิธีที่ Lite.OSWorld กำจัดมันออกไป
นวัตกรรมสำคัญของโครงการนี้คือ Lite.OSWorld ซึ่งปรับปรุงจาก OSWorld เดิมที่ต้องรันผ่าน QEMU/KVM virtual machine (VM) แบบเต็มรูปแบบ ซึ่งกินทรัพยากรสูงและต้องใช้ Nested Virtualization แต่ CUA-Lite ได้เปลี่ยนมาใช้เดสก์ท็อป GNOME ภายใน Docker container ธรรมดาแทน
| ภารกิจ | OSWorld | Lite.OSWorld |
|---|---|---|
| Runtime | QEMU/KVM VM | Docker container |
| ความต้องการ Host | /dev/kvm, nested virt | Docker host ใดก็ได้ |
| หน่วยความจำ | 4.1 GB | 0.9 GB |
| Cold start | 29.9 s | 23.8 s |
| การทำงานขนาน | baseline | จำนวน instance มากขึ้น ~4.6 เท่า |
| ชุดภารกิจ | OSWorld | เหมือนกันทุกประการ |
แม้จะเปลี่ยนจาก VM มาเป็น Container แต่ผลการทดสอบกับโมเดล 13 รุ่นพบว่า คะแนนความแม่นยำของ Lite.OSWorld ตรงกับต้นฉบับดั้งเดิม ทำให้ข้อมูลการฝึกฝนใน Container สามารถนำไปใช้กับ Benchmark จริงได้ทันที ปัจจุบันรองรับ Sandbox หลากหลายตัว เช่น Lite.ScaleCUA, Lite.CUAGym และ Lite.CUAWorld ซึ่งครอบคลุมแอปพลิเคชันกว่า 40 รายการ อาทิ Blender, QGIS และ VS Code รวมแล้วมีภารกิจที่ตรวจสอบได้มากกว่า 30,000 ภารกิจ
หนึ่ง Schema สำหรับข้อมูล และ Adapter ที่รองรับทุกโมเดล
เลเยอร์ที่สองของ CUA-Lite คือ LiteSample ซึ่งเป็น Schema สำหรับการเรียนรู้แบบมีผู้สอน (Supervised Learning) หนึ่งเดียวที่ใช้ร่วมกันได้ในทุกสภาพแวดล้อมและทุกประเภทภารกิจ โดยข้อมูลจะอยู่ในรูปแบบ Parquet พร้อมรูปภาพ นอกจากนี้ทีมวิจัยยังได้นำชุดข้อมูล CUA เดิมกว่า 10 ชุด มาปรับให้อยู่ในรูปแบบนี้และแจกจ่ายฟรีบน Hugging Face
ชุดข้อมูลที่น่าสนใจประกอบด้วย Aguvis, OpenCUA และอื่นๆ อีกมากมาย รวมถึง rollout datasets ที่สร้างจากการรันโมเดลระดับเรือธงเพื่อใช้ในการสกัดความรู้ (Distillation) ให้กับโมเดลขนาดเล็ก โดยเฟรมเวิร์กมี Adapter เฉพาะเพื่อปรับ LiteSample ให้เข้ากับรูปแบบการฝึกของแต่ละโมเดล รวมถึงมีระบบ History Collapsing เพื่อช่วยประหยัดทรัพยากรในการประมวลผล
Eval, SFT และ RL ภายใต้หนึ่งคำสั่ง
ในส่วนของ lite.gym ได้ทำหน้าที่เป็นจุดเชื่อมต่อระหว่าง Agent และสภาพแวดล้อม โดยรองรับโมเดลดังกว่า 10 ตัว เช่น GPT, Claude, Gemini, Qwen3-VL รวมถึง UI-TARS และ Fara-7B พร้อมรวม Benchmark ไว้กว่า 15 รายการ ครอบคลุมทั้งการระบุตำแหน่งบนหน้าจอ (ScreenSpot-Pro), เดสก์ท็อป, เบราว์เซอร์ (WebArena) และมือถือ (AndroidWorld)
แพลตฟอร์มนี้ยังรองรับการทำ Fine-tuning (SFT) และ Reinforcement Learning (RL) อย่างครบวงจร ตัวอย่างเช่นการทำ Fine-tuning Qwen3-VL-2B-Instruct บนชุดข้อมูล Lite.ScaleCUA ซึ่งช่วยเพิ่มประสิทธิภาพการทำงานได้จริง ส่วนในด้าน RL ก็มีการใช้การอัปเดตแบบ GRPO บน Slime เพื่อยกระดับความสามารถของ Agent ในภารกิจบนมือถือผ่าน MobileGym
คำอธิบายแบบโต้ตอบ
ประเด็นสำคัญ
- CUA-Lite รวบรวม Agent, สภาพแวดล้อม และชุดข้อมูลไว้ภายใต้โครงสร้างเดียวกัน เพื่อความง่ายในการพัฒนา
- Lite.OSWorld ลดขนาดสภาพแวดล้อมเหลือ 0.9 GB และรันขนานได้มากกว่าเดิม 4.6 เท่า โดยไม่ต้องใช้ VM
- ผลการทดสอบยืนยันว่าการฝึกฝนใน Container ให้ผลลัพธ์แม่นยำเทียบเท่าการใช้ VM จริง
- มีภารกิจให้ทดสอบกว่า 30,000 ภารกิจ พร้อมชุดข้อมูลแจกฟรีบน Hugging Face
- ใช้งานได้บน Docker ทุกระบบ แต่ควรตรวจสอบใบอนุญาต (License) ก่อนนำไปใช้ในเชิงพาณิชย์
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
