Dyna Robotics เปิดตัว Dyna-2: โมเดล World-Action ที่ฝึกด้วยวิดีโอมนุษย์กว่า 1 ล้านชั่วโมง

Dyna Robotics เปิดตัว Dyna-2 โมเดล World-Action สำหรับการหยิบจับของหุ่นยนต์ที่ผ่านการ Pre-train ด้วยวิดีโอมนุษย์ในมุมมองบุคคลที่หนึ่ง (Egocentric) มากกว่าหนึ่งล้านชั่วโมง หรือเทียบเท่ากับประสบการณ์การตื่นต่อเนื่องยาวนานถึง 170 ปี โดยปกติแล้ว การเรียนรู้ของหุ่นยนต์มักถูกจำกัดด้วยข้อมูลที่มีการระบุคำสั่งการเคลื่อนไหว (Action-labelled data) ซึ่งต้องสร้างขึ้นผ่านการควบคุมทางไกล (Teleoperation) แต่ Dyna-2 ได้เข้ามาพิสูจน์ว่าวิดีโอมนุษย์ทั่วไปสามารถนำมาทดแทนได้ โดยทีมวิจัยพบผลลัพธ์สำคัญ 3 ประการ ได้แก่ กฎการขยายขนาดบนข้อมูลมนุษย์ การถ่ายโอนกฎดังกล่าวไปยังหุ่นยนต์ที่ไม่เคยเห็นมาก่อน และการยืนยันว่าการทำนายวิดีโอคือหัวใจสำคัญของการถ่ายโอนองค์ความรู้นี้
สามารถนำไปใช้งานจริงได้หรือไม่?
คำตอบคือใช้ได้ แต่เป็นระบบที่ดำเนินการโดยผู้จำหน่าย (Vendor-operated system) ไม่ใช่โมเดลแบบ Open Source ที่ดาวน์โหลดได้ โดยทาง Dyna Robotics ยังไม่มีการประกาศปล่อย Checkpoint สาธารณะ หรือ API ให้ใช้งาน การนำไปใช้ในปัจจุบันจึงต้องเป็นการซื้อชุดหุ่นยนต์จาก Dyna โดยตรง
สำหรับกลุ่มเป้าหมายในปัจจุบัน หุ่นยนต์ Dyna-1 ได้เริ่มใช้งานจริงแล้วในโรงแรม ร้านอาหาร และร้านซักรีด ตามประกาศวันที่ 10 สิงหาคม 2026 ของบริษัท ซึ่งเหมาะกับธุรกิจบริการหรืองานอุตสาหกรรมเบาที่มีลักษณะการหยิบจับซ้ำๆ เช่น การเก็บถาดขยะ การประกอบกล่องบรรจุภัณฑ์ หรือการเตรียมไม้แขวนเสื้อ แต่ยังไม่เหมาะกับนักพัฒนารายย่อยที่ต้องการประมวลผลในเครื่องตนเอง
Dyna-2 คืออะไร
Dyna-2 คือ World-Action Model (WAM) ซึ่งเป็นโมเดลแบบ Generative หนึ่งเดียวที่สามารถขจัดสัญญาณรบกวน (Denoises) ในวิดีโออนาคตและชุดคำสั่งการเคลื่อนไหว (Action chunk) ไปพร้อมกันบนโครงสร้าง Video-diffusion โดยใช้สถาปัตยกรรมแบบ Transformer ที่แยกโทเค็นวิดีโอและแอ็คชั่นออกจากกัน แต่มีการประมวลผลร่วมกันผ่านชั้น DiT เพื่อให้หุ่นยนต์ตอบสนองได้ทันทีในขณะประมวลผลจริง
ในส่วนของการฝึกฝนนั้นใช้เทคนิค Flow matching โดยให้ค่าความสูญเสีย (Loss) ของทั้งวิดีโอและแอ็คชั่นใช้ส่วนลำตัวของเครือข่ายร่วมกัน แต่แยกการประมวลผลในส่วนปลาย ทำให้เครือข่ายแอ็คชั่นไม่ต้องรอประมวลผลวิดีโอในอนาคตก่อน ช่วยลดความหน่วง (Latency) ในการทำงานแบบเรียลไทม์ได้โดยไม่เสียประสิทธิภาพ
ผลลัพธ์การขยายขนาดสามประการ
ทีมวิจัยได้ทดสอบกฎการขยายขนาด (Scaling Law) โดยแบ่งชุดข้อมูลออกเป็นระดับตั้งแต่ 1,000 ไปจนถึง 1,000,000 ชั่วโมง และพบข้อสรุปที่น่าสนใจดังนี้:
- กฎการขยายขนาดเป็นจริงบนข้อมูลมนุษย์: ตัวชี้วัดต่างๆ ปรับปรุงขึ้นอย่างต่อเนื่องตามกฎยกกำลัง (Power laws) ตลอดช่วงการเพิ่มขนาดข้อมูล
- การถ่ายโอนกฎไปยังหุ่นยนต์ที่ไม่เคยเห็นมาก่อน: โมเดลสามารถทำคะแนนแบบ Zero-shot ในงานต่างๆ บนแพลตฟอร์มหุ่นยนต์ YAM ได้อย่างดีเยี่ยม โดยเห็นจุดเปลี่ยนที่ชัดเจนเมื่อข้อมูลเกิน 100,000 ชั่วโมง
- วิดีโอคือตัวขับเคลื่อนหลัก: การฝึกวิดีโอร่วมกับแอ็คชั่นให้ผลลัพธ์ที่ดีกว่าการฝึกเฉพาะแอ็คชั่นเพียงอย่างเดียวในทุกระดับ โดยวิดีโอช่วยสร้างองค์ความรู้ข้ามรูปลักษณ์ (Cross-embodiment) ได้อย่างชัดเจน
ผลลัพธ์บนตัวหุ่นยนต์
ในการทดสอบใช้งานจริง โมเดลที่ผ่านการฝึกในระดับต่างๆ ถูกนำมาทำ Post-training ในงานเฉพาะทาง 14 รายการ โดยใช้ข้อมูลหุ่นยนต์เพียงเล็กน้อย ผลปรากฏว่าคะแนนเฉลี่ยเพิ่มขึ้นจาก 20% เป็น 53% ตามลำดับความใหญ่ของข้อมูล โดยบางงาน เช่น การบิดเปิดฝาขวด สามารถเรียนรู้ได้จากการสาธิตเพียง 10 นาทีเท่านั้น
เมื่อเทียบกับ Dyna-1 รุ่นเดิม พบว่า Dyna-2 มีอัตราความสำเร็จสูงกว่าถึง 1.55 เท่า และสามารถผ่านเกณฑ์การผลิตจริงที่ 87% ในหน้างานของลูกค้าที่ไม่เคยพบมาก่อน นอกจากนี้ กระบวนการ Distillation ยังช่วยลดเวลาการประมวลผลสุ่มตัวอย่างวิดีโอลงจากกว่า 10 วินาที เหลือเพียง 110 มิลลิวินาทีบนชิป H100 เพียงเครื่องเดียว
ประเด็นสำคัญ
- Dyna-2 เป็นโมเดล World-Action ที่ฝึกด้วยวิดีโอมนุษย์แบบ Egocentric มหาศาลกว่า 1 ล้านชั่วโมง
- พิสูจน์ให้เห็นว่ากฎการขยายขนาด (Scaling Law) สามารถใช้ได้จริงกับข้อมูลมนุษย์ในงานหุ่นยนต์
- เป็นครั้งแรกที่มีการถ่ายโอนองค์ความรู้แบบ Zero-shot ไปยังหุ่นยนต์ที่ไม่เคยใช้ในการ Pre-training
- การฝึกร่วมกับวิดีโอเป็นปัจจัยหลักในการสร้างองค์ความรู้ข้ามรูปลักษณ์ที่หลากหลาย
- ปัจจุบันยังไม่มีการปล่อย Model Weights หรือ API โดยเน้นการให้บริการผ่านชุดหุ่นยนต์ของ Dyna เท่านั้น
อ่านรายงานทางเทคนิคฉับเต็ม: Dyna-2: A 1-Million-Hour Scaling Law for World-Action Models และ .
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
