Axis Robotics เปิดตัว AXIS เอนจินข้อมูลบนเบราว์เซอร์ พร้อมชุดข้อมูลควบคุมหุ่นยนต์กว่า 5 หมื่นรายการ

Axis Robotics เปิดตัว AXIS เอนจินข้อมูลบนเบราว์เซอร์ พร้อมชุดข้อมูลควบคุมหุ่นยนต์กว่า 5 หมื่นรายการ

ชุดข้อมูลการควบคุมหุ่นยนต์มีอัตราการเติบโตที่ช้ากว่าการพัฒนาโมเดลอย่างมาก เนื่องจากข้อจำกัดของระบบเดิมที่เป็นแบบปิดและรวมศูนย์ โดยผู้เชี่ยวชาญต้องเก็บข้อมูลสาธิตจากฮาร์ดแวร์ในห้องปฏิบัติการและประมวลผลแบบออฟไลน์ ทำให้ได้ชุดข้อมูลมาตรฐานที่คงที่และไม่สามารถขยายตัวได้

ทีมวิจัยจาก Axis Robotics, UC Berkeley, Georgia Tech และ NTU จึงได้เสนอทางออกใหม่ผ่านระบบ AXIS ซึ่งย้ายการเก็บข้อมูลการสาธิตมาอยู่บนเว็บเบราว์เซอร์แทน โดยผลักภาระการคำนวณที่ซับซ้อนไปยัง GPU ฝั่งแบ็กเอนด์ ทำให้สามารถจัดการชุดข้อมูลให้ขยายตัวได้อย่างต่อเนื่อง

ในด้านการนำไปใช้งานจริง training code ได้ถูกเปิดเผยสู่สาธารณะในรูปแบบ patch layer บน OpenPI และมี teleoperation platform ให้ใช้งานผ่านเบราว์เซอร์ทั่วไป ส่วน dataset on Hugging Face ขนาด 2.36 TB ถูกจำกัดไว้เพื่อการใช้งานทางวิชาการเท่านั้น โดยไม่มีการปล่อย policy checkpoints ออกมา

การแยกส่วนระหว่างเบราว์เซอร์และแบ็กเอนด์

หัวใจสำคัญของ AXIS คือระบบที่ไม่สมมาตร (asymmetry) โดยผู้ร่วมทดสอบสามารถควบคุมหุ่นยนต์ Franka Research 3 ผ่านหน้าเว็บด้วยเทคโนโลยี MuJoCo WebAssembly โดยใช้อุปกรณ์ทั่วไปอย่างคีย์บอร์ด เมาส์ หรือเกมแพด ขณะที่การคำนวณฟิสิกส์และการเรนเดอร์ภาพจะทำงานแยกจากส่วนติดต่อผู้ใช้ (UI) เพื่อให้ข้อมูลสถานะการเคลื่อนที่ยังคงแม่นยำตามเครื่องจำลองเสมอ

การประมวลผลหนักจะถูกส่งไปที่แบ็กเอนด์ซึ่งใช้ GPU RTX 4090 จำนวน 8 ตัวสำหรับการเรนเดอร์ และ GPU A100 อีก 8 ตัวสำหรับการฝึกสอนและประเมินผล นอกจากนี้ยังมีระบบ TaskGen ที่ช่วยสร้างภารกิจโดยอัตโนมัติจากคำสั่งภาษาธรรมชาติ พร้อมการสร้างวัตถุ 3D และตรวจสอบความสำเร็จของภารกิจซ้ำที่ฝั่งแบ็กเอนด์เพื่อความถูกต้องสูงสุด

ข้อมูลในชุดข้อมูลประกอบด้วยอะไรบ้าง

ชุดข้อมูลที่เผยแพร่ประกอบด้วย 207 ภารกิจ มากกว่า 50,129 ตอน (episodes) และมีรูปแบบย่อยของฉากกว่า 60,000 รูปแบบ ครอบคลุมข้อมูลเมตา รูปลักษณ์หุ่นยนต์ สถานะวัตถุ และการสังเกตการณ์แบบ RGB-D จากหลายมุมมอง โดยงานวิจัยชิ้นนี้ได้รับความร่วมมือจากสมาชิกในชุมชนมากกว่า 70,000 คน

กระบวนการทำความสะอาดข้อมูลถูกจัดการอย่างเป็นระบบ โดยมีการคัดกรองตัวอย่างที่ไม่มีการเคลื่อนไหวออก และใช้ฟิลเตอร์ Savitzky-Golay เพื่อปรับให้การเคลื่อนที่ราบรื่นขึ้น ผลลัพธ์ที่ได้คืออัตราเร่งเฉลี่ยและค่า jerk ลดลงอย่างมาก ช่วยให้การเคลื่อนที่ของหุ่นยนต์ดูเป็นธรรมชาติ แม้จะทำให้ความสำเร็จในการเล่นซ้ำ (replay success) ลดลงเหลือ 86.2% ก็ตาม

ข้อมูลที่ผ่านการตรวจสอบแล้วจะถูกนำไปเล่นซ้ำใน IsaacSim เพื่อสร้างภาพเรนเดอร์แบบ ray-traced ในสภาพแวดล้อมที่ถูกสุ่มเปลี่ยนทั้งฉาก กล้อง และแสง เพื่อเพิ่มความหลากหลายให้กับชุดข้อมูลก่อนนำไปฝึกสอนโมเดลต่อไป

ผลลัพธ์บน LIBERO-Plus

การทดสอบเริ่มต้นจาก π0.5 checkpoint ซึ่งใช้โครงสร้าง PaliGemma Gemma-2B ร่วมกับ Gemma-300M โดยทำการฝึกสอนต่อ (Continual Pretraining) บนคลังข้อมูลจำลอง AXIS ก่อนจะทำ Fine-tune บน LIBERO ผลปรากฏว่า π0.5 ที่เสริมด้วยข้อมูลจาก AXIS 100% ทำคะแนนได้ถึง 88.8 สูงกว่ารุ่นดั้งเดิมที่ได้ 83.9 และสูงกว่ากลุ่มควบคุมอย่าง RoboCasa365 ที่ได้เพียง 57.5 อย่างเห็นได้ชัด

การพัฒนาที่โดดเด่นที่สุดเกิดขึ้นในส่วนที่เกี่ยวกับ Sensor Noise และมุมกล้อง ซึ่งสอดคล้องกับกระบวนการเพิ่มข้อมูล (augmentation) ของระบบ อย่างไรก็ตาม พบว่าคะแนนในด้านแสง (Light) และภาษา (Language) ลดลงเล็กน้อยเมื่อเทียบกับเกณฑ์มาตรฐานเดิม โดยภาพรวมแสดงให้เห็นว่าการขยายขนาดข้อมูลส่งผลบวกต่อประสิทธิภาพอย่างสม่ำเสมอ

วิดีโออธิบายแบบโต้ตอบ

ประเด็นสำคัญ

  • ภารกิจ 207 รูปแบบ และวิถีการเคลื่อนที่กว่า 5 หมื่นรายการ รวบรวมผ่านเบราว์เซอร์ได้โดยไม่ต้องใช้ GPU แรงสูงหรือหุ่นยนต์จริงในพื้นที่
  • การทำ Continual pretraining ช่วยเพิ่มคะแนน π0.5 บน LIBERO-Plus ขึ้น 4.9 คะแนน (จาก 83.9 เป็น 88.8)
  • ประสิทธิภาพที่เพิ่มขึ้นเหนือกว่ากลุ่มควบคุม RoboCasa365 อย่างมาก พิสูจน์ว่าคุณภาพของข้อมูลจำลองมีผลสำคัญ
  • การปรับแต่งข้อมูลช่วยลดอาการสั่น (jerk) ของหุ่นยนต์ลงได้ถึง 80.8% แต่ต้องแลกกับความสำเร็จในการเล่นซ้ำที่ลดลงเล็กน้อย
  • ระบบยังมีความท้าทายในแกนการรบกวนด้านแสงและภาษาที่ผลลัพธ์ยังไม่ดีเท่าที่ควร
Source: MarkTechPost
ดูแลงานแปลและเรียบเรียงโดย NatapolK

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร