Reka AI เปิดตัว Rho-1 โมเดล Omni ตัวเดียวคุมทั้งภาพ วิดีโอ และหุ่นยนต์
Reka AI ได้เปิดตัว Rho-1 ในรูปแบบการทดสอบเพื่อการวิจัย (research preview) โดย omni-model ขนาด 1.9 หมื่นล้านพารามิเตอร์รุ่นนี้ มีความสามารถโดดเด่นในการประมวลผลและสร้างได้ทั้งข้อความ รูปภาพ วิดีโอ ไปจนถึงการคำสั่งควบคุมหุ่นยนต์จบภายในเครือข่ายประสาทเทียมเพียงหนึ่งเดียว
ความแตกต่างสำคัญคือ Rho-1 รันทุกโหมดการรับรู้ (modalities) ในรูปแบบโทเค็นภายใน context window เดียวกันโดยไม่มีการเรียกใช้เครื่องมือหรือโมเดลภายนอก ต่างจากระบบ AI ส่วนใหญ่ที่ต้องส่งต่องานไปยังโมเดลเฉพาะทาง ทำให้โมเดลนี้สามารถสร้างวิดีโอต่อเนื่องได้แบบเรียลไทม์และตอบสนองต่อคำสั่งใหม่ได้ทันทีโดยไม่ต้องเริ่มต้นกระบวนการใหม่
ในด้านการควบคุมหุ่นยนต์ Rho-1 ใช้น้ำหนักของโมเดล (weights) ชุดเดียวกับที่ใช้คาดการณ์ภาพจากกล้องมาทำหน้าที่ขับเคลื่อนการเคลื่อนที่ของหุ่นยนต์ไปพร้อมกัน ซึ่ง Reka AI ได้แก้ปัญหาความขาดแคลนของข้อมูลฝึกฝนหุ่นยนต์ด้วยการสร้าง inverse dynamics model เพื่อดึงสัญญาณการควบคุมมาจากวิดีโอทั่วไปบนอินเทอร์เน็ต โดยโปรเจกต์นี้ใช้การฝึกฝนบน GPU H100 จำนวน 320 ตัว เป็นเวลาร่วมสามเดือน
Reka AI ถือเป็นผู้เล่นที่น่าจับตาในวงการ multimodal AI โดยเมื่อเดือนเมษายน 2024 ที่ผ่านมา บริษัทเคยสร้างชื่อจากการเปิดตัว Reka Core โมเดลภาษาที่ทำคะแนนทดสอบประสิทธิภาพได้ใกล้เคียงกับยักษ์ใหญ่อย่าง GPT-4, Claude 3 และ Gemini Ultra
การพัฒนา Rho-1 ในครั้งนี้ถือเป็นก้าวสำคัญที่สอดคล้องกับ แรงผลักดันในวงกว้างของงานวิจัย AI ไปสู่สิ่งที่เรียกว่า world models ซึ่งมุ่งเน้นการสร้างระบบที่เข้าใจและโต้ตอบกับโลกแห่งความเป็นจริงได้อย่างเป็นธรรมชาติมากขึ้น
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
