Reka AI เปิดตัว Rho-1 โมเดล Omni ตัวเดียวคุมทั้งภาพ วิดีโอ และหุ่นยนต์

· By: NatapolK

Reka AI ได้เปิดตัว Rho-1 ในรูปแบบการทดสอบเพื่อการวิจัย (research preview) โดย omni-model ขนาด 1.9 หมื่นล้านพารามิเตอร์รุ่นนี้ มีความสามารถโดดเด่นในการประมวลผลและสร้างได้ทั้งข้อความ รูปภาพ วิดีโอ ไปจนถึงการคำสั่งควบคุมหุ่นยนต์จบภายในเครือข่ายประสาทเทียมเพียงหนึ่งเดียว

ความแตกต่างสำคัญคือ Rho-1 รันทุกโหมดการรับรู้ (modalities) ในรูปแบบโทเค็นภายใน context window เดียวกันโดยไม่มีการเรียกใช้เครื่องมือหรือโมเดลภายนอก ต่างจากระบบ AI ส่วนใหญ่ที่ต้องส่งต่องานไปยังโมเดลเฉพาะทาง ทำให้โมเดลนี้สามารถสร้างวิดีโอต่อเนื่องได้แบบเรียลไทม์และตอบสนองต่อคำสั่งใหม่ได้ทันทีโดยไม่ต้องเริ่มต้นกระบวนการใหม่

ในด้านการควบคุมหุ่นยนต์ Rho-1 ใช้น้ำหนักของโมเดล (weights) ชุดเดียวกับที่ใช้คาดการณ์ภาพจากกล้องมาทำหน้าที่ขับเคลื่อนการเคลื่อนที่ของหุ่นยนต์ไปพร้อมกัน ซึ่ง Reka AI ได้แก้ปัญหาความขาดแคลนของข้อมูลฝึกฝนหุ่นยนต์ด้วยการสร้าง inverse dynamics model เพื่อดึงสัญญาณการควบคุมมาจากวิดีโอทั่วไปบนอินเทอร์เน็ต โดยโปรเจกต์นี้ใช้การฝึกฝนบน GPU H100 จำนวน 320 ตัว เป็นเวลาร่วมสามเดือน

Reka AI ถือเป็นผู้เล่นที่น่าจับตาในวงการ multimodal AI โดยเมื่อเดือนเมษายน 2024 ที่ผ่านมา บริษัทเคยสร้างชื่อจากการเปิดตัว Reka Core โมเดลภาษาที่ทำคะแนนทดสอบประสิทธิภาพได้ใกล้เคียงกับยักษ์ใหญ่อย่าง GPT-4, Claude 3 และ Gemini Ultra

การพัฒนา Rho-1 ในครั้งนี้ถือเป็นก้าวสำคัญที่สอดคล้องกับ แรงผลักดันในวงกว้างของงานวิจัย AI ไปสู่สิ่งที่เรียกว่า world models ซึ่งมุ่งเน้นการสร้างระบบที่เข้าใจและโต้ตอบกับโลกแห่งความเป็นจริงได้อย่างเป็นธรรมชาติมากขึ้น

Source: The Decoder
ดูแลงานแปลและเรียบเรียงโดย NatapolK

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร