Google DeepMind ชี้โมเดลสร้างวิดีโออาจมี World Model ในตัว หลัง GenCeption ทำผลงานด้าน Computer Vision ได้ยอดเยี่ยม
GenCeption ผลงานล่าสุดจาก Google DeepMind ได้สร้างความฮือฮาด้วยการนำโมเดลสร้างวิดีโอ (Video Generation Models) มาประยุกต์ใช้ใหม่สำหรับงานด้าน Computer Vision แบบดั้งเดิม เช่น การประเมินความลึก (Depth Estimation) และการแบ่งส่วนภาพ (Segmentation)
ผลการทดสอบพบว่า GenCeption ให้ประสิทธิภาพที่ยอดเยี่ยมเทียบเท่ากับระบบระดับแนวหน้าในปัจจุบัน แต่มีจุดเด่นสำคัญคือการใช้ข้อมูลสำหรับฝึกสอน (Training Data) น้อยกว่ารุ่นก่อนๆ อย่างมหาศาล ซึ่งแสดงให้เห็นถึงความทรงพลังของสถาปัตยกรรมแบบสร้างสรรค์วิดีโอในการทำความเข้าใจโครงสร้างภาพ
สิ่งที่น่าสนใจคือโมเดลนี้ได้รับการฝึกสอนผ่านวิดีโอที่สร้างขึ้นด้วย AI เกือบทั้งหมด ซึ่งผลลัพธ์ดังกล่าวช่วยเพิ่มน้ำหนักให้กับข้อถกเถียงในวงการปัญญาประดิษฐ์ที่ว่า โมเดลสร้างวิดีโออาจมี "World Model" หรือแบบจำลองความเข้าใจโลกทางกายภาพแบบสากลแฝงอยู่ในตัวอยู่แล้วตั้งแต่ต้น

ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
