JEPA-Anything: โมเดลโลกสูตรเดียว คุมอยู่หมัด 7 สาขา

นักวิจัยจากสถาบันชั้นนำอย่าง PhAI Labs, CUHK, Fudan, Stanford, Oxford และ Princeton ได้เปิดตัว JEPA-Anything เฟรมเวิร์กสร้างโมเดลโลกที่ไม่ยึดติดกับโดเมน (domain-agnostic) โดยแทนที่จะต้องออกแบบโมเดลใหม่ทุกครั้งที่เปลี่ยนสาขา แต่ระบบนี้ใช้สูตรการเรียนรู้เพียงสูตรเดียวครอบคลุมระบบที่แตกต่างกันอย่างสิ้นเชิง
หัวใจสำคัญคือการขยายสถาปัตยกรรม Joint-Embedding Predictive Architectures (JEPAs) ด้วยวิธีการ Orthogonal Predictive Factorization (OPF) ซึ่งทีมวิจัยได้พิสูจน์ความสามารถใน 7 โดเมนสำคัญ ได้แก่ การมองเห็น, ชีววิทยา, วิถีทางคลินิก, การควบคุม, พลวัตของโมเลกุล, ฟิลด์ทางฟิสิกส์ และสภาพอากาศ
JEPA-Anything แก้ปัญหาอะไร? โดยปกติแล้วโมเดล JEPA มาตรฐาน เช่น I-JEPA หรือ V-JEPA 2 จะใช้ตัวทำนายเพียงตัวเดียวที่ส่งผลลัพธ์เป็นเป้าหมายการฝังตัว (target embedding) แบบก้อนเดียว ซึ่งทีมวิจัยมองว่าเป็น "ปัญหาการจัดสรรความจุ" (capacity-allocation problem)
ปัญหานี้ทำให้โครงสร้างที่มีความแปรปรวนสูงเข้าครอบงำการเรียนรู้ ส่งผลให้โหมดที่อ่อนแอกว่าเกิดค่า gradient ที่ขัดแย้งกันและทำงานได้ไม่เต็มประสิทธิภาพ
Orthogonal Predictive Factorization ทำงานอย่างไร?
เทคนิค OPF จะแยกเป้าหมายแฝงที่มีความกว้าง d ออกเป็น K สับสเปซที่มีความกว้าง r (โดย d = K × r) ซึ่งในการทดลองส่วนใหญ่กำหนดค่า K = 4 โดยแต่ละปัจจัยจะมีตัวทำนายเฉพาะของตัวเอง จากนั้นจะรวมการทำนายเข้าด้วยกันผ่าน Moore-Penrose pseudoinverse เพื่อให้ได้สถานะแฝงที่สมบูรณ์สำหรับนำไปถอดรหัส วางแผน หรือจำลองสถานการณ์ (rollout)
กระบวนการนี้ถูกควบคุมด้วย Regularizers 3 ตัว เพื่อให้ปัจจัยต่างๆ ทำงานได้อย่างมีประสิทธิภาพ:
- Orthogonality loss: รักษาโปรเจคเตอร์แต่ละตัวให้อยู่ในสับสเปซที่ไม่ซ้อนทับกัน
- Factor-activity loss: ป้องกันไม่ให้ปัจจัยใดปัจจัยหนึ่งหยุดทำงาน (dead factor)
- Encoder-variance loss: ส่งสัญญาณต่อต้านการยุบตัว (anti-collapse) ไปยัง online encoder โดยตรง
ค่า loss จาก OPF จะถูกรวมเข้ากับ loss หลักของแต่ละโดเมน โดยมีตัวปรับแก้ (Domain adapters) จัดการเรื่อง tokenization ส่วน ไลบรารีหลัก จะมีส่วนแกนกลางที่ใช้ร่วมกันในชื่อ OrthogonalFactorProjection เพื่อสร้างความเป็น Orthogonality ที่ช่วยให้การสังเคราะห์ข้อมูลเสถียรขึ้น
รายงานวิจัยระบุผลลัพธ์อย่างไร?
กลุ่มที่ 1 การอ่านค่าปลายทาง (terminal readout): ในข้อมูลเซลล์เดี่ยว การทำ clustering ของ PBMC แบบ zero-shot เพิ่มขึ้นเป็น 0.7752 เมื่อเทียบกับ 0.7194 ของ Cell-JEPA ส่วนการคาดการณ์เหตุการณ์ทางคลินิกใน UK Biobank ให้ค่าเฉลี่ย PRAUC ที่ 0.718 ซึ่งสูงกว่า JEPA มาตรฐาน
กลุ่มที่ 2 พลวัตโลกแฝง (latent world dynamics): ใน Interventional Pong ค่า MSE ของการแทรกแซงเดี่ยวลดลงถึง 34.83% และการจำลองสถานการณ์อิสระ 6 ขั้นตอนดีขึ้น 8.58% โดย JEPA-Anything สามารถปรับปรุงตัวชี้วัดในงานด้านพลวัตได้ดีขึ้นทั้ง 10 งาน ครอบคลุมเกณฑ์มาตรฐานอย่าง CausalWorld, PDEBench และ WeatherBench2
สำหรับการจำลองโมเลกุล 100 ขั้นตอนด้วยโครงสร้าง TrajCast พบว่าโมเดลให้ค่า MAE และ RMSD ต่ำที่สุดในกลุ่มสารอย่างน้ำ ควอตซ์ และพาราเซตามอล อย่างไรก็ตาม ผลการวางแผนใน Walker2d และ HalfCheetah นั้นดีขึ้น แต่ใน Hopper กลับพบว่า JEPA มาตรฐานยังให้ผลดีกว่า
กลุ่มที่ 3 การวิเคราะห์ทางวิทยาศาสตร์: โมเดลได้เสนอแนะแนวทางการรักษาโรคมะเร็งด้วยการใช้ IL-18 ร่วมกับการยับยั้ง CD73 ซึ่งผลการทดสอบในห้องปฏิบัติการทั้งในออร์แกนอยด์และหนูทดลองต่างสนับสนุนแนวคิดนี้ นอกจากนี้ยังสามารถกู้คืนกฎของ Kepler ได้อย่างแม่นยำโดยมีค่าความชันใกล้เคียงทฤษฎีอย่างมาก
JEPA-Anything เปรียบเทียบกับโมเดลโลกอื่นๆ อย่างไร?
| คุณสมบัติ | JEPA-Anything | V-JEPA 2 | DINO-WM | DreamerV3 | TD-MPC2 |
|---|---|---|---|---|---|
| แนวคิดหลัก | JEPA พร้อมปัจจัยการทำนายที่ตั้งฉากกัน K ตัว | Video JEPA บวกกับ V-JEPA 2-AC | โมเดลโลกบนฟีเจอร์การมองเห็นที่ฝึกล่วงหน้า | โมเดลโลกบวกกับ actor-critic | พลวัตแฝงแบบไม่มีตัวถอดรหัสบวกกับ MPC |
| โครงสร้างเป้าหมาย | แยกปัจจัย, รวมใหม่ผ่าน pseudoinverse | เป้าหมายแฝงเดี่ยว | เป้าหมายแฝงเดี่ยว | สถานะแฝงแบบแบ่งหมวดหมู่ | สถานะแฝงเดี่ยว |
| โดเมนที่แสดง | 7: การมองเห็น, เซลล์, คลินิก, ควบคุม, โมเลกุล, PDEs, สภาพอากาศ | วิดีโอ, การจัดการหุ่นยนต์ | PointMaze, PushT, Wall, วัตถุที่เสียรูปได้ | โดเมน RL ที่หลากหลาย | 104 งานควบคุมต่อเนื่อง |
| สัญญาอนุญาต | Apache-2.0 | MIT (บางไฟล์ Apache-2.0) | MIT | MIT | MIT |
แหล่งที่มา: ข้อมูลจาก GitHub และ Hugging Face ตรวจสอบเมื่อวันที่ 5 ตุลาคม 2026
ประเด็นสำคัญ
- OPF ช่วยแยกเป้าหมาย JEPA ออกเป็นปัจจัยที่ตั้งฉากกัน K ตัว เพื่อเพิ่มประสิทธิภาพการทำนาย
- เอาชนะ JEPA baseline ได้ในงานด้านพลวัตทั้ง 10 งานที่ทดสอบ
- ลดข้อผิดพลาดในการแทรกแซงของ Interventional Pong ได้ถึง 34.83%
- ประสิทธิภาพการวางแผนขึ้นอยู่กับสภาพแวดล้อมเฉพาะทาง
- โค้ดหลักเปิดให้ใช้งานแบบ Apache-2.0 และมี research checkpoints บน Hugging Face
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
