JEPA-Anything: โมเดลโลกสูตรเดียว คุมอยู่หมัด 7 สาขา

JEPA-Anything: โมเดลโลกสูตรเดียว คุมอยู่หมัด 7 สาขา

นักวิจัยจากสถาบันชั้นนำอย่าง PhAI Labs, CUHK, Fudan, Stanford, Oxford และ Princeton ได้เปิดตัว JEPA-Anything เฟรมเวิร์กสร้างโมเดลโลกที่ไม่ยึดติดกับโดเมน (domain-agnostic) โดยแทนที่จะต้องออกแบบโมเดลใหม่ทุกครั้งที่เปลี่ยนสาขา แต่ระบบนี้ใช้สูตรการเรียนรู้เพียงสูตรเดียวครอบคลุมระบบที่แตกต่างกันอย่างสิ้นเชิง

หัวใจสำคัญคือการขยายสถาปัตยกรรม Joint-Embedding Predictive Architectures (JEPAs) ด้วยวิธีการ Orthogonal Predictive Factorization (OPF) ซึ่งทีมวิจัยได้พิสูจน์ความสามารถใน 7 โดเมนสำคัญ ได้แก่ การมองเห็น, ชีววิทยา, วิถีทางคลินิก, การควบคุม, พลวัตของโมเลกุล, ฟิลด์ทางฟิสิกส์ และสภาพอากาศ

JEPA-Anything แก้ปัญหาอะไร? โดยปกติแล้วโมเดล JEPA มาตรฐาน เช่น I-JEPA หรือ V-JEPA 2 จะใช้ตัวทำนายเพียงตัวเดียวที่ส่งผลลัพธ์เป็นเป้าหมายการฝังตัว (target embedding) แบบก้อนเดียว ซึ่งทีมวิจัยมองว่าเป็น "ปัญหาการจัดสรรความจุ" (capacity-allocation problem)

ปัญหานี้ทำให้โครงสร้างที่มีความแปรปรวนสูงเข้าครอบงำการเรียนรู้ ส่งผลให้โหมดที่อ่อนแอกว่าเกิดค่า gradient ที่ขัดแย้งกันและทำงานได้ไม่เต็มประสิทธิภาพ

Orthogonal Predictive Factorization ทำงานอย่างไร?

เทคนิค OPF จะแยกเป้าหมายแฝงที่มีความกว้าง d ออกเป็น K สับสเปซที่มีความกว้าง r (โดย d = K × r) ซึ่งในการทดลองส่วนใหญ่กำหนดค่า K = 4 โดยแต่ละปัจจัยจะมีตัวทำนายเฉพาะของตัวเอง จากนั้นจะรวมการทำนายเข้าด้วยกันผ่าน Moore-Penrose pseudoinverse เพื่อให้ได้สถานะแฝงที่สมบูรณ์สำหรับนำไปถอดรหัส วางแผน หรือจำลองสถานการณ์ (rollout)

กระบวนการนี้ถูกควบคุมด้วย Regularizers 3 ตัว เพื่อให้ปัจจัยต่างๆ ทำงานได้อย่างมีประสิทธิภาพ:

  • Orthogonality loss: รักษาโปรเจคเตอร์แต่ละตัวให้อยู่ในสับสเปซที่ไม่ซ้อนทับกัน
  • Factor-activity loss: ป้องกันไม่ให้ปัจจัยใดปัจจัยหนึ่งหยุดทำงาน (dead factor)
  • Encoder-variance loss: ส่งสัญญาณต่อต้านการยุบตัว (anti-collapse) ไปยัง online encoder โดยตรง

ค่า loss จาก OPF จะถูกรวมเข้ากับ loss หลักของแต่ละโดเมน โดยมีตัวปรับแก้ (Domain adapters) จัดการเรื่อง tokenization ส่วน ไลบรารีหลัก จะมีส่วนแกนกลางที่ใช้ร่วมกันในชื่อ OrthogonalFactorProjection เพื่อสร้างความเป็น Orthogonality ที่ช่วยให้การสังเคราะห์ข้อมูลเสถียรขึ้น

รายงานวิจัยระบุผลลัพธ์อย่างไร?

กลุ่มที่ 1 การอ่านค่าปลายทาง (terminal readout): ในข้อมูลเซลล์เดี่ยว การทำ clustering ของ PBMC แบบ zero-shot เพิ่มขึ้นเป็น 0.7752 เมื่อเทียบกับ 0.7194 ของ Cell-JEPA ส่วนการคาดการณ์เหตุการณ์ทางคลินิกใน UK Biobank ให้ค่าเฉลี่ย PRAUC ที่ 0.718 ซึ่งสูงกว่า JEPA มาตรฐาน

กลุ่มที่ 2 พลวัตโลกแฝง (latent world dynamics): ใน Interventional Pong ค่า MSE ของการแทรกแซงเดี่ยวลดลงถึง 34.83% และการจำลองสถานการณ์อิสระ 6 ขั้นตอนดีขึ้น 8.58% โดย JEPA-Anything สามารถปรับปรุงตัวชี้วัดในงานด้านพลวัตได้ดีขึ้นทั้ง 10 งาน ครอบคลุมเกณฑ์มาตรฐานอย่าง CausalWorld, PDEBench และ WeatherBench2

สำหรับการจำลองโมเลกุล 100 ขั้นตอนด้วยโครงสร้าง TrajCast พบว่าโมเดลให้ค่า MAE และ RMSD ต่ำที่สุดในกลุ่มสารอย่างน้ำ ควอตซ์ และพาราเซตามอล อย่างไรก็ตาม ผลการวางแผนใน Walker2d และ HalfCheetah นั้นดีขึ้น แต่ใน Hopper กลับพบว่า JEPA มาตรฐานยังให้ผลดีกว่า

กลุ่มที่ 3 การวิเคราะห์ทางวิทยาศาสตร์: โมเดลได้เสนอแนะแนวทางการรักษาโรคมะเร็งด้วยการใช้ IL-18 ร่วมกับการยับยั้ง CD73 ซึ่งผลการทดสอบในห้องปฏิบัติการทั้งในออร์แกนอยด์และหนูทดลองต่างสนับสนุนแนวคิดนี้ นอกจากนี้ยังสามารถกู้คืนกฎของ Kepler ได้อย่างแม่นยำโดยมีค่าความชันใกล้เคียงทฤษฎีอย่างมาก

JEPA-Anything เปรียบเทียบกับโมเดลโลกอื่นๆ อย่างไร?

คุณสมบัติJEPA-AnythingV-JEPA 2DINO-WMDreamerV3TD-MPC2
แนวคิดหลักJEPA พร้อมปัจจัยการทำนายที่ตั้งฉากกัน K ตัวVideo JEPA บวกกับ V-JEPA 2-ACโมเดลโลกบนฟีเจอร์การมองเห็นที่ฝึกล่วงหน้าโมเดลโลกบวกกับ actor-criticพลวัตแฝงแบบไม่มีตัวถอดรหัสบวกกับ MPC
โครงสร้างเป้าหมายแยกปัจจัย, รวมใหม่ผ่าน pseudoinverseเป้าหมายแฝงเดี่ยวเป้าหมายแฝงเดี่ยวสถานะแฝงแบบแบ่งหมวดหมู่สถานะแฝงเดี่ยว
โดเมนที่แสดง7: การมองเห็น, เซลล์, คลินิก, ควบคุม, โมเลกุล, PDEs, สภาพอากาศวิดีโอ, การจัดการหุ่นยนต์PointMaze, PushT, Wall, วัตถุที่เสียรูปได้โดเมน RL ที่หลากหลาย104 งานควบคุมต่อเนื่อง
สัญญาอนุญาตApache-2.0MIT (บางไฟล์ Apache-2.0)MITMITMIT

แหล่งที่มา: ข้อมูลจาก GitHub และ Hugging Face ตรวจสอบเมื่อวันที่ 5 ตุลาคม 2026

ประเด็นสำคัญ

  • OPF ช่วยแยกเป้าหมาย JEPA ออกเป็นปัจจัยที่ตั้งฉากกัน K ตัว เพื่อเพิ่มประสิทธิภาพการทำนาย
  • เอาชนะ JEPA baseline ได้ในงานด้านพลวัตทั้ง 10 งานที่ทดสอบ
  • ลดข้อผิดพลาดในการแทรกแซงของ Interventional Pong ได้ถึง 34.83%
  • ประสิทธิภาพการวางแผนขึ้นอยู่กับสภาพแวดล้อมเฉพาะทาง
  • โค้ดหลักเปิดให้ใช้งานแบบ Apache-2.0 และมี research checkpoints บน Hugging Face
Source: MarkTechPost
ดูแลงานแปลและเรียบเรียงโดย TanasakP

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร