NVIDIA เปิดตัว Physis-Lang ภาษาฟิสิกส์วิวัฒนาการเอง ดัน Cosmos 3 แซง Veo 3.1

โมเดลโลกวิดีโอในปัจจุบันแม้จะสร้างคลิปที่ดูน่าเชื่อถือได้ แต่บ่อยครั้งยังคงมีการทำลายกฎทางฟิสิกส์ เช่น เนื้อสัมผัสของเนยที่ดูคล้ายสีทาบ้าน หรือวัตถุที่สามารถเคลื่อนที่ทะลุผ่านกันได้ ทีมนักวิจัยจาก NVIDIA, MIT และ University of Oxford เสนอแนวทางแก้ไขผ่านตัวภาษาเอง โดยไม่ต้องพึ่งพาสัญญาณภาพหรือข้อมูลตัวเลขเพิ่มเติม
เฟรมเวิร์กใหม่นี้มีชื่อว่า Physis-Lang ซึ่งปฏิบัติต่อภาษาทางฟิสิกส์ในฐานะตัวแทนที่สามารถปรับแต่งให้เหมาะสมได้ (optimizable representation) โดยใช้ข้อความเดียวกันนี้ขับเคลื่อนทั้งการคัดกรองข้อมูล การฝึกฝนโมเดล และการอนุมานผลลัพธ์ ข้อมูลจาก Physics-IQ Verified leaderboard ณ วันที่ 29 กันยายน 2026 ระบุว่า Physis-Lang บน Cosmos3-Super ครองอันดับหนึ่งด้วยคะแนน 48.2 ± 1.4 ตามด้วยเวอร์ชัน Nano ที่อันดับสอง
Physis-Lang แก้ไขปัญหาอะไร?
คำบรรยาย (captions) แบบดั้งเดิมมักระบุเพียงสิ่งที่เกิดขึ้น แต่ไม่ได้อธิบายเหตุผล เช่น การบอกว่า 'เนยละลายเมื่อร้อน' ไม่ได้กล่าวถึงการถ่ายเทความร้อนหรือแรงโน้มถ่วง Physis-Lang จึงเพิ่มฟิลด์ physics_reasoning เข้าไปในทุกคำบรรยาย เพื่อระบุรายละเอียดของวัตถุ สาเหตุ การปฏิสัมพันธ์ และหลักการที่ควบคุมการเปลี่ยนแปลงตามเวลา
นอกจากนี้ ระบบยังมีการเขียน physics_negative_prompt ที่เฉพาะเจาะจงกับแต่ละฉาก เพื่ออธิบายผลลัพธ์ที่ไม่สมเหตุสมผลซึ่งไม่ควรเกิดขึ้น เช่น หินที่ลอยอยู่บนผิวน้ำ ข้อความเหล่านี้จะทำหน้าที่เป็นเงื่อนไขเชิงลบ (negative conditioning) ในระหว่างการประมวลผลเพื่อป้องกันความผิดพลาดทางฟิสิกส์
วงจรคำบรรยายที่วิวัฒนาการได้เอง (Self-Evolving Caption Loop)
ระบบนี้จะคงตัวสร้างคำบรรยาย (captioner) ไว้ให้คงที่ แต่จะพัฒนาเฉพาะคำสั่ง (instruction) ของมันเท่านั้น โดยใช้ GPT-5.5 เป็นตัวสร้างคำบรรยาย และใช้ Gemini-3.1-Pro ทำหน้าที่เป็นผู้วิจารณ์ (critic) ที่ตระหนักถึงหลักฟิสิกส์ เอเจนต์จะวิเคราะห์คะแนนและความล้มเหลวเพื่อเขียนพรอมต์ใหม่ให้แม่นยำยิ่งขึ้น
ผู้วิจารณ์จะให้คะแนนใน 2 มิติหลัก คือ ความแม่นยำ (Precision) โดยตรวจสอบข้ออ้างย่อยๆ เทียบกับวิดีโอ และ ความครอบคลุม (Recall) เพื่อให้มั่นใจว่าการยืนยันทางฟิสิกส์ที่มนุษย์คัดกรองไว้ถูกระบุครบถ้วน จากการทดสอบบน PhysCapBench พบว่าค่า Caption F1 เพิ่มขึ้นจาก 78.64 ในรอบแรก สู่ 87.82 ในรอบที่ 9 ของการพัฒนา
การคัดกรองข้อมูลและการเปรียบเทียบประสิทธิภาพ
เอเจนต์ GPT-5.5 จะทำหน้าที่วินิจฉัยความล้มเหลวของวิดีโอแล้วจับคู่กับหมวดหมู่ทางฟิสิกส์ เช่น การชน หรือพลศาสตร์ของไหล เพื่อดึงข้อมูลวิดีโอจากคลังขนาดใหญ่มาฝึกฝนเพิ่มเติม ชุดข้อมูลสุดท้ายที่มีวิดีโอ 183,000 รายการ ช่วยเพิ่มคะแนนในเกณฑ์มาตรฐานต่างๆ อย่างมีนัยสำคัญ โดยเฉพาะในด้านกระบวนการทางเคมีและความร้อน
เมื่อเปรียบเทียบ Physis-Lang บน Cosmos3-Nano กับ Veo 3.1 ของ Google พบว่า Physis-Lang ทำคะแนนได้เหนือกว่าในหลายเกณฑ์:
- PhyGenBench: 71.04 เทียบกับ 65.63
- Physics-IQ Verified: 43.41 เทียบกับ 34.99
- VideoPhy-2: 62.36 เทียบกับ 58.43 ในส่วน Hard split
การรันบนระบบภายในโดยไม่ใช้ API เชิงพาณิชย์
ทีมวิจัยประสบความสำเร็จในการกลั่นกรอง (distilled) ไพป์ไลน์จาก GPT มาเป็นโมเดล Qwen3-VL-4B-Instruct สองตัว ได้แก่ PhysThinker-C สำหรับบรรยายภาพ และ PhysThinker-U สำหรับยกระดับพรอมต์ ซึ่งช่วยลดค่าใช้จ่าย API จากประมาณ $24,120 เหลือเพียง $120 ในขณะที่ยังคงให้ประสิทธิภาพที่ใกล้เคียงกัน หรือสามารถรันแบบโลคัลได้ฟรีโดยยังเพิ่มคะแนนได้ถึง +4.76
Physis-Lang เทียบกับคู่แข่ง
| คุณสมบัติ | Physis-Lang | PhiZero | PhyGDPO | Self-Refinement |
|---|---|---|---|---|
| ผู้พัฒนา | NVIDIA, MIT, Oxford | CASIA (NLPR) | Meta (ECCV 2026) | Liu et al. |
| แนวคิดหลัก | คำบรรยายฟิสิกส์และ negative prompts ที่วิวัฒนาการเอง | ภาษาฟิสิกส์แบบไม่ต่อเนื่อง คิดก่อนสร้างภาพ | Groupwise DPO พร้อมรางวัลทางฟิสิกส์ | การปรับปรุงพรอมต์แบบ multimodal CoT |
| Physics-IQ Verified | 43.41 | 40.91 | n/r | 27.20 |
| PhyGenBench | 71.04 | n/r | 48.96 | 49.17 |
| สถานะรหัส/น้ำหนัก | เฉพาะบทความวิจัย | "เร็วๆ นี้" | "เปิดตัวเร็วๆ นี้" | บทความวิจัย |
หมายเหตุ: ข้อมูลอ้างอิงจากบทความวิจัย Physis-Lang สถานะการเผยแพร่ตรวจสอบเมื่อ 30 กันยายน 2026 ปัจจุบันยังมีเพียงบทความวิจัยที่เผยแพร่ออกมาสู่สาธารณะเท่านั้น
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
