NVIDIA เปิดตัว Physis-Lang ภาษาฟิสิกส์วิวัฒนาการเอง ดัน Cosmos 3 แซง Veo 3.1

· By: AttapolK

NVIDIA เปิดตัว Physis-Lang ภาษาฟิสิกส์วิวัฒนาการเอง ดัน Cosmos 3 แซง Veo 3.1

โมเดลโลกวิดีโอในปัจจุบันแม้จะสร้างคลิปที่ดูน่าเชื่อถือได้ แต่บ่อยครั้งยังคงมีการทำลายกฎทางฟิสิกส์ เช่น เนื้อสัมผัสของเนยที่ดูคล้ายสีทาบ้าน หรือวัตถุที่สามารถเคลื่อนที่ทะลุผ่านกันได้ ทีมนักวิจัยจาก NVIDIA, MIT และ University of Oxford เสนอแนวทางแก้ไขผ่านตัวภาษาเอง โดยไม่ต้องพึ่งพาสัญญาณภาพหรือข้อมูลตัวเลขเพิ่มเติม

เฟรมเวิร์กใหม่นี้มีชื่อว่า Physis-Lang ซึ่งปฏิบัติต่อภาษาทางฟิสิกส์ในฐานะตัวแทนที่สามารถปรับแต่งให้เหมาะสมได้ (optimizable representation) โดยใช้ข้อความเดียวกันนี้ขับเคลื่อนทั้งการคัดกรองข้อมูล การฝึกฝนโมเดล และการอนุมานผลลัพธ์ ข้อมูลจาก Physics-IQ Verified leaderboard ณ วันที่ 29 กันยายน 2026 ระบุว่า Physis-Lang บน Cosmos3-Super ครองอันดับหนึ่งด้วยคะแนน 48.2 ± 1.4 ตามด้วยเวอร์ชัน Nano ที่อันดับสอง

Physis-Lang แก้ไขปัญหาอะไร?

คำบรรยาย (captions) แบบดั้งเดิมมักระบุเพียงสิ่งที่เกิดขึ้น แต่ไม่ได้อธิบายเหตุผล เช่น การบอกว่า 'เนยละลายเมื่อร้อน' ไม่ได้กล่าวถึงการถ่ายเทความร้อนหรือแรงโน้มถ่วง Physis-Lang จึงเพิ่มฟิลด์ physics_reasoning เข้าไปในทุกคำบรรยาย เพื่อระบุรายละเอียดของวัตถุ สาเหตุ การปฏิสัมพันธ์ และหลักการที่ควบคุมการเปลี่ยนแปลงตามเวลา

นอกจากนี้ ระบบยังมีการเขียน physics_negative_prompt ที่เฉพาะเจาะจงกับแต่ละฉาก เพื่ออธิบายผลลัพธ์ที่ไม่สมเหตุสมผลซึ่งไม่ควรเกิดขึ้น เช่น หินที่ลอยอยู่บนผิวน้ำ ข้อความเหล่านี้จะทำหน้าที่เป็นเงื่อนไขเชิงลบ (negative conditioning) ในระหว่างการประมวลผลเพื่อป้องกันความผิดพลาดทางฟิสิกส์

วงจรคำบรรยายที่วิวัฒนาการได้เอง (Self-Evolving Caption Loop)

ระบบนี้จะคงตัวสร้างคำบรรยาย (captioner) ไว้ให้คงที่ แต่จะพัฒนาเฉพาะคำสั่ง (instruction) ของมันเท่านั้น โดยใช้ GPT-5.5 เป็นตัวสร้างคำบรรยาย และใช้ Gemini-3.1-Pro ทำหน้าที่เป็นผู้วิจารณ์ (critic) ที่ตระหนักถึงหลักฟิสิกส์ เอเจนต์จะวิเคราะห์คะแนนและความล้มเหลวเพื่อเขียนพรอมต์ใหม่ให้แม่นยำยิ่งขึ้น

ผู้วิจารณ์จะให้คะแนนใน 2 มิติหลัก คือ ความแม่นยำ (Precision) โดยตรวจสอบข้ออ้างย่อยๆ เทียบกับวิดีโอ และ ความครอบคลุม (Recall) เพื่อให้มั่นใจว่าการยืนยันทางฟิสิกส์ที่มนุษย์คัดกรองไว้ถูกระบุครบถ้วน จากการทดสอบบน PhysCapBench พบว่าค่า Caption F1 เพิ่มขึ้นจาก 78.64 ในรอบแรก สู่ 87.82 ในรอบที่ 9 ของการพัฒนา

การคัดกรองข้อมูลและการเปรียบเทียบประสิทธิภาพ

เอเจนต์ GPT-5.5 จะทำหน้าที่วินิจฉัยความล้มเหลวของวิดีโอแล้วจับคู่กับหมวดหมู่ทางฟิสิกส์ เช่น การชน หรือพลศาสตร์ของไหล เพื่อดึงข้อมูลวิดีโอจากคลังขนาดใหญ่มาฝึกฝนเพิ่มเติม ชุดข้อมูลสุดท้ายที่มีวิดีโอ 183,000 รายการ ช่วยเพิ่มคะแนนในเกณฑ์มาตรฐานต่างๆ อย่างมีนัยสำคัญ โดยเฉพาะในด้านกระบวนการทางเคมีและความร้อน

เมื่อเปรียบเทียบ Physis-Lang บน Cosmos3-Nano กับ Veo 3.1 ของ Google พบว่า Physis-Lang ทำคะแนนได้เหนือกว่าในหลายเกณฑ์:

  • PhyGenBench: 71.04 เทียบกับ 65.63
  • Physics-IQ Verified: 43.41 เทียบกับ 34.99
  • VideoPhy-2: 62.36 เทียบกับ 58.43 ในส่วน Hard split

การรันบนระบบภายในโดยไม่ใช้ API เชิงพาณิชย์

ทีมวิจัยประสบความสำเร็จในการกลั่นกรอง (distilled) ไพป์ไลน์จาก GPT มาเป็นโมเดล Qwen3-VL-4B-Instruct สองตัว ได้แก่ PhysThinker-C สำหรับบรรยายภาพ และ PhysThinker-U สำหรับยกระดับพรอมต์ ซึ่งช่วยลดค่าใช้จ่าย API จากประมาณ $24,120 เหลือเพียง $120 ในขณะที่ยังคงให้ประสิทธิภาพที่ใกล้เคียงกัน หรือสามารถรันแบบโลคัลได้ฟรีโดยยังเพิ่มคะแนนได้ถึง +4.76

Physis-Lang เทียบกับคู่แข่ง

คุณสมบัติPhysis-LangPhiZeroPhyGDPOSelf-Refinement
ผู้พัฒนาNVIDIA, MIT, OxfordCASIA (NLPR)Meta (ECCV 2026)Liu et al.
แนวคิดหลักคำบรรยายฟิสิกส์และ negative prompts ที่วิวัฒนาการเองภาษาฟิสิกส์แบบไม่ต่อเนื่อง คิดก่อนสร้างภาพGroupwise DPO พร้อมรางวัลทางฟิสิกส์การปรับปรุงพรอมต์แบบ multimodal CoT
Physics-IQ Verified43.4140.91n/r27.20
PhyGenBench71.04n/r48.9649.17
สถานะรหัส/น้ำหนักเฉพาะบทความวิจัย"เร็วๆ นี้""เปิดตัวเร็วๆ นี้"บทความวิจัย

หมายเหตุ: ข้อมูลอ้างอิงจากบทความวิจัย Physis-Lang สถานะการเผยแพร่ตรวจสอบเมื่อ 30 กันยายน 2026 ปัจจุบันยังมีเพียงบทความวิจัยที่เผยแพร่ออกมาสู่สาธารณะเท่านั้น

Source: MarkTechPost
ดูแลงานแปลและเรียบเรียงโดย AttapolK

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร