NVIDIA เปิดตัว TensorRT Model Connect รุ่น Public Preview เปลี่ยน Hugging Face เป็น C++ Inference ใน 2 คำสั่ง

NVIDIA เปิดตัว TensorRT Model Connect รุ่น Public Preview เปลี่ยน Hugging Face เป็น C++ Inference ใน 2 คำสั่ง

NVIDIA ประกาศเปิดตัว TensorRT Model Connect (TRTMC) ในรุ่น Public Preview ซึ่งเป็นโปรเจกต์ open-source ภายใต้สิทธิ์การใช้งานแบบ Apache-2.0 โดยออกแบบมาเพื่อเปลี่ยน Hugging Face หรือ local checkpoint ให้กลายเป็น TensorRT inference แบบ end-to-end ได้ในเวลาอันรวดเร็ว

จุดเด่นสำคัญของ TRTMC คือการตัดขั้นตอนการ export เป็น ONNX ออกไป โดยจะสร้าง artifact ในรูปแบบ .bundle ที่มีการระบุเวอร์ชันชัดเจน ซึ่งทำงานผ่าน native C++ task APIs ทำให้การรัน inference สามารถทำได้ใน C++ service, embedded application หรือระบบหุ่นยนต์โดยไม่ต้องมี PyTorch ในขณะทำงาน (runtime) นอกจากนี้ NVIDIA ยังระบุว่ากระบวนการพัฒนาโปรเจกต์นี้ ตั้งแต่การเขียนโค้ดจนถึงการทำเอกสาร ได้รับการสนับสนุนจาก OpenAI Codex agents ภายใต้การดูแลของมนุษย์

ความพร้อมในการใช้งานจริง

ปัจจุบัน TRTMC พร้อมสำหรับการนำไปประเมินผลและรวมระบบในสภาพแวดล้อมจริงแล้ว อย่างไรก็ตาม ตัวติดตั้ง (wheels) ในปัจจุบันมุ่งเป้าไปที่ Linux aarch64 เท่านั้น โดยรองรับ Python 3.10 หรือ 3.12 และ TensorRT 11.1.0.106 ส่วนผู้ใช้งานระบบ x86_64 จำเป็นต้องใช้การ build จาก source ผ่าน Docker source-build path

เครื่องมือนี้เหมาะอย่างยิ่งสำหรับบริษัทที่มี inference stack เป็นของตัวเอง เช่น สตาร์ทอัพที่ใช้โซลูชัน NVIDIA, บริษัทผู้ผลิตหุ่นยนต์ และระบบ edge ในอุตสาหกรรมต่างๆ เช่น ยานยนต์ การแพทย์ และการป้องกันประเทศ ซึ่งต้องการรัน inference ภายใน C++ binary แทนที่จะใช้ Python server

ตัวอย่างการใช้งานใน 2 คำสั่ง

ขั้นตอนเริ่มต้นอย่างรวดเร็ว (quick start) สำหรับการ build และรันโมเดล Qwen3-0.6B สามารถทำได้ดังนี้:

trtmc build Qwen/Qwen3-0.6B --precision bf16 --max-cache-length 16384 --output qwen3-0.6b.bundle
trtmc run ./qwen3-0.6b.bundle --prompt "What is the capital of France? Answer in one word." --chat-template --no-thinking

นอกจากนี้ ตัวไฟล์ .bundle ที่ได้ยังสามารถโหลดเข้าสู่ระบบ C++ ได้โดยตรงผ่านคำสั่ง trtmc::load("./qwen3-0.6b.bundle") ช่วยให้การนำโมเดลไปใช้ในแอปพลิเคชันมีความยืดหยุ่นสูง

การออกแบบด้วยแนวคิด Bundle

TRTMC แยกส่วนการ build และ runtime ออกจากกันอย่างชัดเจน โดยใช้ Python จัดการเรื่อง checkpoint และการสร้าง TensorRT engine จากนั้น native profiles จะรับช่วงต่อในการรัน inference บน C++ โดยปราศจาก PyTorch ช่วยลดปัญหาความยุ่งยากแบบเดิมๆ เช่น ช่องว่างในการ export (export gaps) หรือการที่ขั้นตอนการตรวจสอบ (validation) กระจัดกระจาย

แอปพลิเคชันสามารถเรียกใช้ task APIs ต่างๆ เช่น generate(), transcribe() หรือ generate_image() ได้ทันที โดยไม่ต้องเขียนโค้ดเชื่อมต่อใหม่สำหรับทุกโมเดล อีกทั้งยังสามารถใช้คำสั่ง trtmc inspect เพื่อตรวจสอบข้อมูลภายในของ bundle ได้ ทำให้ artifact นี้มีความโปร่งใสและตรวจสอบได้ง่าย

ประเด็นสำคัญที่น่าสนใจ

  • สามารถเปลี่ยน Hugging Face checkpoint เป็น native C++ TensorRT inference ได้ใน 2 คำสั่ง โดยไม่ผ่าน ONNX
  • ไฟล์ .bundle ทำหน้าที่เป็นตัวกลางระหว่าง Python build และ C++ runtime ที่ทำงานได้โดยไม่มี PyTorch
  • ข้อมูล GB300 snapshot (29 กรกฎาคม 2026) ครอบคลุม 76 ตระกูลโมเดล รวม 105 profiles โดยส่วนใหญ่มีประสิทธิภาพสูงกว่าเกณฑ์อ้างอิงเกิน 5%
  • ปัจจุบันรองรับเฉพาะ Linux aarch64 ส่วน x86_64 ต้อง build เองผ่าน Docker

ตรวจสอบข้อมูลเพิ่มเติมได้ที่ GitHub Repo

Source: MarkTechPost
ดูแลงานแปลและเรียบเรียงโดย NatapolK

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร