tag: Inference

NVIDIA เปิดตัว TensorRT Model Connect รุ่น Public Preview เปลี่ยน Hugging Face เป็น C++ Inference ใน 2 คำสั่ง

NVIDIA เปิดตัว TensorRT Model Connect รุ่น Public Preview เปลี่ยน Hugging Face เป็น C++ Inference ใน 2 คำสั่ง

· By: NatapolK
NVIDIA เปิดตัวโปรเจกต์ open-source TensorRT Model Connect (TRTMC) ช่วยแปลงโมเดลจาก Hugging Face สู่ระบบ Inference ด้วยภาษา C++ ได้โดยตรงโดยไม่ต้องผ่าน ONNX หรือใช้ PyTorch ในขณะรันไทม์
ยกระดับ vLLM: เมื่อ Backend ของ Transformers เร็วแรงระดับ Native โดยไม่ต้องแก้โค้ด

ยกระดับ vLLM: เมื่อ Backend ของ Transformers เร็วแรงระดับ Native โดยไม่ต้องแก้โค้ด

· By: TanasakP
vLLM อัปเกรดแบ็กเอนด์ Transformers ให้มีประสิทธิภาพเทียบเท่าหรือสูงกว่าการเขียนโค้ดเฉพาะทาง ช่วยให้ผู้พัฒนาสามารถรันโมเดล LLM หลากหลายสถาปัตยกรรมได้ทันทีด้วยความเร็วสูงสุด