tag: Quantization

Quantization-Aware Healing: พลิกโฉมโมเดล 4-bit ให้แม่นยำกว่าต้นฉบับ 16-bit แม้ถูกบีบอัด

Quantization-Aware Healing: พลิกโฉมโมเดล 4-bit ให้แม่นยำกว่าต้นฉบับ 16-bit แม้ถูกบีบอัด

นักวิจัยเปิดตัวเทคนิค Quantization-Aware Healing (QAH) ที่ช่วยฟื้นฟูประสิทธิภาพของโมเดลภาษาขนาดใหญ่หลังการบีบอัด ทำให้โมเดลขนาด 4-bit มีความแม่นยำสูงกว่าโมเดลต้นฉบับ 16-bit ในขณะที่ประหยัดทรัพยากรมากกว่าเดิม
Liquid AI เปิดตัว Checkpoints LFM2.5 Q4_0 ที่ผ่านการเทรนด้วย Quantization-Aware Distillation

Liquid AI เปิดตัว Checkpoints LFM2.5 Q4_0 ที่ผ่านการเทรนด้วย Quantization-Aware Distillation

· By: SirilukP
Liquid AI เปิดตัวโมเดล LFM2.5 ในรูปแบบ GGUF 4-bit ที่ใช้เทคนิค Quantization-Aware Distillation (QAD) ช่วยให้คงประสิทธิภาพได้สูงถึง 97% ของรุ่น BF16 เดิม แต่ยังประหยัดหน่วยความจำและทำงานได้รวดเร็วตามมาตรฐาน Q4_0
Diffusers รองรับ Nunchaku 4-bit เพิ่มสปีดการรัน Diffusion Transformers โดยใช้หน่วยความจำน้อยลง

Diffusers รองรับ Nunchaku 4-bit เพิ่มสปีดการรัน Diffusion Transformers โดยใช้หน่วยความจำน้อยลง

· By: TanasakP
Diffusers ผสานการทำงานกับ Nunchaku Lite ช่วยให้รันโมเดล Diffusion ขนาดใหญ่ด้วย Precision แบบ 4-bit (W4A4) ได้เร็วขึ้น 30% และลดการใช้ VRAM ลงถึงครึ่งหนึ่งบน GPU ระดับผู้บริโภค