tag: Knowledge Distillation

เผยเทคนิค Knowledge Distillation ใหม่: ลดใช้ VRAM 15 เท่า ฝึก AI ขนาดใหญ่ได้บน GPU ตัวเดียว

เผยเทคนิค Knowledge Distillation ใหม่: ลดใช้ VRAM 15 เท่า ฝึก AI ขนาดใหญ่ได้บน GPU ตัวเดียว

Multiverse Computing พัฒนาเทคนิค Fused Chunked KL Loss ช่วยลดการใช้หน่วยความจำในการฝึกโมเดล AI ขนาดเล็กลงได้มหาศาล ทำให้การทำ Distillation ระดับสเกลใหญ่ประหยัดและเข้าถึงได้ง่ายขึ้น