Alibaba เปิดตัว Qwen-Image-2.1-Turbo สร้างภาพ 2K เร็วขึ้น 5 เท่า

ทีม Qwen ของ Alibaba เปิดตัว Qwen-Image-2.1-Turbo ซึ่งเป็น checkpoint รุ่นเร่งความเร็วของโมเดลแบบ open-weight ในซีรีส์ Qwen-Image-2.1 โดยจุดเด่นอยู่ที่ความสามารถในการ สร้างและแก้ไขรูปภาพได้ใน 8 ขั้นตอน denoising จากเดิมที่ต้องใช้ถึง 40 ขั้นตอนตามมาตรฐาน ของโมเดลฐาน
สำหรับนักพัฒนา ความเปลี่ยนแปลงนี้หมายถึงการลดขั้นตอน denoising ลงถึง 5 เท่าบนสถาปัตยกรรม 7B เดิม โดยยังคงมีตัวเลือกใช้งานผ่าน API แบบ hosted เพื่อความสะดวกในการประมวลผล
TL;DR
- ขนาด: 7B parameters ในส่วน visual generator ทำงานร่วมกับ Qwen3-VL 8B text encoder
- การประมวลผล: รันบน CUDA GPUs รูปแบบ BF16 ผ่าน Diffusers โดย Unsloth ประเมินว่าโมเดลฐานใช้ VRAM 11 GB สำหรับ GGUF และ 24 GB สำหรับ INT8/FP8
- ประสิทธิภาพ: ให้ผลลัพธ์ความละเอียด 2K และมีฟีเจอร์การแก้ไขครบถ้วนเทียบเท่ารุ่นเดิม แต่ใช้เพียง 8 ขั้นตอน
- คะแนนทดสอบ: Qwen-Image-2.1 รุ่นฐานทำคะแนนได้ 60.28 บน Qwen-Image-Bench ซึ่งเป็นคะแนนสูงสุดในกลุ่ม open-weight ที่ Qwen รายงาน
- ข้อดี: สร้างและแก้ไขภาพระดับ 2K จบใน 8 ขั้นตอนภายใน open checkpoint เดียว
- ข้อจำกัด: อนุญาตให้ใช้เพื่อการวิจัยเท่านั้น การใช้งานเชิงพาณิชย์แบบโฮสต์เองต้องขออนุญาตแยกต่างหาก
Qwen-Image-2.1-Turbo คืออะไร?
Qwen-Image-2.1-Turbo คือ checkpoint ที่ออกแบบมาเพื่อการสร้างและแก้ไขภาพที่รวดเร็ว พัฒนาต่อยอดมาจาก Qwen-Image-2.1 โดยยังคงสถาปัตยกรรม visual generation ขนาด 7B เดิมเอาไว้ และสามารถโหลดใช้งานได้ทันทีผ่าน QwenImage21Pipeline ใน Diffusers
โมเดลมาพร้อม sampling schedule แบบ 8 ขั้นตอนที่ตั้งค่ามาให้ในตัว โดยการสร้างภาพจะใช้ค่าเริ่มต้น CFG=1 และใช้เทคนิค Prefix KV caching เพื่อนำบริบทของข้อความและรูปภาพอ้างอิงกลับมาใช้ซ้ำในระหว่างขั้นตอน denoising ช่วยให้การประมวลผลมีประสิทธิภาพสูงขึ้น
Qwen-Image-2.1-Turbo ทำงานอย่างไร?
สถาปัตยกรรม พื้นฐานเป็น DiT (Diffusion Transformer) แบบ single-stream จำนวน 32 เลเยอร์ ขนาด 7B parameters ใช้ระบบ block-causal attention โดยที่ text tokens จะถูกจัดการด้วย token-level causal mask ส่วนรูปภาพจะใช้ chunk-level bidirectional mask
- Text encoder: ใช้ Qwen3-VL 8B ในการเข้ารหัสทั้งคำสั่ง (prompt) และรูปภาพเงื่อนไข
- VAE: เป็น RGBA autoencoder แบบ 64 แชนเนล บีบอัดเชิงพื้นที่ 16 เท่า ทำให้รองรับการสร้างภาพที่มีความโปร่งใส (transparency) ได้ในตัว
- Scheduler: ใช้ระบบ Flow Matching ร่วมกับ Euler discrete scheduling และ dynamic shifting
กลไกของ attention คือหัวใจที่ทำให้ prefix caching ทำงานได้ โดยรูปภาพและข้อความนำเข้าจะถูกคำนวณเพียงครั้งเดียวในขั้นตอนแรก และใช้แคชดังกล่าวซ้ำในขั้นตอนที่เหลือ ซึ่งเมื่อมีเพียง 8 ขั้นตอน การทำ cached prefix จึงช่วยประหยัดทรัพยากรส่วนใหญ่ในกระบวนการปรับสภาพ (conditioning) ได้อย่างมาก
ความสามารถในการสร้างและแก้ไขภาพ
ข้อมูลใน model card ระบุว่าโมเดลครอบคลุมการทำงาน 8 หมวดหมู่หลัก เช่น ภาพพอร์ตเทรต, ท่าทางมนุษย์, ภาพพื้นหลังโปร่งใส, การออกแบบตัวอักษร, โปสเตอร์ และเลย์เอาต์ UI ส่วนฟีเจอร์การแก้ไขรองรับทั้งการแปลงภาพเดี่ยว การจัดองค์ประกอบจากหลายภาพอ้างอิง (สูงสุด 10 ภาพ) และการแก้ไขเฉพาะจุดผ่านการวาดคำอธิบายประกอบหรือการใช้มาสก์
วิธีการรัน Qwen-Image-2.1-Turbo
การติดตั้งใช้งาน ต้องใช้ Diffusers จาก source ร่วมกับ transformers>=5.17.0 และต้องใช้ Diffusers PR #14950 เพื่อรองรับ sampling sigmas ที่กำหนดผ่าน pipeline
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1-Turbo", dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A ceramic teapot on a wooden table, soft window light",
width=2048, height=2048, use_kv_cache=True,
).images[0]สำหรับการแก้ไขภาพ ผู้ใช้สามารถส่งค่า image=input_image พร้อมกับ prompt คำสั่งได้ทันที รองรับความละเอียดตั้งแต่สี่เหลี่ยมจัตุรัส 2048×2048 ไปจนถึงอัตราส่วน 16:9 ที่ขนาด 2752×1536 ทั้งนี้ควรใช้ค่า sigmas ตามที่กำหนด เนื่องจาก Qwen ระบุว่าตารางเวลาอื่นยังไม่ผ่านการทดสอบ
ค่าบริการ API
Alibaba Cloud Model Studio ให้บริการโมเดลทั้งรุ่น Turbo และ Pro โดย qwen-image-2.1-turbo มีราคาเพียง 0.1 หยวนต่อภาพ และจำกัด 120 RPM ส่วน qwen-image-2.1-pro ราคา 0.25 หยวนต่อภาพ ที่ 20 RPM ซึ่งรุ่น Turbo ถูกกว่าถึง 2.5 เท่า และรองรับปริมาณงานได้มากกว่า 6 เท่า
ตารางเปรียบเทียบ Qwen-Image-2.1-Turbo กับคู่แข่ง
| ฟีเจอร์ | Qwen-Image-2.1-Turbo | Qwen-Image-2.1 | Z-Image-Turbo | FLUX.2 klein 9B |
|---|---|---|---|---|
| องค์กร | Alibaba Qwen | Alibaba Qwen | Alibaba Tongyi-MAI | Black Forest Labs |
| ขนาด Generator | 7B | 7B | 6B | 9B |
| Text encoder | Qwen3-VL 8B | Qwen3-VL 8B | ไม่เปิดเผย | Qwen3 8B |
| ขั้นตอนเริ่มต้น | 8 | 40 | 8 NFEs | 4 |
| การแก้ไข | รองรับ (หลายภาพ) | รองรับ (สูงสุด 10 ภาพ) | แยกโมเดล Edit | รองรับ (หลายภาพ) |
| ผลลัพธ์ RGBA | มี | มี | ไม่เปิดเผย | ไม่เปิดเผย |
| ความละเอียดปกติ | 2K (2048×2048) | 2K (2048×2048) | 1024×1024 | 1024×1024 |
| VRAM ที่แนะนำ | ไม่ระบุ | 11-24 GB | ~16 GB | ~29 GB (RTX 4090+) |
| ใบอนุญาต | วิจัย | วิจัย | Apache 2.0 | Non-Commercial |
บทสรุปที่น่าสนใจ
- Qwen-Image-2.1-Turbo ลดขั้นตอนทำงานลงเหลือ 8 ขั้นตอน แต่ยังรักษามาตรฐานภาพระดับ 2K บนสถาปัตยกรรม 7B เดิมได้
- โมเดลเดียวสามารถทำงานได้หลากหลาย ทั้งสร้างภาพจากข้อความ แก้ไขภาพอ้างอิง และสร้างภาพพื้นหลังโปร่งใส (RGBA)
- ค่าบริการ API ของรุ่น Turbo ถูกกว่ารุ่น Pro อย่างเห็นได้ชัด เหมาะสำหรับการใช้งานในปริมาณมาก
- แม้ประสิทธิภาพจะสูง แต่ใบอนุญาตยังจำกัดเฉพาะการวิจัย ซึ่งต้องระวังหากจะนำไปใช้ในเชิงพาณิชย์
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
