Alibaba เปิดตัว Qwen-Image-2.1-Turbo สร้างภาพ 2K เร็วขึ้น 5 เท่า

· By: NatapolK

Alibaba เปิดตัว Qwen-Image-2.1-Turbo สร้างภาพ 2K เร็วขึ้น 5 เท่า

ทีม Qwen ของ Alibaba เปิดตัว Qwen-Image-2.1-Turbo ซึ่งเป็น checkpoint รุ่นเร่งความเร็วของโมเดลแบบ open-weight ในซีรีส์ Qwen-Image-2.1 โดยจุดเด่นอยู่ที่ความสามารถในการ สร้างและแก้ไขรูปภาพได้ใน 8 ขั้นตอน denoising จากเดิมที่ต้องใช้ถึง 40 ขั้นตอนตามมาตรฐาน ของโมเดลฐาน

สำหรับนักพัฒนา ความเปลี่ยนแปลงนี้หมายถึงการลดขั้นตอน denoising ลงถึง 5 เท่าบนสถาปัตยกรรม 7B เดิม โดยยังคงมีตัวเลือกใช้งานผ่าน API แบบ hosted เพื่อความสะดวกในการประมวลผล

TL;DR

  • ขนาด: 7B parameters ในส่วน visual generator ทำงานร่วมกับ Qwen3-VL 8B text encoder
  • การประมวลผล: รันบน CUDA GPUs รูปแบบ BF16 ผ่าน Diffusers โดย Unsloth ประเมินว่าโมเดลฐานใช้ VRAM 11 GB สำหรับ GGUF และ 24 GB สำหรับ INT8/FP8
  • ประสิทธิภาพ: ให้ผลลัพธ์ความละเอียด 2K และมีฟีเจอร์การแก้ไขครบถ้วนเทียบเท่ารุ่นเดิม แต่ใช้เพียง 8 ขั้นตอน
  • คะแนนทดสอบ: Qwen-Image-2.1 รุ่นฐานทำคะแนนได้ 60.28 บน Qwen-Image-Bench ซึ่งเป็นคะแนนสูงสุดในกลุ่ม open-weight ที่ Qwen รายงาน
  • ข้อดี: สร้างและแก้ไขภาพระดับ 2K จบใน 8 ขั้นตอนภายใน open checkpoint เดียว
  • ข้อจำกัด: อนุญาตให้ใช้เพื่อการวิจัยเท่านั้น การใช้งานเชิงพาณิชย์แบบโฮสต์เองต้องขออนุญาตแยกต่างหาก

Qwen-Image-2.1-Turbo คืออะไร?

Qwen-Image-2.1-Turbo คือ checkpoint ที่ออกแบบมาเพื่อการสร้างและแก้ไขภาพที่รวดเร็ว พัฒนาต่อยอดมาจาก Qwen-Image-2.1 โดยยังคงสถาปัตยกรรม visual generation ขนาด 7B เดิมเอาไว้ และสามารถโหลดใช้งานได้ทันทีผ่าน QwenImage21Pipeline ใน Diffusers

โมเดลมาพร้อม sampling schedule แบบ 8 ขั้นตอนที่ตั้งค่ามาให้ในตัว โดยการสร้างภาพจะใช้ค่าเริ่มต้น CFG=1 และใช้เทคนิค Prefix KV caching เพื่อนำบริบทของข้อความและรูปภาพอ้างอิงกลับมาใช้ซ้ำในระหว่างขั้นตอน denoising ช่วยให้การประมวลผลมีประสิทธิภาพสูงขึ้น

Qwen-Image-2.1-Turbo ทำงานอย่างไร?

สถาปัตยกรรม พื้นฐานเป็น DiT (Diffusion Transformer) แบบ single-stream จำนวน 32 เลเยอร์ ขนาด 7B parameters ใช้ระบบ block-causal attention โดยที่ text tokens จะถูกจัดการด้วย token-level causal mask ส่วนรูปภาพจะใช้ chunk-level bidirectional mask

  • Text encoder: ใช้ Qwen3-VL 8B ในการเข้ารหัสทั้งคำสั่ง (prompt) และรูปภาพเงื่อนไข
  • VAE: เป็น RGBA autoencoder แบบ 64 แชนเนล บีบอัดเชิงพื้นที่ 16 เท่า ทำให้รองรับการสร้างภาพที่มีความโปร่งใส (transparency) ได้ในตัว
  • Scheduler: ใช้ระบบ Flow Matching ร่วมกับ Euler discrete scheduling และ dynamic shifting

กลไกของ attention คือหัวใจที่ทำให้ prefix caching ทำงานได้ โดยรูปภาพและข้อความนำเข้าจะถูกคำนวณเพียงครั้งเดียวในขั้นตอนแรก และใช้แคชดังกล่าวซ้ำในขั้นตอนที่เหลือ ซึ่งเมื่อมีเพียง 8 ขั้นตอน การทำ cached prefix จึงช่วยประหยัดทรัพยากรส่วนใหญ่ในกระบวนการปรับสภาพ (conditioning) ได้อย่างมาก

ความสามารถในการสร้างและแก้ไขภาพ

ข้อมูลใน model card ระบุว่าโมเดลครอบคลุมการทำงาน 8 หมวดหมู่หลัก เช่น ภาพพอร์ตเทรต, ท่าทางมนุษย์, ภาพพื้นหลังโปร่งใส, การออกแบบตัวอักษร, โปสเตอร์ และเลย์เอาต์ UI ส่วนฟีเจอร์การแก้ไขรองรับทั้งการแปลงภาพเดี่ยว การจัดองค์ประกอบจากหลายภาพอ้างอิง (สูงสุด 10 ภาพ) และการแก้ไขเฉพาะจุดผ่านการวาดคำอธิบายประกอบหรือการใช้มาสก์

วิธีการรัน Qwen-Image-2.1-Turbo

การติดตั้งใช้งาน ต้องใช้ Diffusers จาก source ร่วมกับ transformers>=5.17.0 และต้องใช้ Diffusers PR #14950 เพื่อรองรับ sampling sigmas ที่กำหนดผ่าน pipeline

import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1-Turbo", dtype=torch.bfloat16
).to("cuda")
image = pipe(
    prompt="A ceramic teapot on a wooden table, soft window light",
    width=2048, height=2048, use_kv_cache=True,
).images[0]

สำหรับการแก้ไขภาพ ผู้ใช้สามารถส่งค่า image=input_image พร้อมกับ prompt คำสั่งได้ทันที รองรับความละเอียดตั้งแต่สี่เหลี่ยมจัตุรัส 2048×2048 ไปจนถึงอัตราส่วน 16:9 ที่ขนาด 2752×1536 ทั้งนี้ควรใช้ค่า sigmas ตามที่กำหนด เนื่องจาก Qwen ระบุว่าตารางเวลาอื่นยังไม่ผ่านการทดสอบ

ค่าบริการ API

Alibaba Cloud Model Studio ให้บริการโมเดลทั้งรุ่น Turbo และ Pro โดย qwen-image-2.1-turbo มีราคาเพียง 0.1 หยวนต่อภาพ และจำกัด 120 RPM ส่วน qwen-image-2.1-pro ราคา 0.25 หยวนต่อภาพ ที่ 20 RPM ซึ่งรุ่น Turbo ถูกกว่าถึง 2.5 เท่า และรองรับปริมาณงานได้มากกว่า 6 เท่า

ตารางเปรียบเทียบ Qwen-Image-2.1-Turbo กับคู่แข่ง

ฟีเจอร์Qwen-Image-2.1-TurboQwen-Image-2.1Z-Image-TurboFLUX.2 klein 9B
องค์กรAlibaba QwenAlibaba QwenAlibaba Tongyi-MAIBlack Forest Labs
ขนาด Generator7B7B6B9B
Text encoderQwen3-VL 8BQwen3-VL 8Bไม่เปิดเผยQwen3 8B
ขั้นตอนเริ่มต้น8408 NFEs4
การแก้ไขรองรับ (หลายภาพ)รองรับ (สูงสุด 10 ภาพ)แยกโมเดล Editรองรับ (หลายภาพ)
ผลลัพธ์ RGBAมีมีไม่เปิดเผยไม่เปิดเผย
ความละเอียดปกติ2K (2048×2048)2K (2048×2048)1024×10241024×1024
VRAM ที่แนะนำไม่ระบุ11-24 GB~16 GB~29 GB (RTX 4090+)
ใบอนุญาตวิจัยวิจัยApache 2.0Non-Commercial

บทสรุปที่น่าสนใจ

  • Qwen-Image-2.1-Turbo ลดขั้นตอนทำงานลงเหลือ 8 ขั้นตอน แต่ยังรักษามาตรฐานภาพระดับ 2K บนสถาปัตยกรรม 7B เดิมได้
  • โมเดลเดียวสามารถทำงานได้หลากหลาย ทั้งสร้างภาพจากข้อความ แก้ไขภาพอ้างอิง และสร้างภาพพื้นหลังโปร่งใส (RGBA)
  • ค่าบริการ API ของรุ่น Turbo ถูกกว่ารุ่น Pro อย่างเห็นได้ชัด เหมาะสำหรับการใช้งานในปริมาณมาก
  • แม้ประสิทธิภาพจะสูง แต่ใบอนุญาตยังจำกัดเฉพาะการวิจัย ซึ่งต้องระวังหากจะนำไปใช้ในเชิงพาณิชย์
Source: MarkTechPost
ดูแลงานแปลและเรียบเรียงโดย NatapolK

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร