Alibaba เปิดตัว Qwen3.8-Omni-Flash โมเดลเข้าใจวิดีโอระดับ Agent

· By: AttapolK

Alibaba เปิดตัว Qwen3.8-Omni-Flash โมเดลเข้าใจวิดีโอระดับ Agent

ทีม Qwen ของ Alibaba เปิดตัว Qwen3.8-Omni-Flash โมเดล Omni-modal รุ่นแรกที่ออกแบบมาให้มีความสามารถแบบ Agentic โดยเฉพาะ โมเดลนี้รองรับข้อมูลหลากหลายรูปแบบทั้งข้อความ รูปภาพ เสียง และวิดีโอ โดยสามารถทำความเข้าใจเนื้อหา วางแผนงาน และเรียกใช้เครื่องมือเพื่อส่งมอบผลลัพธ์เป็นข้อความได้ภายในโมเดลเดียว

ปัจจุบัน Alibaba เปิดให้ใช้งานในรูปแบบ Hosted API ผ่าน QwenCloud, Alibaba Cloud Model Studio และ Qwen Studio อย่างไรก็ตาม ในช่วงเปิดตัวนี้ยังไม่มีการปล่อย Open Weights ทำให้ยังไม่สามารถติดตั้งบนเซิร์ฟเวอร์ส่วนตัว (Self-hosting) ได้ในขณะนี้

Qwen3.8-Omni-Flash คืออะไร

Qwen3.8-Omni-Flash พัฒนาต่อยอดจากสถาปัตยกรรม Qwen3.8-Flash-Next ซึ่งเคยเผยแพร่แบบ Open Weights เมื่อเดือนสิงหาคม 2026 ตัวโมเดลมีจุดเด่นที่ Context Window ขนาด 1 ล้าน Token โดย QwenCloud ระบุว่ารองรับ Input สูงสุด 991K และ Output 131K พร้อมรองรับความยาวในการใช้เหตุผล (Reasoning) ได้สูงสุดถึง 262K Token

โมเดลรุ่นนี้จะส่งผลลัพธ์กลับมาเป็นข้อความเท่านั้น หากนักพัฒนาต้องการสร้างเสียงพูด เอกสารแนะนำให้ใช้ Qwen3.5-Omni แทน ทั้งนี้ระบบการคิด (Thinking) จะถูกเปิดใช้งานเป็นค่าเริ่มต้นด้วยการตั้งค่า reasoning_effort เป็น xhigh ตัว API ยังรองรับมาตรฐานเดียวกับ OpenAI ทำให้นำไปปรับใช้กับ Function Calling, การค้นหาเว็บ และ Structured Outputs ได้ทันที

การรับรู้แบบ Agentic สำหรับวิดีโอที่มีความยาว

ในขณะที่โมเดลวิดีโอส่วนใหญ่ต้องอ่านไฟล์ตั้งแต่ต้นจนจบ ทีมวิจัย Qwen ได้เลือกแนวทางที่ต่างออกไป โดยให้ Agent เริ่มจากคำถามแล้วตัดสินใจว่าจะเลือกดูหรือฟังส่วนไหนของวิดีโอ พร้อมรวบรวมหลักฐานผ่านการพิจารณาหลายรอบจากภาพกว้างไปสู่รายละเอียดเชิงลึก ช่วยให้ประหยัดทรัพยากรไปกับส่วนที่สำคัญจริงๆ

จากการทดสอบบน OmniVideoBench พบว่าความแม่นยำเพิ่มขึ้นจาก 63.4 เป็น 67.8 ในขณะที่การใช้ Token ลดลงจาก 145,736 เหลือเพียง 79,117 Token หรือประหยัดขึ้นประมาณ 45.7% ซึ่งถือเป็นก้าวกระโดดสำคัญในการจัดการกับข้อมูลวิดีโอขนาดใหญ่

ผลการทดสอบประสิทธิภาพที่รายงาน

ทีมวิจัยระบุว่าประสิทธิภาพด้านภาพและเสียงของโมเดลใกล้เคียงกับ Gemini 3.8 Flash และยังมีคะแนนด้านเสียงโดยรวมที่สูงกว่า โดยสรุปผลการทดสอบที่น่าสนใจมีดังนี้:

  • คะแนนเฉลี่ยจากการประเมิน 29 รายการ ดีขึ้นกว่า 25% เมื่อเทียบกับ Qwen3.5-Omni-Plus
  • ประสิทธิภาพของ Agent เพิ่มขึ้นเฉลี่ย 19.5 จุด อ้างอิงจาก WildClawBench-MM และ UniClawBench
  • คะแนน LongAudioSpan เพิ่มขึ้น 8.3 จุด และ OmniVideoBench เพิ่มขึ้น 9.6 จุด

โพสต์บน X ได้สรุป ข้อมูลยืนยันความแข็งแกร่งในด้านงานสาย Agentic ที่เหนือกว่ารุ่นก่อนหน้าอย่างชัดเจน

ราคาและข้อจำกัดของ Input

QwenCloud ตั้งราคาค่าบริการไว้ที่ 0.15 ดอลลาร์ต่อ 1 ล้าน Input Tokens และ 0.47 ดอลลาร์ต่อ 1 ล้าน Output Tokens โดยสามารถลดต้นทุนลงได้มหาศาลเมื่อเทียบกับ Qwen3.5-Omni-Plus โดยเฉพาะค่าบริการ Input เสียงที่ลดลงกว่า 98% และวิดีโอที่ลดลงประมาณ 89%

ข้อจำกัดสำคัญที่นักพัฒนาควรรู้:

  • รองรับไฟล์วิดีโอสูงสุด 2 ชั่วโมง (ขนาดไม่เกิน 2 GB ผ่าน URL)
  • รองรับไฟล์เสียงสูงสุด 3 ชั่วโมง ใน 113 ภาษาและสำเนียง
  • วิดีโอให้ผลลัพธ์เสถียรที่สุดที่ความเร็ว 15 fps
  • เปิดให้บริการแล้วใน 6 ภูมิภาคหลัก ได้แก่ ปักกิ่ง, สิงคโปร์, ฮ่องกง, โตเกียว, แฟรงก์เฟิร์ต และเวอร์จิเนีย

นักพัฒนาสามารถเรียกใช้งานผ่าน OpenAI SDK ได้ด้วยโค้ดสั้นๆ ดังนี้:

import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url=os.environ["DASHSCOPE_BASE_URL"],
)
completion = client.chat.completions.create(
model="qwen3.8-omni-flash",
messages=[{"role": "user", "content": [
{"type": "video_url", "video_url": {"url": os.environ["VIDEO_URL"]}},
{"type": "text", "text": "List the key moments with timestamps."},
]}],
modalities=["text"],
stream=True,
)
for chunk in completion:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")

เครื่องมือ Open-Source: Qwen-MM-Plugins และ Qwen-Live Harness เพื่อให้โมเดลที่ส่งกลับเป็นข้อความสามารถจัดการสื่อได้ดีขึ้น Alibaba ได้เปิดตัวโปรเจกต์ Open-source สองรายการ ได้แก่ Qwen-MM-Plugins ภายใต้ลิขสิทธิ์ Apache-2.0 เพื่อช่วยให้ Agent ต่างๆ รองรับความสามารถ Multimodal ได้ผ่านระบบ Skill

ตัวอย่างความสามารถที่น่าสนใจ ได้แก่ omni-memory สำหรับสร้างความจำจากวิดีโอยาว, omni-video2note สำหรับแปลงวิดีโอสอนงานเป็น PDF และ omni-chatcut ที่ช่วยตัดต่อวิดีโอพร้อมรักษาเสียงเดิมของผู้พูดไว้ อย่างไรก็ตาม ปัจจุบันยังมีข้อจำกัดที่เครื่องมือส่วนใหญ่ยังไม่สามารถส่งเสียงไปยังโมเดลหลักได้โดยตรง ต้องผ่าน API ไปก่อน

สรุปประเด็นสำคัญ

  • Qwen3.8-Omni-Flash รองรับ Input หลากหลายแต่ส่งผลลัพธ์เป็นข้อความ
  • มีจุดเด่นที่ Context Window 1 ล้าน Token และระบบการคิด (Thinking) ในตัว
  • เทคโนโลยี Agentic ช่วยประมวลผลวิดีโอได้แม่นยำขึ้นและประหยัด Token ลง 45.7%
  • ให้บริการผ่าน API ในราคาเริ่มต้นเพียง 0.15 ดอลลาร์ต่อ 1 ล้าน Input Tokens
Source: MarkTechPost
ดูแลงานแปลและเรียบเรียงโดย AttapolK

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร