ByteDance Seed เปิดตัว SeedRealtime: โมเดล LLM แบบ Full-Duplex รับรู้ภาพและเสียงจบในตัวเดียว

ByteDance Seed เปิดตัว SeedRealtime: โมเดล LLM แบบ Full-Duplex รับรู้ภาพและเสียงจบในตัวเดียว

ทีม Seed ของ ByteDance ได้เปิดตัว SeedRealtime ซึ่งเป็น Native Audio-Visual Full-Duplex LLM ที่ปฏิวัติการสื่อสารระหว่างมนุษย์กับ AI โดยโมเดลนี้ได้รวมเสียง วิดีโอ และข้อความเข้าด้วยกันภายใต้สถาปัตยกรรมหนึ่งเดียว ทำให้สามารถโต้ตอบได้แบบเรียลไทม์ผ่านสตรีมข้อมูลที่ต่อเนื่อง แทนที่จะเป็นการโต้ตอบสลับกันทีละเทิร์นแบบเดิม

ความสำเร็จครั้งสำคัญของ Seed ครั้งนี้ประกอบด้วย 3 ประการหลัก ได้แก่ ความเข้าใจด้านภาพและเสียงร่วมกัน (joint audio-visual understanding), การโต้ตอบเชิงรุก (proactive interaction) และจังหวะการสนทนาที่เป็นธรรมชาติ (natural conversational timing) ซึ่งเป็นก้าวสำคัญสู่การโต้ตอบแบบ omni-modal อย่างแท้จริง

เป้าหมายทางสถาปัตยกรรมของ SeedRealtime คือการเปลี่ยนจากระบบแบบเดิมที่ใช้โมดูล ASR, VLM และ TTS มาเชื่อมต่อกันเป็นทอดๆ (cascade) ซึ่งมักจะเพิ่มความหน่วง (latency) และทำให้ข้อมูลสูญหายระหว่างขั้นตอน โดย SeedRealtime เลือกใช้การรันการรับรู้ ความเข้าใจ การตัดสินใจ และการแสดงออกไปพร้อมกันภายในโมเดลแบบ end-to-end เพียงตัวเดียว นอกจากนี้ การสลับเทิร์นการพูด (Turn-taking) ยังถูกย้ายเข้าไปอยู่ภายในโมเดล แทนที่การใช้ตัวตรวจจับเสียงพูดภายนอก (external VAD) ที่ระบบส่วนใหญ่ยังคงพึ่งพาอยู่

Is it deployable?

พร้อมใช้งานในบางส่วน

ปัจจุบัน SeedRealtime ได้ถูก ใช้งานจริงภายในแอป Doubao ซึ่งเป็นผู้ช่วยอัจฉริยะสำหรับผู้บริโภคของ ByteDance อย่างไรก็ตาม ทางบริษัทยังไม่ได้เผยแพร่รายงานทางเทคนิค ไม่ระบุจำนวนพารามิเตอร์ ไม่มีการเปิดซอร์สในส่วนของ weights และยังไม่มี endpoint ให้บริการบน Volcano Engine หรือ BytePlus

ดังนั้น ในฐานะทีมพัฒนาภายนอก คุณจึงยังไม่สามารถนำโมเดลนี้ไปรวมเข้ากับระบบของคุณได้โดยตรงในขณะนี้ สิ่งที่นำไปปรับใช้ได้ทันทีคือแนวคิดและสถาปัตยกรรมอ้างอิงที่ได้รับการพิสูจน์แล้ว ซึ่งถือเป็นการยกระดับมาตรฐานใหม่สำหรับใครก็ตามที่กำลังพัฒนาผลิตภัณฑ์ที่ใช้เสียงและกล้องแบบเรียลไทม์

Interactive explainer

What is actually new in the demos

ทีมพัฒนาได้เผยแพร่ 7 สถานการณ์จำลอง โดยมี 4 สถานการณ์ที่เป็นจุดเด่นดังนี้:

Identity binding across modalities: ในสถานการณ์มื้อค่ำที่มีคนจำนวนมาก โมเดลสามารถจับคู่ชื่อกับใบหน้าเมื่อมีการแนะนำตัว และผูกแต่ละเสียงไว้กับตัวตนของคนนั้นๆ ทำให้ระบุได้ว่าใครเป็นคนพูดแม้จะมีความต้องการที่ขัดแย้งกัน ก่อนที่จะเสนอแผนการสรุปออกมา

Proactive speech from a held instruction: ที่พิพิธภัณฑ์ Hebei ผู้ใช้สั่งให้โมเดลช่วยเตือนเมื่อพบโบราณวัตถุเฉพาะชิ้น ขณะที่กล้องแพนไปเรื่อยๆ โมเดลจะเฝ้าดูและพูดขัดขึ้นมาเองทันทีเมื่อวัตถุนั้นปรากฏในเฟรม เช่นเดียวกับในงานวิจัยที่โมเดลสามารถติดตามการเปิดหน้ากระดาษและหยุดอ่านเพื่อสรุปค่า learning rate หรือ momentum ได้เองโดยไม่ต้องรอคำสั่งซ้ำ

Correction from visual state, not from a question: ระหว่างการดูขั้นตอนการทำกาแฟ โมเดลสามารถขัดจังหวะได้ทันทีเมื่อเห็นการใส่เมล็ดกาแฟแบบเต็มเมล็ดลงในก้านชง (portafilter) พร้อมทั้งวิเคราะห์สีและปริมาณของครีมาเพื่อแนะนำให้ปรับลดเวลาการสกัดได้อย่างแม่นยำ

Interference suppression and off-screen memory: ที่สนามบิน Beijing Daxing โมเดลสามารถแยกแยะและไม่ตอบโต้กับบทสนทนาที่ไม่เกี่ยวข้องรอบข้าง แต่เมื่อผู้ใช้ถามข้อมูลจริง โมเดลจะสามารถดึงข้อมูลจากบอร์ดตารางบินที่เคยเห็นแต่เลื่อนหายไปจากหน้าจอแล้ว รวมถึงค้นหาข้อมูลออนไลน์เพื่อระบุตำแหน่งสายพานรับกระเป๋าได้อย่างถูกต้อง

Key Takeaways

  • SeedRealtime เป็น Native Audio-Visual Full-Duplex LLM ที่รวมเสียง วิดีโอ และข้อความไว้ในระบบ end-to-end เดียว
  • การตัดสินใจเรื่องจังหวะการพูด (Turn-taking) ถูกฝังอยู่ในโมเดลโดยตรง ไม่ต้องพึ่งพา VAD ภายนอก
  • ผลการประเมินระบุว่าปัญหาเรื่องจังหวะการพูดลดลงเหลือเพียงครึ่งเดียวเมื่อเทียบกับระบบแบบเดิม แต่ยังไม่มีการเปิดเผยตัวเลขความหน่วงที่ชัดเจน
  • ใช้งานได้แล้วบนแอป Doubao แต่ยังไม่มีการเปิด API หรือปล่อย Weights สู่สาธารณะ

**Check out the ** ByteDance Seed launch post and

.

Seed models page****Also, feel free to follow us on

Source: MarkTechPost
ดูแลงานแปลและเรียบเรียงโดย TanasakP

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร