tag: Multimodal AI

NeoMME: สถาปัตยกรรม Single-Tower Multimodal Encoder แบบใหม่ที่ทั้งเร็วและประหยัดพื้นที่

NeoMME: สถาปัตยกรรม Single-Tower Multimodal Encoder แบบใหม่ที่ทั้งเร็วและประหยัดพื้นที่

NeoMME เป็นตระกูลโมเดล Multimodal Encoder รุ่นใหม่ที่ใช้ Transformer เพียงตัวเดียวประมวลผลทั้งภาพและข้อความ ให้ประสิทธิภาพสูงในการค้นหาเอกสารภาพและรองรับหลายภาษา
สร้างระบบ Video และ Audio Multimodal ด้วย MiniMax-H3 ผ่าน ComfyUI API

สร้างระบบ Video และ Audio Multimodal ด้วย MiniMax-H3 ผ่าน ComfyUI API

· By: TanasakP
คู่มือการสร้างระบบผลิตสื่อมัลติโมดัลด้วย MiniMax-H3 โดยใช้ ComfyUI เป็นระบบหลังบ้านแบบ Headless เพื่อควบคุมการทำงานอัตโนมัติ ตั้งแต่การตรวจสอบฮาร์ดแวร์จนถึงการถอดรหัสวิดีโอและเสียง
Meta AI เปิดตัว Muse Glimmer โมเดล Agentic ขนาด 30B รันบน GPU ผู้บริโภคตัวเดียวได้สำเร็จ

Meta AI เปิดตัว Muse Glimmer โมเดล Agentic ขนาด 30B รันบน GPU ผู้บริโภคตัวเดียวได้สำเร็จ

· By: SirilukP
Meta เปิดตัว Muse Glimmer โมเดล multimodal แบบ Open-Weights ขนาด 30B ภายใต้ลิขสิทธิ์ Apache 2.0 ที่ถูกปรับแต่งให้มีความเร็วสูงและใช้ VRAM ต่ำเพียง 24 GB เหมาะสำหรับงาน Agent ในพื้นที่
ByteDance Seed เปิดตัว SeedRealtime: โมเดล LLM แบบ Full-Duplex รับรู้ภาพและเสียงจบในตัวเดียว

ByteDance Seed เปิดตัว SeedRealtime: โมเดล LLM แบบ Full-Duplex รับรู้ภาพและเสียงจบในตัวเดียว

· By: TanasakP
ทีม Seed ของ ByteDance เปิดตัว SeedRealtime โมเดลภาษาขนาดใหญ่ที่รวมการประมวลผลเสียง วิดีโอ และข้อความเข้าด้วยกันในสถาปัตยกรรมเดียว ช่วยให้โต้ตอบแบบมัลติโมดัลได้ต่อเนื่องและเป็นธรรมชาติเสมือนมนุษย์
MiniMax เปิดตัว MiniMax H3 โมเดล Omni-Modal เจนวิดีโอ 2K พร้อมเสียงสเตอริโอในตัว

MiniMax เปิดตัว MiniMax H3 โมเดล Omni-Modal เจนวิดีโอ 2K พร้อมเสียงสเตอริโอในตัว

· By: AttapolK
MiniMax เปิดตัวโมเดล AI ใหม่ MiniMax H3 ที่สามารถประมวลผลข้อความ ภาพ วิดีโอ และเสียงได้ในบริบทเดียวกัน เพื่อสร้างวิดีโอความละเอียด 2K ความยาวสูงสุด 15 วินาทีพร้อมเสียงสเตอริโอคุณภาพสูง
Black Forest Labs เปิดตัว FLUX 3 โมเดล Multimodal ล้ำสมัย รองรับทั้งภาพ วิดีโอ เสียง และหุ่นยนต์ในตัวเดียว

Black Forest Labs เปิดตัว FLUX 3 โมเดล Multimodal ล้ำสมัย รองรับทั้งภาพ วิดีโอ เสียง และหุ่นยนต์ในตัวเดียว

· By: SirilukP
Black Forest Labs เปิดตัว FLUX 3 โมเดลพื้นฐานแบบ Multimodal รุ่นแรกที่สามารถทำนายวิดีโอ เสียง และการเคลื่อนไหวของหุ่นยนต์ได้จากชุดน้ำหนักเพียงชุดเดียว โดยใช้สถาปัตยกรรม Self-Flow เพื่อความสมจริงระดับสูงสุด
Meta Superintelligence Labs เปิดตัว Muse Spark 1.1: โมเดลการให้เหตุผล Multimodal สำหรับระบบ Agent อัจฉริยะ

Meta Superintelligence Labs เปิดตัว Muse Spark 1.1: โมเดลการให้เหตุผล Multimodal สำหรับระบบ Agent อัจฉริยะ

Meta เปิดตัว Muse Spark 1.1 พร้อม Meta Model API ในเวอร์ชัน Public Preview ชูจุดเด่นด้านการใช้เครื่องมือ (Tool Use) และ Context Window ขนาด 1 ล้านโทเค็นที่บีบอัดข้อมูลได้เอง แม้ด้านการเขียนโค้ดยังเป็นรองคู่แข่งรายใหญ่