NeoMME: สถาปัตยกรรม Single-Tower Multimodal Encoder แบบใหม่ที่ทั้งเร็วและประหยัดพื้นที่tag: Hcompany, Hugging Face, Information Retrieval, Multimodal AI, NeoMME, Visual RAGSep 4, 2026 · By: SirilukPNeoMME เป็นตระกูลโมเดล Multimodal Encoder รุ่นใหม่ที่ใช้ Transformer เพียงตัวเดียวประมวลผลทั้งภาพและข้อความ ให้ประสิทธิภาพสูงในการค้นหาเอกสารภาพและรองรับหลายภาษา
สร้างระบบ Video และ Audio Multimodal ด้วย MiniMax-H3 ผ่าน ComfyUI APItag: ComfyUI, MiniMax H3, Multimodal AI, Python, Video GenerationAug 12, 2026 · By: TanasakPคู่มือการสร้างระบบผลิตสื่อมัลติโมดัลด้วย MiniMax-H3 โดยใช้ ComfyUI เป็นระบบหลังบ้านแบบ Headless เพื่อควบคุมการทำงานอัตโนมัติ ตั้งแต่การตรวจสอบฮาร์ดแวร์จนถึงการถอดรหัสวิดีโอและเสียง
Meta AI เปิดตัว Muse Glimmer โมเดล Agentic ขนาด 30B รันบน GPU ผู้บริโภคตัวเดียวได้สำเร็จtag: Agentic Model, GPU, Meta AI, Multimodal AI, Muse Glimmer, Open WeightsAug 11, 2026 · By: SirilukPMeta เปิดตัว Muse Glimmer โมเดล multimodal แบบ Open-Weights ขนาด 30B ภายใต้ลิขสิทธิ์ Apache 2.0 ที่ถูกปรับแต่งให้มีความเร็วสูงและใช้ VRAM ต่ำเพียง 24 GB เหมาะสำหรับงาน Agent ในพื้นที่
ByteDance Seed เปิดตัว SeedRealtime: โมเดล LLM แบบ Full-Duplex รับรู้ภาพและเสียงจบในตัวเดียวtag: ByteDance, Doubao, Full-Duplex LLM, Multimodal AI, SeedRealtimeAug 11, 2026 · By: TanasakPทีม Seed ของ ByteDance เปิดตัว SeedRealtime โมเดลภาษาขนาดใหญ่ที่รวมการประมวลผลเสียง วิดีโอ และข้อความเข้าด้วยกันในสถาปัตยกรรมเดียว ช่วยให้โต้ตอบแบบมัลติโมดัลได้ต่อเนื่องและเป็นธรรมชาติเสมือนมนุษย์
MiniMax เปิดตัว MiniMax H3 โมเดล Omni-Modal เจนวิดีโอ 2K พร้อมเสียงสเตอริโอในตัวtag: Hailuo AI, MiniMax, MiniMax H3, Multimodal AI, Video GenerationAug 2, 2026 · By: AttapolKMiniMax เปิดตัวโมเดล AI ใหม่ MiniMax H3 ที่สามารถประมวลผลข้อความ ภาพ วิดีโอ และเสียงได้ในบริบทเดียวกัน เพื่อสร้างวิดีโอความละเอียด 2K ความยาวสูงสุด 15 วินาทีพร้อมเสียงสเตอริโอคุณภาพสูง
Black Forest Labs เปิดตัว FLUX 3 โมเดล Multimodal ล้ำสมัย รองรับทั้งภาพ วิดีโอ เสียง และหุ่นยนต์ในตัวเดียวtag: Black Forest Labs, FLUX 3, Multimodal AI, Self-Flow, Video GenerationJul 28, 2026 · By: SirilukPBlack Forest Labs เปิดตัว FLUX 3 โมเดลพื้นฐานแบบ Multimodal รุ่นแรกที่สามารถทำนายวิดีโอ เสียง และการเคลื่อนไหวของหุ่นยนต์ได้จากชุดน้ำหนักเพียงชุดเดียว โดยใช้สถาปัตยกรรม Self-Flow เพื่อความสมจริงระดับสูงสุด
Meta Superintelligence Labs เปิดตัว Muse Spark 1.1: โมเดลการให้เหตุผล Multimodal สำหรับระบบ Agent อัจฉริยะtag: AI Agent, Meta, Meta Model API, Multimodal AI, Muse Spark 1.1, Reasoning ModelJul 17, 2026 · By: NatapolKMeta เปิดตัว Muse Spark 1.1 พร้อม Meta Model API ในเวอร์ชัน Public Preview ชูจุดเด่นด้านการใช้เครื่องมือ (Tool Use) และ Context Window ขนาด 1 ล้านโทเค็นที่บีบอัดข้อมูลได้เอง แม้ด้านการเขียนโค้ดยังเป็นรองคู่แข่งรายใหญ่