เปิดตัว EmbeddingGemma 2 โมเดล Multimodal ขนาดเล็กสำหรับประมวลผลบนเอดจ์
6 ต.ค. 2026
วันนี้ Google DeepMind ได้เปิดตัว EmbeddingGemma 2 โมเดล multimodal embedding แบบ open-weight ที่ดีที่สุดในรุ่นเมื่อเทียบกับขนาด โดยมีความสามารถในการจับคู่ข้อความ รูปภาพ วิดีโอ และเสียงเข้าสู่ vector space เดียวกันได้อย่างเป็นธรรมชาติ
สำหรับนักพัฒนาที่สร้างระบบค้นหาในเครื่อง โมเดลนี้ช่วยลด latency และประหยัดหน่วยความจำได้มหาศาล เนื่องจากไม่จำเป็นต้องเชื่อมต่อโมเดลแยกกันหลายตัว โดยถูกออกแบบมาเพื่อความเป็นส่วนตัว มีขนาดพารามิเตอร์เพียง 740M และใช้ active RAM ต่ำสุดเพียง 191MB สำหรับข้อความ หรือ 567MB สำหรับรูปแบบเต็มบน Google Pixel 11 Pro นอกจากนี้ยังทำงานเป็นเอนจิ้นการตัดสินใจแบบ zero-shot ที่ประมวลผลได้ในระดับมิลลิวินาที ศึกษาข้อมูลเพิ่มเติมได้ที่ Google DeepMind blog
ในโพสต์นี้ เราจะแนะนำวิธีสัมผัสพลังของ EmbeddingGemma 2 ผ่านช่องทางต่างๆ เช่น Google AI Edge, Google AI Edge Gallery บนมือถือ และ Google AI Edge Foresight บน Mac รวมถึงฟีเจอร์ใหม่บน Android ผ่าน ML Kit ที่จะเปิดตัวเร็วๆ นี้
Google AI Edge Gallery ได้เพิ่มสองฟีเจอร์ใหม่ที่ขับเคลื่อนด้วยโมเดลนี้ ได้แก่:
Instant Media Search ให้ผู้ใช้ค้นหาสื่อในเครื่องด้วยภาษาธรรมชาติหรือรูปภาพตัวอย่าง ระบบจะแปลงคำค้นหาเป็นเวกเตอร์ embedding บนอุปกรณ์และดึงข้อมูลจากฐานข้อมูล SQLite ทันทีที่พิมพ์
การค้นหาขณะพิมพ์และการดึงข้อมูลจากรูปภาพสู่รูปภาพ
การประมวลผลที่รวดเร็วและเป็นส่วนตัว: EmbeddingGemma 2 ทำงานในเครื่องได้โดยไม่ต้องใช้อินเทอร์เน็ต ผ่าน MediaPipe UniversalEmbedder และ SemanticRetriever ทำให้ผลการค้นหาอัปเดตแบบเรียลไทม์ตามการพิมพ์ เช่น การพิมพ์ว่า "Katze" เพื่อหาภาพแมว หรือใช้ภาพถ่ายและสตรีมกล้องสดเพื่อค้นหาได้ทันที
Video Moments Finder ใช้ความสามารถ cross-modal เพื่อช่วยให้ผู้ใช้ระบุช่วงเวลาในวิดีโอได้โดยไม่ต้องถอดเสียงหรือสร้างคำบรรยายล่วงหน้า
ค้นหาไฟล์วิดีโอในเครื่องสำหรับช่วงเวลาที่เฉพาะเจาะจง
การทำดัชนีวิดีโอในเครื่อง: เอนจิ้นจะทำดัชนีภาพและเสียงเป็น embedding เมื่อผู้ใช้พิมพ์คำค้นหา เช่น "เด็กๆ กำลังหัวเราะ" ระบบจะเปรียบเทียบเวกเตอร์และไฮไลต์ช่วงเวลาที่ตรงกันในวิดีโอให้ทันที สามารถดาวน์โหลดแอป Google AI Edge Gallery app ได้จาก Google Play Store หรือ Apple App Store เพื่อทดลองใช้งาน
สำหรับผู้ใช้ Mac เราขอแนะนำ Google AI Edge Foresight แอปทดลองที่จะเปลี่ยน Mac ให้เป็นผู้ช่วยประชุมอัจฉริยะที่ประมวลผลในเครื่องทั้งหมด ช่วยทั้งการจดบันทึกและทำดัชนีไฟล์ส่วนตัวโดยไม่ต้องเชื่อมต่อคลาวด์
การปรับปรุงบันทึกย่อแบบชวเลขโดยอัตโนมัติ
คำถามที่ถูกตรวจพบและตอบสดโดย AI
ด้วยการใช้ EmbeddingGemma 2 และ Gemma 4 ทำให้ Foresight สามารถจดบันทึกการประชุมแบบเรียลไทม์ ค้นหาสื่อข้ามรูปแบบ (Cross-Modal Retrieval) และรักษาความปลอดภัยของข้อมูลโดยไม่ให้ออกนอกอุปกรณ์ ดาวน์โหลดได้ที่ ดาวน์โหลด
การพัฒนาสำหรับ Android และข้ามแพลตฟอร์ม
นักพัฒนา Android จะสามารถใช้โมเดลนี้ผ่าน ML Kit ได้ในเร็วๆ นี้ ซึ่งจะช่วยให้ประมวลผลได้รวดเร็วผ่าน NPU โดยไม่ต้องจัดการโมเดลเอง ส่วนการพัฒนาข้ามแพลตฟอร์มทำได้ง่ายขึ้นผ่าน MediaPipe Tasks ที่สนับสนุน EmbeddingGemma 2 ทั้งบน iOS, macOS, Windows, Linux และเว็บ
- MediaPipe Universal Embedder Task: จัดการการปรับขนาดรูปภาพและทำ tokenization อัตโนมัติ
- MediaPipe Semantic Retriever Task: เอนจิ้นค้นหาเวกเตอร์ที่ปรับแต่งให้ทำงานบนเอดจ์ได้รวดเร็วในระดับมิลลิวินาที
นอกจากนี้ยังใช้เป็นเอนจิ้นการตัดสินใจแบบเรียลไทม์ได้ด้วย MediaPipe Decision Task ซึ่งประมวลผลได้เร็วต่ำกว่า 100ms เหมาะสำหรับงานอย่างการกำหนดเส้นทางหรือทำนายการกระทำ
EmbeddingGemma 2 ขับเคลื่อน MediaPipe Decision task ที่มี latency ต่ำบนอุปกรณ์
โมเดลนี้ทำงานบน LiteRT ซึ่งรองรับทั้ง CPU, GPU และ NPU ทำให้นักพัฒนาสามารถใช้ไฟล์ .litertlm เพียงไฟล์เดียวทำงานได้ทุกแพลตฟอร์ม โดยมีการวัดผลประสิทธิภาพที่น่าประทับใจ เช่น การทำ visual embedding บน MacBook M5 Pro GPU ใช้เวลาเพียง 37.3 ms ต่อภาพ เพื่อให้ทำงานบนอุปกรณ์ที่มีทรัพยากรจำกัดได้ดี EmbeddingGemma 2 จึงใช้โครงสร้างแบบโมดูลาร์ที่เลือกโหลดเฉพาะส่วนที่จำเป็น มีการบีบอัดน้ำหนักโมเดลเป็น INT4 และ INT8 ผ่าน QAT และใช้เทคนิค Matryoshka (MRL) เพื่อลดขนาดดัชนีได้สูงสุดถึง 8 เท่า ตรวจสอบเกณฑ์มาตรฐานเพิ่มเติมได้ที่ model card บน Hugging Face
วันนี้เครื่องมือทั้งหมดพร้อมแล้วให้นักพัฒนานำไปสร้างประสบการณ์ใหม่ๆ ไม่ว่าจะเป็นผ่าน ML Kit, MediaPipe Tasks หรือ LiteRT-LM

ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
