เปิดตัว EmbeddingGemma 2 โมเดล Multimodal ขนาดเล็กประสิทธิภาพสูง

· By: SirilukP

EmbeddingGemma 2

หลังจากที่เราได้เปิดตัว EmbeddingGemma ไปเมื่อปีที่ผ่านมาเพื่อเป็นทางเลือกน้ำหนักเบาสำหรับการทำ Text Embeddings คุณภาพสูง ผลตอบรับจากนักพัฒนานั้นยอดเยี่ยมเกินคาดด้วยยอดดาวน์โหลดกว่า 20 ล้านครั้ง ซึ่งถูกนำไปใช้ขับเคลื่อนระบบค้นหาบนอุปกรณ์และระบบ Retrieval Augmented Generation (RAG) ที่เน้นความเป็นส่วนตัว

วันนี้เราต่อยอดความสำเร็จด้วยการเปิดตัว EmbeddingGemma 2 ที่ขยายขีดความสามารถจากเพียงข้อความไปสู่การรวมโค้ด รูปภาพ วิดีโอ และเสียงเข้าไว้ในพื้นที่ Embedding เดียวกัน โดยสร้างขึ้นบนสถาปัตยกรรม Gemma 4 ภายใต้สัญญาอนุญาต Apache 2.0 ที่ใช้งานในเชิงพาณิชย์ได้

ด้วยพารามิเตอร์เพียง 740 ล้านตัว ทำให้ EmbeddingGemma 2 เหมาะสมอย่างยิ่งสำหรับการทำ Inference บนอุปกรณ์ โดยสามารถค้นหาคลิปวิดีโอจากเสียง หรือค้นหาข้อมูลในบันทึกเสียงยาวหลายชั่วโมงผ่านคำค้นหาที่เป็นข้อความ ซึ่งทั้งหมดนี้ประมวลผลผ่านโมเดล Multimodal แบบ Native เพียงตัวเดียว

EmbeddingGemma 2 พัฒนาจากเทคโนโลยีเดียวกับโมเดล Gemini Embedding โดยมีจุดเด่นที่น่าสนใจดังนี้:

  • ดีที่สุดในรุ่นสำหรับขนาดเดียวกัน: ทำคะแนนสูงสุดในกลุ่ม Multimodal Embedder ที่มีพารามิเตอร์ต่ำกว่า 1 พันล้านตัว (sub-1B) จากการทดสอบ MTEB Code และ MAEB โดยให้ประสิทธิภาพเทียบเท่าหรือดีกว่าโมเดลขนาดใหญ่ในงานด้านข้อความและการมองเห็น
  • การออกแบบที่เป็นโมดูล (Modular by design): ใช้พารามิเตอร์เพียง 270 ล้านตัวสำหรับงานเฉพาะข้อความ และมีตัวเลือกเสริมสำหรับ Vision Encoder (170 ล้าน) และ Audio Encoder (300 ล้าน) เพื่อรองรับ Multimodal เต็มรูปแบบ
  • ประหยัดพื้นที่จัดเก็บ: ใช้เทคนิค Matryoshka Representation Learning (MRL) ช่วยให้นักพัฒนาตัดทอน Output Vectors จาก 768 มิติ เหลือเพียง 128 มิติได้แบบไดนามิก ลดการใช้หน่วยความจำและพื้นที่จัดเก็บได้สูงสุดถึง 6 เท่า
  • ปรับแต่งเพื่อประสิทธิภาพบนอุปกรณ์: เมื่อทดสอบบน Google Pixel 11 Pro พบว่าต้องการ RAM ใช้งานเพียง 191MB สำหรับข้อความ และประมาณ 567MB สำหรับโหมด Multimodal เต็มรูปแบบ
  • รองรับ Context ที่กว้างขึ้น: มี Context Window ขนาด 8K token ซึ่งใหญ่กว่ารุ่นแรกถึง 4 เท่า สามารถประมวลผลเสียงได้นาน 5.5 นาที รูปภาพ 29 รูป หรือวิดีโอ 58 เฟรมบนฮาร์ดแวร์ในเครื่องโดยตรง

บรรลุคุณภาพระดับแนวหน้าสำหรับโค้ด, การมองเห็น และเสียง

EmbeddingGemma 2 ยังคงประสิทธิภาพด้านข้อความที่แข็งแกร่งและพัฒนาด้านโค้ดเพิ่มขึ้นถึง 9.92 จุด (จาก 68.76 เป็น 78.68 ใน MTEB Code) เหมาะสำหรับการทำดัชนีฐานรหัสในเครื่องและการค้นหาโค้ดเชิงความหมายสำหรับ Coding Agent

สำหรับงานด้านภาพและเสียง โมเดลนี้สร้างมาตรฐานใหม่ในแง่คุณภาพต่อจำนวนพารามิเตอร์สำหรับโมเดลระดับ sub-1B และยังทำผลงานได้ดีกว่าโมเดลเฉพาะทางที่มีขนาดใหญ่กว่าเท่าตัวในบางการทดสอบ

Massive Text Embedding Benchmark (Code)

Massive Image Embedding Benchmark (Lite)

Massive Audio Embedding Benchmark

คุณสามารถตรวจสอบตัวชี้วัดและข้อมูลทางเทคนิคทั้งหมดได้ที่ EmbeddingGemma 2 model card

เปิดใช้งานการค้นหาเชิงความหมายและการดึงข้อมูลบนอุปกรณ์อย่างสมบูรณ์

การนำความสามารถมาสู่ฮาร์ดแวร์ระดับ Edge โดยตรงช่วยรับรองความเป็นส่วนตัวของข้อมูลและลดความหน่วง ระบบนี้ทำให้นักพัฒนาสร้างการค้นหาแบบข้ามโหมด (cross-modal) ที่ทำงานออฟไลน์ได้สมบูรณ์

เมื่อใช้งานร่วมกับโมเดล Generative อย่าง Gemma 4 ตัว EmbeddingGemma 2 จะช่วยให้ระบบ RAG บนอุปกรณ์เข้าใจข้อมูล Multimodal ที่ซับซ้อนได้ดียิ่งขึ้น เนื่องจากทั้งสองโมเดลใช้ Text Tokenizer และ Audio Encoder ร่วมกัน ทำให้นักพัฒนาสามารถรันทั้งสองระบบพร้อมกันโดยใช้พื้นที่หน่วยความจำรวมน้อยลง

  • ค้นหาสื่อในคลังด้วยข้อความหรือรูปภาพผ่าน Instant Media Search ใน Google AI Edge Gallery
  • ค้นหาช่วงเวลาเฉพาะในวิดีโอได้ใน Video Moments Finder ของ Google AI Edge Gallery
  • ใช้งานร่วมกับแอป Google AI Edge Foresight เพื่อดึงข้อมูลไฟล์ในเครื่อง
  • สร้างเอนจินการตัดสินใจแบบเรียลไทม์ผ่าน MediaPipe Decision Task API

สำหรับผู้ที่ต้องการสร้างระบบการค้นหาและ RAG บนอุปกรณ์ด้วย LiteRT สามารถศึกษาเพิ่มเติมได้ที่ โพสต์บล็อก Google AI Edge

เริ่มต้นใช้งาน EmbeddingGemma 2

เราได้ร่วมมือกับพันธมิตรต่างๆ เพื่อให้มั่นใจว่า EmbeddingGemma 2 จะพร้อมใช้งานได้ทันทีในทุกแพลตฟอร์ม:

  • ดาวน์โหลดโมเดล: ใช้งานได้แล้วบน Hugging Face และ Kaggle รวมถึงโมเดลปรับแต่งพิเศษใน LiteRT Community บน Hugging Face
  • การปรับใช้บนอุปกรณ์: พัฒนาผ่าน MediaPipe หรือ LiteRT และรองรับเบราว์เซอร์ผ่าน transformers.js หรือ WebGPU
  • เครื่องมือพัฒนา: รองรับทั้ง transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama และ LMStudio
  • การ Fine-tuning: สามารถทำตามคำแนะนำจาก Unsloth เพื่อปรับแต่งโมเดลให้เข้ากับกรณีการใช้งานเฉพาะของคุณ

ศึกษารายละเอียดเพิ่มเติมได้ที่ คู่มือนักพัฒนา และเอกสารประกอบการทำ Inference หรือ Fine-tuning

Source: Google Blog (Models & research)
ดูแลงานแปลและเรียบเรียงโดย SirilukP

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร