Google เปิดตัว EmbeddingGemma 2 โมเดล Multimodal ขนาดจิ๋ว

· By: TanasakP

6 ต.ค. 2026

ปัจจุบันแอปพลิเคชันการค้นหาและการสร้างเนื้อหาแบบ RAG (Retrieval Augmented Generation) จำเป็นต้องทำงานข้ามประเภทเนื้อหาที่หลากหลาย ตั้งแต่เอกสารทางเทคนิคไปจนถึงไฟล์มัลติมีเดีย ความท้าทายหลักคือการหาโมเดลที่ให้ความแม่นยำสูงแต่ยังคงความหน่วงต่ำ โดยไม่ต้องใช้โครงสร้างพื้นฐานขนาดใหญ่ในการประมวลผล

EmbeddingGemma 2 ถูกออกแบบมาเพื่อตอบโจทย์นี้ในฐานะโมเดลแบบเปิดขนาดกะทัดรัดภายใต้ใบอนุญาต Apache 2.0 ด้วยพื้นฐานจาก Gemma 4 โมเดลที่มีขนาดต่ำกว่า 1B นี้สามารถแปลงข้อมูลได้หลากหลายรูปแบบและให้ประสิทธิภาพยอดเยี่ยมเมื่อเทียบกับขนาด

ความสามารถหลักของโมเดลประกอบด้วย:

  • Native multimodal retrieval: รองรับการค้นหาข้ามข้อความ โค้ด รูปภาพ วิดีโอ และเสียงได้โดยตรงใน vector space ขนาด 768 มิติร่วมกัน
  • Superior code understanding: ประสิทธิภาพเหนือกว่ารุ่นแรกอย่างมากในการค้นหาโค้ด เหมาะสำหรับการทำดัชนีฐานโค้ดในเครื่อง (local codebase indexing)
  • Modular memory footprint: เลือกโหลดเฉพาะ encoder ที่จำเป็น เช่น 270M (ข้อความ/โค้ด), 440M (ข้อความ+ภาพ), 570M (ข้อความ+เสียง) หรือ 740M สำหรับการใช้งานเต็มรูปแบบ
  • Flexible vector storage: ใช้เทคโนโลยี Matryoshka Representation Learning (MRL) ช่วยตัดทอนมิติข้อมูลจาก 768 มิติ เหลือเพียง 128 มิติ เพื่อลดพื้นที่จัดเก็บในขณะที่ยังรักษาคุณภาพข้อมูลส่วนใหญ่ไว้ได้

EmbeddingGemma 2 เข้ามาแทนที่ระบบโมเดลแบบเชื่อมต่อกัน (chained models) ด้วยการใช้ modular encoders ที่โปรเจกต์ข้อมูลเข้าไปในพื้นที่ 768 มิติร่วมกัน แม้แต่ละ modality จะมี encoder เฉพาะทาง แต่ input ทั้งหมดจะถูกประมวลผลผ่าน backbone เดียวกันและอยู่ในพื้นที่มิติเดียวกัน

สำหรับส่วนประกอบทางเทคนิคประกอบด้วย Gemma 4 decoder ที่ปรับแต่งพร้อม context window 8,192 โทเค็นสำหรับการประมวลผลข้อความและโค้ด เสริมด้วย vision encoder และ audio encoder เฉพาะทาง นอกจากนี้ยังใช้ tokenizer และโครงสร้างชุดเดียวกับ Gemma 4 ซึ่งช่วยลดการใช้หน่วยความจำโดยรวมเมื่อใช้งานร่วมกันในเวิร์กโฟลว์ RAG บนอุปกรณ์

นักพัฒนาสามารถรัน EmbeddingGemma 2 ได้ง่ายๆ ผ่านไลบรารี sentence-transformers ตั้งแต่เวอร์ชัน 6.1.0 ขึ้นไป โดยรองรับการติดตั้งผ่าน pip:

pip install -U sentence-transformers[image,audio,video] transformers

ตัวอย่างการเรียกใช้งานโมเดลฉบับเต็มเพื่อทำ embedding ครอบคลุมทุก modality:

from sentence_transformers import SentenceTransformer
# Full model: all modalities (740M parameters)
MODEL_ID = "google/embeddinggemma-2"
model = SentenceTransformer(MODEL_ID)

หากต้องการประหยัดหน่วยความจำ สามารถเลือกข้าม modality ที่ไม่ต้องการได้ด้วยการตั้งค่า config_kwargs เป็น None ซึ่งจะช่วยลดทั้งขนาด weights และการจองหน่วยความจำสูงสุด (peak allocation) ในขณะโหลดโมเดล:

# Text only (270M parameters)
text_only_model = SentenceTransformer(
MODEL_ID,
config_kwargs={"vision_config": None, "audio_config": None},
)
# Text, images, and video (440M parameters)
text_image_model = SentenceTransformer(
MODEL_ID,
config_kwargs={"audio_config": None},
)
# Text and audio (570M parameters)
text_audio_model = SentenceTransformer(
MODEL_ID,
config_kwargs={"vision_config": None},
)

โมเดลนี้ยังได้รับการฝึกฝนด้วยคำสั่งงานสั้นๆ (short task instructions) เพื่อควบคุมการนำเสนอข้อมูล ให้ผู้ใช้สามารถตั้งค่า prompt_name ในฟังก์ชัน encode() เพื่อแยกการทำงานระหว่าง Query และ Document ได้อย่างแม่นยำ:

query = "What causes the northern lights?"
document = "The northern lights are caused by charged particles from the sun.." # truncated
# Embed using `prompt_name`
query_emb = model.encode(query, prompt_name="SearchQuery")
doc_emb = model.encode(document, prompt_name="Document")
print(model.similarity(query_emb, doc_emb))

ในส่วนของพื้นที่จัดเก็บ การตัดทอนมิติเวกเตอร์เหลือ 128 มิติจะช่วยลดการใช้หน่วยความจำได้ถึง 6 เท่า (จาก 1.5 GB เหลือ 250 MB สำหรับข้อมูลล้านรายการ) ทำให้ง่ายต่อการใช้งานบนอุปกรณ์พกพาหรือการจัดเก็บดัชนีขนาดใหญ่ โดยคุณภาพการค้นหาข้อความและโค้ดยังคงอยู่สูงถึง 90% แม้จะลดมิติลงอย่างมาก

EmbeddingGemma 2 ทำคะแนน MTEB (Code) สูงกว่ารุ่นเดิม 14% และเพิ่มขีดความสามารถด้านมัลติมีเดียโดยไม่สูญเสียความแม่นยำเดิม ผู้ที่สนใจสามารถดาวน์โหลดน้ำหนักโมเดลได้ทาง Hugging Face หรือศึกษาเพิ่มเติมได้ที่ เอกสารประกอบของ Gemma รวมถึงรองรับการรันผ่านเครื่องมือยอดนิยมอย่าง vLLM, Ollama, และ LMStudio

Source: Google Developers Blog
ดูแลงานแปลและเรียบเรียงโดย TanasakP
Google เปิดตัว EmbeddingGemma 2 โมเดล Multimodal ขนาดจิ๋ว

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร