NVIDIA เปิดตัว Nemotron 3 Embed: คอลเลกชันโมเดล Embedding ประสิทธิภาพสูงรุ่นเปิด ครองอันดับ #1 บน RTEB

โมเดล Embedding ถือเป็นตัวตัดสินว่า AI Agent จะเข้าถึงข้อมูลส่วนใดได้บ้าง NVIDIA จึงได้เปิดตัว Nemotron 3 Embed model เพื่อทำหน้าที่ในเลเยอร์นี้ โดยเน้นการรองรับ RAG ระดับการผลิต (production-scale), การสืบค้นโดยเอเจนต์ (agentic retrieval), การสืบค้นรหัส (code retrieval) และระบบความจำของเอเจนต์
Nemotron 3 Embed คืออะไร?
คอลเลกชันโมเดลนี้ประกอบด้วย checkpoint แบบเปิด 3 รุ่น ได้แก่ Nemotron-3-Embed-8B-BF16 สำหรับผู้ที่เน้นความแม่นยำเป็นหลัก, Nemotron-3-Embed-1B-BF16 ที่ย่อส่วนลงมาให้กะทัดรัดขึ้น และ Nemotron-3-Embed-1B-NVFP4 ซึ่งใช้เทคโนโลยี 4-bit ที่ปรับแต่งมาเพื่อใช้งานบนสถาปัตยกรรม Blackwell โดยเฉพาะ
ทั้งสามรุ่นเป็นสถาปัตยกรรม transformer encoder ที่ฝึกด้วย bidirectional attention masking โดยผลลัพธ์ของ embedding มาจากการทำ average pooling และรองรับความยาว sequence สูงสุดถึง 32,768 token ในทุก checkpoint
โมเดลเหล่านี้ได้รับการประเมินความสามารถใน 34 ภาษา ภายใต้สัญญาอนุญาต OpenMDW License Agreement, version 1.1 (OpenMDW-1.1) โดยมีพื้นฐานมาจากโมเดล Mistral ซึ่งรุ่น 8B พัฒนาต่อยอดจาก Ministral-3-8B-Instruct-2512 และรุ่น 1B ทั้งสองแบบใช้ Ministral-3-3B-Instruct-2512 เป็นต้นแบบ
ประสิทธิภาพ (Performance)
Nemotron-3-Embed-8B-BF16 สามารถครองอันดับ #1 ในภาพรวมบน RTEB (ข้อมูล ณ วันที่ 17 กรกฎาคม 2026) ซึ่งเป็น Benchmark ด้านการสืบค้นข้อมูล (Retrieval Embedding Benchmark) จากการประเมิน 16 งานทดสอบสาธารณะ โดยมีค่าเฉลี่ย NDCG@10 ที่ความยาว 4096 ดังนี้:
| Model | Params | Emb dim | RTEB | ViDoRe-V3 text | MMTEB (Retrieval) |
|---|---|---|---|---|---|
| Nemotron-3-Embed-8B-BF16 | ~8B | 4096 | 78.46 | 60.60 | 75.45 |
| Nemotron-3-Embed-1B-BF16 | 1.14B | 2048 | 72.38 | 57.74 | 71.04 |
| Nemotron-3-Embed-1B-NVFP4 | 1.14B | 2048 | 72.00 | — | — |
| llama-nemotron-embed-vl-1b-v2 | — | — | 61.98 | 52.54 | 59.71 |
| llama-nemotron-embed-1b-v2 | — | — | 60.47 | 52.10 | 59.58 |
จุดที่น่าสนใจคือรุ่น 1B มีคะแนน RTEB สูงขึ้นถึง 10.4 จุดเมื่อเทียบกับรุ่น baseline เดิม และรุ่น NVFP4 เสียคะแนนจากรุ่น BF16 ไปเพียง 0.38 จุดเท่านั้น หรือยังคงประสิทธิภาพไว้ได้สูงถึง 99.5%
กระบวนการสร้างโมเดล 1B
ประสิทธิภาพที่สูงของรุ่น 1B ไม่ได้เกิดจากการฝึกใหม่ตั้งแต่ต้น (from scratch) แต่มาจากกระบวนการบีบอัด (compression pipeline) โดยเริ่มจากโมเดลแม่ nemotron-3-embed-3b ที่ผ่านการทำ Pruning และ Distillation ซ้ำสองรอบ
เริ่มจากการใช้ NVIDIA ModelOpt mcore_minitron Neural Architecture Search (NAS) เพื่อตัดทอนรุ่น 3B ให้เหลือ 2B โดยค้นหาโครงสร้างที่ดีที่สุดทั้งด้าน hidden width, FFN size, attention heads และ depth จากนั้นจึงทำ Distillation จากโมเดลครูขนาด 8B โดยรวมฟังก์ชัน loss ทั้ง cosine distance loss (COS) และ mean squared error (MSE) เข้าด้วยกัน ก่อนจะทำซ้ำอีกครั้งจนได้ขนาด 1.14B ในที่สุด
การให้บริการด้วย NVFP4 (The NVFP4 Serving Tradeoff)
NVIDIA ยังปรับแต่งรูปแบบการให้บริการผ่านชนิดข้อมูล NVFP4 โดยเน้นไปที่ weights และ activations ของ linear layers ทีมวิจัยใช้เทคนิค Quantization-Aware Distillation (QAD) เพื่อคงความแม่นยำสำหรับข้อมูลที่มีความยาวสูง
ผลการทดสอบพบว่า NVFP4 บนชิป Blackwell ให้ throughput สูงขึ้นสูงสุด 2 เท่าเมื่อเทียบกับ BF16 โดยรักษาความแม่นยำในการสืบค้นไว้ได้กว่า 99% นอกจากนี้ยังรองรับการตัดแบ่ง (slice) มิติของ vector จาก 2048 เหลือ 1024 หรือ 512 ได้ตามต้องการ
Interactive Explainer: เส้นทางการสืบค้นห้าขั้นตอน
กระบวนการทำงานของโมเดลประกอบด้วย 5 ขั้นตอนหลัก ได้แก่ Prefixing, Bidirectional encoding, Average pooling, L2 normalization และการให้คะแนนแบบ Dot-product ซึ่งแต่ละขั้นตอนจะช่วยให้การสืบค้นข้อมูลมีความแม่นยำตามค่าคะแนนที่ระบุใน Model Card
Deployment Matrix
การเลือกใช้งานแต่ละรุ่นมีข้อกำหนดทางเทคนิคที่แตกต่างกันดังนี้:
| Feature | 8B-BF16 | 1B-BF16 | 1B-NVFP4 |
|---|---|---|---|
| Transformers / Sentence Transformers | Yes | Yes | No |
vLLM for /v2/embed | 0.25.0 | 0.25.0 | 0.25.0 |
| Microarchitectures | Ampere, Hopper, Blackwell | Ampere, Hopper, Blackwell | Ampere, Hopper, Lovelace, Blackwell |
| Test hardware | A100 80GB, H100 80GB | A100 80GB, H100 80GB | GB200, RTX 6000 PRO, A100, H100, L40, L4 |
| Training data | 50M+ samples | 8.5M+ (distillation) | 20k (QAD) |
นอกจากนี้ NVIDIA ยังเปิดตัว NIM microservice ภาษา Rust ที่ปรับแต่งมาเพื่อรุ่น 1B โดยเฉพาะ ซึ่งให้ประสิทธิภาพดีกว่า vLLM บนการ์ดจอ GB200 และ RTX PRO 6000 พร้อมมีเครื่องมือ NVIDIA NeMo AutoModel ให้ใช้งานสำหรับการทำ Fine-tuning และ Distillation
การใช้งานในโค้ด
สำหรับการใช้งาน ต้องกำหนด Prefix เป็น query: สำหรับคำถาม และ passage: สำหรับเนื้อหา โดยโมเดลรองรับการใช้งานผ่าน sentence-transformers ได้ทันทีดังนี้:
# pip install --upgrade "transformers>=5.2.0" "sentence-transformers>=5.4.1"
import torch
from sentence_transformers import SentenceTransformer
QUERIES = ["How can someone reduce exposure to pollen during allergy season?"]
DOCUMENTS = ["People with pollen allergy can reduce exposure by staying indoors "
"on dry, windy days, avoiding early-morning outdoor activity, and "
"going outside after rain when pollen levels are lower."]
model = SentenceTransformer(
"nvidia/Nemotron-3-Embed-8B-BF16",
device="cuda",
model_kwargs={"dtype": torch.bfloat16,
# use "sdpa" if FlashAttention-2 is unavailable
"attn_implementation": "flash_attention_2"},
processor_kwargs={"padding_side": "left"},
)
model.max_seq_length = 32768
q = model.encode_query(QUERIES, batch_size=1, convert_to_tensor=True)
d = model.encode_document(DOCUMENTS, batch_size=1, convert_to_tensor=True)
print(model.similarity(q, d)) # card's published q[3]/d[3] score: 0.8008สำหรับการเรียกใช้งานผ่าน API ด้วย vLLM สามารถตั้งค่าได้ดังนี้:
vllm serve nvidia/Nemotron-3-Embed-1B-NVFP4 \
--max-model-len 4096 \
--max-num-batched-tokens 4096 \
--max-cudagraph-capture-size 4096import numpy as np, requests
def embed(input_type: str, texts: list[str]) -> np.ndarray:
r = requests.post(
"http://localhost:8000/v2/embed",
json={"model": "nvidia/Nemotron-3-Embed-1B-NVFP4",
"input_type": input_type, # "query" or "document"
"texts": texts,
"embedding_types": ["float"],
"truncate": "END"},
timeout=120,
)
r.raise_for_status()
return np.array(r.json()["embeddings"]["float"], dtype=np.float32)
scores = embed("query", QUERIES) @ embed("document", DOCUMENTS).Tกรณีการใช้งาน (Use Cases)
การสืบค้นข้อมูลในองค์กรหลายภาษา: เหมาะสำหรับทีมสนับสนุนที่ต้องจัดการข้อมูลหลายภาษา เช่น ภาษาฮินดี ญี่ปุ่น และอังกฤษ โดยผู้ใช้สามารถสืบค้นด้วยภาษาหนึ่งเพื่อดึงข้อมูลจากอีกภาษาได้
การสืบค้นโค้ด (Code retrieval): โมเดลถูกฝึกด้วยชุดข้อมูลรหัสโปรแกรมที่หลากหลาย ทำให้ค้นหาโค้ดจากคำสั่งภาษาธรรมชาติได้แม่นยำขึ้น
ความจำของเอเจนต์: ด้วยขีดจำกัด 32,768 token ช่วยให้เอเจนต์จดจำประวัติการสนทนายาวๆ ได้โดยไม่ต้องตัดเนื้อหาออก
RAG แบบประหยัดต้นทุน: สามารถใช้รุ่น 1B-NVFP4 ในขั้นตอนคัดกรองเบื้องต้นที่มีปริมาณงานสูง และใช้รุ่น 8B สำหรับการประมวลผลคำถามที่ซับซ้อน
สรุปประเด็นสำคัญ
- Nemotron-3-Embed-8B-BF16 ครองตำแหน่งอันดับ 1 บน RTEB ด้วยคะแนน NDCG@10 ที่ 78.46
- แจกจ่ายโมเดลแบบเปิด 3 รุ่น: 8B BF16, 1B BF16 และ 1B NVFP4
- รุ่น NVFP4 บน Blackwell ให้ความเร็วสูงขึ้น 2 เท่า โดยรักษาความแม่นยำได้กว่า 99%
- รุ่น 1B พัฒนาด้วยเทคนิค NAS pruning และ Distillation จากรุ่น 8B
- ทุกรุ่นใช้สัญญาอนุญาต OpenMDW-1.1 และรองรับข้อมูลยาว 32,768 token
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
