Perplexity เปิดตัว pplx-embed-v2-context โมเดล AI ค้นหาแม่นยำกว่าเดิม

Perplexity Research และ turbopuffer ได้เปิดตัว pplx-embed-v2-context-9b-preview ซึ่งเป็นโมเดล contextual embedding สำหรับ RAG pipelines โดยจุดเด่นอยู่ที่การทำ embedding แต่ละ chunk โดยมองเห็นเอกสารฉบับเต็ม การเปลี่ยนแปลงที่สำคัญคือสัญญาณในการฝึกฝน (training signal) ที่ช่วยให้โมเดลเรียนรู้การดึงคำตอบออกมาพร้อมกับบริบทที่จำเป็นในการตรวจสอบ ไม่ใช่แค่เพียง 'gold passage' อย่างเดียว
สำหรับผู้ที่สนใจใช้งานจริง โมเดลนี้เปิดให้ใช้งานแล้วในรูปแบบ self-hosted preview โดยมี Weights อยู่บน Hugging Face ภายใต้ใบอนุญาต MIT การโหลดโมเดลต้องใช้ transformers>=5.4.0 พร้อมตั้งค่า trust_remote_code=True อย่างไรก็ตาม ปัจจุบันยังไม่มีให้บริการผ่าน Perplexity API และตัว model card ระบุว่า weights หรือ interface อาจมีการเปลี่ยนแปลงในอนาคต
ทำไม gold passage ถึงไม่เพียงพอ โดยปกติระบบ RAG จะแบ่งเอกสารยาวๆ ออกเป็น chunk ซึ่งบ่อยครั้งความหมายของ chunk หนึ่งมักจะขึ้นอยู่กับหัวข้อหรือคำนิยามที่ระบุไว้ในส่วนอื่นของเอกสาร โมเดลแบบ Contextual จึงเข้ามาแก้ปัญหานี้ด้วย late chunking ที่ทำการเข้ารหัสเอกสาร (encoded) ทั้งหมดในการผ่านครั้งเดียว ก่อนจะทำ pooling ตามแต่ละ chunk
นอกจากนี้ การฝึกฝนแบบเดิมมักกำหนดให้มีเพียงหนึ่ง gold chunk ต่อหนึ่งคำถาม ทำให้ประโยคอื่นๆ ที่ช่วยเสริมความถูกต้องกลายเป็นผลลบ (negative) ทาง Perplexity จึงระบุปัญหา 3 ประการคือ การใช้ binary label ให้สัญญาณที่หยาบเกินไป, ค่าใช้จ่ายในการทำ annotation โดย LLM ที่สูงตามขนาดข้อมูล และข้อจำกัดที่ label มักผูกติดกับกลยุทธ์การแบ่ง chunk แบบเดียว
วิธีการฝึกฝน
โมเดลนี้ใช้ query-aware context compression model ของ Perplexity เป็นตัวสอน (teacher) ซึ่งจะอ่านคำถามและเอกสารไปพร้อมกันเพื่อคำนวณคะแนนในทุกๆ token
กระบวนการฝึกฝนประกอบด้วย:
- Chunk relevance: คำนวณค่าเฉลี่ยคะแนน token สูงสุด n อันดับแรกในแต่ละ chunk
- Soft target: ใช้ temperature-scaled softmax บน chunk ที่เป็นบวก ส่วน chunk อื่นๆ จะได้คะแนนเป็นศูนย์
- Distillation loss: ใช้ forward KL divergence ระหว่าง teacher และ student
- Document loss: ใช้ InfoNCE โดยให้คะแนนเอกสารตาม chunk ที่ดีที่สุด อ้างอิงจาก ColBERT’s MaxSim
โมเดลเริ่มต้นพัฒนาจาก ColBERT 9B ภายในองค์กร โดยใช้การทำ linear projection เพื่อให้ได้ output 2048 มิติ และรองรับ Matryoshka training ที่ขนาด 1024 มิติด้วย การฝึกฝนแบบ quantization-aware ยังช่วยให้รองรับ int8 embeddings ได้ในตัว โดยใช้ชุดข้อมูลกว่า 430 ชุด ครอบคลุมกว่า 50 ภาษา
Interactive explainer
วิธีที่ pplx-embed-v2-context ดึงคำตอบและหลักฐานออกมา
การสาธิตแบบโต้ตอบแสดงให้เห็นว่าทำไมการใช้ chunk ที่แยกโดดๆ ถึงล้มเหลว และวิธีที่ teacher distillation เข้ามาช่วยปรับปรุงการดึงข้อมูล ตัวอย่างเช่น กรณีไฟล์สัญญาเช่าสามไฟล์ที่มีข้อความคล้ายกัน โมเดลจะสามารถแยกแยะและดึงข้อมูลจากไฟล์ที่ถูกต้องได้อย่างแม่นยำ
context compression model จะให้คะแนนทุก token สำหรับคำถามและนำมารวมกลุ่มใหม่ตาม chunk ทำให้เกิดคุณสมบัติ “flexible chunk boundaries” ตามที่ Perplexity อธิบายไว้ ซึ่งช่วยให้การดึงข้อมูลมีความยืดหยุ่นโดยไม่ต้องทำ annotation ซ้ำ
จากการทดสอบบน context-bench พบว่า 1024-dim int8 (1 KB) มีประสิทธิภาพเหนือกว่า voyage-context-4 ที่เป็น 2048-dim float32 (8 KB) เล็กน้อยในการดึงข้อมูลระดับ chunk ซึ่งช่วยประหยัดพื้นที่จัดเก็บได้มากกว่า
Model card สร้างโดย Marktechpost
context-bench: มาตรฐานการทดสอบใหม่
context-bench ถูกสร้างขึ้นโดย turbopuffer เพื่อเป็นมาตรฐานการทดสอบใหม่ที่ป้องกันการปนเปื้อนของข้อมูลฝึกฝน ประกอบด้วย 2,099 คำถาม จากเอกสารกว่า 38,000 ฉบับ ครอบคลุม 21 โดเมน เพื่อทดสอบความสามารถด้านบริบท 12 ประการ เช่น การตีความคำสรรพนามและโครงสร้างตาราง
ผลลัพธ์
ในการทดสอบ context-bench ที่ K = 10 ผลลัพธ์ระบุว่า:
- Answer recall: 45.5%
- Evidence recall: 40.6%
- เมื่อเทียบกับ voyage-context-4: โมเดลของ Perplexity นำหน้าอยู่ 14.4 จุดในด้าน answer recall และ 5.0 จุดในด้าน evidence recall
ในด้านการจัดเก็บข้อมูล ขนาด 1024-dim int8 (1 KB ต่อ vector) สามารถเอาชนะ voyage-context-4 (8 KB) ได้เล็กน้อย ในขณะที่ความยืดหยุ่นของขนาด Chunk ยังคงรักษาประสิทธิภาพไว้ได้ดีแม้จะเปลี่ยนขนาดจาก 64 เป็น 512 tokens
การเปรียบเทียบกับคู่แข่งที่ใกล้เคียงที่สุด
| คุณสมบัติ | pplx-embed-v2-context-9b-preview | voyage-context-4 | pplx-embed-context-v1-4B | Nemotron-3-Embed-8B |
|---|---|---|---|---|
| Chunk embeddings | Contextual | Contextual | Contextual | แยกอิสระต่อ chunk |
| การเข้าถึง | Open weights, MIT | Hosted API | Open weights, MIT | Open weights |
| พารามิเตอร์ | 9B (HF ระบุ 8B) | ไม่เปิดเผย | 4B | ประมาณ 8B |
| มิติ | 2048, 1024 | 2048, 1024, 512, 256 | 2560 | 4096 |
| การเข้าถึง | ติดตั้งเอง | $0.12 ต่อ 1M tokens | ติดตั้งเอง/API | ติดตั้งเอง |
แหล่งที่มา: เอกสาร Voyage, model cards ที่ลิงก์ด้านบน ตรวจสอบเมื่อวันที่ 30 กันยายน 2026
ประเด็นสำคัญ
- การใช้ตัวสอนระดับ token ช่วยเพิ่มความแม่นยำแทนการใช้เลเบลแบบ chunk เดียว
- โมเดลสามารถดึงคำตอบพร้อมหลักฐานสนับสนุนได้ครบถ้วนในดัชนีเดียว
- ประสิทธิภาพ Answer@10 สูงถึง 45.5% ซึ่งโดดเด่นกว่าคู่แข่งในตลาด
- เปิดให้ใช้งานแบบ Open MIT weights แล้ววันนี้ ส่วน API จะตามมาในภายหลัง
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
