Perplexity เปิดตัว pplx-embed-v2-context โมเดล AI ค้นหาแม่นยำกว่าเดิม

· By: TanasakP

Perplexity เปิดตัว pplx-embed-v2-context โมเดล AI ค้นหาแม่นยำกว่าเดิม

Perplexity Research และ turbopuffer ได้เปิดตัว pplx-embed-v2-context-9b-preview ซึ่งเป็นโมเดล contextual embedding สำหรับ RAG pipelines โดยจุดเด่นอยู่ที่การทำ embedding แต่ละ chunk โดยมองเห็นเอกสารฉบับเต็ม การเปลี่ยนแปลงที่สำคัญคือสัญญาณในการฝึกฝน (training signal) ที่ช่วยให้โมเดลเรียนรู้การดึงคำตอบออกมาพร้อมกับบริบทที่จำเป็นในการตรวจสอบ ไม่ใช่แค่เพียง 'gold passage' อย่างเดียว

สำหรับผู้ที่สนใจใช้งานจริง โมเดลนี้เปิดให้ใช้งานแล้วในรูปแบบ self-hosted preview โดยมี Weights อยู่บน Hugging Face ภายใต้ใบอนุญาต MIT การโหลดโมเดลต้องใช้ transformers>=5.4.0 พร้อมตั้งค่า trust_remote_code=True อย่างไรก็ตาม ปัจจุบันยังไม่มีให้บริการผ่าน Perplexity API และตัว model card ระบุว่า weights หรือ interface อาจมีการเปลี่ยนแปลงในอนาคต

ทำไม gold passage ถึงไม่เพียงพอ โดยปกติระบบ RAG จะแบ่งเอกสารยาวๆ ออกเป็น chunk ซึ่งบ่อยครั้งความหมายของ chunk หนึ่งมักจะขึ้นอยู่กับหัวข้อหรือคำนิยามที่ระบุไว้ในส่วนอื่นของเอกสาร โมเดลแบบ Contextual จึงเข้ามาแก้ปัญหานี้ด้วย late chunking ที่ทำการเข้ารหัสเอกสาร (encoded) ทั้งหมดในการผ่านครั้งเดียว ก่อนจะทำ pooling ตามแต่ละ chunk

นอกจากนี้ การฝึกฝนแบบเดิมมักกำหนดให้มีเพียงหนึ่ง gold chunk ต่อหนึ่งคำถาม ทำให้ประโยคอื่นๆ ที่ช่วยเสริมความถูกต้องกลายเป็นผลลบ (negative) ทาง Perplexity จึงระบุปัญหา 3 ประการคือ การใช้ binary label ให้สัญญาณที่หยาบเกินไป, ค่าใช้จ่ายในการทำ annotation โดย LLM ที่สูงตามขนาดข้อมูล และข้อจำกัดที่ label มักผูกติดกับกลยุทธ์การแบ่ง chunk แบบเดียว

วิธีการฝึกฝน

โมเดลนี้ใช้ query-aware context compression model ของ Perplexity เป็นตัวสอน (teacher) ซึ่งจะอ่านคำถามและเอกสารไปพร้อมกันเพื่อคำนวณคะแนนในทุกๆ token

กระบวนการฝึกฝนประกอบด้วย:

  • Chunk relevance: คำนวณค่าเฉลี่ยคะแนน token สูงสุด n อันดับแรกในแต่ละ chunk
  • Soft target: ใช้ temperature-scaled softmax บน chunk ที่เป็นบวก ส่วน chunk อื่นๆ จะได้คะแนนเป็นศูนย์
  • Distillation loss: ใช้ forward KL divergence ระหว่าง teacher และ student
  • Document loss: ใช้ InfoNCE โดยให้คะแนนเอกสารตาม chunk ที่ดีที่สุด อ้างอิงจาก ColBERT’s MaxSim

โมเดลเริ่มต้นพัฒนาจาก ColBERT 9B ภายในองค์กร โดยใช้การทำ linear projection เพื่อให้ได้ output 2048 มิติ และรองรับ Matryoshka training ที่ขนาด 1024 มิติด้วย การฝึกฝนแบบ quantization-aware ยังช่วยให้รองรับ int8 embeddings ได้ในตัว โดยใช้ชุดข้อมูลกว่า 430 ชุด ครอบคลุมกว่า 50 ภาษา

Interactive explainer

วิธีที่ pplx-embed-v2-context ดึงคำตอบและหลักฐานออกมา

การสาธิตแบบโต้ตอบแสดงให้เห็นว่าทำไมการใช้ chunk ที่แยกโดดๆ ถึงล้มเหลว และวิธีที่ teacher distillation เข้ามาช่วยปรับปรุงการดึงข้อมูล ตัวอย่างเช่น กรณีไฟล์สัญญาเช่าสามไฟล์ที่มีข้อความคล้ายกัน โมเดลจะสามารถแยกแยะและดึงข้อมูลจากไฟล์ที่ถูกต้องได้อย่างแม่นยำ

context compression model จะให้คะแนนทุก token สำหรับคำถามและนำมารวมกลุ่มใหม่ตาม chunk ทำให้เกิดคุณสมบัติ “flexible chunk boundaries” ตามที่ Perplexity อธิบายไว้ ซึ่งช่วยให้การดึงข้อมูลมีความยืดหยุ่นโดยไม่ต้องทำ annotation ซ้ำ

จากการทดสอบบน context-bench พบว่า 1024-dim int8 (1 KB) มีประสิทธิภาพเหนือกว่า voyage-context-4 ที่เป็น 2048-dim float32 (8 KB) เล็กน้อยในการดึงข้อมูลระดับ chunk ซึ่งช่วยประหยัดพื้นที่จัดเก็บได้มากกว่า

Perplexity Research·

Model card สร้างโดย Marktechpost

context-bench: มาตรฐานการทดสอบใหม่

context-bench ถูกสร้างขึ้นโดย turbopuffer เพื่อเป็นมาตรฐานการทดสอบใหม่ที่ป้องกันการปนเปื้อนของข้อมูลฝึกฝน ประกอบด้วย 2,099 คำถาม จากเอกสารกว่า 38,000 ฉบับ ครอบคลุม 21 โดเมน เพื่อทดสอบความสามารถด้านบริบท 12 ประการ เช่น การตีความคำสรรพนามและโครงสร้างตาราง

ผลลัพธ์

ในการทดสอบ context-bench ที่ K = 10 ผลลัพธ์ระบุว่า:

  • Answer recall: 45.5%
  • Evidence recall: 40.6%
  • เมื่อเทียบกับ voyage-context-4: โมเดลของ Perplexity นำหน้าอยู่ 14.4 จุดในด้าน answer recall และ 5.0 จุดในด้าน evidence recall

ในด้านการจัดเก็บข้อมูล ขนาด 1024-dim int8 (1 KB ต่อ vector) สามารถเอาชนะ voyage-context-4 (8 KB) ได้เล็กน้อย ในขณะที่ความยืดหยุ่นของขนาด Chunk ยังคงรักษาประสิทธิภาพไว้ได้ดีแม้จะเปลี่ยนขนาดจาก 64 เป็น 512 tokens

การเปรียบเทียบกับคู่แข่งที่ใกล้เคียงที่สุด

คุณสมบัติpplx-embed-v2-context-9b-previewvoyage-context-4pplx-embed-context-v1-4BNemotron-3-Embed-8B
Chunk embeddingsContextualContextualContextualแยกอิสระต่อ chunk
การเข้าถึงOpen weights, MITHosted APIOpen weights, MITOpen weights
พารามิเตอร์9B (HF ระบุ 8B)ไม่เปิดเผย4Bประมาณ 8B
มิติ2048, 10242048, 1024, 512, 25625604096
การเข้าถึงติดตั้งเอง$0.12 ต่อ 1M tokensติดตั้งเอง/APIติดตั้งเอง

แหล่งที่มา: เอกสาร Voyage, model cards ที่ลิงก์ด้านบน ตรวจสอบเมื่อวันที่ 30 กันยายน 2026

ประเด็นสำคัญ

  • การใช้ตัวสอนระดับ token ช่วยเพิ่มความแม่นยำแทนการใช้เลเบลแบบ chunk เดียว
  • โมเดลสามารถดึงคำตอบพร้อมหลักฐานสนับสนุนได้ครบถ้วนในดัชนีเดียว
  • ประสิทธิภาพ Answer@10 สูงถึง 45.5% ซึ่งโดดเด่นกว่าคู่แข่งในตลาด
  • เปิดให้ใช้งานแบบ Open MIT weights แล้ววันนี้ ส่วน API จะตามมาในภายหลัง
Source: MarkTechPost
ดูแลงานแปลและเรียบเรียงโดย TanasakP

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร