Keenable AI เปิดตัว NEEDLE เบนช์มาร์ก Open-Source สำหรับ Search API ที่อัปเดตโจทย์ใหม่ทุกชั่วโมง

Keenable AI เปิดตัว NEEDLE เบนช์มาร์ก Open-Source สำหรับ Search API ที่อัปเดตโจทย์ใหม่ทุกชั่วโมง

เราจะทดสอบเบนช์มาร์กของ Web Search API อย่างไร เมื่อสิ่งที่ถูกทดสอบสามารถเข้าถึงเฉลยได้? ปัญหาใหญ่ของเอเจนต์การค้นหาคือ หากคำตอบที่ถูกต้อง (gold labels) อยู่ในชุดข้อมูลสาธารณะ เอเจนต์อาจข้ามขั้นตอนการดึงข้อมูล (retrieval) แล้วไปดาวน์โหลดคำตอบมาตอบได้ทันที หรือคำตอบนั้นอาจถูกฝังอยู่ในหน่วยความจำ (parametric memory) ของโมเดลอยู่แล้ว ซึ่งการตอบถูกในลักษณะนี้ไม่ได้พิสูจน์ว่าระบบการค้นหาเว็บทำงานได้จริง

Keenable จึงเปิดตัว NEEDLE เบนช์มาร์กแบบโอเพนซอร์สที่ทำงานแบบ Live โดยจะสร้างชุดคำถามใหม่จากแหล่งข้อมูลสาธารณะที่สดใหม่แทนการใช้ชุดข้อมูลแบบคงที่ ชุดคำถามข่าวด่วนจะถูกสร้างใหม่ทุกชั่วโมงจาก RSS feeds และ Google Trends ส่วนคำถามด้านการเงิน วิชาการ กฎหมาย และเอนทิตีที่หายาก (rare-entity) จะอัปเดตทุกวันจาก SEC XBRL, arXiv, Europe PMC, CourtListener และ log ของเอเจนต์สาธารณะ โดยมี Search API จำนวน 15 รายถูกทดสอบภายใต้มาตรฐานเดียวกัน

Is it reproducible?

โครงการนี้เน้นความโปร่งใสในรูปแบบของ Eval harness แบบโอเพนซอร์ส needle เป็น Python CLI ที่ติดตั้งง่ายด้วย uv sync และสั่งการผ่านคำสั่ง generate และ run ผู้ใช้งานเพียงแค่มีคีย์ OpenRouter สำหรับการตัดสินและคีย์ API ของเอนจินที่ต้องการทดสอบ ก็สามารถรันเบนช์มาร์กบนแล็ปท็อปหรือระบบ CI ได้ทันที พร้อมรองรับการตรวจสอบย้อนกลับทั้งกระแสคำถามและการตัดสินคุณภาพการจัดอันดับ (ranking)

What NEEDLE measures

NEEDLE ย่อมาจาก News, Everyday, Expert, Deep-tail, และ Legal Evaluation โดยแต่ละกลุ่มจะจำลองเจตนาการใช้งานที่ต่างกัน ดังนี้:

  • News: ดึงข้อมูลใหม่ล่าสุดจาก RSS feeds 124 รายการและ Google Trends
  • Finance: ถามข้อเท็จจริงจากการจดทะเบียนใน Wikidata และตัวเลขรายไตรมาสจาก SEC XBRL
  • Scholar: แปลงบทความวิชาการเป็นคำถาม 4 รูปแบบ ทั้งแบบระบุชื่อเรื่องไปจนถึงการอธิบายเนื้อหาแบบนึกชื่อไม่ออก (tip-of-the-tongue)
  • Deep-tail: สุ่มคำถามที่มีคำหายากจาก log ของเอเจนต์สาธารณะ เช่น DeepResearchGym และ OpenResearcher
  • Legal: ดึงความเห็นล่าสุดจากศาลรัฐบาลกลาง 14 แห่งผ่าน CourtListener

การให้คะแนนจะปรับตามประเภทข้อมูล โดยกลุ่ม News และ Deep-tail จะใช้ LLM judge ให้คะแนน 0-4 และรายงานผลเป็น nDCG@5 ส่วนกลุ่ม Finance จะวัดจาก answer-recall@5 ว่าข้อเท็จจริงปรากฏใน 5 อันดับแรกหรือไม่ สำหรับกลุ่ม Scholar และ Legal จะใช้การจับคู่รหัสระบุตัวตน (identifier) เพื่อความแม่นยำ

The ceiling is the interesting part

ในการทดสอบ ทุกเอนจินจะได้รับคำถามเดียวกันและส่งคำขอทีละครั้งเพื่อให้เปรียบเทียบความหน่วง (latency) ได้อย่างเป็นธรรม การตัดสินจะพิจารณาจากการจัดอันดับ ชื่อเรื่อง และ snippet ของเอนจินเอง โดยจำกัดหลักฐานไว้ที่ 2,000 ตัวอักษร และกรรมการจะไม่ทราบชื่อเอนจินที่กำลังตรวจ

จุดที่น่าสนใจคือค่า ultimate ceiling ซึ่ง NEEDLE จะรวบรวมผลลัพธ์จากทุกเอนจินมาสร้างเป็นเอนจิน Oracle สังเคราะห์ เพื่อหาเพดานสูงสุดที่เทคโนโลยีในปัจจุบันจะทำได้ ช่องว่างระหว่างคะแนนของเอนจินกับค่า ultimate นี้เองที่เป็นตัวบ่งชี้คุณภาพของ Agentic search หากช่องว่างกว้างแสดงว่ามีผลลัพธ์ที่ดีอยู่แต่เอนจินหาไม่เจอ แต่ถ้าคะแนน ultimate ต่ำ แสดงว่าระบบการดึงข้อมูล (retrieval) ทั้งตลาดกำลังประสบปัญหา

Where the field actually stands

จากข้อมูลเฉลี่ย 7 วัน (สิ้นสุด ณ 2026-08-28) พบว่าโจทย์ด้าน Finance เกือบจะถูกแก้ได้สมบูรณ์ โดย Exa ทำคะแนนได้ 0.910 และ Keenable ได้ 0.872 เทียบกับเพดานที่ 0.965 ในขณะที่ด้าน Scholar มีความแตกต่างกันมาก โดย Keenable นำอยู่ที่ 0.774 ส่วน Tavily อยู่ที่ 0.310 เนื่องจากคำถามบางส่วนต้องใช้ข้อมูลจากเนื้อหาเชิงลึกที่เข้าถึงยาก

ด้านความหน่วง (Latency) ซึ่งสำคัญมากสำหรับเอเจนต์ที่ต้องค้นหาหลายครั้ง พบว่า Keenable-realtime ทำความเร็วได้ดีเยี่ยมที่ 193 ms (p50) ในขณะที่ Exa และ Bing ใช้เวลามากกว่า 1,800 ms และ 2,700 ms ตามลำดับ

Key Takeaways

  • NEEDLE ป้องกันการทำ overfitting โดยการอัปเดตโจทย์ใหม่ทุกชั่วโมงสำหรับข่าว และทุกวันสำหรับหัวข้ออื่น
  • ทดสอบ 15 Search API ภายใต้มาตรฐานเดียวกัน ทั้งข้อความคำถามและข้อจำกัดของหลักฐาน
  • ใช้ค่า ultimate เป็นตัวชี้วัดเพดานความสามารถของอุตสาหกรรม เพื่อแยกแยะปัญหาระหว่างการจัดอันดับกับการดึงข้อมูล
  • ผลการทดสอบชี้ให้เห็นว่า ในโจทย์ที่ยากระดับ Deep-tail เอนจินที่เก่งที่สุดยังทำได้เพียง 0.557 ของเพดานสูงสุดเท่านั้น
  • โปรเจกต์นี้เปิดเป็น Open-source ภายใต้ลิขสิทธิ์ MIT และเผยแพร่ข้อมูลการทดสอบบน Hugging Face
Source: MarkTechPost
ดูแลงานแปลและเรียบเรียงโดย NatapolK

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร