Exa เปิดตัว Agent Ultra: API วิจัยเชิงลึก ชูจุดเด่นค้นหาข้อมูลครบถ้วน

Exa ได้เปิดตัว Agent Ultra ซึ่งเป็นระดับความพยายาม (effort level) สูงสุดของ Exa Agent API โดยถูกออกแบบมาเพื่องานวิจัยที่ต้องการความครบถ้วนสมบูรณ์ระดับสูงสุด ไม่ว่าจะเป็นการสร้างรายการข้อมูลขนาดใหญ่ การเพิ่มข้อมูลเอนทิตี (entity enrichment) หรือการตอบคำถามที่ต้องอาศัยแหล่งข้อมูลนับพันแห่ง
ทีมงาน Exa รายงานว่า Agent Ultra สามารถเอาชนะคู่แข่งระดับแนวหน้าอย่าง Opus 5.5, GPT-6 Astra และ Perplexity Agent ในเกณฑ์มาตรฐานการวิจัย 4 รายการ แม้คู่แข่งจะใช้โหมดการทำงานสูงสุดเช่นกัน โดยปัจจุบันเปิดให้ใช้งานจริงแล้วในรูปแบบ hosted API บน Exa API เพียงตั้งค่า effort: "ultra" (ไม่เปิดเป็น open weights)
Exa Agent Ultra คืออะไร?
Exa Agent ทำงานโดยการแบ่งโจทย์วิจัยออกเป็นงานย่อย และมอบหมายให้ subagents ทำการสืบค้นข้อมูลในหลายโดเมนพร้อมกัน โดยจะเลือกใช้โมเดลระดับ frontier ในขั้นตอนที่ซับซ้อน และสลับไปใช้โมเดลที่รวดเร็วกว่าในส่วนที่เหมาะสม เพื่อประสิทธิภาพสูงสุด
ข้อมูลจาก Agent Ultra docs ระบุว่า Ultra เป็นโหมดที่ใช้ทรัพยากรประมวลผล (compute) มากที่สุด เพื่อให้ได้ผลลัพธ์ที่สมบูรณ์ที่สุด โดยทั่วไปงานที่ซับซ้อนจะใช้เวลาประมาณ 30 นาที แต่สำหรับงานที่มีความยากระดับสูงอาจใช้เวลาดำเนินการนานถึง 3 ชั่วโมง
ผลลัพธ์เกณฑ์มาตรฐาน (Benchmark)
จากการทดสอบที่ระบุใน โพสต์เปิดตัวของ Exa โดยให้คู่แข่งตั้งค่าความพยายามสูงสุด พบผลลัพธ์ดังนี้:
| เกณฑ์มาตรฐาน (หน่วยวัด) | Agent Ultra | Opus 5.5 | GPT-6 Astra | Perplexity Agent |
|---|---|---|---|---|
| WANDR (soft recall) | 81.4% | 72.3% | 26.0% | 40.1% |
| DeepSearchQA (F1) | 93.9% | 77.6% | 85.3% | 89.7% |
| WideSearch (row-level F1) | 58.9% | 51.6% | 54.7% | 56.0% |
| Company Find-All (เฉลี่ยเอนทิตีที่พบ) | 2,451 | 146 | 113 | 98 |
ด้านความคุ้มค่า Exa ระบุว่าบนเกณฑ์ WANDR นั้น Agent Ultra ให้ประสิทธิภาพดีกว่า Opus 5.5 ถึง 12.6% ในราคาเพียงครึ่งเดียว ส่วนเกณฑ์ Company Find-All สามารถค้นพบเอนทิตีได้มากกว่า Opus 5.5 ถึง 1579% โดยมีต้นทุนต่อหนึ่งเอนทิตีต่ำที่สุดในกลุ่มการทดสอบ
ทำความเข้าใจกับตัวเลขเหล่านี้
WANDR คือเกณฑ์มาตรฐานจาก Perplexity ที่ใช้ประเมินงานรวบรวมข้อมูลเชิงกว้างและลึก 500 รายการ โดย Exa ได้นำ open harness มาใช้และปรับเปลี่ยนตัวให้คะแนนเป็น gpt-6-luna
ขณะที่ DeepSearchQA จาก Google DeepMind และ WideSearch เป็นการทดสอบการค้นหาหลายขั้นตอนและการรวบรวมข้อมูลวงกว้างตามลำดับ ทั้งนี้ ผลลัพธ์ทั้งหมดเป็นรายงานจากฝั่ง Exa และยังไม่ได้รับการตรวจสอบซ้ำจากหน่วยงานอิสระภายนอก
Agent Ultra เหมาะกับงานประเภทใด
Exa ระบุกลุ่มเป้าหมายหลักไว้ 3 กลุ่ม ได้แก่:
- ผู้ให้บริการโมเดล: ใช้รวบรวมข้อมูลเฉพาะทางเพื่อการฝึกฝน AI
- บริการทางการเงิน: ทำแผนที่ตลาดเพื่อตรวจสอบวิเคราะห์สถานะ (Due Diligence) และวิจัย KYC
- ทีม Go-to-market: สร้างรายชื่อเป้าหมายพร้อมข้อมูลสนับสนุนและแหล่งอ้างอิงที่แม่นยำ
API, ราคา และการควบคุม
Ultra สามารถเรียกใช้งานผ่าน endpoint ของ Agent มาตรฐาน รองรับทั้งการทำ streaming และการกำหนด outputSchema
from exa_py import Exa
exa = Exa()
run = exa.agent.runs.create(
query="Find all companies building browser automation tools in the United States.",
effort="ultra",
)
run = exa.agent.runs.poll_until_finished(run.id, timeout_ms=3 * 60 * 60 * 1000)
print(run.stop_reason)ค่าบริการคิดตามการใช้งานจริงใน อัตราการใช้งาน Agent โดยมีเพดานสูงสุดเริ่มต้นที่ $20 ต่อการรันหนึ่งครั้ง ผู้ใช้สามารถควบคุมงบประมาณได้ผ่าน maxCostDollars (ระบุได้ $1 ถึง $100) และกำหนดระยะเวลาทำงานได้ผ่าน maxDurationSeconds (สูงสุด 10,800 วินาที)
ประเด็นสำคัญ
- Agent Ultra คือโหมดทรงพลังที่สุดของ Exa Agent สำหรับงานวิจัยเชิงลึก
- ใช้เทคนิคประสานงาน subagents แบบขนานและเลือกใช้โมเดลตามความเหมาะสมของงาน
- ทำคะแนนชนะคู่แข่งในเบนช์มาร์กสำคัญทั้ง WANDR และ DeepSearchQA
- ค่าใช้จ่ายเริ่มต้นสูงสุด $20 ต่อการรัน และใช้เวลาทำงานเฉลี่ยประมาณ 30 นาที
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
