tag: Benchmark

Keenable AI เปิดตัว NEEDLE เบนช์มาร์ก Open-Source สำหรับ Search API ที่อัปเดตโจทย์ใหม่ทุกชั่วโมง

Keenable AI เปิดตัว NEEDLE เบนช์มาร์ก Open-Source สำหรับ Search API ที่อัปเดตโจทย์ใหม่ทุกชั่วโมง

· By: NatapolK
Keenable AI เปิดตัว NEEDLE เบนช์มาร์กแบบ Live สำหรับทดสอบ Web Search API เพื่อแก้ปัญหา AI ท่องจำคำตอบจากชุดข้อมูลเก่า โดยระบบจะสร้างชุดคำถามใหม่จากแหล่งข้อมูลสดทุกชั่วโมง
เจาะลึก Benchmark ความหน่วง API สำหรับ Voice Agents: ทำไม TTFT อย่างเดียวถึงไม่ใช่คำตอบ

เจาะลึก Benchmark ความหน่วง API สำหรับ Voice Agents: ทำไม TTFT อย่างเดียวถึงไม่ใช่คำตอบ

· By: NatapolK
เจาะลึกประสิทธิภาพ Voice Stack ทุกเลเยอร์ตั้งแต่ LLM ถึง Speech-to-Speech พร้อมชี้ให้เห็นว่า Time to First Token (TTFT) อาจไม่ใช่มาตรวัดที่สะท้อนประสบการณ์ผู้ใช้จริงได้ดีเท่ากับความเร็วในการสร้างประโยค
10 อันดับ Open-Source Benchmark สำหรับ AI Coding Agent ในปี 2026

10 อันดับ Open-Source Benchmark สำหรับ AI Coding Agent ในปี 2026

เจาะลึก 10 เครื่องมือวัดผลแบบ Open-source สำหรับประเมินความสามารถ AI Coding Agent ตั้งแต่การแก้บั๊กใน GitHub ไปจนถึงการเขียนโปรแกรมทั้งระบบและการใช้งาน Terminal ในสถานการณ์จริง
Qualcomm ถอดผลทดสอบประสิทธิภาพพลังงาน Snapdragon C ออกบางส่วนหลังประกาศไปเพียงสัปดาห์เดียว

Qualcomm ถอดผลทดสอบประสิทธิภาพพลังงาน Snapdragon C ออกบางส่วนหลังประกาศไปเพียงสัปดาห์เดียว

· By: SirilukP
Qualcomm ทำการแก้ไขสไลด์นำเสนอชิป Snapdragon C โดยตัดผลการทดสอบด้านการประหยัดพลังงานในส่วนของแอปขณะไม่ได้ใช้งานและการท่องเว็บออกโดยไม่ระบุเหตุผลแน่ชัด
Xiaomi เปิดตัว PROVE: เกณฑ์มาตรฐานใหม่สำหรับประเมินการลบวัตถุในวิดีโอด้วย AI

Xiaomi เปิดตัว PROVE: เกณฑ์มาตรฐานใหม่สำหรับประเมินการลบวัตถุในวิดีโอด้วย AI

· By: TanasakP
MiLM Plus จาก Xiaomi เปิดตัว PROVE เกณฑ์วัดประสิทธิภาพการลบวัตถุด้วย AI ที่เน้นความสอดคล้องทางสายตาโดยไม่ต้องใช้ภาพต้นฉบับอ้างอิง เพื่อแก้ปัญหาเกณฑ์วัดเดิมที่มักให้คะแนนผิดพลาด
TutorMoments: เฟรมเวิร์กใหม่ทดสอบครูสอนพิเศษ AI เมื่อใดควรช่วย หรือเมื่อใดควรปล่อยให้นักเรียนฝึกคิดเอง

TutorMoments: เฟรมเวิร์กใหม่ทดสอบครูสอนพิเศษ AI เมื่อใดควรช่วย หรือเมื่อใดควรปล่อยให้นักเรียนฝึกคิดเอง

· By: SirilukP
Allen Institute for AI เปิดตัว TutorMoments พรีวิวเฟรมเวิร์กสำหรับประเมินโมเดลภาษา (LLMs) ในบทบาทครูสอนพิเศษ โดยเน้นจุดตัดสินใจสำคัญว่าโมเดลควรยื่นมือเข้าช่วยหรือผลักดันให้นักเรียนใช้ความคิดด้วยตัวเอง
Supabase เปิดตัว Evals: เบนช์มาร์กโอเพนซอร์ส วัดผล coding agents บนสภาพแวดล้อมจริง

Supabase เปิดตัว Evals: เบนช์มาร์กโอเพนซอร์ส วัดผล coding agents บนสภาพแวดล้อมจริง

· By: AttapolK
Supabase เปิดตัว supabase/evals เฟรมเวิร์กโอเพนซอร์สสำหรับประเมินทักษะ AI coding agents เช่น Claude Code และ OpenCode ผ่านการรันงานบนระบบ Supabase จริงในคอนเทนเนอร์
Datalab เปิดตัว Marker v2: โชว์ผลทดสอบ Benchmark ชนะขาดทั้งความเร็วและความแม่นยำเหนือคู่แข่ง

Datalab เปิดตัว Marker v2: โชว์ผลทดสอบ Benchmark ชนะขาดทั้งความเร็วและความแม่นยำเหนือคู่แข่ง

· By: TanasakP
Datalab ประกาศยกเครื่อง Marker ใหม่เป็นเวอร์ชัน 2 โดยทำคะแนนบน olmOCR-bench ได้สูงสุดถึง 76.0 พร้อมความเร็วเหนือกว่า MinerU ถึง 5 เท่า และเอาชนะ Docling ได้ทั้งในด้านประสิทธิภาพและคุณภาพการแปลงเอกสาร
NVIDIA srt-slurm: เวิร์กโฟลว์เบนช์มาร์ก LLM แบบกระจายด้วย SLURM Recipes และ Pareto Analysis

NVIDIA srt-slurm: เวิร์กโฟลว์เบนช์มาร์ก LLM แบบกระจายด้วย SLURM Recipes และ Pareto Analysis

· By: SirilukP
เจาะลึกการใช้เฟรมเวิร์ก srt-slurm ของ NVIDIA เพื่อสร้างเวิร์กโฟลว์เบนช์มาร์กการให้บริการ LLM แบบกระจายบนระบบ SLURM ตั้งแต่การกำหนดค่าแบบ declarative ไปจนถึงการวิเคราะห์ประสิทธิภาพผ่าน Pareto frontier
Perplexity AI เปิดตัว WANDR เบนช์มาร์กแบบเปิดเพื่อประเมิน AI Research Agent ในงานวิจัยที่ทั้งกว้างและลึก

Perplexity AI เปิดตัว WANDR เบนช์มาร์กแบบเปิดเพื่อประเมิน AI Research Agent ในงานวิจัยที่ทั้งกว้างและลึก

· By: AttapolK
Perplexity AI เปิดตัว WANDR ซึ่งเป็นเบนช์มาร์กแบบเปิดตัวใหม่ที่เน้นการประเมิน AI Research Agent ในการทำงานวิจัยที่ทั้งกว้างและลึกผ่านงานรวบรวมข้อมูลสมจริง 500 รายการ โดยมีการตรวจสอบหลักฐานอ้างอิงและรองรับโครงสร้างข้อมูลที่ซับซ้อน
OpenAI สั่งถอนการรับรองมาตรฐาน SWE-Bench Pro หลังพบโจทย์เขียนโค้ดยอดนิยมมีข้อผิดพลาดเกือบ 30%

OpenAI สั่งถอนการรับรองมาตรฐาน SWE-Bench Pro หลังพบโจทย์เขียนโค้ดยอดนิยมมีข้อผิดพลาดเกือบ 30%

· By: SirilukP
OpenAI ตรวจสอบเกณฑ์มาตรฐานการเขียนโปรแกรม SWE-Bench Pro พบงานกว่า 30% บกพร่องและคลุมเครือ จนนำไปสู่การยกเลิกการรับรองเพื่อป้องกันความคลาดเคลื่อนในการประเมินความสามารถ AI