UK AISI จับมือ EvalEval ยกระดับมาตรฐานการประเมิน AI ให้โปร่งใส

· By: TanasakP

[Avijit Ghosh

evijit

Follow](/evijit)

evaleval

[Jenny Chim

j-chim

Follow](/j-chim)

evaleval

[Deep Joshi

deeplumiere

Follow](/deeplumiere)

evaleval

[Srishti

srishtiy

Follow](/srishtiy)

evaleval

[Matt Kennedy

wmmkennedy

Follow](/wmmkennedy)

evaleval

[Irene Solaiman

irenesolaiman

Follow](/irenesolaiman)

evaleval

[Jessica McFadyen

mcfadyen-aisi

Follow](/mcfadyen-aisi)

ai-safety-institute

[Lynn Tan

lynn-aisi

Follow](/lynn-aisi)

ai-safety-institute

[Coz

coz-aisi

Follow](/coz-aisi)

ai-safety-institute

EvalEval Coalition รู้สึกตื่นเต้นที่จะแจ้งให้ทราบว่า UK AI Security Institute (AISI) กำลังใช้งานโครงสร้างพื้นฐานของ EvalEval เพื่อแบ่งปันผลลัพธ์การประเมินโมเดล AI อย่างเปิดเผย ความร่วมมือครั้งนี้มุ่งสนับสนุนวิทยาศาสตร์การประเมินที่สามารถทำซ้ำและตรวจสอบได้จริง

AISI และ EvalEval เคยร่วมงานกันในงานวิจัยที่เริ่มจากการประชุมเชิงปฏิบัติการ การประชุมเชิงปฏิบัติการร่วมควบคู่ไปกับ NeurIPS 2025 โดยข้อเสนอแนะจากสถาบันมีบทบาทสำคัญในการกำหนดทิศทางของ Every Eval Ever (EEE) schema และในระยะถัดไปจะเป็นการนำโครงสร้างพื้นฐานที่ใช้ร่วมกันนี้มาใช้งานจริงในวงกว้าง

ทำไมการรายงานการประเมินที่ทำซ้ำได้จึงมีความสำคัญ

เมื่อการใช้งาน AI เติบโตอย่างรวดเร็ว การประเมินจึงกลายเป็นหลักฐานสำคัญที่ชี้วัดประสิทธิภาพของโมเดลและระบบ อย่างไรก็ตาม ปัจจุบันผลลัพธ์ถูกรายงานในรูปแบบและแพลตฟอร์มที่หลากหลาย ซึ่งมักขาดข้อมูลเพียงพอต่อการทดสอบซ้ำ อีกทั้งการรันการประเมินใหม่แต่ละครั้งยังมีค่าใช้จ่ายที่สูงมาก

พันธกิจของ EvalEval คือการปรับปรุงระบบนิเวศนี้ผ่าน schema การรายงานร่วมกันอย่าง Every Eval Ever และแพลตฟอร์มแบบเปิด Evaluation Cards ซึ่งรวบรวมผลลัพธ์และข้อมูลจำเป็นในการตีความไว้ในโครงสร้างเดียวกัน เพื่อให้ผู้สนใจสามารถเข้าถึงและทำความเข้าใจผลการทดสอบได้อย่างถูกต้อง

ความเคลื่อนไหวนี้ต่อยอดมาจากงานของ AISI ในการเพิ่มประสิทธิภาพการประเมินผ่าน OptStop และการเพิ่มความแม่นยำทางสถิติด้วย HiBayES โดยทั้งสององค์กรกำลังร่วมมือกันระบุช่องว่างในการรายงานการประเมิน และสร้างโครงสร้างพื้นฐานร่วมกันเพื่อปิดช่องว่างเหล่านั้น

สิ่งที่ AISI กำลังแบ่งปัน

ความโปร่งใสในระดับบทสนทนา (transcript-level) เป็นหัวใจสำคัญในการวิเคราะห์และวินิจฉัยโมเดล ในความร่วมมือระยะใหม่นี้ AISI ได้เปิดเผยวิธีการและผลการประเมินผ่าน Evaluation Cards ครอบคลุมทั้งบริบทและการตั้งค่าสำหรับ 5 Benchmark หลัก ได้แก่ HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro และ Terminal-Bench 2.0

ผลลัพธ์เหล่านี้ครอบคลุม Frontier Model รวม 6 โมเดล ได้แก่ Claude Opus 4, 4.5, 4.6 และ GPT-5, 5.2, 5.4 นอกจากนี้ยังรวมถึงการประเมินด้านไซเบอร์อย่าง Cyber CTFs และ The Last Ones ซึ่งข้อมูลทั้งหมดประกอบอยู่ในรายงานวิจัย How Inference Compute Shapes Frontier LLM Evaluation ที่ศึกษาว่าประสิทธิภาพของ Benchmark ขึ้นอยู่กับทรัพยากรคำนวณและโปรโตคอลอย่างไร

ประสิทธิภาพของ Humanity's Last Exam เปลี่ยนแปลงไปตามโปรโตคอลการประเมินและ inference compute แต่ละเส้นแสดงส่วนแบ่งสะสมของงานที่พยายามทำสำเร็จภายในจำนวน token ที่กำหนด โดยใช้ความสำเร็จแรกสุดที่สังเกตได้ต่องาน เมื่อโมเดลได้รับข้อเสนอแนะความถูกต้องจาก oracle หลังจากการพยายามแต่ละครั้ง โมเดลจะยังคงแก้ปัญหางานเพิ่มเติมต่อไปได้เมื่อการใช้ token เพิ่มขึ้น

เมื่อข้อมูลการตั้งค่าถูกเปิดเผยอย่างโปร่งใส นักวิจัยจะสามารถตรวจสอบการศึกษาแต่ละชิ้นได้อย่างละเอียดและเปรียบเทียบผลลัพธ์ในภาพรวมได้ดียิ่งขึ้น การเปิดเผยข้อมูลของ AISI จะเป็นจุดอ้างอิงสำคัญในการตีความประสิทธิภาพโมเดล และเมื่อมีผู้ใช้ EEE มากขึ้น จะช่วยส่งเสริมการวิจัยเชิงอภิมาน (meta-research) ที่น่าเชื่อถือในอนาคต

ผลลัพธ์ Terminal-Bench 2.0 ของ AISI ควบคู่ไปกับการประเมินอื่นๆ ที่รายงานสำหรับโมเดลเดียวกัน ภายใต้การตั้งค่าการประเมินที่แตกต่างกัน

มีส่วนร่วมในพันธกิจร่วมกัน

เกี่ยวกับ EvalEval Coalition

EvalEval Coalition เป็นชุมชนวิจัยที่พัฒนาโครงสร้างพื้นฐานสำหรับระบบนิเวศการประเมิน AI เพื่อแก้ปัญหาการขาดฉันทามติในการบันทึกข้อมูล โดยมีโครงการหลักคือ Every Eval Ever และ Evaluation Cards ที่ช่วยให้เข้าใจความแตกต่างของคะแนนประเมินภายใต้เงื่อนไขที่ต่างกัน

เกี่ยวกับ UK AI Security Institute

UK AI Security Institute เป็นองค์กรวิจัยภายใต้รัฐบาลสหราชอาณาจักร มีหน้าที่สร้างความเข้าใจทางวิทยาศาสตร์เกี่ยวกับความเสี่ยงของ AI ขั้นสูง เพื่อให้ข้อมูลประกอบการตัดสินใจเชิงนโยบายและการพัฒนาแนวทางบรรเทาความเสี่ยงที่มีประสิทธิภาพ

อ่านเพิ่มเติม

Source: Hugging Face Blog
ดูแลงานแปลและเรียบเรียงโดย TanasakP

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร