UK AISI จับมือ EvalEval ยกระดับมาตรฐานการประเมิน AI ให้โปร่งใส
[Avijit Ghosh
evijit
Follow](/evijit)
[Jenny Chim
j-chim
Follow](/j-chim)
[Deep Joshi
deeplumiere
Follow](/deeplumiere)
[Srishti
srishtiy
Follow](/srishtiy)
[Matt Kennedy
wmmkennedy
Follow](/wmmkennedy)
[Irene Solaiman
irenesolaiman
Follow](/irenesolaiman)
[Jessica McFadyen
mcfadyen-aisi
Follow](/mcfadyen-aisi)
[Lynn Tan
lynn-aisi
Follow](/lynn-aisi)
[Coz
coz-aisi
Follow](/coz-aisi)
EvalEval Coalition รู้สึกตื่นเต้นที่จะแจ้งให้ทราบว่า UK AI Security Institute (AISI) กำลังใช้งานโครงสร้างพื้นฐานของ EvalEval เพื่อแบ่งปันผลลัพธ์การประเมินโมเดล AI อย่างเปิดเผย ความร่วมมือครั้งนี้มุ่งสนับสนุนวิทยาศาสตร์การประเมินที่สามารถทำซ้ำและตรวจสอบได้จริง
AISI และ EvalEval เคยร่วมงานกันในงานวิจัยที่เริ่มจากการประชุมเชิงปฏิบัติการ การประชุมเชิงปฏิบัติการร่วมควบคู่ไปกับ NeurIPS 2025 โดยข้อเสนอแนะจากสถาบันมีบทบาทสำคัญในการกำหนดทิศทางของ Every Eval Ever (EEE) schema และในระยะถัดไปจะเป็นการนำโครงสร้างพื้นฐานที่ใช้ร่วมกันนี้มาใช้งานจริงในวงกว้าง
ทำไมการรายงานการประเมินที่ทำซ้ำได้จึงมีความสำคัญ
เมื่อการใช้งาน AI เติบโตอย่างรวดเร็ว การประเมินจึงกลายเป็นหลักฐานสำคัญที่ชี้วัดประสิทธิภาพของโมเดลและระบบ อย่างไรก็ตาม ปัจจุบันผลลัพธ์ถูกรายงานในรูปแบบและแพลตฟอร์มที่หลากหลาย ซึ่งมักขาดข้อมูลเพียงพอต่อการทดสอบซ้ำ อีกทั้งการรันการประเมินใหม่แต่ละครั้งยังมีค่าใช้จ่ายที่สูงมาก
พันธกิจของ EvalEval คือการปรับปรุงระบบนิเวศนี้ผ่าน schema การรายงานร่วมกันอย่าง Every Eval Ever และแพลตฟอร์มแบบเปิด Evaluation Cards ซึ่งรวบรวมผลลัพธ์และข้อมูลจำเป็นในการตีความไว้ในโครงสร้างเดียวกัน เพื่อให้ผู้สนใจสามารถเข้าถึงและทำความเข้าใจผลการทดสอบได้อย่างถูกต้อง
ความเคลื่อนไหวนี้ต่อยอดมาจากงานของ AISI ในการเพิ่มประสิทธิภาพการประเมินผ่าน OptStop และการเพิ่มความแม่นยำทางสถิติด้วย HiBayES โดยทั้งสององค์กรกำลังร่วมมือกันระบุช่องว่างในการรายงานการประเมิน และสร้างโครงสร้างพื้นฐานร่วมกันเพื่อปิดช่องว่างเหล่านั้น
สิ่งที่ AISI กำลังแบ่งปัน
ความโปร่งใสในระดับบทสนทนา (transcript-level) เป็นหัวใจสำคัญในการวิเคราะห์และวินิจฉัยโมเดล ในความร่วมมือระยะใหม่นี้ AISI ได้เปิดเผยวิธีการและผลการประเมินผ่าน Evaluation Cards ครอบคลุมทั้งบริบทและการตั้งค่าสำหรับ 5 Benchmark หลัก ได้แก่ HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro และ Terminal-Bench 2.0
ผลลัพธ์เหล่านี้ครอบคลุม Frontier Model รวม 6 โมเดล ได้แก่ Claude Opus 4, 4.5, 4.6 และ GPT-5, 5.2, 5.4 นอกจากนี้ยังรวมถึงการประเมินด้านไซเบอร์อย่าง Cyber CTFs และ The Last Ones ซึ่งข้อมูลทั้งหมดประกอบอยู่ในรายงานวิจัย How Inference Compute Shapes Frontier LLM Evaluation ที่ศึกษาว่าประสิทธิภาพของ Benchmark ขึ้นอยู่กับทรัพยากรคำนวณและโปรโตคอลอย่างไร
ประสิทธิภาพของ Humanity's Last Exam เปลี่ยนแปลงไปตามโปรโตคอลการประเมินและ inference compute แต่ละเส้นแสดงส่วนแบ่งสะสมของงานที่พยายามทำสำเร็จภายในจำนวน token ที่กำหนด โดยใช้ความสำเร็จแรกสุดที่สังเกตได้ต่องาน เมื่อโมเดลได้รับข้อเสนอแนะความถูกต้องจาก oracle หลังจากการพยายามแต่ละครั้ง โมเดลจะยังคงแก้ปัญหางานเพิ่มเติมต่อไปได้เมื่อการใช้ token เพิ่มขึ้น
เมื่อข้อมูลการตั้งค่าถูกเปิดเผยอย่างโปร่งใส นักวิจัยจะสามารถตรวจสอบการศึกษาแต่ละชิ้นได้อย่างละเอียดและเปรียบเทียบผลลัพธ์ในภาพรวมได้ดียิ่งขึ้น การเปิดเผยข้อมูลของ AISI จะเป็นจุดอ้างอิงสำคัญในการตีความประสิทธิภาพโมเดล และเมื่อมีผู้ใช้ EEE มากขึ้น จะช่วยส่งเสริมการวิจัยเชิงอภิมาน (meta-research) ที่น่าเชื่อถือในอนาคต
ผลลัพธ์ Terminal-Bench 2.0 ของ AISI ควบคู่ไปกับการประเมินอื่นๆ ที่รายงานสำหรับโมเดลเดียวกัน ภายใต้การตั้งค่าการประเมินที่แตกต่างกัน
มีส่วนร่วมในพันธกิจร่วมกัน
- ผู้พัฒนาโมเดล: สามารถ รายงานผลลัพธ์การประเมินที่ผ่านการตรวจสอบแล้ว
- ผู้พัฒนาการประเมิน: รายงาน Benchmark และข้อมูลการรันผ่าน Every Eval Ever schema
- นักวิจัยและผู้กำหนดนโยบาย: สำรวจ Evaluation Cards เพื่อตรวจสอบสถานะการรายงานการประเมินโดยรวม
เกี่ยวกับ EvalEval Coalition
EvalEval Coalition เป็นชุมชนวิจัยที่พัฒนาโครงสร้างพื้นฐานสำหรับระบบนิเวศการประเมิน AI เพื่อแก้ปัญหาการขาดฉันทามติในการบันทึกข้อมูล โดยมีโครงการหลักคือ Every Eval Ever และ Evaluation Cards ที่ช่วยให้เข้าใจความแตกต่างของคะแนนประเมินภายใต้เงื่อนไขที่ต่างกัน
เกี่ยวกับ UK AI Security Institute
UK AI Security Institute เป็นองค์กรวิจัยภายใต้รัฐบาลสหราชอาณาจักร มีหน้าที่สร้างความเข้าใจทางวิทยาศาสตร์เกี่ยวกับความเสี่ยงของ AI ขั้นสูง เพื่อให้ข้อมูลประกอบการตัดสินใจเชิงนโยบายและการพัฒนาแนวทางบรรเทาความเสี่ยงที่มีประสิทธิภาพ
อ่านเพิ่มเติม
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
