Supabase เปิดตัว Evals: เบนช์มาร์กโอเพนซอร์ส วัดผล coding agents บนสภาพแวดล้อมจริง

Supabase ประกาศ open sourced Supabase Evals ซึ่งเป็นเบนช์มาร์กและเฟรมเวิร์กใหม่สำหรับทดสอบความสามารถของ AI agents ในการสร้างและจัดการระบบบน Supabase โดยตัวระบบจะรัน coding agents ชื่อดังอย่าง Claude Code, Codex และ OpenCode เพื่อทำภารกิจจริง ไม่ว่าจะเป็นการสร้าง schema, การดีบั๊ก Edge Function หรือการแก้ไขนโยบายความปลอดภัย RLS ที่มีปัญหา
การประเมินผลจะใช้การให้คะแนนทั้งแบบ deterministic และระบบ LLM-as-a-judge เพื่อวัดประสิทธิภาพอย่างแม่นยำ ซึ่งระบบนี้ยังทำหน้าที่ขับเคลื่อนลีดเดอร์บอร์ดสาธารณะที่ supabase.com/evals รวมถึงใช้เป็นชุดทดสอบ regression ภายในที่ตรวจสอบเป็นประจำทุกวันอีกด้วย
ใช้งานได้จริงแล้ววันนี้
โครงการ supabase/evals เปิดให้ใช้งานแบบสาธารณะภายใต้สัญญาอนุญาต Apache-2.0 โดยนักพัฒนาสามารถเริ่มต้นรันภายในเครื่องได้ทันทีผ่านคำสั่ง
pnpmเครื่องมือนี้เหมาะอย่างยิ่งสำหรับกลุ่มอุตสาหกรรมเครื่องมือพัฒนาระบบ, โครงสร้างพื้นฐานคลาวด์ และกลุ่มธุรกิจที่เน้นความปลอดภัยสูงอย่าง Fintech หรือ Healthcare เนื่องจากการที่ agent เขียนนโยบาย RLS ผิดพลาดอาจนำไปสู่ช่องโหว่ร้ายแรงได้ โดยสามารถนำไปประยุกต์ใช้ได้ทั้งการทดสอบ regression สำหรับเอกสารและทักษะ ไปจนถึงการคัดกรองคุณภาพก่อนปล่อย SDK สู่สาธารณะ อย่างไรก็ตาม การรันระบบจำเป็นต้องมี Docker daemon, API keys ของผู้ให้บริการ และการเปิดพอร์ต 54321–54329 ไว้ให้พร้อม
เจาะลึกการทำงานของเฟรมเวิร์ก
Supabase กำหนดโครงสร้างการทดสอบไว้สามมิติหลัก ได้แก่ products (ครอบคลุมตั้งแต่ database, auth ไปจนถึง vectors), topics (เช่น RLS, SQL และความปลอดภัย) และ stages (เริ่มตั้งแต่ build ไปจนถึงการ resolve ปัญหา) โดยคัดเลือกสถานการณ์จำลองจากปัญหาจริงที่พบในตั๋วสนับสนุนลูกค้า รายงานบั๊ก และ GitHub issues
สถานการณ์ต่างๆ จะถูกแบ่งเป็นสองกลุ่มคือ Benchmark สำหรับการวัดผลทั่วไปที่เปิดเผยต่อสาธารณะ และ Regression สำหรับตรวจสอบรูปแบบความล้มเหลวที่เคยเกิดขึ้นเพื่อป้องกันการเกิดซ้ำ ซึ่งจะมีการอัปเดตข้อมูลทุกวันแต่ไม่นำคะแนนมาแสดงบนลีดเดอร์บอร์ดหลัก
จุดเด่นคือทุกสถานการณ์จะรันบนสภาพแวดล้อมจริงผ่านคอนเทนเนอร์ที่จำลอง stack ของ Supabase ขึ้นมา ทำให้ agents ต้องเรียกใช้ MCP server และ CLI จริงๆ ไม่ใช่การใช้ข้อมูลสมมติ (mocks) โดยใช้รันไทม์ platform-lite ที่ทำงานร่วมกับ @supabase/lite ในการจัดการ Management API ซึ่ง agents จะได้รับโอกาสในการลองแก้ปัญหาใหม่ได้หนึ่งครั้งก่อนจะทำการตัดสินคะแนน
แต่ละโฟลเดอร์การประเมินจะประกอบด้วยไฟล์งาน PROMPT.md, ตัวให้คะแนน EVAL.ts และสถานะเริ่มต้นใน remote/ หรือ local/ ซึ่งหากมีการประกาศ interface: cli ระบบจะบูต Docker sandbox พร้อมติดตั้ง CLI จริงมาให้โดยอัตโนมัติ
ผลการทดสอบที่น่าสนใจ
จากการทดสอบพบว่า AI agents ส่วนใหญ่สามารถผ่านสถานการณ์ต่างๆ ได้ดี โดยในขั้นตอน Build โมเดลอย่าง Opus 5 และ Kimi K3 ทำคะแนนได้เต็ม 100% โดยไม่ต้องใช้ตัวช่วยเสริม ขณะที่โมเดลอื่นๆ มีประสิทธิภาพเพิ่มขึ้นเมื่อได้รับการเสริมทักษะ (skill) เช่น Sonnet 5 ที่คะแนนพุ่งจาก 78% เป็น 100% และ GPT-5.4 mini ที่เพิ่มจาก 78% เป็น 89%
อย่างไรก็ตาม ยังพบจุดอ่อนที่สำคัญสามประการคือ 1. Agents มักเขียน migrations ด้วยมือแทนการใช้ declarative schemas 2. มักตรวจสอบสิทธิ์ด้วยตนเองแทนการใช้ @supabase/server และ 3. พฤติกรรมการอ่านเอกสารที่ต่างกันมาก โดย Codex อ่านเอกสารเฉลี่ย 8 หน้าต่อสถานการณ์ ในขณะที่ Claude Code อ่านเพียง 2 หน้าเท่านั้น
บทสรุปสำคัญ
- Supabase ปล่อย
supabase/evalsเป็นโอเพนซอร์สภายใต้สัญญาอนุญาต Apache-2.0 - การทดสอบรันบน Supabase stack จริงในคอนเทนเนอร์ ไม่ใช่การจำลองข้อมูล
- ระบบให้คะแนนใช้ทั้งการตรวจสอบอัตโนมัติและ LLM-as-a-judge พร้อมโอกาสแก้ตัวหนึ่งครั้ง
- การเสริมทักษะ (Skills) ส่งผลต่อโมเดลขนาดเล็กมากกว่าโมเดลระดับเรือธง
สำหรับนักพัฒนาที่สนใจสามารถอ่าน รายละเอียดทางเทคนิค เพิ่มเติมได้ที่ GitHub Repo
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
