Anthropic เผย Claude 'เป็นผู้นำ' งานวิจัย 26% ท่ามกลางนิยามที่ยังคลุมเครือ

Anthropic กำลังเปิดเผยตัวชี้วัดความเร็วในการพัฒนา AI ของบริษัท โดยระบุว่าขณะนี้ Claude ได้ก้าวขึ้นมา "เป็นผู้นำ" (leads) ในงานพัฒนาโมเดลแห่งอนาคตถึง 26 เปอร์เซ็นต์ อย่างไรก็ตาม มาตรวัดพื้นฐานยังคงมีความคลุมเครือ เนื่องจากเป็นการให้คะแนนโดยตัว Claude เอง และคำว่า "เป็นผู้นำ" อาจมีความหมายที่แตกต่างจากที่หลายคนเข้าใจ
ใน โพสต์ ล่าสุด Anthropic ได้วางมาตรการวัดผล 3 ด้าน ได้แก่ ปริมาณงานที่ AI จัดการได้เอง, ประสิทธิภาพในการตรวจสอบ AI Agent และจำนวนทรัพยากรคำนวณ (Compute) ที่ใช้ในงานด้านความปลอดภัย เพื่อสร้างความโปร่งใสให้สาธารณชนเห็นกระบวนการสร้างโมเดลที่ชัดเจนขึ้น
การเปิดเผยข้อมูลครั้งนี้เกิดขึ้นหลังจากที่ Dario Amodei ซีอีโอของ Anthropic ได้เรียกร้องให้มี ชะลอการพัฒนา AI ระดับแนวหน้า (frontier) อย่างมีการประสานงานกัน ซึ่ง Anthropic มองว่าการมีตัวชี้วัดเหล่านี้จะช่วยเสริมการทดสอบความสามารถของโมเดลในปัจจุบันได้
ความหมายของคำว่า "เป็นผู้นำ" ในที่นี้ และสิ่งที่ไม่ใช่
หัวใจสำคัญของดัชนีนี้คือการจัดหมวดหมู่งานพัฒนาตาม มาตรวัดจาก Epoch AI ซึ่งแบ่งระดับตั้งแต่ AL0 (ไม่มี AI) ไปจนถึง AL5 (อิสระโดยสมบูรณ์) โดย ณ เดือนสิงหาคม 2024 งานของ Anthropic กว่า 26 เปอร์เซ็นต์อยู่ที่ระดับ AL4 ซึ่งก้าวกระโดดจากเดือนกุมภาพันธ์ที่มีไม่ถึง 1 เปอร์เซ็นต์
แม้ Epoch AI จะเรียกระดับ AL4 ว่า "AI leads" หรือ AI เป็นผู้นำ แต่ไม่ได้หมายถึงความเป็นอิสระโดยสมบูรณ์ ตัวอย่างการทำงานในระดับ AL4 คือเมื่อวิศวกรส่งรายงานข้อผิดพลาด (bug report) ให้ Claude มันจะวิเคราะห์และแก้ไขเองโดยไม่ถามคำถาม แต่จะไม่มีสิทธิ์ส่งงาน (ship) ออกไปจนกว่ามนุษย์จะเป็นผู้ตัดสินใจขั้นสุดท้าย
ความน่าสนใจอยู่ที่ Claude เป็นผู้ให้คะแนนตัวเอง โดยใช้เอเจนท์รวบรวมหลักฐานจาก Slack และเอกสารภายใน แล้วให้โมเดล Claude อีกตัวเป็นผู้กำหนดระดับ ซึ่ง Anthropic ยอมรับว่าระบบ "ผู้พิพากษา" นี้อาจเกิดความผิดพลาดได้เช่นเดียวกับระบบที่มันกำลังตรวจสอบอยู่

นอกจากนี้ เส้นแบ่งระหว่างการ "ร่วมมือ" (AL3) กับการ "เป็นผู้นำ" (AL4) ยังไม่ชัดเจน แม้แต่พนักงานของบริษัทเองก็มีความเห็นตรงกันเพียง 1 ใน 3 ของเวลาทั้งหมดเท่านั้น ขณะที่โมเดล Claude ตัดสินตรงกับมนุษย์เพียง 59 เปอร์เซ็นต์ ซึ่งความแตกต่างเพียงระดับเดียวนี้ถือเป็นการก้าวกระโดดทางนิยามที่สำคัญ
การวัดผล 26 เปอร์เซ็นต์ดังกล่าวยังคำนวณจากสัดส่วนชั่วโมงทำงานของมนุษย์ที่ใช้ไปในแต่ละกิจกรรม ซึ่งไม่ได้สะท้อนว่า Claude มีส่วนร่วมในการตัดสินใจเชิงกลยุทธ์หรือกำหนดทิศทางงานวิจัยมากน้อยเพียงใด ข้อมูลนี้จึงเป็นทั้งการโฆษณาประสิทธิภาพผลิตภัณฑ์และเป็นข้อสนับสนุนการเรียกร้องให้ชะลอการพัฒนาของ Amodei ไปในตัว
การกำกับดูแลที่ยังเยาว์วัยสำหรับ 30,000 เอเจนท์
ปัจจุบัน Anthropic มีเอเจนท์ประมาณ 30,000 ตัวทำงานพร้อมกันบนแพลตฟอร์มภายใน โดยมีระบบตรวจสอบแบบเรียลไทม์เพื่อบล็อกการกระทำที่ผิดปกติ เช่น การคัดลอกน้ำหนักของโมเดล (model weights) ซึ่งจากการตัดสินใจกว่าพันล้านครั้งในเดือนสิงหาคม ระบบได้หยุดการกระทำที่สุ่มเสี่ยงไป 0.002 เปอร์เซ็นต์
ในด้านทรัพยากร ช่วงเดือนกรกฎาคมมีการใช้ Compute สำหรับงานวิจัยด้านความปลอดภัยเพียง 6 เปอร์เซ็นต์ ซึ่ง Anthropic ให้ความสำคัญกับตัวเลขนี้เพราะตรวจสอบได้ง่ายที่สุด อย่างไรก็ตาม บริษัทชี้แจงว่าตัวเลขที่ต่ำไม่ได้หมายความว่างานความปลอดภัยมีน้อย เพราะงานส่วนใหญ่เป็นการออกแบบการทดลองที่ใช้เวลาของนักวิจัยมากกว่าพลังประมวลผล
สุดท้าย Anthropic เตือนว่าเส้นแบ่งระหว่างการวิจัยด้านความปลอดภัยและความสามารถของ AI นั้นเลือนลางมาก ผู้พัฒนาแต่ละรายอาจตีความอย่างเข้าข้างตัวเองเพื่อให้ตัวเลขดูดี ดังนั้นภาระในการพิสูจน์ความปลอดภัย (burden of proof) จึงควรตกเป็นหน้าที่ของผู้พัฒนาเองอย่างแท้จริง
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
