AI agent ช่วยพัฒนาโมเดลมากขึ้น แต่การตัดสินใจหลักยังเป็นของมนุษย์

ทีมวิจัยเผยผลการบันทึกการทำงานร่วมกันระหว่างมนุษย์และ AI agent ในการสร้างโมเดล AI ใหม่ ซึ่งผลลัพธ์ที่ได้นั้นท้าทายความเชื่อเดิมๆ เกี่ยวกับขีดความสามารถในการทำงานอย่างเป็นอิสระของ AI
เมื่อ AI agent เข้ามามีบทบาทในการสร้างโมเดล AI ใหม่ ใครกันแน่ที่เป็นผู้ตัดสินใจ? เพื่อหาคำตอบนี้ ทีมนักวิจัยซึ่งรวมถึงผู้เชี่ยวชาญจาก Fudan University ประเทศจีน ได้วิเคราะห์บันทึกงานกว่า 700 รายการจากผู้เข้าร่วม 56 คน ควบคู่ไปกับบันทึกการทำงานของ agent ที่พวกเขาใช้งาน
โครงการนี้มุ่งเน้นการพัฒนา agentic language model ที่ชื่อว่า Atria Dawn Preview ซึ่งใช้สถาปัตยกรรม mixture-of-experts ขนาด 744 พันล้านพารามิเตอร์ ออกแบบมาเพื่อรองรับงานวิจัยและวิศวกรรมโดยเฉพาะ
ตัวโมเดลถูกฝึกฝนผ่านระบบที่เชื่อมโยงงานเข้ากับสภาพแวดล้อมจริง โดยสามารถเรียกใช้เครื่องมือ สร้างผลลัพธ์ระหว่างทาง และตรวจสอบกับข้อมูลภายนอก เช่น ผลการทดสอบหรือซอร์สโค้ด ทีมวิจัยระบุว่าโมเดลนี้ทำคะแนนนำใน 5 จาก 16 เกณฑ์มาตรฐาน (benchmarks) รวมถึงด้านการค้นหาเว็บและความปลอดภัยทางไซเบอร์ แม้จะยังไม่มีความได้เปรียบเหนือคู่แข่งในภาพรวมก็ตาม

1 ใน 3 ของงานจะไม่มีทางเกิดขึ้นหากไม่มี AI ช่วย
จากการตรวจสอบพบว่า AI ถูกนำมาใช้ในงานถึง 96.5% โดยผู้เข้าร่วมโครงการมีแนวโน้มส่งต่องานให้ agent มากขึ้นเรื่อยๆ เห็นได้จากค่ามัธยฐานของอัตราส่วนการกระทำของ agent ต่อการสั่งงานของมนุษย์ที่เพิ่มจาก 11 เป็น 28.5 ภายในสี่สัปดาห์ อย่างไรก็ตาม ทีมวิจัยเตือนว่านี่ไม่ใช่การทำงานอย่างอิสระ เพราะทุกการตัดสินใจของมนุษย์เพียงครั้งเดียวอาจนำไปสู่ขั้นตอนการทำงานของ AI ที่มากขึ้นเท่านั้น

ที่น่าสนใจคือ เมื่อถามผู้เข้าร่วมว่าสามารถทำงานให้เสร็จในคุณภาพเดิมโดยไม่มี AI ได้หรือไม่ พบว่า 151 งานจาก 455 งาน (ประมาณ 1 ใน 3) ถูกประเมินว่า "ทำไม่ได้" หากไม่มี AI ซึ่งงานเหล่านี้กระจายอยู่ในกลุ่มผู้ใช้ทั่วไป ไม่ใช่แค่กลุ่มผู้เชี่ยวชาญ สะท้อนว่า AI ไม่ได้แค่ช่วยให้งานเร็วขึ้น แต่ยังช่วยให้งานที่เป็นไปไม่ได้ในตอนแรกเกิดขึ้นได้จริง

AI เสนอแนวทาง แต่มนุษย์คือผู้เลือก
ในด้านการกำหนดวิธีการและพารามิเตอร์ รูปแบบที่พบมากที่สุดคือ "AI เสนอ มนุษย์เลือก" ซึ่งสูงถึง 55.4% โดยภาพรวมมนุษย์เป็นผู้ตัดสินใจหลักถึง 85.5% ในขณะที่ AI มีส่วนในการตัดสินใจขั้นสุดท้ายเพียง 9.2% เท่านั้น ส่วนการกำหนดเป้าหมายและขอบเขตงาน มนุษย์ยังคงกุมบังเหียนอยู่ที่ 93.4%
แม้ AI จะมีบทบาทในการเสนอแนะตั้งแต่ 17% ถึง 55% ตามประเภทของงาน แต่อำนาจการตัดสินใจสุดท้ายยังคงเป็นของมนุษย์อย่างเหนียวแน่น แม้แต่ในกลุ่มงานที่ยากจนต้องพึ่งพา AI อย่างมาก มนุษย์ก็ยังเป็นผู้เลือกเป้าหมายสูงถึง 95.4% ของเวลาทั้งหมด

มนุษย์ให้บริบท ไม่ใช่ใช้แรงงาน
เมื่อเกิดปัญหาในงาน 588 รายการ พบว่า 76% สามารถไปต่อได้ด้วยการแทรกแซงของมนุษย์ ขณะที่มีเพียง 23% ที่ agent แก้ไขได้เอง โดยการช่วยเหลือของมนุษย์ส่วนใหญ่เป็นการให้ข้อมูลเพิ่มเติม (35.2%) หรือวินิจฉัยและสลับวิธีทำงาน (34.7%) มนุษย์แทบไม่ต้องลงมือแก้ไขโค้ดหรือทำงานนั้นด้วยตัวเองเลย

หากผลลัพธ์ของ AI ต้องมีการแก้ไข AI จะเป็นผู้ลงมือจัดการเองถึง 75.4% หลังจากได้รับคำติชม ทำให้เห็นว่า "วิจารณญาณของมนุษย์" คือคอขวดสำคัญของกระบวนการ ไม่ใช่ขั้นตอนการลงมือทำ
ทีมวิจัยแบ่งระยะบทบาท AI เป็น 4 ระยะ: เริ่มจากการเป็นวัตถุประสงค์การวิจัย, สู่เครื่องมือเฉพาะงาน, จนถึงปัจจุบันที่เป็น "พันธมิตรโครงการ" ซึ่งทำหน้าที่ร่างแผนงานภายใต้เป้าหมายของมนุษย์ ส่วนระยะที่ 4 คือการพัฒนาตัวเองแบบวนซ้ำ (recursive self-improvement) ที่โมเดลรุ่นพี่จะสร้างรุ่นน้องที่เก่งกว่าเดิม

ความเสี่ยงของการเป็นเพียงผู้ประทับตราอนุมัติ
เมื่อห่วงโซ่การทำงานของ agent ยาวเกินกว่าที่มนุษย์จะตรวจสอบได้ทั้งหมด การกำกับดูแลจึงทำได้ยากขึ้น ทีมวิจัยเตือนว่ามนุษย์อาจกลายเป็นเพียง "ตรายาง" ที่อนุมัติงานตามความเคยชิน นอกจากนี้ผู้ใช้หลายคนยังเลือกใช้โหมดอัตโนมัติเพียงเพื่อความสะดวก เพื่อไม่ให้งานต้องหยุดชะงักจากการรออนุมัติบ่อยครั้ง
ประเด็นการพัฒนาตัวเองของ AI กำลังเป็นที่ถกเถียงอย่างกว้างขวาง โดย Anthropic เชื่อว่าเหตุการณ์นี้ อาจเกิดขึ้นเร็วกว่าที่คิด จนนำไปสู่การเรียกร้องให้มี การจำกัดความเร็วในการพัฒนา ขณะที่ OpenAI และ Google ก็เริ่มนำ AI มาใช้ในวงจรการพัฒนามากขึ้น
อย่างไรก็ตาม งานวิจัยจาก Princeton และสถาบันความปลอดภัย AI ของสหราชอาณาจักร กลับให้ผลลัพธ์ที่สอดคล้องกับทีม Atria ว่าแม้โมเดลระดับแนวหน้าจะจัดการงานวิศวกรรมได้ดี แต่ยังคงล้มเหลวในการตัดสินใจในเรื่องสำคัญจริงๆ ซึ่งเป็นสิ่งที่มนุษย์ยังต้องควบคุมต่อไป
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
