AI agent ช่วยพัฒนาโมเดลมากขึ้น แต่การตัดสินใจหลักยังเป็นของมนุษย์

· By: SirilukP

Image description

ทีมวิจัยเผยผลการบันทึกการทำงานร่วมกันระหว่างมนุษย์และ AI agent ในการสร้างโมเดล AI ใหม่ ซึ่งผลลัพธ์ที่ได้นั้นท้าทายความเชื่อเดิมๆ เกี่ยวกับขีดความสามารถในการทำงานอย่างเป็นอิสระของ AI

เมื่อ AI agent เข้ามามีบทบาทในการสร้างโมเดล AI ใหม่ ใครกันแน่ที่เป็นผู้ตัดสินใจ? เพื่อหาคำตอบนี้ ทีมนักวิจัยซึ่งรวมถึงผู้เชี่ยวชาญจาก Fudan University ประเทศจีน ได้วิเคราะห์บันทึกงานกว่า 700 รายการจากผู้เข้าร่วม 56 คน ควบคู่ไปกับบันทึกการทำงานของ agent ที่พวกเขาใช้งาน

โครงการนี้มุ่งเน้นการพัฒนา agentic language model ที่ชื่อว่า Atria Dawn Preview ซึ่งใช้สถาปัตยกรรม mixture-of-experts ขนาด 744 พันล้านพารามิเตอร์ ออกแบบมาเพื่อรองรับงานวิจัยและวิศวกรรมโดยเฉพาะ

ตัวโมเดลถูกฝึกฝนผ่านระบบที่เชื่อมโยงงานเข้ากับสภาพแวดล้อมจริง โดยสามารถเรียกใช้เครื่องมือ สร้างผลลัพธ์ระหว่างทาง และตรวจสอบกับข้อมูลภายนอก เช่น ผลการทดสอบหรือซอร์สโค้ด ทีมวิจัยระบุว่าโมเดลนี้ทำคะแนนนำใน 5 จาก 16 เกณฑ์มาตรฐาน (benchmarks) รวมถึงด้านการค้นหาเว็บและความปลอดภัยทางไซเบอร์ แม้จะยังไม่มีความได้เปรียบเหนือคู่แข่งในภาพรวมก็ตาม

Eight bar charts comparing Atria Dawn Preview with DeepSeek V4 Pro, Kimi K3, Qwen 3.8 Max, GLM 5.3, GPT 5.6 Sol, and Claude Opus 5 across AutomationBench, SkillsBench, Workspace-Bench-Lite, GDPval, CyberGym, MLE-Bench Lite, DeepResearch Bench II, and SWE-Bench Pro.

1 ใน 3 ของงานจะไม่มีทางเกิดขึ้นหากไม่มี AI ช่วย

จากการตรวจสอบพบว่า AI ถูกนำมาใช้ในงานถึง 96.5% โดยผู้เข้าร่วมโครงการมีแนวโน้มส่งต่องานให้ agent มากขึ้นเรื่อยๆ เห็นได้จากค่ามัธยฐานของอัตราส่วนการกระทำของ agent ต่อการสั่งงานของมนุษย์ที่เพิ่มจาก 11 เป็น 28.5 ภายในสี่สัปดาห์ อย่างไรก็ตาม ทีมวิจัยเตือนว่านี่ไม่ใช่การทำงานอย่างอิสระ เพราะทุกการตัดสินใจของมนุษย์เพียงครั้งเดียวอาจนำไปสู่ขั้นตอนการทำงานของ AI ที่มากขึ้นเท่านั้น

Line chart showing the daily median of agent actions per human prompt from August 7 to September 4, 2026, rising from 11.0 to 28.5 with a gray shaded interquartile range.

ที่น่าสนใจคือ เมื่อถามผู้เข้าร่วมว่าสามารถทำงานให้เสร็จในคุณภาพเดิมโดยไม่มี AI ได้หรือไม่ พบว่า 151 งานจาก 455 งาน (ประมาณ 1 ใน 3) ถูกประเมินว่า "ทำไม่ได้" หากไม่มี AI ซึ่งงานเหล่านี้กระจายอยู่ในกลุ่มผู้ใช้ทั่วไป ไม่ใช่แค่กลุ่มผู้เชี่ยวชาญ สะท้อนว่า AI ไม่ได้แค่ช่วยให้งานเร็วขึ้น แต่ยังช่วยให้งานที่เป็นไปไม่ได้ในตอนแรกเกิดขึ้นได้จริง

Heatmap table showing estimated time effort without AI by task category, ranging from under half an hour to infeasible, with the infeasible share at 33.2 percent overall.

AI เสนอแนวทาง แต่มนุษย์คือผู้เลือก

ในด้านการกำหนดวิธีการและพารามิเตอร์ รูปแบบที่พบมากที่สุดคือ "AI เสนอ มนุษย์เลือก" ซึ่งสูงถึง 55.4% โดยภาพรวมมนุษย์เป็นผู้ตัดสินใจหลักถึง 85.5% ในขณะที่ AI มีส่วนในการตัดสินใจขั้นสุดท้ายเพียง 9.2% เท่านั้น ส่วนการกำหนดเป้าหมายและขอบเขตงาน มนุษย์ยังคงกุมบังเหียนอยู่ที่ 93.4%

แม้ AI จะมีบทบาทในการเสนอแนะตั้งแต่ 17% ถึง 55% ตามประเภทของงาน แต่อำนาจการตัดสินใจสุดท้ายยังคงเป็นของมนุษย์อย่างเหนียวแน่น แม้แต่ในกลุ่มงานที่ยากจนต้องพึ่งพา AI อย่างมาก มนุษย์ก็ยังเป็นผู้เลือกเป้าหมายสูงถึง 95.4% ของเวลาทั้งหมด

Stacked bar chart showing who proposes and who decides on goals, methods, and acceptance criteria, with AI proposing methods in 55.4 percent of cases and humans making the final selection.

มนุษย์ให้บริบท ไม่ใช่ใช้แรงงาน

เมื่อเกิดปัญหาในงาน 588 รายการ พบว่า 76% สามารถไปต่อได้ด้วยการแทรกแซงของมนุษย์ ขณะที่มีเพียง 23% ที่ agent แก้ไขได้เอง โดยการช่วยเหลือของมนุษย์ส่วนใหญ่เป็นการให้ข้อมูลเพิ่มเติม (35.2%) หรือวินิจฉัยและสลับวิธีทำงาน (34.7%) มนุษย์แทบไม่ต้องลงมือแก้ไขโค้ดหรือทำงานนั้นด้วยตัวเองเลย

Horizontal bar chart showing how tasks progressed after a problem, with 35.2 percent resolved by adding context, 34.7 percent by human diagnosis, and 23.0 percent by the AI recovering on its own.

หากผลลัพธ์ของ AI ต้องมีการแก้ไข AI จะเป็นผู้ลงมือจัดการเองถึง 75.4% หลังจากได้รับคำติชม ทำให้เห็นว่า "วิจารณญาณของมนุษย์" คือคอขวดสำคัญของกระบวนการ ไม่ใช่ขั้นตอนการลงมือทำ

ทีมวิจัยแบ่งระยะบทบาท AI เป็น 4 ระยะ: เริ่มจากการเป็นวัตถุประสงค์การวิจัย, สู่เครื่องมือเฉพาะงาน, จนถึงปัจจุบันที่เป็น "พันธมิตรโครงการ" ซึ่งทำหน้าที่ร่างแผนงานภายใต้เป้าหมายของมนุษย์ ส่วนระยะที่ 4 คือการพัฒนาตัวเองแบบวนซ้ำ (recursive self-improvement) ที่โมเดลรุ่นพี่จะสร้างรุ่นน้องที่เก่งกว่าเดิม

Four-panel diagram showing a human and a robot in the roles of research object, task-level runner, project-level coworker, and a question mark for the next stage.

ความเสี่ยงของการเป็นเพียงผู้ประทับตราอนุมัติ

เมื่อห่วงโซ่การทำงานของ agent ยาวเกินกว่าที่มนุษย์จะตรวจสอบได้ทั้งหมด การกำกับดูแลจึงทำได้ยากขึ้น ทีมวิจัยเตือนว่ามนุษย์อาจกลายเป็นเพียง "ตรายาง" ที่อนุมัติงานตามความเคยชิน นอกจากนี้ผู้ใช้หลายคนยังเลือกใช้โหมดอัตโนมัติเพียงเพื่อความสะดวก เพื่อไม่ให้งานต้องหยุดชะงักจากการรออนุมัติบ่อยครั้ง

ประเด็นการพัฒนาตัวเองของ AI กำลังเป็นที่ถกเถียงอย่างกว้างขวาง โดย Anthropic เชื่อว่าเหตุการณ์นี้ อาจเกิดขึ้นเร็วกว่าที่คิด จนนำไปสู่การเรียกร้องให้มี การจำกัดความเร็วในการพัฒนา ขณะที่ OpenAI และ Google ก็เริ่มนำ AI มาใช้ในวงจรการพัฒนามากขึ้น

อย่างไรก็ตาม งานวิจัยจาก Princeton และสถาบันความปลอดภัย AI ของสหราชอาณาจักร กลับให้ผลลัพธ์ที่สอดคล้องกับทีม Atria ว่าแม้โมเดลระดับแนวหน้าจะจัดการงานวิศวกรรมได้ดี แต่ยังคงล้มเหลวในการตัดสินใจในเรื่องสำคัญจริงๆ ซึ่งเป็นสิ่งที่มนุษย์ยังต้องควบคุมต่อไป

Source: The Decoder
ดูแลงานแปลและเรียบเรียงโดย SirilukP

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร