ผลการศึกษาแย้งคำอ้าง Anthropic และ OpenAI ชี้ AI ยังไม่พร้อมทำวิจัยด้วยตนเอง

การศึกษาล่าสุดที่จัดทำร่วมกับมหาวิทยาลัย Princeton และสถาบันความปลอดภัย AI ของสหราชอาณาจักร (UK AI Safety Institute) ได้ทำการทดสอบขีดความสามารถของเอเจนต์ AI ที่ขับเคลื่อนด้วยโมเดลระดับแนวหน้า (Frontier Models) อย่าง Claude Opus 4.8 และ GPT-5.6 Sol ในการสร้างสรรค์ผลงานวิจัยทางวิทยาศาสตร์อย่างเป็นอิสระ

ในการทดสอบนี้ เอเจนต์ AI ได้รับเวลา 6 วัน พร้อมเครดิต API มูลค่า 3,000 ดอลลาร์ และสิทธิ์การเข้าถึง GPU เพื่อเขียนงานวิจัย AI อย่างเต็มรูปแบบ

อย่างไรก็ตาม เมื่อนำผลลัพธ์ที่ได้ไปให้ผู้เขียนต้นฉบับของบทความวิจัยระดับ NeurIPS ที่ยังไม่ได้รับการตีพิมพ์เป็นผู้ประเมิน ผลปรากฏว่าบทความเหล่านั้นถูกตัดสินให้ "ไม่ผ่าน" (Reject) ทั้งหมด

แม้ผลการศึกษาจะพบว่าโมเดลระดับสูงเหล่านี้สามารถจัดการกระบวนการด้านวิศวกรรมการวิจัยได้ครบถ้วนในเชิงเทคนิค แต่ยังคงมีจุดอ่อนสำคัญคือการขาดทักษะด้านการตัดสินใจเชิงวิชาการ การแก้ปัญหาอย่างสร้างสรรค์ และที่สำคัญที่สุดคือยังขาดความสามารถในการพิจารณาเพื่อละทิ้งแนวทางที่ล้มเหลวระหว่างการทำงาน

ผลลัพธ์นี้ถือเป็นการโต้แย้งคำกล่าวอ้างของบริษัทผู้พัฒนาอย่าง Anthropic และ OpenAI ที่เคยระบุว่าการวิจัย AI แบบอัตโนมัติ (Automated AI Research) กำลังจะเกิดขึ้นในเร็ววัน โดยชี้ให้เห็นว่าเทคโนโลยียังมีช่องว่างขนาดใหญ่ที่ต้องเติมเต็มก่อนจะสามารถทำงานวิจัยที่ซับซ้อนได้จริง

Source: The Decoder
ดูแลงานแปลและเรียบเรียงโดย SirilukP
A collage of a computer screen showing red corrections and X marks next to a stack of scientific reports containing charts.

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร