ทีมนักวิจัยจาก Princeton และ UC San Diego พบว่า AI agents มีประสิทธิภาพสูงขึ้นจากเวิร์กโฟลว์ที่มีโครงสร้างชัดเจน ไม่ใช่การเพิ่มพูนความรู้ แต่เตือนว่าหากคลังทักษะมีขนาดใหญ่เกินไปอาจทำให้ระบบสับสนในการเลือกคำสั่ง
งานวิจัยพบว่าโมเดล AI จดจำเสียงชื่อดังหลายตัวอาจถูกปรับแต่งให้ทำคะแนนเบนช์มาร์กได้สูงเกินจริง โดยใช้วิธีเลียนแบบข้อผิดพลาดหรือรูปแบบการเขียนเฉพาะในชุดข้อมูลทดสอบแทนการฟังเสียงจริงๆ
Meta AI พัฒนา Memory Agent แยกส่วนเพื่อช่วยให้ AI หลักจดจำข้อผิดพลาดในอดีตและไม่ทำขั้นตอนที่ล้มเหลวซ้ำ ช่วยเพิ่มประสิทธิภาพการทำงานที่ซับซ้อนได้สูงสุดถึง 8.3 จุดเปอร์เซ็นต์