Google Research และ UNSW Sydney พัฒนา GlucoFM โมเดล Foundation Model ขนาดเล็กแต่ทรงพลังที่แยกข้อมูลการตรวจระดับน้ำตาลต่อเนื่อง (CGM) เป็นสายข้อมูลสรีรวิทยาและเหตุการณ์ชั่วคราว ซึ่งให้ความแม่นยำสูงกว่าโมเดลขนาดใหญ่หลายร้อยเท่า
งานวิจัยพบว่าโมเดล AI จดจำเสียงชื่อดังหลายตัวอาจถูกปรับแต่งให้ทำคะแนนเบนช์มาร์กได้สูงเกินจริง โดยใช้วิธีเลียนแบบข้อผิดพลาดหรือรูปแบบการเขียนเฉพาะในชุดข้อมูลทดสอบแทนการฟังเสียงจริงๆ
MiLM Plus จาก Xiaomi เปิดตัว PROVE เกณฑ์วัดประสิทธิภาพการลบวัตถุด้วย AI ที่เน้นความสอดคล้องทางสายตาโดยไม่ต้องใช้ภาพต้นฉบับอ้างอิง เพื่อแก้ปัญหาเกณฑ์วัดเดิมที่มักให้คะแนนผิดพลาด
Microsoft เปิดตัว code-testing-generator เอเจนท์แบบ polyglot ภายใต้ลิขสิทธิ์ MIT ที่สามารถวิเคราะห์บริบทของ repository เพื่อสร้างและตรวจสอบ Unit Test ได้อัตโนมัติ โดยทำคะแนนความสำเร็จในภารกิจทดสอบได้สูงถึง 92.1%