tag: Artificial Analysis

Liquid AI เปิดตัว Pipette เครื่องมือ Open-Source วัดประสิทธิภาพ AI บนอุปกรณ์แบบครบวงจร

Liquid AI เปิดตัว Pipette เครื่องมือ Open-Source วัดประสิทธิภาพ AI บนอุปกรณ์แบบครบวงจร

Liquid AI เปิดตัว Pipette แพลตฟอร์ม Open-Source สำหรับทดสอบประสิทธิภาพโมเดล AI บนอุปกรณ์พกพาและ Edge Devices โดยวัดผลครอบคลุมทั้งโมเดล การ Quantization และฮาร์ดแวร์จริง เพื่อแก้ปัญหาความคลาดเคลื่อนของข้อมูลจาก Model Card ทั่วไป
GLM-5.3 ขึ้นแท่นโมเดล Open-Source อันดับ 1 พร้อมทำราคาตัดหน้าคู่แข่ง แม้เลื่อนเปิดตัว

GLM-5.3 ขึ้นแท่นโมเดล Open-Source อันดับ 1 พร้อมทำราคาตัดหน้าคู่แข่ง แม้เลื่อนเปิดตัว

· By: SirilukP
GLM-5.3 โมเดล AI จาก Z.ai สตาร์ทอัพจีน ครองอันดับหนึ่งร่วมในกลุ่มโมเดลแบบเปิดบนดัชนี Artificial Analysis ด้วยคะแนน 60 แต้ม แซงหน้าโมเดลรุ่นเดิมอย่างมีนัยสำคัญ
Cartesia เปิดตัว Sonic-3.6 โมเดล AI สร้างเสียงพูดระดับท็อป ครองอันดับ 1 ในทุกตารางทดสอบ

Cartesia เปิดตัว Sonic-3.6 โมเดล AI สร้างเสียงพูดระดับท็อป ครองอันดับ 1 ในทุกตารางทดสอบ

Cartesia ปล่อย Sonic-3.6 โมเดล Text-to-Speech แบบสตรีมมิ่งที่ใช้สถาปัตยกรรม State Space Models จนสามารถคว้าอันดับ 1 ในตาราง Artificial Analysis ทั้งสองรายการ ด้วยความเร็วในการสร้างเสียงครั้งแรกต่ำกว่า 90ms
Ling 3.0 Flash ขึ้นแท่นโมเดล Open Model ที่ชาญฉลาดที่สุดเมื่อเทียบในระดับเดียวกัน

Ling 3.0 Flash ขึ้นแท่นโมเดล Open Model ที่ชาญฉลาดที่สุดเมื่อเทียบในระดับเดียวกัน

Ling 3.0 Flash พลิกโฉมวงการ AI ในฐานะโมเดลแบบเปิดที่มีประสิทธิภาพสูงสุดในกลุ่มขนาดเดียวกัน โดยทำคะแนนแซงหน้าคู่แข่งและลดอัตราการหลอนของข้อมูลลงอย่างมีนัยสำคัญ
Thinking Machines เปิดตัว Inkling Small โมเดล AI ไซส์เล็กที่เน้นประสิทธิภาพการใช้เหตุผลที่เหนือกว่า

Thinking Machines เปิดตัว Inkling Small โมเดล AI ไซส์เล็กที่เน้นประสิทธิภาพการใช้เหตุผลที่เหนือกว่า

Thinking Machines สตาร์ทอัพของ Mira Murati เปิดตัว Inkling Small โมเดล Open-weights ขนาดเล็กที่มีพารามิเตอร์เพียง 1 ใน 3 ของรุ่นเดิม แต่กลับทำคะแนนด้านการเขียนโค้ดและการใช้เหตุผลได้ดีกว่ารุ่นใหญ่
DeepSeek เปิดตัวโมเดล Flash ใหม่ ประสิทธิภาพจี้ติด GPT-5.6 Luna ในราคาถูกกว่า 60%

DeepSeek เปิดตัวโมเดล Flash ใหม่ ประสิทธิภาพจี้ติด GPT-5.6 Luna ในราคาถูกกว่า 60%

· By: SirilukP
DeepSeek อัปเกรดโมเดล V4 Flash เวอร์ชัน 0731 ทำคะแนนบน Artificial Analysis Intelligence Index พุ่งแตะ 50 จุด ไล่เลี่ยกับ GPT-5.6 Luna ของ OpenAI แต่มีต้นทุนถูกกว่าถึง 60%
OpenAI สั่งถอนการรับรองมาตรฐาน SWE-Bench Pro หลังพบโจทย์เขียนโค้ดยอดนิยมมีข้อผิดพลาดเกือบ 30%

OpenAI สั่งถอนการรับรองมาตรฐาน SWE-Bench Pro หลังพบโจทย์เขียนโค้ดยอดนิยมมีข้อผิดพลาดเกือบ 30%

· By: SirilukP
OpenAI ตรวจสอบเกณฑ์มาตรฐานการเขียนโปรแกรม SWE-Bench Pro พบงานกว่า 30% บกพร่องและคลุมเครือ จนนำไปสู่การยกเลิกการรับรองเพื่อป้องกันความคลาดเคลื่อนในการประเมินความสามารถ AI
Meta Muse Spark 1.1 อวดฟอร์มแกร่ง! แซงหน้า GLM-5.2 ด้านการเขียนโค้ด ในราคาที่ถูกกว่า

Meta Muse Spark 1.1 อวดฟอร์มแกร่ง! แซงหน้า GLM-5.2 ด้านการเขียนโค้ด ในราคาที่ถูกกว่า

· By: AttapolK
Meta Muse Spark 1.1 พัฒนาอย่างก้าวกระโดดด้วยคะแนน 51 บนดัชนี Intelligence Index พร้อมโชว์ศักยภาพด้านการเขียนโค้ดแซงหน้า GLM-5.2 ด้วยราคาที่เป็นมิตรและอัตราการเกิดภาพหลอนที่ลดลงอย่างมาก
Claude Fable 5 จาก Anthropic คว้าแชมป์ดัชนีชี้วัดอุตสาหกรรมใหม่ แต่แลกมาด้วยต้นทุนที่พุ่งสูง

Claude Fable 5 จาก Anthropic คว้าแชมป์ดัชนีชี้วัดอุตสาหกรรมใหม่ แต่แลกมาด้วยต้นทุนที่พุ่งสูง

Claude Fable 5 ครองอันดับ 1 ในผลทดสอบประสิทธิภาพเจาะลึก 6 อุตสาหกรรมจาก Artificial Analysis ทว่ามีราคาสูงกว่าคู่แข่งอย่าง DeepSeek V4 Pro ถึงกว่า 100 เท่าในบางดัชนี แม้คะแนนจะห่างกันเพียงเล็กน้อย