Kimi K3 จาก Moonshot คว้าอันดับหนึ่งงาน Frontend ในขณะที่คะแนนคณิตศาสตร์ขั้นสูงยังตามหลัง OpenAI

Kimi K3 จากค่าย Moonshot สร้างประวัติศาสตร์เป็นโมเดลภาษาขนาดใหญ่ (LLM) สัญชาติจีนรายแรกที่สามารถขึ้นสู่อันดับหนึ่งในการจัดอันดับ Code Arena: Frontend โดยทำผลงานเอาชนะโมเดลชั้นครูอย่าง Claude Fable 5 และ GPT-5.6 Sol ไปได้อย่างขาดลอย แสดงให้เห็นถึงขีดความสามารถที่โดดเด่นในด้านการเขียนโค้ดสำหรับส่วนติดต่อผู้ใช้

อย่างไรก็ตาม เมื่อพิจารณาถึงความสามารถด้านคณิตศาสตร์ขั้นสูง พบว่าช่องว่างระหว่างเทคโนโลยีของจีนและสหรัฐฯ ยังคงมีความแตกต่างกันอย่างชัดเจน โดยผลการทดสอบใน FrontierMath Tier 4 ระบุว่า Kimi K3 สามารถทำคะแนนได้เพียงประมาณ 39 เปอร์เซ็นต์เท่านั้น

ในขณะเดียวกัน โมเดลจากฝั่ง OpenAI และ Anthropic กลับทำคะแนนในโจทย์คณิตศาสตร์ชุดเดียวกันได้สูงเกือบถึง 90 เปอร์เซ็นต์ ซึ่งสะท้อนให้เห็นว่าแม้ Moonshot จะประสบความสำเร็จในงานเฉพาะทางอย่าง Frontend แต่ยังคงต้องเร่งพัฒนาอีกมากเพื่อให้ทันคู่แข่งในด้านการให้เหตุผลเชิงคณิตศาสตร์ระดับสูง

Source: The Decoder
ดูแลงานแปลและเรียบเรียงโดย AttapolK
Kimi K3 จาก Moonshot คว้าอันดับหนึ่งงาน Frontend ในขณะที่คะแนนคณิตศาสตร์ขั้นสูงยังตามหลัง OpenAI

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร