SpaceXAI เปิดตัว Grok 4.5 โมเดลตัวท็อป ชูจุดเด่นงาน Agentic และการเขียนโค้ดร่วมกับ Cursor

SpaceXAI เปิดตัว Grok 4.5 โมเดลตัวท็อป ชูจุดเด่นงาน Agentic และการเขียนโค้ดร่วมกับ Cursor

SpaceXAI เปิดตัว Grok 4.5 โมเดลที่บริษัทระบุว่ามีความชาญฉลาดที่สุดในปัจจุบัน โดยมุ่งเน้นไปที่การเขียนโค้ด การทำงานในรูปแบบ Agentic และงานที่ต้องใช้ความรู้เฉพาะทางระดับสูง โดย Grok 4.5 ได้รับการฝึกฝนควบคู่ไปกับ Cursor ซึ่งเป็นเครื่องมือแก้ไขโค้ดด้วย AI ยอดนิยม

TL;DR

  • Grok 4.5 เน้นงานเขียนโค้ด, งานแบบ Agentic และงานด้านวิชาการ โดยเทรนร่วมกับ Cursor
  • จากแผนภูมิของ SpaceXAI พบว่า Fable (max) ยังเป็นผู้นำใน 4 เกณฑ์มาตรฐานหลัก โดย Grok 4.5 ทำคะแนนได้ใกล้เคียงที่สุดใน Terminal Bench 2.1
  • โดดเด่นเรื่องความประหยัด (Token efficiency): ใช้ท็อกเก็นเอาต์พุตน้อยกว่า Opus 4.8 (max) ถึง 4.2 เท่าในผลทดสอบ SWE Bench Pro
  • ค่าบริการอยู่ที่ $2 ต่อล้านอินพุตท็อกเก็น และ $6 ต่อล้านเอาต์พุตท็อกเก็น ให้ความเร็วที่ 80 TPS
  • คว้าอันดับ 1 ใน Harvey’s Legal Agent Benchmark และถูกกำหนดเป็นโมเดลเริ่มต้นสำหรับ Grok Build

Grok 4.5 คืออะไร?

Grok 4.5 เป็นโมเดลอเนกประสงค์ที่ปรับแต่งมาเพื่อแก้ปัญหาทางวิศวกรรมในชีวิตจริง SpaceXAI ใช้ชุดข้อมูลที่ครอบคลุมทั้งการเขียนโปรแกรม วิทยาศาสตร์ วิศวกรรม และคณิตศาสตร์ในการเทรนโมเดล ทีมวิจัยระบุว่าความสามารถในการใช้เหตุผลนั้นทั้งชาญฉลาดและมีประสิทธิภาพ โดยสามารถทำคะแนนสูงสุดใน Harvey’s Legal Agent Benchmark ซึ่งสะท้อนถึงความแข็งแกร่งในการจัดการงานเอกสารในระดับสำนักงาน

SpaceXAI เทรน Grok 4.5 อย่างไร?

การเทรนใช้ขุมพลังจาก GPU NVIDIA GB300 จำนวนหลายหมื่นตัว โดย SpaceXAI ใช้เทคนิคการเทรนและการรักษาเสถียรภาพระบบที่ออกแบบมาเพื่อรองรับการรันในสเกลยักษ์ นอกจากการเตรียมปริมาณข้อมูลมหาศาลแล้ว ทีมงานยังให้ความสำคัญกับการคัดกรองข้อมูล ทั้งการกำจัดข้อมูลซ้ำ การให้คะแนนคุณภาพ และการคัดเลือกเนื้อหาตามความเชี่ยวชาญเฉพาะด้าน

นอกจากนี้ SpaceXAI ยังต่อยอดด้วยการเรียนรู้แบบเสริมกำลัง (Reinforcement Learning) ที่เน้นเพิ่มความฉลาดต่อท็อกเก็น (Intelligence-per-token) โดยผ่านการฝึกฝนงานกว่าหลายแสนรายการ ซึ่งเน้นไปที่วิศวกรรมซอฟต์แวร์ที่ซับซ้อนหลายขั้นตอน โครงสร้างระบบยังรองรับการเทรนแบบอซิงโครนัส (Asynchronous) ขั้นสูง ทำให้ Agent สามารถประมวลผลงานต่อเนื่องได้นานหลายชั่วโมงแม้ยังอยู่ในกระบวนการเรียนรู้

ประสิทธิภาพผลการทดสอบ (Benchmark performance)

SpaceXAI ได้เผยแพร่คะแนนทดสอบเทียบกับเกณฑ์มาตรฐานด้านการเขียนโค้ด 4 รายการ โดยอ้างอิงตัวเลขคู่แข่งจากเอกสาร System card หรือตารางลีดเดอร์บอร์ดสาธารณะ แม้ SpaceXAI จะระบุว่า Grok 4.5 เหนือกว่าโมเดลระดับเดียวกันในหลายด้าน แต่ในแผนภูมิเปรียบเทียบพบว่าผลลัพธ์มีความหลากหลาย โดย Fable (max) ยังคงครองคะแนนสูงสุดในทั้ง 4 รายการ ขณะที่ Grok 4.5 ทำคะแนนได้สูสีที่สุดใน Terminal Bench 2.1

ข้อมูลอ้างอิง: “pass@1” คือการวัดผลสำเร็จจากการพยายามครั้งแรก; “resolve rate” คืออัตราส่วนของปัญหาที่ได้รับการแก้ไข

เกณฑ์มาตรฐาน (harness)Grok 4.5อันดับสูงสุดที่ระบุอื่นๆ
DeepSWE 1.0 — pass@1 (each provider’s harness)62.0%Fable (max) 66.1%GPT 5.5 (xhigh) 64.31%; Opus 4.8 (max) 55.75%
DeepSWE 1.1 (mini-swe-agent harness, DataCurve)53%Fable (max) 70%GPT 5.5 (xhigh) 67%; Opus 4.8 (max) 59%; GLM 5.2 44%
Terminal Bench 2.183.3%Fable (max) 84.3%GPT 5.5 (xhigh) 83.4%; Opus 4.8 (max) 78.9%
SWE Bench Pro — resolve rate64.7%Fable (max) 80.4%Opus 4.8 (max) 69.2%; GLM 5.2 62.1%; GPT 5.5 (xhigh) 58.6%

ความเร็วและความประหยัดท็อกเก็น

Grok 4.5 ให้บริการด้วยความเร็ว 80 TPS โดย SpaceXAI ระบุว่าสามารถประหยัดการใช้ท็อกเก็นได้มากกว่าโมเดลชั้นนำอื่นถึงเท่าตัว ตัวอย่างเช่นในเกณฑ์ SWE Bench Pro โมเดล Grok 4.5 ใช้ท็อกเก็นเอาต์พุตเฉลี่ยเพียง 15,954 ท็อกเก็น เพื่อแก้ไขงาน ในขณะที่ Opus 4.8 (max) ต้องใช้ถึง 67,020 ท็อกเก็น (ต่างกันประมาณ 4.2 เท่า) ซึ่งการใช้ท็อกเก็นน้อยลงหมายถึงต้นทุนที่ถูกลงและความหน่วง (Latency) ในการทำงานที่ลดลงด้วย

ราคาการใช้งาน

ค่าบริการของ Grok 4.5 อยู่ที่ $2 ต่อล้านอินพุตท็อกเก็น และ $6 ต่อล้านเอาต์พุตท็อกเก็น โดย SpaceXAI เคลมว่าโมเดลสามารถทำงานสำเร็จโดยใช้จำนวนขั้นตอนน้อยลงกว่าครึ่ง ทั้งนี้ควรตรวจสอบราคาล่าสุดผ่านคอนโซลของ SpaceXAI อีกครั้งก่อนวางแผนค่าใช้จ่าย

ตัวอย่างกรณีการใช้งาน

  • การแก้ปัญหาในโค้ดเบส: ค้นหาจุดบกพร่อง แก้ไข พร้อมอธิบายสาเหตุ
  • การสร้างโปรโตไทป์แอป: เขียนโค้ดจำลองระบบสุริยะด้วย Three.js จากการสั่งงานเพียงครั้งเดียว
  • งานที่ปรึกษากฎหมายอัตโนมัติ: ครองอันดับ 1 ในการทดสอบ Harvey’s Legal Agent Benchmark
  • การจัดการสเปรดชีต: สร้างโมเดล Excel หลายชีทที่เชื่อมโยงข้อมูลวิจัยจากเว็บไซต์
  • งานเอกสาร: แปลงสรุปเนื้อหาให้เป็นไฟล์สไลด์นำเสนอหรือรายงานใน Word

เริ่มต้นใช้งาน

Grok 4.5 พร้อมใช้แล้วใน Grok Build, เครื่องมือ Cursor ทุกแพ็กเกจ และผ่าน SpaceXAI console โดยใช้โมเดล ID คือ grok-4.5 สำหรับการเรียกใช้งาน API

curl -s https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.5",
    "input": "Find and fix the bug, then explain it: function median(a){a.sort();return a[a.length/2]}"
  }'

หากต้องการใช้ Grok Build ผ่านเทอร์มินัล สามารถติดตั้ง CLI ได้ดังนี้:

curl -fsSL https://x.ai/cli/install.sh | bash

ตารางสรุปข้อมูล Grok 4.5

คุณลักษณะรายละเอียด
ผู้พัฒนาSpaceXAI
จุดเน้นหลักการเขียนโค้ด, งานแบบ Agentic, งานด้านความรู้เชิงลึก
พันธมิตรการเทรนCursor
ฮาร์ดแวร์ที่ใช้NVIDIA GB300 GPUs หลายหมื่นตัว
ความเร็ว (Speed)80 TPS
ประสิทธิภาพท็อกเก็นใช้ท็อกเก็นน้อยกว่า Opus 4.8 (max) 4.2 เท่า บน SWE Bench Pro
ราคาอินพุต$2 / ล้านท็อกเก็น
ราคาเอาต์พุต$6 / ล้านท็อกเก็น
ช่องทางเข้าใช้งานGrok Build, Cursor (ทุกระดับสมาชิก), SpaceXAI console
Model IDgrok-4.5

ความพร้อมใช้งานและข้อจำกัด

แม้ Grok 4.5 จะเปิดให้ใช้งานได้แล้วผ่าน Grok Build, Cursor และ SpaceXAI console แต่ในขณะนี้ยังไม่เปิดให้บริการแก่กลุ่มผู้ใช้ในสหภาพยุโรป (EU) โดยคาดว่าจะเริ่มเปิดบริการในเขตดังกล่าวได้ช่วงกลางเดือนกรกฎาคม สำหรับผู้ใช้งาน Grok Build และ Cursor จะมีโปรโมชันให้ทดลองใช้งานได้ฟรีในเวลาจำกัด

Interactive Explorer

ตรวจสอบ รายละเอียดทางเทคนิคที่นี่

นอกจากนี้ อย่าลืมติดตามเราได้ที่

Source: MarkTechPost
ดูแลงานแปลและเรียบเรียงโดย NatapolK

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร