SpaceXAI เปิดตัว Grok 4.5 โมเดลตัวท็อป ชูจุดเด่นงาน Agentic และการเขียนโค้ดร่วมกับ Cursor

SpaceXAI เปิดตัว Grok 4.5 โมเดลที่บริษัทระบุว่ามีความชาญฉลาดที่สุดในปัจจุบัน โดยมุ่งเน้นไปที่การเขียนโค้ด การทำงานในรูปแบบ Agentic และงานที่ต้องใช้ความรู้เฉพาะทางระดับสูง โดย Grok 4.5 ได้รับการฝึกฝนควบคู่ไปกับ Cursor ซึ่งเป็นเครื่องมือแก้ไขโค้ดด้วย AI ยอดนิยม
TL;DR
- Grok 4.5 เน้นงานเขียนโค้ด, งานแบบ Agentic และงานด้านวิชาการ โดยเทรนร่วมกับ Cursor
- จากแผนภูมิของ SpaceXAI พบว่า Fable (max) ยังเป็นผู้นำใน 4 เกณฑ์มาตรฐานหลัก โดย Grok 4.5 ทำคะแนนได้ใกล้เคียงที่สุดใน Terminal Bench 2.1
- โดดเด่นเรื่องความประหยัด (Token efficiency): ใช้ท็อกเก็นเอาต์พุตน้อยกว่า Opus 4.8 (max) ถึง 4.2 เท่าในผลทดสอบ SWE Bench Pro
- ค่าบริการอยู่ที่ $2 ต่อล้านอินพุตท็อกเก็น และ $6 ต่อล้านเอาต์พุตท็อกเก็น ให้ความเร็วที่ 80 TPS
- คว้าอันดับ 1 ใน Harvey’s Legal Agent Benchmark และถูกกำหนดเป็นโมเดลเริ่มต้นสำหรับ Grok Build
Grok 4.5 คืออะไร?
Grok 4.5 เป็นโมเดลอเนกประสงค์ที่ปรับแต่งมาเพื่อแก้ปัญหาทางวิศวกรรมในชีวิตจริง SpaceXAI ใช้ชุดข้อมูลที่ครอบคลุมทั้งการเขียนโปรแกรม วิทยาศาสตร์ วิศวกรรม และคณิตศาสตร์ในการเทรนโมเดล ทีมวิจัยระบุว่าความสามารถในการใช้เหตุผลนั้นทั้งชาญฉลาดและมีประสิทธิภาพ โดยสามารถทำคะแนนสูงสุดใน Harvey’s Legal Agent Benchmark ซึ่งสะท้อนถึงความแข็งแกร่งในการจัดการงานเอกสารในระดับสำนักงาน
SpaceXAI เทรน Grok 4.5 อย่างไร?
การเทรนใช้ขุมพลังจาก GPU NVIDIA GB300 จำนวนหลายหมื่นตัว โดย SpaceXAI ใช้เทคนิคการเทรนและการรักษาเสถียรภาพระบบที่ออกแบบมาเพื่อรองรับการรันในสเกลยักษ์ นอกจากการเตรียมปริมาณข้อมูลมหาศาลแล้ว ทีมงานยังให้ความสำคัญกับการคัดกรองข้อมูล ทั้งการกำจัดข้อมูลซ้ำ การให้คะแนนคุณภาพ และการคัดเลือกเนื้อหาตามความเชี่ยวชาญเฉพาะด้าน
นอกจากนี้ SpaceXAI ยังต่อยอดด้วยการเรียนรู้แบบเสริมกำลัง (Reinforcement Learning) ที่เน้นเพิ่มความฉลาดต่อท็อกเก็น (Intelligence-per-token) โดยผ่านการฝึกฝนงานกว่าหลายแสนรายการ ซึ่งเน้นไปที่วิศวกรรมซอฟต์แวร์ที่ซับซ้อนหลายขั้นตอน โครงสร้างระบบยังรองรับการเทรนแบบอซิงโครนัส (Asynchronous) ขั้นสูง ทำให้ Agent สามารถประมวลผลงานต่อเนื่องได้นานหลายชั่วโมงแม้ยังอยู่ในกระบวนการเรียนรู้
ประสิทธิภาพผลการทดสอบ (Benchmark performance)
SpaceXAI ได้เผยแพร่คะแนนทดสอบเทียบกับเกณฑ์มาตรฐานด้านการเขียนโค้ด 4 รายการ โดยอ้างอิงตัวเลขคู่แข่งจากเอกสาร System card หรือตารางลีดเดอร์บอร์ดสาธารณะ แม้ SpaceXAI จะระบุว่า Grok 4.5 เหนือกว่าโมเดลระดับเดียวกันในหลายด้าน แต่ในแผนภูมิเปรียบเทียบพบว่าผลลัพธ์มีความหลากหลาย โดย Fable (max) ยังคงครองคะแนนสูงสุดในทั้ง 4 รายการ ขณะที่ Grok 4.5 ทำคะแนนได้สูสีที่สุดใน Terminal Bench 2.1
ข้อมูลอ้างอิง: “pass@1” คือการวัดผลสำเร็จจากการพยายามครั้งแรก; “resolve rate” คืออัตราส่วนของปัญหาที่ได้รับการแก้ไข
| เกณฑ์มาตรฐาน (harness) | Grok 4.5 | อันดับสูงสุดที่ระบุ | อื่นๆ |
|---|---|---|---|
| DeepSWE 1.0 — pass@1 (each provider’s harness) | 62.0% | Fable (max) 66.1% | GPT 5.5 (xhigh) 64.31%; Opus 4.8 (max) 55.75% |
| DeepSWE 1.1 (mini-swe-agent harness, DataCurve) | 53% | Fable (max) 70% | GPT 5.5 (xhigh) 67%; Opus 4.8 (max) 59%; GLM 5.2 44% |
| Terminal Bench 2.1 | 83.3% | Fable (max) 84.3% | GPT 5.5 (xhigh) 83.4%; Opus 4.8 (max) 78.9% |
| SWE Bench Pro — resolve rate | 64.7% | Fable (max) 80.4% | Opus 4.8 (max) 69.2%; GLM 5.2 62.1%; GPT 5.5 (xhigh) 58.6% |
ความเร็วและความประหยัดท็อกเก็น
Grok 4.5 ให้บริการด้วยความเร็ว 80 TPS โดย SpaceXAI ระบุว่าสามารถประหยัดการใช้ท็อกเก็นได้มากกว่าโมเดลชั้นนำอื่นถึงเท่าตัว ตัวอย่างเช่นในเกณฑ์ SWE Bench Pro โมเดล Grok 4.5 ใช้ท็อกเก็นเอาต์พุตเฉลี่ยเพียง 15,954 ท็อกเก็น เพื่อแก้ไขงาน ในขณะที่ Opus 4.8 (max) ต้องใช้ถึง 67,020 ท็อกเก็น (ต่างกันประมาณ 4.2 เท่า) ซึ่งการใช้ท็อกเก็นน้อยลงหมายถึงต้นทุนที่ถูกลงและความหน่วง (Latency) ในการทำงานที่ลดลงด้วย
ราคาการใช้งาน
ค่าบริการของ Grok 4.5 อยู่ที่ $2 ต่อล้านอินพุตท็อกเก็น และ $6 ต่อล้านเอาต์พุตท็อกเก็น โดย SpaceXAI เคลมว่าโมเดลสามารถทำงานสำเร็จโดยใช้จำนวนขั้นตอนน้อยลงกว่าครึ่ง ทั้งนี้ควรตรวจสอบราคาล่าสุดผ่านคอนโซลของ SpaceXAI อีกครั้งก่อนวางแผนค่าใช้จ่าย
ตัวอย่างกรณีการใช้งาน
- การแก้ปัญหาในโค้ดเบส: ค้นหาจุดบกพร่อง แก้ไข พร้อมอธิบายสาเหตุ
- การสร้างโปรโตไทป์แอป: เขียนโค้ดจำลองระบบสุริยะด้วย Three.js จากการสั่งงานเพียงครั้งเดียว
- งานที่ปรึกษากฎหมายอัตโนมัติ: ครองอันดับ 1 ในการทดสอบ Harvey’s Legal Agent Benchmark
- การจัดการสเปรดชีต: สร้างโมเดล Excel หลายชีทที่เชื่อมโยงข้อมูลวิจัยจากเว็บไซต์
- งานเอกสาร: แปลงสรุปเนื้อหาให้เป็นไฟล์สไลด์นำเสนอหรือรายงานใน Word
เริ่มต้นใช้งาน
Grok 4.5 พร้อมใช้แล้วใน Grok Build, เครื่องมือ Cursor ทุกแพ็กเกจ และผ่าน SpaceXAI console โดยใช้โมเดล ID คือ grok-4.5 สำหรับการเรียกใช้งาน API
curl -s https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.5",
"input": "Find and fix the bug, then explain it: function median(a){a.sort();return a[a.length/2]}"
}'หากต้องการใช้ Grok Build ผ่านเทอร์มินัล สามารถติดตั้ง CLI ได้ดังนี้:
curl -fsSL https://x.ai/cli/install.sh | bashตารางสรุปข้อมูล Grok 4.5
| คุณลักษณะ | รายละเอียด |
|---|---|
| ผู้พัฒนา | SpaceXAI |
| จุดเน้นหลัก | การเขียนโค้ด, งานแบบ Agentic, งานด้านความรู้เชิงลึก |
| พันธมิตรการเทรน | Cursor |
| ฮาร์ดแวร์ที่ใช้ | NVIDIA GB300 GPUs หลายหมื่นตัว |
| ความเร็ว (Speed) | 80 TPS |
| ประสิทธิภาพท็อกเก็น | ใช้ท็อกเก็นน้อยกว่า Opus 4.8 (max) 4.2 เท่า บน SWE Bench Pro |
| ราคาอินพุต | $2 / ล้านท็อกเก็น |
| ราคาเอาต์พุต | $6 / ล้านท็อกเก็น |
| ช่องทางเข้าใช้งาน | Grok Build, Cursor (ทุกระดับสมาชิก), SpaceXAI console |
| Model ID | grok-4.5 |
ความพร้อมใช้งานและข้อจำกัด
แม้ Grok 4.5 จะเปิดให้ใช้งานได้แล้วผ่าน Grok Build, Cursor และ SpaceXAI console แต่ในขณะนี้ยังไม่เปิดให้บริการแก่กลุ่มผู้ใช้ในสหภาพยุโรป (EU) โดยคาดว่าจะเริ่มเปิดบริการในเขตดังกล่าวได้ช่วงกลางเดือนกรกฎาคม สำหรับผู้ใช้งาน Grok Build และ Cursor จะมีโปรโมชันให้ทดลองใช้งานได้ฟรีในเวลาจำกัด
Interactive Explorer
ตรวจสอบ รายละเอียดทางเทคนิคที่นี่
นอกจากนี้ อย่าลืมติดตามเราได้ที่
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
