Google DeepMind เปิดตัว Gemini 4 Argon ชูจุดเด่น 1M Output Tokens

Google DeepMind ประกาศเปิดตัว ประกาศเปิดตัว Gemini 4 Argon โมเดลระดับแนวหน้า (frontier model) รุ่นแรกในยุค Gemini 4 ซึ่งออกแบบมาเพื่อรองรับงานวิศวกรรมซอฟต์แวร์ระยะยาว งานความรู้เฉพาะทางด้านกฎหมายและการเงิน รวมถึงการป้องกันความมั่นคงปลอดภัยทางไซเบอร์ โดยจุดเปลี่ยนสำคัญคือความยาวของผลลัพธ์ (output length) ที่สูงถึง 1,000,000 โทเค็นในการตอบกลับครั้งเดียว พุ่งทะยานจากเดิมที่ทำได้เพียง 64,000 โทเค็นในรุ่นก่อนหน้า
สิ่งที่ Google ประกาศ
Google DeepMind ระบุว่า Argon ถูกพัฒนาขึ้นเพื่อจัดการเวิร์กโฟลว์ที่ซับซ้อนโดยเฉพาะ ปัจจุบัน Google กำลังใช้วิธีการเปิดตัวแบบเป็นขั้นตอนผ่านกระบวนการสมัครใจของรัฐบาลสหรัฐฯ เพื่อทดสอบการเข้าถึงก่อนเปิดใช้งานจริง โดยจะรวบรวมข้อเสนอแนะเพื่อปรับปรุงระบบป้องกันความปลอดภัย (guardrails) ให้รัดกุมก่อนเปิดตัวในวงกว้างต่อไป
ด้านราคาเปิดเผยว่า Argon จะมีราคาแนะนำอยู่ที่ $2 ต่อ 1M input tokens และ $10 ต่อ 1M output tokens สำหรับอินพุตที่แคชไว้ (cached input tokens) จะได้รับส่วนลดพิเศษ 95% เหลือเพียง $0.10 ต่อ 1M ซึ่ง Logan Kilpatrick ได้ยืนยันตัวเลขราคาแนะนำนี้แล้ว ทั้งนี้ราคาจะปรับขึ้นเป็น $4 สำหรับอินพุต และ $20 สำหรับเอาต์พุตหลังจากช่วงแนะนำ
ทำไมขีดจำกัดเอาต์พุต 1M จึงสำคัญ
ในปัจจุบัน API ของคู่แข่งระดับแนวหน้ายังมีขีดจำกัดการตอบกลับต่อครั้งต่ำกว่ามาก โดย Claude Opus 5.5, Claude Fable 5.1 และ GPT-6 Astra ต่างจำกัดอยู่ที่ 128,000 โทเค็น
Argon สามารถคิดเชิงลึกและสร้างโทเค็นได้หลายแสนโทเค็นต่อเนื่องกัน ช่วยให้นักพัฒนาสามารถทำ refactor โค้ดขนาดใหญ่หรือเขียนรายงานขนาดยาวได้จบในครั้งเดียวโดยไม่ต้องแบ่งงาน อย่างไรก็ตาม ผู้ใช้ต้องพิจารณาเรื่องต้นทุนซึ่งจะอยู่ที่ $10 ถึง $20 ต่อ 1 ล้านโทเค็นตามช่วงเวลาที่ใช้งาน ขณะที่หน้าต่างบริบทอินพุต (input context window) ยังไม่มีการเปิดเผยข้อมูลแน่ชัด
เกณฑ์มาตรฐาน (Benchmarks): จุดที่ Argon นำหน้าและจุดที่ตามหลัง
จากการเปรียบเทียบกับ GPT-6 Astra และซีรีส์ Claude พบว่า Argon นำหน้าอย่างชัดเจนใน 12 จาก 18 เกณฑ์มาตรฐาน และครองอันดับหนึ่งร่วมในอีก 1 รายการ
จุดที่นำหน้า:
- DeepSWE v1.1 (วิศวกรรมซอฟต์แวร์): ทำได้ 77.9% ขึ้นแท่นระดับล้ำหน้าสุด (SOTA) ใหม่ เหนือกว่า Opus 5.5 (74.2%) และ GPT-6 Astra (74.1%)
- Vals Index (การเงิน, กฎหมาย, ภาษี): ครองอันดับหนึ่งที่ 68.9% บน Vals Index
- AutomationBench (การดำเนินธุรกิจ): ได้ 51.3% ขณะที่ Opus 5.5 ได้ 42.5%
- Harvey Legal Agent Benchmark: ทำคะแนนทิ้งห่างที่ 19.6% เทียบกับ GPT-6 Astra ที่ได้ 5.4%
- LVBench (ความเข้าใจวิดีโอยาว): สร้างสถิติใหม่ที่ 91.7%
จุดที่ตามหลัง:
- FrontierSWE v2: ได้ 55.0% ตามหลัง GPT-6 Astra ที่ทำได้ 65.5%
- Terminal-Bench 4.0: ได้ 57.4% ตามหลัง Claude Opus 5.5 ที่ทำได้ 66.4%
- OSWorld-2.0: ได้ 69.2% ตามหลัง GPT-6 Astra ที่ทำได้ 72.6%
Artificial Analysis รายงานเพิ่มเติมว่า Argon มีดัชนีความฉลาดเทียบเท่า GPT-6 Astra แต่มีต้นทุนต่อหนึ่งงานเพียง 60% เมื่อใช้ราคาลดพิเศษ
การป้องกันทางไซเบอร์: ค้นหา, ตรวจสอบ, แก้ไข
Google ฝึกฝน Argon ให้สามารถตรวจพบและแก้ไขช่องโหว่ซอฟต์แวร์สำคัญได้อัตโนมัติ โดยทีมภายในและพันธมิตรที่ได้รับความไว้วางใจจะสามารถเข้าถึงโมเดลนี้แบบไม่มีข้อจำกัดด้านไซเบอร์ (cyber guardrails) เพื่อประสิทธิภาพสูงสุด
บนเกณฑ์ CWE-bench v1 Argon ครองอันดับหนึ่งร่วมที่ 68% นอกจากนี้ Wiz ยังได้นำโมเดลนี้ไปใช้ในโครงการ Scan for Good ซึ่งช่วยค้นพบช่องโหว่ระดับวิกฤตในซอฟต์แวร์การแพทย์ที่โมเดลรุ่นก่อนๆ ตรวจไม่พบ
ก่อนเปิดตัวสู่สาธารณะ Google กำลังเสริมความปลอดภัย 4 ด้านหลัก:
- ป้องกันการนำไปใช้ในทางที่ผิดภายใต้ Frontier Safety Framework
- ต้านทาน indirect prompt injection (IPI) ซึ่ง Argon ทำคะแนนนำในเกณฑ์ของ Gray Swan
- ตรวจสอบความไม่สอดคล้องในกระบวนการคิด (chain-of-thought) พร้อมระบบหยุดทำงานอัตโนมัติ
- ใช้สภาพแวดล้อมจำลอง (sandboxes) ที่แยกส่วนสำหรับการประเมินที่มีความเสี่ยงสูง
Argon ภายใน Google
พนักงาน Google หลายพันคนได้เริ่มใช้งาน Argon แล้ว โดยมีผลลัพธ์ที่น่าสนใจดังนี้:
- ช่วยจัดการหน่วยความจำในศูนย์ข้อมูล คืนพื้นที่ได้กว่า 300 TiB และคาดว่าจะสูงถึง 1 PiB
- พัฒนาโค้ด SIMD 32,000 บรรทัดใน libgav1 ทำให้ถอดรหัสเร็วขึ้น 2.7 เท่า
- ย้ายฐานข้อมูลโค้ด C/C++ ไปยัง Rust กว่า 800,000 บรรทัดใน Zircon kernel ของ Fuchsia
- พัฒนาอัลกอริทึมควอนตัมได้ดีกว่าค่ามาตรฐานเดิมถึง 40% ภายในไม่กี่นาที
การเปรียบเทียบ: Gemini 4 Argon เทียบกับคู่แข่ง
| คุณสมบัติ | Gemini 4 Argon | Claude Opus 5.5 | Claude Fable 5.1 | GPT-6 Astra |
|---|---|---|---|---|
| ผู้พัฒนา | Google DeepMind | Anthropic | Anthropic | OpenAI |
| การเข้าถึง | โปรแกรม Fairwind เท่านั้น | API และคลาวด์ | API และคลาวด์ | OpenAI API |
| เอาต์พุตสูงสุดต่อการตอบกลับ | 1M tokens | 128K | 128K | 128K |
| หน้าต่างบริบท (Context window) | ไม่เปิดเผย | 1M | 1M | 1.05M |
| ราคา Input / output (ต่อ 1M) | $2 / $10 (แนะนำ) | $4 / $20 | $10 / $50 | $10 / $50 |
| Cached input (ต่อ 1M) | $0.10 (แนะนำ) | $0.20 | $0.25 | $1.00 |
| DeepSWE v1.1 | 77.9% | 74.2% | 67.4% | 74.1% |
| FrontierSWE v2 | 55.0% | 62.3% | 56.3% | 65.5% |
| CWE-bench v1 | 68% (ครองร่วม) | 67% | 58% | 68% (ครองร่วม) |
ข้อมูลอ้างอิงจาก Google, Anthropic, และ OpenAI โดยราคา GPT-6 Astra เป็นระดับ short-context tier
สรุปประเด็นสำคัญ
Gemini 4 Argon สร้างมาตรฐานใหม่ด้วยเอาต์พุต 1 ล้านโทเค็นและประสิทธิภาพที่เหนือกว่าในด้านวิศวกรรมซอฟต์แวร์และการเงิน แม้จะยังมีบางจุดที่ตามหลังคู่แข่งในด้านการใช้งานคอมพิวเตอร์และ Terminal แต่ด้วยราคาแนะนำที่ถูกกว่า Claude Opus 5.5 ถึงครึ่งหนึ่ง ทำให้เป็นโมเดลที่น่าจับตามองอย่างยิ่ง อย่างไรก็ตาม ปัจจุบันการเข้าถึงยังคงจำกัดอยู่ในกลุ่มโครงการ Fairwind เท่านั้น
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
