OpenAI เปิดตัว GPT-5.6 ตระกูลโมเดล 3 ระดับ พร้อมระบบ Programmatic Tool Calling ใหม่

OpenAI ประกาศปรับสถานะตระกูล GPT-5.6 family สู่ระดับทั่วไป (General Availability) หลังผ่านช่วงทดสอบจำกัด โดยการเปิดตัวครั้งนี้มาพร้อมโมเดล 3 ระดับเพื่อตอบโจทย์การใช้งานที่ต่างกัน ได้แก่ Sol รุ่นเรือธงประสิทธิภาพสูงสุด, Terra รุ่นสมดุลสำหรับการใช้งานทั่วไป และ Luna รุ่นเน้นความคุ้มค่า
สรุปสาระสำคัญ
- GPT-5.6 เปิดตัว 3 ระดับ — Sol, Terra, Luna — ราคาเริ่มต้น $1/$6 ถึง $5/$30 ต่อ 1 ล้านทอเค็น
- Sol ขึ้นแท่นผู้นำ Artificial Analysis Coding Agent Index ด้วยคะแนน 80 สูงกว่า Claude Fable 5 อยู่ 2.8 จุด
- ระบบ Programmatic Tool Calling รองรับการรัน JavaScript ที่เขียนโดยโมเดลใน V8 runtime แบบแยกส่วนและปลอดภัย
- โหมด
ultraช่วยให้รัน 4 agent แบบขนาน ยกระดับคะแนน Terminal-Bench 2.1 จาก 88.8% เป็น 91.9% - ยังคงตามหลังใน SWE-Bench Pro: Sol ทำได้ 64.6% ขณะที่ Claude Mythos 5 นำอยู่ที่ 80.3%
GPT-5.6 คืออะไร?
โมเดลเจเนอเรชันนี้แบ่งออกเป็น 3 รุ่นตามระดับราคาต่อ 1 ล้านทอเค็น โดย Sol คิดราคา input $5 / output $30, Terra ราคา $2.50 / $15 และ Luna ราคา $1 / $6
รายละเอียดการใช้งานในแต่ละช่องทาง:
- Chat: ผู้ใช้ Plus, Pro, Business และ Enterprise เข้าถึง Sol ได้โดยเลือกตั้งค่าระดับความพยายาม (effort) ปานกลางถึงสูง สำหรับผู้ใช้ Pro และ Enterprise สามารถเลือกใช้ GPT-5.6 Sol Pro ได้เป็นพิเศษ
- ChatGPT Work และ Codex: ผู้ใช้ Free และ Go ใช้งาน Terra ได้ ส่วนผู้ใช้แพ็กเกจชำระเงินสามารถเลือกใช้ได้ทั้ง 3 รุ่น พร้อมกำหนดระดับความพยายามได้เอง โดยโหมด
maxเปิดให้ทุกคนที่มีสิทธิ์เข้าใช้งาน GPT-5.6 ปรับตั้งค่าได้อิสระ - API: ใช้งานได้ทั้ง 3 ระดับ โดยมีฟีเจอร์เด่นอย่าง Programmatic Tool Calling และ multi-agent beta ใน Responses API
สำหรับการจัดการ Prompt caching มีการอัปเดตใหม่ โดย GPT-5.6 รองรับการระบุ cache breakpoints ได้ชัดเจนและมีอายุ cache ขั้นต่ำ 30 นาที สำหรับค่าเขียน cache (Cache writes) จะคิดราคา 1.25 เท่าของอัตรา input ปกติ ส่วนการอ่าน cache (Cache reads) รับส่วนลด 90% ตามเดิม
ประสิทธิภาพ
ในการทดสอบ Agents’ Last Exam ซึ่งวัดเวิร์กโฟลว์ระดับมืออาชีพใน 55 สาขาวิชา OpenAI รายงานว่า Sol ทำคะแนนได้ 53.6 จุด แซงหน้า Claude Fable 5 ไป 13.1 จุด
อย่างไรก็ตาม ข้อมูลในตารางประเมินของ OpenAI ระบุคะแนน Sol ไว้ที่ 52.7% และ Fable 5 ที่ 40.5% (ส่วนต่าง 13.1 จุด) ซึ่ง OpenAI ไม่ได้ระบุชัดเจนว่าการตั้งค่า reasoning แบบใดที่ทำให้ Sol ได้คะแนนในรายงานสูงถึง 53.6
สำหรับ Artificial Analysis Coding Agent Index v1.1 Sol ในระดับ max reasoning คว้าคะแนนไป 80 จุด สูงกว่า Fable 5 อยู่ 2.8 จุด โดย OpenAI ระบุว่าสามารถทำคะแนนนี้ได้โดยใช้ output tokens และเวลาลดลงกว่าครึ่งหนึ่ง
นอกจากนี้ Sol ยังสร้างสถิติใหม่ (state-of-the-art) ในด้านอื่น ๆ เช่น Terminal-Bench 2.1, DeepSWE, BrowseComp (92.2%) และ OSWorld 2.0 (62.6%) โดยเฉพาะใน OSWorld ที่ Sol แซงหน้า Claude Opus 4.8 ได้แม้จะใช้ output tokens น้อยกว่าถึง 85%
| Eval | GPT-5.6 Sol | GPT-5.6 Terra | GPT-5.6 Luna | GPT-5.5 | Claude Fable 5 | Claude Opus 4.8 | Gemini 3.1 Pro Preview |
|---|---|---|---|---|---|---|---|
| AA Coding Agent Index v1.1 | 80 | 77.4 | 74.6 | 76.4 | 77.2 | 72.5 | 42.7 |
| AA Intelligence Index v4.1 | 58.9 | 55 | 51.2 | 54.8 | 59.9 | 55.7 | 46.5 |
| Terminal-Bench 2.1 | 88.8% | 87.4% | 84.7% | 85.6% | 83.1% | 78.9% | 70.7% |
| DeepSWE v1.1 | 72.7% | 69.6% | 67.2% | 67% | 69.7% | 59% | 11.8% |
| SWE-Bench Pro | 64.6% | 63.4% | 62.7% | 59.4% | 80% | 69.2% | 54.2% |
| Agents’ Last Exam | 52.7% | 50.4% | 50.3% | 46.9% | 40.5% | 45.2% | 32.1% |
| GDPval-AA v2 (Elo) | 1,747.8 | 1,593 | 1,591.8 | 1,493.7 | 1,759.6 | 1,600.1 | 962.3 |
| BrowseComp | 90.4% | 87.5% | 83.3% | 84.4% | — | 84.3% | 85.9% |
| OSWorld 2.0 | 62.6% | 50.2% | 45.6% | 47.5% | — | 54.8% | — |
| Toolathlon | 58% | 53.1% | 53.4% | 55.6% | 61.7% | 59.9% | 48.8% |
ที่มา: ข้อมูลจาก OpenAI โดย Sol Ultra ทำคะแนนได้ 91.9% ใน Terminal-Bench 2.1 และ 92.2% ใน BrowseComp ส่วน Claude Mythos 5 ยังนำใน SWE-Bench Pro ที่ 80.3% เครื่องหมายแดชหมายถึงไม่มีข้อมูลรายงาน
จุดที่ GPT-5.6 ยังไม่เป็นผู้นำ
ประเด็นที่น่าสังเกตที่ GPT-5.6 ยังคงตามหลังคู่แข่ง:
- SWE-Bench Pro: Sol ทำได้ 64.6% ยังตามหลัง Claude Mythos 5 (80.3%) และ Fable 5 (80%) อยู่ราว 15 จุด ในบททดสอบด้านการเขียนโค้ดที่สำคัญนี้
- ความฉลาดและงานวิชาการ: Fable 5 ยังครองแชมป์ใน Artificial Analysis Intelligence Index v4.1 และ GDPval-AA v2 รวมถึง HealthBench Professional ที่เฉือนชนะ Sol ไปเล็กน้อย
- การใช้งานเครื่องมือ (Tool use): ใน Toolathlon นั้น Sol ได้ 58% ในขณะที่ Fable 5 ทำได้ 61.7% และที่น่าสนใจคือรุ่นเล็กอย่าง Luna กลับทำคะแนนได้ดีกว่า Terra ในส่วนนี้
- Long context: ประสิทธิภาพของ Luna ลดลงเหลือ 41.3% ในการทดสอบ MRCR v2 8-needle ช่วง 256K–1M ส่วน Sol ทำได้ 73.8% ในช่วง 512K–1M ซึ่งต่ำกว่า GPT-5.5 เล็กน้อย
คำอธิบายเพิ่มเติม
การคิดค่าบริการ Cache: การเขียน cache ใหม่จะคิดราคา 1.25 เท่าของเรตปกติ มีผลตั้งแต่ GPT-5.6 เป็นต้นไป โดยระบบจะเก็บ cache ไว้อย่างน้อย 30 นาที
ช่องทางการใช้ ultra: รองรับใน ChatGPT Work (Pro/Enterprise) และ Codex (Plus ขึ้นไป) สำหรับสายพัฒนา API สามารถใช้ multi-agent beta ใน Responses API เพื่อสร้างเวิร์กโฟลว์ที่ใกล้เคียงกับระดับ ultra ได้
MARKTECHPOST
จุดแข็งและจุดอ่อน
จุดแข็ง
- เป็นผู้นำใน Artificial Analysis Coding Agent Index ด้วยคะแนน 80
- ระบบ Programmatic Tool Calling ช่วยลูกค้าลดจำนวนทอเค็นได้เฉลี่ย 38% - 63.5%
- โมเดลทั้ง 3 ระดับมีประสิทธิภาพเหนือกว่า GPT-5.5 ในการประเมินส่วนใหญ่
- โครงสร้างราคา 5 ระดับ ช่วยให้องค์กรเลือกใช้โมเดลได้ตามความเหมาะสมของงาน
- ระบบ Cache breakpoints ช่วยให้ควบคุมต้นทุนได้แม่นยำขึ้น
- Sol มีประสิทธิภาพเด่นชัดใน OSWorld 2.0 โดยใช้ทอเค็นน้อยกว่าคู่แข่งอย่างมาก
จุดอ่อน
- คะแนน SWE-Bench Pro ตามหลังตระกูล Claude อยู่ประมาณ 15 จุด
- ยังไม่สามารถโค่น Fable 5 ในด้าน Intelligence Index และ Toolathlon ได้
- ข้อมูลคะแนน Agents’ Last Exam ในรายงานและตารางจริงมีความคลาดเคลื่อนกัน
- รุ่น Luna ยังมีข้อจำกัดในด้าน Long context และการทดสอบ Terminal-Bench 2.1
- ค่าเขียน cache เป็นต้นทุนใหม่ 1.25 เท่าที่ผู้ใช้ต้องพิจารณา
- ตัวเลขความหน่วงและต้นทุนปัจจุบันยังมาจากการจำลองแบบ offline ไม่ใช่การใช้งานจริงในหน้างาน
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
