OpenAI เปิดตัว GPT-5.6 ตระกูลโมเดล 3 ระดับ พร้อมระบบ Programmatic Tool Calling ใหม่

OpenAI เปิดตัว GPT-5.6 ตระกูลโมเดล 3 ระดับ พร้อมระบบ Programmatic Tool Calling ใหม่

OpenAI ประกาศปรับสถานะตระกูล GPT-5.6 family สู่ระดับทั่วไป (General Availability) หลังผ่านช่วงทดสอบจำกัด โดยการเปิดตัวครั้งนี้มาพร้อมโมเดล 3 ระดับเพื่อตอบโจทย์การใช้งานที่ต่างกัน ได้แก่ Sol รุ่นเรือธงประสิทธิภาพสูงสุด, Terra รุ่นสมดุลสำหรับการใช้งานทั่วไป และ Luna รุ่นเน้นความคุ้มค่า

สรุปสาระสำคัญ

  • GPT-5.6 เปิดตัว 3 ระดับ — Sol, Terra, Luna — ราคาเริ่มต้น $1/$6 ถึง $5/$30 ต่อ 1 ล้านทอเค็น
  • Sol ขึ้นแท่นผู้นำ Artificial Analysis Coding Agent Index ด้วยคะแนน 80 สูงกว่า Claude Fable 5 อยู่ 2.8 จุด
  • ระบบ Programmatic Tool Calling รองรับการรัน JavaScript ที่เขียนโดยโมเดลใน V8 runtime แบบแยกส่วนและปลอดภัย
  • โหมด ultra ช่วยให้รัน 4 agent แบบขนาน ยกระดับคะแนน Terminal-Bench 2.1 จาก 88.8% เป็น 91.9%
  • ยังคงตามหลังใน SWE-Bench Pro: Sol ทำได้ 64.6% ขณะที่ Claude Mythos 5 นำอยู่ที่ 80.3%

GPT-5.6 คืออะไร?

โมเดลเจเนอเรชันนี้แบ่งออกเป็น 3 รุ่นตามระดับราคาต่อ 1 ล้านทอเค็น โดย Sol คิดราคา input $5 / output $30, Terra ราคา $2.50 / $15 และ Luna ราคา $1 / $6

รายละเอียดการใช้งานในแต่ละช่องทาง:

  • Chat: ผู้ใช้ Plus, Pro, Business และ Enterprise เข้าถึง Sol ได้โดยเลือกตั้งค่าระดับความพยายาม (effort) ปานกลางถึงสูง สำหรับผู้ใช้ Pro และ Enterprise สามารถเลือกใช้ GPT-5.6 Sol Pro ได้เป็นพิเศษ
  • ChatGPT Work และ Codex: ผู้ใช้ Free และ Go ใช้งาน Terra ได้ ส่วนผู้ใช้แพ็กเกจชำระเงินสามารถเลือกใช้ได้ทั้ง 3 รุ่น พร้อมกำหนดระดับความพยายามได้เอง โดยโหมด max เปิดให้ทุกคนที่มีสิทธิ์เข้าใช้งาน GPT-5.6 ปรับตั้งค่าได้อิสระ
  • API: ใช้งานได้ทั้ง 3 ระดับ โดยมีฟีเจอร์เด่นอย่าง Programmatic Tool Calling และ multi-agent beta ใน Responses API

สำหรับการจัดการ Prompt caching มีการอัปเดตใหม่ โดย GPT-5.6 รองรับการระบุ cache breakpoints ได้ชัดเจนและมีอายุ cache ขั้นต่ำ 30 นาที สำหรับค่าเขียน cache (Cache writes) จะคิดราคา 1.25 เท่าของอัตรา input ปกติ ส่วนการอ่าน cache (Cache reads) รับส่วนลด 90% ตามเดิม

ประสิทธิภาพ

ในการทดสอบ Agents’ Last Exam ซึ่งวัดเวิร์กโฟลว์ระดับมืออาชีพใน 55 สาขาวิชา OpenAI รายงานว่า Sol ทำคะแนนได้ 53.6 จุด แซงหน้า Claude Fable 5 ไป 13.1 จุด

อย่างไรก็ตาม ข้อมูลในตารางประเมินของ OpenAI ระบุคะแนน Sol ไว้ที่ 52.7% และ Fable 5 ที่ 40.5% (ส่วนต่าง 13.1 จุด) ซึ่ง OpenAI ไม่ได้ระบุชัดเจนว่าการตั้งค่า reasoning แบบใดที่ทำให้ Sol ได้คะแนนในรายงานสูงถึง 53.6

สำหรับ Artificial Analysis Coding Agent Index v1.1 Sol ในระดับ max reasoning คว้าคะแนนไป 80 จุด สูงกว่า Fable 5 อยู่ 2.8 จุด โดย OpenAI ระบุว่าสามารถทำคะแนนนี้ได้โดยใช้ output tokens และเวลาลดลงกว่าครึ่งหนึ่ง

นอกจากนี้ Sol ยังสร้างสถิติใหม่ (state-of-the-art) ในด้านอื่น ๆ เช่น Terminal-Bench 2.1, DeepSWE, BrowseComp (92.2%) และ OSWorld 2.0 (62.6%) โดยเฉพาะใน OSWorld ที่ Sol แซงหน้า Claude Opus 4.8 ได้แม้จะใช้ output tokens น้อยกว่าถึง 85%

EvalGPT-5.6 SolGPT-5.6 TerraGPT-5.6 LunaGPT-5.5Claude Fable 5Claude Opus 4.8Gemini 3.1 Pro Preview
AA Coding Agent Index v1.18077.474.676.477.272.542.7
AA Intelligence Index v4.158.95551.254.859.955.746.5
Terminal-Bench 2.188.8%87.4%84.7%85.6%83.1%78.9%70.7%
DeepSWE v1.172.7%69.6%67.2%67%69.7%59%11.8%
SWE-Bench Pro64.6%63.4%62.7%59.4%80%69.2%54.2%
Agents’ Last Exam52.7%50.4%50.3%46.9%40.5%45.2%32.1%
GDPval-AA v2 (Elo)1,747.81,5931,591.81,493.71,759.61,600.1962.3
BrowseComp90.4%87.5%83.3%84.4%84.3%85.9%
OSWorld 2.062.6%50.2%45.6%47.5%54.8%
Toolathlon58%53.1%53.4%55.6%61.7%59.9%48.8%

ที่มา: ข้อมูลจาก OpenAI โดย Sol Ultra ทำคะแนนได้ 91.9% ใน Terminal-Bench 2.1 และ 92.2% ใน BrowseComp ส่วน Claude Mythos 5 ยังนำใน SWE-Bench Pro ที่ 80.3% เครื่องหมายแดชหมายถึงไม่มีข้อมูลรายงาน

จุดที่ GPT-5.6 ยังไม่เป็นผู้นำ

ประเด็นที่น่าสังเกตที่ GPT-5.6 ยังคงตามหลังคู่แข่ง:

  • SWE-Bench Pro: Sol ทำได้ 64.6% ยังตามหลัง Claude Mythos 5 (80.3%) และ Fable 5 (80%) อยู่ราว 15 จุด ในบททดสอบด้านการเขียนโค้ดที่สำคัญนี้
  • ความฉลาดและงานวิชาการ: Fable 5 ยังครองแชมป์ใน Artificial Analysis Intelligence Index v4.1 และ GDPval-AA v2 รวมถึง HealthBench Professional ที่เฉือนชนะ Sol ไปเล็กน้อย
  • การใช้งานเครื่องมือ (Tool use): ใน Toolathlon นั้น Sol ได้ 58% ในขณะที่ Fable 5 ทำได้ 61.7% และที่น่าสนใจคือรุ่นเล็กอย่าง Luna กลับทำคะแนนได้ดีกว่า Terra ในส่วนนี้
  • Long context: ประสิทธิภาพของ Luna ลดลงเหลือ 41.3% ในการทดสอบ MRCR v2 8-needle ช่วง 256K–1M ส่วน Sol ทำได้ 73.8% ในช่วง 512K–1M ซึ่งต่ำกว่า GPT-5.5 เล็กน้อย

คำอธิบายเพิ่มเติม

การคิดค่าบริการ Cache: การเขียน cache ใหม่จะคิดราคา 1.25 เท่าของเรตปกติ มีผลตั้งแต่ GPT-5.6 เป็นต้นไป โดยระบบจะเก็บ cache ไว้อย่างน้อย 30 นาที

ช่องทางการใช้ ultra: รองรับใน ChatGPT Work (Pro/Enterprise) และ Codex (Plus ขึ้นไป) สำหรับสายพัฒนา API สามารถใช้ multi-agent beta ใน Responses API เพื่อสร้างเวิร์กโฟลว์ที่ใกล้เคียงกับระดับ ultra ได้

MARKTECHPOST

จุดแข็งและจุดอ่อน

จุดแข็ง

  • เป็นผู้นำใน Artificial Analysis Coding Agent Index ด้วยคะแนน 80
  • ระบบ Programmatic Tool Calling ช่วยลูกค้าลดจำนวนทอเค็นได้เฉลี่ย 38% - 63.5%
  • โมเดลทั้ง 3 ระดับมีประสิทธิภาพเหนือกว่า GPT-5.5 ในการประเมินส่วนใหญ่
  • โครงสร้างราคา 5 ระดับ ช่วยให้องค์กรเลือกใช้โมเดลได้ตามความเหมาะสมของงาน
  • ระบบ Cache breakpoints ช่วยให้ควบคุมต้นทุนได้แม่นยำขึ้น
  • Sol มีประสิทธิภาพเด่นชัดใน OSWorld 2.0 โดยใช้ทอเค็นน้อยกว่าคู่แข่งอย่างมาก

จุดอ่อน

  • คะแนน SWE-Bench Pro ตามหลังตระกูล Claude อยู่ประมาณ 15 จุด
  • ยังไม่สามารถโค่น Fable 5 ในด้าน Intelligence Index และ Toolathlon ได้
  • ข้อมูลคะแนน Agents’ Last Exam ในรายงานและตารางจริงมีความคลาดเคลื่อนกัน
  • รุ่น Luna ยังมีข้อจำกัดในด้าน Long context และการทดสอบ Terminal-Bench 2.1
  • ค่าเขียน cache เป็นต้นทุนใหม่ 1.25 เท่าที่ผู้ใช้ต้องพิจารณา
  • ตัวเลขความหน่วงและต้นทุนปัจจุบันยังมาจากการจำลองแบบ offline ไม่ใช่การใช้งานจริงในหน้างาน
Source: MarkTechPost
ดูแลงานแปลและเรียบเรียงโดย NatapolK

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร