OpenAI เปิดตัว GPT-6 Sol และ Luna โมเดลฉลาดล้ำในราคาถูกลง 50%

· By: NatapolK

เพิ่มทางเลือกในการนำความฉลาดระดับแนวหน้ามาสู่การทำงานในทุกๆ วันของคุณ

เมื่อต้นเดือนนี้ เราได้แนะนำ GPT‑6 Astra ซึ่งเป็นโมเดลที่ชาญฉลาดที่สุดและมีการปรับจูน (aligned) ได้ดีที่สุดในโลก แม้ว่าโปรเจกต์สำคัญที่ต้องการประสิทธิภาพสูงสุดจะยังคงต้องพึ่งพาความลุ่มลึกอย่างเต็มที่ของ Astra แต่การทำงานจริงนั้นเกิดขึ้นในหลายระดับ จังหวะ และงบประมาณที่แตกต่างกัน

นั่นคือเหตุผลที่เราขยายจักรวาล GPT-6 ด้วยการเปิดตัว GPT‑6 Sol และ GPT‑6 Luna โดยในขณะที่ GPT‑6 Astra นำเสนอปัญญาประดิษฐ์เจเนอเรชันใหม่ โมเดลรุ่นใหม่เหล่านี้จะช่วยกระจายผลประโยชน์ของความฉลาดนั้นผ่านการพัฒนาความก้าวหน้าด้านความคุ้มค่า เราฝึกฝน GPT‑6 Sol และ Luna ด้วยวิธีการที่คล้ายคลึงกับ GPT‑6 Astra เพื่อนำความก้าวหน้าเบื้องหลังประสิทธิภาพระดับแนวหน้าของ Astra ทั้งในด้านการทำงานระดับมืออาชีพ, ข้อเท็จจริง, การเขียนโค้ด, การใช้งานคอมพิวเตอร์ และการปรับจูน มาสู่โมเดลที่ทำงานได้เร็วขึ้นและมีราคาจับต้องได้ง่ายขึ้น

โมเดลตระกูล GPT-6 นำหน้าในเรื่องเส้นกราฟระหว่างต้นทุนและความฉลาด โดยผสมผสานความสามารถอันยอดเยี่ยมในทุกระดับเข้ากับโครงสร้างพื้นฐานที่ส่งมอบประสิทธิภาพในวงกว้างได้อย่างมีประสิทธิผล การปรับปรุงระบบ caching และ inference ช่วยให้เราให้บริการโมเดลเหล่านี้ได้ในราคาที่ถูกลง และเรากำลังส่งต่อความประหยัดดังกล่าวไปยังผู้ใช้และลูกค้าโดยตรงด้วยการลดราคา API สำหรับ Sol และ Luna ลง 50% เมื่อเทียบกับราคาโปรโมชันของ GPT‑5.6 ซึ่งการปรับปรุงร่วมกันเหล่านี้ช่วยให้ AI ขั้นสูงสามารถใช้งานได้จริงสำหรับงานทั่วไปและการใช้งานในวงกว้างมากขึ้น

| | | | | | | $4 → | $20 → | ถูกลง 50% | | | $0.20 → | $1.20 → | ถูกลง 50% |

ราคาต่อ 1 ล้าน token

GPT‑6 Astra ยังคงเป็นโมเดลที่ดีที่สุดของเราในทุกๆ ด้าน ซึ่งควรเลือกใช้เมื่อคุณต้องการผลลัพธ์ที่ดีที่สุดและประสบการณ์ใช้งานที่ไม่มีข้อผูกมัด

ส่วน GPT‑6 Sol และ Luna นำการอัปเกรดทั้งด้านความฉลาดและความคุ้มค่ามาสู่โมเดลที่คุณคุ้นเคยและใช้งานอยู่แล้ว ในฟังก์ชันต่างๆ ที่มีประโยชน์ที่สุดสำหรับการทำงานที่ซับซ้อนให้สำเร็จ

GPT‑6 Sol สามารถรับมือกับงานที่ยากลำบากได้ดี ในขณะเดียวกันก็เปิดโอกาสให้คุณทำงานซ้ำได้มากขึ้นด้วยขีดจำกัดการใช้งานที่สูงขึ้นและต้นทุนที่ต่ำลง โดยมอบความฉลาดและผลลัพธ์ที่ดีกว่าเมื่อเทียบกับโมเดลคู่แข่งในราคาใกล้เคียงกัน

จากผลการทดสอบบน AutomationBench ซึ่งเป็นบททดสอบเวิร์กโฟลว์ทางธุรกิจผ่านแอปพลิเคชันต่างๆ พบว่า GPT‑6 Sol ที่ระดับความพยายาม xhigh ให้ประสิทธิภาพเหนือกว่า Claude Opus 5 ที่ระดับความพยายามสูงสุด (max effort) โดยใช้ต้นทุนเพียง 9% ของ Opus 5 ต่อหนึ่งงาน ส่วนในระดับความพยายามสูง GPT‑6 Luna พัฒนาขึ้นจากรุ่นก่อนหน้า 5.4 เปอร์เซ็นต์พอยต์ โดยมีต้นทุนต่อหนึ่งงานต่ำกว่าเดิมถึง 58%

ใน AutomationBench 1.0.6(opens in a new window) เอเยนต์ AI จะถูกทดสอบบนเวิร์กโฟลว์แบบครบวงจรโดยใช้เครื่องมือ 47 อย่าง ครอบคลุมด้านการขาย, การตลาด, การปฏิบัติงาน, การสนับสนุน, การเงิน และทรัพยากรบุคคล ทั้งนี้จุดข้อมูลสำหรับ Claude Fable 5.1 แสดงต้นทุนต่ำกว่าความเป็นจริง เนื่องจากไม่ได้รวมต้นทุนของการสำรองข้อมูล (fallbacks) ไปยัง Opus 5 ซึ่งเกิดขึ้นในงานประมาณ 40%

นอกจากนี้ GPT‑6 Sol ยังเหนือกว่า Claude Fable 5.1 ด้วยต้นทุนที่ต่ำกว่ามาก และยังทำผลงานได้ดีกว่า GPT‑6 Astra ในระดับความพยายามต่ำ (low-effort) อีกด้วย

| | | | |---|---|---| | GPT‑6 Sol (xhigh) | 33.2% | $0.27 | | GPT‑6 Astra (low) | 30.3% | | | Claude Opus 5 (max) | 26.9% | | | Claude Fable 5.1 w/ Opus 5 Fallback (max) | 31.4% |

|

สำหรับการทดสอบ Agents’ Last Exam ซึ่งประเมินเอเยนต์บนเวิร์กโฟลว์ระดับมืออาชีพที่ซับซ้อน GPT‑6 Sol ที่ระดับความพยายามสูงสุดสามารถทำคะแนนได้ 56.4% ซึ่งสูงกว่าคะแนนสูงสุดของ Claude Opus 5 ในการประเมินนี้ โดยมีต้นทุนต่อหนึ่งงานต่ำกว่าถึง 60%

ใน Agents’ Last Exam V1(opens in a new window) เอเยนต์ AI จะถูกประเมินในงานที่มีระยะเวลายาวนานและมีมูลค่าทางเศรษฐกิจ ครอบคลุม 55 อุตสาหกรรมย่อย ซึ่งเป็นสาขางานหลักระดับมืออาชีพส่วนใหญ่ที่ปฏิบัติงานบนคอมพิวเตอร์

ประโยชน์ของคำตอบย่อมขึ้นอยู่กับการได้รับข้อเท็จจริงที่ถูกต้อง ซึ่งเรากำลังก้าวหน้าอย่างต่อเนื่องในเรื่องความน่าเชื่อถือด้านข้อมูล จากการประเมินข้อเท็จจริงภายในของเราที่อ้างอิงจากการสนทนาจริงที่ถูกลบข้อมูลระบุตัวตน (de-identified) ซึ่งเป็นเคสที่ผู้ใช้เคยระบุข้อผิดพลาดจากโมเดลรุ่นก่อน พบว่า GPT‑6 Sol มีข้อผิดพลาดลดลงเหลือเพียงประมาณครึ่งหนึ่ง ทำให้เข้าใกล้ระดับความน่าเชื่อถือของ Astra ในราคาที่ถูกกว่ามาก ทางด้าน GPT‑6 Luna ก็มีการปรับปรุงอย่างมากเช่นกัน โดยในระดับความพยายามที่สูงขึ้น มันสามารถทำงานได้เทียบเท่ากับ GPT‑5.6 Sol ด้วยราคาเพียงประมาณหนึ่งในร้อยของต้นทุนเท่านั้น

ในที่นี้เราประเมินความเป็นข้อเท็จจริงจากการสนทนา ChatGPT ที่ลบตัวตนออกแล้ว ซึ่งผู้ใช้เคยระบุข้อผิดพลาดทางข้อเท็จจริงจากโมเดลรุ่นก่อน โดยการสนทนาที่ทำให้เกิดข้อผิดพลาดเหล่านี้ไม่ได้เป็นตัวแทนของการใช้งานทั่วไป ซึ่งปกติแล้วข้อผิดพลาดทางข้อเท็จจริงจะเกิดขึ้นได้ยากกว่า และคะแนนไม่ได้ถูกควบคุมตามความยาว อย่างไรก็ตาม การตรวจสอบความฟุ่มเฟือยของคำ (verbosity sweeps) ของเราแสดงให้เห็นว่าเกือบไม่มีความเกี่ยวข้องกับความยาวของคำตอบเลย

ในปีนี้ เอเยนต์เขียนโค้ด (coding agents) เริ่มจัดการงานที่มีความซับซ้อน ขอบเขต และระยะเวลาที่ยาวนานกว่าที่เคยเป็นมา โดยที่ OpenAI การใช้งานภายในของเราเติบโตขึ้นอย่างทวีคูณ หากวัดตามราคา API การใช้งาน token ต่อวันนั้นเกินกว่า $600 สำหรับนักวิจัยค่ามัธยฐาน และสูงกว่า $7,000 สำหรับนักวิจัยในเปอร์เซ็นไทล์ที่ 90 ( Research acceleration: The view inside OpenAI) เมื่อเอเยนต์เขียนโค้ดต้องรับงานที่ยาวและต้องการความสามารถสูงขึ้น ต้นทุนของการใช้งานอย่างต่อเนื่องจึงมีความสำคัญอย่างยิ่ง ซึ่ง GPT‑6 Sol และ Luna ได้รวมประสิทธิภาพการเขียนโค้ดที่แข็งแกร่งเข้ากับราคา API ที่ต่ำลง ช่วยให้นักพัฒนามีพื้นที่ในการทำงานซ้ำได้มากขึ้น และทำให้ทีมมีความมั่นใจที่จะตั้งเป้าหมายที่ทะเยอทะยานยิ่งขึ้นในการสั่งงาน Codex

จากการทดสอบบน FrontierCode ซึ่งประเมินว่าเอเยนต์เขียนโค้ดสร้างการเปลี่ยนแปลงที่พร้อมจะผสาน (merge) เข้ากับ codebase จริงหรือไม่ พบว่า GPT‑6 Sol พัฒนาขึ้นอย่างมากเมื่อเทียบกับ GPT‑5.6 Sol และสามารถทำงานเทียบเท่ากับ Claude Fable 5.1 xhigh ได้ในราคาที่ต่ำกว่ามาก

ใน FrontierCode 1.1 Main(opens in a new window) เอเยนต์ AI จะเขียนโค้ดที่ไม่ได้วัดเกรดแค่ความถูกต้องเท่านั้น แต่ยังรวมถึง "ความพร้อมในการผสานรวม" (mergeability) เช่น คุณภาพการทดสอบ, วินัยของขอบเขตงาน, สไตล์ของโค้ด และการปฏิบัติตามมาตรฐาน codebase

ในบททดสอบ DeepSWE v1.1 ซึ่งทดสอบประสิทธิภาพของงานวิศวกรรมซอฟต์แวร์ที่ซับซ้อนใน codebase จริง GPT‑6 Sol ที่ความพยายามสูงสุดทำคะแนนได้ 68.8% ซึ่งตามหลังคะแนนสูงสุดของ Claude Fable 5 ที่ทำไว้ 69.9% ณ ระดับความพยายาม xhigh เพียง 1.1 เปอร์เซ็นต์พอยต์เท่านั้น โดยมีต้นทุนต่อหนึ่งงานต่ำกว่าประมาณ 80%

ส่วน GPT‑6 Luna ที่ความพยายามสูงสุดทำคะแนนได้ 66.6% ซึ่งเทียบเท่ากับ Claude Opus 5 และ Fable 5 ที่ความพยายามระดับปานกลาง โดยในการเปรียบเทียบนี้ Luna มีต้นทุนต่อหนึ่งงานน้อยกว่า Opus 5 อยู่ 93% และน้อยกว่า Fable 5 ถึง 96%

ใน DeepSWE 1.1(opens in a new window) เอเยนต์ AI จะต้องแก้ปัญหางานวิศวกรรมซอฟต์แวร์ระยะยาวที่เป็นโจทย์ต้นฉบับ

แม้ว่า GPT‑6 Astra จะยังคงเป็นโมเดลที่ดีที่สุดในโลกสำหรับการใช้งานคอมพิวเตอร์ แต่ GPT‑6 Sol และ Luna ก็นำเสนอประสิทธิภาพที่คุ้มค่ากว่ารุ่นก่อนๆ โดยใน OSWorld 2.0 offline GPT‑6 Sol ที่ความพยายาม xhigh ทำคะแนนได้ใกล้เคียงกับ Claude Opus 5 ที่ความพยายามระดับปานกลาง (60.5% เทียบกับ 60.3%) โดยมีต้นทุนต่อหนึ่งงานต่ำกว่าประมาณ 80% ขณะที่ GPT‑6 Luna (max) สามารถเอาชนะ GPT‑5.6 Sol (medium) ได้ด้วยต้นทุนเพียงหนึ่งในสิบ

ใน OSWorld 2.0(opens in a new window) เอเยนต์ AI จะพยายามทำเวิร์กโฟลว์การใช้งานคอมพิวเตอร์ระยะยาวที่ครอบคลุมงานในชีวิตประจำวันและงานระดับมืออาชีพ โดยเรารายงานรางวัลบางส่วน (partial reward) จากชุด offline ของเวอร์ชัน v2026.08.08

นอกจากนี้ เรายังได้นำสไตล์การสื่อสารที่ปรับปรุงใหม่ของ GPT‑6 Astra มาสู่ Sol และ Luna ด้วย ซึ่งเราคาดว่าผู้ใช้จะสังเกตเห็นการเปลี่ยนแปลงได้อย่างชัดเจน โดยเฉพาะในการสนทนาด้านเทคนิคและการเขียนโค้ด เตรียมพบกับความชัดเจนที่มากขึ้น, คำศัพท์เฉพาะทางที่ลดลง, วลีที่แปลกประหลาดน้อยลง, รายละเอียดที่มีมูลค่าน้อยที่ลดลง และคำตอบโดยรวมที่สั้นลงเล็กน้อยโดยไม่เสียเนื้อหาสำคัญ

แม้ว่าสไตล์จะเป็นเรื่องส่วนตัว แต่เราชอบการตอบกลับของ GPT‑6 Sol ในที่นี้มากกว่า เนื่องจากมันไม่ได้ด่วนสรุปเร็วเกินไป ใช้เวลาน้อยลงในการทวนรายละเอียดที่อาจชัดเจนสำหรับผู้ถามอยู่แล้ว (เช่น เว็บไซต์มีสี่หน้า), ใช้ภาษาที่กำกวมน้อยลง (เช่น "bento feel", "reshaping… around that system"), ให้ข้อมูลที่ชัดเจนกว่าเกี่ยวกับสิ่งที่ตรวจสอบและไม่ได้ตรวจสอบ และไม่แชร์รายละเอียดการทำงานอย่างเช่น prompt ของเครื่องมือสร้างภาพโดยไม่จำเป็น

นอกเหนือจากราคา token ที่ถูกลงแล้ว เรายังช่วยให้นักพัฒนาที่สร้างแอปพลิเคชันบน GPT‑6 ประหยัดต้นทุนได้มากขึ้นในส่วนของ context ที่นำกลับมาใช้ใหม่ โดยเราได้ปรับปรุงระบบ prompt caching สำหรับ GPT‑6 เพื่อให้อัตรา cache hit สูงขึ้นโดยค่าเริ่มต้น ซึ่งช่วยให้เอเยนต์นำ context กลับมาใช้ใหม่ได้มากขึ้น ตอบสนองได้เร็วขึ้น และได้รับประโยชน์จากส่วนลด 90% สำหรับการอ่าน input-token ที่เก็บไว้ใน cache

นักพัฒนายังมีวิธีเพิ่มเติมในการวัดและปรับแต่งประสิทธิภาพการทำ caching ของตนเอง ดังนี้:

  • ตรวจสอบและวินิจฉัย ด้วยเครื่องมือ Prompt Caching Dashboard(opens in a new window) และ diagnostics tool(opens in a new window)
  • ปรับระดับความพยายามในการใช้เหตุผลและความพร้อมของเครื่องมือโดยไม่ทำให้ cache หลุด ผ่านการตั้งค่า reasoning effort(opens in a new window) หรือ enable or disable tools(opens in a new window)
  • เพิ่มประสิทธิภาพว่าส่วนหน้า (prefixes) ใดควรถูก cache จุดตัดที่ชัดเจน (explicit breakpoints) ช่วยให้นักพัฒนาเลือกได้ว่าส่วนหน้าที่ถูก cache จะสิ้นสุดลงที่ใด ซึ่งช่วยให้ควบคุมการนำ cache กลับมาใช้ใหม่ได้มากขึ้นและปรับปรุงประสิทธิภาพได้ดีขึ้น

GitHub รายงานว่าในช่วงหลายเดือนที่ผ่านมา การปรับปรุงเหล่านี้ช่วยลดสัดส่วนของ prompt token ที่ต้องประมวลผลใหม่ลงมากกว่า 50% จากคำขอนับพันล้านรายการที่ส่งไปยังโมเดลของ OpenAI ซึ่งช่วยให้ Copilot สามารถตอบสนองได้รวดเร็วยิ่งขึ้น

GPT‑6 Sol และ Luna สร้างขึ้นบนพื้นฐานงานด้านการปรับจูน (alignment) ที่เปิดตัวพร้อมกับ Astra ซึ่งเป็นโมเดลที่มีการปรับจูนดีที่สุดของเราในปัจจุบัน โดยในการประเมินด้านการปรับจูน ทั้ง Sol และ Luna แสดงให้เห็นถึงการพัฒนาที่เหนือกว่าคู่เทียบในรุ่น GPT‑5.6 รวมถึงมีอัตราการกล่าวอ้างที่ทำให้เข้าใจผิดเกี่ยวกับการเขียนโค้ดที่ลดลงด้วย

อนึ่ง การประเมินด้านล่างนี้เป็นการทดสอบในสถานการณ์ที่ท้าทายเป็พิเศษ และไม่ได้วัดอัตราความล้มเหลวในการใช้งานทั่วไป โดยสามารถดูรายละเอียดผลลัพธ์ทั้งหมดได้ที่ system card(opens in a new window)

GPT‑6 Sol และ GPT‑6 Luna พร้อมใช้งานแล้วใน ChatGPT Work และ Codex ตั้งแต่วันนี้สำหรับผู้ใช้ Plus, Pro, Business, Enterprise และ Edu ทุกคน ส่วนผู้ใช้กลุ่ม Free และ Go สามารถเข้าถึง GPT‑6 Luna ได้บนแอปพลิเคชันเดสก์ท็อป ทว่าโมเดลเหล่านี้ยังไม่พร้อมใช้งานในระบบ Chat สำหรับใน OpenAI API โมเดลทั้งสองพร้อมให้บริการแล้วในชื่อ gpt-6-sol และ gpt-6-luna เพื่อให้การบริการมีความเสถียรสำหรับทุกคน เราวางแผนที่จะทยอยเปิดตัวโมเดลเหล่านี้ใน ChatGPT ตลอดทั้งวัน หากคุณยังไม่เห็นโมเดลใหม่ใน ChatGPT Work หรือ Codex โปรดลองใหม่อีกครั้งในภายหลัง

การประเมิน GPT ถูกดำเนินการในสภาพแวดล้อมการวิจัยของเราหรือผ่าน API ซึ่งอาจให้ผลลัพธ์ที่แตกต่างจาก ChatGPT เวอร์ชันใช้งานจริงเล็กน้อยเนื่องจากความแตกต่างของ system prompts, เครื่องมือที่มีให้ใช้ ฯลฯ ทั้งนี้การประเมินโมเดลคู่แข่งนำมาจากรายงานที่เปิดเผยต่อสาธารณะ และคะแนนของ Claude Fable 5 จะถูกรายงานเมื่อไม่มีคะแนนสำหรับ Claude Fable 5.1

Source: OpenAI News
ดูแลงานแปลและเรียบเรียงโดย NatapolK

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร