Anthropic เปิดตัว Claude Opus 4.6 อัปเกรดความฉลาดเหนือชั้น ทิ้งห่างคู่แข่งด้วย context 1 ล้าน token
เรากำลังอัปเกรดโมเดลที่ฉลาดที่สุดของเรา
Claude Opus 4.6 ใหม่ได้รับการพัฒนาทักษะการเขียนโค้ดให้เหนือกว่ารุ่นก่อนหน้า โดยเน้นการวางแผนที่รอบคอบ สามารถจัดการงานในลักษณะ Agentic ได้ต่อเนื่องยาวนานขึ้น และทำงานร่วมกับฐานข้อมูลโค้ดขนาดใหญ่ได้อย่างน่าเชื่อถือ นอกจากนี้ยังมีทักษะการตรวจทานโค้ด (code review) และการดีบั๊ก (debugging) ที่แม่นยำยิ่งขึ้นเพื่อลดข้อผิดพลาด และเป็นครั้งแรกที่โมเดลตระกูล Opus มาพร้อมกับ context window ขนาด 1M token ในเวอร์ชัน beta1
Opus 4.6 ยังสามารถประยุกต์ใช้ความสามารถที่เพิ่มขึ้นนี้กับงานประจำวันได้อย่างหลากหลาย ไม่ว่าจะเป็นการวิเคราะห์ทางการเงิน การทำงานวิจัย ตลอดจนการจัดการเอกสาร สเปรดชีต และงานนำเสนอ ภายใต้ Cowork ที่ Claude สามารถทำงานหลายอย่างพร้อมกันแบบอัตโนมัติ เพื่อทำหน้าที่แทนคุณได้อย่างสมบูรณ์แบบ
ประสิทธิภาพของโมเดลอยู่ในระดับล้ำหน้า (state-of-the-art) จากผลประเมินในหลายสาขา เช่น การคว้าคะแนนสูงสุดด้าน agentic coding บน Terminal-Bench 2.0 และนำหน้าโมเดลระดับแนวหน้า (frontier models) ทั้งหมดใน Humanity’s Last Exam ซึ่งเป็นการทดสอบการให้เหตุผลแบบสหวิทยาการที่ซับซ้อน
ในส่วนของ GDPval-AA ซึ่งประเมินงานบริการทางความรู้ด้านการเงินและกฎหมาย Opus 4.6 มีประสิทธิภาพเหนือกว่าคู่แข่งที่ใกล้เคียงที่สุดอย่าง GPT-5.2 ของ OpenAI ถึงประมาณ 144 Elo points และดีกว่า Claude Opus 4.5 รุ่นเดิมถึง 190 points นอกจากนี้ยังทำผลงานได้ดีกว่าโมเดลใดๆ ใน BrowseComp ซึ่งวัดความสามารถในการค้นหาข้อมูลหายากบนโลกออนไลน์
จากการตรวจสอบใน system card ฉบับสมบูรณ์ พบว่า Opus 4.6 มีโปรไฟล์ความปลอดภัยที่ดีเยี่ยมเทียบเท่าหรือสูงกว่าโมเดลระดับเดียวกันในอุตสาหกรรม โดยมีอัตราพฤติกรรมที่ไม่สอดคล้อง (misaligned behavior) ต่ำมากจากการประเมินด้านความปลอดภัย

สำหรับเครื่องมือ Claude Code ตอนนี้คุณสามารถรวมกลุ่มเอเจนต์เป็น agent teams เพื่อทำงานสอดประสานกันเป็นทีมได้ สำหรับการใช้งานผ่าน API นั้น Claude สามารถใช้ to summarize its own context and perform longer-running tasks without bumping up against limits. We’re also introducing compaction where the model can pick up on contextual clues about how much to use its extended thinking, and new adaptive thinking controls to give developers more control over intelligence, speed, and cost. effort
นอกจากนี้ เรายังมีการอัปเกรด Claude in Excel ครั้งใหญ่ และเปิดตัว Claude in PowerPoint ในรูปแบบ research preview ซึ่งช่วยเพิ่มประสิทธิภาพของการทำงานในออฟฟิศให้สูงขึ้นอย่างก้าวกระโดด
Claude Opus 4.6 เปิดให้ใช้งานแล้ววันนี้ผ่าน claude.ai รวมถึง API และแพลตฟอร์มคลาวด์ชั้นนำ สำหรับนักพัฒนาสามารถเรียกใช้ claude-opus-4-6 ผ่าน Claude API ได้โดยยังคงราคาเดิมที่ $5/$25 ต่อล้าน token ตรวจสอบรายละเอียดได้ที่ หน้าเพจราคา
ความประทับใจแรก
เราสร้าง Claude ด้วยตัว Claude เอง โดยทีมวิศวกรของเราใช้ Claude Code ในการทำงานทุกวันและทดสอบโมเดลใหม่ผ่านงานจริงก่อนเสมอ ซึ่งในรุ่น Opus 4.6 เราพบว่าโมเดลสามารถลำดับความสำคัญของงานที่ท้าทายได้เก่งขึ้นโดยไม่ต้องสั่งการละเอียด ทำงานพื้นฐานได้อย่างรวดเร็ว และมีวิจารณญาณในการจัดการปัญหาที่คลุมเครือได้ดีขึ้นแม้ในเซสชันการทำงานที่ยาวนาน โดยส่วนใหญ่ Opus 4.6 จะใช้เวลาคิดและทบทวนเหตุผลอย่างละเอียดก่อนสรุปคำตอบ ซึ่งแม้จะให้ผลลัพธ์ที่ดีเยี่ยมในโจทย์ยาก แต่อาจทำให้เกิด latency ในโจทย์ที่ง่ายเกินไป หากผู้ใช้พบว่าโมเดล "คิดมาก" เกินความจำเป็น สามารถปรับค่า effort จาก High (ค่าเริ่มต้น) เป็น Medium ได้ผ่าน พารามิเตอร์ /effort เพื่อความเหมาะสมกับงาน
การประเมินผล Claude Opus 4.6
ในงานด้าน agentic coding, การควบคุมคอมพิวเตอร์, การใช้เครื่องมือ, การค้นหาข้อมูล และ การเงิน นั้น Opus 4.6 คือผู้นำที่มักจะทิ้งห่างคู่แข่งอย่างเห็นได้ชัด ตารางด้านล่างแสดงผลลัพธ์การเปรียบเทียบกับโมเดลรุ่นก่อนหน้าและคู่แข่งในเบนมาร์กต่างๆ

Opus 4.6 มีความโดดเด่นมากในการดึงข้อมูลจากเอกสารมหาศาล โดยสามารถรักษาความถูกต้องของข้อมูลผ่าน token จำนวนหลายแสนตัวได้โดยมีการคลาดเคลื่อน (drift) น้อยลงอย่างมาก และสามารถตรวจพบรายละเอียดเล็กๆ น้อยๆ ที่ซ่อนอยู่ ซึ่งแม้แต่โมเดลรุ่นท็อปอย่าง Opus 4.5 ก็อาจมองข้ามไป
ปัญหาที่มักพบใน AI คือสภาวะ "context rot" หรือการที่ประสิทธิภาพลดลงเมื่อการสนทนายาวขึ้น แต่ Opus 4.6 ก้าวข้ามขีดจำกัดนี้ได้ โดยในการทดสอบ MRCR v2 แบบ 1 ล้านรายการเพื่อค้นหาข้อมูลที่ถูกซ่อนไว้กลางข้อความมหาศาล Opus 4.6 ทำคะแนนได้สูงถึง 76% เทียบกับ Sonnet 4.5 ที่ทำได้เพียง 18.5% เท่านั้น

แผนภูมิด้านล่างแสดงให้เห็นถึงความสำเร็จของ Claude Opus 4.6 ในเบนมาร์กด้านวิศวกรรมซอฟต์แวร์ การเขียนโค้ดหลายภาษา ความต่อเนื่องของการให้เหตุผล ความปลอดภัยไซเบอร์ และความรู้ด้านวิทยาศาสตร์ชีวภาพ

ก้าวสำคัญด้านความปลอดภัย
ความฉลาดที่สูงขึ้นไม่ได้แลกมาด้วยความเสี่ยง เพราะ Opus 4.6 มีอัตราพฤติกรรมที่ไม่เหมาะสมต่ำลง ทั้งในด้านการหลอกลวงหรือการประจบเอาใจ (sycophancy) โดยมีความสอดคล้อง (aligned) กับหลักความปลอดภัยในระดับที่เหนือกว่า Claude Opus 4.5 และยังมีอัตราการปฏิเสธคำตอบที่ถูกต้อง (over-refusals) ต่ำสุดในบรรดาโมเดลรุ่นล่าสุดอีกด้วย

เราได้ทำการประเมินความปลอดภัยอย่างละเอียดที่สุดในบรรดาโมเดลที่เคยสร้างมา โดยใช้ทั้งการประเมินความเป็นอยู่ที่ดีของผู้ใช้ (user wellbeing) และการทดสอบความสามารถในการขัดขวางคำขอที่เป็นอันตราย นอกจากนี้ยังมีการใช้ศาสตร์ interpretability เพื่อทำความเข้าใจการทำงานภายในของ AI และตรวจจับปัญหาที่การทดสอบทั่วไปอาจเข้าไม่ถึง รายละเอียดทั้งหมดถูกรวบรวมไว้ใน Claude Opus 4.6 system card
ในขณะที่โมเดลมีความสามารถด้านไซเบอร์เพิ่มขึ้น เราก็ได้พัฒนา probes ใหม่ 6 จุดเพื่อตรวจจับการนำไปใช้ในทางที่ผิด และยังส่งเสริมการใช้โมเดลในเชิงป้องกัน (cyberdefensive) เพื่อช่วยค้นหาและแก้ไขช่องโหว่ในซอฟต์แวร์โอเพนซอร์ซ ดังที่ระบุไว้ใน โพสต์บล็อกความมั่นคงปลอดภัยไซเบอร์ ของเรา
อัปเดตผลิตภัณฑ์และ API เพื่อให้ Opus 4.6 ทำงานได้เต็มประสิทธิภาพ เราได้อัปเดตคุณสมบัติใหม่ใน Claude Platform ดังนี้:
- Adaptive thinking: ระบบอัจฉริยะที่ให้ Claude ตัดสินใจเองว่าจะใช้การคิดขั้นสูงเมื่อใด เพื่อให้ได้ผลลัพธ์ที่ดีที่สุดในต้นทุนที่เหมาะสม
- Effort: เพิ่มระดับการควบคุมได้ 4 ระดับ (low, medium, high, max) เพื่อให้เหมาะสมกับประเภทของงาน
- Context compaction (beta): สรุปและจัดการ context อัตโนมัติเมื่อการสนทนายาวเกินไป เพื่อป้องกันการชนขีดจำกัดของระบบ
- 1M token context (beta): รองรับบริบทที่ยาวที่สุดถึง 1 ล้าน token (พร้อมโครงสร้างราคาใหม่สำหรับ prompt ที่เกิน 200k tokens)
- 128k output tokens: รองรับการสร้างเนื้อหาที่ยาวขึ้นในครั้งเดียวโดยไม่ต้องแบ่งขอใหม่
ในด้านผลิตภัณฑ์ เราเปิดตัว agent teams ใน Claude Code สำหรับการทำงานแบบทีมเอเจนต์ขนานกัน และการอัปเดต Claude in Excel รวมถึงการแนะนำ Claude in PowerPoint (research preview) เพื่อช่วยสรุปข้อมูลจากสเปรดชีตมาเป็นสไลด์นำเสนอที่ตรงตามโลโก้และแบรนด์ของคุณโดยอัตโนมัติ
ฟุตโน้ต
[1] context window ขนาด 1M token ปัจจุบันพร้อมใช้งานในรูปแบบ beta บน Claude Developer Platform เท่านั้น [2] ดำเนินการโดยอิสระโดย Artificial Analysis ดูที่นี่ [3] หมายถึง Claude Opus 4.6 ได้รับคะแนนสูงกว่า GPT-5.2 ประมาณ 70% ของเวลาทั้งหมดในการประเมินนี้
เนื้อหาที่เกี่ยวข้อง
สมัครทุนการวิจัย AI for Science สำหรับโรคหายากของ Anthropic
ขอแนะนำ Claude for Teachers
Anthropic มอบเงิน 10 ล้านดอลลาร์เพื่อสนับสนุนการวิจัย AI ในแคนาดา
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
