Anthropic เปิดตัว Claude Opus 5.5 นำด้านโค้ดดิ้งและงานวิจัย

เราขอนำเสนอ Claude Opus 5.5 โมเดลแรกในตระกูล Claude 5.5 ใหม่ล่าสุดที่มีประสิทธิภาพเทียบเท่า Claude Fable 5.1 ในงานส่วนใหญ่ แต่มาพร้อมความคุ้มค่าด้วยค่าใช้จ่ายในการใช้งานที่ถูกกว่า Opus 5 ถึง 40%
การเปิดตัว Claude Opus 5.5 ในครั้งนี้ถือเป็นก้าวสำคัญหลังจากที่เราได้รณรงค์เรื่องการ ควบคุมความเร็วของพรมแดนเทคโนโลยี (pacing the frontier) โดยโมเดลนี้ผ่านการทดสอบอย่างเข้มงวดจากหน่วยงานภายนอกอย่าง Frontier Design และ METR ซึ่งผลการตรวจสอบพฤติกรรมอัตโนมัติ (automated behavioral audit) พบว่า Opus 5.5 เป็นโมเดลที่แข็งแกร่งที่สุดเท่าที่เราเคยทดสอบมา พร้อมมาตรการความปลอดภัยขั้นสูงสุด
ประสิทธิภาพ (Performance) Opus 5.5 คือผู้นำรุ่นใหม่ที่ยกระดับความสามารถขึ้นอย่างชัดเจน โดยเฉพาะในงานที่ซับซ้อน เช่น การย้ายรหัส (code migration) จำนวน 680,000 บรรทัดที่สามารถเสร็จสิ้นได้ในเวลาไม่ถึงวัน ซึ่งปกติอาจต้องใช้เวลาหลายสัปดาห์ นอกจากนี้ยังเก่งในการเพิ่มประสิทธิภาพซอฟต์แวร์ โดยทำภารกิจลดเวลาโหลดหน้าเว็บแอปสำเร็จถึง 39 จาก 40 ครั้ง ขณะที่รุ่นเดิมทำได้เพียงเล็กน้อย
ความปลอดภัย (Safety) Opus 5.5 ทำคะแนนการทดสอบ alignment ได้สูงสุดเป็นประวัติการณ์ มีความเสี่ยงในการกระทำนอกขอบเขตที่ได้รับมอบหมายน้อยลง และทนทานต่อการโจมตีแบบ prompt injection มากกว่า Opus 5 สำหรับรายละเอียดเชิงลึกสามารถศึกษาได้จาก Opus 5.5 System Card
นอกจากนี้ สำหรับงานด้านชีววิทยาและความมั่นคงปลอดภัยไซเบอร์ เราได้นำมาตรการความปลอดภัยระดับสูงมาใช้ องค์กรที่ผ่านการตรวจสอบสามารถสมัคร Life Sciences Verification Program เพื่อใช้งานในการวิจัยได้ รวมถึงจะมีการขยายการเข้าถึง Cyber Verification Program สำหรับผู้เชี่ยวชาญในลำดับถัดไป
ราคาและความเร็ว (Cost and speed) Opus 5.5 ใช้ทรัพยากรประมวลผลน้อยลง ส่งผลให้มีราคาถูกลง 40% ในปริมาณงานทั่วไป โดยราคา input token อยู่ที่ $4 และ output token อยู่ที่ $20 ต่อล้านโทเคน สำหรับงานเขียนโค้ดและงาน agentic ที่ต้องอ่าน Cache บ่อยครั้ง จะมีค่าใช้จ่ายเพียง $0.20 ต่อล้านโทเคน (ลดลง 60%) และประมวลผลได้เร็วขึ้นกว่า 30%
การสื่อสาร (Communication) โมเดลรุ่นนี้สื่อสารได้อย่างเป็นธรรมชาติและชัดเจนกว่าเดิม โดยจะเน้นการนำเสนอข้อมูลสำคัญไว้ตอนต้น ทำให้เป็นคู่คิดในการทำงานที่ดีขึ้นในเซสชันที่ยาวนาน ดังที่ผู้ทดสอบรายหนึ่งระบุว่า "มันเขียนในแบบที่ผมเขียน" ซึ่งช่วยให้การติดตามและตรวจสอบงานทำได้ง่ายและปลอดภัยยิ่งขึ้น
สำหรับโมเดลรุ่นรองลงมาอย่าง Claude Sonnet 5.5 และ Claude Haiku 5.5 จะเปิดตัวตามมาในสัปดาห์หน้า พร้อมการปรับปรุงประสิทธิภาพและความปลอดภัยในระดับที่ใกล้เคียงกัน
ประสิทธิภาพและความคุ้มค่า (Performance and cost-effectiveness)
จากผลทดสอบ benchmark พบว่า Claude Opus 5.5 เป็นผู้นำในด้าน agentic coding, computer use และงานเชิงความรู้ แม้ช่องว่างระหว่าง Opus 5.5 และ Claude Fable 5.1 ในการใช้งานจริงจะแคบกว่าที่ตัวเลขระบุไว้
| Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra | GPT-5.6 Sol | |
|---|---|---|---|---|---|
| Agentic codingTerminal-Bench 4.0¹ | 66.4% | 55.8% | 52.3% | 57.9% | 37.3% |
| Agentic codingFrontierCode v1.1 (Main) | 54.4% | 50.3% | 48.0% | 53.3% | 47.5% |
| Agentic codingCursorBench 4.0 | 57.8% | 51.8% | 46.6% | - | 41.7% |
| Knowledge workGDPval-AA v2.1 | 1846 | 1735 | 1708 | 1542 | 1588 |
| Business workflowsAutomationBench² | 40.0% | 31.4% | 26.9% | 41.4% | 28.8% |
| Multidisciplinary reasoningHumanity's Last Exam | 67.7%with tools | 65.6%with tools | 63.6%with tools | 57.2%with tools | - |
| Agentic scientific researchTerminal-Bench-Science 0.1³ | 58.7% | 52.6% | 29.0% | 64.6% | 22.4% |
| Computer useOSWorld 2.0 | 81.8%partial | 80.7%partial | 74.0%partial | - | - |
| Visual chart recognitionChartography | 89.0%with tools | 88.4%with tools | 83.4%with tools | - | - |
การทดสอบทั้งหมดของ Claude Opus 5.5 ใช้ฟีเจอร์ adaptive thinking ที่ระดับความพยายามสูงสุด (max effort) เพื่อแสดงขีดความสามารถที่แท้จริง
การกำหนดราคา
| ราคาต่อ 1 ล้านโทเคน | Claude Opus 5.5 | Claude Opus 5 |
|---|---|---|
| Cache reads | $0.20 | $0.50 |
| Input tokens | $4 | $5 |
| Output tokens | $20 | $25 |
| Cache writes | $5 | $6.25 |
นอกจากนี้ยังมี Fast mode ที่มีความเร็วเพิ่มขึ้นสูงสุด 2.5 เท่า สำหรับผู้ที่ต้องการความรวดเร็วในการทำงานบน Claude Code
การเขียนโค้ด (Coding)
Opus 5.5 โดดเด่นในงานที่ต้องทำต่อเนื่องยาวนาน เช่น การตรวจสอบ codebase ขนาด 200,000 บรรทัดที่ทำเสร็จในเวลาไม่ถึง 3 ชั่วโมง ซึ่งเร็วกว่า Opus 5 ที่ใช้เวลาถึง 20 ชั่วโมงหลายเท่าตัว นอกจากนี้ในการทดสอบแปลภาษาซอฟต์แวร์จาก C เป็น Rust พบว่า Opus 5.5 ทำงานเสร็จเร็วกว่า Fable 5.1 และประหยัดค่าใช้จ่ายได้มากกว่าครึ่ง
การทำงานเชิงความรู้ (Knowledge work)
ในด้านการวิจัย Opus 5.5 แสดงความแม่นยำสูงมาก โดยรายงานวิเคราะห์ผลประกอบการส่วนใหญ่ผ่านเกณฑ์คุณภาพที่เข้มงวด (ห้ามมีข้อมูลที่แต่งขึ้นแม้แต่นิดเดียว) ขณะที่รุ่นก่อนหน้าไม่สามารถผ่านเกณฑ์นี้ได้ รวมถึงความสามารถในการตรวจพบข้อผิดพลาดในคำแนะนำทางการเงินที่โมเดลอื่นมองข้าม
ความปลอดภัย (Safety)
Anthropic ให้ความสำคัญกับความปลอดภัยควบคู่ไปกับการพัฒนา โดยมีการคัดกรองการกระทำของเอเจนต์ก่อนรันจริง และการใช้มาตรการทางเทคนิคเพื่อป้องกันภัยคุกคามทางไซเบอร์และชีววิทยา รวมถึงการป้องกันการโจมตีแบบ prompt injection ที่มีประสิทธิภาพสูงสุดในกลุ่มโมเดลที่ทดสอบโดย Gray Swan
นอกจากนี้เรายังนำระบบ preserved thinking มาใช้เพื่อป้องกันการดึงข้อมูลการให้เหตุผล (distillation attacks) ซึ่งช่วยรักษาความปลอดภัยของระบบ AI ในระดับอุตสาหกรรม
การวางจำหน่าย
Claude Opus 5.5 พร้อมใช้งานแล้วในทุกแพลตฟอร์มหลัก ทั้ง Amazon Web Services, Google Cloud, Microsoft Azure และผ่านทาง API ของ Anthropic โดยนักพัฒนาสามารถ เริ่มต้นใช้งาน ได้ทันทีผ่านรหัสโมเดล claude-opus-5-5
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
