Anthropic เปิดตัว Claude Opus 5.5 ประสิทธิภาพแรงเทียบชั้น Fable ในราคาถูกลง

· By: SirilukP

Image description

Update:

  • เพิ่มผลการทดสอบจาก Artificial Analysis

Anthropic เริ่มเปิดตัว Claude Opus 5.5 โมเดลรุ่นแรกในตระกูลเจเนอเรชันใหม่ โดยทางบริษัทระบุว่าโมเดลนี้มีประสิทธิภาพในระดับเดียวกับ Claude Fable 5.1 แต่มีจุดเด่นสำคัญที่ราคาถูกลงและประมวลผลได้รวดเร็วกว่ารุ่นก่อนหน้าอย่างมาก

ข้อมูลจาก Anthropic ชี้ให้เห็นว่า Opus 5.5 สามารถทำงานส่วนใหญ่ได้ทัดเทียมกับ Claude Fable 5.1 โดยมีต้นทุนการใช้งานถูกกว่า Opus 5 ประมาณ 40 เปอร์เซ็นต์ ทั้งนี้คาดว่าโมเดลรุ่นรองลงมาอย่าง Claude Sonnet 5.5 และ Haiku 5.5 จะเปิดตัวตามมาในอีกไม่กี่สัปดาห์ข้างหน้า เพื่อยกระดับความคุ้มค่าและความปลอดภัยในทิศทางเดียวกัน

ผลการทดสอบเบื้องต้นแสดงให้เห็นว่า Opus 5.5 มีสมรรถนะเหนือกว่าทั้ง Fable 5.1 และ GPT-6 Astra ของ OpenAI ที่มีราคาสูงกว่ามาก ในเกือบทุกประเภทงาน

Benchmark / capabilityOpus 5.5Fable 5.1Opus 5GPT-6 AstraGPT-5.6 Sol
Agentic codingTerminal-Bench 4.0[1]
66.4%
55.8%52.3%57.9%37.3%
Agentic codingFrontierCode v1.1 (Main)
54.4%
50.3%48.0%53.3%47.5%
Agentic codingCursorBench 4.0
57.8%
51.8%46.6%N/A41.7%
Knowledge workGDPval-AA v2.1
1,846
1,7351,7081,5421,588
Business workflowsAutomationBench[1]
40.0%31.4%26.9%41.4%
28.8%
Multidisciplinary reasoningHumanity's Last Exam
67.7%(with tools)
65.6%(with tools)
63.6%(with tools)
57.2%(with tools)
N/A
Agentic scientific researchTerminal-Bench-Science 0.1[1]
58.7%52.6%29.0%64.6%
22.4%
Computer useOSWorld 2.0
81.8%(partial)
80.7%(partial)
74.0%(partial)
N/AN/A
Visual chart recognitionChartography
89.0%(with tools)
88.4%(with tools)
83.4%(with tools)
N/AN/A

Anthropic กล่าวว่าซีรีส์ใหม่นี้มุ่งเน้นการตอบโจทย์ลูกค้าในกลุ่มบริการทางการเงิน กฎหมาย และการพัฒนาซอฟต์แวร์ ซึ่งต้องการความแม่นยำสูงควบคู่ไปกับความประหยัดและคุณภาพการสื่อสารที่ดีขึ้น

ราคาที่ถูกลงและการใช้ token ที่ลดลงช่วยตัดต้นทุนการดำเนินงาน

Anthropic ตั้งราคา Opus 5.5 ไว้ที่ 4 ดอลลาร์ต่อล้าน input tokens และ 20 ดอลลาร์ต่อล้าน output tokens ลดลงจากรุ่น Opus 5 เดิมประมาณ 20 เปอร์เซ็นต์ นอกจากนี้ยังมีการปรับลดค่าใช้จ่ายในการอ่านแคช (cache read) ลงถึง 60 เปอร์เซ็นต์ เพื่อช่วยให้องค์กรประหยัดงบประมาณได้มากขึ้น

เมื่อคำนวณจากทั้งราคาและปริมาณการใช้งาน ซึ่งปัจจุบันถูกมองว่าเป็นตัวชี้วัดธุรกิจที่สำคัญ ต้นทุนรวมของ Opus 5.5 จะต่ำกว่ารุ่นก่อนหน้าประมาณ 40 เปอร์เซ็นต์ เนื่องจากโมเดลใช้จำนวน token น้อยลงในการทำงานแบบเดียวกัน และสร้างผลลัพธ์ได้เร็วขึ้น 30 เปอร์เซ็นต์

Prices per 1M tokensClaude Opus 5.5Claude Opus 5
Cache reads$0.20$0.50
Input tokens$4$5
Output tokens$20$25
Cache writes$5$6.25

สำหรับสมาชิกรายบุคคล ขีดจำกัดการใช้งานในรอบ 5 ชั่วโมงจะเพิ่มขึ้น 20 เปอร์เซ็นต์ และด้วยประสิทธิภาพการประมวลผลที่ดีขึ้น จะส่งผลให้ขีดจำกัดดังกล่าวใช้งานได้ยาวนานขึ้นโดยรวม 25 เปอร์เซ็นต์ โดยผู้ใช้สามารถเลือกบริหารจัดการการรีเซ็ตขีดจำกัดเพื่อเก็บไว้ใช้ในเวลาจำเป็นได้

ในการทดสอบด้านการเขียนโค้ด Anthropic ระบุว่า Opus 5.5 มีความคุ้มค่าสูงมาก โดยในเกณฑ์ FrontierCode สามารถชนะ GPT-6 Astra ด้วยต้นทุนเพียง 20 เปอร์เซ็นต์ และชนะ GPT-5.6 Sol ใน CursorBench ไป 11 คะแนนด้วยต้นทุนเพียงหนึ่งในสาม ซึ่งการลดราคานี้ถือเป็นการแก้เกมการแข่งขันกับ OpenAI และโมเดลจากจีน ที่มีราคาถูกกว่ามาก

Anthropic สัญญาว่าจะลดความเป็น "Claudish"

Opus 5.5 ได้รับการพัฒนาให้สื่อสารได้อย่างเป็นธรรมชาติมากขึ้น โดยตัดความเป็นสูตรสำเร็จหรือภาษาที่ซับซ้อนเกินไปซึ่งมักถูกล้อเลียนว่าเป็น "Claudish" ออกไป โมเดลจะเน้นนำเสนอข้อมูลสำคัญก่อน ใช้ศัพท์เฉพาะน้อยลง และปฏิบัติตามคำสั่งการเขียนอย่างเคร่งครัด ซึ่งช่วยให้การทำงานต่อเนื่องนานๆ เป็นไปอย่างราบรื่น

Anthropic เปิดตัว Claude Opus 5.5 ประสิทธิภาพแรงเทียบชั้น Fable ในราคาถูกลง

Screenshot via PAW

นอกจากนี้ Opus 5.5 ยังมาพร้อมมาตรการป้องกันความปลอดภัยระดับแนวหน้าที่เทียบเท่า Fable 5.1 โดยจะมีการส่งต่อคำขอไปยังโมเดลที่เหมาะสมโดยอัตโนมัติ เช่น ภารกิจด้านไซเบอร์จะถูกส่งไปยัง Opus 4.8 ส่วนงานด้านชีววิทยาจะถูกส่งไปยัง Opus 5 เพื่อรักษาความปลอดภัยสูงสุด

องค์กรวิจัยสามารถขอเข้าถึงโมเดลเพื่อการศึกษาผ่าน Life Sciences Verification Program และในอนาคตจะมีการขยาย Cyber Verification Program ให้ครอบคลุม Opus 5.5 ด้วย ปัจจุบันโมเดลพร้อมใช้งานแล้วผ่านทุกแพลตฟอร์มหลักทั้ง AWS, Google Cloud และ Azure

Anthropic เรียกร้องมาตรฐานความปลอดภัยที่สูงขึ้นเมื่อโมเดลมีความสามารถมากขึ้น

Anthropic ให้ความสำคัญกับความปลอดภัยควบคู่กับการพัฒนา โดยตั้งเป้าตรวจสอบสภาพแวดล้อมการเรียนรู้ (reinforcement learning) ให้เข้มงวดขึ้น เพื่อป้องกัน พฤติกรรมโมเดลที่ไม่สอดคล้องกับเป้าหมาย (misaligned) ซึ่งเป็นความกังวลหลักในวงการ AI ปัจจุบัน

ในขณะที่ OpenAI เรียกร้องให้มีมาตรฐานสากลสำหรับ AI ที่พัฒนาตนเองได้ ทาง Anthropic ก็มีจุดยืนที่ใกล้เคียงกัน โดยมองว่าควรมีมาตรฐานความปลอดภัยที่สูงขึ้นสำหรับโมเดลที่ทำงานวิจัยอัตโนมัติได้ และควรมีองค์กรภายนอกอย่าง Frontier Design และ METR เข้ามาร่วมทดสอบก่อนเปิดใช้งานจริง

ข้อจำกัดใหม่มุ่งเป้าไปที่การสกัดความรู้ (distillation) และรองรับการปฏิบัติตามกฎหมาย EU AI Act เพื่อป้องกัน การโจมตีเพื่อสกัดความรู้ (distillation attacks) Anthropic ได้นำฟีเจอร์ "Preserved Thinking" มาใช้ เพื่อไม่ให้ผู้ใช้งานผ่าน API แก้ไขกระบวนการให้เหตุผลของโมเดลเพื่อนำไปฝึกสอน AI ตัวอื่น โดยจะมีผลกับบัญชีใหม่ที่สร้างหลังวันที่ 31 สิงหาคม 2026

นอกจากนี้ Opus 5.5 ยังได้เพิ่มมาตรการใส่ลายน้ำดิจิทัล เพื่อปฏิบัติตามกฎหมาย EU AI Act และผู้ใช้จะไม่สามารถปิดโหมด "Thinking" ได้อีกต่อไป เพื่อความโปร่งใสตามนโยบาย Zero Data Retention ของบริษัท

Artificial Analysis จัดให้ Opus 5.5 อยู่ในอันดับต้นๆ ของดัชนีความฉลาด

Artificial Analysis ยืนยันความสำเร็จของ Opus 5.5 โดยระบุว่าทำคะแนนได้ 58 คะแนนในดัชนีความฉลาด (Intelligence Index) ซึ่งเป็นสถิติสูงที่สุดเท่าที่เคยมีการบันทึกมา โดยครองอันดับหนึ่งใน 6 จาก 10 รายการทดสอบหลัก เช่น Humanity's Last Exam และ SciCode

Claude Opus 5.5 leads the Artificial Analysis Intelligence Index with 58 points, followed by Claude Fable 5.1 and GPT-6 Astra at 53 each. In the cost-performance chart (bottom), several Opus 5.5 effort levels sit on the Pareto frontier. | Image: Artificial Analysis

ข้อมูลระบุว่า Opus 5.5 สามารถก้าวขึ้นมาทัดเทียมกับ GPT-6 Astra ในงานด้าน Automation และเอาชนะ GPT-5.6 Sol ในด้านคุณภาพการนำเสนอผลงานได้เป็นครั้งแรก รวมถึงมีประสิทธิภาพเหนือกว่า Astra ในเกณฑ์ GDPval-AA ของ OpenAI เกือบทุกโหมดการทดสอบ

Anthropic เปิดตัว Claude Opus 5.5 ประสิทธิภาพแรงเทียบชั้น Fable ในราคาถูกลง

แม้ Artificial Analysis จะพบว่า Opus 5.5 ใช้ปริมาณ token ต่อภารกิจมากกว่าคู่แข่งเมื่อใช้ความพยายามสูงสุด แต่ด้วยราคาต่อหน่วยที่ถูกลง ทำให้ต้นทุนรวมยังอยู่ในระดับที่น่าพอใจและอยู่ในตำแหน่ง Pareto frontier ซึ่งถือว่ามีความคุ้มค่าสูงสุดเมื่อเทียบกับโมเดลระดับท็อปตัวอื่นๆ ในตลาด

Source: The Decoder
ดูแลงานแปลและเรียบเรียงโดย SirilukP

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร