Anthropic เปิดตัว Claude Opus 5.5 นำด้านโค้ดดิ้งและงานวิจัย

· By: TanasakP

Anthropic เปิดตัว Claude Opus 5.5 นำด้านโค้ดดิ้งและงานวิจัย

เราขอนำเสนอ Claude Opus 5.5 โมเดลแรกในตระกูล Claude 5.5 ใหม่ล่าสุดที่มีประสิทธิภาพเทียบเท่า Claude Fable 5.1 ในงานส่วนใหญ่ แต่มาพร้อมความคุ้มค่าด้วยค่าใช้จ่ายในการใช้งานที่ถูกกว่า Opus 5 ถึง 40%

การเปิดตัว Claude Opus 5.5 ในครั้งนี้ถือเป็นก้าวสำคัญหลังจากที่เราได้รณรงค์เรื่องการ ควบคุมความเร็วของพรมแดนเทคโนโลยี (pacing the frontier) โดยโมเดลนี้ผ่านการทดสอบอย่างเข้มงวดจากหน่วยงานภายนอกอย่าง Frontier Design และ METR ซึ่งผลการตรวจสอบพฤติกรรมอัตโนมัติ (automated behavioral audit) พบว่า Opus 5.5 เป็นโมเดลที่แข็งแกร่งที่สุดเท่าที่เราเคยทดสอบมา พร้อมมาตรการความปลอดภัยขั้นสูงสุด

ประสิทธิภาพ (Performance) Opus 5.5 คือผู้นำรุ่นใหม่ที่ยกระดับความสามารถขึ้นอย่างชัดเจน โดยเฉพาะในงานที่ซับซ้อน เช่น การย้ายรหัส (code migration) จำนวน 680,000 บรรทัดที่สามารถเสร็จสิ้นได้ในเวลาไม่ถึงวัน ซึ่งปกติอาจต้องใช้เวลาหลายสัปดาห์ นอกจากนี้ยังเก่งในการเพิ่มประสิทธิภาพซอฟต์แวร์ โดยทำภารกิจลดเวลาโหลดหน้าเว็บแอปสำเร็จถึง 39 จาก 40 ครั้ง ขณะที่รุ่นเดิมทำได้เพียงเล็กน้อย

ความปลอดภัย (Safety) Opus 5.5 ทำคะแนนการทดสอบ alignment ได้สูงสุดเป็นประวัติการณ์ มีความเสี่ยงในการกระทำนอกขอบเขตที่ได้รับมอบหมายน้อยลง และทนทานต่อการโจมตีแบบ prompt injection มากกว่า Opus 5 สำหรับรายละเอียดเชิงลึกสามารถศึกษาได้จาก Opus 5.5 System Card

นอกจากนี้ สำหรับงานด้านชีววิทยาและความมั่นคงปลอดภัยไซเบอร์ เราได้นำมาตรการความปลอดภัยระดับสูงมาใช้ องค์กรที่ผ่านการตรวจสอบสามารถสมัคร Life Sciences Verification Program เพื่อใช้งานในการวิจัยได้ รวมถึงจะมีการขยายการเข้าถึง Cyber Verification Program สำหรับผู้เชี่ยวชาญในลำดับถัดไป

ราคาและความเร็ว (Cost and speed) Opus 5.5 ใช้ทรัพยากรประมวลผลน้อยลง ส่งผลให้มีราคาถูกลง 40% ในปริมาณงานทั่วไป โดยราคา input token อยู่ที่ $4 และ output token อยู่ที่ $20 ต่อล้านโทเคน สำหรับงานเขียนโค้ดและงาน agentic ที่ต้องอ่าน Cache บ่อยครั้ง จะมีค่าใช้จ่ายเพียง $0.20 ต่อล้านโทเคน (ลดลง 60%) และประมวลผลได้เร็วขึ้นกว่า 30%

การสื่อสาร (Communication) โมเดลรุ่นนี้สื่อสารได้อย่างเป็นธรรมชาติและชัดเจนกว่าเดิม โดยจะเน้นการนำเสนอข้อมูลสำคัญไว้ตอนต้น ทำให้เป็นคู่คิดในการทำงานที่ดีขึ้นในเซสชันที่ยาวนาน ดังที่ผู้ทดสอบรายหนึ่งระบุว่า "มันเขียนในแบบที่ผมเขียน" ซึ่งช่วยให้การติดตามและตรวจสอบงานทำได้ง่ายและปลอดภัยยิ่งขึ้น

สำหรับโมเดลรุ่นรองลงมาอย่าง Claude Sonnet 5.5 และ Claude Haiku 5.5 จะเปิดตัวตามมาในสัปดาห์หน้า พร้อมการปรับปรุงประสิทธิภาพและความปลอดภัยในระดับที่ใกล้เคียงกัน

ประสิทธิภาพและความคุ้มค่า (Performance and cost-effectiveness)

จากผลทดสอบ benchmark พบว่า Claude Opus 5.5 เป็นผู้นำในด้าน agentic coding, computer use และงานเชิงความรู้ แม้ช่องว่างระหว่าง Opus 5.5 และ Claude Fable 5.1 ในการใช้งานจริงจะแคบกว่าที่ตัวเลขระบุไว้

Opus 5.5Fable 5.1Opus 5GPT-6 AstraGPT-5.6 Sol
Agentic codingTerminal-Bench 4.0¹66.4%55.8%52.3%57.9%37.3%
Agentic codingFrontierCode v1.1 (Main)54.4%50.3%48.0%53.3%47.5%
Agentic codingCursorBench 4.057.8%51.8%46.6%-41.7%
Knowledge workGDPval-AA v2.118461735170815421588
Business workflowsAutomationBench²40.0%31.4%26.9%41.4%28.8%
Multidisciplinary reasoningHumanity's Last Exam67.7%with tools65.6%with tools63.6%with tools57.2%with tools-
Agentic scientific researchTerminal-Bench-Science 0.1³58.7%52.6%29.0%64.6%22.4%
Computer useOSWorld 2.081.8%partial80.7%partial74.0%partial--
Visual chart recognitionChartography89.0%with tools88.4%with tools83.4%with tools--

การทดสอบทั้งหมดของ Claude Opus 5.5 ใช้ฟีเจอร์ adaptive thinking ที่ระดับความพยายามสูงสุด (max effort) เพื่อแสดงขีดความสามารถที่แท้จริง

การกำหนดราคา

ราคาต่อ 1 ล้านโทเคนClaude Opus 5.5Claude Opus 5
Cache reads$0.20$0.50
Input tokens$4$5
Output tokens$20$25
Cache writes$5$6.25

นอกจากนี้ยังมี Fast mode ที่มีความเร็วเพิ่มขึ้นสูงสุด 2.5 เท่า สำหรับผู้ที่ต้องการความรวดเร็วในการทำงานบน Claude Code

การเขียนโค้ด (Coding)

Opus 5.5 โดดเด่นในงานที่ต้องทำต่อเนื่องยาวนาน เช่น การตรวจสอบ codebase ขนาด 200,000 บรรทัดที่ทำเสร็จในเวลาไม่ถึง 3 ชั่วโมง ซึ่งเร็วกว่า Opus 5 ที่ใช้เวลาถึง 20 ชั่วโมงหลายเท่าตัว นอกจากนี้ในการทดสอบแปลภาษาซอฟต์แวร์จาก C เป็น Rust พบว่า Opus 5.5 ทำงานเสร็จเร็วกว่า Fable 5.1 และประหยัดค่าใช้จ่ายได้มากกว่าครึ่ง

การทำงานเชิงความรู้ (Knowledge work)

ในด้านการวิจัย Opus 5.5 แสดงความแม่นยำสูงมาก โดยรายงานวิเคราะห์ผลประกอบการส่วนใหญ่ผ่านเกณฑ์คุณภาพที่เข้มงวด (ห้ามมีข้อมูลที่แต่งขึ้นแม้แต่นิดเดียว) ขณะที่รุ่นก่อนหน้าไม่สามารถผ่านเกณฑ์นี้ได้ รวมถึงความสามารถในการตรวจพบข้อผิดพลาดในคำแนะนำทางการเงินที่โมเดลอื่นมองข้าม

ความปลอดภัย (Safety)

Anthropic ให้ความสำคัญกับความปลอดภัยควบคู่ไปกับการพัฒนา โดยมีการคัดกรองการกระทำของเอเจนต์ก่อนรันจริง และการใช้มาตรการทางเทคนิคเพื่อป้องกันภัยคุกคามทางไซเบอร์และชีววิทยา รวมถึงการป้องกันการโจมตีแบบ prompt injection ที่มีประสิทธิภาพสูงสุดในกลุ่มโมเดลที่ทดสอบโดย Gray Swan

นอกจากนี้เรายังนำระบบ preserved thinking มาใช้เพื่อป้องกันการดึงข้อมูลการให้เหตุผล (distillation attacks) ซึ่งช่วยรักษาความปลอดภัยของระบบ AI ในระดับอุตสาหกรรม

การวางจำหน่าย

Claude Opus 5.5 พร้อมใช้งานแล้วในทุกแพลตฟอร์มหลัก ทั้ง Amazon Web Services, Google Cloud, Microsoft Azure และผ่านทาง API ของ Anthropic โดยนักพัฒนาสามารถ เริ่มต้นใช้งาน ได้ทันทีผ่านรหัสโมเดล claude-opus-5-5

Source: Anthropic News
ดูแลงานแปลและเรียบเรียงโดย TanasakP

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร