เปิดตัว Claude Sonnet 5.5 เร็วขึ้น 30% พร้อมลดต้นทุนการใช้งาน
ขอแนะนำ Claude Sonnet 5.5 โมเดลลำดับที่สองในตระกูล Claude 5.5 ซึ่งเป็นการอัปเกรดที่เหนือกว่า Claude Sonnet 5 อย่างชัดเจน โดยทำงานเร็วขึ้นกว่า 30% และมีค่าใช้จ่ายถูกลงสูงสุด 30% สำหรับงานส่วนใหญ่
Sonnet 5.5 ถูกวางตัวให้เป็นทางเลือกที่รวดเร็วและราคาถูกกว่าสำหรับ Claude Opus 5.5 โดยในขณะที่ Opus เน้นงานซับซ้อนที่ต้องตัดสินใจสูง แต่ Sonnet 5.5 จะทรงพลังที่สุดในงานประจำวันที่ขอบเขตชัดเจน เช่น การแก้ไขบั๊ก การสร้างเอกสาร สไลด์ และสเปรดชีต รวมถึงงานด้านการออกแบบ ส่วน Claude Haiku 5.5 สำหรับงานปริมาณมากและเน้นประหยัดต้นทุนจะตามมาในสัปดาห์หน้า
โมเดลรุ่นนี้มีการปรับปรุงดีขึ้นในหลายด้าน ได้แก่:
- ประสิทธิภาพ (Performance): ทำคะแนนเขียนโค้ดใน Terminal-Bench 4.0 ได้สูงถึง 70.6% และเป็นโมเดล Sonnet ตัวแรกที่เอาชนะเกม Pokémon Red ได้ผ่านการประมวลผลจากภาพหน้าจอ
- การทำงานร่วมกัน (Collaboration): เขียนได้ชัดเจนกว่ารุ่นเดิม และเหมาะสำหรับการทำซ้ำ (iteration) ในงานที่ซับซ้อนน้อยกว่า
- ต้นทุน (Cost): แม้ราคาต่อล้าน tokens จะเท่าเดิม ($2 input / $10 output) แต่ประหยัดกว่าเพราะใช้จำนวน tokens น้อยลงในการทำงานแบบเดียวกัน
- ความเร็ว (Speed): สร้างผลลัพธ์ได้เร็วขึ้นกว่า 30% กลายเป็นโมเดล Sonnet ที่เร็วที่สุดในปัจจุบัน
- ความปลอดภัย (Safety): เป็นรุ่นแรกที่เปิดตัวพร้อมระบบป้องกันภัยไซเบอร์ (cyber safeguards) เทียบเท่ากับโมเดลรุ่นท็อป
ประสิทธิภาพ (Performance)
Sonnet 5.5 พัฒนาขึ้นเหนือ Sonnet 5 ในทุกโดเมนจนบางกรณีเป็นการก้าวกระโดด ในการประเมินหลายรายการที่ระดับ Max effort ทำประสิทธิภาพได้เทียบเท่ากับ Opus 5.5 อย่างไรก็ตาม Opus 5.5 ยังคงแข็งแกร่งกว่าในงานปลายเปิดที่ซับซ้อน
| Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol | |
|---|---|---|---|---|
| Agentic coding Terminal-Bench 4.0 | 70.6% | 10.3% | 66.4%¹ | - |
| Agentic coding FrontierCode 1.1 (Main) | 46.2%Max² | 42.4% | 54.4% | 49.3% |
| 52.1%Xhigh | ||||
| Agentic coding CursorBench 4.0 | 55.5% | 34.1% | 57.8% | - |
| Knowledge work GDPval-AA v2.1³ | 1844 | 1449 | 1846 | 1487⁴ |
| Knowledge work AA-Briefcase v1.1³ | 1811 | 1359 | 1822 | 1483⁴ |
| Multidisciplinary reasoning Humanity’s Last Exam | 64.5%with tools | 54.9%with tools | 67.7%with tools | - |
| Computer use OSWorld 2.1 | 80.1%partial | 57.0%partial | 81.8%partial | - |
| Visual chart recognition Chartography | 61.6%no tools | 15.6%no tools | 64.4%no tools | 53.6%⁴no tools |
สำหรับรายละเอียดเกี่ยวกับการประเมิน สามารถดูได้ที่ Sonnet 5.5 System Card
ในการทดสอบ Terminal-Bench 4.0 ซึ่งวัดการทำงานระดับมืออาชีพผ่าน command-line พบว่า Sonnet 5.5 ที่ระดับ Medium effort (ค่าเริ่มต้นในแอป Claude) ทำคะแนนได้สูงกว่ารุ่นเดิมมาก โดยมีต้นทุนต่องานน้อยกว่าหนึ่งในสิบ ส่วนใน FrontierCode ที่ใช้วัดงานเขียนโค้ดระดับเอเจนต์ Sonnet 5.5 ที่ระดับ High effort ทำคะแนนเทียบเท่า GPT-6 Sol โดยใช้ต้นทุนเพียงหนึ่งในห้าเท่านั้น
การเขียนโค้ด (Coding)
การก้าวกระโดดของประสิทธิภาพเห็นได้ชัดที่สุดในงานเขียนโค้ด โดยใน CursorBench ซึ่งทดสอบจากงานจริงของเซสชัน Cursor พบว่าคะแนนห่างจาก Opus 5.5 เพียงสองจุด ผู้ทดสอบกลุ่มแรกระบุว่ามันทำความเข้าใจฐานโค้ด (codebase) ได้รวดเร็วและสามารถเรียกใช้เครื่องมือแบบกลุ่ม (batched tool calls) ได้มีประสิทธิภาพกว่าเดิม ส่งผลให้ขั้นตอนน้อยลงและลดต้นทุน
งานด้านความรู้ (Knowledge work)
Sonnet 5.5 ทำคะแนน GDPval-AA ที่ทดสอบกับ 44 อาชีพได้เกือบเท่า Opus 5.5 และสูงกว่ารุ่นก่อนถึง 400 จุด ในด้านการใช้งานจริง ผู้ทดสอบพบว่ามันเป็นคู่สนทนาที่ธรรมชาติและมีความเด่นด้านงานออกแบบ เช่น การสร้างสไลด์นำเสนอจากข้อมูลดิบและเทมเพลตที่ได้ผลลัพธ์พร้อมใช้งานทันทีโดยไม่ต้องแก้ไข
ต้นทุนและความเร็ว (Cost and speed)
| Price per 1M tokens | Claude Sonnet 5.5 | Claude Opus 5.5 |
|---|---|---|
| Cache reads | $0.20 | $0.20 |
| Cache writes | $2.50 | $5 |
| Input tokens | $2 | $4 |
| Output tokens | $10 | $20 |
ความเร็วของ Sonnet 5.5 ที่เพิ่มขึ้น 30% สามารถสังเกตเห็นได้ทันทีจากตัวอย่างการรันโปรแกรมจำลอง:
ฝูงนกสตาร์ลิง 400 ตัวในไฟล์ HTML เดียว

ลมที่พัดทรายเป็นรูปเนินทรายในไฟล์ HTML เดียว

นาฬิกาที่ทำจากนาฬิกาขนาดเล็ก 24 เรือนในไฟล์ HTML เดียว

ผู้ใช้สามารถรักษาสมดุลระหว่างต้นทุนและความเร็วผ่านการปรับ ระดับความพยายาม (effort level) โดยระดับ Low/Medium จะเหมาะกับงานประจำวันที่ต้องการความรวดเร็ว ส่วนระดับ High จะเน้นการให้เหตุผลที่ละเอียดถี่ถ้วน
ความปลอดภัย (Safety)
จากการตรวจสอบสถานการณ์กว่า 1,850 รูปแบบ Sonnet 5.5 พัฒนาขึ้นในเกณฑ์การปรับจูนและความซื่อสัตย์ โดยแทบไม่พบพฤติกรรมหนีออกจากแซนด์บ็อกซ์ (sandbox) หรือแสวงหาเป้าหมายที่ขัดต่อเจตนาผู้ใช้
ในด้านความปลอดภัยทางไซเบอร์ ได้มีการนำระบบป้องกันมาใช้เช่นเดียวกับ Opus 5.5 โดยหากเป็นการทำงานที่มีความเสี่ยงสูง ระบบจะเปลี่ยนไปใช้ Sonnet 5 แทนโดยอัตโนมัติ สำหรับผู้เชี่ยวชาญสามารถขอเข้าถึงความสามารถระดับสูงผ่าน Cyber Verification Program ได้
นอกจากนี้ยังเป็นโมเดล Sonnet รุ่นแรกที่ป้องกันการสกัดเอาขั้นตอนการคิด (reasoning extraction) ออกไปผ่านระบบ การคิดที่ถูกรักษาไว้ (preserved thinking) เพื่อป้องกันการโจมตีแบบกลั่นกรอง (Distillation attacks)
การเริ่มต้นใช้งาน (Getting started)
Claude Sonnet 5.5 พร้อมใช้งานแล้วทุกแพลตฟอร์มทั้ง AWS, Google Cloud และ Azure รวมถึง Claude Platform ด้วยรหัส claude-sonnet-5-5 สำหรับผู้ที่ต้องการปิดระบบการคิด (thinking off) จะต้องปรับการตั้งค่าตาม คู่มือการย้ายข้อมูล (migration guide)
เชิงอรรถ (Footnotes)
1 ผลการทดสอบ Terminal-Bench 4.0 รายงานสำหรับ Claude Opus 5.5 ที่ระดับ Xhigh effort 2 Sonnet 5.5 มักใช้ทักษะการตรวจสอบโค้ดบ่อยกว่าที่ระดับ Max effort ซึ่งในบางกรณีอาจทำให้เกิดการหมดเวลาหรือแก้ไขเกินขอบเขตงาน 3 การทดสอบรุ่นก่อนเปิดตัวพบบั๊กใน structured outputs ซึ่งได้รับการแก้ไขแล้ว และคาดว่ามีผลกระทบต่อคะแนนเพียงเล็กน้อย 4 คะแนนของ GPT-6 Sol อาจยังไม่สะท้อนถึงการแก้ไขบั๊กการเข้าใจรูปภาพล่าสุดของ OpenAI แต่คาดว่าจะไม่มีผลกระทบใหญ่ต่อการจัดอันดับ
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
