เปิดตัว Claude Sonnet 5.5 เร็วขึ้น 30% พร้อมลดต้นทุนการใช้งาน

· By: TanasakP

ขอแนะนำ Claude Sonnet 5.5 โมเดลลำดับที่สองในตระกูล Claude 5.5 ซึ่งเป็นการอัปเกรดที่เหนือกว่า Claude Sonnet 5 อย่างชัดเจน โดยทำงานเร็วขึ้นกว่า 30% และมีค่าใช้จ่ายถูกลงสูงสุด 30% สำหรับงานส่วนใหญ่

Sonnet 5.5 ถูกวางตัวให้เป็นทางเลือกที่รวดเร็วและราคาถูกกว่าสำหรับ Claude Opus 5.5 โดยในขณะที่ Opus เน้นงานซับซ้อนที่ต้องตัดสินใจสูง แต่ Sonnet 5.5 จะทรงพลังที่สุดในงานประจำวันที่ขอบเขตชัดเจน เช่น การแก้ไขบั๊ก การสร้างเอกสาร สไลด์ และสเปรดชีต รวมถึงงานด้านการออกแบบ ส่วน Claude Haiku 5.5 สำหรับงานปริมาณมากและเน้นประหยัดต้นทุนจะตามมาในสัปดาห์หน้า

โมเดลรุ่นนี้มีการปรับปรุงดีขึ้นในหลายด้าน ได้แก่:

  • ประสิทธิภาพ (Performance): ทำคะแนนเขียนโค้ดใน Terminal-Bench 4.0 ได้สูงถึง 70.6% และเป็นโมเดล Sonnet ตัวแรกที่เอาชนะเกม Pokémon Red ได้ผ่านการประมวลผลจากภาพหน้าจอ
  • การทำงานร่วมกัน (Collaboration): เขียนได้ชัดเจนกว่ารุ่นเดิม และเหมาะสำหรับการทำซ้ำ (iteration) ในงานที่ซับซ้อนน้อยกว่า
  • ต้นทุน (Cost): แม้ราคาต่อล้าน tokens จะเท่าเดิม ($2 input / $10 output) แต่ประหยัดกว่าเพราะใช้จำนวน tokens น้อยลงในการทำงานแบบเดียวกัน
  • ความเร็ว (Speed): สร้างผลลัพธ์ได้เร็วขึ้นกว่า 30% กลายเป็นโมเดล Sonnet ที่เร็วที่สุดในปัจจุบัน
  • ความปลอดภัย (Safety): เป็นรุ่นแรกที่เปิดตัวพร้อมระบบป้องกันภัยไซเบอร์ (cyber safeguards) เทียบเท่ากับโมเดลรุ่นท็อป

ประสิทธิภาพ (Performance)

Sonnet 5.5 พัฒนาขึ้นเหนือ Sonnet 5 ในทุกโดเมนจนบางกรณีเป็นการก้าวกระโดด ในการประเมินหลายรายการที่ระดับ Max effort ทำประสิทธิภาพได้เทียบเท่ากับ Opus 5.5 อย่างไรก็ตาม Opus 5.5 ยังคงแข็งแกร่งกว่าในงานปลายเปิดที่ซับซ้อน

Sonnet 5.5Sonnet 5Opus 5.5GPT-6 Sol
Agentic coding Terminal-Bench 4.070.6%10.3%66.4%¹-
Agentic coding FrontierCode 1.1 (Main)46.2%Max²42.4%54.4%49.3%
52.1%Xhigh
Agentic coding CursorBench 4.055.5%34.1%57.8%-
Knowledge work GDPval-AA v2.1³1844144918461487⁴
Knowledge work AA-Briefcase v1.1³1811135918221483⁴
Multidisciplinary reasoning Humanity’s Last Exam64.5%with tools54.9%with tools67.7%with tools-
Computer use OSWorld 2.180.1%partial57.0%partial81.8%partial-
Visual chart recognition Chartography61.6%no tools15.6%no tools64.4%no tools53.6%⁴no tools

สำหรับรายละเอียดเกี่ยวกับการประเมิน สามารถดูได้ที่ Sonnet 5.5 System Card

ในการทดสอบ Terminal-Bench 4.0 ซึ่งวัดการทำงานระดับมืออาชีพผ่าน command-line พบว่า Sonnet 5.5 ที่ระดับ Medium effort (ค่าเริ่มต้นในแอป Claude) ทำคะแนนได้สูงกว่ารุ่นเดิมมาก โดยมีต้นทุนต่องานน้อยกว่าหนึ่งในสิบ ส่วนใน FrontierCode ที่ใช้วัดงานเขียนโค้ดระดับเอเจนต์ Sonnet 5.5 ที่ระดับ High effort ทำคะแนนเทียบเท่า GPT-6 Sol โดยใช้ต้นทุนเพียงหนึ่งในห้าเท่านั้น

การเขียนโค้ด (Coding)

การก้าวกระโดดของประสิทธิภาพเห็นได้ชัดที่สุดในงานเขียนโค้ด โดยใน CursorBench ซึ่งทดสอบจากงานจริงของเซสชัน Cursor พบว่าคะแนนห่างจาก Opus 5.5 เพียงสองจุด ผู้ทดสอบกลุ่มแรกระบุว่ามันทำความเข้าใจฐานโค้ด (codebase) ได้รวดเร็วและสามารถเรียกใช้เครื่องมือแบบกลุ่ม (batched tool calls) ได้มีประสิทธิภาพกว่าเดิม ส่งผลให้ขั้นตอนน้อยลงและลดต้นทุน

งานด้านความรู้ (Knowledge work)

Sonnet 5.5 ทำคะแนน GDPval-AA ที่ทดสอบกับ 44 อาชีพได้เกือบเท่า Opus 5.5 และสูงกว่ารุ่นก่อนถึง 400 จุด ในด้านการใช้งานจริง ผู้ทดสอบพบว่ามันเป็นคู่สนทนาที่ธรรมชาติและมีความเด่นด้านงานออกแบบ เช่น การสร้างสไลด์นำเสนอจากข้อมูลดิบและเทมเพลตที่ได้ผลลัพธ์พร้อมใช้งานทันทีโดยไม่ต้องแก้ไข

ต้นทุนและความเร็ว (Cost and speed)

Price per 1M tokensClaude Sonnet 5.5Claude Opus 5.5
Cache reads$0.20$0.20
Cache writes$2.50$5
Input tokens$2$4
Output tokens$10$20

ความเร็วของ Sonnet 5.5 ที่เพิ่มขึ้น 30% สามารถสังเกตเห็นได้ทันทีจากตัวอย่างการรันโปรแกรมจำลอง:

ฝูงนกสตาร์ลิง 400 ตัวในไฟล์ HTML เดียว The previous model writing a starling murmuration program, then running it. The latest model writing a starling murmuration program, then running it.

ลมที่พัดทรายเป็นรูปเนินทรายในไฟล์ HTML เดียว The previous model writing a sand dunes program, then running it. The latest model writing a sand dunes program, then running it.

นาฬิกาที่ทำจากนาฬิกาขนาดเล็ก 24 เรือนในไฟล์ HTML เดียว The previous model writing a clock-of-clocks program, then running it. The latest model writing a clock-of-clocks program, then running it.

ผู้ใช้สามารถรักษาสมดุลระหว่างต้นทุนและความเร็วผ่านการปรับ ระดับความพยายาม (effort level) โดยระดับ Low/Medium จะเหมาะกับงานประจำวันที่ต้องการความรวดเร็ว ส่วนระดับ High จะเน้นการให้เหตุผลที่ละเอียดถี่ถ้วน

ความปลอดภัย (Safety)

จากการตรวจสอบสถานการณ์กว่า 1,850 รูปแบบ Sonnet 5.5 พัฒนาขึ้นในเกณฑ์การปรับจูนและความซื่อสัตย์ โดยแทบไม่พบพฤติกรรมหนีออกจากแซนด์บ็อกซ์ (sandbox) หรือแสวงหาเป้าหมายที่ขัดต่อเจตนาผู้ใช้

ในด้านความปลอดภัยทางไซเบอร์ ได้มีการนำระบบป้องกันมาใช้เช่นเดียวกับ Opus 5.5 โดยหากเป็นการทำงานที่มีความเสี่ยงสูง ระบบจะเปลี่ยนไปใช้ Sonnet 5 แทนโดยอัตโนมัติ สำหรับผู้เชี่ยวชาญสามารถขอเข้าถึงความสามารถระดับสูงผ่าน Cyber Verification Program ได้

นอกจากนี้ยังเป็นโมเดล Sonnet รุ่นแรกที่ป้องกันการสกัดเอาขั้นตอนการคิด (reasoning extraction) ออกไปผ่านระบบ การคิดที่ถูกรักษาไว้ (preserved thinking) เพื่อป้องกันการโจมตีแบบกลั่นกรอง (Distillation attacks)

การเริ่มต้นใช้งาน (Getting started)

Claude Sonnet 5.5 พร้อมใช้งานแล้วทุกแพลตฟอร์มทั้ง AWS, Google Cloud และ Azure รวมถึง Claude Platform ด้วยรหัส claude-sonnet-5-5 สำหรับผู้ที่ต้องการปิดระบบการคิด (thinking off) จะต้องปรับการตั้งค่าตาม คู่มือการย้ายข้อมูล (migration guide)

เชิงอรรถ (Footnotes)

1 ผลการทดสอบ Terminal-Bench 4.0 รายงานสำหรับ Claude Opus 5.5 ที่ระดับ Xhigh effort 2 Sonnet 5.5 มักใช้ทักษะการตรวจสอบโค้ดบ่อยกว่าที่ระดับ Max effort ซึ่งในบางกรณีอาจทำให้เกิดการหมดเวลาหรือแก้ไขเกินขอบเขตงาน 3 การทดสอบรุ่นก่อนเปิดตัวพบบั๊กใน structured outputs ซึ่งได้รับการแก้ไขแล้ว และคาดว่ามีผลกระทบต่อคะแนนเพียงเล็กน้อย 4 คะแนนของ GPT-6 Sol อาจยังไม่สะท้อนถึงการแก้ไขบั๊กการเข้าใจรูปภาพล่าสุดของ OpenAI แต่คาดว่าจะไม่มีผลกระทบใหญ่ต่อการจัดอันดับ

Source: Anthropic News
ดูแลงานแปลและเรียบเรียงโดย TanasakP

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร