Z.ai เปิดตัว GLM-5.3 ยกระดับงานโค้ดและไซเบอร์โดยไม่ต้องเทรน Base Model ใหม่

Z.ai ประกาศเปิดตัว GLM-5.3 โมเดลภาษาขนาดใหญ่ที่ทำงานบนพื้นฐาน base model ขนาด 743B ตัวเดิมของ GLM-5.2 โดยประสิทธิภาพที่เพิ่มขึ้นอย่างก้าวกระโดดนี้ไม่ได้มาจากการเทรนโมเดลใหม่ แต่เกิดจากการขยายสเกล post-training ในสภาพแวดล้อมที่หลากหลายและยาวนานขึ้น ส่งผลให้การทำงานในรูปแบบ long-horizon มีความเสถียรและแม่นยำสูงกว่าเดิม
การพัฒนาในครั้งนี้เน้นไปที่สองด้านหลักคือการเขียนโค้ดและการรักษาความปลอดภัยทางไซเบอร์ โดยในด้านการเขียนโค้ด คะแนน Terminal-Bench 3.0 ขยับเพิ่มขึ้นจาก 4.6 เป็น 28.3 ขณะที่ด้านความปลอดภัยทางไซเบอร์ทำผลงานได้เกินความคาดหมายของทีมพัฒนา โดยมีคะแนน CyberGym สูงถึง 84.5% อย่างไรก็ตาม ในปัจจุบัน Weights ของโมเดลยังไม่มีการเปิดเผยต่อสาธารณะอย่างเป็นทางการ
สามารถนำไปใช้งานได้หรือยัง?
ใช้งานได้บางส่วน ปัจจุบัน GLM-5.3 เปิดให้เข้าถึงผ่านทาง Z.ai API, GLM Coding Plan และ ZCode เป็นที่เรียบร้อยแล้ว ส่วนการเปิดเผย Weights นั้น ทาง Z.ai ระบุว่าจะดำเนินการปล่อยออกมาในอีกประมาณสองสัปดาห์ หลังจากเสร็จสิ้นการประเมินความปลอดภัยและกระบวนการทำ hardening เพื่อความมั่นใจสูงสุด
บริษัทกลุ่มไหนที่เริ่มใช้ได้เลย: สำหรับกลุ่มสตาร์ทอัพและหน่วยงานวิศวกรรมระดับกลางสามารถเริ่มใช้งานผ่าน API ได้ทันที แต่สำหรับองค์กรขนาดใหญ่ที่มีข้อกำหนดด้านการจัดเก็บข้อมูล (data-residency) ที่เข้มงวดอาจจำเป็นต้องรอการปล่อย Weights เพื่อนำไปรันเองภายในองค์กร โดยโมเดลนี้จะมอบประโยชน์สูงสุดแก่ผู้ให้บริการด้านความปลอดภัย (MSSP) และบริษัทที่ต้องการเครื่องมือวิจัยช่องโหว่ระดับสูง
อุตสาหกรรมและแนวทางการใช้งาน: โมเดลนี้เหมาะสำหรับอุตสาหกรรมโครงสร้างพื้นฐานคลาวด์, ฟินเทค, และอีคอมเมิร์ซ โดยสามารถนำไปประยุกต์ใช้ในการทำ refactor โค้ดระดับ repository, การสร้างเอเจนต์ CLI สำหรับงานระยะยาว, การวิเคราะห์ความล้มเหลวของระบบ CI ไปจนถึงการตรวจสอบช่องโหว่แบบ white-box และการคัดแยกเหตุการณ์ระบบล่ม (crash triage) อย่างมีประสิทธิภาพ
ผลลัพธ์ด้านการเขียนโค้ด (Coding Results)
ในด้านประสิทธิภาพการเขียนโค้ด GLM-5.3 แสดงให้เห็นถึงการพัฒนาที่ชัดเจน โดยคะแนน DeepSWE v1.1 เพิ่มขึ้นเป็น 66.9 จากเดิม 46.2 และในเกณฑ์วัด Agents’ Last Exam (CLI) ขยับขึ้นเป็น 28.5 นอกจากนี้ในการทดสอบ GDPval-AA v2 ครอบคลุม 44 สายอาชีพ โมเดลสามารถทำได้ถึง 1,769 แต้ม
จากการประเมินภายในผ่าน Z.ai Code Bench พบว่าประสิทธิภาพดีขึ้นถึง 50% เมื่อเทียบกับรุ่นก่อน โดยสามารถทำงานที่ขนาด 50,000 token ได้แม่นยำ 31.4% ซึ่งแซงหน้า Claude Opus 4.8 ที่ทำได้ 29.5% แม้จะยังตามหลัง Claude Fable 5 ที่ครองตำแหน่งสูงสุดอยู่ที่ 39.5% ก็ตาม ทั้งนี้ทาง Z.ai ให้ความเห็นว่าการใช้ชุดทดสอบภายในช่วยลดความเสี่ยงเรื่องข้อมูลรั่วไหลเข้าไปในชุดเทรน (contamination risk) ได้ดีกว่า
อย่างไรก็ตาม สำหรับชุดทดสอบสาธารณะระดับยาก GLM-5.3 ยังคงมีคะแนนตามหลังคู่แข่งอย่าง GPT-5.6 Sol และ Fable 5 อยู่เล็กน้อย ซึ่งข้อมูลตัวเลขทั้งหมดได้รับการยืนยันโดยเวนเดอร์พร้อมเอกสารอ้างอิงด้านสภาพแวดล้อมการทดสอบอย่างครบถ้วน
ผลลัพธ์ด้านความปลอดภัยทางไซเบอร์ (The Cybersecurity Result)
ความก้าวหน้าในด้านความปลอดภัยทางไซเบอร์ถือเป็นเรื่องประหลาดใจสำหรับทีมงาน Z.ai เนื่องจากเดิมทีทีมงานเพียงต้องการเพิ่มข้อมูลการค้นหาช่องโหว่เพื่อให้โมเดลมีตรรกะเหตุผลที่ดีขึ้น แต่ผลลัพธ์ที่ได้คือโมเดลสามารถสร้างแผนการเจาะระบบที่ซับซ้อนต่อเนื่องเป็นสายโซ่ (exploitation chains) ได้เองจากการขยายสเกลการเทรน
CyberGym ซึ่งเน้นการตรวจสอบซอร์สโค้ดแบบ white-box ทำคะแนนได้ 84.5% แซงหน้าทั้ง Mythos 5 (83.8%) และ GPT-5.6 Sol (83.6%) ส่วนในด้าน ExploitBench ที่ต้องใช้การวิเคราะห์หาสาเหตุรากเหง้า (root-cause reasoning) คะแนนพุ่งจาก 24.4% เป็น 54.4% แม้จะยังตามหลัง Mythos 5 ที่ทำได้ 78.0% แต่ก็แสดงถึงพัฒนาการที่สำคัญ
จากการทดสอบบน ExploitGym พบว่า GLM-5.3 สามารถทำภารกิจสำเร็จได้ 105 งานภายใน 2 ชั่วโมง และเพิ่มเป็น 130 งานใน 6 ชั่วโมง ซึ่งถือว่าก้าวกระโดดจากรุ่นเดิมที่ทำได้เพียง 29 และ 39 งานตามลำดับ รูปแบบของผลลัพธ์นี้ชี้ให้เห็นว่า ยิ่งงานมีความซับซ้อนในเชิงลึกมากเท่าไหร่ ประสิทธิภาพที่เหนือกว่า GLM-5.2 ก็จะยิ่งเด่นชัดมากขึ้นเท่านั้น
ประเด็นสำคัญ
- GLM-5.3 ยังคงใช้ base model ตัวเดิมของ GLM-5.2 โดยพัฒนาขีดความสามารถผ่าน post-training เท่านั้น
- คะแนนการเขียนโค้ด Terminal-Bench 3.0 ก้าวกระโดดจาก 4.6 เป็น 28.3
- ผลงานด้านความปลอดภัยไซเบอร์โดดเด่น โดย CyberGym แตะ 84.5% แซงหน้าคู่แข่งระดับเรือธงบางรุ่น
- ExploitBench เพิ่มประสิทธิภาพขึ้นกว่าเท่าตัว แตะระดับ 54.4%
- Weights ของโมเดลมีกำหนดปล่อยให้ใช้งานในอีกประมาณสองสัปดาห์หลังกระบวนการตรวจสอบความปลอดภัยสิ้นสุด
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
