Holo4: เอเจนต์ AI ทรงพลัง รองรับทุกอินเทอร์เฟซในหนึ่งเดียว

· By: AttapolK

Floor of screens from Holo4 benchmark runs across web apps, desktop software and mobile.

Holo4 คือซีรีส์ใหม่ของโมเดลเชิงเอเจนต์ (agentic models) จากเรา โดยมีให้เลือกสองขนาด ได้แก่ 27B แบบ dense และ 35B-A3B แบบ Mixture of Experts ซึ่งทั้งคู่พร้อมใช้งานแล้วบน H Models API นอกจากนี้ เรายังได้อัปเดตเวอร์ชันใหม่ของ Holotron 3 ในชื่อ Holotron4 Nano อีกด้วย

โมเดล Holo4 พัฒนาต่อยอดจากรุ่นก่อนหน้าเพื่อให้สามารถโต้ตอบกับซอฟต์แวร์ผ่านอินเทอร์เฟซใดก็ได้ ไม่ว่าจะเป็น GUI, code, MCP หรือ API แม้จะทำคะแนนได้ดีในการทดสอบทางวิชาการ แต่เป้าหมายหลักของเราคือการใช้งานในเวิร์กโฟลว์ธุรกิจจริง โดยผ่านการฝึกฝนด้วยวิธี Supervised Learning และ Reinforcement Learning บนสภาพแวดล้อมที่หลากหลายจาก Agentic Task Factory ของเรา

เริ่มต้นใช้งานได้เลย:

โมเดลที่สร้างขึ้นเพื่อทุกอินเทอร์เฟซ

Holo4 มีความสามารถรอบด้าน ทั้งการคลิกและพิมพ์บนหน้าจอ เขียนและรันโค้ดเอง ไปจนถึงการเรียกใช้เครื่องมือ MCP หรือ API โดยจะเลือกวิธีที่เหมาะสมที่สุดกับงานนั้นๆ ต่างจากโมเดลเอเจนต์ส่วนใหญ่ที่มักถูกฝึกมาเพื่ออินเทอร์เฟซเดียว เช่น โมเดล GUI ที่ทำงานไม่ได้หากไม่มีหน้าจอ หรือโมเดล Tool Calling ที่ไปไม่เป็นเมื่อเจอแอปพลิเคชันที่ไม่มี API

ในโลกการทำงานจริง งานหนึ่งอย่างอาจต้องใช้หลายวิธีผสมผสานกัน Holo4 จึงถูกออกแบบมาให้ทำงานได้ทั้งบนเดสก์ท็อป เว็บ Android ใน code sandbox และเชื่อมต่อกับ API ธุรกิจได้ทันที โดยเป็นโมเดลชุดเดียวกันที่เรียกใช้งานได้ในรูปแบบเดียว ช่วยให้คุณไม่ต้องเปลี่ยนโมเดลไปมาตามแพลตฟอร์ม

Holo4 benchmark results with cost per task, against Qwen3.8 27B and frontier models

Holo4 พัฒนาขึ้นอย่างก้าวกระโดดจากฐานเดิมอย่าง Qwen โดยทำคะแนนตามหลังเพียงโมเดลแบบปิด (closed models) ระดับท็อปในเวิร์กโฟลว์ระยะยาวเท่านั้น ในการทดสอบ OSWorld 2.0 รุ่น Holo4 27B ทำได้ 61.7% (เทียบกับ Opus 5.5 ที่ 81.8%) และรุ่น 35B-A3B ทำได้ 30.9%

จุดเด่นสำคัญคือ Holo4 ใช้จำนวนพารามิเตอร์น้อยกว่าและมีค่าใช้จ่ายต่ำกว่ามาก เราได้เปิดเผยทุกขั้นตอน (trajectory) เบื้องหลังคะแนนการทดสอบให้ทุกคนตรวจสอบหรือดาวน์โหลดไปศึกษาต่อได้ที่ trajectories.hcompany.ai และ Hugging Face

แข่งขันกับโมเดลระดับแนวหน้า ในราคาเพียงเศษเสี้ยว

จากการทดสอบทางวิชาการที่หินที่สุด ทั้งด้านการควบคุมเดสก์ท็อป (OSWorld 2.0) และการใช้ API (AutomationBench) พบว่า Holo4 สามารถต่อกรกับโมเดลระดับแนวหน้า (frontier models) ได้อย่างสูสี โดยมีต้นทุนต่อการทำงานหนึ่งครั้งที่ต่ำกว่ามาก

OSWorld 2.0: average partial score vs. cost per task

AutomationBench: score vs. cost per task

หมายเหตุเกี่ยวกับแผนภูมิราคาและประสิทธิภาพ

OSWorld 2.0: คำนวณต้นทุนจากจำนวน Token เข้า-ออกของแต่ละการรัน โดย Holo4 อ้างอิงราคาจาก H Models API ส่วน Qwen อ้างอิงราคาจาก Alibaba Cloud สำหรับโมเดลแบบปิดอื่นๆ ใช้ข้อมูลจาก official OSWorld 2.0 leaderboard

AutomationBench: วัดคะแนนและต้นทุนผ่าน internal harness ของเราสำหรับโมเดลตระกูล Holo4 และ Qwen ส่วนโมเดลอื่นๆ อ้างอิงจาก AutomationBench README และ official leaderboard ของ Zapier

AI ที่ทำงานได้จริง

ด้วยการฝึกฝนผ่าน Agentic Task Factory ทำให้ Holo4 โดดเด่นในการใช้งานซอฟต์แวร์ระดับมืออาชีพ ตัวอย่างด้านล่างเปรียบเทียบ Holo4 27B กับ Qwen3.8 27B ซึ่งเป็นโมเดลฐาน โดยใช้คำสั่งและระบบควบคุมเดียวกัน

3D modeling · หอไอเฟล

คำสั่ง: สร้างโมเดล 3 มิติของหอไอเฟลใน FreeCAD มาตราส่วน 1 มม. ต่อ 1 เมตร โดยต้องมีขาสี่ข้างที่โปร่งตา แพลตฟอร์มสามชั้น และเสากระโดงยอดแหลมตามสเปกที่กำหนด

Holo4 27B (เรียกใช้งาน 84 ครั้ง, 1.3 ล้าน token) Holo4: เอเจนต์ AI ทรงพลัง รองรับทุกอินเทอร์เฟซในหนึ่งเดียว

Qwen3.8 27B (เรียกใช้งาน 60 ครั้ง, 1.0 ล้าน token) Holo4: เอเจนต์ AI ทรงพลัง รองรับทุกอินเทอร์เฟซในหนึ่งเดียว

Game design · Pac-Man

คำสั่ง: สร้างเกมสไตล์ Pac-Man ใน Godot ให้มีระบบผีไล่ล่า เม็ดอาหาร และแสดงคะแนนบนหน้าจอ โดยตัวผู้เล่นต้องเคลื่อนที่อัตโนมัติด้วยหลัก heuristic เพื่อกินเม็ดอาหารและหลบหลีกผี

Holo4 27B (เรียกใช้งาน 68 ครั้ง, 2.4 ล้าน token, 268 บรรทัด) Holo4: เอเจนต์ AI ทรงพลัง รองรับทุกอินเทอร์เฟซในหนึ่งเดียว

Qwen3.8 27B (เรียกใช้งาน 197 ครั้ง, 11.4 ล้าน token, 327 บรรทัด) Holo4: เอเจนต์ AI ทรงพลัง รองรับทุกอินเทอร์เฟซในหนึ่งเดียว

กระบวนการสร้าง Holo4

Agentic Task Factory

เราสร้างไปป์ไลน์ภายในเพื่อเนรมิตสภาพแวดล้อมและงานทดสอบจากเอกสารประกอบ เช่น ภาพหน้าจอเว็บไซต์หรือซอฟต์แวร์โอเพนซอร์ส ปัจจุบันสร้างงานไปแล้วกว่า 10,000 งาน ครอบคลุมทั้งเว็บ, MCP และเดสก์ท็อป

Holo4: เอเจนต์ AI ทรงพลัง รองรับทุกอินเทอร์เฟซในหนึ่งเดียว

การฝึกฝนและการจัดการบริบท

นอกจากการฝึกฝนด้วยข้อมูลจำนวนมหาศาลแล้ว เรายังสร้าง harness ใหม่ที่ช่วยจัดการบริบท (context) ได้นับร้อยขั้นตอน ทำให้เอเจนต์มีความจำที่เชื่อถือได้และสามารถควบคุมระบบปฏิบัติการเดสก์ท็อปได้โดยตรง

Holo4: เอเจนต์ AI ทรงพลัง รองรับทุกอินเทอร์เฟซในหนึ่งเดียว

Agentic Task Factory: sources, build, gates, runtime and output

Holotron4 Nano

เรานำเทคโนโลยีเดียวกันนี้ไปปรับใช้กับโมเดล Nemotron 3 Nano Omni ภายใต้ความร่วมมือ NVIDIA Nemotron Coalition จนเกิดเป็น Holotron4 Nano ซึ่งเป็นเอเจนต์ขนาดเล็กที่มีประสิทธิภาพสูงกว่าโมเดลฐานอย่างชัดเจนในงานด้าน GUI และ API

Holo4 training: supervised fine-tuning on 127B tokens, two RL experts, one merged model

เริ่มต้นใช้งาน

โมเดล Holo4 ทุกขนาดเปิดให้ใช้งานแล้วบน H Models API และสามารถดาวน์โหลดน้ำหนักโมเดลได้ที่ Hugging Face ในหลายฟอร์แมต รวมถึง 4-bit GGUF และเรากำลังจะปล่อย DSpark drafter checkpoints เพื่อเร่งความเร็วในการประมวลผลเร็วๆ นี้

Source: Hugging Face Blog
ดูแลงานแปลและเรียบเรียงโดย AttapolK
Automatic harness engineering: OSWorld 2.0 score of every evaluation run over timeHolotron4 Nano vs. Nemotron 3 Nano Omni across five benchmarks

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร