Pokee AI เปิดตัว Pokee-Isaac 28B โมเดล Agentic รองรับ Context 10 ล้านโทเคน เน้นความปลอดภัยระดับองค์กร

Pokee AI เปิดตัว Pokee-Isaac 28B โมเดล Agentic รองรับ Context 10 ล้านโทเคน เน้นความปลอดภัยระดับองค์กร

ในโลกของ Agent แบบ Long-horizon ข้อมูลจากการทำงาน เช่น การใช้เครื่องมือ การสังเกตการณ์ และการให้เหตุผลระดับกลาง มักสะสมอยู่ใน Context Window เร็วกว่าที่งานจะเสร็จสิ้น ความสามารถในการรักษาบริบทและความสอดคล้องของเนื้อหาตลอดทั้ง Window จึงเป็นสิ่งสำคัญยิ่ง ทว่าที่ผ่านมาความสามารถนี้มักจำกัดอยู่เพียงบริการบนคลาวด์ ซึ่งไม่ตอบโจทย์อุตสาหกรรมที่ถูกควบคุม สถาบันภาครัฐ หรือแอปพลิเคชันบนอุปกรณ์ที่ไม่ได้รับอนุญาตให้ส่งข้อมูลออกนอกขอบเขตความปลอดภัย เพื่อแก้ปัญหานี้ Pokee AI จึงเปิดตัว Pokee-Isaac 28B โมเดลพื้นฐานแบบ text-only ขนาด 28B ที่มาพร้อม Context Window มหาศาลถึง 10 ล้านโทเคน (10M-token) โดยออกแบบมาให้รันภายในขอบเขตความปลอดภัยของลูกค้า (customer boundary) โดยเฉพาะ ทีมวิจัยระบุว่าโมเดลทำคะแนนได้สูงถึง 93.3% บน RULER ที่ 10M tokens ซึ่งเทียบเท่ากับโมเดลบนคลาวด์ที่แข็งแกร่งที่สุด แต่ประหยัดทรัพยากรจนสามารถรันได้บน GPU เพียงตัวเดียว

Is it deployable

ใช่ — แต่เป็นการให้สิทธิ์การใช้งาน (licensed) ไม่ใช่ open-weight โดย Pokee AI ให้บริการ Isaac ผ่าน developer API ที่รองรับมาตรฐาน OpenAI รวมถึงให้สิทธิ์การใช้งานเพื่อติดตั้งภายใน VPC, on-premises หรือบนอุปกรณ์โดยตรง โมเดลนี้รองรับการใช้งานร่วมกับ vLLM และ SGLang ตั้งแต่วันแรก และสามารถรันบน GPU ตัวเดียวเริ่มต้นตั้งแต่ RTX 4090 เป็นต้นไป แม้ผลทดสอบทางการจะเน้นไปที่ B200 แต่ทางผู้ผลิตยืนยันว่าสามารถใช้งานบน Consumer GPU ได้เช่นกัน

สำหรับกลุ่มลูกค้าระดับองค์กร Isaac เหมาะอย่างยิ่งสำหรับทีมที่มีโครงสร้างพื้นฐานด้าน Inference เป็นของตนเอง เช่น องค์กรขนาดใหญ่หรือผู้ผลิตอุปกรณ์ (OEMs) โดยเฉพาะในอุตสาหกรรมที่มีกฎระเบียบเคร่งครัดอย่างการแพทย์ ประกันภัย การเงิน ภาครัฐ และกฎหมาย ซึ่งข้อมูลต้องไม่ถูกส่งออกไปยัง API ภายนอกเด็ดขาด การมีบริบทที่กว้างขวางช่วยให้สามารถตรวจสอบโค้ดทั้งคลัง (repository) หรือวิเคราะห์เอกสารย้อนหลังหลายปีได้โดยไม่ต้องพึ่งพาการบีบอัดข้อมูลหรือการสรุปย่อที่อาจทำให้ข้อมูลตกหล่น

Long-context results

ในการทดสอบบน RULER Isaac สามารถรักษาคะแนนความแม่นยำได้สูงกว่า 93.3% ตลอดทุกระดับความยาวจนถึง 10M tokens ในขณะที่คู่แข่งอย่าง GPT-5.6 Luna และ Gemini 3.5 Flash Lite เริ่มมีปัญหา context-overflow ตั้งแต่ช่วง 1M tokens เป็นต้นไป

นอกจากนี้ ผลการทดสอบบน MRCR v2 ซึ่งใช้เทคนิค 8 needles พบว่า Isaac ทำคะแนนได้ 0.607, 0.743 และ 0.500 ที่ระดับ 256K, 512K และ 1M ตามลำดับ โดยแสดงให้เห็นว่ายิ่งบริบทกว้างขึ้น ส่วนต่างของประสิทธิภาพเมื่อเทียบกับ Gemini ก็ยิ่งทิ้งห่างมากขึ้นอย่างชัดเจน

Agentic and security results

Isaac พิสูจน์ความเป็นผู้นำในด้าน Agent โดยทำคะแนนสูงสุดบน BFCL v4 ที่ 70.94 คะแนน เฉือนเอาชนะ Luna ที่ได้ 70.61 ส่วนในด้านการทำงานจริงบน τ³-bench Isaac ทำคะแนนเฉลี่ยได้ 0.662 นำหน้า Gemini ที่ได้ 0.631 โดยเฉพาะในโดเมนธนาคารที่ขึ้นชื่อว่ามีความยากสูง

สำหรับการทดสอบ MCP-Atlas แม้ Isaac จะอยู่อันดับสามด้านการครอบคลุมที่ 74.59% แต่กลับมีความโดดเด่นในด้านความกระชับ โดยใช้เพียง 9.10 รอบต่อหนึ่งงาน เทียบกับ Gemini ที่ต้องใช้ถึง 14.99 รอบ ส่วนในด้านความปลอดภัยจากการโจมตีบน DTAP Isaac มีอัตราความสำเร็จในการโจมตี (Attack Success Rate) ต่ำที่สุดทั้งในแบบทางตรงและทางอ้อม ในขณะที่ยังคงประสิทธิภาพการทำงานปกติ (Benign Success) ได้สูงถึง 82.5%

Efficiency, pricing, and portability

ในด้านประสิทธิภาพบน GPU B200 หนึ่งตัว พบว่าค่า TTFT (Time to First Token) อยู่ที่ 23.6 วินาทีที่ 1M และเพิ่มเป็น 72.9 วินาทีที่ 10M โดยความเร็วในการ Prefill จะเพิ่มขึ้นตามปริมาณ Context ตั้งแต่ 42,400 ถึง 137,200 tokens/s ทำให้แม้ข้อมูลจะเพิ่มขึ้นสิบเท่า แต่เวลาที่รอโทเคนแรกกลับเพิ่มขึ้นเพียงสามเท่าเท่านั้น

ราคาแนะนำเบื้องต้นถูกตั้งไว้ที่ $0.15 ต่อล้านโทเคนฝั่ง Input และ $1.00 สำหรับ Output นอกจากนี้ Isaac ยังมีความยืดหยุ่นสูง โดยสามารถรันบนอุปกรณ์พกพาได้หลากหลาย ไม่ว่าจะเป็น Intel Arc Pro B70, Core Ultra Series 3 (Panther Lake) หรือแม้แต่ชิปเซ็ต Qualcomm Snapdragon X2 Elite

Key Takeaways

  • Pokee-Isaac 28B ทำคะแนนได้ 93.3% บน RULER ที่ 10M tokens ในขณะที่โมเดลอื่นทำคะแนนได้เกือบศูนย์เมื่อเกินระดับ 2M
  • ความเร็ว Prefill สูงสุดถึง 137,200 tokens/s บน B200 ตัวเดียว โดยมีอัตรา Decode คงที่ประมาณ 335 tokens/s
  • เป็นผู้นำในด้าน Agentic Benchmarks ทั้ง BFCL v4 และ τ³-bench รวมถึงมีผลทดสอบด้านความปลอดภัยที่แข็งแกร่ง
  • เน้นความเป็นส่วนตัวโดยรันภายในขอบเขตของลูกค้า (VPC/On-prem) โดยใช้รูปแบบการอนุญาตสิทธิ์การใช้งาน (Licensed) แทนการเปิด Weights สู่สาธารณะ

**Check out the Blog **และ

Source: MarkTechPost
ดูแลงานแปลและเรียบเรียงโดย SirilukP

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร