Microsoft เปิดซอร์ส TauGrid ตัวช่วยประมวลผล GPU AI บน Kubernetes

· By: NatapolK

Microsoft เปิดซอร์ส TauGrid ตัวช่วยประมวลผล GPU AI บน Kubernetes

ทีมแพลตฟอร์มที่รัน AI บน Kubernetes มักประสบปัญหาความยุ่งยากในการจัดการระบบคิว, distributed runtime, การตรวจสอบความสมบูรณ์ของโหนด GPU และระบบสังเกตการณ์ ล่าสุดทีมวิศวกรรม Azure Kubernetes Service (AKS) จึงได้ open-sourced TauGrid เพื่อยุบรวมงานประกอบที่ซับซ้อนเหล่านั้นให้เหลือเพียงการติดตั้งผ่าน Helm ครั้งเดียว

TauGrid เปิดให้ใช้งานภายใต้สัญญาอนุญาตแบบ MIT โดยมีคอนเทนเนอร์อิมเมจและ Helm charts เผยแพร่เป็น OCI artifacts สาธารณะบน Microsoft Container Registry สำหรับข้อกำหนดเบื้องต้นในการใช้งานคือต้องมีคลัสเตอร์ Kubernetes เวอร์ชัน 1.30 ขึ้นไป พร้อมโหนด GPU, kubectl และ Helm 3.0 หรือใหม่กว่า

TauGrid คืออะไร

TauGrid คือแพลตฟอร์มแบบ self-hosted สำหรับรันเวิร์กโหลด AI บน Kubernetes ที่รวม 5 องค์ประกอบสำคัญเข้าด้วยกัน ได้แก่ tau CLI, ระบบคิวเวิร์กโหลดผ่าน Kueue, การจัดการคลัสเตอร์ Ray ผ่าน KubeRay, ระบบตรวจสอบความสมบูรณ์ของ GPU ระดับโหนด และการสังเกตการณ์เวิร์กโหลด

หัวใจสำคัญของการออกแบบคือการแบ่งความรับผิดชอบอย่างชัดเจน โดยทีมแพลตฟอร์มจะดูแลเรื่องโครงสร้างพื้นฐานอย่างคิวและพื้นที่เก็บข้อมูล ส่วนนักวิจัยสามารถส่งเวิร์กโหลดผ่าน CLI ได้ทันทีโดยไม่ต้องตั้งค่า Kubernetes ด้วยตัวเอง ซึ่งตัวฐานรหัสพัฒนาด้วยภาษา Go เป็นหลัก

กระบวนการทำงานของระบบ

เวิร์กโหลดจะถูกกำหนดค่าผ่านไฟล์ tau.yaml โดย Microsoft ได้เผยแพร่ตัวอย่างการเทรน GPU สำหรับการรันงาน PyTorch บน A100 ตัวเดียวดังนี้:

schema_version: 1
name: aks-gpu-quickstart
run:
  entrypoint: train.py
  workload_kind: rayjob
  compute:
    gpus: 1
    workers: 1
    cpus: 16
    memory: 64Gi
  runtime:
    image: mcr.microsoft.com/aks/ai-runtime/ray:py3.12-ray2.56.0-cuda13.0
    pip:
      - torch>=2.4.0

เมื่อใช้คำสั่ง tau run ระบบจะตรวจสอบนโยบาย แปลงไฟล์เป็น Kubernetes Job หรือ KubeRay RayJob และส่งผ่าน Kueue โดยมีกระบวนการ 6 ขั้นตอน ได้แก่ การส่งงาน, เข้าคิว, ประมวลผล, ตรวจสอบ, กู้คืน และบันทึกหลักฐาน ซึ่งการกู้คืนจะครอบคลุมถึงการลองใหม่และรันต่อจาก checkpoint ส่วนบันทึกหลักฐานจะเก็บข้อมูลเมตาและล็อกทั้งหมดเพื่อให้สามารถรันซ้ำและตรวจสอบย้อนหลังได้

ในกรณีที่มีหลายทีมใช้คลัสเตอร์ร่วมกัน งานทั้งหมดจะถูกส่งไปยัง Kueue ClusterQueue เพื่อจัดลำดับความสำคัญตามโควตา จากนั้น Kubernetes จะจัดวางงานลงบน GPU ที่มีความสมบูรณ์ที่สุดโดยอัตโนมัติ

รูปแบบการติดตั้ง

ผู้ใช้งานสามารถติดตั้งผ่าน Helm chart จาก MCR ได้โดยตรง:

helm install taugrid \
oci://mcr.microsoft.com/aks/ai-runtime/helm/taugrid \
--version 0.4.2 \
--namespace tau-system \
--create-namespace

สำหรับอิมเมจหลักอย่าง Tau, TauGrid Portal และ core controller จะอยู่ภายใต้ mcr.microsoft.com/aks/ai-runtime/ โดยแนะนำให้ระบุเวอร์ชันแบบเจาะจงแทนการใช้ latest ส่วนตัว CLI รองรับทั้ง Linux, macOS และ Windows ผ่านตัวติดตั้งที่ตรวจสอบค่า checksum เพื่อความปลอดภัย

สิ่งที่ควรทราบคือ TauGrid จะไม่ส่งข้อมูล telemetry กลับไปยัง Microsoft โดยค่าเริ่มต้น เว้นแต่ผู้ดูแลระบบจะตั้งค่าเอง อย่างไรก็ตาม การสังเกตการณ์บางส่วนยังคงเชื่อมโยงกับ Azure Data Explorer แต่ Microsoft มีเป้าหมายที่จะรองรับ Kubernetes ทั้งในรูปแบบ Cloud และ On-premises อย่างสมบูรณ์ในอนาคต

ประเด็นสำคัญ

  • Microsoft เปิดซอร์ส TauGrid ภายใต้สัญญาอนุญาต MIT ผ่าน Azure/taugrid เมื่อวันที่ 28 สิงหาคม 2026
  • รวม tau CLI, Kueue, KubeRay และระบบตรวจสอบ GPU ไว้ในจุดเดียว
  • รองรับ Kubernetes 1.30+ พร้อม GPU และ Helm 3.0+
  • มีระบบบันทึกหลักฐาน (Evidence) เพื่อให้การรันเวิร์กโหลดทำซ้ำและตรวจสอบได้
  • ไม่มี telemetry โดยค่าเริ่มต้น แต่ฟีเจอร์สังเกตการณ์ขั้นสูงบางส่วนยังต้องพึ่งพา Azure Data Explorer
Source: MarkTechPost
ดูแลงานแปลและเรียบเรียงโดย NatapolK

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร