วิธีรัน Mythos โมเดล AI สายโค้ดสุดแรงบนเครื่องด้วย llama.cpp และ Pi

· By: SirilukP

Run the Mythos Enhanced Coding Model Locally with llama.cpp and Pi

บทนำ

Qwythos-9B-Claude-Mythos-5-1M คือโมเดล AI ด้านการใช้เหตุผลและเขียนโค้ดขนาด 9B ที่พัฒนาต่อยอดมาจาก Qwen3.5 โดยถูกออกแบบมาเพื่อ Workflow การเขียนโค้ดภายในเครื่อง (Local) การทำงานแบบ AI Agent และรองรับ Context ที่ยาวเป็นพิเศษ จุดเด่นสำคัญคือขนาดที่เล็กพอจะรันบนฮาร์ดแวร์ทั่วไปได้ แต่ยังคงประสิทธิภาพในการช่วยงานเขียนโค้ดที่ใช้งานได้จริง

ในคู่มือนี้ ผมจะสาธิตวิธีรันโมเดล Qwythos เวอร์ชั่นเสริมพลังด้วย Mythos บนเครื่องโดยใช้ llama.cpp แล้วเชื่อมต่อกับ Pi เพื่อใช้งานในฐานะ Local Coding Agent โดยผมใช้ RTX 4070 Ti Super (VRAM 16GB) ซึ่งรัน Quantization แบบ Q6_K MTP ได้ลื่นไหล แต่สำหรับใครที่มี GPU 8GB แนะนำให้เริ่มด้วยรุ่น Q4_K_M เพื่อความสมดุลระหว่างคุณภาพและความเร็ว

การติดตั้ง llama.cpp

เริ่มด้วยการติดตั้ง llama.cpp command-line interface (CLI) อย่างเป็นทางการ เพื่อให้สามารถใช้งานคำสั่ง llama และ llama serve สำหรับรันโมเดลได้

curl -LsSf https://llama.app/install.sh | sh

Run the Mythos Enhanced Coding Model Locally with llama.cpp and Pi

จากนั้นให้เพิ่มไดเรกทอรีการติดตั้งลงใน shell path เพื่อให้ Terminal ค้นหาคำสั่งเจอ:

echo 'export PATH="$HOME/.local/bin:$PATH"' >> ~/.bashrc
source ~/.bashrc

ตรวจสอบความถูกต้องของการติดตั้งด้วยคำสั่ง:

llama help

หากติดตั้งสำเร็จ คุณจะเห็นรายการคำสั่งและตัวเลือกต่างๆ ของ llama.cpp ปรากฏขึ้นมา

Run the Mythos Enhanced Coding Model Locally with llama.cpp and Pi

การตั้งค่า Hugging Face Cache Directory

การกำหนดค่า Cache ของ Hugging Face ไว้ในจุดที่มีพื้นที่ว่างเพียงพอเป็นสิ่งสำคัญ โดยเฉพาะบนเครื่อง Cloud ที่ไดเรกทอรี Home มักมีพื้นที่จำกัด

export HF_HOME="/workspace/huggingface"
mkdir -p "$HF_HOME"
``` เพื่อให้ตั้งค่านี้นำไปใช้โดยอัตโนมัติในทุกครั้งที่เปิด Terminal ให้เพิ่มคำสั่งลงใน shell configuration:
 
```bash
echo 'export HF_HOME="/workspace/huggingface"' >> ~/.bashrc
source ~/.bashrc

เริ่มต้นรันโมเดล Qwythos MTP

ใช้คำสั่งเรียกใช้งานโมเดล Q6_K MTP GGUF โดยดึงขุมพลังจาก GPU ทั้งหมดที่มี:

llama serve \
  -hf "empero-ai/Qwythos-9B-Claude-Mythos-5-1M-GGUF:MTP-Q6_K" \
  --alias "qwythos-9b-mtp" \
  --host 0.0.0.0 \
  --port 8910 \
  --n-gpu-layers all \
  --ctx-size 100000 \
  --parallel 1 \
  --batch-size 1024 \
  --ubatch-size 512 \
  --flash-attn on \
  --cache-type-k q8_0 \
  --cache-type-v q8_0 \
  --spec-type draft-mtp \
  --spec-draft-n-max 6 \
  --threads 12 \
  --threads-batch 24 \
  --temp 0.6 \
  --top-p 0.95 \
  --top-k 20 \
  --repeat-penalty 1.05 \
  --jinja \
  --perf

ในการรันครั้งแรก llama.cpp จะดาวน์โหลดไฟล์โมเดลจาก Hugging Face โดยอัตโนมัติ Run the Mythos Enhanced Coding Model Locally with llama.cpp and Pi จากนั้นจะโหลดข้อมูลเข้าสู่หน่วยความจำ GPU และเริ่มทำงานในรูปแบบ Local Server Run the Mythos Enhanced Coding Model Locally with llama.cpp and Pi

เมื่อระบบพร้อม คุณสามารถเปิด Interface ผ่าน Browser ได้ที่ http://localhost:8910 และใช้งาน API ที่รองรับมาตรฐาน OpenAI ได้ทาง http://localhost:8910/v1 ท่านที่พบปัญหา VRAM เต็ม แนะนำให้ลดค่า --ctx-size หรือเปลี่ยนไปใช้รุ่น Q4_K_M แทน

คำอธิบาย Flag ที่สำคัญ:

FlagPurpose
--n-gpu-layers allย้ายเลเยอร์ทั้งหมดไปทำงานบน GPU
--ctx-size 100000จองพื้นที่ Context Window 100,000 token
--flash-attn onเปิดใช้งาน Flash Attention เพิ่มสปีด
--cache-type-k q8_0 และ --cache-type-v q8_0ลดการใช้หน่วยความจำ KV-cache โดยไม่เสียคุณภาพ
--spec-type draft-mtpเปิดใช้งาน MTP speculative decoding
--spec-draft-n-max 6กำหนดค่าทำนายล่วงหน้าสูงสุด 6 token ต่อขั้นตอน
--jinjaใช้ Chat Template ของโมเดลโดยเฉพาะ
--perfแสดงสถิติประสิทธิภาพการประมวลผล

จากการทดสอบบน RTX 4070 Ti Super ผมได้ความเร็วถึง 81.74 tokens ต่อวินาที ซึ่งตัวโมเดลสามารถคิดวิเคราะห์ เรียกใช้เครื่องมือ และส่งข้อมูลจริงกลับมาได้อย่างถูกต้องแม่นยำ Run the Mythos Enhanced Coding Model Locally with llama.cpp and Pi

การติดตั้ง Pi และการเชื่อมต่อกับ llama.cpp

Pi สามารถเชื่อมต่อกับ Local Server ของ llama.cpp เพื่อใช้งานเป็น Coding Agent ได้ผ่านปลั๊กอิน pi-llama ซึ่งถูกออกแบบมาให้ทำงานร่วมกันได้โดยไม่ต้องใช้ API Key จากภายนอก

เริ่มจากการติดตั้ง Pi:

curl -fsSL https://pi.dev/install.sh | sh

Run the Mythos Enhanced Coding Model Locally with llama.cpp and Pi

จากนั้นติดตั้งปลั๊กอิน llama.cpp สำหรับ Pi:

pi install git:github.com/huggingface/pi-llama

สร้างโปรเจกต์สำหรับทดสอบ:

mkdir new-project
cd new-project
``` เนื่องจากปลั๊กอินจะมองหาพอร์ต 8080 เป็นหลัก แต่เราใช้งานที่พอร์ต 8910 จึงต้องตั้งค่าที่อยู่ API ก่อนเริ่ม Pi:
 
```bash
export LLAMA_BASE_URL="http://127.0.0.1:8910/v1"
pi

ใช้งานคำสั่ง /model ภายใน Pi แล้วเลือก qwythos-9b-mtp เพื่อเริ่มใช้งานโมเดลในฐานะ local agent Run the Mythos Enhanced Coding Model Locally with llama.cpp and Pi

ทดสอบโมเดลเขียนโค้ดในสถานการณ์จริง

ผมได้ทดสอบด้วยงาน 2 รูปแบบ คือการสร้างเกมบน Browser และเครื่องมือ Python CLI

สร้างเกมบน Browser

ผมส่ง Prompt ให้ Pi สร้างเกม "Beat the AI" โดยใช้ HTML, CSS และ JavaScript ล้วน ผลลัพธ์ที่ได้คือโค้ดไฟล์เดียวที่ครบถ้วน ทั้งระบบนับถอยหลัง การสุ่มคำถาม และระบบนับคะแนนที่ทำงานได้สมบูรณ์แบบบน Browser ทันที Run the Mythos Enhanced Coding Model Locally with llama.cpp and Pi ตัวเกมมีการขัดเกลามาอย่างดี มี Progress bar และปุ่มเริ่มใหม่ พร้อมใช้งาน Run the Mythos Enhanced Coding Model Locally with llama.cpp and Pi

สร้างเครื่องมือแปลง CSV เป็น Excel ด้วย Python

การทดสอบที่สองคือการสร้างโปรแกรม CLI สำหรับแปลงไฟล์ CSV เป็น .xlsx ซึ่งโปรแกรมที่โมเดลสร้างขึ้นสามารถรักษา Header ได้ถูกต้อง มีการจัดการข้อผิดพลาด (Error Handling) และทำงานร่วมกับข้อมูลตัวอย่างได้อย่างราบรื่น Run the Mythos Enhanced Coding Model Locally with llama.cpp and Pi

สรุปส่งท้าย

ผมประทับใจความสามารถของโมเดลขนาดเล็กตัวนี้มาก เพราะมันทำงานได้รวดเร็ว แม่นยำ และกินทรัพยากรน้อย เหมาะสำหรับการสร้างโปรเจกต์ Prototype หรือเครื่องมือใช้สอยทั่วไปในเครื่องโดยไม่ต้องพึ่งพา API เสียเงิน

หากต้องการประสิทธิภาพที่สูงขึ้น แนะนำให้ผนวกการใช้งานเข้ากับระแบบค้นหาเว็บหรือปลั๊กอินอย่าง Context7 ของ Pi และคุณสามารถศึกษาคู่มือการปรับแต่งเพิ่มเติมได้ที่บทความ How to Set Up Kimi K2.7 Code with Pi: The Ultimate AI Coding Environment

Source: KDnuggets
ดูแลงานแปลและเรียบเรียงโดย SirilukP
Run the Mythos Enhanced Coding Model Locally with llama.cpp and PiRun the Mythos Enhanced Coding Model Locally with llama.cpp and PiRun the Mythos Enhanced Coding Model Locally with llama.cpp and Pi

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร