วิธีรัน Mythos โมเดล AI สายโค้ดสุดแรงบนเครื่องด้วย llama.cpp และ Pi

บทนำ
Qwythos-9B-Claude-Mythos-5-1M คือโมเดล AI ด้านการใช้เหตุผลและเขียนโค้ดขนาด 9B ที่พัฒนาต่อยอดมาจาก Qwen3.5 โดยถูกออกแบบมาเพื่อ Workflow การเขียนโค้ดภายในเครื่อง (Local) การทำงานแบบ AI Agent และรองรับ Context ที่ยาวเป็นพิเศษ จุดเด่นสำคัญคือขนาดที่เล็กพอจะรันบนฮาร์ดแวร์ทั่วไปได้ แต่ยังคงประสิทธิภาพในการช่วยงานเขียนโค้ดที่ใช้งานได้จริง
ในคู่มือนี้ ผมจะสาธิตวิธีรันโมเดล Qwythos เวอร์ชั่นเสริมพลังด้วย Mythos บนเครื่องโดยใช้ llama.cpp แล้วเชื่อมต่อกับ Pi เพื่อใช้งานในฐานะ Local Coding Agent โดยผมใช้ RTX 4070 Ti Super (VRAM 16GB) ซึ่งรัน Quantization แบบ Q6_K MTP ได้ลื่นไหล แต่สำหรับใครที่มี GPU 8GB แนะนำให้เริ่มด้วยรุ่น Q4_K_M เพื่อความสมดุลระหว่างคุณภาพและความเร็ว
การติดตั้ง llama.cpp
เริ่มด้วยการติดตั้ง llama.cpp command-line interface (CLI) อย่างเป็นทางการ เพื่อให้สามารถใช้งานคำสั่ง llama และ llama serve สำหรับรันโมเดลได้
curl -LsSf https://llama.app/install.sh | sh
จากนั้นให้เพิ่มไดเรกทอรีการติดตั้งลงใน shell path เพื่อให้ Terminal ค้นหาคำสั่งเจอ:
echo 'export PATH="$HOME/.local/bin:$PATH"' >> ~/.bashrc
source ~/.bashrcตรวจสอบความถูกต้องของการติดตั้งด้วยคำสั่ง:
llama helpหากติดตั้งสำเร็จ คุณจะเห็นรายการคำสั่งและตัวเลือกต่างๆ ของ llama.cpp ปรากฏขึ้นมา

การตั้งค่า Hugging Face Cache Directory
การกำหนดค่า Cache ของ Hugging Face ไว้ในจุดที่มีพื้นที่ว่างเพียงพอเป็นสิ่งสำคัญ โดยเฉพาะบนเครื่อง Cloud ที่ไดเรกทอรี Home มักมีพื้นที่จำกัด
export HF_HOME="/workspace/huggingface"
mkdir -p "$HF_HOME"
``` เพื่อให้ตั้งค่านี้นำไปใช้โดยอัตโนมัติในทุกครั้งที่เปิด Terminal ให้เพิ่มคำสั่งลงใน shell configuration:
```bash
echo 'export HF_HOME="/workspace/huggingface"' >> ~/.bashrc
source ~/.bashrcเริ่มต้นรันโมเดล Qwythos MTP
ใช้คำสั่งเรียกใช้งานโมเดล Q6_K MTP GGUF โดยดึงขุมพลังจาก GPU ทั้งหมดที่มี:
llama serve \
-hf "empero-ai/Qwythos-9B-Claude-Mythos-5-1M-GGUF:MTP-Q6_K" \
--alias "qwythos-9b-mtp" \
--host 0.0.0.0 \
--port 8910 \
--n-gpu-layers all \
--ctx-size 100000 \
--parallel 1 \
--batch-size 1024 \
--ubatch-size 512 \
--flash-attn on \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
--spec-type draft-mtp \
--spec-draft-n-max 6 \
--threads 12 \
--threads-batch 24 \
--temp 0.6 \
--top-p 0.95 \
--top-k 20 \
--repeat-penalty 1.05 \
--jinja \
--perfในการรันครั้งแรก llama.cpp จะดาวน์โหลดไฟล์โมเดลจาก Hugging Face โดยอัตโนมัติ
จากนั้นจะโหลดข้อมูลเข้าสู่หน่วยความจำ GPU และเริ่มทำงานในรูปแบบ Local Server 
เมื่อระบบพร้อม คุณสามารถเปิด Interface ผ่าน Browser ได้ที่ http://localhost:8910 และใช้งาน API ที่รองรับมาตรฐาน OpenAI ได้ทาง http://localhost:8910/v1 ท่านที่พบปัญหา VRAM เต็ม แนะนำให้ลดค่า --ctx-size หรือเปลี่ยนไปใช้รุ่น Q4_K_M แทน
คำอธิบาย Flag ที่สำคัญ:
| Flag | Purpose |
|---|---|
--n-gpu-layers all | ย้ายเลเยอร์ทั้งหมดไปทำงานบน GPU |
--ctx-size 100000 | จองพื้นที่ Context Window 100,000 token |
--flash-attn on | เปิดใช้งาน Flash Attention เพิ่มสปีด |
--cache-type-k q8_0 และ --cache-type-v q8_0 | ลดการใช้หน่วยความจำ KV-cache โดยไม่เสียคุณภาพ |
--spec-type draft-mtp | เปิดใช้งาน MTP speculative decoding |
--spec-draft-n-max 6 | กำหนดค่าทำนายล่วงหน้าสูงสุด 6 token ต่อขั้นตอน |
--jinja | ใช้ Chat Template ของโมเดลโดยเฉพาะ |
--perf | แสดงสถิติประสิทธิภาพการประมวลผล |
จากการทดสอบบน RTX 4070 Ti Super ผมได้ความเร็วถึง 81.74 tokens ต่อวินาที ซึ่งตัวโมเดลสามารถคิดวิเคราะห์ เรียกใช้เครื่องมือ และส่งข้อมูลจริงกลับมาได้อย่างถูกต้องแม่นยำ 
การติดตั้ง Pi และการเชื่อมต่อกับ llama.cpp
Pi สามารถเชื่อมต่อกับ Local Server ของ llama.cpp เพื่อใช้งานเป็น Coding Agent ได้ผ่านปลั๊กอิน pi-llama ซึ่งถูกออกแบบมาให้ทำงานร่วมกันได้โดยไม่ต้องใช้ API Key จากภายนอก
เริ่มจากการติดตั้ง Pi:
curl -fsSL https://pi.dev/install.sh | sh
จากนั้นติดตั้งปลั๊กอิน llama.cpp สำหรับ Pi:
pi install git:github.com/huggingface/pi-llamaสร้างโปรเจกต์สำหรับทดสอบ:
mkdir new-project
cd new-project
``` เนื่องจากปลั๊กอินจะมองหาพอร์ต 8080 เป็นหลัก แต่เราใช้งานที่พอร์ต 8910 จึงต้องตั้งค่าที่อยู่ API ก่อนเริ่ม Pi:
```bash
export LLAMA_BASE_URL="http://127.0.0.1:8910/v1"
piใช้งานคำสั่ง /model ภายใน Pi แล้วเลือก qwythos-9b-mtp เพื่อเริ่มใช้งานโมเดลในฐานะ local agent 
ทดสอบโมเดลเขียนโค้ดในสถานการณ์จริง
ผมได้ทดสอบด้วยงาน 2 รูปแบบ คือการสร้างเกมบน Browser และเครื่องมือ Python CLI
สร้างเกมบน Browser
ผมส่ง Prompt ให้ Pi สร้างเกม "Beat the AI" โดยใช้ HTML, CSS และ JavaScript ล้วน ผลลัพธ์ที่ได้คือโค้ดไฟล์เดียวที่ครบถ้วน ทั้งระบบนับถอยหลัง การสุ่มคำถาม และระบบนับคะแนนที่ทำงานได้สมบูรณ์แบบบน Browser ทันที
ตัวเกมมีการขัดเกลามาอย่างดี มี Progress bar และปุ่มเริ่มใหม่ พร้อมใช้งาน 
สร้างเครื่องมือแปลง CSV เป็น Excel ด้วย Python
การทดสอบที่สองคือการสร้างโปรแกรม CLI สำหรับแปลงไฟล์ CSV เป็น .xlsx ซึ่งโปรแกรมที่โมเดลสร้างขึ้นสามารถรักษา Header ได้ถูกต้อง มีการจัดการข้อผิดพลาด (Error Handling) และทำงานร่วมกับข้อมูลตัวอย่างได้อย่างราบรื่น 
สรุปส่งท้าย
ผมประทับใจความสามารถของโมเดลขนาดเล็กตัวนี้มาก เพราะมันทำงานได้รวดเร็ว แม่นยำ และกินทรัพยากรน้อย เหมาะสำหรับการสร้างโปรเจกต์ Prototype หรือเครื่องมือใช้สอยทั่วไปในเครื่องโดยไม่ต้องพึ่งพา API เสียเงิน
หากต้องการประสิทธิภาพที่สูงขึ้น แนะนำให้ผนวกการใช้งานเข้ากับระแบบค้นหาเว็บหรือปลั๊กอินอย่าง Context7 ของ Pi และคุณสามารถศึกษาคู่มือการปรับแต่งเพิ่มเติมได้ที่บทความ How to Set Up Kimi K2.7 Code with Pi: The Ultimate AI Coding Environment



ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
