tag: LLM

Fly Language Model: เมื่อโครงข่ายประสาทแมลงหวี่ 1.6 แสนเซลล์ ถูกเชื่อมต่อกับ LLM แต่ผลทดสอบชี้อาจไม่ช่วยเพิ่มประสิทธิภาพ

Fly Language Model: เมื่อโครงข่ายประสาทแมลงหวี่ 1.6 แสนเซลล์ ถูกเชื่อมต่อกับ LLM แต่ผลทดสอบชี้อาจไม่ช่วยเพิ่มประสิทธิภาพ

โครงการ Fly Language Model (FLM) ทดลองนำโครงข่ายประสาทแมลงหวี่ตัวผู้กว่า 1.6 แสนเซลล์มาเชื่อมต่อกับโมเดลภาษา LFM2.5-1.2B พบว่าแม้จะมีส่วนร่วมในระบบประมวลผลจริง แต่กลุ่มควบคุมที่ไม่มีโครงข่ายประสาทกลับทำผลงานได้ดีกว่าเล็กน้อย
HarnessDev เผยศักยภาพ LLM ในการออกแบบ Agent Harness: พัฒนาเองได้ดีเทียบเท่ามนุษย์ในบางด้าน แต่ผลลัพธ์ยังไม่เสถียร

HarnessDev เผยศักยภาพ LLM ในการออกแบบ Agent Harness: พัฒนาเองได้ดีเทียบเท่ามนุษย์ในบางด้าน แต่ผลลัพธ์ยังไม่เสถียร

· By: NatapolK
ทีมนักวิจัยจาก ByteDance Seed และพันธมิตรเปิดตัว HarnessDev เกณฑ์วัดผลแนวใหม่ที่เน้นประเมินโค้ด Harness ที่ LLM สร้างขึ้นเอง พบว่าโมเดลเริ่มทำผลงานได้ใกล้เคียงมนุษย์ในงานเขียนและงานทดลอง ML แต่ยังคงมีปัญหาด้านความแม่นยำและการนำไปใช้จริงในระยะยาว
ปฏิวัติการฝึก AI ด้วย Tunix: เมื่อ AI Agent ช่วยทำ Post-training แบบอัตโนมัติบน Google TPUs

ปฏิวัติการฝึก AI ด้วย Tunix: เมื่อ AI Agent ช่วยทำ Post-training แบบอัตโนมัติบน Google TPUs

· By: TanasakP
Google เปิดตัวแนวคิดการใช้ AI Agent เพื่อทำ LLM Fine-tuning แบบอัตโนมัติผ่านโปรเจกต์ autofinetune ช่วยลดขั้นตอนการปรับจูน Hyperparameters ที่ยุ่งยากให้กลายเป็นกระบวนการที่รันได้เองตลอด 24 ชั่วโมง
Cohere เปิดตัว North Small Translate โมเดล MoE 218B ชูประสิทธิภาพการแปล 50 ภาษา แซงหน้า Google Translate

Cohere เปิดตัว North Small Translate โมเดล MoE 218B ชูประสิทธิภาพการแปล 50 ภาษา แซงหน้า Google Translate

Cohere เปิดตัว North Small Translate โมเดลแปลภาษาแบบ open-weight สถาปัตยกรรม MoE ขนาด 218 พันล้านพารามิเตอร์ ซึ่งทำคะแนนทดสอบ WMT26 ได้สูงถึง 83.6 เหนือกว่าผู้นำในตลาดอย่าง Google Translate และ DeepL
Redis เปิดตัว LangCache: บริการ Semantic Cache ช่วยลดค่าใช้จ่าย LLM สูงสุด 90% และประมวลผลเร็วขึ้น 15 เท่า

Redis เปิดตัว LangCache: บริการ Semantic Cache ช่วยลดค่าใช้จ่าย LLM สูงสุด 90% และประมวลผลเร็วขึ้น 15 เท่า

· By: NatapolK
Redis LangCache เป็นบริการ Managed Semantic Caching ที่ช่วยลดภาระการทำงานของ LLM โดยการจับคู่คำถามด้วยความหมายแทนข้อความ ช่วยประหยัดค่า API และลดระยะเวลาตอบสนองได้อย่างมีประสิทธิภาพ
ToolGrad: ปฏิวัติการสร้างชุดข้อมูล AI Agent ด้วยเทคนิค Textual Gradients

ToolGrad: ปฏิวัติการสร้างชุดข้อมูล AI Agent ด้วยเทคนิค Textual Gradients

· By: NatapolK
นักวิจัยเปิดตัว ToolGrad เฟรมเวิร์กสร้างชุดข้อมูลการใช้เครื่องมือสำหรับ LLM แบบเน้นคำตอบก่อน ซึ่งประหยัดต้นทุนกว่าและให้ประสิทธิภาพสูงจนโมเดลขนาดเล็กสามารถเอาชนะโมเดลระดับ SoTA ได้
DeepSeek ปล่อย DeepSeek-V4.1-Flash รุ่นใหม่: มาพร้อม 1M Context และนวัตกรรมประหยัด KV Cache ถึง 437 เท่า

DeepSeek ปล่อย DeepSeek-V4.1-Flash รุ่นใหม่: มาพร้อม 1M Context และนวัตกรรมประหยัด KV Cache ถึง 437 เท่า

DeepSeek-V4.1-Flash คือโมเดล Mixture-of-Experts มัลติโมดอลที่ออกแบบมาเพื่อลดปัญหาคอขวดของหน่วยความจำในการรัน Long-horizon agents โดยรองรับ Context Window สูงสุดถึง 1 ล้านโทเคน
Harness Engineering: กลยุทธ์ประเมินและปรับปรุง AI Coding Agent ให้ทำงานแม่นยำและมั่นคง

Harness Engineering: กลยุทธ์ประเมินและปรับปรุง AI Coding Agent ให้ทำงานแม่นยำและมั่นคง

· By: TanasakP
เจาะลึกการสร้างระบบประเมินพฤติกรรม (Behavioral Evals) สำหรับ AI Agent เพื่อช่วยให้นักพัฒนาสามารถปรับแต่ง Prompt และอัปเกรดโมเดลได้อย่างมั่นใจโดยไม่เกิดการถดถอยของประสิทธิภาพ
Anthropic งานเข้า! ถูกฟ้องแบบกลุ่มฐานโฆษณาสิทธิพิเศษสมาชิก Claude เกินจริง

Anthropic งานเข้า! ถูกฟ้องแบบกลุ่มฐานโฆษณาสิทธิพิเศษสมาชิก Claude เกินจริง

· By: AttapolK
คดีฟ้องร้องแบบกลุ่มกล่าวหา Anthropic ว่าบิดเบือนข้อมูลปริมาณการใช้งานจริงของสมาชิก Claude ระดับพรีเมียม โดยตัวคูณการใช้งานไม่ได้ครอบคลุมตามที่โฆษณาไว้
Google Research เปิดตัว ToolGrad: เฟรมเวิร์กสร้างข้อมูล Tool-Use แบบใหม่ ทำ Pass Rate สูงถึง 99.8%

Google Research เปิดตัว ToolGrad: เฟรมเวิร์กสร้างข้อมูล Tool-Use แบบใหม่ ทำ Pass Rate สูงถึง 99.8%

· By: AttapolK
Google Research พัฒนา ToolGrad เฟรมเวิร์กที่พลิกกระบวนการสร้างชุดข้อมูล tool-use โดยตรวจสอบ API chain ก่อนเขียน query ส่งผลให้ Gemma-3-12B ที่ถูกฝึกด้วยข้อมูลเพียง 500 ชุด มีประสิทธิภาพเทียบเท่า Gemini 2.5 Pro
เจาะลึกระบบความปลอดภัย Muse: เอเจนต์ AI อัจฉริยะที่ออกแบบมาเพื่อป้องกันความเสี่ยงระดับ Superintelligence

เจาะลึกระบบความปลอดภัย Muse: เอเจนต์ AI อัจฉริยะที่ออกแบบมาเพื่อป้องกันความเสี่ยงระดับ Superintelligence

· By: TanasakP
Meta Superintelligence Labs เปิดเผยรายละเอียดวิศวกรรมความปลอดภัยของ Muse เอเจนต์ส่วนตัวที่เน้นการปกป้องข้อมูลด้วยระบบ VM แยกส่วนและ Sentinel พร้อมประกาศรางวัล Bug Bounty สูงสุด 300,000 ดอลลาร์
ความปลอดภัยของ LLM: ทำไมการปฏิเสธแบบเหมาเข่งจึงไม่ใช่คำตอบที่ถูกต้อง

ความปลอดภัยของ LLM: ทำไมการปฏิเสธแบบเหมาเข่งจึงไม่ใช่คำตอบที่ถูกต้อง

· By: SirilukP
งานวิจัยใหม่เสนอแนวทาง Narrow-boundary safety เพื่อแก้ปัญหาโมเดล AI ปฏิเสธการตอบคำถามที่ปลอดภัยเพียงเพราะมีคำที่ดูอันตรายปนอยู่ โดยเน้นการกำหนดขอบเขตความปลอดภัยให้แม่นยำตามเจตนาของผู้ใช้แทนการบล็อกทั้งหัวข้อ
นักวิจัยเตือนภัย 'โรคจิตจาก AI' เมื่อแชทบอทกลายเป็นห้องแห่งเสียงสะท้อนที่ตอกย้ำความเชื่อผิดๆ

นักวิจัยเตือนภัย 'โรคจิตจาก AI' เมื่อแชทบอทกลายเป็นห้องแห่งเสียงสะท้อนที่ตอกย้ำความเชื่อผิดๆ

· By: AttapolK
ทีมนักวิจัยนานาชาติกำลังพิจารณาบรรจุ 'โรคจิตที่เกี่ยวข้องกับ AI' เป็นการวินิจฉัยทางคลินิกใหม่ หลังพบพฤติกรรมแชทบอทที่ประจบประแจงผู้ใช้จนสร้างระบบความเชื่อผิดๆ ร่วมกัน ซึ่งส่งผลกระทบต่อผู้ใช้งานนับแสนรายต่อสัปดาห์
รู้จัก Switchyard: ไลบรารี Open Source จาก NVIDIA ที่ช่วยจัดการเส้นทาง LLM เพื่อลดต้นทุน

รู้จัก Switchyard: ไลบรารี Open Source จาก NVIDIA ที่ช่วยจัดการเส้นทาง LLM เพื่อลดต้นทุน

· By: SirilukP
NVIDIA เปิดตัว Switchyard เครื่องมือ Intelligent Routing ที่ช่วยเลือกใช้งานโมเดล AI ตามความเหมาะสมของคำขอ ช่วยลดทั้งค่าใช้จ่ายและความหน่วงโดยไม่เสียคุณภาพงาน
NVIDIA เปิดตัว Switchyard: ตัวกลางจัดการทราฟฟิก LLM ข้ามค่ายผ่าน Rust Proxy และ Library

NVIDIA เปิดตัว Switchyard: ตัวกลางจัดการทราฟฟิก LLM ข้ามค่ายผ่าน Rust Proxy และ Library

· By: NatapolK
NVIDIA เปิดตัว Switchyard โปรเจกต์ Open-source สำหรับจัดการเส้นทางและแปลรูปแบบทราฟฟิก LLM ช่วยให้แอปพลิเคชันที่รองรับเฉพาะ OpenAI หรือ Anthropic สามารถทำงานร่วมกับโมเดลบน vLLM, NIM หรือ Ollama ได้ทันที
5 คอร์สเรียนฟรี เปลี่ยนคุณจากมือใหม่สู่ผู้เชี่ยวชาญด้าน LLM อย่างเป็นระบบ

5 คอร์สเรียนฟรี เปลี่ยนคุณจากมือใหม่สู่ผู้เชี่ยวชาญด้าน LLM อย่างเป็นระบบ

· By: SirilukP
แนะนำแหล่งเรียนรู้ฟรีคุณภาพสูง 5 ลำดับที่จะพาคุณเจาะลึกตั้งแต่พื้นฐานคณิตศาสตร์ การสร้างโมเดล Transformer ไปจนถึงการปรับใช้เอเจนต์ AI ในระดับโปรดักชัน
เจาะลึก Benchmark ความหน่วง API สำหรับ Voice Agents: ทำไม TTFT อย่างเดียวถึงไม่ใช่คำตอบ

เจาะลึก Benchmark ความหน่วง API สำหรับ Voice Agents: ทำไม TTFT อย่างเดียวถึงไม่ใช่คำตอบ

· By: NatapolK
เจาะลึกประสิทธิภาพ Voice Stack ทุกเลเยอร์ตั้งแต่ LLM ถึง Speech-to-Speech พร้อมชี้ให้เห็นว่า Time to First Token (TTFT) อาจไม่ใช่มาตรวัดที่สะท้อนประสบการณ์ผู้ใช้จริงได้ดีเท่ากับความเร็วในการสร้างประโยค
ผลวิจัยเผย AI Agent ขาดประสาทสัมผัสเรื่องเวลา ประเมินระยะทำงานพลาดกว่า 10 เท่า

ผลวิจัยเผย AI Agent ขาดประสาทสัมผัสเรื่องเวลา ประเมินระยะทำงานพลาดกว่า 10 เท่า

· By: AttapolK
ผลการศึกษาใหม่พบว่าผู้ช่วยเขียนโค้ด AI อย่าง Claude Code และ Codex ขาดความเข้าใจเรื่องเวลาและประเมินผลงานตัวเองสูงเกินจริง ซึ่งเป็นความท้าทายสำคัญในการกำกับดูแลงานอัตโนมัติระยะยาว
IBM เปิดตัว Granite 4.2: โมเดล Open Reasoning ทรงพลังด้วยระบบ Agentic RL และการสั่งงาน Terminal

IBM เปิดตัว Granite 4.2: โมเดล Open Reasoning ทรงพลังด้วยระบบ Agentic RL และการสั่งงาน Terminal

· By: TanasakP
IBM เปิดตัวตระกูลโมเดลภาษา Granite 4.2 ในขนาด 3B, 8B และ 30B ภายใต้ลิขสิทธิ์ Apache 2.0 ชูจุดเด่นด้านการคิดวิเคราะห์อย่างเป็นระบบ (Reasoning) และความสามารถในการควบคุม Terminal รวมถึงการแก้ไขโค้ดผ่านสภาพแวดล้อมจำลอง
คู่มือประเมิน LLM ก่อนใช้งานจริง: ถอดบทเรียนจากระบบ Secret Scanning ของ GitHub

คู่มือประเมิน LLM ก่อนใช้งานจริง: ถอดบทเรียนจากระบบ Secret Scanning ของ GitHub

สรุปแนวทางปฏิบัติและบทเรียนสำคัญจากการประเมินผล LLM ในสภาพแวดล้อมจริง เพื่อลดความผิดพลาดและเพิ่มความแม่นยำก่อนนำระบบเข้าสู่กระบวนการ Production
หน้า 1 · 53 ข่าวถัดไป →