Reward AI เปิดตัว OM-1 นโยบายควบคุมหุ่นยนต์อัจฉริยะ ฝึกฝนจากข้อมูลมนุษย์โดยตรง 100%tag: Humanoid, OM-1, Omnibody Model, Reinforcement Learning, Reward AI, RoboticsSep 15, 2026 · By: NatapolKReward AI เปิดตัว OM-1 นโยบายควบคุมหุ่นยนต์อเนกประสงค์ที่ฝึกฝนผ่านการสาธิตโดยมนุษย์ด้วยถุงมือเซนเซอร์ 7-DoF โดยไม่ต้องใช้การควบคุมระยะไกลหรือข้อมูลเดิมจากตัวหุ่นยนต์ สามารถเรียนรู้งานใหม่ได้ภายในเวลาไม่ถึง 30 นาที
เทคนิคการฝึก AI เขียนโค้ดวาดภาพสีน้ำด้วย TRL และ OpenEnv ผ่านกระบวนการ RLtag: Generative Art, Hugging Face, OpenEnv, p5.js, Qwen, Reinforcement LearningSep 3, 2026 · By: TanasakPสรุปกระบวนการสร้างและฝึกโมเดลภาษาขนาดเล็กให้สามารถวาดภาพสีน้ำที่สวยงามผ่านโค้ด JavaScript โดยใช้เทคนิค Reinforcement Learning (RL) ร่วมกับไลบรารี p5.brush และเครื่องมือจาก Hugging Face เพื่อเลียนแบบรสนิยมทางศิลปะของมนุษย์
Hugging Face เปิดตัว Microduck หุ่นยนต์สองขา Open-Source ราคา 1.4 หมื่นบาท ฝึกฝนด้วย AI ได้บนโต๊ะทำงานtag: Hugging Face, Microduck, MuJoCo, Open Source Robotics, Pollen Robotics, Reinforcement LearningAug 30, 2026 · By: TanasakPPollen Robotics ทีมผู้พัฒนาจาก Hugging Face เปิดตัว Microduck หุ่นยนต์สองขาสูง 25 ซม. ที่รองรับการฝึกฝนผ่าน Reinforcement Learning ในราคา 399 ดอลลาร์ พร้อมเปิดเผยกระบวนการฝึกแบบ sim-to-real สู่สาธารณะ
Harvey เปิดตัว Tenet: โมเดลฐาน Kimi K3 ที่ผ่านการฝึกฝนพิเศษเพื่อยกระดับงานกฎหมายระยะยาวtag: Harvey, Harvey Tenet, Kimi K3, Legal AI, Reinforcement LearningAug 24, 2026 · By: SirilukPHarvey เปิดตัว Harvey Tenet โมเดลวิจัยที่พัฒนาจาก Kimi K3 ผ่านกระบวนการ Reinforcement Learning เพื่อเพิ่มประสิทธิภาพในภารกิจทางกฎหมายที่ซับซ้อน โดยทำคะแนนบน Legal Agent Benchmark ได้ดีขึ้นเกือบเท่าตัว
Moonshot AI เปิดตัว 'AgentENV' โอเพนซอร์สระบบ MicroVM ความเร็วสูง ขับเคลื่อนการฝึก Agentic RL ให้ Kimi K3tag: AgentENV, Firecracker, Kimi K3, Moonshot AI, Open-Source, Reinforcement LearningJul 29, 2026 · By: NatapolKทีม Kimi ของ Moonshot AI และ kvcache-ai เปิดตัว AgentENV ระบบ Sandbox สำหรับ AI Agent ที่ใช้เทคโนโลยี Firecracker microVM สามารถ Snapshot และ Resume ได้ในระดับมิลลิวินาที พร้อมรองรับการฝึกโมเดล Kimi K3 ขนาด 2.8 ล้านล้านพารามิเตอร์
คอมพิวเตอร์ควอนตัมยุคใหม่ เรียนรู้และแก้ไขความผิดพลาดได้เองโดยไม่ต้องหยุดการประมวลผลtag: Google DeepMind, Google Quantum AI, Quantum Error Correction, Reinforcement Learning, WillowJul 23, 2026 · By: NatapolKGoogle Research พัฒนาเฟรมเวิร์ก Reinforcement Learning (RL) ที่ช่วยให้คอมพิวเตอร์ควอนตัมสามารถปรับจูนพารามิเตอร์และแก้ไขข้อผิดพลาดได้แบบเรียลไทม์ระหว่างรันอัลกอริทึม
Sakana AI เปิดตัว Error Diffusion: ฝึก AI ด้วยหลักการชีวภาพโดยไม่ใช้ Backpropagationtag: Backpropagation, Dale's Principle, Error Diffusion, Reinforcement Learning, Sakana AIJul 19, 2026 · By: AttapolKSakana AI เปิดตัว Error Diffusion (ED) แนวทางการฝึก AI รูปแบบใหม่ที่ใช้หลักการชีวภาพโดยไม่พึ่งพา Backpropagation เพื่อแก้ปัญหาการขนส่งน้ำหนักและรองรับฮาร์ดแวร์ยุคใหม่ ผลการทดสอบพบว่าสามารถใช้กับโครงข่าย Convolutional ได้เป็นครั้งแรกและทำประสิทธิภาพได้ดีในงานเสริมแรงเรียนรู้
Rich Sutton เจ้าของรางวัล Turing Award เปิดตัว Oak Lab มุ่งสร้าง AI Agent ที่เรียนรู้ได้เองตลอดเวลาtag: AI Agent, Deep Learning, Oak Lab, Reinforcement Learning, Rich Sutton, Turing AwardJul 14, 2026 · By: SirilukPRich Sutton ผู้บุกเบิกด้าน Reinforcement Learning ระดับโลก เปิดตัวสตาร์ทอัพ Oak Lab ในโตรอนโต เพื่อท้าทายขีดจำกัดของ Deep Learning ในปัจจุบัน และสร้าง AI ที่สามารถเรียนรู้จากสิ่งแวดล้อมได้อย่างต่อเนื่อง