tag: Reinforcement Learning

Reward AI เปิดตัว OM-1 นโยบายควบคุมหุ่นยนต์อัจฉริยะ ฝึกฝนจากข้อมูลมนุษย์โดยตรง 100%

Reward AI เปิดตัว OM-1 นโยบายควบคุมหุ่นยนต์อัจฉริยะ ฝึกฝนจากข้อมูลมนุษย์โดยตรง 100%

Reward AI เปิดตัว OM-1 นโยบายควบคุมหุ่นยนต์อเนกประสงค์ที่ฝึกฝนผ่านการสาธิตโดยมนุษย์ด้วยถุงมือเซนเซอร์ 7-DoF โดยไม่ต้องใช้การควบคุมระยะไกลหรือข้อมูลเดิมจากตัวหุ่นยนต์ สามารถเรียนรู้งานใหม่ได้ภายในเวลาไม่ถึง 30 นาที
เทคนิคการฝึก AI เขียนโค้ดวาดภาพสีน้ำด้วย TRL และ OpenEnv ผ่านกระบวนการ RL

เทคนิคการฝึก AI เขียนโค้ดวาดภาพสีน้ำด้วย TRL และ OpenEnv ผ่านกระบวนการ RL

สรุปกระบวนการสร้างและฝึกโมเดลภาษาขนาดเล็กให้สามารถวาดภาพสีน้ำที่สวยงามผ่านโค้ด JavaScript โดยใช้เทคนิค Reinforcement Learning (RL) ร่วมกับไลบรารี p5.brush และเครื่องมือจาก Hugging Face เพื่อเลียนแบบรสนิยมทางศิลปะของมนุษย์
Hugging Face เปิดตัว Microduck หุ่นยนต์สองขา Open-Source ราคา 1.4 หมื่นบาท ฝึกฝนด้วย AI ได้บนโต๊ะทำงาน

Hugging Face เปิดตัว Microduck หุ่นยนต์สองขา Open-Source ราคา 1.4 หมื่นบาท ฝึกฝนด้วย AI ได้บนโต๊ะทำงาน

Pollen Robotics ทีมผู้พัฒนาจาก Hugging Face เปิดตัว Microduck หุ่นยนต์สองขาสูง 25 ซม. ที่รองรับการฝึกฝนผ่าน Reinforcement Learning ในราคา 399 ดอลลาร์ พร้อมเปิดเผยกระบวนการฝึกแบบ sim-to-real สู่สาธารณะ
Harvey เปิดตัว Tenet: โมเดลฐาน Kimi K3 ที่ผ่านการฝึกฝนพิเศษเพื่อยกระดับงานกฎหมายระยะยาว

Harvey เปิดตัว Tenet: โมเดลฐาน Kimi K3 ที่ผ่านการฝึกฝนพิเศษเพื่อยกระดับงานกฎหมายระยะยาว

· By: SirilukP
Harvey เปิดตัว Harvey Tenet โมเดลวิจัยที่พัฒนาจาก Kimi K3 ผ่านกระบวนการ Reinforcement Learning เพื่อเพิ่มประสิทธิภาพในภารกิจทางกฎหมายที่ซับซ้อน โดยทำคะแนนบน Legal Agent Benchmark ได้ดีขึ้นเกือบเท่าตัว
Moonshot AI เปิดตัว 'AgentENV' โอเพนซอร์สระบบ MicroVM ความเร็วสูง ขับเคลื่อนการฝึก Agentic RL ให้ Kimi K3

Moonshot AI เปิดตัว 'AgentENV' โอเพนซอร์สระบบ MicroVM ความเร็วสูง ขับเคลื่อนการฝึก Agentic RL ให้ Kimi K3

ทีม Kimi ของ Moonshot AI และ kvcache-ai เปิดตัว AgentENV ระบบ Sandbox สำหรับ AI Agent ที่ใช้เทคโนโลยี Firecracker microVM สามารถ Snapshot และ Resume ได้ในระดับมิลลิวินาที พร้อมรองรับการฝึกโมเดล Kimi K3 ขนาด 2.8 ล้านล้านพารามิเตอร์
คอมพิวเตอร์ควอนตัมยุคใหม่ เรียนรู้และแก้ไขความผิดพลาดได้เองโดยไม่ต้องหยุดการประมวลผล

คอมพิวเตอร์ควอนตัมยุคใหม่ เรียนรู้และแก้ไขความผิดพลาดได้เองโดยไม่ต้องหยุดการประมวลผล

Google Research พัฒนาเฟรมเวิร์ก Reinforcement Learning (RL) ที่ช่วยให้คอมพิวเตอร์ควอนตัมสามารถปรับจูนพารามิเตอร์และแก้ไขข้อผิดพลาดได้แบบเรียลไทม์ระหว่างรันอัลกอริทึม
Sakana AI เปิดตัว Error Diffusion: ฝึก AI ด้วยหลักการชีวภาพโดยไม่ใช้ Backpropagation

Sakana AI เปิดตัว Error Diffusion: ฝึก AI ด้วยหลักการชีวภาพโดยไม่ใช้ Backpropagation

Sakana AI เปิดตัว Error Diffusion (ED) แนวทางการฝึก AI รูปแบบใหม่ที่ใช้หลักการชีวภาพโดยไม่พึ่งพา Backpropagation เพื่อแก้ปัญหาการขนส่งน้ำหนักและรองรับฮาร์ดแวร์ยุคใหม่ ผลการทดสอบพบว่าสามารถใช้กับโครงข่าย Convolutional ได้เป็นครั้งแรกและทำประสิทธิภาพได้ดีในงานเสริมแรงเรียนรู้
Rich Sutton เจ้าของรางวัล Turing Award เปิดตัว Oak Lab มุ่งสร้าง AI Agent ที่เรียนรู้ได้เองตลอดเวลา

Rich Sutton เจ้าของรางวัล Turing Award เปิดตัว Oak Lab มุ่งสร้าง AI Agent ที่เรียนรู้ได้เองตลอดเวลา

Rich Sutton ผู้บุกเบิกด้าน Reinforcement Learning ระดับโลก เปิดตัวสตาร์ทอัพ Oak Lab ในโตรอนโต เพื่อท้าทายขีดจำกัดของ Deep Learning ในปัจจุบัน และสร้าง AI ที่สามารถเรียนรู้จากสิ่งแวดล้อมได้อย่างต่อเนื่อง