tag: Computer Vision

สร้าง Hierarchical NeRF ด้วย JAX3D: เจาะลึกกระบวนการ Volumetric Rendering และการจำลองภาพ 3D

สร้าง Hierarchical NeRF ด้วย JAX3D: เจาะลึกกระบวนการ Volumetric Rendering และการจำลองภาพ 3D

· By: NatapolK
คู่มือการสร้าง Neural Radiance Field (NeRF) แบบลำดับชั้นตั้งแต่เริ่มต้นด้วย JAX และ Flax โดยใช้ฟังก์ชัน jax3d เพื่อจัดการกระบวนการสร้างโครงสร้าง 3D และการเรนเดอร์ภาพจากมุมมองใหม่ได้อย่างแม่นยำ
Xiaomi เปิดตัว PROVE: เกณฑ์มาตรฐานใหม่สำหรับประเมินการลบวัตถุในวิดีโอด้วย AI

Xiaomi เปิดตัว PROVE: เกณฑ์มาตรฐานใหม่สำหรับประเมินการลบวัตถุในวิดีโอด้วย AI

· By: TanasakP
MiLM Plus จาก Xiaomi เปิดตัว PROVE เกณฑ์วัดประสิทธิภาพการลบวัตถุด้วย AI ที่เน้นความสอดคล้องทางสายตาโดยไม่ต้องใช้ภาพต้นฉบับอ้างอิง เพื่อแก้ปัญหาเกณฑ์วัดเดิมที่มักให้คะแนนผิดพลาด
Pixel-Native RAG: คู่มือสร้างระบบ Indexing เอกสารเชิงภาพแบบครบวงจร

Pixel-Native RAG: คู่มือสร้างระบบ Indexing เอกสารเชิงภาพแบบครบวงจร

· By: NatapolK
เรียนรู้การสร้างระบบ PixelRAG ที่จัดการเอกสาร PDF และหน้าเว็บในรูปแบบรูปภาพโดยไม่ต้องสกัดข้อความ ช่วยเพิ่มประสิทธิภาพการกู้คืนข้อมูลเชิงภาพด้วย Multimodal Embedding และ Hybrid Search
สร้างเวิร์กโฟลว์ End-to-End OCR ด้วย Unlimited-OCR จาก Baidu รองรับ PDF หลายหน้าและความละเอียดสูง

สร้างเวิร์กโฟลว์ End-to-End OCR ด้วย Unlimited-OCR จาก Baidu รองรับ PDF หลายหน้าและความละเอียดสูง

· By: TanasakP
คู่มือการสร้างระบบ OCR ครบวงจรด้วยโมเดล Unlimited-OCR ของ Baidu ที่รองรับทั้งการประมวลผลรูปภาพความละเอียดสูงผ่านโหมด Gundam และการทำงานกับ PDF หลายหน้าที่ซับซ้อนอย่างมีประสิทธิภาพ
Google DeepMind ชี้โมเดลสร้างวิดีโออาจมี World Model ในตัว หลัง GenCeption ทำผลงานด้าน Computer Vision ได้ยอดเยี่ยม

Google DeepMind ชี้โมเดลสร้างวิดีโออาจมี World Model ในตัว หลัง GenCeption ทำผลงานด้าน Computer Vision ได้ยอดเยี่ยม

Google DeepMind นำเสนอ GenCeption ซึ่งพบว่าโมเดลสร้างวิดีโอสามารถทำงานด้าน Computer Vision ได้อย่างยอดเยี่ยมโดยใช้ข้อมูลฝึกสอนน้อยกว่าเดิมมาก ผลลัพธ์นี้ช่วยสนับสนุนสมมติฐานที่ว่าโมเดลสร้างวิดีโออาจมีแบบจำลองความเข้าใจโลกทางกายภาพแฝงอยู่ภายใน
สร้างระบบสรุปวิดีโอแบบ Local ด้วย SmolVLM2-2.2B: ประมวลผลบนเครื่องส่วนตัวได้อย่างมีประสิทธิภาพ

สร้างระบบสรุปวิดีโอแบบ Local ด้วย SmolVLM2-2.2B: ประมวลผลบนเครื่องส่วนตัวได้อย่างมีประสิทธิภาพ

SmolVLM2-2.2B คือโมเดลที่ลงตัวทั้งด้านขนาดและความสามารถ โดยมีขนาดเล็กพอที่จะรันบน GPU ระดับผู้บริโภคทั่วไปเพียงตัวเดียว แต่ทรงพลังพอที่จะสรุปเนื้อหาวิดีโอและใช้งานในเวิร์กโฟลว์จริงได้อย่างดีเยี่ยม
Ant Group เปิดตัว LingBot-World-Infinity: โมเดลโลกแบบ Causal 14B จำลองวิดีโอ 60 นาทีแบบเรียลไทม์

Ant Group เปิดตัว LingBot-World-Infinity: โมเดลโลกแบบ Causal 14B จำลองวิดีโอ 60 นาทีแบบเรียลไทม์

Robbyant หน่วยงานด้านสมองกลอัจฉริยะของ Ant Group เปิดตัว LingBot-World 2.0 เครื่องจำลองโลกเสมือนที่โต้ตอบได้แบบไร้รอยต่อ โดยใช้กลไก MoBA และ DMD เพื่อแก้ปัญหาภาพบิดเบี้ยวในการสร้างวิดีโอระยะยาว