Jina AI เปิดตัว jina-ocr-v1 โมเดลวิเคราะห์เอกสารความเร็วสูง

· By: NatapolK

Jina AI เปิดตัว jina-ocr-v1 โมเดลวิเคราะห์เอกสารความเร็วสูง

Jina AI ในเครือ Elastic เปิดตัว jina-ocr-v1 เครื่องมือวิเคราะห์เอกสารด้วยภาพแบบ end-to-end ที่สามารถแปลงไฟล์ PDF, งานสแกน, ตาราง, แผนภูมิ หรือใบแจ้งหนี้ ให้กลายเป็นข้อมูล Markdown ที่สะอาดตาได้ในการประมวลผลรอบเดียว โมเดลนี้ถูกออกแบบมาเพื่อใช้งานบน GPU ราคาประหยัดอย่าง NVIDIA L4 โดยเฉพาะ

ตัวโมเดลมีพารามิเตอร์รวม 3.4B โดยมีส่วนของ decoder ที่ทำงานจริงเพียง 570M ต่อหนึ่งโทเคน พร้อมติดตั้งหัวใจสำคัญอย่าง speculative decoding มาให้ในตัว จากข้อมูลใน technical report ระบุว่าโมเดลทำคะแนนได้ 91.14 บน OmniDocBench v1.6 และ 83.4 บน olmOCR-Bench

สำหรับการใช้งานเพื่อการวิจัยและงานที่ไม่ใช่เชิงพาณิชย์ สามารถเข้าถึง open weights ขนาดประมาณ 6.8 GB ในรูปแบบ BF16 ซึ่งทำงานบน Transformers หรือ vLLM ได้ทันที ส่วนการใช้งานเชิงพาณิชย์ภายใต้สัญญาอนุญาต CC BY-NC 4.0 จำเป็นต้อง ติดต่อ Jina AI

jina-ocr-v1 คืออะไร?

โมเดลนี้ได้รับการพัฒนาต่อยอด (post-train) จาก DeepSeek-OCR โดยยังคงประสิทธิภาพของ DeepEncoder (380M พารามิเตอร์) ที่รวมเทคโนโลยี SAM, CLIP-L และตัวบีบอัดแบบ convolutional เข้าด้วยกัน ซึ่งสามารถเปลี่ยนภาพหน้ากระดาษความละเอียด 1024×1024 ให้กลายเป็น visual tokens ได้สูงสุด 1,156 โทเคนต่อหน้า

ในส่วนของ decoder ใช้สถาปัตยกรรม DeepSeek-3B-MoE ประกอบด้วย 12 layers และระบบผู้เชี่ยวชาญ (experts) รวม 66 ตัว โดยจะกระตุ้นการทำงานเพียง 570M พารามิเตอร์ต่อโทเคน รองรับขีดจำกัดตำแหน่งสูงสุด 32,768 สามารถให้ผลลัพธ์เป็น Markdown โดยแปลงตารางเป็น HTML และสูตรคำนวณเป็น LaTeX ได้อย่างแม่นยำ

การทำงานของ FastMTP Speculative Decoding เนื่องจากผลลัพธ์ของ OCR มักมีโครงสร้างที่แน่นอน Jina AI จึงนำ speculative decoding มาใช้ร่วมกับหัว FastMTP เพื่อร่างโทเคนล่วงหน้า 3 ขั้นตอน (K=3) โดยที่ตัว decoder หลักจะคอยตรวจสอบความถูกต้อง ซึ่งวิธีนี้ช่วยเพิ่มความเร็วได้โดยไม่สูญเสียความแม่นยำ (lossless) และสามารถยืนยันโทเคนได้เฉลี่ยถึง 2.73 โทเคนต่อขั้นตอน

การทำ Post-Training ด้วย Dense Verifiable Rewards

กระบวนการฝึกฝนขั้นสุดท้ายใช้เทคนิค GRPO ร่วมกับการปรับจูนความทนทานต่อเอกสารที่คุณภาพต่ำ โดยมีการให้คะแนน (reward) ผ่านโค้ดที่ตรวจสอบความถูกต้องของเนื้อหา สูตร ตาราง และโครงสร้างอย่างละเอียด นอกจากนี้ยังมีการสร้างชุดข้อมูล JinaOCRSynth เพื่อฝึกฝนการจัดการกับตารางและสูตรคำนวณที่ซับซ้อนโดยเฉพาะ

เกณฑ์มาตรฐานและประสิทธิภาพการประมวลผล (Throughput)

| Model | Params as listed in the paper | | |---|

olmOCR-Bench

แม้ jina-ocr-v1 จะไม่ได้ครองอันดับหนึ่งด้านความแม่นยำสูงสุดเมื่อเทียบกับโมเดลอย่าง HunyuanOCR-1.5 หรือ chandra-ocr-2 แต่จุดเด่นที่สำคัญคือความเร็วในการประมวลผล โดยบน A100 จำนวน 1 ใบ โมเดลนี้สามารถวิเคราะห์ได้ถึง 2.57 หน้าต่อวินาที ซึ่งสูงที่สุดในบรรดา 14 ระบบที่นำมาทดสอบเปรียบเทียบ

สำหรับการใช้งานบน NVIDIA L4 ความเร็วในการประมวลผล (batch size 1) เพิ่มขึ้นจาก 42.7 เป็น 83.1 โทเคนต่อวินาที หรือเร็วขึ้นเกือบ 2 เท่า เมื่อใช้เทคนิค FastMTP และหากใช้งานร่วมกับ CUDA graphs ความเร็วจะยิ่งเพิ่มขึ้นเป็นลำดับ

วิธีการใช้งาน

ผู้ใช้สามารถเริ่มใช้งานได้ทันทีผ่าน Jina Reader เพียงส่ง URL ไปที่ r.jina.ai พร้อมกำหนดหัวข้อ X-Respond-With: jina-ocr-v1 หรือจะใช้งานผ่าน API ที่รองรับรูปแบบเดียวกับ OpenAI ก็ได้เช่นกัน

สำหรับการติดตั้งใช้งานเอง น้ำหนักโมเดลพร้อมให้ดาวน์โหลดแล้วบน Hugging Face โดยหากต้องการใช้ความสามารถ FastMTP จำเป็นต้องใช้ vLLM เวอร์ชัน 0.21 ขึ้นไป แต่หากใช้งานผ่าน Transformers ปกติจะรันได้เฉพาะส่วน MoE decoder เท่านั้น

สรุปประเด็นสำคัญ

  • พารามิเตอร์รวม 3.4B ทำงานจริงประมาณ 570M ต่อโทเคน พัฒนาต่อยอดจาก DeepSeek-OCR
  • FastMTP ช่วยร่าง 3 โทเคนต่อขั้นตอน ทำให้ประมวลผลได้รวดเร็วโดยไม่เสียความแม่นยำ
  • ทำคะแนนได้ 91.14 บน OmniDocBench v1.6 และ 83.4 บน olmOCR-Bench
  • ประมวลผลได้เร็วถึง 2.57 หน้าต่อวินาทีบน A100 1 ใบ ซึ่งสูงที่สุดในกลุ่มที่ทดสอบ
  • เปิดให้ใช้งานแล้วบน Hugging Face และ Jina Reader
Source: MarkTechPost
ดูแลงานแปลและเรียบเรียงโดย NatapolK

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร