News / ข่าว AI / รวมค่าย
รวมค่าย · ข่าว AI

Baidu เพิ่งปล่อยโมเดล OCR ตัวหนึ่งที่แก้ปัญหาที่ผมหงุดหงิดกับ OCR…

ภีศเดช เพชรน้อย
ภีศเดช เพชรน้อย
20 ก.ค. 2026 · อ่าน 2 นาที
สรุปสั้น — Baidu เพิ่งปล่อยโมเดล OCR ตัวหนึ่งที่แก้ปัญหาที่ผมหงุดหงิดกับ OCR มานาน คืออ่านเอกสารยาวๆ ทีละหน้าแล้วบริบทหลุด อ่านตารางที่ล้นข้า
#เขียน/เอกสาร#Productivity
Baidu เพิ่งปล่อยโมเดล OCR ตัวหนึ่งที่แก้ปัญหาที่ผมหงุดหงิดกับ OCR…

โมเดลชื่อ Unlimited-OCR อ่าน PDF หรือเอกสารยาว 40 หน้าจบในการประมวลผลครั้งเดียว ไม่ต้องตัดเป็นหน้าๆ แล้วค่อยเอามาต่อกันทีหลังแบบ OCR ทั่วไป ตัวโมเดลเล็กมากแค่ 3 พันล้านพารามิเตอร์ แต่ใช้งานจริงแค่ 500 ล้าน เพราะเป็น Mixture-of-Experts รันบนเครื่องธรรมดาได้ ไม่ต้องพึ่งคลาวด์

เทคนิคที่ทำให้อ่านเอกสารยาวได้โดยไม่กินแรมบานคือ Reference Sliding Window Attention ทำให้หน่วยความจำคงที่ไม่ว่าจะยาวกี่หน้า ผลคือรักษาลำดับการอ่าน จับตารางที่ล้นหน้า จับสูตรคณิตศาสตร์ แล้วแปลงออกมาเป็น Markdown ที่มีโครงสร้างพร้อมใช้เลย คะแนน benchmark OmniDocBench อยู่ที่ 93.23% สูงกว่าโมเดลฐานเดิมประมาณ 6 แต้ม

ปล่อยเป็น MIT license ใช้ได้ฟรีทั้งเชิงพาณิชย์ ดาวน์โหลดบน Hugging Face ไปแล้วกว่า 2.1 ล้านครั้งตั้งแต่มิถุนายน

จุดที่ผมสนใจที่สุดคือมันไม่มีค่าใช้จ่ายต่อหน้าแบบ Textract หรือ Google Cloud Vision รันเองได้ 100% ถ้าใครทำงานที่ต้อง digitize เอกสารเยอะๆ เช่นสัญญา รายงาน หรือเอกสารราชการ ตัวนี้น่าจะประหยัดได้เยอะเลย ส่วนภาษาไทยตัวโมเดลระบุว่า multilingual แต่ยังไม่มี benchmark ไทยอย่างเป็นทางการ ต้องลองเทสเองก่อนเอาไปใช้งานจริง

Source: huggingface.co/baidu/Unlimited-OCR

อยากใช้ AI กับงานจริงเป็นระบบ?

เรียน Claude Method — วิธีคิดและลงมือใช้ Claude/AI กับงานจริง ตั้งแต่วันแรก

ดูคอร์ส →

📍 โพสต้นฉบับบน Facebook: AI กับ Peesamac