Baidu เพิ่งปล่อยโมเดล OCR ตัวหนึ่งที่แก้ปัญหาที่ผมหงุดหงิดกับ OCR…
โมเดลชื่อ Unlimited-OCR อ่าน PDF หรือเอกสารยาว 40 หน้าจบในการประมวลผลครั้งเดียว ไม่ต้องตัดเป็นหน้าๆ แล้วค่อยเอามาต่อกันทีหลังแบบ OCR ทั่วไป ตัวโมเดลเล็กมากแค่ 3 พันล้านพารามิเตอร์ แต่ใช้งานจริงแค่ 500 ล้าน เพราะเป็น Mixture-of-Experts รันบนเครื่องธรรมดาได้ ไม่ต้องพึ่งคลาวด์
เทคนิคที่ทำให้อ่านเอกสารยาวได้โดยไม่กินแรมบานคือ Reference Sliding Window Attention ทำให้หน่วยความจำคงที่ไม่ว่าจะยาวกี่หน้า ผลคือรักษาลำดับการอ่าน จับตารางที่ล้นหน้า จับสูตรคณิตศาสตร์ แล้วแปลงออกมาเป็น Markdown ที่มีโครงสร้างพร้อมใช้เลย คะแนน benchmark OmniDocBench อยู่ที่ 93.23% สูงกว่าโมเดลฐานเดิมประมาณ 6 แต้ม
ปล่อยเป็น MIT license ใช้ได้ฟรีทั้งเชิงพาณิชย์ ดาวน์โหลดบน Hugging Face ไปแล้วกว่า 2.1 ล้านครั้งตั้งแต่มิถุนายน
จุดที่ผมสนใจที่สุดคือมันไม่มีค่าใช้จ่ายต่อหน้าแบบ Textract หรือ Google Cloud Vision รันเองได้ 100% ถ้าใครทำงานที่ต้อง digitize เอกสารเยอะๆ เช่นสัญญา รายงาน หรือเอกสารราชการ ตัวนี้น่าจะประหยัดได้เยอะเลย ส่วนภาษาไทยตัวโมเดลระบุว่า multilingual แต่ยังไม่มี benchmark ไทยอย่างเป็นทางการ ต้องลองเทสเองก่อนเอาไปใช้งานจริง
Source: huggingface.co/baidu/Unlimited-OCR
อยากใช้ AI กับงานจริงเป็นระบบ?
เรียน Claude Method — วิธีคิดและลงมือใช้ Claude/AI กับงานจริง ตั้งแต่วันแรก
📍 โพสต้นฉบับบน Facebook: AI กับ Peesamac