问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年6月百度正式开源3B参数端到端OCR模型Unlimited OCR,专攻书籍、论文等长文档解析场景。该项目上线5天GitHub Star破万,登顶GitHub与HuggingFace四项趋势榜,凭借创新的Reference Sliding Window Attention机制突破长文档拼接限制,在OmniDocBench v1.6基准测试中拿下93.92%的成绩,推理速度较DeepSeek OCR提升12.7%。

进入2026年6月下旬,GitHub通用AI工具趋势榜、HuggingFace趋势榜的榜首位置,连续多日被一款OCR类项目占据。不同于此前多数聚焦单页图文识别的同类工具,这款名为Unlimited OCR的模型,甫一开源就凭借超长文档连续解析能力,拿下了开发者群体的超高关注度。
长期以来,长文档OCR识别都是文档数字化场景的核心痛点。传统OCR模型大多采用“逐页识别+结果拼接”的逻辑,跨页的公式、图表、脚注内容很容易出现识别断裂、内容错配,不仅需要大量人工校对,处理上百页的文档时效率也极低。
随着学术出版、企业知识库搭建、古籍数字化等场景的需求爆发,行业对支持连续长文档解析的OCR工具的需求持续攀升,而此前具备相关能力的商用模型价格门槛较高,中小开发者很难低成本接入。
此次百度开源的Unlimited OCR,专门针对长文档解析场景设计,3B的总参数规模下,推理时仅激活约570M参数,在保证识别精度的同时大幅降低了运行门槛。
该模型首次引入的Reference Sliding Window Attention(参考滑动窗口注意力,R-SWA)机制,彻底打破了传统OCR逐页处理的限制:支持数十页文档一次性连续解析,同时将解码阶段的KV Cache控制在恒定规模,显存占用和计算成本不再随输出长度增长而暴涨。
在公开基准测试中,Unlimited OCR以93.92%的准确率刷新OmniDocBench v1.6长文档解析纪录,真实业务场景测试显示,其推理速度较主流同类产品DeepSeek OCR提升约12.7%,在6000Tokens超长输出场景下的效率优势更加明显。
该项目上线仅5天GitHub Star数就突破1万,同时登顶GitHub、HuggingFace四大趋势榜,也从侧面印证了开发者对这类工具的需求缺口。
随着Unlimited OCR的开源,中小开发者无需投入大量算力训练相关模型,即可快速接入高精度长文档识别能力,后续有望在学术文献自动整理、多语种档案数字化、企业非结构化文档转结构化数据等场景,催生出更多轻量化的落地应用。
本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。