AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

百度发布3B参数Unlimited OCR 长文档解析效率获突破性提升

百度近日推出全新OCR大模型Unlimited OCR,参数量为3B,创新性采用R-SWA机制替换传统解码器注意力,实现KV缓存大小恒定,可高效完成数十页长文档的内容解析任务。该模型在长文本OCR场景下的算力消耗较现有同类产品降低超60%,识别准确率提升12%,为办公、政务、法律等高密度文档处理场景提供了新的技术方案。

日常办公中,多页扫描件、合同卷宗、学术论文的批量识别一直是高频痛点:传统OCR模型处理超过10页的文档时,要么因为显存占用过高触发卡顿,要么分段识别丢失跨页上下文信息,表格、签章等特殊内容的识别错误率居高不下,企业往往需要投入大量人力做二次校验。

过去基于Transformer架构的OCR模型,推理过程中用于存储历史注意力信息的KV缓存会随着输入文本长度的增加线性膨胀。如果处理50页的长文档,KV缓存占用的显存会是单页文档的40倍以上,大部分消费级显卡甚至无法支撑单任务运行,商用部署的算力成本极高。

此前行业的主流解决方案是将长文档拆分为单页或多页片段分别识别,再通过后处理拼接,但这种模式会丢失跨页的版式关联信息,跨页表格、连续段落、骑缝章等内容的识别准确率不足70%,无法满足高要求的商用场景。

百度此次发布的3B参数Unlimited OCR,核心创新点在于用循环滑动窗口注意力(R-SWA) 替换了传统Transformer解码器的自注意力模块,从架构层面解决了KV缓存膨胀的问题。

据公开测试数据,该模型的KV缓存大小全程保持恒定,和输入文档的长度完全无关:不管处理1页还是50页的文档,显存占用波动不超过5%,单页平均处理耗时稳定在0.2秒,整体算力消耗较同类3B级OCR模型降低62%,跨页内容识别准确率提升12个百分点。

目前Unlimited OCR已经接入百度智能云的文档处理服务矩阵,面向企业客户开放API调用,首批落地场景覆盖政务档案数字化、法律卷宗识别、财务凭证批量处理、制造业图纸数字化等多个领域。

从试点客户的反馈来看,某省级政务服务中心用该模型处理100万页历史档案扫描件,整体数字化效率较原有方案提升71%,人工校验成本降低48%;某头部律所批量处理案件卷宗,跨页法条、签章的识别准确率达到97.3%,完全符合业务要求。

百度相关技术负责人透露,本次在Unlimited OCR上验证的KV缓存恒定技术,后续还会拓展到更多多模态文档处理模型中,覆盖手写体识别、复杂版面还原、结构化信息抽取等更多能力,未来目标是实现千页级超长文档的端到端秒级处理,进一步降低全行业的文档数字化成本。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。