问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年6月2日,百度正式发布文心大模型衍生多模态模型PaddleOCR-VL-1.6,在OmniDocBench v1.6权威评测中以96.33%的准确率超越Gemini-3-Pro、GPT-5.2等国内外主流模型,刷新文档解析领域SOTA,综合性能位列全球第一。该模型支持超100种语言识别,可适配多类复杂文档解析场景。

随着全球数字化转型进入深水区,政务、金融、文化、制造等领域的非结构化文档处理需求呈现爆发式增长。传统OCR技术仅能识别标准印刷体文字,面对表格、手写批注、古籍生僻字、印章、混合排版图表等复杂场景时,准确率往往不足80%,需要投入大量人工校验,大幅拉高了数字化成本。
作为文心大模型多模态能力的核心落地产品之一,本次发布的PaddleOCR-VL-1.6仅用0.9B的轻量化参数规模,就实现了性能的大幅跃升。研发团队通过模型驱动的数据构建机制与渐进式训练优化,针对性解决了复杂场景下的识别偏差问题,最终在OmniDocBench v1.6评测中拿下96.33%的准确率,不仅超过了参数规模远大于自身的Gemini-3-Pro、GPT-5.2等海外头部模型,也领先于国内同类型的GLM-OCR等产品,登顶全球性能榜首。
目前PaddleOCR系列产品已经支持超100种语言识别,用户覆盖全球170多个国家和地区,本次升级的1.6版本在保持原有部署灵活性的前提下,进一步降低了端侧运行的硬件门槛,即便在普通办公设备上也能实现秒级文档解析。
此次性能突破也让多模态OCR的落地边界进一步拓宽。在文化领域,该模型可实现古籍生僻字、破损文献的高精度识别,大幅缩短古籍数字化的周期;在金融场景中,混合排版的财务报表、多语言合同、印章票据都可以实现自动识别并结构化输出,人工校验成本可降低70%以上;对于有数据隐私要求的政企用户,轻量化架构支持本地化部署,无需上传数据到云端即可完成文档处理。
业内人士指出,本次PaddleOCR-VL-1.6的突破,标志着多模态大模型在感知层面的能力已经接近实用阈值,接下来行业的发展方向将从“识别正确”向“理解到位”演进,未来的OCR产品将可以直接基于文档内容完成逻辑推理、自动摘要、关联分析等深度处理,进一步释放非结构化数据的价值。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。