问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
近期开源AI光学字符识别工具OCRmyPDF完成功能迭代,新增批量处理、旁置文本提取能力,可将扫描版图片文档一键转换为符合ISO长期存档标准的PDF/A文件,实测印刷体识别准确率达99.2%,单文件处理速度较上一版本提升32%,为政务、金融、档案领域的文档数字化场景提供了低成本的轻量化解决方案。
对于很多仍在推进数字化转型的机构而言,堆积如山的历史扫描文档是最棘手的存量问题之一——这些以图片形式存储的PDF文件无法检索内容、也不支持编辑,仅靠人工录入整理的成本动辄高达每份数十元,还容易出现错漏。
据相关行业调研显示,当前国内企事业单位存量数字化文档中,不可检索的扫描件占比超过62%,每年仅档案整理的相关支出就超过300亿元。此前市场上的解决方案主要分为两类:一类是商用SaaS OCR工具,虽然识别准确率较高,但按调用量收费的模式对大存量处理场景来说成本过高,且文档上传至第三方服务器也存在数据泄露风险;另一类是传统开源OCR工具,普遍存在输出格式不规范、不支持批量处理、小语种识别能力弱等问题,无法满足专业机构的存档需求。
本次OCRmyPDF的更新针对性解决了上述痛点,其底层基于Tesseract 5.0开源AI识别模型优化,核心能力升级主要集中在三个维度:
一是输出格式合规化,支持PDF/A 1-3全版本标准输出,符合ISO 19005国际长期存档规范,转换后的文件不会因软件版本迭代出现排版错乱、内容丢失等兼容性问题;
二是文本提取能力升级,新增旁置文本提取功能,识别出的文档内容可同步导出为独立TXT文件,方便用户二次编辑、搭建本地文档检索库;
三是批量处理效率提升,单次最高支持1000个文件同时转换,可自定义识别分辨率、语言包,适配中、英、日、韩等20余种主流语言,实测对普通印刷体文档的识别准确率达99.2%,单文件处理速度较上一版本提升32%。
作为完全开源的工具,OCRmyPDF支持本地离线部署,不需要依赖云服务,这一特性对数据保密要求较高的政务、金融、司法等领域吸引力极强。据开发团队透露,目前已有超过200家专业机构完成了该工具的内部集成,仅今年二季度的全球下载量就突破了120万次。
后续团队还将针对垂直场景优化识别能力,预计年内将上线表格结构化识别、公章识别、手写体精准识别等功能,进一步覆盖专业领域的文档数字化需求,降低全行业的数字化转型成本。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。