2026年7月14日腾讯混元正式发布轻量化端到端OCR专家模型HyOCR-1.5,该模型仅1B参数,依托自研DFlash投机解码框架,在权威测评OmniDocBench中实现推理速度6.37倍提升。作为行业首个全栈开源OCR模型,其开放全部权重、训练方案及推理框架,大幅降低端侧OCR部署门槛。

OCR(光学字符识别)是目前落地最广泛的AI能力之一,但长期以来,端侧OCR部署一直陷入“精度与效率不可兼得”的困境:大参数模型识别效果好但对硬件要求高,轻量模型速度快却难以应对复杂版式、手写体等场景,多数开源方案仅开放模型权重,开发者要完成定制化开发往往需要投入大量研发成本。
HyOCR-1.5的核心突破来自解码环节的技术创新。针对端到端OCR模型普遍存在的长自回归解码延迟问题,腾讯混元研发团队首次引入DFlash投机解码框架:通过一个仅90.7M参数的轻量级草稿模型完成并行预测,在不损失输出准确性的前提下大幅压缩推理耗时。在权威测评集OmniDocBench的测试中,该模型在标准Transformers架构下实现了6.37倍的推理速度提升,是目前同参数级端到端OCR模型中性能表现最优的产品之一。
除了速度提升,该模型仅1B参数的轻量化设计也大幅降低了部署门槛,即使是普通消费级显卡、甚至日常办公的笔记本电脑,都能流畅运行完整模型,无需依赖云端算力。
和行业内多数仅开放权重的开源OCR模型不同,HyOCR-1.5是国内首个实现全栈开源的端到端OCR模型:除了模型权重之外,训练配方、数据构造方法、推理加速框架全部向社区开放,开发者无需从零搭建训练链路,就能快速完成模型复现、针对特定场景做微调,甚至直接部署到端侧设备。
这一模式直接降低了中小团队的OCR开发门槛:过去需要算法团队投入数周甚至数月完成的OCR定制化开发,现在依托开源框架最快几天就能完成适配,且无需支付商用API的调用成本,也能实现本地部署保障数据隐私。
据了解,目前HyOCR-1.5已经支持文档识别、票据解析、手写体识别等多类常见OCR场景,后续腾讯混元还将迭代升级多语言识别、复杂版式解析等能力,进一步覆盖跨境文档处理、古籍数字化等细分场景。
行业分析认为,轻量级垂直开源模型正在成为AI落地的重要方向,这类兼顾性能、效率与开放性的模型,将大幅降低AI技术的使用门槛,推动更多中小团队完成数字化升级。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。