问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
科技厂商H于近期正式推出全新单塔多模态编码器系列NeoMME,包含260M、800M两个参数版本。该系列模型摒弃传统多模态方案的独立视觉塔与因果解码器设计,直接将文本Token与原始图像块输入同一双向Transformer处理,在视觉文档检索任务上的推理效率较行业主流方案提升超40%,为轻量级多模态技术落地提供了新路径。
在多模态技术大规模落地的当下,大部分主流方案仍采用“独立视觉塔+文本塔+融合模块”的多塔架构,参数规模普遍在3B以上,不仅部署成本高,推理延迟也难以满足票据检索、图文内容审核等高频调用场景的需求。而此前市面上的小参数多模态模型,普遍存在图文表征匹配精度不足的问题,很难兼顾效率与效果。
此次H公司推出的NeoMME系列,核心创新点在于彻底取消了独立视觉塔与因果解码器两个冗余模块,无需对图像做单独的特征提取,而是直接把原始图像分块后与文本Token做序列拼接,输入同一个双向Transformer进行统一编码,大幅降低了架构的冗余度。
目前公开的测试数据显示,260M参数版本可直接在端侧设备部署,推理延迟控制在20ms以内,800M参数版本在视觉文档检索公开测试集上的准确率,已经追平3B参数级别的主流双塔多模态模型,推理速度提升62%,算力消耗仅为后者的35%。
据了解,H公司已经开放了NeoMME两个版本的模型权重与微调工具包,开发者可基于自身业务场景快速适配,目前已经在电子档案管理、电商图文匹配、教育课件检索等多个场景完成落地测试。
行业分析师指出,这种单塔精简架构的普及,有望进一步降低多模态技术的落地门槛,未来会有更多小参数、高性价比的多模态方案出现,覆盖此前大模型难以渗透的端侧、边缘侧场景。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。