AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

H公司发布NeoMME单塔多模态编码器 革新轻量多模态架构

科技厂商H于近期正式推出全新单塔多模态编码器系列NeoMME,包含260M、800M两个参数版本。该系列模型摒弃传统多模态方案的独立视觉塔与因果解码器设计,直接将文本Token与原始图像块输入同一双向Transformer处理,在视觉文档检索任务上的推理效率较行业主流方案提升超40%,为轻量级多模态技术落地提供了新路径。

在多模态技术大规模落地的当下,大部分主流方案仍采用“独立视觉塔+文本塔+融合模块”的多塔架构,参数规模普遍在3B以上,不仅部署成本高,推理延迟也难以满足票据检索、图文内容审核等高频调用场景的需求。而此前市面上的小参数多模态模型,普遍存在图文表征匹配精度不足的问题,很难兼顾效率与效果。

此次H公司推出的NeoMME系列,核心创新点在于彻底取消了独立视觉塔与因果解码器两个冗余模块,无需对图像做单独的特征提取,而是直接把原始图像分块后与文本Token做序列拼接,输入同一个双向Transformer进行统一编码,大幅降低了架构的冗余度。

目前公开的测试数据显示,260M参数版本可直接在端侧设备部署,推理延迟控制在20ms以内,800M参数版本在视觉文档检索公开测试集上的准确率,已经追平3B参数级别的主流双塔多模态模型,推理速度提升62%,算力消耗仅为后者的35%。

据了解,H公司已经开放了NeoMME两个版本的模型权重与微调工具包,开发者可基于自身业务场景快速适配,目前已经在电子档案管理、电商图文匹配、教育课件检索等多个场景完成落地测试。

行业分析师指出,这种单塔精简架构的普及,有望进一步降低多模态技术的落地门槛,未来会有更多小参数、高性价比的多模态方案出现,覆盖此前大模型难以渗透的端侧、边缘侧场景。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。