AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

微信开源多模态嵌入模型WeMM-Embedding 日调用超10亿次登顶权威榜

9月4日微信AI正式开源通用多模态嵌入模型WeMM-Embedding,涵盖2B、4B、9B三个参数版本,支持文本、图像、视频、视觉文档等多模态交错输入,可实现统一语义空间检索。据微信员工客村小蒋披露,该模型已落地朋友圈搜索、视频号推荐等场景,日调用量达10亿次,在国际权威榜单MMEB-v2中登顶,性能超过此前所有开源及闭源模型。

配图

10亿次日调用量是什么概念?这相当于国内所有网民平均每天至少触发一次相关服务,而这些调用就藏在用户刷视频号推荐、搜朋友圈历史内容、逛微信电商找同款的每一次操作背后,多数普通用户甚至完全感知不到这项AI技术的存在。

据微信视觉团队成员客村小蒋透露,WeMM-Embedding早已完成内部全场景落地,除了用户感知较强的朋友圈搜索、视频号推荐外,公众号内容匹配、微信电商的商品推荐与搜索等场景,都已经在稳定使用该模型。目前该模型的日调用量已经突破10亿次,经过了亿级用户、复杂场景的长期验证,稳定性和准确率都经过了实战检验。

和普通的单模态模型不同,WeMM-Embedding的核心价值是可以把不同形态的内容映射到同一个语义空间:一张橘猫晒太阳的照片、一段“橘猫躺平”的文字描述、一段猫咪追逐逗猫棒的短视频,都会被模型标记为语义相近的向量,哪怕用户用文字搜索图片、用图片匹配视频,也能得到精准的结果。

此次微信开源的WeMM-Embedding共推出2B、4B、9B三个参数版本,可适配端侧部署、云端轻量化部署、高性能云端部署等不同需求。和传统多模态模型不同,它支持文本、图像、视频、视觉文档等任意模态的交错输入,哪怕用户同时上传图片+文字片段作为查询条件,也能精准返回匹配结果。

在国际权威多模态嵌入评测榜单MMEB-v2中,WeMM-Embedding超越所有已提交的开源及闭源模型拿下总分第一,技术实力得到行业公认。目前该模型的相关技术论文已发布于arXiv,代码仓库同步在GitHub开放,全球开发者都可以免费获取使用。

在WeMM-Embedding开源之前,中小团队想要搭建多模态检索能力,要么需要投入大量算力和研发资源自研模型,要么需要付费调用闭源厂商的API,成本门槛较高。而微信此次开源的模型已经过微信生态的实战验证,开发者可以直接基于现有版本微调,快速适配自身业务场景,大幅降低多模态应用的研发成本。

未来随着该模型的普及,无论是个人开发者搭建个人多媒体素材库,还是企业上线智慧办公文档检索、电商以图搜货、短视频内容审核等服务,都能获得更高效、更低成本的技术支持,进一步推动多模态AI技术的普惠落地。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。