Multiverse推出跨厂适配压缩大模型方案 正式切入主流商用市场

量子计算厂商Multiverse Computing近日面向主流市场推出AI大模型压缩商用方案,已完成对OpenAI、Meta、DeepSeek、Mistral AI等头部厂商主流大模型的轻量化改造,同步上线的演示应用与开放API可让各类开发者低成本调用高压缩比、低算力需求的大模型能力,大幅降低大模型落地门槛。

此次Multiverse推出的压缩方案可将原有大模型的体积压缩至原有的1/10至1/20,推理过程中的算力需求下降80%以上,而输出质量的损失控制在5%以内,这一参数表现已经达到当前大模型压缩领域的第一梯队水平。

过去两年大模型技术迭代速度不断加快,但商用落地的成本门槛始终居高不下。对于中小开发者而言,调用头部厂商的大模型API每年的成本可达数万至数十万元,而如果选择本地化部署70B参数级别的大模型,仅前期硬件投入就需要超过30万元,且后续的运维、算力成本也持续高企,大部分下沉场景的需求难以被满足。

此前市面上的大模型压缩方案大多存在两大短板:要么压缩比提升的同时性能损失过大,无法满足实际商用需求;要么仅适配单一厂商的模型底座,开发者需要针对不同模型重复做适配工作,反而增加了开发成本。

Multiverse原本是一家聚焦量子算法研发的科技公司,此前已经在金融、工业等领域的复杂优化问题上积累了大量算法经验,此次推出的大模型压缩方案正是其量子启发算法在AI领域的落地应用。

不同于市面上多数仅适配单一厂商底座的压缩工具,Multiverse的方案已经完成了对OpenAI GPT-3.5/4o mini、Meta Llama 3全系列、DeepSeek通用/代码大模型、Mistral 7B/70B等主流产品的适配,用户无需针对不同厂商的模型单独做适配改造。

此次同步上线的演示APP已经对外开放,普通用户可直接体验压缩后模型的对话、内容生成、代码编写能力,实际体验与原版模型几乎无感知差异;而面向开发者的API调用成本相比原厂公开价低60%以上,本地化部署的硬件门槛仅为原来的1/10。

Multiverse相关负责人透露,方案推出不到一周,已经有超过200名开发者提交了API试用申请,同时有17家零售、教育、工业制造领域的企业正在对接定制化压缩服务,其中大部分客户的需求是将大模型能力嵌入到边缘端设备、或者面向C端用户的轻量化应用中。

业内普遍认为,随着大模型技术从尝鲜期进入落地期,接下来轻量化、定制化的小模型将成为主流落地形态,类似的压缩优化方案也将成为AI基础设施中的重要组成部分,进一步降低AI技术的使用门槛。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。