AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

阿里推出Marco-Mini-Instruct 低激活MoE可在普通CPU流畅运行

阿里国际数字商业团队近日推出MoE架构大模型Marco-Mini-Instruct,该模型基于Qwen3-0.6B-Base通过Upcycling技术转化而来,总参数量达17.3B,激活参数仅0.86B占比约5%,在8bit量化、搭配4条DDR4 2400内存的普通CPU环境下,推理速度可达30token/s,大幅降低了10B级大模型的本地部署门槛。

大模型落地端侧的瓶颈,正在被全新的技术路线打破。长期以来,用户始终面临“参数小则性能不足、参数大则算力不够”的两难选择,即便是被视作效率最优解的MoE架构,此前也因推理算力要求较高,难以在无GPU的普通设备上运行。

对于大量中小开发者、小微企业以及有隐私合规要求的用户而言,云端大模型API调用存在数据泄露风险,本地部署大模型又需要采购万元级别的GPU硬件,门槛极高。而此前主流的端侧小模型普遍参数规模在7B以下,在复杂推理、多轮对话等场景下的表现和10B以上级大模型存在明显差距,无法满足专业场景的使用需求。

此次2026年4月推出的Marco-Mini-Instruct,给出了兼顾性能与成本的全新解法。该模型并非从零开始训练,而是基于**Qwen3-0.6B-Base**小模型,通过**Upcycling升维技术**改造为MoE架构,最终得到**总参数量17.3B、激活参数仅0.86B(占比约5%)**的全新模型。

在实际测试中,该模型在采用8bit量化、搭配4条DDR4 2400内存的普通消费级CPU上,**推理速度可达30token/s**,换算为中文输出约为每秒20-25字,已经完全覆盖普通用户的阅读速度,日常对话、内容生成、简单推理等场景都可以流畅运行。

此前MoE架构的落地场景几乎全部集中在云端数据中心,需要大量GPU集群支撑推理,此次Marco-Mini-Instruct的出现,首次将MoE模型的推理门槛降到了普通CPU级别,用户仅需一台普通办公电脑就可以本地部署17B级别的大模型,无需额外采购GPU,也不用担心数据上传到云端的安全问题。

这一技术路线也为整个大模型行业提供了新的研发思路:相比一味堆高总参数规模,通过架构优化降低激活参数占比、提升推理效率,可能是未来大模型走向普惠的核心路径。据了解,目前该模型已经开放下载,开发者可以直接部署测试。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。