问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
阿里国际数字商业团队近日推出MoE架构大模型Marco-Mini-Instruct,该模型基于Qwen3-0.6B-Base通过Upcycling技术转化而来,总参数量达17.3B,激活参数仅0.86B占比约5%,在8bit量化、搭配4条DDR4 2400内存的普通CPU环境下,推理速度可达30token/s,大幅降低了10B级大模型的本地部署门槛。
大模型落地端侧的瓶颈,正在被全新的技术路线打破。长期以来,用户始终面临“参数小则性能不足、参数大则算力不够”的两难选择,即便是被视作效率最优解的MoE架构,此前也因推理算力要求较高,难以在无GPU的普通设备上运行。
对于大量中小开发者、小微企业以及有隐私合规要求的用户而言,云端大模型API调用存在数据泄露风险,本地部署大模型又需要采购万元级别的GPU硬件,门槛极高。而此前主流的端侧小模型普遍参数规模在7B以下,在复杂推理、多轮对话等场景下的表现和10B以上级大模型存在明显差距,无法满足专业场景的使用需求。
此次2026年4月推出的Marco-Mini-Instruct,给出了兼顾性能与成本的全新解法。该模型并非从零开始训练,而是基于**Qwen3-0.6B-Base**小模型,通过**Upcycling升维技术**改造为MoE架构,最终得到**总参数量17.3B、激活参数仅0.86B(占比约5%)**的全新模型。
在实际测试中,该模型在采用8bit量化、搭配4条DDR4 2400内存的普通消费级CPU上,**推理速度可达30token/s**,换算为中文输出约为每秒20-25字,已经完全覆盖普通用户的阅读速度,日常对话、内容生成、简单推理等场景都可以流畅运行。
此前MoE架构的落地场景几乎全部集中在云端数据中心,需要大量GPU集群支撑推理,此次Marco-Mini-Instruct的出现,首次将MoE模型的推理门槛降到了普通CPU级别,用户仅需一台普通办公电脑就可以本地部署17B级别的大模型,无需额外采购GPU,也不用担心数据上传到云端的安全问题。
这一技术路线也为整个大模型行业提供了新的研发思路:相比一味堆高总参数规模,通过架构优化降低激活参数占比、提升推理效率,可能是未来大模型走向普惠的核心路径。据了解,目前该模型已经开放下载,开发者可以直接部署测试。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。