Swiftlet运行时技术突破 80B量级Qwen模型可在苹果设备低耗运行

2026年8月发布的Swiftlet Swift+Metal运行时针对通义千问Qwen系列MoE大模型优化,通过专家权重SSD存储、按需流式加载的方案,可在M5 Mac上实现80B参数Qwen3-Next模型峰值内存仅4.3GB,35B参数Qwen3.6模型峰值内存低至2.6GB,后者还可在iPhone 17原生运行,大幅降低大参数模型端侧部署门槛。

配图

不少用户对端侧大模型的认知还停留在7B、14B参数的入门级模型,想要体验能力更强的35B以上参数模型,往往需要调用云端接口,既受网络波动限制,也存在敏感数据上传的隐私风险。过去两年,端侧AI的硬件升级速度很快,但内存瓶颈始终是限制大参数模型落地的核心障碍,动辄几十GB的参数加载需求,让消费级设备根本无力承载。

Swiftlet运行时的核心巧思,恰好命中了MoE混合专家模型的调度特性:这类模型并不会同时调用所有专家参数进行计算,绝大多数时候只有少量核心单元处于工作状态。

基于Swift+Metal框架开发的Swiftlet索性改变了传统大模型运行全量参数加载到内存的逻辑,只保留小型稠密核心常驻内存,占参数大头的路由专家权重全部存储在SSD中,只有调度到对应模块时才会按需流式加载,从根源上压缩了内存占用,同时也没有明显损失模型的推理精度。

目前公开的实测数据已经验证了这套方案的可行性,表现远超行业此前预期。

在M5 Mac设备上,4-bit量化的Qwen3.6-35B-A3B模型仅占用18GB磁盘空间,峰值内存仅2.6GB,解码速度可达7-11tok/s,已经完全满足日常文本生成、对话交互的流畅度要求。

针对参数更大的80B量级Qwen3-Next-80B-A3B 4-bit版本,磁盘占用虽然提升到42GB,但峰值内存仍然被控制在仅4.3GB,解码速度可达4.5-5tok/s,哪怕是处理长文档总结、复杂逻辑推理这类任务,也能达到可用水平。

更值得关注的是移动端适配进展,35B参数的Qwen3.6版本已经可以在iPhone 17上原生运行,内存占用仅约2.5GB,后续通过调度优化还有进一步提升速度的空间。

此前业内普遍认为,大参数模型端侧部署至少还需要2-3年的硬件迭代才能实现,Swiftlet的出现相当于用软件优化提前撬开了端侧通用人工智能的落地大门。

一方面,本地运行大参数模型意味着所有数据计算都在设备端完成,不需要上传云端,彻底解决了办公文档分析、私人信息处理等场景的隐私顾虑;另一方面,脱离云端依赖也让AI应用的响应速度更稳定,哪怕是无网络环境也能正常使用。

接下来随着这套调度方案的持续优化,未来有望覆盖更多品牌、更多品类的消费级电子设备,基于大参数端侧模型的原生AI应用也将迎来爆发期。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。