问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
AI基础设施厂商PrismML近日正式发布轻量化大模型Bonsai 27B,该模型基于阿里云通义千问Qwen3.6-27B进行1比特、三值量化改造,整体体积压缩至5.9GB,三值版本保留原FP16精度模型94.6%的性能,1比特版本性能保留率也达89.5%,可直接在消费级笔记本、智能手机等端侧设备离线运行,大幅降低大模型部署门槛。

随着用户对AI服务隐私性、响应速度的要求不断提升,端侧部署已经成为大模型行业的重要发展方向,但过去很长一段时间里,端侧可运行的大模型普遍集中在7B、14B参数区间,推理能力上限明显。
更高参数的20B+大模型虽然逻辑推理、知识储备、复杂任务处理能力远胜小参数模型,但FP16精度下27B参数模型的体积就超过50GB,即使用主流的4比特量化方案压缩后也有十几GB,很难在内存普遍只有8-16GB的消费级移动设备上流畅运行,而更低位宽的量化方案往往伴随着超过20%的性能损耗,实用价值大打折扣。
PrismML本次推出的Bonsai 27B,正是瞄准了低比特量化的性能痛点,在阿里云通义千问Qwen3.6-27B的底座基础上采用自研的量化保留算法,分别推出了三值量化和1比特量化两个版本。
公开数据显示,两个版本的模型体积均压缩至5.9GB,仅为原FP16版本的1/9左右,其中三值量化版本的性能保留率达到94.6%,几乎与全精度版本的使用体验无明显差异,即便是量化程度更高的1比特版本,性能保留率也达到89.5%,足以应对绝大多数日常AI任务需求。
该模型目前已经可以在配备8GB以上内存的Windows、Mac轻薄本,以及8GB以上运存的安卓、iOS旗舰手机上离线运行,不需要依赖云端服务器响应,推理延迟较云端服务降低70%以上,同时避免了用户数据上传云端的隐私风险。
Bonsai 27B的出现,也打破了此前行业对于“20B+参数大模型无法在消费级端侧设备运行”的固有认知。
随着低比特量化技术的成熟,未来会有更多30B、40B参数级别的大模型完成端侧适配,本地复杂文档处理、离线代码开发、端侧多模态生成等此前只能在云端实现的功能,都将逐步落地到消费级设备上,推动个人AI助手、行业端侧应用的生态进一步爆发。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。