近日Google DeepMind正式发布Gemma 4系列QAT(量化感知训练)检查点,包含Q40量化版本与全新移动端专属格式,可将端侧设备运行大模型的内存占用最高降低75%,无需损失过多推理精度即可让中端手机、边缘设备流畅运行百亿参数级大模型,为端侧AI应用落地再降技术门槛。

随着端侧AI需求的快速爆发,大模型本地部署的内存瓶颈已经成为限制消费级产品普及的核心障碍。此前行业普遍采用的后量化方案,往往会让大模型推理精度下降5%以上,难以满足日常使用需求,本次DeepMind推出的预训练量化权重,直接解决了开发者的适配痛点。
过去两年,包括手机厂商、IoT企业在内的终端玩家都在加速布局端侧AI功能,离线语音助手、本地文档总结、无联网AI创作等需求持续增长,但大模型的资源占用问题始终难以解决。
以12B参数的通用大模型为例,FP16全精度版本仅权重就需要占用24GB内存,远超绝大多数消费级手机的可用内存上限,仅少数旗舰机型能勉强运行精简版本,覆盖人群十分有限。
本次发布的Gemma 4 QAT检查点采用量化感知训练技术,在模型训练阶段就注入量化噪声,大幅降低量化后的精度损失。其中通用Q40版本适配所有支持4位推理的硬件设备,基准测试显示其精度仅比全精度版本低1.2个百分点,内存占用直接降到原来的25%,12B参数版本仅需6GB内存即可运行。
而专为移动端优化的专属格式,额外针对ARM架构芯片做了指令集适配,在精度保持一致的前提下,推理速度比通用Q4_0版本提升32%,进一步降低了中端手机的运行门槛。目前所有量化权重已经对全球开发者开放下载,无需额外授权即可用于商业或非商业项目。
作为DeepMind旗下开源大模型的核心产品线,Gemma系列此前已经积累了数十万开发者用户,本次预量化权重的发布,直接为开发者省去了至少2到3个月的量化适配工作,可快速将大模型集成到各类端侧应用中。
有行业人士预测,随着这类低门槛量化方案的普及,未来2年之内,端侧AI应用的数量将增长3倍以上,无联网、隐私优先的AI功能将成为消费级电子设备的标配。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。