问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
谷歌DeepMind于2026年6月正式发布新一代开源大模型Gemma4,其参数规模维持300亿级不变但单位参数智能密度大幅提升,性能可对标一年半前顶尖闭源模型。本次核心技术突破为E2B参数卸载架构,50亿参数版本仅需2GB显存即可极速推理,为手机等消费级设备本地运行高性能大模型提供了成熟的技术路径。

6月3日谷歌DeepMind的年度开源模型发布会上,主讲人没有首先公布参数规模的跃升,而是直接抛出了一组让全场开发者沸腾的测试数据:一款50亿参数级的大模型,在旗舰手机的本地环境下,连续完成12轮复杂逻辑推理任务,全程响应延迟不到0.3秒,全程没有调用任何云端算力。
过去两年端侧AI概念热度居高不下,但实际落地始终卡在“性能和显存不可兼得”的死胡同里:小参数模型能力不足以支撑复杂推理、创作类任务,大参数模型动辄需要十几GB显存,消费级手机普遍的8GB、12GB显存根本腾不出足够空间独立运行。当前普通用户日常使用的AI功能90%以上都要依赖云端传输,不仅存在网络波动导致的延迟问题,还存在用户隐私数据上传泄露的风险。
Gemma4本次的核心创新完全跳出了“堆参数提性能”的传统路线,首次采用了E2B(参数卸载)架构,从底层解决了大模型显存占用过高的问题。
传统Transformer架构中,占参数量近60%的嵌入层需要全部加载到显存中才能完成计算,是端侧运行的最大负担。而E2B架构创新性地在每一层网络中加入独立嵌入表,用低功耗的查找表机制替代了原本高算力消耗的全矩阵乘法运算。以本次同步推出的50亿参数轻量化版本为例,实际需要加载到GPU显存中的有效参数仅为20亿,剩余30亿参数可以卸载到CPU甚至本地磁盘存储,仅需2GB显存就能实现极速推理。
而300亿参数的标准版Gemma4,在参数规模与上一代完全持平的前提下,单位参数智能密度实现量级提升,在数学推理、多轮对话、代码生成等核心任务上的表现,已经可以匹敌2024年底发布的顶尖闭源大模型。
作为完全开源可商用的大模型,Gemma4的发布直接拉低了端侧AI的落地门槛,所有开发者和消费电子厂商都可以免费适配,无需支付任何专利费用。
此前开源大模型的迭代路线基本围绕“堆参数、提算力”展开,E2B架构的出现为行业提供了“提效优先”的新路线,接下来大概率会有更多厂商跟进研发类似的高效架构,开源大模型的竞争将从参数规模竞赛转向单位参数效率的比拼。对于消费电子行业而言,这也意味着未来不需要堆高显存配置,就能让中低端手机也具备本地运行高性能大模型的能力,普惠性的端侧AI普及有望大幅提速。
据了解目前已经有头部安卓手机厂商在测试Gemma4的本地适配工作,最快今年第三季度就会有搭载本地运行Gemma4的消费级手机上市。未来用户不仅可以在无网络环境下使用AI完成文案撰写、数据整理、图片编辑等复杂操作,所有交互数据都不需要上传云端,隐私安全性大幅提升。随着后续更多基于E2B架构的多模态模型推出,本地运行AI生成视频、实时同声翻译等高消耗功能也会逐步走进普通用户的日常。
本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。