AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

谷歌联合英伟达发布DiffusionGemma 扩散机制实现单卡推理提速4倍

2026年6月谷歌联合英伟达正式发布开源大语言模型DiffusionGemma,首次将图像领域成熟的扩散机制引入文本生成赛道,打破传统大模型逐字生成的自回归范式。该模型参数规模260亿,经英伟达硬件优化后单卡推理速度较同类传统模型提升近4倍,H100显卡单请求输出可达每秒1000标记,消费级RTX5090也能实现每秒700标记的输出效率。

配图

2026年6月10日,谷歌DeepMind团队低调上线了实验性开源模型DiffusionGemma,这款产品从立项阶段就邀请英伟达AI计算团队参与联合硬件适配,上线首日就登顶Hugging Face开源模型趋势榜首位,引发全球AI开发者社群的广泛讨论。

过去数年,主流大语言模型普遍采用自回归生成架构,逐字推演的模式虽然保证了输出准确率,但天然存在推理效率瓶颈:高并发场景下算力成本居高不下,端侧部署更是需要对模型做高强度量化,不得不牺牲生成质量。行业此前的优化方向大多集中在量化压缩、KV缓存优化等维度,从未有人尝试将计算机视觉领域成熟的扩散机制迁移到文本生成赛道,DiffusionGemma的出现填补了这一技术空白。

DiffusionGemma的核心创新,就是首次把扩散模型的迭代降噪思路引入文本生成流程:模型不再逐字预测下一个token,而是从随机噪声矩阵出发,经过多轮迭代优化后一次性并行输出256个标记的完整词块,彻底打破了自回归模型只能向后推演的局限。依托260亿参数规模的混合专家(MoE)架构,该模型单步激活参数仅为38亿,大幅降低了推理过程中的算力占用。
目前公开的基准测试结果显示,其文本生成质量略逊于谷歌旗下同量级的Gemma4系列模型,但全块感知能力让它在长文本生成、多轮对话上下文一致性上的表现明显优于传统自回归模型。

这次英伟达的深度适配是DiffusionGemma能实现效率突破的关键。官方测试数据显示,在单GPU单用户场景下,该模型的推理速度比同参数级的传统自回归模型快近4倍:在数据中心级的H100显卡上处理单条用户请求,输出速度可达每秒1000个标记;即使是面向消费端的RTX5090显卡,也能跑出每秒700个标记的成绩,基本达到了用户无感知等待的交互门槛。

业内分析认为,DiffusionGemma的开源很可能会开辟大语言模型的全新技术路线:一方面,扩散机制带来的推理效率提升,能大幅降低大模型的部署成本,甚至让高参数模型在消费级设备上原生运行成为可能;另一方面,全块生成的特性也为多模态融合、长文本创作等场景提供了新的技术可能性。谷歌团队表示目前该模型还处于实验阶段,后续会继续迭代优化生成准确率,预计2026年第四季度就能追上传统自回归模型的基准测试表现。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。