AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

英伟达Transformer Engine技术升级 显著提升大模型训练效率

近日英伟达公布Transformer Engine最新技术优化方案,通过融合内核、FP8低精度计算、BF16混合精度调度等技术组合,在Hopper架构GPU上的实测显示,千亿参数Transformer架构大模型的训练速度最高可提升38%,同时显存占用率下降22%,为大语言模型、多模态模型的训练降本提供了可行的技术路径。

配图

当前大模型行业的竞赛已经从“参数竞赛”转向“效率竞赛”,千亿参数级大模型单轮训练成本动辄数百万元,训练迭代速度直接决定了厂商的产品落地节奏,从软件栈层面挖掘现有硬件的算力潜力,已经成为全行业的共同诉求。

据行业测算,当前GPT-4级别的多模态大模型单次预训练成本超过1亿元,其中GPU算力支出占比超过7成。由于Transformer架构的运算特性,训练过程中普遍存在算力浪费问题:多步分散运算之间的数据搬运会占用大量GPU资源,而如果为了提升速度采用低精度计算,又容易出现训练不稳定、模型效果下降的问题。此前大部分厂商只能通过牺牲效率保证训练稳定性,算力利用率普遍不足40%。

Transformer Engine是英伟达2022年随Hopper架构GPU推出的专属训练加速组件,本次更新围绕训练链路的核心痛点做了三重优化:
首先是融合内核(Fused Kernels)技术,将Transformer训练过程中分散的偏置添加、激活函数计算、注意力掩码等多个操作合并到单个GPU内核中执行,减少了全局显存的访问次数,仅此一项就可降低15%左右的算力损耗。
其次是FP8与BF16混合精度智能调度,系统会自动识别不同运算环节的精度敏感度,在对精度要求较低的正向矩阵运算环节自动切换为FP8精度,在反向传播等核心环节保留BF16精度,在不影响最终训练效果的前提下大幅提升运算速度。
此外英伟达还同步推出了配套的GPU基准测试工具,可针对不同参数规模的大模型自动匹配合适的调度策略,无需开发者手动调整底层参数,大幅降低了优化门槛。

实测数据显示,这套优化方案目前已经完成对H100、H200等主流训练GPU的适配,相比此前的通用训练框架,千亿参数大模型的训练速度最高提升38%,显存占用降低22%,单轮训练成本可下降近3成。更重要的是,企业不需要更换硬件,只要更新CUDA软件栈即可完成升级,适配成本极低。

目前包括OpenAI、Anthropic在内的多家头部大模型厂商已经开始测试这套优化方案,行业预计2026年下半年到2027年,大模型训练的单位算力成本可下降40%以上,中小厂商训练百亿级参数大模型的门槛将进一步降低,有望推动AI应用的更快落地。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。