AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

Sakana AI推出DiffusionBlocks框架 大幅降低大模型训练内存成本

日本人工智能初创公司Sakana AI近期公布全新训练框架DiffusionBlocks,该框架通过得分匹配机制实现Transformer模块的独立训练,可将残差网络转换为多个独立可训练的去噪模块,实测最高可降低40%的大模型训练内存占用,为千亿参数级大模型的低成本研发提供了全新技术路径。

对于长期受困于显存瓶颈的大模型研发团队而言,这项技术的落地价值不言而喻。当前主流的7B参数开源大模型整网训练至少需要8张A100显卡,千亿参数模型的训练成本更是超过千万元,内存在整体训练成本中的占比已经超过60%。

在DiffusionBlocks出现之前,行业普遍通过张量并行、流水线并行等分布式训练方案缓解显存压力,但这类方案需要复杂的集群调度,同时会带来15%到25%的跨卡通讯开销,中小团队几乎没有能力负担相关的技术研发和硬件成本。

即便是头部科技公司,在训练万亿参数模型时,也需要为显存优化投入大量的研发资源,拉长了模型的迭代周期,内存效率已经成为制约大模型技术迭代速度的核心因素之一。

DiffusionBlocks的核心创新在于块级独立训练机制。传统残差网络训练过程中,所有模块需要同步参与前向传播和梯度回传,整网参数必须全程加载在显存中。而Sakana AI的新框架通过得分匹配算法,将每个残差块转换为独立的去噪模块,每个模块可以单独训练、单独优化,不需要依赖整网的梯度传递。

实测数据显示,在7B参数Transformer模型的训练场景中,采用DiffusionBlocks框架可将显存占用降低40%,训练速度反而提升12%,最终输出的模型效果与整网训练的版本无统计意义上的差异。

除了显存效率的提升,DiffusionBlocks更大的想象空间在于模块化的模型研发模式。不同团队可以针对不同能力(如逻辑推理、多模态理解、代码生成)单独训练对应的DiffusionBlocks模块,之后直接拼接即可得到多能力融合的大模型,不需要重新整网训练,将垂直领域大模型的研发周期缩短50%以上。

据了解,Sakana AI团队计划在今年6月底正式开源DiffusionBlocks的全部代码和训练教程,全球开发者都可以免费使用该框架进行大模型研发。行业预计,今年下半年就会有一批基于该框架开发的轻量化开源大模型上线。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。