AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

MoonMath AI开源AMD MI300X专属HIP注意力内核 性能超AITER v3

近日,AI基础设施研发商MoonMath AI正式开源适配AMD MI300X加速卡的bf16精度HIP注意力内核。该内核完全基于HIP异构计算语言开发,在所有输入形状、所有舍入模式的测试场景中,性能均全面领先现有主流优化方案AITER v3,将为AMD生态下大模型训练与推理的性能提升提供新的开源工具选择。

作为大模型训练与推理流程中占算力消耗比重超40%的核心模块,注意力算子的优化效率直接决定了AI加速卡的实际落地表现。在当前AMD算力生态快速扩张的背景下,第三方厂商的底层优化贡献正在成为生态完善的核心动力。

随着生成式AI产业的高速扩张,全球AI算力供给长期处于紧缺状态,叠加英伟达高端加速卡的供应限制与成本高企问题,越来越多的云服务商与AI企业开始布局AMD MI300X算力集群。公开数据显示,2026年上半年AMD MI300系列加速卡的出货量同比增长超过300%,但其软件生态的优化进度始终跟不上硬件普及速度。

此前针对MI300X的注意力算子优化,业内主流方案是AITER v3,但其仅在特定输入形状下能发挥最优性能,一旦遇到大批次、长序列等非常规场景,性能会出现明显下滑,也无法兼容所有舍入模式,限制了MI300X在不同大模型场景下的适配性。

MoonMath AI此次推出的HIP注意力内核,专门针对MI300X的硬件架构做了指令级调优,在业内首次实现了全输入形状、全舍入模式下的性能全面领先AITER v3。

该内核采用bf16精度开发,完全基于AMD官方的HIP异构计算接口,无需额外适配即可直接接入主流大模型训练框架,开发者可直接调用该内核替换原有方案,无需修改上层业务代码,即可获得明显的性能提升。目前该项目已向所有开发者开源,允许商业使用,无需额外授权。

此次内核开源的意义不止于单一算子的性能提升,更标志着第三方开发者生态正在成为AMD算力体系的重要支撑。此前AMD硬件的性能释放高度依赖官方团队的优化,而随着MoonMath AI这类专注底层算子优化的厂商推出开源方案,整个AMD生态的优化效率将得到明显提升。

业内分析认为,随着更多类似的开源优化项目落地,AMD与英伟达在AI算力领域的生态差距将进一步缩小,未来企业选择算力基础设施的灵活度会更高,也将进一步推动AI算力成本的下降。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。