AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

xFormers融合五项前沿注意力技术 打造高内存效率Transformer架构

Meta旗下开源AI工具xFormers推出全新内存优化Transformer搭建方案,通过融合打包序列(Packed Sequences)、分组查询注意力(GQA)、ALiBi位置偏置、SwiGLU激活函数、因果注意力五项前沿技术,可在同等推理精度下,将Transformer模型内存占用最高降低62%,训练速度提升38%,为大语言模型、多模态模型的端侧部署提供了新的技术路径。

配图

当前大语言模型、多模态模型的参数规模快速扩张,Transformer架构作为绝大多数AI模型的核心底座,其注意力模块的内存开销已占模型整体运行内存的70%以上。无论是千亿参数模型的训练成本压缩,还是10B级以下小模型的端侧部署,降低Transformer的内存占用都是行业公认的核心需求。

此前行业的内存优化方案多为单点适配,需要开发者针对不同模型架构、不同运行场景手动修改核心代码,适配成本高且优化效果有限,难以覆盖批量生产的落地需求。

作为Meta开源的轻量级Transformer加速工具库,xFormers此次推出的优化方案最大的特点,是将此前分散在不同场景下应用的五项注意力优化技术做了原生集成,开发者无需单独做模块适配,仅需修改3-5行调用代码即可完成整套优化方案的部署。

其中打包序列(Packed Sequences)可将长度不一致的输入序列合并处理,彻底避免传统padding占位带来的无效内存占用;分组查询注意力(GQA)在推理精度损失不到1%的前提下,可将注意力头的KV缓存规模压缩到传统多头注意力的1/4;ALiBi位置偏置则替代了传统的位置编码模块,无需随序列长度扩展重新训练,进一步降低了长序列推理的内存开销。再搭配SwiGLU激活函数和因果注意力的原生适配,整套方案在13B参数模型、4k序列长度的实测场景下,内存占用从28GB降至10.6GB,训练吞吐量提升38%,完全匹配生产级部署的精度要求。

该方案的落地将大幅降低端侧AI的部署门槛。目前消费级手机、边缘计算芯片的运行内存普遍在12GB-16GB区间,此前要运行13B参数大模型,需要将模型量化到4bit甚至更低,会出现明显的推理精度损失。而采用xFormers的优化方案后,8bit量化的13B模型即可在16GB内存设备上流畅运行,为AR眼镜、智能音箱、离线办公助手等消费级AI产品的落地扫清了核心障碍。

据了解,xFormers团队接下来还将完成与Llama 3、Qwen等主流开源大模型架构的原生适配,后续也会将这套内存优化方案扩展到多模态模型的注意力模块,进一步覆盖文生图、视频生成等AI应用场景。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。