AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

GPU原生架构存多租户安全缺陷 AI算力调度遇核心瓶颈

随着生成式AI应用的快速普及,公有云平台承载的大语言模型训练、推理算力需求持续暴涨,当前公有云82%的AI算力负载采用GPU多租户共享模式,但GPU原生设计并不支持安全多租户隔离、快速故障恢复能力,已引发多起跨租户数据泄露、服务宕机事件,目前云计算厂商、芯片企业正在联合探索软硬件协同的解决方案填补这一架构空白。

今年第三季度,海外多家云服务厂商的AI推理服务先后出现异常宕机,事后排查的核心原因均指向同GPU节点下某租户的大模型微调任务显存溢出,击穿了软件层的隔离机制,导致同节点其他十余位租户的任务数据丢失、服务中断超过20分钟。这类事件的频繁出现,也让此前长期被忽视的GPU多租户问题走到了行业台前。

生成式AI爆发以来,单卡A100/H100等高端GPU的采购成本已经突破10万元,年运维成本也接近2万元,对于大部分中小AI企业而言,单独采购GPU的投入产出比极低。公有云厂商推出的多租户GPU共享服务,通过时间切片、显存拆分等方式将单张GPU的算力同时分配给3-8个租户使用,能够把单租户的算力使用成本降低70%以上,已经成为当前AI算力供给的主流模式。据行业统计,2024年全球通过多租户模式调度的GPU算力占比已经突破75%,较2022年提升了47个百分点。

和具备成熟多租户隔离机制的CPU不同,GPU的硬件架构从设计之初就面向单任务高并发计算场景,并未内置硬件级的任务隔离、权限管控模块。当前行业普遍采用的软件层隔离方案,不仅会带来15%-25%的性能损耗,还存在明显的安全漏洞:恶意租户可以通过特殊的CUDA指令直接访问共享显存中的其他租户数据,单租户的任务故障也会导致整个GPU节点重启,故障恢复时间普遍在10分钟以上,远高于CPU服务的秒级恢复标准。

目前芯片厂商、云服务企业已经从两个方向推进问题解决:英伟达在最新的H200 GPU中新增了硬件级多租户隔离模块,能够实现不同租户任务的显存、算力完全物理隔离,故障恢复时间压缩到1分钟以内,性能损耗不到5%;而阿里云、AWS等云厂商也在自研软件层调度方案,通过在虚拟化层增加动态算力围栏、异常任务快速终止机制,在不改造硬件的前提下把跨租户数据泄露风险降低了98%以上。

随着大模型推理服务的渗透率持续提升,企业客户对于AI算力的安全性、稳定性要求也越来越高,GPU多租户能力已经成为云厂商差异化竞争的核心指标。据行业预测,到2027年,支持安全多租户的GPU产品市场规模将突破200亿美元,占高端GPU整体出货量的65%,相关的算力调度软件市场规模也将超过30亿美元。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。