近日曝光的亚马逊内部AI成本失控事件引发行业广泛关注:该公司工程师调用Anthropic旗下Claude Sonnet模型处理电商平台作者与商品数据匹配任务,最终产生180万美元(约合人民币1215万元)账单,实际支出超原定预算860%,项目持续运行5个月未成功落地,暴露出企业AI落地过程中成本管控的普遍漏洞。

这起事故直到季度财务对账时才被亚马逊后台部门察觉——此前的5个月里,存在逻辑缺陷的AI生成程序一直在后台循环调用大模型接口,没有任何预设的告警机制触发阻拦,相当于一台没有关闭的“算力水龙头”日夜不停消耗资源,最终产生的账单金额甚至比项目原定的预期价值还高出数倍。
复盘报告显示,本次事故的诱因并不复杂:工程师使用Claude Sonnet生成的程序代码缺少调用频次限制,触发死循环后持续向大模型发起请求,按调用量计费的算力成本随之不断累积。更核心的问题是项目团队并未设置实时的AI成本告警机制,也没有对AI生成的代码做完整的逻辑校验,微小的漏洞在无人监管的状态下持续运行了5个月,最终出现860%的超支幅度,酿成千万元级别的浪费。
随着生成式AI的普及,全球企业都在加快相关项目的落地节奏,但大部分团队对大模型的按量计费模式仍缺乏足够的精细化运营经验。此前行业调研显示,超过6成的企业AI项目负责人表示,大模型调用成本超出预期是现阶段落地的最大阻碍之一。不同于传统软件的一次性授权付费,大模型按token量、调用次数计费的模式,一旦出现程序逻辑问题或者恶意调用,很容易在短时间内产生高额账单,不少中小团队甚至没有设置单项目的调用上限阈值,往往等到账单出具才发现异常。
本次亚马逊的事故也给全行业敲响了警钟:企业引入AI工具的核心目标是降本增效,但如果缺少配套的管控体系,反而可能造成额外的巨额损失。目前已经有不少云服务商、大模型厂商推出了AI成本管控工具,支持单项目调用上限设置、实时成本告警、AI生成代码自动巡检等功能,未来成本管控能力将和技术能力一样,成为企业AI落地的核心竞争力。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。