如果一个AI系统响应够快、服务可用、技术上运行正常,它是否就称得上「健康」?InfoWorld近期刊发的一篇文章提出了一个更尖锐的问题:当AI系统在幻觉与答非所问中持续让用户失望时,现有的监控面板可能完全看不到。这篇文章的核心观点是,传统以延迟和错误率为核心的服务等级指标(SLI),已经无法覆盖AI原生系统真正需要观测的故障面。

文章描绘的关键场景是:AI系统可能运行快速、持续在线,各项基础设施指标都显示正常,却在用户层面失败——比如模型给出看似合理实则错误的答案,或对用户提问答非所问。这种「技术上健康、语义上错误」的状态,正是传统监控体系最容易遗漏的部分。微软社区博客也曾明确提出,AI应用可能处于技术上健康、语义上错误(technically healthy and semantically wrong)的状态。
传统可观测性建立在日志、指标、追踪(Metrics/Logs/Traces)三支柱之上,衡量的是系统是否「活着」、响应是否够快、请求是否出错。但对AI系统而言,一次成功返回HTTP 200的调用,其内容可能完全是幻觉输出或偏离用户意图的回答。微软社区、CNCF、InfoQ等多个权威来源均指出,需要在三支柱基础上叠加语义层信号,如幻觉、越狱、语义质量等,才能反映AI系统真正的健康度。
业界已逐步形成共识:AI可观测性需要在传统三支柱之上引入新的SLI,包括语义质量、安全合规与业务成果;同时要区分token延迟与首/尾token时间、语义错误与HTTP状态码错误。OpenTelemetry GenAI语义约定正在推动统一的埋点标准,让不同AI组件的语义信号能够以一致的方式被采集和比对。此外,第三方调查数据也提示了这一议题的紧迫性——麦肯锡2025年的一项调查显示,51%使用AI的组织遭遇过因模型不准确导致的负面后果;Gartner则预计到2028年,60%的团队将使用AI可观测平台。
围绕这一议题,近期已有具体方案落地。微软Foundry在2026年9月提出五层AI可观测框架,涵盖技术、Agent执行、安全/策略、质量、业务五个层面,并指出传统APM(应用性能管理)仅覆盖第一层。即将于10月22日至24日举行的QCon上海2026大会,也设置了「Agent安全与可观测」专题,讨论OpenTelemetry GenAI语义约定、两阶段大模型评估等实践。腾讯云则在2026年9月发文,将SLI/SLO/Error Budget作为AIOps的地基,延续了同一议题的讨论。
在作者看来,这一轮讨论的意义在于:AI可观测性的重心正在从「基础设施是否正常」向「用户感知到的结果是否正确」迁移。传统APM衡量的是系统有没有宕机、接口有没有报错,而AI原生系统更需要在技术指标之外,回答「模型给出的答案是否可信」「Agent的行为是否符合预期」这类问题。这并不意味着延迟与错误率不再重要,而是它们需要与语义质量、安全合规等新SLI一起,构成更完整的观测体系。