什么是 AI 可观测性?

发布日期 2025年12月30日
更新日期 2026年6月22日
在监控室工作的女保安正在监控闭路电视并进行讨论。
By Derek Robertson and Matthew Kosinski

AI 可观测性的定义

人工智能 (AI) 可观测性是指理解 AI 模型和其他人工智能驱动的工具和系统的能力,可通过监控其独特的遥测数据,包括令牌使用情况、响应质量和模型漂移来实现这一目标。

传统的可观测性工具借助可观测性的三大支柱(即日志、跟踪和指标)来了解复杂系统的内部状态或状况。AI 应用程序和 AI 智能体则引入了更高层次的复杂性,因此需要部署专用的可观测性工具。这些工具可以通过监控 AI 特定的输出和生成(通常由 AI 生成)可视化元素来优化模型性能。

与传统软件不同,大语言模型 (LLM) 和其他生成式人工智能应用程序的输出结果基于概率产生。相同的输入可能会产生不同回应,导致输入对输出的影响难以追溯,而传统的可观测性工具无法解决这一问题。因此,生成式 AI 系统中的故障排除、调试和性能监控流程更为复杂。

此外,AI 的可解释性是一个不断发展的领域,旨在减少众多 AI 模型的“黑匣”特性,但目前还无法完全解释模型如何与更广泛的 IT 系统和工作流交互。AI 可观测性解决方案必须优先处理能够有效衡量和分析的内容。在使用 OpenAI 或 Google 等第三方私有部署与管理的模型时,这一优先策略尤为重要。

AI 智能体(在整个 IT 生态系统中自主设计并执行工作流的系统)对可观测性提出了独特的挑战,因此需要采取同样独特的数据收集方法。IBM 商业价值研究院曾在 2025 年开展一项调研,其中近半数的受访高管表示,“智能体决策过程缺乏可见性是 智能体式 AI 部署的主要障碍”。这些系统的可观测性对于应用至关重要。

AI 可观测性的运作原理

AI 可观测性的运作原理是从整个技术堆栈中实时收集 AI 特定的指标,并将其纳入仪表板。AI 可观测性能够帮助管理员深入洞察分析 AI 模型的内部运作情况,同时减少瓶颈、幻觉延迟等常见问题。

可观测性的核心支柱

可观测性平台聚焦三类主要的遥测数据,这些数据在 AI 系统中呈现特定的形态,即日志、跟踪与指标。

日志

日志是应用程序事件的记录,其特点是粒度细、带时间戳、完整且不可篡改。除其他事项外,日志可用于创建 IT 系统中每个事件的高精度毫秒级记录,并以相关的背景信息作为补充。在 AI 开发领域,开发人员可利用日志进行故障排除和调试。

跟踪

跟踪会记录每个用户请求的端到端“旅程”,即从用户界面或移动应用程序开始,贯穿整个架构和 AI 模型,最终返回用户的过程。

指标

指标是衡量一段时间内应用程序和系统运行状况的基本测度。例如,指标可用于衡量应用程序在五分钟内使用了多少内存或 CPU 算力,或者应用程序在用量高峰期间经历多少延迟。

AI 特定的可观测性数据

AI 智能体、生成式 AI 和其他 AI 系统(如大语言模型)也会生成独特的专属遥测数据,必须对其进行收集和分析,才能为管理员提供实用的洞察分析数据。

令牌使用情况、模型漂移和响应质量是大多数 AI 可观测性计划的三大核心数据点。监控这些因素有助于减少模型生命周期中的性能问题并提升用户体验。

与模型相关且更传统的遥测数据(例如 GPU 使用情况、网络基础设施的瓶颈和用户界面反馈),也可以借助 AI 可观测性工具收集。

令牌使用情况

令牌是语言的基本单位(通常为单词或词段),即 AI 模型可以理解的语义单元。模型处理输入或生成输出时消耗的令牌数量,直接影响基于 LLM 应用程序的运营成本与性能表现。令牌用量过高会推高运营成本并延长响应延迟。

令牌使用情况追踪核心指标包括:

  • 词元消耗率和成本,有助于量化运营费用。

  • 令牌效率:衡量单次交互中每个令牌使用效能的指标。高效交互在保证输出质量的同时最大程度减少令牌用量。

  • 不同提示类型中的令牌使用模式,有助于识别模型的资源密集型用例。

这些指标可以帮助组织识别减少令牌消耗的优化机遇,例如,通过优化提示以更少的令牌传达更多信息。通过优化令牌利用率,组织可以保持较高的响应质量,同时有可能降低机器学习工作量的推理成本。

模型漂移

与传统软件不同,随着现实数据的演变,AI 模型可能会面临逐渐产生非预期行为的风险。这种现象称为“模型漂移”,可能会显著降低 AI 系统的可靠性和性能。

用于跟踪模型漂移的关键指标包括:

  • 响应模式随时间的变化:用于识别新出现的不一致问题。

  • 输出质量或相关性发生变化,可能表明模型性能下降。

  • 延迟波动或资源利用率变化可能预示算力效率低下。

漂移检测机制可在模型针对特定用例的准确率下降时提前发出预警,便于团队在模型影响业务运营前实施干预。

响应质量

监控 AI 输出质量对于维护信任、可靠性和合规性至关重要。跟踪响应质量的关键指标包括:

  • 不同提示类型的幻觉频率可识别不准确输出的潜在触发因素。

  • 生成响应的事实准确性,尽管这一指标通常需要外部验证和人工监督。

  • 相似输入的输出一致性,可验证模型随时间推移的稳定性。

  • 响应与用户提示的相关性,可评估模型与用户意图的契合度。

  • 延迟跟踪对于面向用户的 AI 应用程序来说至关重要,因为这通常需要在速度和准确性之间进行权衡。监控不同提示类型的响应时间可以帮助组织查明性能瓶颈和算力效率低下等问题。
IBM DevOps

什么是 DevOps?

Andrea Crawford 阐述了什么是开发运维、开发运维的价值,以及开发运维实践和工具如何帮助您完成从应用程序构思到生产的整个软件交付管道。本课程由 IBM 资深思想领袖主导,旨在帮助企业领导者获得所需的知识,以优先考虑能够推动增长的 AI 投资。

OpenTelemetry 和 AI 可观测性

OpenTelemetry (OTel) 是一个用于收集和传输遥测数据的开源框架,可以帮助应对 AI 带来的可观测性挑战。

对于 AI 提供商而言,OpenTelemetry 可提供规范其分享性能数据方式的方法,而无需公开专有模型的细节或源代码。对于企业而言,这一方案可确保可观测性数据在复杂的 AI 管道中持续流动,而这些管道可能包括多个模型、各种依赖关系和检索增强生成 (RAG) 系统。

OpenTelemetry 在 AI 可观测性领域的核心优势包括:

  • 供应商独立性:组织可以摆脱特定可观测性平台的限制,随 AI 技术的发展灵活扩展。

  • 端到端可见性:遥测数据从 AI 应用程序基础设施的所有组件一致地流动。

  • 前瞻性保障:OpenTelemetry 标准可随 AI 技术的演进同步调整,确保可观测性策略持续有效。

  • 生态系统整合:开放标准支持跨多供应商 AI 解决方案与混合部署模式的可观测性。

  • 元数据标准化:由于 OpenTelemetry 与供应商无关,因此无论开发人员使用哪种可观测性后端或供应商,它都能帮助开发人员捕获与 AI 相关的重要元数据,并保持整个技术栈的可视性。

可观测性与 AI 智能体

由于 AI 智能体在网络中具备高度自主性和自动化能力,因此可观测性平台需要特别关注其行为——尤其是它们在系统内执行的操作以及这些操作的相关日志和跟踪数据。

运用 LLM、记忆往期对话及调用外部工具的能力,正是 AI 智能体的核心价值,而这些能力也是监测、理解与控制难度提升的原因所在。

AI 智能体可能执行的常见操作包括调用应用程序编程接口 (API) 与搜索引擎进行交互、调用 LLM 生成文本或理解用户输入、将请求上报至人工代理,或自动推送安全漏洞或算力不足等相关警报。

虽然这些功能可确保智能体独立运作,但也使其透明度远低于基于显式、预定义规则和逻辑而构建的传统应用程序。通过跟踪与这些智能体流程相关的数据,管理员可以洞察分析智能体的行为,规避违规行为、操作故障,以免用户信任度下降。

AI 智能体可观测性的独特日志包括:

  • 用户交互日志,可记录用户与 AI 智能体间每次交互的情况。

  • LLM 交互日志,可记录智能体与 LLM 之间的交互情况。

  • 工具执行日志,用于衡量所使用的工具和检测智能体类型、使用时间、发送的命令内容以及相关输出结果。

  • 智能体决策日志,用于记录 AI 智能体如何做出决策或采取特定行动(如有)。

AI 可观测性的优势

AI 可观测性的优点包括控制模型使用成本、简化合规以及改进模型本身。

成本控制

深入洞察分析人工智能驱动的工具与 IT 生态系统的交互方式,有助于识别资源浪费。例如,如果组织发现某个模型仅使用了一小部分为其分配的算力资源,DevOps 团队可以缩减规模或将资源转移至需求更紧迫的环节。

AI 合规

AI 可观测性工具可以自动收集、处理和存储 AI 智能体遥测数据,以便进行合规审计。随着欧盟《AI 法案》及美国各州多项法规提案的出台,组织正大力规范 AI 的商业应用并着手保护模型所使用的个人身份信息 (PII),而审计支持也变得愈发重要。

维护模型完整性

对于模型开发人员而言,可观测性工具收集的遥测数据量有助于减少模型漂移、跟踪最具价值且最实用(或最易失效)的特性,并检查是否存在偏见和公平问题。

AI 可观测性与机器学习 (ML) 可观测性

虽然 AI 可观测性是通过其遥测数据理解 AI 系统的实践,但机器学习可观测性能够更具体地呈现 AI 工具在模型层面使用数据的方式。

了解机器学习遥测至关重要,因为模型所采集和学习的数据会不断变化。深入解读模型内部的运作方式,不仅有助于引导管理者确定模型是否出现漂移或效能下降,更能理解其根本原因。

机器学习可观测性的关键指标(通常也包括 LLM 可观测性)可用于衡量模型质量、模型采集的数据本身以及模型与相关基础设施的交互方式。

模型质量

不同类型的模型涉及不同的质量指标,可观测性平台可以对其进行跟踪。

对于可将数据分类为预定义类别的分类模型常见的性能指标包括:

  • 准确性:正确预测数与预测总数的比较

  • 精确度和召回率:衡量所选项目相关性的指标

  • F1 评分:此类指标的常用组合

另一方面,回归模型通常通过均方根误差等指标进行评估,这些指标可衡量模型预测与实际数据点之间的平均差异。

核心数据

机器学习可观测性可以衡量数据漂移(例如输入数据和训练数据之间的显著差异,或其预测的统计分布变化趋势)以及简单的数据质量指标(例如缺失值、错误值和无效值类型)。借助这些指标,机器学习可观测性工具就能执行根本原因分析,以了解模型漂移或在其发生之前加以预防。

运营

机器学习可观测性通常还能衡量与模型相关且更传统的指标,例如延迟、内存使用情况和吞吐量,或模型在既定时间范围内可执行的预测次数。

作者

Derek Robertson

Staff Writer

IBM Think

Matthew Kosinski

Staff Editor

IBM Think

相关解决方案
IBM Instana Observability

利用 AI 和自动化的强大功能,主动解决整个应用程序堆栈中的问题。

深入了解 IBM Instana Observability
IBM 可观测性解决方案

借助人工智能驱动的可观测性,最大限度提高运营弹性,并确保云原生应用正常运行。

深入了解 IBM 可观测性解决方案
IBM® Consulting AIOps

使用生成式 AI 增强 IT 自动化和运营,将 IT 基础设施的每个方面与业务优先事项保持一致。

深入了解 IBM Consulting AIOps
采取后续步骤

了解 IBM Instana® 如何通过 SaaS 或自托管形式提供实时应用程序性能监控及 AI 驱动洞察。

  1. 深入了解 IBM Instana Observability
  2. 了解实际应用