根本原因分析

Instana 管理事件并加快识别可能的根本原因。 Instana 自动检测事件、问题和变更,帮助您发现、理解并排查应用程序的服务质量问题。

DevOps 从业者在当今由成百上千个组件组成的动态应用程序世界中面临重大问题。 当出现故障时,他们需要能够尽快发现并了解问题,甚至在用户开始感受到服务影响之前。 DevOps 尽快恢复服务后,他们需要修复确切的根本原因,并确保问题不会再次发生。 DevOps 可能需要数小时甚至数天才能查明问题的根本原因,而且很多时候,原因仍无法查明。

先决条件

对于 SaaS 以及自托管的 Instana 环境,推测性根本原因分析功能默认处于启用状态。 但是,若要查看事件的根本原因分析,您的环境必须满足以下先决条件:

  • 必须存在一个应用程序 Smart Alert 事件。 仅支持对由应用程序智能警报生成的事件进行可能根本原因分析。 此外,并非所有此类警报中的事件都能确定其可能的根本原因。
  • 如果您使用的是“自定义事件”,则必须迁移至 Instana 智能警报。
  • 权限 :查看根本原因分析无需任何权限。 但是,要配置事件创建功能,您必须拥有一个具备 “事件和警报管理 ”访问权限以及“事件和警报配置 ”权限的账户。

有关设置权限的更多信息,请参阅 “管理用户访问权限 ”。

自动推断的可能根本原因

为了缩短 DevOps 从业人员的平均修复时间(MTTR), Instana 能够自动识别事件的可能根本原因。 Instana 的“可能根本原因”引擎采用统计性、非确定性分析模型,而非依赖固定规则。 Instana 利用该模型的因果人工智能算法,动态且持续地分析跟踪统计数据和拓扑结构,评估所发现的任何模式、依赖关系、异常关联以及遥测置信度评分,从而推断出最有可能导致该事件的组件。 该算法每10分钟运行一次推理,以精准定位可能导致错误传播的实体。

当因果人工智能算法识别出可能导致问题的实体(或多个实体)时 ,“可能的根本原因 ”部分将显示最多三个被识别为最可能根本原因的实体。 这些因素是按引发该问题的可能性排序的,因此最可能的根本原因会首先显示。 这些实体可以是任何由 Instana 监控并显示的物理或逻辑实体。 任何显示的实体均链接至该实体的详情页面,该页面描述了该实体在事件发生时的状态。 通过确定这一可能的根本原因, Instana 能够帮助 DevOps 开发人员更快速地查明应用程序故障的实际原因并找到解决方案。

重要提示: 并非所有事件都能确定其可能的根本原因。 只有当 AI 模型对识别出的可能根本原因达到足够的置信度时,该事件的“可能根本原因”才会显示在该事件的详情页面上。 如果置信度不够高, Instana 会刻意不显示可能的根本原因或相应的界面区域,以避免指出导致该事件的误导性或错误原因。
Instana 仅对以下实体类型中由智能警报生成的事件进行分析和识别其可能的根本原因:
  • 应用程序透视图
  • 服务
  • 端点
  • 应用角度的服务水平目标
图 1. 可能的根本原因
可能的根本原因
当确定了可能的原因,且事件的 “可能根本原因 ”部分确实显示在详细信息页面上时,该部分包含以下信息:
  • 最可能的根本原因实体,以及任何其他已识别的可能根本原因,还有相关的基础设施或应用程序信息。 还包含了指向所示层次结构中该实体详情页面的链接。
  • 用于确定该实体的证据,旨在帮助您的 DevOps 从业者理解为何将特定实体识别为可能的根本原因。
  • 针对已识别的可能根本原因的建议措施清单。
  • 一个用于启动智能事件调查的选项(UI 按钮),该功能利用基于大型语言模型(LLM)的先进调查能力,提供更深入的分析。 了解更多信息
  • 一个选项(UI 按钮),用于查看与可能的根本原因实体相关的事件,以及指示故障发生概率的概率级别。 相关事件均为近期发生在可能的根本原因实体上的事件。 有了详细的相关事件,DevOps 实践者就能快速识别导致问题的问题、事件或变更事件。
  • 一个用于查看相关跟踪错误消息和日志的选项(UI 按钮),可帮助用户快速锁定可能的根本原因,并一目了然地掌握问题的更多细节。
    • 通过流经可能原因的跟踪记录(如果您的系统记录了任何跟踪错误),可以提取相应的跟踪错误消息。 该表格既显示了错误消息本身,也显示了在指定时间范围内记录的该特定错误消息的出现次数。
    • 跟踪日志是对系统呼叫流事件的更全面的记录。 跟踪日志按计数排序,包括 "ERROR和 "WARN等日志级别。

事件

事件的严重程度等级最高。 当用户访问的边缘服务受到影响或存在迫在眉睫的影响风险时,就会创建这些服务。 使用动态图,针对每个突发事件关联所有相关事件,以提供上下文和根本原因分析假设。

某项服务的响应速度突然比平时慢,我们将这种情况称为平均延迟的突然增加。 该事件会自动标记为黄色作为警告。颜色会一直显示到该事件激活为止。 解决后,颜色会变为灰色,但仍可用于下拉菜单。 请参阅以下事件示例。

图 2. 突发事件
事件

事件详细信息视图组织为三个部分:

  1. 该头包含有关事件的关键事实的基本信息。

    • 开始时间;
    • 结束时间(如果仍在进行中,那么为当前时间);
    • 仍处于活动状态的事件数;
    • 所涉及的更改数;
    • 受影响实体的数量。

    您可以查看该事件的开始日期、结束日期(如果已关闭)、仍有多少个事件处于活动状态、该事件包含多少项变更,以及受影响的实体数量:

    图 3. 事件关键绩效指标
    事件关键绩效指标
  2. 第二部分提供了随时间变化的事件发展的直观表示。 该图表展示了完整的时间范围,从开始到结束,并按开始时间排序列出了所有事件。 该视图在折叠时限制为 7 个事件。 如果您的事件一次包含超过 7 个事件,请按展开按钮以查看完整视图。 单击任何一个条形将打开该问题的详细信息视图:

    图 4. 研究对象
    研究对象
  3. 第三部分详细说明了第二部分中的图表视图。 按开始时间排序的所有事件列表可让用户查看每个事件的所有可用信息。 点击某项活动以展开详情,查看该活动的全部信息:

    图5。 扩展事件
    扩展事件

详细信息帮助您了解事件,然后是多个图表,其中绘制了相应的度量值以进行可视化。 如果某个事件仍处于活动状态,那么图表将继续呈现新的传入度量值。 有两种旗帜可供选择。 一个标志是强调事件影响了服务,另一个标志是事件引发了事件。 如果可用,这些标记会显示在列表中的每个事件上方。

当您关注一个事件时,详细信息部分提供的信息与第 3 点事件列表中描述的信息相同。

问题

“问题 ”是指当应用程序、服务或其任何部分出现性能下降时所创建的事件。 Instana 该产品内置了数百个经过精心筛选的健康指标,可检测从服务质量下降、复杂的基础设施问题到磁盘空间饱和等各类问题。 当指标、事件或元数据恢复到预期值时,问题将自动解决。

除了内置问题,您还可以定义定制事件以检测特定于您的系统的问题。

要查看 Instana 检测到的所有问题(包括内置问题和自定义问题),请转到 “事件 ”视图,然后选择 “问题 ”选项卡。 您可以使用 “动态关注 ”来筛选问题。

每份 Instana 报告均包含以下信息:

  • 严重性:该信息可以是 "危急"(CRITICAL)或 "警告"(WARNING)。 CRITICAL 意味着直接或间接存在数据丢失或服务中断的风险。 “警告”指任何其他可能影响用户体验或长期导致问题的性能问题。
  • 问题的开始时间、结束时间和持续时间。
  • 受影响的实体:一个或多个实体受到该问题的影响。
  • 详细信息:提供更多背景信息及解决问题的具体措施的补充说明。
  • 指标:显示问题发生前后相关指标值的指标图表。
  • 如有需要,请访问 Unbounded Analytics ,以排查受此问题影响的跟踪、调用或页面加载。
图6。 活动详情示例
活动详情示例

在此示例中,一个 Linux 机器上的 CPU 耗用时间可疑,因此被标记为问题。 一个问题本身不会触发警报,但 Instana 会记录该问题的发生。 如果该系统所连接的服务运行异常,此问题即属于该事件的一部分。 这种方法是 Instana 的主要优势之一,因为您无需手动关联事件与性能问题。 仅仅因为某个进程在一段时间内占用了过多的 CPU 资源,并不意味着存在问题。 只有当这些信息影响到某项服务时,才具有相关性。

有关管理内置和自定义问题的更多信息,请参阅 “管理内置事件”

由于 Instana 掌握所有受监控服务之间的依赖关系,因此当事件对用户造成影响时,它会针对所有服务质量问题触发事件。 它还会针对关键基础设施问题触发事件,例如磁盘空间已满以及 Elasticsearch 集群出现“脑裂”情况,因为这些问题很可能导致数据丢失。

注意: 对于流量稀少的应用程序、服务或端点(例如,每 15 分钟仅有一个调用),我们认为其无法为问题检测提供充分依据。 问题的严重性在其生存期内可能会更改。 它表示此特定问题所达到的最高严重性。
Draft comment:

Impacted Users for application issues (private preview)

This feature is under private preview. You can contact the technical Instana support to get included in this program.

By using this feature, you can see the impacted users of a specific event, and get valuable insights into how events are affecting your users by quickly identifying and addressing issues that impact user experience.

Availability

To use this feature, ensure that the following conditions are met:
  • Both your front-end (website or mobile app) and back-end servers are monitored by Instana.
  • The correlation between front-end and back-end monitoring functions as expected. For more information, see [Backend correlation](../website_monitoring/backend_correlation.md).
  • The Impacted Users feature is currently supported only for application issues.

What is an impacted user?

An impacted user is a user whose experience is negatively affected by an application issue that triggers an event. For example, an impacted user might be someone whose journey or visit to your website or mobile app is disrupted due to a back-end server error issue as follows:
  • The user encounters a critical error page and cannot continue using the site or app.
  • The user experiences significant delays or timeouts, leading to a disrupted experience.
  • The user's actions (such as form submissions or transactions) fail to complete due to server-side issues.

Event data correlation and impact analysis

When an event is triggered, the system correlates data from your front-end and back-end monitoring to identify which end users are impacted. Then, you can detailed information about the affected users and understand the scope and impact of the issue.

更改

更是指代表系统中发生变化的事件,例如服务器的启动/停止、部署以及配置变更。 此外,还分为

  • 更改 - 更改组件的配置,例如版本、环境变量值和其他组件
  • 离线/在线 - 跟踪管理组件的存在情况

更改事件是重要的信息,与动态图表一起使用可自动检测配置更改与事件的关系。

图7。 变更详情示例
变更详情示例

“事件”视图

要查看 Instana 检测到的所有事件,请转到 “事件” 仪表板,然后选择 “事件 ”、 “问题、“变更”或 “全部 ”选项卡,以查看相应的事件类型。

图8。 活动 - 搜索视图
活动 - 搜索视图

所有事件的筛选功能

动态焦点查询

通过 Instana 发现的事件进行搜索,依赖于 “动态聚焦 ”功能。 在“事件”条形图中选择一个或多个条形后,“事件”表格中将仅显示所选条形中包含的事件。 通过选择事件条形图中的条形,您可以在不更改当前时间间隔的情况下,对事件进行详细查看。 您还可以使用搜索框,根据“概览”表格中“标题”或“发生于”列(即事件发生的服务)中的数据查找特定条目。 在此示例中,搜索查询是 event.text:"Error rate". 结果是标题中包含 "错误率 "短语的所有事件列表:

筛选表

“事件”视图通过专用的 UI 筛选器提供了强大的筛选功能。 可以使用以下三个主要筛选选项对事件列表进行筛选:

  • 瞬态事件 :事件是瞬态的、非瞬态的,还是两者兼有。
  • 事件类型 :指事件是内置的还是自定义的。
  • 智能警报 :如果事件是由应用程序、网站、合成监控、基础设施、移动端、日志或服务水平目标(SLO)触发的智能警报所引发的。

这些筛选器可以单独使用,也可以组合使用,从而快速查找相关事件,并将故障排除工作集中在最重要的方面。

图9。 活动 - 搜索视图
活动 - 搜索视图