DevOps 开发运维(DevOps) Full Stack Observability指南

第 1 章

开发运维:IT 与运营之间的桥梁

第 2 章

Full Stack Observability 为什么很重要

第 3 章

在开发生命周期中采用左移方案

第 4 章

尽早构建安全功能以加快交付速度

第 5 章

Full Stack Observability 最佳实践

第 6 章

使用像开发运维工程师一样思考的 AI 智能体

第 7 章

开发运维工具包中缺少的部分

第 8 章

开始制定路线图,以更好地工作

办公室里的一男一女坐在一张放有电子设备的桌子前

开发运维:IT 与运营之间的桥梁

您正在快速部署代码、管理复杂基础设施并实时响应事件,同时还需要尽力缩短停机时间,保障业务平稳运行。

但现代系统信息繁杂、架构分散,且始终处于动态变化中。传统的监控工具往往会让用户疲于缓解症状,而不是解决根本原因。

本指南适用于:

  • 工程师,想要缩短平均修复时间 (MTTR) 且避免警报疲劳。
  • 从业者,需要实时了解从容器到 API 的整个堆栈的情况。
  • 问题解决者,随时准备左移并在问题升级之前将其解决。

介绍多种实用战略,可帮助企业:

  • 更快地检测和解决事件。
  • 自动调查和修复。
  • 从一开始就构建更具弹性、可观测性更强的系统。

 

女性在会议中展示密码

为什么 Full Stack Observability 很重要

待监测的内容繁多、待处理的事务繁杂,但可支配的时间却十分有限。

优秀的 DevOps 开发运维文化让团队有能力快速解决问题,专注于研发与创新这类核心工作。配套的工具与系统则为团队提供清晰度支撑,支持他们更自信地开展工作。

全栈应用程序可观测性使您能够监控、分析并了解整个应用程序堆栈的性能与运行状态。但是,作为 DevOps 开发运维专业人员,在实现全栈应用程序可观测性方面,可能会遇到三大挑战。

1
现代应用程序非常复杂,因此很难监控和分析整个堆栈。持续的上下文切换会分散注意力,增加员工倦怠的风险,并减缓故障排除速度,从而难以快速识别和解决问题。
2
手动操作繁琐,需要时刻关注部署情况、追踪不稳定的测试结果以及手动处理无穷无尽的警报,这会扼杀进度。花在繁琐任务上的每一刻,都在消耗本可以用于推动创新、实现自动化和扩展系统的时间和精力。
3
来自不同来源的数据缺乏上下文,因此,很难解释和确定问题的根本原因。此问题会导致团队被大量警报淹没,没有明确的优先级或切实可行的洞察分析。

尽早在开发生命周期中采用左移方案

告别被动追赶!

设想存在这样一种开发文化:能够在早期阶段持续进行调整和改进。在应用程序开发中,左移指的是在开发生命周期的早期阶段就集成测试和安全功能的做法。采用由全栈可观测性支持的左移方案,将能够交付更稳健、更可靠且可观测性更高的应用程序,从而满足业务需求和用户期望。

采用左移方案,并利用智能可观测性,可帮助:

  1. 从一开始就将质量融入到应用程序、环境或体验中,避免下游出现问题。
  2. 持续、主动地及早发现潜在问题,做到防患于未然。
  3. 将遥测数据关联起来,通过自动生成与业务目标一致的处理措施,转化为可执行的故障事件。

为了利用左移开发方案和全栈可观测性首先在持续集成和持续交付 (CICD) 管道早期嵌入自动化测试(例如单元测试和整合测试),以便在部署前发现问题。

采用与生产环境完全相同的可观测性配置监控预发环境,以便尽早发现性能与可靠性方面的问题

借助全栈可观测性工具,追踪全栈服务的依赖关系、延迟与错误率,并依托关联日志、指标和链路追踪数据,加速根本原因分析。

左移示意图
展示自动化解决方案的可视化流程图

尽早构建安全功能以加快交付速度

您还可以采用安全左移理念,以此提升发布安全性。试想一下,船只刚起航就发现漏水,这就好比传统安全管控环节被置于流程末端时的感受。

为防止这种情况发生,必须将可观测性和合规性管理直接嵌入开发人员的集成开发环境 (IDE) 中,将安全功能转化为护栏,既保障安全,又不会拖慢速度。

以下是在第一步就启用安全防护的方法:

  1. 将合成测试标准化为代码,并使用管道触发器实现自动化,防止出现环境偏差。
  2. 采用两层监控方案:通过主机与智能体组合快速检查基础设施运行状况,并通过浏览器/API 测试监控真实用户使用情况。
  3. 在代码编写之初(而不是几天之后)即明确安全要求,防止后期管道故障并降低修复成本。
  4. 利用 AI 实现合规管理和政策执行的自动化,使安全功能起到护栏的作用,在不阻碍开发人员的情况下为他们提供支持。

安全左移不只是一个理念,更是一套工作流程。现代研发流程不再是先编码、后加固,而是从一开始就嵌入可观测性与合规管理。

从安全瓶颈到更快发布
挑战:迟发检测

痛点:部署后发现的漏洞会导致代价高昂的回滚操作、紧急补丁,并使 MTTR 飙升

影响:安全性将成为瓶颈,从而阻碍 CI/CD 管道并进而扼杀速度。

解决方案:自动化与早期检测

策略:将安全扫描直接嵌入 IDE 中,以便在编码过程中发现问题。

可观测性:实施双层合成监测,以便在用户检测异常之前先行检测。

结果:有保障的速度

结果:从一开始就提交干净、合规的代码。

优点:开发人员可以放心地更快进行部署,且安全性成为速度的推手,而非阻碍。

将此历程可视化有助于团队在目标上保持一致。我们正从“停车标志”安全模式转向“护栏”模式。

Full Stack Observability 最佳实践

采用端到端监控埋点:让系统的每个环节都具备可观测性。
  • 为代码、服务和基础设施添加监控功能。
  • 在所有组件中使用跟踪和指标。
  • 在 CICD 管道中创建新服务时自动应用检测工具。
利用运行状况指标(SLO 和 SLI):聚焦核心关键指标进行监控。
  • 跟踪关键指标,例如部署频率、交付周期和 MTTR。
  • 保持服务级别指标 (SLI) 与业务目标和客户影响一致。
  • 利用关键绩效指标 (KPI) 和服务级别目标 (SLO) 设置未达到性能目标时的警报。
尽可能全链路追踪:跟踪请求流转,更快定位并解决问题。
  • 在日志和跟踪中使用一致的 ID。
  • 培训团队能够解读跟踪流程并发现问题。
  • 将跟踪链接到日志和指标以获得更深入的洞察分析。
梳理服务依赖关系:关联各系统,加快问题排查速度。
  • 维护一份最新的服务关系映射。
  • 在更改时自动更新映射。
  • 在仪表板中显示依赖关系以便快速访问。
采用业界顶尖工具:将可观测能力与工作流程深度打通。
  • 利用工具整合点,全面了解系统。
  • 选择并关联最适合具体需求和现有工作流程的工具。
  • 通过自动执行重复任务,减少人工错误并加快交付速度。
优化告警设置:过滤无效干扰,聚焦关键问题。
  • 设置明确的警报级别。
  • 对相关警报进行分组以减少混乱。
  • 定期清理过时或易受干扰的规则。
使用自动化运维剧本:快速响应并减少停机时间。
  • 为常见问题编制运行手册。
  • 将警报链接到有用的指南或脚本。
  • 正式使用自动化修复程序之前对它们进行测试。
开展混沌工程:在压力场景下测试系统的弹性与抗风险能力。
  • 在安全环境中运行故障测试。
  • 模拟中断和性能问题。
  • 使用结果来改进监控和响应

使用像开发运维工程师一样思考的 AI 智能体

图示为多个代表基础设施的立方体

当系统出现故障时,大家总会第一时间找到您。而这种压力会不断累积——尤其是在系统规模庞大、故障毫无征兆地突发时。一旦问题发生,您往往没有时间逐一审视日志,或手动拼凑定位故障原因。

这便是由智能体 AI 驱动的智能可观测性平台发挥作用的地方。它们如同另一双慧眼——主动排查问题、串联线索,并清晰列出故障解决步骤。AI 智能体能够模拟您的思路,与您协同工作,在分秒必争的时刻更快排查故障、挖掘关键洞察并执行处置。无需从零开始分析,它们能帮您抢占先机。

自动化任务执行 - AI 智能体可处理重复性任务,如代码集成、测试、部署和监控,让工程师能够专注于战略性工作。

预测性监控与故障响应 - 通过分析历史数据与实时数据,AI 智能体可预测故障、检测异常并触发自动化响应,从而最大限度减少停机时间,提升系统可靠性。

持续改进 - 通过机器学习,智能体将识别低效之处,并提出或实施跨管道的改进建议,从而实现更快的迭代和优化。

这一流程对您而言究竟意味着什么?

采用 AI 智能体的智能工具,能帮您专注于系统构建,而非时刻值守看护。它们在后台静默可靠地运行,让您工作思路更清晰、压力更小。

无论您是在大规模管理微服务,还是排查重大故障,拥有合适的可观测性工具都至关重要。

自动化可观测性解决方案为 DevOps 开发运维团队提供了对应用程序和基础设施性能的深度实时洞察分析,助力团队快速、自信地识别和解决问题。

这意味着不必再熬夜排查性能问题。这意味着在问题恶化之前就能提前发现。这意味着在大规模部署时,能少一份后顾之忧。

圆形工作流图插图,其中包含连接三张白色卡片的蓝色连接线,并展示了一个包含三个关键阶段的软件开发过程

想象一下,您正在将一项新服务部署到生产环境。短短几分钟内,延迟飙升,错误率开始上升——但您不必在多个监控面板间手忙脚乱,只需借助智能可观测性平台。通过对整个技术栈的实时可视能力,您能清晰定位受影响的服务,将问题追溯至配置错误的依赖项,并在事态升级前完成修复。

在瞬息万变的 IT 环境中,被动响应与主动解决问题的区别,往往取决于您所信赖的工具。当可观测性具备智能化、自动化与深度集成能力时,它就不再只是一个监控面板,而是您的技术架构中一直缺失的关键一环。专为场景打造的可观测性解决方案能够助力实现:

一名女子指着屏幕

开发运维工具包中缺少的部分

1
确保对整个应用程序堆栈(包括所有服务、API、数据库和基础设施组件)进行全面监控。
2
通过由智能体式 AI 提供支持的事件发现功能,最大限度减少停机时间和运营开销,快速检测并解决整个堆栈中的事件。
3
通过监控应用程序、基础设施、服务和系统,实现整个技术堆栈的持续且全面的可见性,支持更一致、更可靠的交付。
4
获得全栈知识和上下文,加快识别和解决问题的速度,实现深度分析和实时自动修复。
5
利用人工智能驱动的智能体进行智能事件调查:自动进行根本原因分析,快速查明并解决关键问题。
6
利用智能警报和通知功能,并根据风险和影响设定阈值,优先处理对企业最重要的事项。

开始构建实现更智能业务的路线图

我们必须承认,现代 IT 环境极为复杂。正因如此,将 AI 驱动的智能化可观测性融入整个堆栈,不仅大有裨益,更是不可或缺的关键举措。如果采用左移策略,从一开始便将质量融入开发流程,就更有能力尽早发现问题,快速修复问题,确保一切进展顺利。

这就是 IBM® Instana 的用武之地,这款可观测性解决方案专为开发运维团队打造,在需要之时提供所需的清晰洞察。减少盲目猜测,告别深夜告警,让您有更多时间专注于真正重要的工作。

还在等什么?迈入 DevOps 的未来时代,让技术与您并肩协作,带来更出色的性能、更高的可靠性,以及面向未来的坚实底座。探索更多,修复更多,成就更多。

耳听而虚,眼见为实。不妨亲自体验一番吧!

坐在橙色沙发上指着笔记本与同事交谈的男士

© Copyright IBM Corporation 2025

IBM、IBM 徽标、IBM Instana 和 Instana 是 International Business Machines Corporation 在美国和/或其他国家或地区的商标或注册商标。其他产品和服务名称可能是 IBM 或其他公司的商标。IBM 商标的最新列表可参见 ibm.com/legal/copytrade

本文档为自最初公布日期起的最新版本,IBM 可能随时对其进行更改。

IBM 并不一定在开展业务的所有国家或地区提供所有产品或服务。

本文档内的信息“按现状”提供,不附有任何种类的(无论是明示的还是默示的)保证,包括不附有关于适销性、适用于某种特定用途的任何保证以及非侵权的任何保证或条件。IBM 产品根据其提供时所依据的协议条款和条件获得保证。