Operações eficientes

IBM Well-Architected Framework

Um retângulo 3D azul com um símbolo de energia branco sobre ele, sobre um fundo branco.
Visão geral

O Pilar de Operações Eficientes concentra-se em soluções que atendem aos requisitos de insights de cargas de trabalho em nuvem, processos digitalizados e manutenção de uma postura operacional proativa. Isso é possível por meio de práticas e orientações sobre as equipes de implementação, automação e ferramentas de IA para monitorar, gerenciar e manter as soluções de maneira segura, confiável e com um alto desempenho.

Princípios

Exemplos de modelos operacionais incluem "Você constrói, você executa" ou estabelecer uma prática de Engenharia de Confiabilidade Local. Esses e outros modelos operacionais dependem do entendimento das necessidades e do contexto da empresa, dos clientes, dos administradores e das equipes de desenvolvimento.

É importante compreender que os modelos operacionais devem ser continuamente avaliados, ajustados e adaptados às necessidades da organização, considerando fatores como o setor, requisitos regulatórios, soluções existentes e objetivos do usuário.

A automação de tarefas de operações comuns e rotineiras usando scripts, agentes inteligentes e outras ferramentas ajuda a manter altos níveis de serviço.

Esse princípio deve ser escalado entre as equipes e dependências para alcançar uma eficiência/velocidade de ponta a ponta, precisão, redução de erros, agilidade e garantir a consistência dentro do ambiente operacional.

Atualmente, as equipes de operações têm uma grande variedade de ferramentas operacionais e podem escolher as melhores para aspectos operacionais específicos, o que pode levar à proliferação, se não for gerenciada.

As variações e a integração entre ferramentas podem gerar desafios para a integração de membros da equipe, licenciamento e controle de custos, agilidade e maior vulnerabilidade. As equipes de operações devem buscar continuamente minimizar e consolidar as ferramentas operacionais e consoles em uso.

Nem toda solução exige disponibilidade 24 horas por dia, 7 dias por semana, ou tempo de resposta instantâneo. Soluções eficientes devem suportar múltiplos níveis de serviço em uma única solução e permitir que a carga de trabalho seja alocada na infraestrutura que melhor atenda aos requisitos operacionais das cargas de trabalho.

Os níveis de serviço também orientarão as equipes de desenvolvimento a considerar as configurações e a instrumentação no nível da aplicação para dar suporte aos objetivos de negócios e a uma experiência de usuário positiva.

As equipes operacionais eficientes são multidisciplinares, ou seja, possuem todas as habilidades necessárias para dar suporte a um conjunto de aplicações. Para alcançar esse recurso, é preciso considerar todo o stack de cargas de trabalho, incluindo os serviços de aplicação e infraestrutura.

As ferramentas de soluções e operações devem apoiar este modelo, permitindo tanto a integração (entre os componentes da solução) quanto a segregação (de outras soluções) de ferramentas e informações de operações.

O que é engenharia de confiabilidade local?

Muitas práticas operacionais são comuns e podem ser automatizadas e acessadas por meio de uma API para maior controle, por exemplo, não apenas criando automação para gerenciar segredos, mas também criando uma API de longa duração para executar as operações de gerenciamento de segredos.

Essa abordagem abrange a integração de novos recursos e a integração em um fluxo de trabalho dinâmico. Isso pode padronizar procedimentos e reduzir o tempo de espera entre as equipes.

 

Práticas

Práticas e orientações para a criação de soluções operacionais eficientes. Essa orientação orienta as equipes na implementação de princípios de operações eficientes e na garantia da confiabilidade, disponibilidade e desempenho de sistemas complexos. Essas práticas ajudam as organizações a atingir suas metas de confiabilidade centradas no usuário e manter a integridade de seus serviços.

As práticas operacionais eficientes são ajustáveis e podem ser dimensionadas para atender às necessidades e ao contexto específicos dos consumidores, sistemas e serviços de uma organização.

Os requisitos, cargas de trabalho e arquiteturas específicos da organização ditarão as melhores práticas a serem adotadas. A melhoria contínua por meio de feedback, avaliação e alinhamento com a estratégia de nuvem da organização é essencial para a eficiência e a eficácia contínuas.

O objetivo é criar uma cultura de confiabilidade e colaboração que aprimore a experiência do usuário, gere valor para o negócio e minimize as interrupções.

Cada aplicação em nuvem com sua própria equipe administrativa ou de SRE tenderá a adotar ou criar uma solução de monitoramento. Para minimizar os painéis de controle, as equipes de operações devem preferir trabalhar com uma equipe de ferramentas centralizada para integrar uma solução de monitoramento centralizada.

Consolidar os registros de sistema, eventos e aplicações em um local central simplifica bastante o monitoramento operacional e o diagnóstico de problemas, minimizando o número de fontes e locais de registro que precisam ser monitorados e gerenciados pela equipe de operações. Isso permite que as equipes configurem sistemas de monitoramento abrangentes para coletar e analisar continuamente as métricas e registros de vários componentes do sistema. Esses sistemas disparam alertas quando os SLIs se desviam das faixas aceitáveis, permitindo que os engenheiros ou processos automatizados respondam rapidamente para lidar com os sinais indicativos.

IBM Observability with Instana IBM Cloud Pak for AIOps

O antigo modelo de "se quebrou, conserte" simplesmente não funciona em ambientes de TI modernos com maiores demandas dos clientes, vastas soluções multinuvem e menos funcionários qualificados para gerenciar tudo. As ferramentas de operações assistidas por inteligência artificial (AIOps) ajudam as equipes de operações a manter a disponibilidade, o desempenho e a segurança de seus ambientes, além de identificar e resolver rapidamente problemas potenciais e em andamento nesses ambientes.

A adoção de AIOps é viabilizada por meio de atividades essenciais, incluindo:

  • Coleta de dados em processos operacionais, como incidentes, problemas e mudanças
  • Treinamento de modelo alinhado a SLOs e SLIs
  • Detecção e triagem automatizadas em serviços individuais e integrados
  • Resposta e remediação automatizadas para permitir sistemas de autocorreção
  • Feedback contínuo e aprendizado
IBM Cloud Pak for AIOps

As especificações e configurações da infraestrutura são gerenciadas como código, ou seja, usando ferramentas de provisionamento automatizadas para permitir o gerenciamento de configurações e garantir a consistência da infraestrutura em toda a implementação.

A configuração consistente da infraestrutura no código garante ambientes reproduzíveis ao longo dos ciclos de vida do SLDC e implementações em todos os ambientes.

Essa abordagem permite os principais benefícios, incluindo:

  • Governança, auditabilidade e controle de versão utilizando sistemas como o Git
  • Permitir a colaboração e a capacidade de reverter alterações quando necessário
  • Automação e velocidade de provisionamento e gestão de recursos
  • Escalabilidade de acordo com limites e gatilhos
  • Reusabilidade entre equipes e projetos

 

Ansible

As equipes de produto trabalham com os stakeholders para definir os Objetivos de Nível de Serviço (SLOs) e estabelecer os Indicadores de Nível de Serviço (SLIs) que medem a resiliência e a entrega de um serviço. Os SLIs podem ter uma relação de muitos para um com os SLOs, aproveitando métricas mensuráveis como latência, taxas de erro e tempo de atividade, que contribuem para o cumprimento dos objetivos estabelecidos.

O estabelecimento de SLOs e SLIs possibilita os principais benefícios, incluindo:

  • Metas mensuráveis para garantir que as equipes tenham objetivos bem definidos e claros
  • Foco centrado no usuário, baseado nas expectativas do negócio e na experiência do usuário
  • Medição quantificável que permite uma medição e avaliação objetivas
  • Orientação sobre o alinhamento com a qualidade dos serviços ao usar fornecedores externos
  • Medição comum entre as equipes (desenvolvimento, operações e negócios)

Desenvolver consistentemente procedimentos que definam funções, responsabilidades, canais de comunicação e caminhos de escalonamento durante processos-chave, como gerenciamento de incidentes, mudanças e problemas. Esses procedimentos garantem o uso funcional, seguro, escalável e econômico dos recursos de nuvem.

Os procedimentos comuns de operações de nuvem incluem:

  • Provisionamento e implementação baseados em modelos predefinidos de Infraestrutura como Código.
  • Monitoramento e alertas para notificar as equipes quando os limites ou parâmetros de integridade forem ultrapassados
  • Backups regulares de dados e configurações para garantir planos de recuperação robustos e oportunos
  • Monitoramento da utilização de recursos e identificação de oportunidades de otimização de custos
  • Realizar testes de recuperação de desastres regularmente para validar a eficácia dos planos de recuperação
  • Análise das tendências de uso e crescimento para prever as necessidades de recursos
  • Desenvolvimento de planos de resposta a incidentes para lidar com eventos críticos, como interrupções e violações

A implementação e gerenciamento de procedimentos bem definidos inclui simulações de processos para emular cenários e garantir que as equipes estejam bem preparadas para executar as tarefas com qualidade e eficiência em todas as áreas.

Após a ocorrência de um incidente inesperado, as equipes realizam análises pós-incidente e investigações imparciais para identificar os fatores contribuintes, a causa raiz e a eficácia da resposta. Em seguida, é implementada uma solução digitalizada e/ou automatizada para evitar incidentes semelhantes no futuro.

Essa prática inclui avaliações regulares e refinamento com base em insights baseados em dados, análises pós-incidente e feedback dos stakeholders. Além disso, à medida que os serviços são integrados e incorporados aos ambientes, a integração com as soluções automatizadas existentes é fundamental para manter uma postura proativa.

Isso garante que os processos não permaneçam estáticos, mas sim evoluam para atender aos objetivos, requisitos e desafios dinâmicos dos negócios.

Colabore com as equipes de segurança para garantir que as medidas de segurança sejam integradas aos processos de desenvolvimento, implementação e manutenção.

Isso inclui a adoção de medidas de segurança e ciclos de vida de desenvolvimento de software (SDLC) mais abrangentes, com foco na implementação de políticas por meio de soluções codificadas e automatizadas.

A colaboração consistente com a segurança garante que as cargas de trabalho implementadas permaneçam alinhadas às políticas dinâmicas da organização e aos objetivos de negócios. Outros processos incluem a realização de avaliações de segurança regulares, a incorporação da gestão de vulnerabilidades e a aplicação de verificações periódicas de conformidade.

 

Recursos IBM Cloud Pak for AIOps
uma plataforma abrangente de gestão de operações com auxílio de IA que ajuda as equipes de operações a contextualizar os dados operacionais e a resolver problemas de forma colaborativa, além de fornecer recomendações proativas para ajudar as equipes a evitar problemas antes que eles ocorram.
IBM Instana Observability
uma plataforma full stack de observabilidade operacional que integra a equipe de operações por meio de uma plataforma comum e visualizações contextualizadas que dão suporte a todas as equipes de entrega, incluindo DevOps, SRE, engenharia de plataforma e ITOps.
IBM Turbonomic
uma plataforma de automação de operações e visualização full stack que ajuda as equipes de operações a otimizar os recursos de infraestrutura em termos de custo e desempenho.
IBM DevOps Automation
uma ferramenta de software inteligente que ajuda as equipes a entregar software com mais eficiência.
Red Hat Ansible
uma plataforma de automação em nuvem híbrida automatiza tarefas repetitivas para economizar tempo e aumentar a produtividade.
Pipelines do OpenShift
solução de integração e entrega contínuas nativa da nuvem (CI/CD) baseada em recursos do Kubernetes que é executada no Red Hat OpenShift e, portanto, pode ser implementada e usada em qualquer lugar na nuvem híbrida.
GitOps do OpenShift
O GitOps do OpenShift é uma forma declarativa de implementação contínua para aplicações nativas da nuvem.
Equipes multidisciplinares e alinhadas à aplicação
O que é engenharia de confiabilidade local (SRE)? apresenta uma visão geral do SRE e de seu papel em uma solução de nuvem híbrida.
Pilares do Well-Architected Framework Híbrido e portátil Resiliência Segurança e conformidade Desempenho Operações financeiras e sustentabilidade
Próximas etapas