Tipos de eventos

Para ajudá-lo a gerenciar a Qualidade de Serviço de seus aplicativos, a Instana detecta três tipos de um evento.

Incidente

Um incidente ajuda você a entender situações que impactam seus serviços de borda e a infraestrutura crítica, aprendendo automaticamente seu comportamento e funcionamento e, em seguida, enviando alertas quando eles se tornam não funcionais. Os serviços de borda são o que os clientes ou outros sistemas fora do aplicativo monitorado realmente acessam, eles são as entregas externas do aplicativo.

Os incidentes são criados assim que o Instana detecta que uma indicação de desempenho chave (KPI) foi violada em um serviço de borda ou um problema crítico de infraestrutura. Para obter mais contexto, consulte nosso blog Analisar e derivar Funcionamento do Aplicativo .

Para serviços de aplicativos descobertos, o Instana rastreia os KPIs a seguir:

  • Carregamento (chamadas/segundo).
  • Latência (tempo de resposta em milissegundos).
  • Erros (taxa de erro).

O Instana mede automaticamente esses KPIs para cada serviço e aplica o aprendizado de máquina em cada um para descobrir o funcionamento de um serviço. Os problemas típicos detectados são:

  • A taxa de erro é maior do que o normal.
  • O desempenho do serviço é lento.
  • Há uma queda repentina de carga.

Os KPIs são determinados por meio da captura e análise de cada rastreio nos serviços e no aplicativo. Os Traces capturam automaticamente erros, como códigos de status ou exceções, para identificar se algo deu errado. Os rastreamentos também medem o tempo gasto em cada serviço e em seus componentes subjacentes. Com base na arquitetura Dapper do Google, um rastreamento é uma árvore composta por intervalos, sendo que um intervalo é uma unidade básica de trabalho. No mundo do microsserviço, um período normalmente é igual a uma solicitação de serviço ou componente, como um banco de dados. Isso significa que nós não apenas temos um rastreio de ponta a ponta do aplicativo, mas também as informações sobre o desempenho de cada serviço e componente individual. 

Se o funcionamento de um serviço é impactado, o Instana cria um novo incidente e, ao percorrer o Gráfico Dinâmico de problemas e eventos, correlaciona-o com todos os outros incidentes. Isso dá uma visão geral abrangente da situação em relação ao serviço e ao impacto do evento.

Problema

Um problema é um evento que é acionado se algo fora do comum acontece.

Problemas de infraestrutura crítica, como saturação de disco e situações de split-brain do cluster Elasticsearch, acionam incidentes porque seu resultado final é muito provavelmente a perda de dados.

No exemplo anterior, o tempo de roubo da CPU em uma máquina Linux é suspeito e, portanto, marcado como um problema. Um problema por si só não aciona um alerta e o Instana simplesmente constata que ele aconteceu. Caso o serviço ao qual este sistema está conectado apresente mau funcionamento, esse problema será considerado parte do incidente. Essa metodologia é um dos principais benefícios do Instana porque libera você de correlacionar manualmente eventos e problemas de desempenho. O fato de algo estar consumindo muita CPU por um tempo não significa necessariamente que haja um problema. Somente quando um serviço for impactado isso será uma informação relevante.

O Instana registra o horário em que um problema ocorre pela primeira vez e também quando a condição deixa de existir (horário de início e de encerramento). Neste caso, você vê que o roubo da CPU ultrapassou o limite de 5% apenas por cerca de dois minutos e meio (de 07h08min37s a 07h10min54s). Clique na linha do problema para ver os detalhes no painel de detalhes do problema. O aumento no roubo da CPU é evidente por volta das 17h10.

O link “Ver evento integrado ” leva você diretamente à definição correspondente nas configurações de Eventos e Alertas para esta questão. Isso ajuda a entender em que base um determinado problema foi criado.

Observação:

  • Aplicativos, serviços ou pontos de extremidade que recebem tráfego esporádico — por exemplo, uma chamada a cada 15 minutos — não são considerados como tendo base suficiente para nossa detecção de problemas.
  • A severidade de um problema pode mudar durante o seu tempo de vida. Representa a maior gravidade já atingida pelo problema específico.

Alterar

Uma _alteração em um ambiente inclui, entre outras coisas, implantações, alterações de configuração, inicializações ou desligamentos de servidores, e é categorizada por:

  • Mudanças - Mudança na configuração de componentes.
  • Offline/Online - Acompanhamento da presença dos componentes sob gerenciamento.

O Instana reconhece mudanças ao rastrear configurações relevantes específicas para cada tecnologia monitorada, além de monitorar se algo fica on-line (monitorado pelo Instana) ou fica off-line (não é mais monitorado pelo Instana).

Toda mudança é registrada e geralmente tem uma duração de apenas um segundo (diferença de horário de início e de encerramento). Semelhante a problemas, os eventos de mudança também estão correlacionados a um incidente, caso eles sejam relevantes, poupando você de um alerta apenas porque um sistema ficou off-line. Talvez ele tenha sido desligado porque a carga diminuiu no final do dia de trabalho e ele não era mais necessário.