Alertes intelligentes pour l'infrastructure

Avec Smart Alerts, vous pouvez recevoir automatiquement des alertes en fonction des métriques d'infrastructure que vous sélectionnez.

Instana vous propose des seuils et des paramètres de configuration lorsque vous sélectionnez dans la liste les indicateurs d'infrastructure pour lesquels vous souhaitez recevoir des alertes. Vous pouvez ajouter plusieurs canaux d'alerte à la configuration, et Instana crée automatiquement une alerte personnalisée pour vous.

Kubernetes - Alertes intelligentes spécifiques

Si vous devez surveiller les environnements d' Kubernetes, vous pouvez accéder à une vue dédiée des alertes intelligentes d'infrastructure qui affiche uniquement les alertes liées à Kubernetes. Cette vue est disponible dans l'interface utilisateur d' Instana ( Plateformes > Kubernetes > Alertes intelligentes ) et offre une expérience optimisée aux administrateurs d' Kubernetes. Pour plus d'informations, consultez la section « Alertes intelligentes pour l'infrastructure »

Ajouter une alerte

Pour ajouter une alerte, procédez comme suit:

  1. Dans le menu de navigation de l'interface utilisateur d' Instana, sélectionnez « Infrastructure ».
  2. Sélectionnez l'onglet Smart Alerts .
  3. Cliquez sur « Créer des alertes intelligentes ».

La boîte de dialogue « Créer des alertes intelligentes », dans laquelle vous pouvez configurer les alertes intelligentes, s'ouvre.

Le processus de configuration des alertes comprend les étapes suivantes:

  1. Définissez le champ d'application de l'alerte en ajoutant des filtres afin de recevoir des alertes plus précises.
  2. Ajoutez des indicateurs pour configurer l'alerte.
  3. Ajoutez des canaux d'alerte pour sélectionner ceux sur lesquels vous souhaitez recevoir les notifications d'alerte.
  4. Ajoutez des propriétés d'alerte pour personnaliser le titre et la description de l'alerte.
  5. Cliquez sur « Créer » une fois la configuration terminée.

Étape 1 : Définir le périmètre

Pour définir la portée de l'alerte, procédez comme suit dans la section « Portée » :

  1. Sélectionnez le type d'entité.
    Figure 1. Type d'entité
    Type d'entité
  2. Sélectionnez le mode d'alerte. Vous pouvez choisir l'une ou l'autre des méthodes d'évaluation suivantes pour cet indicateur :
    • Par groupe : regroupez les indicateurs en fonction de balises personnalisées que vous définissez, puis créez un seul événement pour suivre l'ensemble de ces indicateurs. Cette méthode est activée par défaut. Utilisez cette méthode dans les cas suivants :
      • Suivi des indicateurs agrégés sur plusieurs entités (par exemple, l'utilisation moyenne du processeur sur l'ensemble des hôtes d'une zone ou d'une région donnée).
      • Réduire le bruit des alertes en regroupant les entités similaires.
      • Analyser les tendances et les schémas généraux plutôt que le comportement de chaque entité.
      • Suivi de la capacité globale ou de l'utilisation des ressources au sein d'un cluster ou d'un environnement.

      Exemple : surveiller la charge moyenne du processeur sur tous les hôtes de production, regroupés par zone de disponibilité. Vous recevez une seule alerte lorsque la charge moyenne du processeur dans une zone dépasse le seuil, plutôt que des alertes distinctes pour chaque hôte.

      Figure 2. Alertes par groupe
      Alertes par groupe
    • Par entité : créez un événement pour chaque indicateur ayant dépassé le seuil, afin de surveiller chaque indicateur individuellement. Utilisez les alertes par entité dans les cas suivants :
      • Identifier les problèmes sur des entités spécifiques (par exemple, un hôte, un conteneur ou une instance de base de données en particulier) et y remédier.
      • Accorder une attention particulière et proposer des mesures correctives adaptées à chaque entité.
      • Surveillance des ressources critiques pour lesquelles la moindre défaillance peut avoir des conséquences graves.
      • Suivi des accords de niveau de service (SLA) ou des exigences de performance propres à chaque entité.

      Exemple : surveiller individuellement l'utilisation du processeur sur chaque serveur de base de données de production. Vous recevez une alerte distincte pour chaque serveur de base de données qui dépasse le seuil d'utilisation du processeur, ce qui vous permet d'identifier et de résoudre le problème sur l'instance concernée.

      Figure 3 Génération d'alertes par entité
      Génération d'alertes par entité

      La fonctionnalité d'alerte par entité prend en charge le regroupement par balises liées aux métriques, telles que metricId ou par balises personnalisées, telles que device, et mountpoint state. Ce regroupement permet de définir des alertes individuelles pour chaque variante unique d'indicateur lorsque l'on utilise des modèles d'indicateurs ou des indicateurs avec des balises personnalisées.

  3. (Facultatif) Ajoutez les filtres nécessaires en fonction du type d'entité choisi afin d'affiner davantage la portée de l'alerte.
    Figure 4 Filtres
    Filtres
  4. (Facultatif) Définir un regroupement pour les indicateurs : définissez la manière dont les résultats des indicateurs doivent être organisés à l'aide de balises de regroupement. Vous pouvez utiliser jusqu'à cinq balises pour regrouper les indicateurs. Les groupes peuvent être utilisés comme variables lors de la génération du nom et de la description de l'alerte intelligente.
    Figure 5. Regroupement
    Regroupement

Étape 2 : Ajouter des indicateurs

Configurez les indicateurs pour l'alerte.
  • Le nombre maximal de métriques autorisées par alerte intelligente est de cinq.
  • Pour afficher un aperçu des alertes, une seule métrique et une seule balise de groupe doivent être sélectionnées, le cas échéant.
  1. Cliquez sur Ajouter des mesures. La boîte de dialogue « Ajouter des indicateurs » s'ouvre.
    Figure 6 Ajouter des unités de mesure
    Ajouter des métriques
  2. Cliquez sur « Sélectionner un indicateur » et choisissez le type d'indicateur à l'aide de l'une des options suivantes :
    • Dans l'onglet Liste, effectuez une recherche dans la liste des indicateurs à l'aide de mots-clés.
    • Dans l'onglet « Regex », définissez la portée de la métrique à l'aide d'expressions régulières
    Figure 7. Sélectionner une métrique
    Sélectionner une métrique
  3. Cliquez sur « Sélectionner un filtre de métrique » et choisissez un filtre de balise de métrique pour affiner la valeur de la métrique à surveiller.
  4. Cliquez sur « Sélectionner un groupe de métriques » et sélectionnez les balises de regroupement des métriques afin de définir la manière dont celles-ci sont organisées.
  5. Définissez l'agrégation à l'aide des options suivantes :
    • Agrégation inter-périodes : sélectionnez l'agrégation inter-périodes souhaitée. Cette méthode regroupe les points de données dans un seul compartiment.
    • Agrégations inter-séries : pour additionner les tranches entre les différentes séries de données, activez l'option « Utiliser SUM pour l'agrégation inter-séries ». En général, l'agrégation inter-séries correspond à l'agrégation inter-périodes.
    Figure 8. Configurer la métrique
    Configurer la métrique
  6. Définissez le seuil en choisissant entre un seuil statique et un seuil adaptatif.
    • Seuil statique : les seuils statiques ne varient pas au fil du temps. Vous pouvez les définir lorsque vous créez ou modifiez l'alerte intelligente. Vous pouvez définir différents seuils pour les niveaux de gravité « avertissement » et « critique ». Un seuil fixe peut perdre toute pertinence si l'indicateur sous-jacent subit une modification significative. En réponse à cela, vous pouvez à tout moment ajuster manuellement ou recalculer le seuil. Vous pouvez sélectionner un opérateur de seuil pour définir la condition de seuil.
      Les seuils statiques sont particulièrement efficaces dans les situations suivantes :
      • Quelle que soit la saisonnalité de l'indicateur sous-jacent, celui-ci ne doit ni dépasser ni descendre en dessous d'une valeur constante.
      • L'indicateur sous-jacent est saisonnier; par conséquent, les seuils varient en fonction de l'heure de la journée ou du jour de la semaine. Cependant, ces seuils ne changent pas au fil du temps. Il n'est pas souhaitable de modifier progressivement ces seuils sur de longues périodes.
      Lorsque vous sélectionnez un opérateur « Seuil », vous disposez des options suivantes : greater than or equal to, greater than, less than or equal to, less than, between, et outside.
      • Si vous devez définir des plages délimitées par des limites supérieure et inférieure pour les seuils critiques et d'alerte, utilisez les opérateurs outside between ou. Avec un intervalle configuré à l'aide de ces opérateurs, vous recevez une alerte lorsqu'une métrique se situe entre les limites supérieure et inférieure définies ou en dehors de celles-ci.
    • Seuil adaptatif : les seuils adaptatifs évoluent en permanence et s'ajustent en fonction des nouvelles données observées par Instana. Cela signifie que le seuil tient compte en permanence des variations saisonnières de l'indicateur sous-jacent, sans aucune intervention humaine. Vous pouvez définir différents seuils pour les niveaux de gravité « avertissement » et « critique ». Pour plus d'informations, consultez la section « Seuils adaptatifs ».
      Les seuils adaptatifs sont particulièrement efficaces dans les situations suivantes :
      • L'indicateur sous-jacent n'est pas soumis à des variations saisonnières. On s'attend à ce que ce seuil évolue progressivement au fil du temps, mais tout écart soudain par rapport à cette tendance est indésirable.
      • L'indicateur sous-jacent est saisonnier et des seuils différents s'appliquent selon le moment de la journée ou de la semaine. Les seuils eux-mêmes devraient évoluer progressivement au fil du temps, mais tout écart soudain par rapport à cette tendance est indésirable.
      Lorsque vous sélectionnez un opérateur « Seuil », les options suivantes s'offrent à vous : greater than or equal to, greater than, less than or equal to, less than, et outside.
      • Si vous souhaitez recevoir une alerte lorsqu'un indicateur sort des limites supérieure et inférieure définies, vous pouvez utiliser l'opérateur outside pour configurer les plages supérieures et inférieures correspondant aux seuils critiques et d'avertissement.
      Exigences relatives au seuil adaptatif :
      • Le seuil adaptatif nécessite au moins 6 heures de données métriques continues. Si cette condition n'est pas remplie, vous pouvez tout de même créer l'alerte intelligente. La détection des problèmes et la génération d'alertes se déclenchent dès que les conditions requises en matière de données sont remplies pour initialiser le modèle utilisé.
      Figure 9. Configurer le seuil
      Configurer le seuil
  7. Consultez l'aperçu de l'alerte.

    Une fois que vous avez défini la période et le seuil, le graphique est généré à partir des données historiques relatives à ces indicateurs. Le graphique permet de visualiser jusqu'à 7 jours de données historiques. Vous pouvez basculer entre les données historiques des dernières 24 heures et celles des 7 derniers jours afin de visualiser l'évolution de ces données au fil du temps.

    Sur la base des données historiques et des conditions de seuil, le graphique affiche les alertes que la valeur de seuil actuelle pourrait déclencher.
    Figure 10. Aperçu de l'alerte
    Aperçu de l'alerte
    Si vous sélectionnez des options de regroupement, les résultats de ce regroupement peuvent s'afficher sous forme de tableau à la suite du graphique. Pour analyser les tendances des données de métrique dans le graphique par rapport à chaque regroupement, sélectionnez les lignes correspondantes dans la table.
    Figure 11. Aperçu des alertes avec regroupement
    Aperçu des alertes avec regroupement
  8. k Ajouter un indicateur pour revenir à la boîte de dialogue « Configurer l'alerte ».
  9. Définissez la granularité de la métrique pour déterminer comment chaque valeur de métrique est calculée au cours de la période spécifiée.
  10. Définissez le seuil d'échec pour déterminer le nombre d'échecs consécutifs dans la fenêtre temporelle nécessaire pour déclencher une alerte.
  11. (Facultatif) Configurez le délai de grâce pour définir la durée pendant laquelle un problème reste ouvert une fois que le seuil de non-conformité n'est plus atteint. Une fois ce délai écoulé, le dossier est automatiquement clôturé.
  12. (Facultatif) Configurez les alertes de prévision pour être averti à l'avance : vous pouvez configurer les alertes de prévision afin de recevoir des alertes proactives basées sur la tendance des données historiques, ce qui vous permettra d'anticiper et de résoudre les problèmes potentiels avant qu'ils n'affectent votre système.
Par exemple, vous pourriez souhaiter recevoir une alerte lorsqu'un disque est sur le point d'atteindre sa capacité maximale ou lorsque l'utilisation de la mémoire par un processus approche des limites du conteneur, ce qui pourrait indiquer une fuite de mémoire. Avec l' Instana, vous pouvez configurer des alertes en fonction des prévisions des indicateurs.
Figure 12. Configuration des indicateurs d'alerte
Configuration des indicateurs d'alerte

Étape 3 : Ajouter des canaux d'alerte

Sélectionnez les canaux sur lesquels les notifications doivent être envoyées. Pour ajouter des canaux d'alerte, procédez comme suit :
  1. Cliquez sur « Ajouter des canaux d'alerte ».
  2. Dans la liste des canaux préconfigurés, sélectionnez les canaux à partir desquels vous souhaitez recevoir les alertes.

Si une valeur seuil est définie pour les niveaux de gravité « Avertissement » et « Critique », vous pouvez configurer les canaux d'alerte pour chaque niveau de gravité. Si une valeur seuil est définie pour les deux niveaux de gravité, tous les canaux d'alerte sont sélectionnés par défaut pour le niveau « avertissement ».

Canaux d'alerte pour lesquels les deux niveaux de gravité sont configurés :
Figure 13. Canaux d'alerte avec plusieurs niveaux de gravité
Canaux d'alerte avec plusieurs niveaux de gravité

Si une valeur seuil est définie pour un seul niveau de gravité, ce niveau s'affiche pour chaque canal d'alerte en tant que niveau d'alerte.

Canaux d'alerte pour lesquels une seule niveau de gravité a été configuré :
Figure 14. Canaux d'alerte avec un seul niveau de gravité
Canaux d'alerte avec un seul niveau de gravité

Pour plus d'informations sur la création de canaux, consultez la section « Canaux d'alerte ».

Étape 4 : Ajouter les propriétés de l'alerte

Dans cette section, vous pouvez, si vous le souhaitez, configurer des propriétés d'alerte supplémentaires liées aux alertes créées à l'aide de la configuration « Smart Alert ». Vous pouvez également ajouter des charges utiles personnalisées.
Figure 15. Propriétés d'alerte
Propriétés d'alerte
  • Titre : « Instana » propose un titre par défaut en fonction du type de blueprint utilisé et des options de configuration associées. Cependant, vous pouvez remplacer le titre par défaut par un texte statique de votre choix ou utiliser un titre dynamique en insérant des variables.
    Vous pouvez insérer des variables dynamiques dans le titre de l'alerte à l'aide du menu déroulant « Insérer une variable ». Ces variables permettent de mieux cerner le contexte de l'alerte lorsqu'elle se déclenche.
    • Vous pouvez inclure ${severity} en tant que variable dans le titre de l'alerte pour indiquer le niveau de gravité. Cette variable est utile lorsque vous configurez plusieurs niveaux de gravité au sein d'une même alerte. Par exemple, un titre tel que High CPU Usage - ${severity} indique le niveau de gravité directement dans le titre de l'alerte.
    D'autres variables sont disponibles en fonction de la méthode d'alerte sélectionnée :
    • Avec l'agrégation personnalisée, regroupez les données par balise (zone), puis utilisez les balises regroupées comme variables ( ${zone}). Cette variable est désormais disponible dans le menu déroulant « Insérer une variable ».
    • Lors de la configuration des alertes par entité, la ${entity.label} variable est disponible. Cette variable identifie l'entité spécifique à l'origine de l'alerte.
    • Lorsque vous utilisez des modèles métriques avec des groupes de capture d'expressions régulières (par exemple, fs\.(.+)\.free), vous pouvez inclure les valeurs capturées en tant que variables dans le titre. Le menu « Insérer une variable » contient des options similaires aux éléments suivants :
      • Regex 1st capturing group pour le premier groupe de capture de votre motif
      • Regex 2nd capturing group, Regex 3rd capturing group, etc., pour d'autres groupes de capture
      • Grâce à ces variables, vous pouvez intégrer de manière dynamique des éléments du nom de la métrique correspondante dans les titres de vos alertes.
  • Description : Vous pouvez, si vous le souhaitez, ajouter une description à l'alerte. Une bonne description comprend un bref résumé de l'alerte ainsi que les étapes à suivre pour mener l'enquête ou résoudre le problème dès réception de l'alerte. Vous pouvez également créer une description dynamique en insérant des variables, que vous pouvez sélectionner dans le menu déroulant « Insérer une variable ». Ces variables peuvent fournir des informations contextuelles lorsque l'alerte est déclenchée.
    Figure 16. Champs « Titre » et « Description » contenant des variables
    Champs « Titre » et « Description » contenant des variables
  • Déclenche un incident : l'activation de cette option crée un incident lorsque l'alerte est générée. L'alerte est enregistrée comme événement déclencheur de l'incident. Les autres événements liés à cet incident sont mentionnés en tant qu 'événements connexes.
  • Données personnalisées : pour inclure des données supplémentaires qui vous concernent dans les notifications d'alerte correspondant à une configuration d'alerte spécifique envoyées par Instana, cliquez sur « Ajouter une ligne » dans la section « Données personnalisées ».

    Les charges utiles personnalisées globales et celles spécifiques à l'alerte sont incluses dans les notifications d'alerte le cas échéant, mais la configuration spécifique à l'alerte prévaut sur la configuration globale. Par conséquent, si vous utilisez la même clé, la valeur de la zone de contenu personnalisé global est remplacée par la valeur spécifique à l'alerte.

    L'image suivante montre des contenus personnalisés définis globalement qui sont utilisés dans la configuration d'alerte:
    Figure 17. Charge utile personnalisée globale
    Charge utile personnalisée globale

    Pour plus d'informations sur les charges utiles personnalisées globales, consultez la section « Configurer une charge utile personnalisée au niveau global ».

    À l'heure actuelle, la préversion publique ne prend pas en charge les charges utiles globales personnalisées dynamiques.

Étape 5 : Créer l'alerte

Cliquez sur « Créer » pour créer l'alerte intelligente relative à l'infrastructure. L'alerte créée s'affiche dans l'onglet « Alertes intelligentes », dans la liste des alertes configurées.

Prise en charge de Terraform

Instana permet de mettre en œuvre des fonctionnalités d'« Infrastructure as Code » ( IaC ) en fournissant une ressource « Terraform » permettant de gérer les alertes intelligentes de l'infrastructure par programmation. Cette fonctionnalité permet aux équipes d' DevOps s et de SRE de définir, de déployer et de gérer les configurations d'alerte sous forme de code. Cela contribue à améliorer l'automatisation et la cohérence entre les différents environnements.

Pour plus d'informations sur la gestion des alertes intelligentes d'infrastructure à l'aide d' Terraform, consultez la documentation relative à la configuration des alertes d'infrastructure sur Instana.

Questions fréquentes

Pourquoi migrer les événements personnalisés liés aux métriques d'infrastructure vers Smart Alerts?

Les alertes intelligentes pour l'infrastructure présentent plusieurs avantages par rapport aux événements personnalisés :
  • Une sélection des métriques plus flexible, avec prise en charge des modèles de métriques et des expressions régulières.
  • Attribution directe des canaux d'alerte avec routage basé sur le niveau de gravité.
  • Fonctionnalités améliorées de regroupement et d'agrégation.
  • Alertes de prévision pour une surveillance proactive.
  • Variables dynamiques dans les titres et les descriptions des alertes.
  • Aperçus lors de la configuration des alertes à partir des données historiques.

Comment migrer un événement personnalisé vers une alerte intelligente

Il n'existe pas de correspondance biunivoque entre les alertes intelligentes et les événements personnalisés. En raison des différences entre les deux entités, les configurations d'événements personnalisés suivantes ne peuvent pas être migrées vers les alertes intelligentes de l'infrastructure :
  • Événements personnalisés à plusieurs métriques : seuls les événements personnalisés comportant une seule métrique peuvent être migrés.
  • Types d'agrégation : les événements personnalisés qui utilisent les agrégations suivantes ne peuvent pas être migrés :
    • Différence relative
    • Différence absolue
  • Règles système : les règles système intégrées suivantes ne peuvent pas être migrées vers les alertes intelligentes d'infrastructure :
    • Détection d'événements hors ligne
    • Hôtes sur lesquels aucune entité correspondante n'est en cours d'exécution
    • Détection de la disponibilité de l'hôte
    • Hôtes sur lesquels s'exécutent un nombre inhabituel d'entités

Migration semi-automatique

Pour vous aider à migrer vos événements personnalisés existants vers les alertes intelligentes de l'infrastructure, l'interface utilisateur d' Instana fournit des outils de migration de base. La page de détails d'un événement personnalisé associé à une entité d'infrastructure affiche deux boutons liés à la migration des alertes intelligentes :
  • Marquer comme migré : marque un événement personnalisé obsolète comme ayant été migré et le désactive. Sélectionnez cette option lorsque vous migrez manuellement un événement personnalisé vers une alerte intelligente. Une fois que vous avez marqué l'événement personnalisé comme ayant été migré, vous pouvez toujours le consulter dans la liste et examiner sa configuration à titre de référence. Cette fonction vous aide à suivre la progression de votre migration et garantit qu'aucun événement personnalisé n'est migré plus d'une fois.
  • Passer à Smart Alert : ouvre la boîte de dialogue Smart Alert avec les valeurs préremplies provenant de l'événement personnalisé. Ces valeurs peuvent inclure le nom, la description, le niveau de gravité, l'indicateur d'incident, la métrique, la granularité d'évaluation, l'agrégation, l'opérateur et le seuil. Instana tente de migrer ces champs dans la mesure du possible. Le périmètre défini dans la requête de mise en évidence dynamique (DFQ) de l'événement personnalisé ou dans les entités sélectionnées est transféré soit en sélectionnant les entités correspondantes, soit en utilisant des filtres de balises. Si le DFQ ne peut pas être entièrement mappé, un message d'avertissement s'affiche et vous pouvez alors ajuster manuellement la portée. L'enregistrement de l'alerte intelligente désactive automatiquement l'événement personnalisé précédent et le marque comme ayant été migré.
Figure 18. Boutons de l'outil de migration
Boutons de l'outil de migration

Migration manuelle

Vous pouvez migrer manuellement les événements personnalisés vers les alertes intelligentes de l'infrastructure en suivant ces instructions :
  • Mise en correspondance des métriques : lors de la migration, veillez à sélectionner la métrique équivalente dans la configuration des alertes intelligentes de l'infrastructure. Utilisez la liste des métriques ou la correspondance par expression régulière pour identifier la métrique appropriée.
  • Portée et sélection des entités : les alertes intelligentes d'infrastructure utilisent un filtrage basé sur des balises plutôt que des requêtes Dynamic Focus. Pour reproduire la portée de votre événement personnalisé :
    1. Identifiez les entités concernées par l'événement personnalisé.
    2. Utilisez l'option « Ajouter un filtre » dans la configuration des alertes intelligentes pour appliquer des filtres de balises équivalents.
    3. Choisissez entre l'agrégation personnalisée (pour les métriques agrégées entre entités) ou les alertes par entité (pour la surveillance individuelle des entités).
  • Mappage des agrégations : associez le type d'agrégation de votre événement personnalisé à l'option équivalente dans Smart Alerts :
    • Agrégation temporelle : sélectionnez la méthode d'agrégation temporelle (par exemple, moyenne, minimum, maximum, somme).
    • Agrégation inter-séries : cochez la case « Utiliser SUM pour l'agrégation inter-séries » si vous souhaitez effectuer une somme sur plusieurs entités.
  • Réglage des seuils : lors de la migration des valeurs de seuil, tenez compte des éléments suivants :
    • Différences de granularité des métriques : les événements personnalisés et les alertes intelligentes de l'infrastructure utilisent des agrégations de métriques sous-jacentes différentes :
      • Les événements personnalisés utilisent des flux de métriques d'une seconde pour les fenêtres temporelles inférieures à 30 minutes, et des agrégations de 5 secondes (calculées à partir de la moyenne des métriques d'une seconde) pour les fenêtres temporelles de 30 minutes ou plus. L'agrégation est appliquée à une fenêtre glissante de ces valeurs.
      • Les alertes intelligentes d'infrastructure utilisent des cycles d'évaluation avec des valeurs cumulées toutes les 10 secondes (calculées à partir de la moyenne des mesures effectuées toutes les secondes). Chaque cycle d'évaluation effectue une agrégation inter-temporelle (et, éventuellement, une agrégation inter-séries) à partir de ces cumuls sur 10 secondes.
    • Ajustez les valeurs seuils en fonction de la nouvelle granularité d'évaluation et du type d'agrégation.
    • Utilisez le graphique de prévisualisation pour vérifier que votre seuil déclenche les alertes comme prévu avec les données historiques.

    Exemple d'agrégation SUM : si votre événement personnalisé pour une entité « ActiveMQ » avait un seuil de 100 messages par seconde avec une fenêtre temporelle d'une minute en utilisant l'agrégation SUM, et que vous utilisez une granularité d'évaluation de 5 minutes avec l'agrégation SUM dans l'alerte intelligente, réglez le seuil sur 30 000 messages (100 × 60 × 5).

    Exemple d'agrégation MOYENNE : si votre événement personnalisé utilise l'agrégation MOYENNE (moyenne) avec un seuil de 100 messages par seconde, et que vous utilisez l'agrégation MOYENNE dans l'alerte intelligente, la valeur du seuil reste approximativement la même (100 messages par seconde ou environ 1 000 messages par période de 10 secondes), car la moyenne est calculée sur la fenêtre d'évaluation plutôt que d'être simplement additionnée.

    La principale différence : l'agrégation SUM nécessite d'ajuster le seuil en fonction de la durée de la fenêtre d'évaluation, tandis que les agrégations MEAN, MIN et MAX ne nécessitent généralement pas d'ajustement du seuil.

  • Mappage des seuils temporels : associez le délai de grâce et la fenêtre temporelle de l'événement personnalisé aux options de seuils temporels de l'alerte intelligente :
    • Utilisez la persistance dans le temps pour exiger plusieurs violations consécutives avant de déclencher une alerte.
    • La granularité d'évaluation des alertes intelligentes fournit des indicateurs plus stables que la granularité à la seconde près des événements personnalisés, ce qui réduit la nécessité de prévoir des délais de grâce prolongés.
  • Attribution des canaux d'alerte : contrairement aux événements personnalisés, dont le routage repose sur des configurations d'alerte, les alertes intelligentes d'infrastructure permettent d'attribuer directement des canaux d'alerte avec un routage basé sur le niveau de gravité. Attribuez les canaux appropriés aux niveaux de gravité « Avertissement » et « Critique » selon les besoins.

Quelles sont les différences entre l'agrégation personnalisée et les alertes par entité?

L'agrégation personnalisée regroupe les données métriques en fonction des balises que vous définissez et compare la métrique agrégée au seuil. Cette approche est utile pour suivre les tendances générales au sein de plusieurs entités et réduire le bruit des alertes. Vous recevez une seule alerte lorsque la métrique agrégée dépasse le seuil.

La surveillance par entité surveille chaque entité individuellement et déclenche des alertes distinctes pour chaque entité qui dépasse le seuil. Cette approche est utile lorsque vous devez identifier les problèmes liés à des entités spécifiques et y remédier. Vous recevez des alertes individuelles pour chaque entité concernée.

Choisissez le mode d'alerte en fonction de ce que vous souhaitez surveiller : le comportement global (agrégation personnalisée) ou le comportement de chaque entité (alertes par entité).

Comment fonctionnent les alertes de prévision dans les Smart Alerts d'infrastructure?

Le système d'alerte de prévision utilise la régression linéaire sur les données historiques des indicateurs pour prédire les valeurs futures. Vous configurez deux plages horaires :
  • Période couverte par les données historiques : définit la période couverte par les données passées utilisées pour ajuster le modèle de prévision.
  • Période de prévision : permet de définir jusqu'à quand s'étend la prévision.

Une alerte est déclenchée lorsque la valeur actuelle de l'indicateur ou la valeur prévisionnelle dépasse le seuil. Cette approche proactive vous permet de résoudre les problèmes potentiels avant qu'ils n'affectent votre système, comme un manque d'espace disque ou des fuites de mémoire qui menacent d'atteindre les limites des conteneurs.

Des plages horaires plus larges augmentent le risque de fausses alertes; il convient donc de trouver un équilibre entre la proactivité des alertes et leur précision, en fonction de votre cas d'utilisation spécifique.