Référence d'événements intégrés
La page Événements affiche une liste de tous les événements actuellement disponibles, des événements intégrés de la zone et des événements personnalisés définis par l'utilisateur. Pour afficher la page Événements, cliquez sur Paramètres-> Evénements.
La liste peut être filtrée par :
- Type : événement intégré ou événement personnalisé.
- Incidents et niveau de gravité : incidents, avertissements ou situations critiques.
- Recherche en texte intégral.
Important : les événements intégrés ne peuvent pas être modifiés. Vous pouvez créer des événements personnalisés en vous basant sur les mêmes entités et indicateurs que ceux utilisés pour les événements intégrés. Les événements personnalisés déclenchent des problèmes ou des incidents en fonction des seuils d'une métrique individuelle pour une entité donnée.
Application .NET
| Événement | Description | Métrique |
|---|---|---|
| L'activité de ramassage des ordures est intense. | Surveille le temps consacré au nettoyage de la mémoire (GC) par la plateforme d'exécution CLR et le compare à la valeur maximale autorisée en pourcentage. | Temps de nettoyage de la mémoire (mem.time_in_gc). |
Pour plus d'informations sur ce capteur, consultez la documentation d'.NET.
ActiveMQ
| Événement | Description | Métrique |
|---|---|---|
| Augmentation de la taille de la file d'attente de lettres mortes. | La taille de la file d'attente de lettres mortes augmente. Les messages envoyés ne sont pas acheminés vers leur destination correcte. | Taille de la file d'attente ActiveMQ. |
| L'utilisation de la mémoire est proche de la limite. | L'utilisation de la mémoire est proche de 100 % de la limite de mémoire. | Utilisation de la mémoire (memoryPercentage). |
| L'utilisation du stockage est proche de la limite. | L'utilisation du stockage est proche de 100 % de la limite de stockage. | Utilisation du stockage (storePercentage). |
Pour plus d'informations sur ce capteur, consultez la documentation d' ActiveMQ.
ActiveMQ Artemis
| Événement | Description | Métrique |
|---|---|---|
| ActiveMQ Artemis n'a pas de connexions. | Il n'y a pas eu de connexion au cours des 5 dernières secondes. Le nombre actuel de connexions est égal au nombre NoConnections configurées. | Nombre total de connexions (totalConnectionCount). |
| ActiveMQ Artemis n'a pas de consommateurs. | Aucun consommateur au cours des 5 dernières secondes. Le nombre actuel de consommateurs est égal au nombre NoConsumers configuré. | Nombre total de consommateurs (totalConsumerCount). |
| L'utilisation de la mémoire d'adresses est proche de la limite. | L'utilisation de la mémoire de toutes les adresses est proche de 100 % de sa limite. | Utilisation de la mémoire d'adresse (addressMemoryPercentage). |
Pour plus d'informations sur ce capteur, consultez la documentation d' ActiveMQ Artemis.
HTTPd
| Événement | Description | Métrique |
|---|---|---|
| Les processus enfants Apache sont bloqués en cours de recherches DNS. | Détecte l'utilisation élevée de workers de serveur par une recherche DNS. | DNS (worker.dns). |
| La journalisation ralentit les performances d'Apache HTTPd. | Détecte l'utilisation élevée des workers du serveur dans un but de journalisation. | Journalisation (worker.logging). |
| Le nombre de workers occupés s'approche du maximum possible. | Détecter un pourcentage élevé de workers occupés. | Workers occupés (busy_workers). |
Pour plus d'informations sur ce capteur, consultez la documentation d' HTTPd.
Application
| Événement | Description | Métrique |
|---|---|---|
| Chute totale des appels | Détecte une baisse rapide jusqu'à zéro (concrètement le service n'est plus appelé) dans les valeurs des appels par rapport aux valeurs des 30 dernières minutes. L'ampleur de la baisse des appels devrait également dépasser les paramètres de seuil relatifs et absolus. | Appels/s (count) |
| Taux d'erreurs trop élevé | Détecte un taux d'erreurs constamment élevé lorsque l'indicateur clé de performance moyen des erreurs au cours des quatre dernières minutes est supérieur à la valeur de seuil indiquée. | Taux d'erreur (error_rate). |
| Tendance croissante du taux d'erreur | Cette règle vérifie l'existence d'une tendance croissante dans une mesure donnée. La règle est conçue pour détecter des augmentations faiblement monotones dans la métrique donnée. Cependant, le détecteur n'est pas rigoureux et tolère une certaine baisse de la valeur métrique au sein du candidat à la tendance. | Taux d'erreur (error_rate). |
| Une baisse soudaine des appels | Détecte une baisse rapide des valeurs de l'indicateur clé de performance des appels par rapport aux valeurs des 30 dernières minutes. L'ampleur de la baisse des appels devrait également dépasser les paramètres de seuil relatifs et absolus. | Appels/s (count). |
| Augmentation soudaine du taux d'erreur | Détecte une augmentation rapide des valeurs de l'indicateur de performance clé (KPI) « erreurs » par rapport aux valeurs de cet indicateur enregistrées au cours des 10 dernières minutes. L'ampleur de l'augmentation des erreurs devrait également dépasser les paramètres de seuil relatifs et absolus. | Taux d'erreur (error_rate). |
| Augmentation soudaine de la latence | Détecte une augmentation rapide du percentile du KPI de latence spécifié par rapport aux valeurs du KPI enregistrées au cours des 30 dernières minutes. L'ampleur de l'augmentation de la latence doit dépasser les seuils relatifs et absolus indiqués. | Latence 50e (duration.50th). |
| Augmentation soudaine de la latence pour une fraction des demandes | Détecte une augmentation rapide du percentile du KPI de latence spécifié par rapport aux valeurs du KPI enregistrées au cours des 30 dernières minutes. L'ampleur de l'augmentation de la latence doit dépasser les seuils relatifs et absolus indiqués. | Latence au 99e centile (duration.99th). |
AWS DynamoDB
| Événement | Description | Métrique |
|---|---|---|
| Le rapport entre les lectures consommées et celles mises à disposition est critique. | Détecte un rapport élevé entre les lectures consommées et celles mises à disposition. | Capacité de lecture consommée (consumed_read). |
| Le rapport entre les écritures consommées et celles mises à disposition est critique. | Détecte un rapport élevé entre des écritures consommées et celles mises à disposition. | Capacité d'écriture consommée (consumed_write) et capacité d'écriture mise à disposition (provisioned_write). |
Pour plus d'informations sur ce capteur, consultez la documentation d' AWS DynamoDB.
AWS MSK
| Événement | Description | Métrique |
|---|---|---|
| Nombre de contrôleurs actifs. | Recherche un nombre inhabituel de contrôleurs actifs dans le cluster Kafka. | Nombre de contrôleurs actifs (active_controller_count). |
| Nombre de partitions hors ligne. | Définit la proportion maximale autorisée de violations des partitions hors ligne dans la fenêtre de temps spécifiée. | Nombre de partitions hors ligne (offline_partitions_count). |
| Délai d'inactivité faible du processeur réseau. | Vérifie si l'unité d'exécution du réseau Kafka subit une charge intense. | Délai d'inactivité du processeur réseau (network_processor_idle). |
| Délai d'inactivité faible du gestionnaire de demandes. | Vérifie si le gestionnaire de requêtes Kafka subit une charge intense. | Délai d'inactivité du gestionnaire de demandes (request_handler_idle). |
| Nombre de partitions sous-répliquées. | Vérifie si le nombre de partitions sous-répliquées dépasse le nombre prévu. | Partitions sous-répliquées (under_replicated_partitions). |
Pour plus d'informations sur ce capteur, consultez la documentation d' AWS MSK.
AWS RDS
| Événement | Description | Métrique |
|---|---|---|
| Le solde du crédit de l'unité centrale atteint zéro. | Vérifie si le solde du crédit de l'unité centrale se rapproche de zéro. | Solde de crédit de l'UC (cpu_credit_balance). |
| Le nombre de crédits d'unité centrale consommés est élevé. | Vérifie si le pourcentage de crédits d'unité centrale consommés par une instance atteint la capacité maximale. | Utilisation du crédit d'UC (cpu_credit_usage) et solde de crédit de l'unité centrale (cpu_credit_balance). |
Pour plus d'informations sur ce capteur, consultez la documentation d' AWS RDS.
Azure API Management Service
Le capteur Azure API Management effectuera automatiquement chaque minute les contrôles de santé personnalisés configurés. Si les vérifications échouent pendant au moins une minute, un problème sera soulevé pour informer l'utilisateur.
| Événement | Description | Métrique |
|---|---|---|
| La capacité de gestion de l'API Azure se rapproche de la limite maximale de capacité. | Vérifie si la gestion d'API Azure utilise plus de 90 % de la capacité disponible. | Capacité (metrics.Capacity). |
Pour plus d'informations sur ce capteur, consultez la documentation relative à la gestion de l'API d' Azure.
Azure CosmosDB
| Événement | Description | Métrique |
|---|---|---|
| La capacité de stockage Azure CosmosDb se rapproche de la limite maximale de capacité. | Détecte si la capacité de stockage d'Azure CosmosDb atteint la limite maximale de capacité. | Capacité de stockage CosmosDb. |
Pour plus d'informations sur ce capteur, consultez la documentation relative à l' Azure CosmosDB.
Azure Redis
Le détecteur d'Azure Redis Cache effectuera des diagnostics d'intégrité personnalisés et les renouvellera à chaque minute. Si les vérifications échouent pendant au moins une minute, un problème sera soulevé pour informer l'utilisateur.
| Événement | Description | Métrique |
|---|---|---|
| Les connexion client Azure Redis Cache se rapprochent de la limite maximale de connexions. | Azure Redis Cache utilise plus de 90% des connexions client disponibles. | Clients connectés (connectedclients). |
| L'utilisation de la mémoire d'Azure Redis Cache se rapproche de la limite maximale de mémoire. | Azure Redis Cache utilise plus de 90 % de la mémoire disponible. | Pourcentage de mémoire utilisée (usedmemorypercentage). |
Pour plus d'informations sur ce capteur, consultez la documentation d' Azure Redis.
Azure SQL Database
Le capteur Asure SQL Database effectuera des diagnostics d'intégrité personnalisés et les renouvellera à chaque minute. Si les vérifications échouent pendant au moins une minute, un problème sera soulevé pour informer l'utilisateur.
| Événement | Description | Métrique |
|---|---|---|
| La base de données est à court d'espace. | Vérifie si Azure SQL Database est à court d'espace. La limite d'avertissement est à 80 % et la limite critique est à 90 % de la taille utilisée. | metrics.storage_percent. |
| Statut de base de données. | L'état de non-intégrité est dû à l'indisponibilité de la base de données. Une base de données peut être indisponible si l'une des conditions suivantes est vraie :
|
metrics.statusCode. |
| L'utilisation totale de DTU se rapproche de la limite maximale de DTU. | Vérifie si l'utilisation de DTU d'Azure SQL Database atteint la limite maximale de DTU. La limite d'avertissement est à 75 % et la limite critique est à 85 % de l'utilisation de DTU. | metrics.dtu_consumption_percent. |
Base de données Azure MySQL
Le capteur de la base de données « Azure MySQL » effectue des contrôles d'intégrité personnalisés toutes les minutes. Si les vérifications échouent pendant au moins une minute, un problème est soulevé pour vous informer.
| Événement | Description | Métrique |
|---|---|---|
| Les connexions serveur disponibles se rapprochent de la limite maximale de connexions | L'utilisation des connexions au serveur d' Azure MySQL s représente plus de 85 % des connexions client disponibles. | Connexions actives (active_connections) |
Pour plus d'informations sur ce capteur, consultez la documentation d' Azure MySQL.
Azure Service Bus
Le capteur « Azure Service Bus » effectue des contrôles d'intégrité personnalisés toutes les minutes. Si les vérifications échouent pendant au moins une minute, un problème est soulevé pour vous informer.
| Événement | Description | Métrique |
|---|---|---|
| Azure Service Bus contient au moins un message dans la file d'attente DL | Vérifie si l' Azure Service Bus e contient au moins un message dans la file d'attente des messages perdus. | Messages avec en-tête Lettered (deadletteredMessages) |
Pour plus d'informations sur ce capteur, consultez la documentation d' Azure Service Bus.
Azure SQL Elastic Pool
Le capteur de pool élastique d'Azure SQL effectuera des diagnostics d'intégrité personnalisés et les renouvellera toutes les minutes. Si les vérifications échouent pendant au moins une minute, un problème sera soulevé pour informer l'utilisateur.
| Événement | Description | Métrique |
|---|---|---|
| L'utilisation totale d'eDTU se rapproche de la limite maximale d'eDTU. | Vérifie si les eDTU de pool élastique d'Azure SQL atteignent la limite maximale d'eDTU. | metrics.dtu_consumption_percent. |
Cassandra
Cluster Cassandra
| Événement | Description | Métrique |
|---|---|---|
| Nœuds Cassandra inaccessibles. | Un ou plusieurs nœuds sont en panne. | Nombre de nœuds inaccessibles (unreachableNodes). |
Nœud Cassandra
| Événement | Description | Métrique |
|---|---|---|
| Pools d'unités d'exécution bloqués. | Vérifie si des étapes comportent des unités d'exécution bloquées. | Métrique d'unités d'exécution bloquées pour une étape. |
| Messages supprimés. | Vérifie si des pools d'unités d'exécution ont supprimé des messages. | Mesure des messages supprimés pour une étape. |
| Compactages en attente. | Vérifie si le nombre de compactages en attente augmente. | Écriture (en attente) (compaction.pending). |
| Mutations en attente. | Vérifie s'il existe des mutations en attente. | Mutation au compteurs (stage.mutation.pending). |
| Lectures en attente. | Lectures en attente. | Réparation de lecture (stage.read.pending). |
| Réponses à des demandes en attente. | Réponses à des demandes en attente. | Écriture (Mutation) (stage.requestresponse.pending). |
| Baisse soudaine des demandes d'écriture. | Recherche une chute soudaine du nombre de demandes d'écriture Cassandra. | Écritures (clientrequests.write.count). |
Pour plus d'informations sur ce capteur, consultez la documentation d' Cassandra.
Ceph
| Événement | Description | Métrique |
|---|---|---|
| Statut du cluster Ceph. | Le cluster Ceph fait état d'un incident : HEALTH_WARN ou HEALTH_ERR. |
Statut du cluster Ceph (overall_status). |
| Le quorum de surveillance n'est pas atteint. | Le nombre de moniteurs sains est inférieur à 50 % de l'ensemble des moniteurs. | Nombre de moniteurs (num_mons) et nombre de moniteurs actifs (num_active_mons). |
| État de pleine capacité Osd(s). | Certains des OSD affichent un état complet. | Nombre de groupes de placement (PG) à l'état active+clean (num_full_osds). |
| Osd(s) près de l'état de pleine capacité. | Certains des OSD font affiche un état presque complet. | Nombre de presque tous les osds (num_near_full_osds). |
Pour plus d'informations sur ce capteur, consultez la documentation d' Ceph.
Consul (HashiCorp)
| Événement | Description | Métrique |
|---|---|---|
| Intégrité du cluster Consul | Détecte l'intégrité globale du cluster et si l'un des nœuds est considéré comme n'étant pas intègre par Autopilot. | Intégrité du consul Autopilot (consul.autopilot.healthy). |
CRI-O
| Événement | Description | Métrique |
|---|---|---|
| Mémoire épuisée. | Détecte le moment où l'utilisation de la mémoire du conteneur dépasse les limites spécifiées. | RSS (memory.total_rss). |
Docker
| Événement | Description | Métrique |
|---|---|---|
| Mémoire épuisée. | Lorsque l'utilisation de la mémoire du conteneur dépasse les limites spécifiées, un seuil d'avertissement de mémoire ou une alerte de seuil critique mémoire s'affiche. | RSS (memory.total_rss). |
Pour plus d'informations sur ce capteur, consultez la documentation d' Docker.
Elasticsearch
Cluster ElasticSearch
| Événement | Description | Métrique |
|---|---|---|
| Statut du cluster. | Surveille le statut du cluster Elasticsearch. | Nombre de nœuds Elasticsearch (node_count) et statut du cluster Elasticsearch (cluster_status). |
| Elasticsearch est en situation de division de cerveau. | Vérifie si un cluster Elasticsearch possède plus d'un nœud maître. La division de cerveau est déclenchée pour les environnements avec deux clusters Elastic portant le même nom. | Les nœuds maîtres comptent dans le cluster Elasticsearch. |
Noeud Elasticsearch
| Événement | Description | Métrique |
|---|---|---|
| Limite de capacité lors du rééquilibrage. | Caractérise le nœud au niveau de la limite de capacité en vérifiant s'il relocalise les fragments au moment où il se trouve à la limite de capacité. | Résultats de l'évaluation du plafond de capacité et de la relocalisation du fragment. |
| Répartition des segments de mémoire. | Évalue si le paramètre de taille de segment de mémoire de la recherche Elasticsearch est trop grand. | Taille maximale de segment de mémoire de la machine virtuelle Java sous-jacente et de la mémoire totale sur l'hôte sous-jacent. |
| Utilisation de segment de mémoire élevée. | Vérifie l'utilisation de segments de mémoire du nœud ainsi que les caractéristiques de charge de travail récentes afin de détecter toute utilisation excessive de l'utilisation des segments de mémoire. | Utilisation des segments de mémoire par la JVM sous-jacente et caractéristiques de la charge de travail. |
| Nœud aux limites de sa capacité. | Vérifie si le nœud se trouve à la limite de sa capacité qui est déterminée par la présence des problèmes suivants : charge et utilisation de l'unité centrale élevées sur l'hôte, utilisation intense des segments de mémoire et temps long de nettoyage de la mémoire dans la machine JVM Elasticsearch. | Charge et temps UC intense sur l'hôte, utilisation élevée de segments de mémoire par Elasticsearch, et temps de nettoyage de mémoire sur la machine virtuelle Java sous-jacente long. |
| État du nœud. | Vérifie le statut du cluster fourni par Elasticsearch. | Charge et temps UC élevés sur l'hôte, utilisation intense de segments de mémoire par Elasticsearch, et temps long de nettoyage de mémoire sur la machine virtuelle Java sous-jacente. |
| Actions rejetées. | Vérifie si le nombre d'unités d'exécution rejetées est trop élevé. | Index (threads.index_rejected), recherche (threads.search_rejected), vrac (threads.bulk_rejected) et obtention (threads.get_rejected). |
Pour plus d'informations sur ce capteur, consultez la documentation d' Elasticsearch.
Noeud final
| Événement | Description | Métrique |
|---|---|---|
| Chute total des appels. | Détecte une baisse rapide jusqu'à zéro (concrètement le service n'est plus appelé) dans les valeurs des appels par rapport aux valeurs des 30 dernières minutes. L'ampleur de la baisse des appels devrait également dépasser les paramètres relatifs et absolus de seuil comme suit. | Appels/s (count). |
| Taux d'erreur trop élevé. | Détecte un taux d'erreurs constamment élevé lorsque l'indicateur clé de performance moyen des erreurs au cours des quatre dernières minutes est supérieur à la valeur de seuil indiquée. | Taux d'erreur (error_rate). |
| Taux d'erreur trop élevé pour un nœud final synthétique. | Détecte un taux d'erreur constamment élevé pour un nœud final synthétique lorsque l'indicateur clé de performance moyen des erreurs pour les quatre dernières minutes est supérieur à la valeur de seuil indiquée. | Taux d'erreur synthétique (synthetic_error_rate). |
| Tendance croissante du taux d'erreur. | Vérifie l'existence d'une tendance croissante dans une mesure donnée. La règle est conçue pour détecter des augmentations faiblement monotones dans la métrique donnée. Le capteur n'est cependant pas strict et tolère une certaine diminution de la valeur métrique au sein de la tendance envisagée. | Taux d'erreur (error_rate). |
| Une baisse soudaine des appels. | Détecte une baisse rapide des valeurs de l'indicateur clé de performance des appels par rapport aux valeurs des 30 dernières minutes. L'ampleur de la baisse des appels devrait également dépasser les paramètres relatifs et absolus de seuil comme suit. | Appels/s (count). |
| Chute soudaine des appels synthétiques. | Détecte une baisse rapide des valeurs de l'indicateur clé de performance des appels par rapport aux valeurs des 30 dernières minutes. L'ampleur de la baisse des appels devrait également dépasser les paramètres relatifs et absolus de seuil comme suit. | Appels synthétiques/s (synthetic_count). |
| Augmentation soudaine du taux d'erreur. | Détecte une augmentation rapide des valeurs de l'indicateur clé de performance des erreurs par rapport aux valeurs des 10 dernières minutes. L'ampleur de l'augmentation des erreurs devrait également dépasser les paramètres de seuil relatifs et absolus comme suit. | Taux d'erreur (error_rate). |
| Augmentation soudaine de la latence. | Détecte une augmentation rapide du percentile du KPI de latence spécifié par rapport aux valeurs du KPI enregistrées au cours des 30 dernières minutes. L'ampleur de l'augmentation de la latence doit dépasser les paramètres de seuil relatifs et absolus. | Latence 50e (duration.50th). |
| Augmentation soudaine de la latence pour une fraction des demandes | Détecte une augmentation rapide du percentile du KPI de latence spécifié par rapport aux valeurs du KPI enregistrées au cours des 30 dernières minutes. L'ampleur de l'augmentation de la latence doit dépasser les paramètres de seuil relatifs et absolus comme suit. | Latence au 99e centile (duration.99th). |
etcd
| Événement | Description | Métrique |
|---|---|---|
| Durée de validation de back end de disque anormalement élevée. | Détecte une durée de validation du back end de disque élevée. | Durée de validation de back-end de disque (health.disk_backend_commit_duration). |
| Durée anormalement longue de la fonction wal fsync pour le disque. | Détecte une durée disc wal fsync élevée. | Durée fsync du disque (health.disk_wal_fsync_duration). |
| Durée d'instantané anormalement longue. | Détecte une durée longue pour la sauvegarde d'un instantané. | Durée totale de sauvegarde d'instantané (health.debugging_snap_save_total_duration). |
| Des changements de leader fréquents ont été observés au cours de la dernière minute. | Détecte un nombre élevé de changements de leader au cours de la dernière minute. | Changements de leader du serveur (health.server_leader_changes). |
| Le membre n'a pas de leader. | Détecte un membre qui n'a pas de leader (indisponible). | Le serveur a un leader (health.server_has_leader). |
| Analyse du rapport de proposition. | Détecte une chute inhabituelle des propositions appliquées et une augmentation inhabituelle des propositions en attente et en échec. | Nombre de propositions validées (health.server_proposals_committed), nombre de propositions en vigueur (health.server_proposals_applied), nombre de propositions en attentes (health.server_proposals_pending), et nombre de propositions ayant échoué (health.server_proposals_failed). |
| L'utilisation de descripteurs de fichiers ouverts est critique. | Détecte une utilisation intense des descripteurs de fichiers ouverts. | Nombre de descripteurs de fichiers ouverts (health.process_open_fds) et nombre maximal de descripteurs de fichier (health.process_max_fds). |
Pour plus d'informations sur ce capteur, consultez la documentation d' etcd.
Conteneur Garden
| Événement | Description | Métrique |
|---|---|---|
| Mémoire épuisée. | L'utilisation de la mémoire du conteneur se rapproche de la limite de mémoire. | Utilisation (memory.usage). |
Pour plus d'informations sur ce capteur, consultez la documentation d' Garden.
Glassfish
| Événement | Description | Métrique |
|---|---|---|
| Glassfish Le taux de réussite du cache de fichiers est de 70 %. | Un pipeline de traitement vérifie le taux de réussite du cache de fichiers et vérifie s'il est inférieur à la valeur de seuil indiquée. | Taux de hits (file_cache_rate). |
| Nombre maximal de connexions JDBC atteint. | Un pipeline de traitement vérifie le nombre total de connexions JDBC. Il valide le fait que la limite maximale est atteinte pour la configuration du serveur. | D'occasion (jdbc_connection_used). |
Pour plus d'informations sur ce capteur, consultez la documentation d' Glassfish.
Google Cloud Datastore
| Événement | Description | Métrique |
|---|---|---|
| Le nombre de demandes de magasin de données a diminué considérablement au cours des 30 dernières minutes. | Recherche une diminution soudaine du nombre de demandes. | Demandes (request_count) |
| Le nombre de demandes de magasin de données a augmenté de manière significative au cours des 30 dernières minutes. | Recherche une augmentation soudaine du nombre de demandes. | Demandes (request_count) |
Pour plus d'informations sur ce capteur, consultez la documentation d' Google Cloud Datastore.
Google Cloud Storage
| Événement | Description | Métrique |
|---|---|---|
| Augmentation soudaine de la taille de tous les objets | Recherche une augmentation soudaine de la taille de tous les objets en 24h pour les compartiments non vides | Taille totale de tous les objets dans le compartiment. |
Pour plus d'informations sur ce capteur, consultez la documentation d' Google Cloud Storage.
Google Cloud Pub/Sub
| Événement | Description | Métrique |
|---|---|---|
| La latence de demande push pour l'abonnement a augmenté au cours des 10 dernières minutes. | Recherche une augmentation soudaine de la latence de demande push pour l'abonnement. | Temps d'attente des demandes (push_request_latencies) |
| Message le plus ancien de la rubrique. | Vérifie s'il existe des messages sur la rubrique antérieure à la valeur de seuil. | Message le plus ancien (oldest_unacked_message_age) |
Pour plus d'informations sur ce capteur, consultez la documentation d' Google Cloud Pub/Sub.
Hadoop YARN
| Événement | Description | Métrique |
|---|---|---|
| Le gestionnaire de ressources fait état du nœud perdu. | Détecte si le gestionnaire de ressources fait état de nœuds perdus. | Nœuds perdus (lostNodes). |
| Le gestionnaire de ressources fait état d'un nœud non intègre. | Détecte si le gestionnaire de ressources fait état de nœuds non intègres. | Nœuds non intègres (unhealthyNodes). |
| L'application soumise a échoué. | Détecte si l'application soumise a échoué. | Apps ayant échoué (appsFailed). |
Pour plus d'informations sur ce capteur, consultez la documentation d' Hadoop YARN.
HAProxy
| Événement | Description | Métrique |
|---|---|---|
| La taille moyenne des files d'attente de backend HAProxy est grande. | La taille moyenne des files d'attente de back end HAProxy est grande. | Taille de la file d'attente back end. |
| L'utilisation de la session front end HAProxy est intense. | L'utilisation de la session front end HAProxy est intense. | Utilisation de la session front end. |
| Augmentation soudaine du temps de réponse moyen. | Recherche une augmentation soudaine du temps de réponse moyen d'un système back end unique. | Métriques du temps de réponse moyen. |
Pour plus d'informations sur ce capteur, consultez la documentation d' HAProxy.
Hazelcast
A partir de Hazelcast 3.3 , les méthodes publiques HazelcastInstance::getPartitionService()::isLocalMemberSafe() sont utilisées. Pour les anciennes versions d' Hazelcast, l'état de santé est déterminé à partir d'un indicateur interne indiquant si des migrations sont en cours sur chaque nœud local.
L'intégrité du cluster Hazelcast est agrégé à partir de chaque nœud Hazelcast. C'est exactement ce que fait HazelcastInstance::getPartitionService()::isClusterSafe() en interne, mais sans créer de surcharge supplémentaire liée à l'appel de cette méthode.
Cluster Hazelcast
| Événement | Description | Métrique |
|---|---|---|
| Statut du cluster. | Vérifie le statut de cluster de Hazelcast. Hazelcast 3.3 ou plus. | Indicateur du statut du cluster Hazelcast. |
Nœud Hazelcast
| Événement | Description | Métrique |
|---|---|---|
| État du nœud. | Vérifie le statut du membre local. Hazelcast 3.3 ou plus. | Indicateur de statut du nœud Hazelcast. |
Pour plus d'informations sur ce capteur, consultez la documentation IMDG d' Hazelcast.
HBase
| Événement | Description | Métrique |
|---|---|---|
| La différence entre le nombre de magasins et le nombre de fichiers de magasin est significative. | Détecte un nombre exceptionnellement bas ou anormalement élevé de magasins. | Nombre de magasins (rs_store_count) et nombre de fichiers de magasin (rs_store_file_count). |
| Le taux de hits du cache du bloc de serveurs de région est faible. | Détecte un faible taux de hits en cache. | Taux de hits en cache de bloc (rs_blk_cache_hit_rate) et nombre de hits en cache de bloc (rs_blk_cache_hit_count). |
| Augmentation significative de la longueur de la file d'attente de compactage. | Recherche une augmentation soudaine de la longueur de la file d'attente de compactage. Cette règle indique que toutes les régions se développent à un rythme semblable et qu'elles ont besoin de se frationner/compacter à peu près au même moment. Cette option peut être prise en compte lors du pré-fractionnement ou de la mise hors tension des compactages automatiques. | Longueur de la file d'attente de compactage (rs_comp_queue_length). |
| Augmentation significative de la longueur de la file d'attente de vidage. | Recherche une augmentation soudaine de la longueur de la file d'attente de vidage. Son déclenchement peut indiquer un manque de mémoire vive ou d'une rapidité des vidages excessive par rapport à ce que les disques peuvent gérer. | Longueur de la file d'attente de vidage (rs_flush_queue_length). |
Pour plus d'informations sur ce capteur, consultez la documentation d' Apache HBase.
Hôte
| Événement | Description | Métrique |
|---|---|---|
| L'UC passe beaucoup de temps à attendre l'entrée/la sortie. | Vérifie si le système passe beaucoup de temps à attendre l'entrée / la sortie (échantillonnage dans une fenêtre temporelle glissante de 60 secondes). | Attendez (cpu.wait). |
| Délai de vol d'unité centrale dépassé. | Vérifie en l'espace d'une seconde, s'il y a trop d'UC volée entre les processus en cours d'exécution ou par l'hyperviseur/système d'exploitation hôte (échantillonnage dans une fenêtre temporelle glissante de 60 secondes). | Vol (cpu.steal). |
| La capacité de l'unité est faible ou est pleine. | Détecte les problèmes de faible capacité du disque pour permettre une prédiction rapide d'une éventuelle rupture de capacité jusqu'à 15 minutes à l'avance. Le capteur ne déclenche rien lorsque l'espace disque restant est supérieur à 1 Go ou à 1 % de la capacité totale. Toutefois, il sera déclenché si l'espace disque restant est vide (<1MB) ou si l'espace disque se remplit dans les 15 prochaines minutes en fonction de la tendance actuelle. | Capacité de stockage disponible dans les disques. |
| Le disque se remplit plus rapidement qu'il n'est purgé. | Détecte les problèmes de capacité du disque à long terme et se déclenche lorsque le disque est susceptible de ne plus avoir aucune capacité dans les 48 heures. Le capteur ne déclenche rien lorsque l'espace disque restant est supérieur à 20 % de la capacité totale. Cependant, il se déclenchera si la tendance actuelle indique que l'espace disque sera rempli dans les 48 heures. Cette tendance est calculée en fonction des minima locaux calculés au fil du temps. Lorsque ces minima locaux indiquent un délai d'au moins 4 heures, un modèle de régression linéaire est ajusté sur ces points de données pour finalement réaliser les prévisions à long terme. | Capacité de stockage disponible dans les disques. |
| Erreurs TCP fréquentes. | Vérifie si l'hôte a un nombre inhabituellement élevé d'erreurs TCP (échantillonnage dans une fenêtre temporelle glissante de 60 secondes). | En segments/s (tcp.inSegs) et erreur (tcp.errors). |
| Échecs de TCP fréquents. | Vérifie si l'hôte a un nombre anormalement élevé de TCP (échantillonnage dans une fenêtre temporelle glissante de 60 secondes). | Echec (tcp.fails) et ouverture / s (tcp.opens). |
| Retransmissions TCP permanentes. | Vérifie si l'hôte a un nombre inhabituellement élevé de retransmission TCP (échantillonnage dans une fenêtre temporelle glissante de 60 secondes). | Retransmission (tcp.retrans) et Segments/s en sortie (tcp.outSegs). |
| Charge système trop élevée. | Vérifie si la charge du système est trop élevée, en comparant la charge par rapport à 2 fois les cœurs d'unité centrale de la machine (échantillonnage dans une fenêtre temporelle coulissante de 120 secondes). | Charge (load.1min). |
| Mémoire système épuisée. | Vérifie si la mémoire système est sur le point d'être épuisée (déclenchement instantané). | Disponible (memory.free) et utilisé (memory.used). |
| Trop de fichiers ouverts. | Les processus ouvrent des fichiers plus rapidement qu'ils ne les ferment (le rapport en cours/max dépasse le seuil). | D'occasion (openFiles.used). |
| Trop d'inodes utilisés. | Un faible d'inodes disponibles sur le système de fichiers déclenche cette règle d'intégrité (le rapport en cours/max dépasse le seuil). | Utilisation d'inode. |
| Utilisation excessive de l'unité centrale par les processus utilisateur. | Vérifie si l'utilisation d'UC par les processus utilisateur est trop élevée (échantillonnage dans une fenêtre temporelle glissante de 180 secondes). | Utilisateur (cpu.user) et topPID. |
| Vous n'aurez bientôt plus d'espace disque. | Détecte les problèmes de capacité à court terme d'un disque et se déclenche lorsque le disque est susceptible de ne plus avoir de capacité au cours de la prochaine heure. Le capteur ne se déclenche pas lorsque le disque a libéré une quantité considérable d'espace (>=100 Mo) récemment, ou lorsque l'espace disque restant est supérieur à 20 % de la capacité totale. Cependant, il se déclenchera à une heure du remplissage de l'espace disque d'après la tendance actuelle. Cette tendance est calculée à partir d'un modèle de régression linéaire installé sur les points de données de la fenêtre temporelle glissante actuelle. | Capacité de stockage disponible dans les disques. |
| Windows Le statut du service a changé. | Vérifie si l'état du service Windows a changé (échantillonnage dans une fenêtre glissante de 60 secondes). | Windows état du service (state). |
Pour plus d'informations sur ce capteur, consultez la documentation de l'hôte.
IBM ACE
| Événement | Description | Métrique |
|---|---|---|
| Statut d'ACE Integration Server | Vérifier le statut d'ACE Integration Server. | État d'Integration Server |
| Format numérique de statut d'ACE Integration Server | Vérifiez le statut numérique d'ACE Integration Server. | Mesures de l'état d'Integration Server |
| Format numérique du statut de connexion du gestionnaire de files d'attente | Vérifiez le statut numérique entre ACE Integration Server et le gestionnaire de files d'attente. | Mesures du statut de connexion du gestionnaire de files d'attente |
| Message avec nombre d'erreurs | Nombre de messages contenant des erreurs. | Nombre de messages avec erreurs |
| Flux de messages avec nombre d'erreurs | Nombre d'erreurs MQGET pour les nœuds MQInput ou nombre d'erreurs Web Services pour les nœuds HTTPInput. | Nombre d'erreurs MQGET |
| Traitement des messages avec le nombre d'erreurs | Nombre d'erreurs survenues lors du traitement d'un message. | Nombre de messages avec erreurs |
| Statut du flux de messages | Vérifiez l'état du flux de messages ACE. | Statut du flux de messages |
| Format numérique du statut du flux de messages | Vérifiez le statut numérique du flux de messages ACE. | Mesures du statut du flux de messages |
Pour plus d'informations sur ce capteur, consultez la documentation d' IBM ACE.
IBM Db2
| Événement | Description | Métrique |
|---|---|---|
| Statut des métriques des utilitaires d'espace table | Recherchez les événements liés à l'espace table et à ses métriques lorsque la fonction de redimensionnement automatique est activée et désactivée. | Utilitaires d'espace table |
| Statut de connexion HADR | Recherchez les événements liés au statut de connexion des bases de données de secours HADR. L'ID de secours est utilisé comme filtre pour générer l'événement HADR_CONNECT_STATUS , qui est spécifique à n'importe quel noeud de secours, et peut être défini avec l'ID de secours dans la zone d'opérateur correspondante. Les événements peuvent être créés en fonction des éléments suivants, qui représentent l'état en cours de n'importe quelle base de données:
|
HADR_CONNECT_STATUS (hadr.standbyId.HADR_CONNECT_STATUS). Les opérateurs correspondants définis sur any généreront les événements quel que soit l'ID de secours. |
Pour plus d'informations sur ce capteur, consultez la documentation d' IBM Db2.
IBM MQ
Gestionnaire de file d'attente IBM MQ
| Événement | Description | Métrique |
|---|---|---|
| Nombre de connexions du gestionnaire de files d'attente | Vérifie s'il n'y a pas de connexions actuellement sur le gestionnaire de files d'attente. | Nombre de connexions (connectionCount) |
| Statut du gestionnaire de files d'attente | Vérifie si le gestionnaire de files d'attente est à l'état arrêté ou de secours pour déclencher l'événement Down ou Switchover . |
Statut du gestionnaire de files d'attente (statusMetric) |
| Statut de l'initialisateur de canal pour le gestionnaire de files d'attente | Vérifie si l'initialisateur de canal est en cours d'exécution. | Statut de l'initialisateur de canal (channelInitiatorStatus) |
| Statut du moteur de publication / abonnement pour le gestionnaire de files d'attente | Vérifie si le moteur de publication ou d'abonnement est en cours d'exécution. | Statut du moteur de publication / abonnement (pubsubStatus) |
| Pont fermé [1] | Indique que le pont IMS est arrêté. | Extrait de la rubrique « Événements » du site IBM MQ |
File d'attente IBM MQ
| Événement | Description | Métrique |
|---|---|---|
| Message le plus ancien de la file | Vérifie si la file d'attente contient des messages antérieurs à la valeur de seuil. | Message le plus ancien dans la file d'attente (oldestMessage) |
| Différence de longueur de la file d'attente | Vérifie si la longueur de la file d'attente est proche de la valeur de longueur maximale de la file d'attente. | Longueur de file d'attente (queueDepth) et longueur maximale de file d'attente (maxQueueDepth) |
| File d'attente saturée | Vérifie si le pourcentage de longueur de la file d'attente a atteint la valeur d'avertissement ou critique. | Pourcentage de nombre de lignes de la file d'attente (queueFullPercentage) |
| File d'attente de transmission élevée | Vérifie si le nombre de messages de file d'attente de transmission est trop élevé. | Nombre de lignes de la file d'attente (queueDepth) |
| Intervalle de service de la file d'attente élevé [1:1] | Détecte qu'aucune opération GET ou appel MQPUT n'a abouti dans un intervalle supérieur à la limite spécifiée dans l'attribut QServiceInterval . |
Extrait de la rubrique « Événements » du site IBM MQ |
| Profondeur de la file d'attente élevée [1:2] | Indique que la longueur de la file d'attente a atteint un seuil prédéfini par un appel MQPUT ou MQPUT1 spécifié dans l'attribut QDepthHighLimit . |
Extrait de la rubrique « Événements » du site IBM MQ |
| File d'attente pleine [1:3] | Indique un échec d'appel (sur un appel MQPUT ou MQPUT1 ) car la file d'attente est saturée. C'est-à-dire que la file d'attente contient déjà le nombre maximal de messages possible. | Extrait de la rubrique « Événements » du site IBM MQ |
Canal IBM MQ
| Événement | Description | Métrique |
|---|---|---|
| Statut du canal | Vérifie si le canal est dans un état sain. | Statut du canal (channelStatus) |
| Statut InDoubt du canal | Vérifie si le canal est à l'état En attente de validation. | Statut du canal (channelStatus) |
| Erreur de conversion de canal [1:4] | Indique une erreur lorsqu'un canal ne parvient pas à effectuer la conversion de données et l'appel MQGET pour obtenir un message de la file d'attente de transmission qui a entraîné une erreur de conversion de données. | Extrait de la rubrique « Événements » du site IBM MQ |
| Erreur de canal SSL [1:5] | Indique une erreur lorsqu'un canal utilisant le protocole Transport Layer Security ( TLS ) ou Secure Sockets Layer ( SSL ) ne parvient pas à établir une connexion MQ. | Extrait de la rubrique « Événements » du site IBM MQ |
Vous pouvez utiliser des événements intégrés pour les canaux dont le statut est Arrêté et InDoubt . Vous devez créer des événements personnalisés pour les canaux ayant un autre statut avec des métriques intégrées. Pour connaître les valeurs de l'énumération relative à l'état du canal, consultez la référence sur les métriques de canal à l'adresse IBM MQ.
Programme d'écoute IBM MQ
| Événement | Description | Métrique |
|---|---|---|
| Statut des programmes d'écoute | Vérifie si le programme d'écoute est dans un état sain. | Statut du programme d'écoute (listenerStatus) |
Pour plus d'informations sur ce capteur, consultez la documentation d' IBM MQ.
IIS Internet Information Server
| Événement | Description | Métrique |
|---|---|---|
| Chute soudaine des demandes de site IIS. | Recherche une baisse soudaine des demandes de site IIS. | Nombre total de demandes de site IIS. |
Pour plus d'informations sur ce capteur, consultez la documentation d' Microsoft IIS.
IBM Datapower
Dispositif IBM DataPower
| Événement | Description | Métrique |
|---|---|---|
| Pourcentage d'utilisation de l'unité centrale de l'appliance | Vérifiez si le pourcentage d'utilisation de l'unité centrale de l'appliance est trop élevé. | Utilisation de l'unité centrale (cpuUsage) |
| Pourcentage d'utilisation de l'appliance | Vérifiez si le pourcentage d'utilisation de la mémoire de l'appliance est trop élevé. | Utilisation de la mémoire (memoryUsage) |
| Pourcentage de la charge du système de l'appareil | Vérifiez si le pourcentage de la charge du système de l'appliance est trop élevé. | Charge du système (systemLoad) |
| Statut de l'appliance | Vérifiez si l'appliance est en bonne santé. | Statut (status) |
Domaine IBM DataPower
| Événement | Description | Métrique |
|---|---|---|
| Pourcentage d'utilisation de la mémoire par le domaine | Vérifiez si le pourcentage d'utilisation de la mémoire par le domaine est trop élevé. | Utilisation de la mémoire en cours (currentMemUsage) |
| IBM DataPower Gateway -Statut d'appairage | Vérifiez si le statut d'appairage de passerelle de chaque instance est rompu. | Statut de rupture ('brokenStatus') |
Service IBM DataPower
| Événement | Description | Métrique |
|---|---|---|
| Pourcentage d'utilisation de la mémoire par le service | Vérifiez si le pourcentage d'utilisation de la mémoire par le service est trop élevé. | Utilisation de la mémoire en cours (currentMemUsage) |
| Etat du service | Vérifiez si le service est en bonne santé. | Statut (status) |
Pour plus d'informations sur ce capteur, consultez la documentation Datapower d' IBM.
JBoss
| Événement | Description | Métrique |
|---|---|---|
| Nombre moyen d'erreurs sur le connecteur trop élevé. | Un pipeline de traitement détecte le nombre d'erreurs survenues sur les connecteurs dans la fenêtre de temps donnée et vérifie également si le nombre d'erreurs est supérieur à la valeur de seuil. | Erreurs de connecteur Jboss. |
| ConnectionPool n'a plus de connexion. | Un pipeline de traitement détecte le taux de connexions utilisées et vérifie s'il est sur le point d'atteindre la valeur de seuil. | Taux de connexions du pool de connexions JBoss utilisées. |
| Plus de connexions sur datasources. | Un pipeline de traitement détecte le nombre de connexions disponibles sur les sources de données dans la fenêtre de temps donnée et vérifie si le nombre total de connexions est sur le point d'atteindre la valeur de seuil. | Connexions datasources Jboss utilisées, connexions datasources disponibles. |
| ThreadPool n'a plus d'unité d'exécution. | Un pipeline de traitement détecte le nombre maximal d'unités d'exécution et vérifie si le nombre d'unités d'exécution en cours est sur le point d'atteindre la valeur de seuil. | Nombre actuel d'unités d'exécution du pool d'unités d'exécution JBoss, unités d'exécution max du pool d'unités d'exécution. |
Pour plus d'informations sur ce capteur, consultez la documentation d' JBoss AS.
JBoss Data Grid
| Événement | Description | Métrique |
|---|---|---|
| Les caches ne sont pas en cours d'exécution. | Vérifie le rapport entre le nombre de caches créés et le nombre de caches en cours d'exécution dans la grille de données Jboss. Si le rapport est comme suit une certaine valeur, alors il est considéré comme une violation. | Caches en cours d'exécution et caches créés dans les gestionnaires de cache. |
Pour plus d'informations sur ce capteur, consultez la documentation d' JBoss Data Grid.
JVM
| Événement | Description | Métrique |
|---|---|---|
| Activité intense de nettoyage de la mémoire. | Un pipeline de traitement surveille le temps de nettoyage de la mémoire pour la plateforme d'exécution JVM et le valide par rapport à un seuil. | Nettoyage de la mémoire JVM. |
| Le cache du code JVM est plein. | Un pipeline de traitement surveille l'utilisation maximale du cache de code de la plateforme d'exécution JVM. | Utilisation maximale du cache de code JVM. |
| Perm Gen est plein (CMS). | Un pipeline de traitement détecte le nombre maximal de pools de CMS Perm Gen utilisés. | pools.CMS Perm Gen |
| Perm Gen est plein (G1). | Un pipeline de traitement détecte le nombre maximal de pools Perm Gen G1 utilisés. | pools.G1 Perm Gen |
| Perm Gen est plein (PS). | Un pipeline de traitement détecte le nombre maximal de pools de PS Perm Gen utilisés. | pools.PS Perm Gen |
| Les unités d'exécution sont bloquées. | Un détecteur surveille la plateforme d'exécution JVM et détecte s'il existe des unités d'exécution bloquées. | Nombre d'unités d'exécution bloquées (threads.deadlocked). |
| J9VM : fuite de mémoire. | Un détecteur vérifie le taux de croissance de la mémoire dynamique utilisée après le ramassage des ordures (GC), en mégaoctets par heure, et détecte s'il existe une fuite de mémoire potentielle dans l' JVM. IBM J9 VM La détection des fuites de mémoire est une fonctionnalité facultative, désactivée par défaut dans le backend Instana. Pour activer cette fonctionnalité facultative, consultez la page correspondant à votre déploiement d' Instana : SaaS, Édition personnalisée auto-hébergée ( Kubernetes ou Red Hat OpenShift Container Platform ) ou Édition classique auto-hébergée ( Docker ) | memory.gc.after memory.gc.before |
Pour plus d'informations sur ce capteur, consultez la documentation d' JVM.
Kafka
Cluster Kafka
| Événement | Description | Métrique |
|---|---|---|
| Nombre de contrôleurs actifs. | Recherche un nombre inhabituel de contrôleurs actifs dans le cluster Kafka. | Nombre de contrôleurs Broker actifs (broker.activeControllerCount). |
Nœud Kafka
| Événement | Description | Métrique |
|---|---|---|
| Charge intense sur l'unité d'exécution du réseau Kafka. | Vérifie si l'unité d'exécution du réseau Kafka subit une charge intense. | Processeur de réseau (broker.networkProcessorIdle). |
| L'unité d'exécution du gestionnaire de requêtes Kafka subit une charge intense. | Vérifie si le gestionnaire de requêtes Kafka subit une charge intense. | Gestionnaire de demandes (broker.requestHandlerIdle). |
| Les élections de leader sont trop fréquentes. | Vérifie s'il y a trop d'élections de leader dans un délai donné. | Elections de leader (broker.leaderElections). |
| Perte potentielle de données en raison d'une élection de leader incorrecte. | Recherche des pertes potentielles de données dues à des élections de leader incorrectes. | Élection de leader incorrecte (broker.uncleanLeaderElections). |
| Les producteurs et les consommateurs sont bloqués. | Vérifie si les producteurs et les consommateurs sont bloqués en raison de la mise hors ligne des partitions. | Partitions hors ligne (broker.offlinePartitionsCount). |
| Le nombre de répliques en synchronisation a diminué. | Vérifie si le nombre de répliques synchrones a diminué et n'a pas récupéré au cours de l'intervalle donné. | Réduction ISR (broker.isrShrinks) et extension ISR (broker.isrExpansions). |
| Partitions sous-répliquées. | Vérifie si le nombre de partitions sous-répliquées dépasse le nombre prévu. | Partitions sous-répliquées (broker.underReplicatedPartitions). |
Pour plus d'informations sur ce capteur, consultez la documentation d' Kafka.
Kubernetes
Cluster Kubernetes
| Événement | Description | Métrique |
|---|---|---|
| Statut du composant de cluster Kubernetes. | Kubernetes signale qu'un composant maître (serveur API-serveur, planificateur, gestionnaire de contrôleur) n'est pas intègre. En raison d'un bogue dans Kubernetes, la santé n'est pas toujours fiable. Nous essayons de les filtrer et de ne pas provoquer une alerte en n'affichant sur la page que les détails du cluster. | Événements de bas niveau Instana. |
Kubernetes DaemonSet
| Événement | Description | Métrique |
|---|---|---|
| Les répliques disponibles sont inférieures aux répliques souhaitées. | Vérifie si le nombre total de répliques disponibles est inférieur au nombre de répliques souhaitées. Cela indique que les serveurs Kubernetes DaemonSet ne sont pas des répliques. | Souhaitées (desiredReplicas) et disponibles (availableReplicas). |
Déploiement Kubernetes
| Événement | Description | Métrique |
|---|---|---|
| Les répliques disponibles sont inférieures aux répliques souhaitées. | Vérifie si le nombre total de répliques disponibles est inférieur au nombre de répliques souhaitées. Cela indique qu'il manque des pods de répliques pour le déploiement Kubernetes. | Souhaitées (desiredReplicas) et disponibles (availableReplicas). |
Espace de nom Kubernetes
| Événement | Description | Métrique |
|---|---|---|
| Quantité trop faible de demandes d'UC pouvant être allouée. | L'UC demandée approche de la capacité maximale (le rapport UC demandée/Capacité UC est supérieur à 80 %). | Allocation de demandes d'UC (required_cpu_percentage). |
| Quantité trop faible de demande de mémoire pouvant être allouée. | La mémoire demandée se rapproche de la capacité maximale (le rapport de mémoire demandée/capacité mémoire est supérieur à 80 %) | Allocation de demandes de mémoire (required_mem_percentage). |
| Nombre de pods pouvant être alloués trop faible. | Les pods alloués approchent de la capacité maximale (le rapport de capacité pods / pods alloués est supérieur à 80%). Pour un espace de nom, les pods des phases Pending, Runninget Unknown sont comptabilisés comme alloués. Les valeurs de capacité de l'espace de nom reposent sur ResourceQuotas, qui peut être défini par espace de nom. Pour plus d'informations, voir la documentation Kubernetes . |
Allocation de pods (used_pods_percentage). |
Noeud Kubernetes
| Événement | Description | Métrique |
|---|---|---|
| L'UC pouvant être allouée est trop faible. | L'UC demandée approche de la capacité maximale (le rapport UC demandée/Capacité UC est supérieur à 80 %). | Allocation de demandes d'UC (required_cpu_percentage). |
| La mémoire pouvant être allouée est trop faible. | La mémoire demandée se rapproche de la capacité maximale (le rapport de mémoire demandée/capacité de mémoire est supérieur à 80%). | Allocation de demandes de mémoire (required_mem_percentage). |
| Nombre de pods pouvant être alloués trop faible. | Les pods alloués approchent de la capacité maximale (le rapport de capacité pods / pods alloués est supérieur à 80%). Pour un noeud, les pods des phases Running et Unknown sont comptabilisés comme alloués. Pour plus d'informations, voir la documentation Kubernetes . |
Allocation de pods (alloc_pods_percentage). |
| Statut de condition du nœud Kubernetes. | Le nœud signale une condition qui n'est pas prête depuis plus d'une minute. Pour un noeud qui correspond à toutes les conditions en dehors de la condition Ready . Pour plus d'informations, consultez la documentation de Kubernetes. |
Événements de bas niveau Instana. |
Pod Kubernetes
| Événement | Description | Métrique |
|---|---|---|
| Statut de la condition Pod de Kubernetes. | Un pod n'est pas prêt pour plus d'une minute, alors qu'il n'est pas terminé. (PodCondition=Ready, Status=False, Reason != PodCompleted). Pour plus d'informations, consultez la documentation de Kubernetes. | Événements de bas niveau Instana. |
Pour plus d'informations sur ce capteur, consultez la documentation d' Kubernetes.
Kubernetes Coût
| Événement | Description | Métrique |
|---|---|---|
| Kubecost vCPU utilisation > 200 | Un avertissement sera enregistré lorsque vous approcherez de la limite de 250 licences gratuites d' vCPU. | coreCountStats.totalCoreCount |
| Kubecost vCPU utilisation > 250 | La licence gratuite ne prend en charge que 250 vCPUs au maximum. | coreCountStats.totalCoreCount |
Modèles linguistiques à grande échelle (LLM)
| Événement | Description | Métrique |
|---|---|---|
| OTel Seuil de statut des grands modèles de langage. | Lorsque le système LLM est hors service, les alarmes se déclenchent. | Statut (llm.status). |
| OTel Durée de réponse des grands modèles de langage. | Lorsque le temps de réponse du LLM dépasse le seuil défini, les alarmes se déclenchent. | Latence (llm.response.duration.max). |
Noeud Memcached
| Événement | Description | Métrique |
|---|---|---|
| Vider toutes les commandes exécutées. | Détecte un nombre élevé pour la commande flush_all. |
Vider (cmd_flush). |
| Expulsions importantes de clés. | Détecte un nombre élevé d'expulsions importantes de clés. | Expulsion (evictions). |
| Le nombre de connexions en file d'attente augmente. | Détecte un nombre élevé de connexions en file d'attente. | En file d'attente (conn_queued). |
| Le nombre de connexions produites a augmenté. | Détecte un nombre élevé de connexions produites. | Productions (conn_yields). |
| Les octets utilisés par Memcached ont atteint la limite maxbytes. | Les octets utilisés par Memcached ont atteint la limite maxbytes. | Octets utilisés. |
Pour plus d'informations sur ce capteur, consultez la documentation d' Memcached.
Noeud MongoDB
| Événement | Description | Métrique |
|---|---|---|
| Augmentation continue de la latence du vidage l'arrière-plan. | La base de données fait état d'une augmentation de la latence du vidage en arrière-plan (échantillonnage dans une fenêtre temporelle glissante de 150 secondes). | Latence du dernier vidage en arrière-plan (backgroundFlushingLast). |
| Longueur de file d'attente de verrouillage en augmentation constante. | Surveille la métrique de la file d'attente de verrouillage MongoDb et valide si la taille de la file d'attente de verrouillage augmente trop rapidement. | Longueur de la file d'attente de verrouillage (lockQueue). |
| Augmentation des erreurs de page. | Augmentation des erreurs de page (échantillonnage dans une fenêtre temporelle glissante de 150 secondes). | Nombre d'erreurs de page (pageFaults). |
| Augmentation des validations de journal en verrouillage d'écriture | Augmentation des validations de journal en verrouillage d'écriture (échantillonnage dans une fenêtre temporelle glissante de 150 secondes). | Verrouillage d'écriture dans le journal (journalWriteLock). |
| Taux trop élevé de mémoire virtuelle non mappée | Taux trop élevé de mémoire virtuelle non mappée (déclenchée instantanément et signalée par le détecteur d'hôte Instana). | Virtual et mapped. |
Ensemble de réplicas MongoDB
| Événement | Description | Métrique |
|---|---|---|
| Un ou plusieurs membres de ReplicaSet sont à l'arrêt. | Le membre, vu depuis un autre membre de l'ensemble, est inaccessible. | unreachableNodeCount. |
| Statut de surveillance ReplicaSet. | Surveille l'intégrité de tous les membres du jeu de répliques MongoDB. | Nombre de retards d'esclave (slaveDelaysCount), nombre d'optimes (optimesCount) et nombre de membres surveillés (monitoredMembersCount). |
| Le décalage de réplication augmente. | Le décalage de réplication augmente (échantillonnage dans une fenêtre temporelle glissante de 150 secondes). | Retards esclave (slaveDelays) et Optimes (optimes). |
| Utilisation élevée de la connexion Replica Set. | Le nombre de connexions actives est supérieur à 90 % des connexions maximales. | Connexions ('connections'). |
Pour plus d'informations sur ce capteur, consultez la documentation d' MongoDB.
MongoDB cluster fragmenté (Mongos)
Événements pouvant survenir dans un environnement de cluster fragmenté d' MongoDB.
Le tableau suivant décrit les événements pouvant survenir dans un environnement de cluster fragmenté d' MongoDB :
| Événement | Description | Métrique |
|---|---|---|
| Tous les serveurs de configuration sont inaccessibles. | Aucun serveur de configuration n'est accessible depuis l'instance mongos. Il est impossible d'accéder aux métadonnées du cluster. | Vérification de la connectivité du serveur de configuration. |
| Les serveurs de configuration sont partiellement inaccessibles | Certains serveurs de configuration ne sont pas accessibles depuis l'instance mongos. Cette situation pourrait affecter la disponibilité des métadonnées du cluster. | Vérification de la connectivité du serveur de configuration |
| Fragment inaccessible | Un fragment n'est pas accessible depuis l'instance mongos. Cette situation affecte la disponibilité des données pour ce segment. | Vérification de la connectivité des shards |
| Le pool de connexions est épuisé. | Le pool de connexions Mongos ne dispose d'aucune connexion disponible (0 disponible). Les demandes de nouveaux clients ne peuvent pas être traitées. | Pool de connexions disponible (connectionPool.available). |
| Taux d'utilisation élevé du pool de connexions | Le taux d'utilisation du pool de connexions Mongos dépasse 90 %. Le pool de connexions risque d'être bientôt épuisé. | Pool de connexions disponible (connectionPool.available) et total (connectionPool.total) |
Pour plus d'informations sur ce capteur, consultez la documentation relative à la surveillance de l' MongoDB.
Base de données MySQL
| Événement | Description | Métrique |
|---|---|---|
| Les connexions serveur disponibles sont à la limite. | Le rapport entre l'utilisation et la limite de connexions est supérieur au seuil configuré. | Connexions (status.THREADS_CONNECTED). |
Pour plus d'informations sur ce capteur, consultez la documentation d' MySQL.
Serveur Nginx
| Événement | Description | Métrique |
|---|---|---|
| Nginx a un problème avec des homologues hors ligne. | Homologue inactif (disponible uniquement pour NGINX Plus). | Échec de services en amont (nginx_plus.http.upstreams.peers.failed). |
| Nginx élimine des connexions. | Connexions éliminées. | Connexions éliminées (connections.dropped). |
| Nginx échoue dans des négociations SSL. | Échecs de négociations SSL (disponible uniquement pour NGINX Plus). | Échec de négociations (nginx_plus.ssl.handshakes_failed). |
| Le nombre de connexions actives est proche de la valeur maximale. | Le taux de connexions utilisées dépasse le seuil configuré pour le taux de connexions utilisées. | Connexions actives (connections.active). |
Pour plus d'informations sur ce capteur, consultez la documentation d' NGINX.
Application Node.js
| Événement | Description | Métrique |
|---|---|---|
| Activité intense de nettoyage de la mémoire. | Vérifie si le temps passé en nettoyage de mémoire dans la fenêtre temporelle est supérieur au seuil donné. | Métriques de pauses pour nettoyage de mémoire. |
| Des diagnostics d'intégrité échouent. | Vérifie s'il existe des échecs de diagnostics d'intégrité. Pour plus d'informations, consultez la section Assistance pour les bilans de santé. | Résultat de diagnostic d'intégrité (healthcheckResult). |
Pour plus d'informations sur ce capteur, consultez la documentation d' Node.js.
Configuration de déploiement OpenShift
| Événement | Description | Métrique |
|---|---|---|
| Les répliques disponibles sont inférieures aux répliques souhaitées. | Vérifie si le nombre total de répliques disponibles est inférieur au nombre de répliques souhaitées. Cela indique que la configuration OpenShift DeploymentConfig ne contient pas de fichiers de réplique. | Souhaitées (desiredReplicas) et disponibles (availableReplicas). |
Pour plus d'informations sur ce capteur, consultez la documentation OpenShift.
Hôte OTel
| Événement | Description | Métrique |
|---|---|---|
| Temps d'attente CPU dépassé | Vérifie si le système passe beaucoup de temps à attendre des opérations d'entrée ou de sortie. | Attente de l'unité centrale (cpu.wait) |
| Temps de vol de l'unité centrale dépassé | Spécifie le nombre de violations autorisées du délai d'attente de l'unité centrale au cours d'une période donnée. | Vol de CPU (cpu.steal) |
| Utilisation élevée de l'unité centrale | Vérifie si l'utilisation de l'unité centrale est élevée. Cet événement évalue en permanence les données sur l'intervalle le plus récent de 180 secondes. | Utilisateur de l'unité centrale (cpu.user) |
| Charge du système trop élevée | Vérifie si la charge du système est élevée en comparant la charge à deux fois le nombre de cœurs de l'unité centrale de la machine. Cet événement évalue en permanence les données sur l'intervalle de 120 secondes le plus récent. | Chargement (load.avg_1m) |
| Mémoire système épuisée | Vérifie si la mémoire du système est presque entièrement utilisée (déclenchement instantané). | Mémoire libre (memory.free) et Mémoire utilisée (memory.used) |
| Disque de faible capacité | Détecte les problèmes de capacité à court terme d'un appareil dont la taille est inférieure à un seuil statique (1GB) ou inférieure à 1 % de la taille totale du volume. En outre, il détecte la capacité si le temps restant jusqu'à zéro fournit le taux de changement actuel est inférieur à 15 minutes. | Capacité de stockage libre des disques |
Pour plus d'informations sur ce capteur, consultez la documentation d' OpenTelemetry.
OracleDB
| Événement | Description | Métrique |
|---|---|---|
| Le rapport entre le temps d'UC de la base de données et le temps de base de données est faible. | Le rapport entre le temps UC de la base de données et le temps de la base de données est le suivant: | Rapport Délai d'UC de la base de données/Temps de base de données (stats.cpuTimeDbTimeRatio). |
| L'utilisation de l'espace table est élevée. | L'espace utilisé dans l'espace table est plus important que la quantité configurée pour le maximum d'espace. | Pourcentage d'espace utilisé dans l'espace table. |
| Nombre total de sessions au maximum. | Le taux de sessions utilisées dépasse le seuil configuré pour le taux de sessions utilisées. | Sessions/Limite de session (stats.usedSessionsRatio). |
Pour plus d'informations sur ce capteur, consultez la documentation d' OracleDB.
Processus de système d'exploitation
| Événement | Description | Métrique |
|---|---|---|
| Utilisation de l'UC | Le processus provoque une utilisation élevée de l'unité centrale sur l'hôte. | Résultat d'une évaluation de règle pour utilisation intense de l'UC sur l'hôte sous-jacent et pour temps utilisateur d'UC du processus donné. |
| Utilisation de fichiers ouverts. | Le processus ouvre les fichiers plus rapidement qu'il ne les ferme (le rapport en cours/max dépasse le seuil) | D'occasion (openFiles.used). |
| Arrêt anormal. | Processus interrompu à la suite d'un signal non intercepté. | |
| Arrêt anormal. | Processus arrêté avec un code de sortie non nul. |
Pour plus d'informations sur ce capteur, consultez la documentation relative aux processus du système d'exploitation.
Environnement d'exécution PHP-FPM
| Événement | Description | Métrique |
|---|---|---|
| Redémarrages fréquents du pool worker PHP-FPM. | Recherche des redémarrages fréquents d'un pool worker PHP-FPM en évaluant le nombre de ses redémarrages dans une fenêtre de temps donnée par rapport à un seuil donné. | Heure de début d'un pool worker. |
| Retard de traitement d'écoute en dépassement de capacité configuré. | Vérifie si le retard de traitement d'écoute d'un pool worker est en dépassement de capacité configuré. | Longueur de file d'attente du pool worker. |
| Trop de connexions réinitialisée. | Vérifie si le nombre de réinitialisations de connexion dépasse le seuil indiqué dans la fenêtre temporelle donnée. | Métrique de réinitialisations de connexion pour le pool worker. |
| Trop de demandes s'accumule dans le retard de traitement d'écoute. | Vérifie la taille des différentes files d'attente worker PHP-FPM et les valide par rapport à la valeur de seuil. | Métriques de taille de file d'attente d'écoute pour différentes files d'attente worker PHP-FPM. |
| Trop de demandes ralenties. | Vérifie le taux de demandes ralentit par rapport à l'ensemble des pools worker PHP-FPM surveillés. | Métrique des demandes ralenties et de connexion acceptée pour un pool worker d'une instance PHP-FPM. |
Pour plus d'informations sur ce capteur, consultez la documentation d' PHP.
Vérification synthétique
| Événement | Description | Métrique |
|---|---|---|
| La cible distante n'est pas accessible. | Vérifie si le pourcentage de tentatives de communication ayant échoué dans la fenêtre temporelle glissante donnée dépasse le seuil indiqué. | Statut de la commande Ping (status). Un code de statut http compris entre 200-206 et 300-307 génère un statut sain, pour icmp, la valeur de sortie 0 est considérée comme étant saine tandis que la valeur 1 est considérée comme étant non saine. En outre, un temps d'exécution maximal de 2 secondes est défini. |
Pour plus d'informations sur ce capteur, consultez la documentation relative à Synthetic Check.
Base de données PostgreSQL
| Événement | Description | Métrique |
|---|---|---|
| Utilisation de connexion active. | Le nombre de connexions actives est supérieur à 90 % des connexions maximales. | Utilisatio connexion (max_conn_pct). |
Pour plus d'informations sur ce capteur, consultez la documentation d' PostgreSQL.
Processus
| Événement | Description | Métrique |
|---|---|---|
| Utilisation intense de l'UC. | Évalue si le processus donné provoque une utilisation intense de l'unité centrale sur un hôte. | Résultats de l'évaluation de la règle d'utilisation intense de l'unité centrale sur l'hôte sous-jacent et du temps utilisateur de l'unité centrale du processus donné. |
| Trop de fichiers ouverts. | Le pourcentage de fichiers ouverts est supérieur au seuil configuré. | D'occasion (openFiles.used). |
RabbitMQ
Cluster RabbitMQ
| Événement | Description | Métrique |
|---|---|---|
| Partition réseau RabbitMQ détectée | Détecte si la partition réseau se produit dans le cluster RabbitMQ (déclenché toutes les 5 secondes). | Nombre total de partitions réseau (net_partitions_count). |
Serveur RabbitMQ
| Événement | Description | Métrique |
|---|---|---|
| Les files d'attente se remplissent avec des messages | Pendant une période de 10 minutes, les files d'attente se remplissent ont en cours de remplissage avec des messages qui ne sont pas livrés. | Messages prêts (overview.messages_ready) et messages en réception confirmée (overview.ack). |
| RabbitMq n'a pas de consommateurs | Au cours des 5 dernières secondes, RabbitMQ n'a pas eu de consommateurs. | Consommateurs (overview.consumers). |
| RabbitMq n'a pas de connexions | Depuis les 5 dernières secondes, RabbitMQ n'a pas de connexions. | Connexions (overview.connections). |
Nœuds RabbitMQ
| Événement | Description | Métrique |
|---|---|---|
| L'utilisation des descripteurs de fichier RabbitMQ est critique. | Le taux d'utilisation des descripteurs de fichier est critique sur un noeud spécifique (avertissement: > 90%, critique: > 98%). Cette opération est déclenchée toutes les 5 secondes. | Taux d'utilisation des descripteurs de fichier RabbitMQ (fd_used_rate). |
| L'utilisation de la mémoire de RabbitMQ est critique sur le nœud. | Le taux d'utilisation de la mémoire est critique sur un noeud spécifique (avertissement: > 90%, critique: > 98%). Cette opération est déclenchée toutes les 5 secondes. | Taux d'utilisation de la mémoire de RabbitMQ (mem_used_rate). |
| Le nombre de processus RabbitMQ Erlang est critique. | Le nombre de processus Erlang est critique sur un noeud spécifique (Avertissement: > 90%, Critique: > 98%). Cette opération est déclenchée toutes les 5 secondes. | Taux de processus RabbitMQ. |
Files d'attente RabbitMQ
| Événement | Description | Métrique |
|---|---|---|
| Plus de messages produits que de messages consommés. | Le nombre de messages publiés dans une file d'attente est supérieur à ce que les consommateurs peuvent traiter dans une file d'attente. | Messages RabbitMQ non reconnus dans une file d'attente. |
Pour plus d'informations sur ce capteur, consultez la documentation d' RabbitMQ.
Redis
Cluster Redis
| Événement | Description | Métrique |
|---|---|---|
| L'état du cluster Redis n'est pas correct. | Le cluster est dans un état inapproprié. | cluster_state. |
Nœud Redis
| Événement | Description | Métrique |
|---|---|---|
| Analyse de l'allocation de mémoire. | Le serveur Redis est à l'origine de la fragmentation de la mémoire externe. | Mémoire utilisée (used_memory) et taux de fragmentation de la mémoire (mem_fragmentation_ratio). |
| Le taux de hits Redis est faible. | Le taux de hits Redis est le suivant: le seuil configuré. | Taux d'accès au cache (hit_rate), accès à l'espace de clés (keyspace_hits), échecs d'accès à l'espace de clés (keyspace_misses), et clés supprimées de Redis (evicted_keys). |
| L'utilisation de la mémoire Redis se rapproche de la limite maximale de la mémoire. | L'utilisation de la mémoire Redis se rapproche de la limite maximale de la mémoire. | Mémoire utilisée (used_memory). |
| Rejet de connexions par Redis. | Redis rejette des connexions. | Nombre de connexions rejetées (rejected_connections). |
| Le nœud esclave Redis ne peut pas se connecter au nœud maitre. | Le nœud esclave Redis ne peut pas se connecter au nœud maitre. | master_downtime_seconds. |
Pour plus d'informations sur ce capteur, consultez la documentation d' Redis.
SAP ABAP
| Événement | Description | Métrique |
|---|---|---|
| Le verrouillage dure depuis plus de 5 minutes | Détecte les conflits d'accès et fournit des détails sur le mode de verrouillage et l'objet de verrouillage. | Conflit de verrouillage ABAP |
| Vidages ABAP générés | Détecte les vidages ABAP qui sont générés et fournit des détails sur la gravité. | Gravité des vidages ABAP |
| Des erreurs IDoc entrantes et OutBound se sont produites | Détecte les erreurs pour les IDocs entrants et sortants. | Erreur IDoc entrante et erreur IDoc sortante |
| Une tâche en arrière-plan est interrompue ou annulée | Détecte si une tâche en arrière-plan est interrompue ou annulée. | Une tâche en arrière-plan est interrompue ou annulée |
| Utilisation élevée de l'unité centrale détectée | Détecte si l'utilisation de l'unité centrale est supérieure à 90%. | Utilisation élevée de l'UC |
| Utilisation élevée de la mémoire détectée | Détecte si l'utilisation de la mémoire est supérieure à 90%. | Utilisation élevée de la mémoire |
| Processus de travail en mode arrêté, arrêt ou PRIV (privé) détecté | Détecte si le processus de travail est en mode PRIV (privé), arrêté ou arrêté. | Statut du processus de travail |
| Le processus de travail « En attente » dépasse le seuil | Détecte si le nombre de processus de travail est en attente et dépasse 5. | Statut du processus de travail |
| Seuil d'utilisation du système de fichiers détecté | Détecte si l'utilisation du système de fichiers dépasse le seuil de 80%. | Utilisation du système de fichiers |
| Problèmes de connexion détectés | Détecte un nom d'utilisateur ou un mot de passe incorrect, une défaillance de la passerelle ou des tentatives de connexion incorrectes. | Statut de connectivité |
| Autorisation manquante détectée | Détecte si l'utilisateur ne dispose pas de l'autorisation d'exécuter un module de fonction. | Contrôle d'autorisation |
| Compte utilisateur verrouillé détecté | Détecte si le compte utilisateur est verrouillé en raison d'échecs de connexion. | Verrou de compte utilisateur |
| Erreur de spool détectée | Détecte une erreur de spool. | Erreur de spool |
| Temps de réponse du dialogue dépassant le seuil | Détecte si le temps de réponse du dialogue dépasse le seuil préféré. | Temps de réponse de dialogue |
| Processus de travail dialogué dépassant le seuil | Détecte si le processus de travail du dialogue dure plus de 10 secondes. | Processus de travail de dialogue |
| Latence de la base de données dépassant le seuil | Détecte si la latence moyenne de la base de données dépasse 5 secondes. | Latence de base de données |
| Détection de la libération de l'ordre de transport | Détermine si l'ordre de transport est libéré ou protégé. | Demande de transport |
| La durée de la tâche en arrière-plan dépasse 6 heures | Détecte si la tâche en arrière-plan ne s'est pas terminée dans les 6 heures. | Travaux en arrière-plan |
| La durée de l'appel du service Web dépasse 10 minutes | Détecte lorsqu'un appel de service Web (client ou destination) ne s'achève pas dans les 10 minutes. | Appels de services Web |
| Le temps de traitement de la passerelle dépasse 60 secondes | Détecte si le temps de traitement des appels vers la passerelle dépasse 60 secondes. | Statistiques de passerelle |
Pour plus d'informations sur ce capteur, consultez SAP ABAP.
SAP Java NetWeaver
| Événement | Description | Métrique |
|---|---|---|
| Utilisation élevée de l'unité centrale détectée | Détecte si l'utilisation de l'unité centrale est supérieure à 90%. | Utilisation élevée de l'UC |
| Utilisation élevée de la mémoire détectée | Détecte si l'utilisation de la mémoire est supérieure à 90%. | Utilisation élevée de la mémoire |
| Utilisation élevée du disque détectée | Détecte si l'espace disque utilisé dépasse 90 %. | Utilisation élevée du disque |
| Échec d'authentification détecté | Détecte les échecs d'authentification dus à un nom d'utilisateur ou un mot de passe incorrect. | Échec d'authentification |
| Échec de l'autorisation détecté | Détecte un échec d'autorisation dû au fait qu'aucune action « JMXManageAll » n'a été attribuée à l'utilisateur. | Echec d'autorisation |
| Délai d'attente de connexion dépassé | Détecte les délais d'expiration de connexion ou les problèmes liés au réseau. | Délai d'attente de connexion dépassé |
| Charge système élevée détectée | Détecte si la charge moyenne du système est supérieure à 90 %. | Utilisation élevée des ressources système |
| Problème de GC détecté | Détecte le problème lié au ramasse-miettes (GC). | Problèmes de GC détectés |
| Problème système détecté | Détecte le problème du système. | Problèmes système détectés |
| Pénurie de mémoire du tas | Détecte s'il y a un manque de mémoire disponible dans le tas. | Pénurie de mémoire du tas |
| Mémoire insuffisante | Détecte si une erreur de mémoire insuffisante se produit. | Mémoire insuffisante |
| Utilisation élevée de threads d' HTTP | Détecte si le nombre de threads actifs de l' HTTP atteint la taille configurée du pool. | Utilisation intensive de threads dans High HTTP |
Pour plus d'informations sur ce capteur, consultez SAP Java Netweaver.
SAP HANA
| Événement | Description | Métrique |
|---|---|---|
| Utilisation élevée de l'unité centrale | Détecte si l'utilisation totale de l'unité centrale dépasse 90 % | Total d'utilisation de l'UC |
| Utilisation élevée de la mémoire HANA | Détecte si la mémoire utilisée dépasse 90% de la limite allouée | Utilisation de la mémoire HANA |
| Utilisation élevée de la mémoire de l'hôte | Détecte si l'utilisation de la mémoire de l'hôte dépasse 90 % | Utilisation de la mémoire hôte |
| Utilisation élevée de la mémoire du tas | Détecte lorsque l'utilisation de la mémoire du tas dépasse 90 % | Utilisation du segment de mémoire |
| Utilisation élevée du disque | Détecte si l'utilisation du disque dépasse 90 % | Synthèse de l'utilisation du disque |
| Nombre élevé de connexions en file d'attente | Détermine si les connexions de mise en file d'attente sont multiples | Connexions |
| Nombre élevé de sessions bloquées | Détermine si les sessions bloquées sont multiples | Sessions |
| Nombre élevé de sessions de blocage | Détermine si les sessions de blocage sont multiples | Sessions |
| Nombre élevé de fils bloqués | Détecte si les threads bloqués sont supérieurs à 10 | Unités d'exécution |
| Nombre élevé de threads SQL bloqués | Détecte si les threads SQL bloqués sont supérieurs à 10 | Fils SQL |
| Nombre élevé de threads de travail bloqués | Détecte si le nombre de threads de travail bloqués est supérieur à 10 | Unités d'exécution de noeud worker de tâche |
| Nombre élevé de demandes en attente | Détecte si les demandes en attente sont supérieures à 10 | Demandes |
| Unité centrale de traitement élevée | Détecte si l'une des unités centrales du processus dépasse 90 % | Détails du service |
| Le statut du service n'est pas actif | Détecte si l'état de service n'est pas actif | Détails du service |
| Utilisation élevée de la mémoire par les services HANA | Détecte lorsque l'utilisation de la mémoire des services HANA dépasse 90 % | Détails du service |
| Echec de la sauvegarde | Détecte la dernière sauvegarde ayant échoué | Dernière sauvegarde |
| Blocage de l'utilisateur | Détecte lorsque le nombre de verrous utilisateur dépasse 10 | Verrous utilisateur |
| Les tâches planifiées ont échoué | Détecte les tâches planifiées qui ont échoué | Travaux planifiés |
| Des événements système se sont produits | Détecte les événements du système | Evénements système |
| Échec de la sauvegarde du journal des archives | Détecte les échecs des sauvegardes de journaux | Toutes les sauvegardes |
| La transaction n'est pas active | Détection de l'interruption partielle et de l'interruption des transactions | Statistiques des transactions |
| Transactions bloquées | Détecte lorsqu'une transaction est bloquée | Transactions bloquées |
| Consommation importante de données | Détecte lorsque l'utilisation des données atteint 90 % | Volume de données utilisées |
| Événement « Mémoire insuffisante » | Détecte toute situation de mémoire insuffisante | Mémoire saturée |
Pour plus d'informations sur le capteur « SAP HANA », consultez la page SAP HANA.
Service
| Événement | Description | Métrique |
|---|---|---|
| Chute total des appels. | Détecte une baisse rapide jusqu'à zéro (concrètement le service n'est plus appelé) dans les valeurs des appels par rapport aux valeurs des 30 dernières minutes. L'ampleur de la baisse des appels devrait également dépasser les paramètres relatifs et absolus de seuil comme suit. | Appels/s (count). |
| Taux d'erreur trop élevé. | Détecte un taux d'erreurs constamment élevé lorsque l'indicateur clé de performance moyen des erreurs au cours des quatre dernières minutes est supérieur à la valeur de seuil indiquée. | Taux d'erreur (error_rate). |
| Tendance croissante du taux d'erreur. | Vérifie l'existence d'une tendance croissante dans une mesure donnée. La règle est conçue pour détecter des augmentations faiblement monotones dans la métrique donnée. Le capteur n'est cependant pas strict et tolère certaines diminutions de la valeur métrique à l'intérieur de la tendance envisagée. | Taux d'erreur (error_rate). |
| Une baisse soudaine des appels. | Détecte une baisse rapide des valeurs de l'indicateur clé de performance des appels par rapport aux valeurs des 30 dernières minutes. L'ampleur de la baisse des appels devrait également dépasser les paramètres relatifs et absolus de seuil comme suit. | Appels/s (count). |
| Augmentation soudaine du taux d'erreur. | Détecte une augmentation rapide des valeurs de l'indicateur clé de performance des erreurs par rapport aux valeurs des 10 dernières minutes. L'ampleur de l'augmentation des erreurs devrait également dépasser les paramètres de seuil relatifs et absolus comme suit. | Taux d'erreur (error_rate). |
| Augmentation soudaine de la latence. | Détecte une augmentation rapide du percentile du KPI de latence spécifié par rapport aux valeurs du KPI enregistrées au cours des 30 dernières minutes. L'ampleur de l'augmentation de la latence doit dépasser les paramètres de seuil relatifs et absolus. | Latence 50e (duration.50th). |
| Augmentation soudaine de la latence pour une fraction des demandes | Détecte une augmentation rapide du percentile du KPI de latence spécifié par rapport aux valeurs du KPI enregistrées au cours des 30 dernières minutes. L'ampleur de l'augmentation de la latence doit dépasser les paramètres de seuil relatifs et absolus. | Latence au 99e centile (duration.99th). |
Solr
Cluster Solr Cloud
| Événement | Description | Métrique |
|---|---|---|
| Nœuds Solr inaccessibles. | Un ou plusieurs nœuds sont en panne. | unreachableNodes. |
Nœud Solr
| Événement | Description | Métrique |
|---|---|---|
| Le taux d'accès à la mémoire cache Solr est faible. | Le taux de réussite en cache Solr est de 80% au cours de la dernière minute, probablement en raison d'expulsions importantes ou de clients qui interrogent des données incorrectes. | Taux d'accès à Solr (hitratio) et Expulsions Solr. |
Pour plus d'informations sur ce capteur, consultez la documentation d' Apache Solr.
Spark
Application Spark
| Événement | Description | Métrique |
|---|---|---|
| Échec des tâches sur l'exécuteur. | Le nombre de tâches ayant échoué sur un exécuteur dépasse le seuil configuré. | Les tâches de l'application Spark ont échoué. |
| Le retard de planification est élevé. | Le retard de planification augmente trop vite ou est trop élevé. | Retard de planification (schedulingDelay). |
Spark Standalone
| Événement | Description | Métrique |
|---|---|---|
| Le pilote a échoué. | Le nombre de pilotes ayant échoué dépasse le seuil configuré. | Nombre de pilotes ayant échoué (drivers.failed). |
| Le maître Spark standalone fait état d'un ou plusieurs worker(s) morts. | Le nombre de workers morts dépasse le seuil configuré. | Workers morts (workers.deadWorkers). |
| Le maître Spark Standalone signal un ou des worker(s) dans un état inconnu. | Le nombre de workers dans un état inconnu dépasse le seuil configuré. | |
| L'application soumise a échoué. | Le nombre d'applications ayant échoué dépasse le seuil configuré. | Workers dans un état inconnu (workers.workersInUnknownState). |
Pour plus d'informations sur ce capteur, consultez la documentation d' Apache Spark.
Application Spring Boot
| Événement | Description | Métrique |
|---|---|---|
| Le nombre de sessions actives atteint le nombre maximal. | Un pipeline de traitement détecte le nombre de connexions actives de l'application SpringBoot dans la fenêtre temporelle donnée. Elle vérifie si le nombre de sessions actives est supérieur à la valeur de seuil. | Sessions actives (metrics.httpsessions.active). |
| Application Spring Boot à l'arrêt. | Surveille le statut de l'application SpringBoot. | Statut de l'application SpringBoot (metrics.status). |
Pour plus d'informations sur ce capteur, consultez la documentation d' Spring Boot.
Serveur Sybase
| Événement | Description | Métrique |
|---|---|---|
| Les connexions serveur disponibles sont à la limite. | Le nombre de connexions est proche de 100 % de la limite des connexions par serveur. | Connexions (stats.connCount). |
| Le nombre maximal de bases de données est limité. | Le nombre de bases de données est proche de 100 % de la limite de bases de données par serveur. | databasesCount. |
Pour plus d'informations sur le capteur SQL Anywhere d' SAP, consultez la section « Surveillance d' SAP SQL Anywhere ».
PoP synthétique
| Événement | Description | Métrique |
|---|---|---|
| Statut de la fenêtre en incrustation synthétique | Vérifiez si l' PoP e synthétique peut se connecter au backend d' Instana | Statut de PoP synthétique (status) |
| Statut du moteur de simulation | Vérifiez si le moteur de simulation est surchargé. | Statut de la charge de travail des moteurs de simulation browserscript.workloadStatus, http.workloadStatus, javascript.workloadStatuset ism.workloadStatus. |
| Echec d'extraction des données d'identification | Impossible d'obtenir les identifiants synthétiques auprès du backend Instana. | Code d'erreur et message d' URL ation de la fonction pop_get_cred_failed(error.pop_get_cred_failed). |
| Echec de l'extraction des tests | Impossible de récupérer les tests synthétiques depuis le backend Instana. | Code d'erreur et URL de pop_get_test_failed (error.pop_get_test_failed ). |
| Echec du signalement des résultats de test | Échec de l'envoi des résultats du test synthétique vers le backend d' Instana. | Code d'erreur et message d' URL de la fonction pop_report_result_failed(error.pop_report_result_failed). |
| Echec de la génération de rapports sur les détails du test tesult | Impossible d'enregistrer les détails des résultats des tests synthétiques dans le backend d' Instana. | Code d'erreur et URL de pop_report_result_details_failed (error.pop_report_result_details_failed ). |
| Le nombre de lignes de la file d'attente des résultats de génération | Détecter si la longueur de la file d'attente des résultats est élevée | ResultQueueDepthHigh (resultQueueDepthHigh). |
Pour plus d'informations sur ce capteur, consultez la documentation relative à l' PoP e synthétique.
TIBCO EMS
| Événement | Description | Métrique |
|---|---|---|
| Les connexions dépassent les connexions disponibles max. | Le nombre maximal de connexions est presque entièrement utilisé. | Nombre de connexions (connectionCount). |
| L'utilisation de la mémoire pour les messages dépasse la limite. | La mémoire maximale pour les message est presque entièrement utilisée. | Mémoire pour les messages (messagesMemory). |
| Les messages en attente de files d'attente dépassent la limite. | Le nombre maximal de messages en attente pour la file d'attente est presque entièrement utilisé. | Utilisation des messages en attente de file d'attente. |
| Les messages en attente de rubrique dépassent la limite. | Le nombre maximal de messages en attente pour la rubrique est presque entièrement utilisé. | Utilisation de messages en attente de rubrique. |
Pour plus d'informations sur ce capteur, consultez la documentation TIBCO EMS.
Tomcat
| Événement | Description | Métrique |
|---|---|---|
| Les connexions actives ont atteint le maximum. | Détecte si le nombre de connexions d'un connecteur spécifique atteint sa valeur maximale configurée. | Nombre de connexions de connecteur. |
| Baisse soudaine du nombre de sessions. | Recherche une baisse significative du nombre de sessions. | Nombre total de sessions (totalSessionCount). |
| Augmentation soudaine du nombre de sessions. | Recherche une augmentation importante du nombre de sessions. | Nombre total de sessions (totalSessionCount). |
| Nombre maximal d'unités d'exécution atteint. | Détecte si le nombre d'unités d'exécution occupées pour un connecteur spécifique atteint sa valeur maximale configurée. | Nombre d'unités d'exécution occupées du connecteur. |
Pour plus d'informations sur ce capteur, consultez la documentation Tomcat.
Nœud Varnish
| Événement | Description | Métrique |
|---|---|---|
| Baisse soudaine du nombre de demandes. | Recherche une baisse soudaine du nombre de demandes client. | Demandes de client reçues (client_req). |
| Augmentation soudaine des objets écartés. | Recherche une augmentation soudaine du nombre d'objets écartés. | Objets détruits (n_lru_nuked). |
| Échec de création d'unité d'exécution. | Trop de créations d'unités d'exécution ont échoué. | Échec (threads_failed) et limité (threads_limited). |
| Le back end Varnish est présenté comme non intègre. | Le serveur back end Varnish n'est pas intègre ou n'est pas disponible. | Non intègre (backend_unhealthy). |
| Le taux d'accès Varnish est faible. | Le taux d'accès Varnish est très faible. | Taux d'accès à la mémoire cache (cache_hit_rate). |
| Varnish n'a plus d'unités d'exécution worker. | Varnish n'a plus d'unités d'exécution worker. | Connexions supprimées en raison d'une file d'attente saturée (sess_dropped). |
Pour plus d'informations sur ce capteur, consultez la documentation de Varnish.
Vault
| Événement | Description | Métrique |
|---|---|---|
| Le coffre est scellé. | Détecte si le statut scellé est défini sur true. | Scellé (sealed). |
| Augmentation soudaine des lectures de secret | Cherche une augmentation soudaine (augmentation de 60 % basée sur la moyenne des 5 dernières minutes) du nombre de secrets lus. | Nombre de lectures de secrets (secret.read.count). |
Pour plus d'informations sur ce capteur, consultez la documentation d' Vault.
Serveur WebLogic
| Événement | Description | Métrique |
|---|---|---|
| État d'erreur de la source de données. | Un pipeline de traitement surveille les codes de statut des sources de données WebLogicApplications, et vérifie que toutes les sources de données sont intègres. | Statut de source de données WebLogic. |
| État de santé | Détecte la dégradation globale du système en fonction de l'état de santé rapporté. | Statut de l'état de santé. |
Pour plus d'informations sur ce capteur, consultez la documentation d' WebLogic.
WebSphere
| Événement | Description | Métrique |
|---|---|---|
| Nombre maximal d'unités d'exécution actives du pool d'unités d'exécution du conteneur Web. | Un pipeline de traitement valide le fait que le nombre d'unités d'exécution actives dans le pool d'unités d'exécution du conteneur Web atteint la limite maximale. | Unités d'exécution actives (threadPools.webContainer.activeThreads). |
| Le certificat WebSphere est sur le point d'expirer. | Les jours restants avant l'expiration du certificat sont inférieurs à la valeur de seuil. | Jours restants avant expiration (certificates.{certificate}.expDaysLeft) |
Pour plus d'informations sur ce capteur, consultez la documentation d' WebSphere Application Server.
ZooKeeper
| Événement | Description | Métrique |
|---|---|---|
| La latence maximale des demandes est élevée. | Un pipeline de traitement vérifie si la latence maximale de demande atteint la valeur de seuil. | Latence maximale de demande (max_request_latency). |
| Le nombre de demandes en file d'attente est élevé. | Un pipeline de traitement détecte le nombre de demandes en file d'attente et vérifie si le nombre atteint la valeur de seuil. | Nombre de demandes en attente (outstanding_requests). |
Pour plus d'informations sur ce capteur, consultez la documentation d' ZooKeeper.
Les événements sont extraits de la rubrique « Événements » du site IBM MQ. Instana L'agent recueille ces événements « IBM MQ » et les signale en tant qu'événements « Instana ». Pour collecter ces événements, vous devez activer l'événement de performances du gestionnaire de files d'attente et l'événement de canal. Pour plus d'informations, consultez la section « Configuration d' IBM MQ s supplémentaires ». ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎