Referenz für integrierte Ereignisse
Die Seite Ereignisse zeigt eine Liste aller derzeit verfügbaren Ereignisse mit vorkonfigurierten, integrierten Ereignissen und benutzerdefinierten, angepassten Ereignissen an. Klicken Sie zum Anzeigen der Ereignisseite auf Einstellungen -> Ereignisse.
Die Liste kann gefiltert werden nach:
- Typ: integriertes Ereignis oder benutzerdefiniertes Ereignis.
- Vorfälle und Schweregrad: Vorfälle, Warnungen oder kritische Meldungen.
- Volltextsuche.
Wichtig: Integrierte Ereignisse können nicht geändert werden. Sie können benutzerdefinierte Ereignisse erstellen, die auf denselben Entitäten und Metriken basieren wie die integrierten Ereignisse. Angepasste Ereignisse lösen Probleme oder Vorfälle auf Basis der Schwellenwerte eines einzelnen Messwerts einer bestimmten Entität aus.
.NET-App
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Die Garbage-Collection-Aktivität ist hoch. | Überwacht die von der CLR-Laufzeitplattform verwendete Zeit für Garbage-Collection (GC) und vergleicht sie mit dem Wert für den maximal zulässigen Prozentsatz. | GC-Zeit (mem.time_in_gc). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter .NET.
ActiveMQ
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Die Warteschlange für nicht zustellbare Nachrichten wächst. | Die Warteschlange für nicht zustellbare Nachrichten wird länger. Gesendete Nachrichten werden nicht an das richtige Ziel weitergeleitet. | ActiveMQ-Warteschlangengröße. |
| Das Speicherlimit nähert sich dem Grenzwert. | Die Speicherbelegung liegt bei fast 100 % des Speicherlimits. | Speicherbelegung (memoryPercentage). |
| Die Store-Belegung nähert sich dem Grenzwert. | Die Store-Belegung liegt bei fast 100 % des Store-Limits. | Store-Belegung (storePercentage). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter ActiveMQ.
ActiveMQ Artemis
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| ActiveMQ Artemis verfügt über keine Verbindungen. | In den letzten 5 Sekunden gab es keine Verbindungen. Die aktuelle Anzahl an Verbindungen entspricht der konfigurierten Anzahl für NoConnections. | Gesamtzahl der Verbindungen (totalConnectionCount). |
| ActiveMQ Artemis verfügt über keine Konsumenten. | In den letzten 5 Sekunden gab es keine Konsumenten. Die aktuelle Anzahl an Konsumenten entspricht der konfigurierten Anzahl für NoConsumers. | Gesamtzahl der Konsumenten (totalConsumerCount). |
| Die Adressspeicherbelegung nähert sich dem Grenzwert. | Die Speicherbelegung aller Adressen liegt bei fast 100 % des Speicherlimits. | Adressspeicherbelegung (addressMemoryPercentage). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter ActiveMQ Artemis.
HTTPd
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Untergeordnete Apache-Prozesse sind bei der DNS-Suche hängen geblieben. | Eine hohe Auslastung der Server-Worker durch die DNS-Suche wurde erkannt. | DNS (worker.dns). |
| Die Protokollierung verlangsamt die HTTPd-Leistung von Apache. | Eine hohe Auslastung der Server-Worker zu Protokollierungszwecken wurde erkannt. | Protokollierung (worker.logging). |
| Die Anzahl der aktiven Worker nähert sich dem Maximalwert für Worker. | Ein hoher Prozentsatz aktiver Worker wurde erkannt. | Aktive Worker (busy_workers). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter HTTPd.
Anwendung
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Vollständiger Abfall bei Aufrufen | Ein schneller Abfall auf null (der Service wird praktisch nicht mehr aufgerufen) in den Werten der Aufrufe in Relation zu den Werten in den letzten 30 Minuten. Das Ausmaß des Abfalls bei den Aufrufen sollte auch die aufgeführten Parameter für relative und absolute Schwellenwerte überschreiten. | Aufrufe/s (count) |
| Fehlerrate zu hoch | Eine dauerhaft hohe Fehlerrate beim KPI für durchschnittliche Fehler innerhalb der letzten vier Minuten oberhalb des angegebenen Schwellenwerts wurde erkannt. | Fehlerrate (error_rate). |
| Ansteigender Trend bei der Fehlerrate | Diese Regel überprüft das Vorhandensein eines ansteigenden Trends für einen bestimmten Messwert. Die Regel ist so optimiert, dass ein wöchentliches monotones Ansteigen beim jeweiligen Messwert erkannt wird. Der Detektor ist jedoch nicht streng und toleriert eine gewisse Abnahme des Metrikwerts innerhalb des Trendkandidaten. | Fehlerrate (error_rate). |
| Plötzlicher Abfall bei Aufrufen | Erkennt einen schnellen Abfall in den KPI-Werten der Aufrufe in Relation zu den Werten in den letzten 30 Minuten. Das Ausmaß des Abfalls bei den Aufrufen sollte auch die aufgeführten Parameter für relative und absolute Schwellenwerte überschreiten. | Aufrufe/s (count). |
| Plötzlicher Anstieg der Fehlerrate | Erkennt einen raschen Anstieg der Werte des Fehler-KPIs im Vergleich zu den KPI-Werten der letzten 10 Minuten. Das Ausmaß des Anstiegs bei den Fehlern sollte auch die aufgeführten Parameter für relative und absolute Schwellenwerte überschreiten. | Fehlerrate (error_rate). |
| Plötzlicher Anstieg der Latenzzeit | Erkennt einen raschen Anstieg des angegebenen Latenz-KPI-Perzentils im Vergleich zu den KPI-Werten der letzten 30 Minuten. Der Anstieg der Latenz muss die angegebenen relativen und absoluten Schwellenwerte überschreiten. | Latenz 50. (duration.50th). |
| Plötzlicher Anstieg der Latenzzeit für einen Bruchteil der Anfragen | Erkennt einen raschen Anstieg des angegebenen Latenz-KPI-Perzentils im Vergleich zu den KPI-Werten der letzten 30 Minuten. Der Anstieg der Latenz muss die angegebenen relativen und absoluten Schwellenwerte überschreiten. | Latenz 99. (duration.99th). |
AWS DynamoDB
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Der Anteil an verarbeiteten und bereitgestellten Lesevorgängen ist kritisch. | Es wurde ein hoher Anteil an verarbeiteten und bereitgestellten Lesevorgängen festgestellt. | Kapazität für verarbeitete Lesevorgänge (consumed_read). |
| Der Anteil an verarbeiteten und bereitgestellten Schreibvorgängen ist kritisch. | Es wurde ein hoher Anteil an verarbeiteten und bereitgestellten Schreibvorgängen festgestellt. | Kapazität für verarbeitete Schreibvorgänge (consumed_write) und Kapazität für bereitgestellte Schreibvorgänge (provisioned_write). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter AWS DynamoDB.
AWS MSK
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Anzahl aktiver Controller. | Überprüft auf eine ungewöhnliche Anzahl an aktiven Controllern im Kafka-Cluster. | Anzahl aktiver Controller (active_controller_count). |
| Anzahl der Partitionen, die offline sind. | Definiert den maximal zulässigen Anteil an Verletzungen durch Partitionen, die offline sind, innerhalb des angegebenen Zeitfensters. | Anzahl der Partitionen, die offline sind (offline_partitions_count). |
| Geringe Leerlaufzeit des Netzprozessors. | Überprüft, ob der Kafka-Netz-Thread eine hohe Arbeitslast aufweist. | Leerlaufzeit des Netzprozessors (network_processor_idle). |
| Geringe Leerlaufzeit des Anforderungshandlers. | Überprüft, ob der Kafka-Anforderungshandler eine hohe Arbeitslast aufweist. | Leerlaufzeit des Anforderungshandlers (request_handler_idle). |
| Anzahl der Partitionen mit zu wenigen Repliken. | Überprüft, ob die Anzahl der Partitionen mit zu wenigen Repliken die erwartete Anzahl überschreitet. | Partitionen mit zu wenigen Repliken (under_replicated_partitions). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter AWS MSK.
AWS RDS
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Das CPU-Guthaben geht gegen Null. | Überprüft, ob das CPU-Guthaben sich Null annähert. | CPU-Guthaben (cpu_credit_balance). |
| Die Menge des verbrauchten CPU-Guthabens ist groß. | Überprüft, ob der Prozentsatz des von einer Instanz verbrauchten CPU-Guthabens sich der maximalen Kapazität nähert. | CPU-Guthabennutzung (cpu_credit_usage) und CPU-Guthaben (cpu_credit_balance). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter AWS RDS.
Azure API Management Service
Der Azure API Management-Sensor führt einmal in der Minute automatisch beliebige angepasste Zustandsprüfungen durch. Wenn die Prüfungen für mindestens eine Minute fehlschlagen, wird ein Problem gemeldet, um den Benutzer zu informieren.
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Die Azure API Management-Kapazität nähert sich dem Kapazitätslimit. | Überprüft, ob Azure API Management mehr als 90 % der verfügbaren Kapazität verwendet. | Kapazität (metrics.Capacity). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation zu „ Azure “ unter „Api Management“.
Azure CosmosDB
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Die Azure CosmosDb-Storage-Kapazität nähert sich dem Kapazitätslimit. | Erkennt, ob die Azure CosmosDb-Storage-Kapazität das Kapazitätslimit erreicht. | CosmosDb-Storage-Kapazität. |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter AzureCosmosDB.
Azure Redis
Der Azure Redis Cache-Sensor führt einmal in der Minute angepasste Zustandsprüfungen aus. Wenn die Prüfungen für mindestens eine Minute fehlschlagen, wird ein Problem gemeldet, um den Benutzer zu informieren.
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Azure Redis Cache-Clientverbindungen nähern sich dem Limit für die maximale Anzahl an Verbindungen. | Azure Redis Cache verwendet mehr als 90 % der verfügbaren Clientverbindungen. | Verbundene Clients (connectedclients). |
| Die Azure Redis Cache-Speicherbelegung nähert sich dem Speicherlimit. | Azure Redis Cache belegt mehr als 90 % des verfügbaren Speichers. | Prozentsatz des belegten Speichers (usedmemorypercentage). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter Azure Redis.
Azure SQL Database
Der Azure SQL-Datenbank-Sensor führt einmal in der Minute angepasste Zustandsprüfungen aus. Wenn die Prüfungen für mindestens eine Minute fehlschlagen, wird ein Problem gemeldet, um den Benutzer zu informieren.
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Der Datenbank geht der Speicherplatz aus. | Überprüft, ob der Azure SQL-Datenbank der Speicherplatz ausgeht. Der Warngrenzwert liegt bei 80 % und der kritische Grenzwert bei 90 % der verwendeten Größe. | metrics.storage_percent. |
| Datenbankstatus. | Der nicht einwandfreie Zustand wird dadurch verursacht, dass die Datenbank nicht verfügbar ist. Eine Datenbank kann nicht verfügbar sein, wenn eine der folgenden Bedingungen zutrifft:
|
metrics.statusCode. |
| Die gesamte DTU-Auslastung nähert sich dem DTU-Limit. | Überprüft, ob die DTU-Auslastung der Azure SQL-Datenbank sich dem DTU-Limit nähert. Der Warngrenzwert liegt bei 75 % und der kritische Grenzwert bei 85 % der DTU-Auslastung. | metrics.dtu_consumption_percent. |
Azure MySQL-Datenbank
Der „ Azure MySQL “-Datenbanksensor führt jede Minute benutzerdefinierte Zustandsprüfungen durch. Wenn die Prüfungen für mindestens eine Minute fehlschlagen, wird ein Problem ausgegeben, um Sie zu informieren.
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Verfügbare Serververbindungen nähern sich dem Grenzwert für maximale Verbindungen. | Die Nutzung von Verbindungen zum „ Azure MySQL “-Server macht mehr als 85 % der verfügbaren Client-Verbindungen aus. | Aktive Verbindungen (active_connections) |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter Azure MySQL.
Azure Service Bus
Der Sensor „ Azure Service Bus “ führt jede Minute benutzerdefinierte Zustandsprüfungen durch. Wenn die Prüfungen für mindestens eine Minute fehlschlagen, wird ein Problem ausgegeben, um Sie zu informieren.
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Azure Service Bus enthält mindestens eine Nachricht in der DL-Warteschlange | Prüft, ob die „ Azure Service Bus “ mindestens eine Nachricht in der Dead-Letter-Warteschlange enthält. | Lesen von Nachrichten mit Buchstaben (deadletteredMessages) |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter Azure Service Bus.
Azure SQL Elastic Pool
Der Azure SQL Elastic Pool-Sensor führt einmal in der Minute angepasste Zustandsprüfungen aus. Wenn die Prüfungen für mindestens eine Minute fehlschlagen, wird ein Problem gemeldet, um den Benutzer zu informieren.
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Die gesamte eDTU-Auslastung nähert sich dem eDTU-Limit. | Überprüft, ob die eDTU-Auslastung von Azure SQL Elastic Pool sich dem eDTU-Limit nähert. | metrics.dtu_consumption_percent. |
Cassandra
Cassandra-Cluster
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Nicht erreichbare Cassandra-Knoten. | Ein oder mehrere Knoten sind inaktiv. | Anzahl der nicht erreichbaren Knoten (unreachableNodes). |
Cassandra-Knoten
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Blockierte Threadpools. | Überprüft, ob Phasen mit den blockierten Threads vorhanden sind. | Blockierte Thread-Messdaten für eine Phase. |
| Gelöschte Nachrichten. | Überprüft, ob Threadpools vorhanden sind, die Nachrichten löschen. | Messdaten zu gelöschten Nachrichten für eine Phase. |
| Anstehende Komprimierungen. | Überprüft, ob sich die Anzahl der anstehenden Komprimierungen erhöht. | Schreiben (Anstehend) (compaction.pending). |
| Anstehende Mutationen. | Überprüft, ob Mutationen anstehen. | Zähler für Mutationen (stage.mutation.pending). |
| Anstehende Lesevorgänge. | Anstehende Lesevorgänge. | Lesevorgänge, Reparatur (stage.read.pending). |
| Anstehende Anforderungsantworten. | Anstehende Anforderungsantworten. | Schreibvorgang (Mutation) (stage.requestresponse.pending). |
| Plötzlicher Abfall bei Schreibanforderungen. | Überprüft auf einen plötzlichen Abfall der Anzahl der Cassandra-Schreibanforderungen. | Schreibvorgänge (clientrequests.write.count). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter Cassandra.
Ceph
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Ceph-Clusterstatus. | Das Ceph-Cluster meldet ein Problem; HEALTH_WARN oder HEALTH_ERR. |
Status des Ceph-Clusters (overall_status). |
| Das Monitorquorum wurde nicht erreicht. | Die Anzahl der Monitore in einwandfreiem Zustand beträgt weniger als 50 % aller Monitore. | Anzahl der Monitore (num_mons) und Anzahl der aktiven Monitore (num_active_mons). |
| OSD(s) mit vollständigem Kapazitätsstatus. | Einige OSDs melden vollständigen Status. | Anzahl der aktiven und bereinigten pgs (num_full_osds). |
| OSD(s), die fast vollständigen Kapazitätsstatus melden. | Einige OSDs melden fast vollständigen Status. | Anzahl der fast vollständigen OSDs (num_near_full_osds). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter Ceph.
Consul (HashiCorp)
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Allgemeinzustand des Consul-Clusters. | Erkennt den Gesamtzustand des Clusters und ob Knoten von Autopilot als nicht einwandfrei angesehen werden. | Allgemeinzustand von Consul-Autopilot (consul.autopilot.healthy). |
CRI-O
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Speicher überlastet. | Erkennt, wenn die Containerspeicherbelegung die angegebenen Grenzwerte überschreitet. | RSS (memory.total_rss). |
Docker
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Speicher überlastet. | Wenn die Containerspeicherbelegung die angegebenen Grenzwerte überschreitet, wird ein Warnungsschwellenwert für den Speicher oder ein kritischer Schwellenwertalert für den Speicher angezeigt. | RSS (memory.total_rss). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter Docker.
Elasticsearch
Elasticsearch-Cluster
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Clusterstatus. | Überwacht den Status des Elasticsearch-Clusters. | Anzahl der Elasticsearch-Knoten (node_count) und Status des Elasticsearch-Clusters (cluster_status). |
| Elasticsearch befindet sich in einer Split-Brain-Situation. | Überprüft, ob ein Elasticsearch-Cluster über mehr als einen Masterknoten verfügt. Split-Brain wird für Umgebungen mit zwei Elastic-Clustern mit demselben Namen ausgelöst. | Anzahl der Masterknoten im Elasticsearch-Cluster. |
Elasticsearch-Knoten
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Kapazitätslimit bei der Neuverteilung. | Charakterisiert den Knoten als am Kapazitätslimit, indem geprüft wird, ob beim Annähern an das Kapazitätslimit die Shards neu verteilt wurden. | Ergebnisse der Kapazitätslimitbewertung und der Shardneuverteilung. |
| Heapspeicherüberzuordnung. | Bewertet, ob die Einstellung für die Größe des Heapspeichers von Elasticsearch zu hoch ist. | Die maximale Größe des Heapspeichers der zugrunde liegenden JVM und der Gesamtspeicher auf dem zugrunde liegenden Host. |
| Hohe Heapspeicherbelegung. | Überprüft die Heapspeicherbelegung des Knotens zusammen mit den aktuellen Auslastungsmerkmalen, um zu erkennen, ob die Heapspeicherbelegung zu hoch ist. | Heapspeicherbelegung durch die zugrunde liegende JVM und Auslastungscharakterisierung. |
| Knoten am Kapazitätslimit. | Überprüft, ob der Knoten am Kapazitätslimit liegt, was durch das Vorhandensein folgender Probleme bestimmt wird: Hohe Arbeitslast und CPU-Belastung auf dem Host, hohe Heapspeicherbelegung und hohe GC-Zeit in der Elasticsearch-JVM. | Hohe Arbeitslast und hohe CPU-Zeit auf dem Host, hohe Heapspeicherbelegung durch Elasticsearch sowie hohe GC-Zeit auf der zugrunde liegenden JVM |
| Knotenstatus. | Überprüft den Clusterstatus, der von Elasticsearch bereitgestellt wurde. | Hohe Arbeitslast und hohe CPU-Zeit auf dem Host, hohe Heapspeicherbelegung durch Elasticsearch sowie hohe GC-Zeit auf der zugrunde liegenden JVM. |
| Zurückgewiesene Aktionen. | Überprüft, ob die Anzahl der zurückgewiesenen Threads zu hoch ist. | Index (threads.index_rejected), search (threads.search_rejected), bulk (threads.bulk_rejected) und get (threads.get_rejected). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter Elasticsearch.
Endpunkt
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Vollständiger Abfall bei Aufrufen. | Erkennt einen schnellen Abfall auf null (der Service wird praktisch nicht mehr aufgerufen) in den Werten der KPI-Messdaten der Aufrufe in Relation zu den Werten in den letzten 30 Minuten. Die Größe des Rückgangs der Aufrufe sollte auch die relativen und absoluten Schwellenwertparameter wie folgt überschreiten. | Aufrufe/s (count). |
| Fehlerrate zu hoch. | Eine dauerhaft hohe Fehlerrate beim KPI für durchschnittliche Fehler innerhalb der letzten vier Minuten oberhalb des angegebenen Schwellenwerts wurde erkannt. | Fehlerrate (error_rate). |
| Fehlerrate zu hoch für einen synthetischen Endpunkt. | Erkennt eine dauerhaft hohe Fehlerrate eines synthetischen Endpunkts, wenn der durchschnittliche KPI für Fehler innerhalb der letzten vier Minuten den angegebenen Schwellenwert überschreitet. | Synthetische Fehlerrate (synthetic_error_rate). |
| Steigender Trend bei der Fehlerrate. | Überprüft einen bestimmten Messwert auf einen ansteigenden Trend. Die Regel ist so optimiert, dass ein wöchentliches monotones Ansteigen beim jeweiligen Messwert erkannt wird. Der Detektor ist jedoch nicht strikt und toleriert einen gewissen Rückgang des Messwerts innerhalb des Trendkandidaten. | Fehlerrate (error_rate). |
| Plötzlicher Abfall bei Aufrufen. | Erkennt einen schnellen Abfall in den KPI-Werten der Aufrufe in Relation zu den Werten in den letzten 30 Minuten. Die Größe des Rückgangs der Aufrufe sollte auch die relativen und absoluten Schwellenwertparameter wie folgt überschreiten. | Aufrufe/s (count). |
| Plötzlicher Abfall bei synthetischen Aufrufen. | Erkennt einen schnellen Abfall in den KPI-Werten der Aufrufe in Relation zu den Werten in den letzten 30 Minuten. Die Größe des Rückgangs der Aufrufe sollte auch die relativen und absoluten Schwellenwertparameter wie folgt überschreiten. | Synthetische Aufrufe/s (synthetic_count). |
| Plötzlicher Anstieg bei der Fehlerrate. | Erkennt einen schnellen Anstieg in den KPI-Werten der Fehler in Relation zu den KPI-Werten in den letzten 10 Minuten. Die Größe des Fehleranstiegs sollte auch die relativen und absoluten Schwellenwertparameter wie folgt überschreiten. | Fehlerrate (error_rate). |
| Plötzlicher Anstieg der Latenzzeit. | Erkennt einen raschen Anstieg des angegebenen Latenz-KPI-Perzentils im Vergleich zu den KPI-Werten der letzten 30 Minuten. Der Anstieg der Latenz muss die relativen und absoluten Schwellenwerte überschreiten. | Latenz 50. (duration.50th). |
| Plötzlicher Anstieg der Latenzzeit für einen Bruchteil der Anfragen. | Erkennt einen raschen Anstieg des angegebenen Latenz-KPI-Perzentils im Vergleich zu den KPI-Werten der letzten 30 Minuten. Der Anstieg der Latenz muss die relativen und absoluten Schwellenwerte wie folgt überschreiten. | Latenz 99. (duration.99th). |
etcd
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Abnormal lange Dauer des Disk-Back-End-Commit. | Erkennt die Dauer des High-Disk-Back-End-Commit. | Dauer des Disk-Back-End-Commit (health.disk_backend_commit_duration). |
| Abnormal lange Dauer des Disk-Wal-Fsync. | Erkennt lange Dauer des Disk-Wal-Fsync. | Dauer des Disk-Fsync (health.disk_wal_fsync_duration). |
| Abnormal lange Dauer der Momentaufnahme. | Erkennt eine lange Dauer für das Speichern einer Momentaufnahme. | Gesamtdauer für das Speichern der Momentaufnahme (health.debugging_snap_save_total_duration). |
| Häufige Leader-Änderungen während der letzten Minute. | Erkennt eine große Anzahl an Leader-Änderungen während der letzten Minute. | Server-Leader-Änderungen (health.server_leader_changes). |
| Member verfügt über keinen Leader. | Erkennt ein Member, das über keinen Leader verfügt (nicht verfügbar). | Server hat Leader (health.server_has_leader). |
| Analyse des Vorschlagsverhältnisses. | Erkennt einen ungewöhnlichen Abfall der angewandten Vorschläge und einen ungewöhnlichen Anstieg der anstehenden und fehlgeschlagenen Vorschläge. | Anzahl der festgeschriebenen Vorschläge (health.server_proposals_committed), Anzahl der angewandten Vorschläge (health.server_proposals_applied), Anzahl der anstehenden Vorschläge (health.server_proposals_pending) und Anzahl der fehlgeschlagenen Vorschläge (health.server_proposals_failed). |
| Die Nutzung von offenen Dateideskriptoren ist kritisch. | Erkennt eine starke Nutzung von offenen Dateideskriptoren. | Anzahl der offenen Dateideskriptoren (health.process_open_fds) und maximale Anzahl der Dateideskriptoren (health.process_max_fds). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter etcd.
Garden-Container
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Speicher überlastet. | Die Containerspeicherbelegung nähert sich dem Speicherlimit. | Belegung (memory.usage). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter Garden.
Glassfish
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Glassfish Die Trefferquote des Dateicaches beträgt 70 %. | Eine verarbeitende Pipeline überprüft die Trefferquote für den Dateicache und prüft, ob sie unter dem angegebenen Schwellenwert liegt. | Trefferquote (file_cache_rate). |
| Die maximale Anzahl an JDBC-Verbindungen wurde erreicht. | Eine Verarbeitungs-Pipeline überprüft die Gesamtzahl der JDBC-Verbindungen. Sie bewertet, ob sie den Maximalwert für die Serverkonfiguration erreicht. | Verwendet (jdbc_connection_used). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter Glassfish.
Google Cloud Datastore
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Die Anzahl der Datastore-Anforderungen ist in den letzten 30 Minuten deutlich gefallen. | Überprüft auf plötzlichen Abfall der Anzahl der Anforderungen. | Anforderungen (request_count) |
| Die Anzahl der Datastore-Anforderungen ist in den letzten 30 Minuten deutlich gestiegen. | Überprüft auf plötzliche Zunahme der Anzahl der Anforderungen. | Anforderungen (request_count) |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter Google Cloud Datastore.
Google Cloud Storage
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Plötzlicher Anstieg der Größe aller Objekte | Überprüft auf einen plötzlichen Anstieg der Größe aller Objekte innerhalb von 24 Stunden für nicht leere Buckets | Die Gesamtgröße aller Objekte im Bucket. |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter Google Cloud Storage.
Google Cloud Pub/Sub
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Die Latenzzeit für Push-Anforderungen für das Abonnement hat in den letzten 10 Minuten zugenommen. | Überprüft auf eine plötzliche Erhöhung der Latenzzeit für Push-Anforderungen für das Abonnement. | Latenzzeit für Anforderungen (push_request_latencies) |
| Älteste Nachricht für Thema. | Überprüft, ob Nachrichten zu dem Thema vorliegen, die älter als der Schwellenwert sind. | Älteste Nachricht (oldest_unacked_message_age) |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter Google Cloud Pub/Sub.
Hadoop YARN
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Der Ressourcenmanager meldet einen verlorenen Knoten. | Erkennt, ob der Ressourcenmanager verlorene Knoten meldet. | Verlorene Knoten (lostNodes). |
| Der Ressourcenmanager meldet einen nicht einwandfreien Knoten. | Erkennt, ob der Ressourcenmanager nicht einwandfreie Knoten meldet. | Nicht einwandfreie Knoten (unhealthyNodes). |
| Die übergebene App ist fehlgeschlagen. | Erkennt, ob die übergebene App fehlgeschlagen ist. | Fehlgeschlagene Apps (appsFailed). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter Hadoop YARN.
HAProxy
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Die durchschnittliche Warteschlange für das HAProxy-Back-End ist groß. | Die durchschnittliche Warteschlange für das HAProxy-Back-End ist groß. | Back-End-Warteschlangengröße. |
| Die Nutzung der HAProxy-Front-End-Sitzung ist hoch. | Die Nutzung der HAProxy-Front-End-Sitzung ist hoch. | Nutzung der Front-End-Sitzung. |
| Plötzlicher Anstieg bei der durchschnittlichen Antwortzeit. | Überprüft auf einen plötzlichen Anstieg bei der durchschnittlichen Antwortzeit eines einzelnen Back-Ends. | Messdaten für durchschnittliche Antwortzeit. |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter HAProxy.
Hazelcast
Ab Hazelcast 3.3 werden die öffentlichen Methoden vom Typ HazelcastInstance::getPartitionService()::isLocalMemberSafe() verwendet. Bei älteren Versionen von „ Hazelcast “ wird der Betriebszustand aus einem internen Status „has ongoing migrations“ auf jedem lokalen Knoten abgeleitet.
Der Allgemeinzustand des Hazelcast-Clusters wird aus den einzelnen Hazelcast-Knoten aggregiert. Genau das führt auch HazelcastInstance::getPartitionService()::isClusterSafe() intern aus, aber ohne durch das Aufrufen dieser Methode einen Mehraufwand zu erzeugen.
Haselcast-Cluster
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Clusterstatus. | Überprüft den Clusterstatus von Hazelcast. Hazelcast 3.3 oder höher. | Flag für Hazelcast-Clusterstatus. |
Haselcast-Knoten
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Knotenstatus. | Überprüft den Status des lokalen Members. Hazelcast 3.3 oder höher. | Flag für Hazelcast-Knotenstatus. |
Weitere Informationen zu diesem Sensor finden Sie in der IMDG -Dokumentation unter „ Hazelcast “.
HBase
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Die Differenz zwischen der Anzahl der Stores und der Anzahl der Store-Dateien ist erheblich. | Erkennt eine ungewöhnlich geringe oder eine ungewöhnlich hohe Anzahl an Stores. | Anzahl an Stores (rs_store_count) und Anzahl der Store-Dateien (rs_store_file_count). |
| Die Cachetrefferquote des Regionsserverblocks ist niedrig. | Erkennt eine niedrige Cachetrefferquote. | Trefferquote für Blockcache (rs_blk_cache_hit_rate) und Trefferanzahl für Blockcache (rs_blk_cache_hit_count). |
| Deutlicher Anstieg der Länge der Komprimierungswarteschlange. | Überprüft auf einen plötzlichen Anstieg der Länge der Komprimierungswarteschlange. Diese Regel weist darauf hin, dass alle Regionen mit einer ähnlichen Rate anwachsen und etwa um die gleiche Zeit aufteilen/komprimieren müssen. Dies kann durch eine Vorabaufteilung oder durch das Ausschalten der automatischen Komprimierung gelöst werden. | Länge der Komprimierungswarteschlange (rs_comp_queue_length). |
| Deutlicher Anstieg der Länge der Flush-Warteschlange. | Überprüft auf einen plötzlichen Anstieg der Länge der Flush-Warteschlange. Wird dies ausgelöst, kann es ein Hinweis auf einen Mangel an RAM sein oder darauf, dass Flushes schneller stattfinden, als sie von den Platten verarbeitet werden können. | Länge der Flush-Warteschlange (rs_flush_queue_length). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter Apache HBase.
Host
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| CPU verbringt sehr viel Zeit mit dem Warten auf die Ein-/Ausgabe. | Überprüft, ob das System sehr viel Zeit mit dem Warten auf die Ein-/Ausgabe verbringt (Stichprobenentnahme in einem Schiebefenster von 60 Sekunden). | Warten (cpu.wait). |
| Steal Time für CPU überschritten. | Überprüft in einem sich sekündlich verschiebenden Fenster, ob zu viel CPU zwischen laufenden Prozessen oder vom Hypervisor-/Host-Betriebssystem "gestohlen" wird (Stichprobenentnahme in einem Schiebefenster von 60 Sekunden). | Stehlen (cpu.steal). |
| Das Gerät verfügt über geringe freie Kapazität oder ist voll. | Erkennt Probleme mit geringer Plattenkapazität, um eine frühe Prognose für eine mögliche Kapazitätsüberschreitung bis zu 15 Minuten im Voraus zu treffen. Der Detektor löst nicht aus, wenn der verbleibende Plattenspeicherplatz über 1 GB oder 1 % der Gesamtkapazität liegt. Sie wird jedoch ausgelöst, wenn entweder der verbleibende Plattenspeicherplatz leer ist (<1MB) oder der Plattenspeicherplatz innerhalb der nächsten 15 Minuten aufgrund des aktuellen Trends voll wird. | Die freie Storage-Kapazität der Platten. |
| Platte füllt sich schneller, als sie bereinigt wird. | Erkennt langfristige Probleme mit dem Plattenspeicherplatz und löst aus, wenn der Plattenspeicherplatz der Platte voraussichtlich innerhalb der nächsten 48 Stunden vollständig gefüllt ist. Der Detektor löst nicht aus, wenn der verbleibende Plattenspeicherplatz mehr als 20 % der Gesamtkapazität beträgt. Er löst jedoch aus, wenn der Plattenspeicherplatz basierend auf dem aktuellen Trend innerhalb der nächsten 48 Stunden vollständig gefüllt wird. Dieser Trend wird basierend auf lokalen Minimalwerten berechnet, die im Laufe der Zeit erfasst werden. Wenn diese lokalen Minimalwerte einen Zeitrahmen von mindestens 4 Stunden definieren, wird ein lineares Regressionsmodell an diese Datenpunkte angelegt, um schließlich die langfristige Prognose zu erstellen. | Die freie Storage-Kapazität der Platten. |
| Häufige TCP-Fehler. | Überprüft, ob der Host eine ungewöhnlich hohe Anzahl an TCP-Fehlern aufweist (Stichprobenentnahme in einem Schiebefenster von 60 Sekunden). | In Segmente/s (tcp.inSegs) und Fehler (tcp.errors). |
| Häufige TCP-Ausfälle. | Überprüft, ob der Host eine ungewöhnlich hohe Anzahl an TCP-Ausfällen aufweist (Stichprobenentnahme in einem Schiebefenster von 60 Sekunden). | Ausfall (tcp.fails) und offen/s (tcp.opens). |
| Permanente TCP-Neuübertragungen. | Überprüft, ob der Host eine ungewöhnlich hohe Anzahl an TCP-Neuübertragungen aufweist (Stichprobenentnahme in einem Schiebefenster von 60 Sekunden). | Neuübertragung (tcp.retrans) und out-Segmente/s (tcp.outSegs). |
| Systemauslastung zu hoch. | Überprüft, ob die Systemauslastung zu hoch ist, indem die Auslastung mit dem 2-fachen der CPU-Kerne der Maschine verglichen wird (Stichprobenentnahme in einem Schiebefenster von 120 Sekunden). | Auslastung (load.1min). |
| Systemspeicher überlastet. | Überprüft, ob der Systemspeicher kurz vor der Überlastung steht (sofort ausgelöst). | Frei (memory.free) und belegt (memory.used). |
| Zu viele offene Dateien. | Prozesse öffnen Dateien schneller, als sie sie schließen (das aktuelle vs-max-Verhältnis überschreitet den Schwellenwert). | Verwendet (openFiles.used). |
| Zu viele verwendete I-Nodes. | Eine geringe Anzahl freier I-Nodes im Dateisystem löst diese Zustandsregel aus (Das Verhältnis zwischen aktueller und maximaler Rate überschreitet den Schwellenwert). | I-Node-Belegung. |
| Zu hohe CPU-Belastung durch Benutzerprozesse. | Überprüft, ob die CPU-Belastung durch Benutzerprozesse zu hoch ist (Stichprobenentnahme in einem Schiebefenster von 180 Sekunden). | Benutzer (cpu.user) und topPID. |
| Der Plattenspeicherplatz ist bald vollständig belegt. | Erkennt kurzfristige Plattenkapazitätsprobleme und löst aus, wenn die Platte voraussichtlich innerhalb der nächsten Stunde vollständig belegt wird. Der Detektor löst nicht aus, wenn die Platte vor Kurzem eine erhebliche Menge an Speicherplatz (>= 100 MB) freigegeben hat oder wenn der verbleibende Plattenspeicherplatz mehr als 20 % der Gesamtkapazität beträgt. Er löst jedoch aus, wenn der Plattenspeicherplatz basierend auf dem aktuellen Trend innerhalb der nächsten Stunde vollständig gefüllt wird. Dieser Trend wird basierend auf einem linearen Regressionsmodell berechnet, das an die Datenpunkte des aktuellen Schiebefensters angelegt wird. | Die freie Storage-Kapazität der Platten. |
| Windows Der Servicestatus wurde geändert. | Prüft, ob sich der Status des Dienstes „ Windows “ geändert hat (Abtastung in einem gleitenden Zeitfenster von 60 Sekunden). | Windows Dienststatus (state). |
Weitere Informationen zu diesem Sensor finden Sie in der Host -Dokumentation.
IBM ACE
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Status von ACE Integration Server | Überprüft den Status von ACE Integration Server. | Status des Integrationsservers |
| Status des ACE-Integrationsservers im digitalen Format | Überprüfen Sie den digitalen Status des ACE-Integrationsservers. | Messwerte für den Status des Integrationsservers |
| Verbindungsstatus des Warteschlangenmanagers im digitalen Format | Überprüfen Sie den digitalen Status zwischen dem ACE-Integrationsserver und dem Warteschlangenmanager. | Messwerte für den Verbindungsstatus des Warteschlangenmanagers |
| Anzahl der Nachrichten mit Fehlern | Die Anzahl der Nachrichten, die Fehler enthalten. | Anzahl der Nachrichten mit Fehlern |
| Anzahl der Nachrichtenflüsse mit Fehlern | Die Anzahl der MQGET-Fehler für MQInput-Knoten oder Web-Services-Fehler für HTTPInput-Knoten. | Anzahl der MQGET-Fehler |
| Anzahl der Nachrichtenverarbeitungen mit Fehlern | Die Anzahl der Fehler, die beim Verarbeiten einer Nachricht auftreten. | Anzahl der Nachrichten mit Fehlern |
| Nachrichtenflussstatus | Überprüft den Status des ACE-Nachrichtenflusses | Nachrichtenflussstatus |
| Status des Nachrichtenflusses im digitalen Format | Überprüfen Sie den digitalen Status des ACE-Nachrichtenflusses. | Messdaten für den Staus des Nachrichtenflusses |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter IBM ACE.
IBM Db2
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Status der Messwerte für Tabellenbereichsdienstprogramme | Suchen Sie nach Ereignissen, die sich auf den Tabellenbereich und seine Metriken beziehen, wenn die Funktion zur automatischen Größenänderung aktiviert und inaktiviert ist. | Tabellenbereichsprogramme |
| HADR-Verbindungsstatus | Suchen Sie nach Ereignissen, die sich auf den Verbindungsstatus der HADR-Bereitschaftsdatenbanken beziehen. Die Standby-ID wird als Filter verwendet, um das Ereignis HADR_CONNECT_STATUS zu generieren, das für jeden Standby-Knoten spezifisch ist, und kann mit der Standby-ID im entsprechenden Operatorfeld festgelegt werden. Die Ereignisse können auf der Basis der folgenden Elemente erstellt werden, die den aktuellen Status einer beliebigen Datenbank darstellen:
|
HADR_CONNECT_STATUS (hadr.standbyId.HADR_CONNECT_STATUS). Die übereinstimmenden Operatoren, die auf any gesetzt sind, generieren die Ereignisse unabhängig von der Standby-ID. |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter IBM Db2.
IBM MQ
IBM MQ-Warteschlangenmanager
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Anzahl der Verbindungen des Warteschlangenmanagers | Überprüft, ob derzeit keine Verbindungen für Queue Manager vorliegen. | Anzahl der Verbindungen (connectionCount) |
| Warteschlangenmanagerstatus | Prüft, ob sich der Warteschlangenmanager im Status 'Gestoppt' oder 'Standby' befindet, um das Ereignis Down oder Switchover auszulösen |
Warteschlangenmanagerstatus (statusMetric) |
| Kanalinitiatorstatus für Warteschlangenmanager | Prüft, ob der Kanalinitiator aktiv ist. | Kanalinitiatorstatus (channelInitiatorStatus) |
| Status der Publish/Subscribe-Engine für Warteschlangenmanager | Prüft, ob die Publish/Subscribe-Engine aktiv ist. | Status der Publish/Subscribe-Engine (pubsubStatus) |
| Brücke gesperrt [1] | Gibt an, dass die IMS -Bridge gestoppt wurde. | Aus der Veranstaltungsreihe „ IBM MQ “ |
IBM MQ-Warteschlange
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Älteste Nachricht in Warteschlange | Prüft, ob die Warteschlange Nachrichten enthält, die älter als der Schwellenwert sind. | Älteste Nachricht in Warteschlange (oldestMessage) |
| Differenz für Warteschlangenlänge | Prüft, ob sich die Warteschlangenlänge dem Wert für die maximale Warteschlangenlänge nähert | Warteschlangenlänge (queueDepth) und maximale Warteschlangenlänge (maxQueueDepth) |
| Warteschlange voll | Prüft, ob der Prozentsatz für die Warteschlangenlänge den Warnungswert oder den kritischen Wert erreicht hat. | Auslastung der Warteschlangenlänge (queueFullPercentage) |
| Übertragungswarteschlange-Hoch | Prüft, ob die Anzahl der Nachrichten in der Übertragungswarteschlange zu hoch ist. | Warteschlangenlänge (queueDepth) |
| Warteschlangen-Serviceintervall hoch [1:1] | Erkennt, dass innerhalb eines Intervalls keine erfolgreichen GET-Operationen oder MQPUT-Aufrufe größer als der im Attribut QServiceInterval angegebene Grenzwert sind. |
Aus der Veranstaltungsreihe „ IBM MQ “ |
| Hohe Warteschlangentiefe [1:2] | Gibt an, dass die Warteschlangenlänge durch einen MQPUT-oder MQPUT1 -Aufruf, der im Attribut QDepthHighLimit angegeben ist, auf einen vordefinierten Schwellenwert erhöht wurde. |
Aus der Veranstaltungsreihe „ IBM MQ “ |
| Warteschlange voll [1:3] | Gibt einen Aufruffehler (bei einem MQPUT-oder MQPUT1 -Aufruf) an, da die Warteschlange voll ist. Dies bedeutet, dass die Warteschlange bereits die maximal mögliche Anzahl von Nachrichten enthält. | Aus der Veranstaltungsreihe „ IBM MQ “ |
IBM MQ-Kanal
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Kanalstatus | Prüft, ob sich der Kanal in einem einwandfreien Zustand befindet | Kanalstatus (channelStatus) |
| Kanalstatus InDoubt | Prüft, ob der Kanal einen unbestätigten Status hat | Kanalstatus (channelStatus) |
| Fehler bei der Kanalumwandlung [1:4] | Gibt einen Fehler an, wenn ein Kanal die Datenkonvertierung und den MQGET-Aufruf zum Abrufen einer Nachricht aus der Übertragungswarteschlange nicht abschließen kann, was zu einem Datenkonvertierungsfehler geführt hat. | Aus der Veranstaltungsreihe „ IBM MQ “ |
| Fehler bei der Kanal SSL [1:5] | Zeigt einen Fehler an, wenn ein Kanal, der Transport Layer Security ( TLS ) oder Secure Sockets Layer ( SSL ) verwendet, keine Verbindung zum MQ herstellen kann. | Aus der Veranstaltungsreihe „ IBM MQ “ |
Sie können integrierte Ereignisse für Kanäle im Status Gestoppt und InDoubt verwenden. Sie müssen angepasste Ereignisse für Kanäle mit einem anderen Status mit integrierten Metriken erstellen. Die Aufzählungswerte für den Kanalstatus finden Sie unter IBM MQ channel metrics reference.
IBM MQ-Listener
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Listenerstatus | Prüft, ob sich das Empfangsprogramm in einwandfreiem Zustand befindet | Listenerstatus (listenerStatus) |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter IBM MQ.
IIS Internet Information Server
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Plötzlicher Abfall bei Anforderungen an IIS-Site. | Überprüft, ob ein plötzlicher Abfall der Anforderungen für eine IIS-Site vorliegt. | Messdaten zur Gesamtzahl der Anforderungen einer IIS-Site. |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter Microsoft IIS.
IBM Datapower
IBM DataPower-Appliance
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Appliance - Prozentsatz der CPU-Auslastung | Überprüfen Sie, ob der Anteil der CPU-Auslastung für das Gerät zu hoch ist. | CPU-Auslastung (cpuUsage) |
| Appliance - Prozentsatz der Speicherbelegung | Überprüfen Sie, ob der Anteil der Speicherauslastung für das Gerät zu hoch ist. | Speicherauslastung (memoryUsage) |
| Appliance - Prozentsatz der Systembelastung | Überprüfen Sie, ob der Anteil der Systembelastung für das Gerät zu hoch ist. | Systembelastung (systemLoad) |
| Appliance-Status | Überprüfen Sie, ob der Gerätestatus fehlerfrei ist. | Status (status) |
IBM DataPower-Domäne
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Domäne - Prozentsatz der Speicherbelegung | Überprüfen Sie, ob der Anteil der Speicherauslastung für die Domäne zu hoch ist. | Aktuelle Speicherauslastung (currentMemUsage) |
| IBM DataPower Gateway Peering-Status | Überprüfen Sie, ob der Gateway-Peering-Status jeder Instanz unterbrochen ist. | Gebrochener Status ('brokenStatus') |
IBM DataPower-Service
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Service - Prozentsatz der Speicherbelegung | Prüfen Sie, ob der Anteil der Speicherauslastung für den Dienst zu hoch ist. | Aktuelle Speicherauslastung (currentMemUsage) |
| Status des Dienstes | Überprüfen Sie, ob der Dienststatus fehlerfrei ist. | Status (status) |
Weitere Informationen zu diesem Sensor finden Sie in der Datapower -Dokumentation unter „ IBM “.
JBoss
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Die durchschnittliche Anzahl an Fehlern am Connector ist zu hoch. | Eine Verarbeitungs-Pipeline erkennt die Anzahl der Fehler, die im angegebenen Zeitfenster an Connectors aufgetreten sind, und überprüft außerdem, ob die Anzahl der Fehler über dem Schwellenwert liegt. | Jboss-Connector-Fehler. |
| ConnectionPool verfügt bald über keine Verbindungen mehr. | Eine Verarbeitungs-Pipeline erkennt den Anteil an verwendeten Verbindungen und überprüft, ob bald der Schwellenwert erreicht wird. | Anteil der verwendeten JBoss Connection Pool-Verbindungen. |
| Keine Verbindungen zu Datenquellen übrig. | Eine Verarbeitungs-Pipeline erkennt die Anzahl der verfügbaren Verbindungen zu Datenquellen im angegebenen Zeitfenster und überprüft, ob bald der Schwellenwert für die Gesamtzahl der Verbindungen erreicht wird. | Verwendete Jboss-Datenquellenverbindungen, verfügbare Datenquellenverbindungen. |
| ThreadPool verfügt bald über keine Threads mehr. | Eine Verarbeitungs-Pipeline erkennt die maximale Anzahl an Threads und überprüft, ob die aktuelle Anzahl an Threads bald den Schwellenwert erreicht. | Aktuelle Anzahl an Threads für JBoss-Thread-Pool, maximale Anzahl an Threads für Thread-Pool. |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter JBoss AS.
JBoss Data Grid
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Caches, die nicht im aktiven Zustand sind. | Überprüft die Anzahl der erstellten Caches im Verhältnis zur Anzahl der Caches, die im JBoss Data Grid aktiv sind. Wenn das Verhältnis einem bestimmten Wert entspricht, wird es als Verstoß betrachtet. | Aktive und erstellte Caches von Cache-Managern. |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter JBoss Data Grid.
JVM
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Garbage-Collection-Aktivität hoch. | Eine Verarbeitungs-Pipeline überwacht die von der JVM-Laufzeitplattform für die Garbage-Collection benötigte Zeit und überprüft sie anhand eines Schwellenwerts. | JVM-Garbage-Collection. |
| Der JVM-Code-Cache ist voll. | Eine Verarbeitungs-Pipeline überwacht die maximale Nutzung des Code-Caches der JVM-Laufzeitplattform. | Maximale Nutzung des JVM-Code-Caches. |
| Perm Gen ist voll (CMS). | Eine Verarbeitungs-Pipeline erkennt die maximale Anzahl verwendeter Perm Gen CMS-Pools. | pools.CMS Perm Gen |
| Perm Gen ist voll (G1). | Eine Verarbeitungs-Pipeline erkennt die maximale Anzahl verwendeter Perm Gen G1-Pools. | pools.G1 Perm Gen |
| Perm Gen ist voll (PS). | Eine Verarbeitungs-Pipeline erkennt die maximale Anzahl verwendeter Perm Gen PS-Pools. | pools.PS Perm Gen |
| Threads sind blockiert. | Ein Detektor überwacht die JVM-Laufzeitplattform und erkennt, ob blockierte Threads vorliegen. | Anzahl der blockierten Threads (threads.deadlocked). |
| J9VM -Speicherleck. | Ein Detektor überprüft die Wachstumsrate des nach der GC belegten Heaps in MB pro Stunde und erkennt, ob möglicherweise ein Speicherleck in der Anwendung vorliegt ( JVM ). IBM J9 VM Die Erkennung von Speicherlecks ist eine optionale Funktion, die im Backend „ Instana “ standardmäßig deaktiviert ist. Um diese optionale Funktion zu aktivieren, besuchen Sie die Seite für Ihre „ Instana “-Bereitstellung: SaaS, selbst gehostete Custom Edition ( Kubernetes oder Red Hat OpenShift Container Platform ) oder selbst gehostete Classic Edition ( Docker ) | memory.gc.after memory.gc.before |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter JVM.
Kafka
Kafka-Cluster
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Anzahl der aktiven Controller. | Überprüft auf eine ungewöhnliche Anzahl an aktiven Controllern im Kafka-Cluster. | Anzahl der aktiven Broker-Controller (broker.activeControllerCount). |
Kafka-Knoten
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Der Kafka-Netz-Thread weist eine hohe Arbeitslast auf. | Überprüft, ob der Kafka-Netz-Thread eine hohe Arbeitslast aufweist. | Netzprozessor (broker.networkProcessorIdle). |
| Der Thread des Kafka-Anforderungshandlers weist eine hohe Arbeitslast auf. | Überprüft, ob der Kafka-Anforderungshandler eine hohe Arbeitslast aufweist. | Anforderungshandler (broker.requestHandlerIdle). |
| Leader Elections finden zu häufig statt. | Überprüft, ob in einem bestimten Zeitrahmen zu viele Leader Elections stattfinden. | In: Leader Wahlen (broker.leaderElections). |
| Potentieller Datenverlust aufgrund einer unsauberen Leader Election. | Überprüft auf einen potenziellen Datenverlust aufgrund von unsauberen Leader Elections. | Unsaubere Leader Elections (broker.uncleanLeaderElections). |
| Produzenten und Konsumenten sind blockiert. | Überprüft, ob Produzenten und Konsumenten blockiert sind, weil Partitionen offline sind. | Partitionen, die offline sind (broker.offlinePartitionsCount). |
| Die Anzahl an synchronen Repliken hat sich verringert. | Überprüft, ob sich die Anzahl an synchronen Repliken verringert hat und innerhalb des angegebenen Intervalls nicht wiederhergestellt wurde. | ISR-Verkleinerungen (broker.isrShrinks) und ISR-Erweiterungen (broker.isrExpansions). |
| Partitionen mit zu wenigen Repliken. | Überprüft, ob die Anzahl der Partitionen mit zu wenigen Repliken die erwartete Anzahl überschreitet. | Partitionen mit zu wenigen Repliken (broker.underReplicatedPartitions). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter Kafka.
Kubernetes
Kubernetes-Cluster
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Komponentenstatus des Kubernetes-Clusters. | Kubernetes meldet, dass eine Masterkomponente (API-Server, Scheduler, Controller-Manager) nicht einwandfrei funktioniert. Aufgrund eines Programmfehlers in Kubernetes wird der Allgemeinzustand nicht immer zuverlässig gemeldet. Wir versuchen, diese Fehler herauszufiltern, damit kein Alert ausgelöst wird, wenn er auf der Detailseite für den Cluster angezeigt wird. | Instana-Ereignisse mit niedriger Stufe. |
Kubernetes DaemonSet
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Die Anzahl an verfügbaren Repliken ist geringer als die der erwünschten Repliken. | Überprüft, ob die Gesamtzahl an verfügbaren Repliken geringer ist als die Anzahl an gewünschten Repliken. Dies weist darauf hin, dass im Kubernetes-DaemonSet Replikapods fehlen. | Erwünschte (desiredReplicas) und verfügbare (availableReplicas). |
Kubernetes-Implementierung
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Die Anzahl an verfügbaren Repliken ist geringer als die der erwünschten Repliken. | Überprüft, ob die Gesamtzahl an verfügbaren Repliken geringer ist als die Anzahl an gewünschten Repliken. Dies weist darauf hin, dass in der Kubernetes-Implementierung Replikapods fehlen. | Erwünschte (desiredReplicas) und verfügbare (availableReplicas). |
Kubernetes-Namensbereich
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Zuordnungsfähige CPU-Anforderungen zu gering. | Die angeforderte CPU nähert sich der maximalen Kapazität an (der Anteil der angeforderten CPU an der CPU-Kapazität ist größer als 80 %). | Zuordnung der CPU-Anforderungen (required_cpu_percentage). |
| Zuordnungsfähige Speicheranforderungen zu gering. | Der angeforderte Speicher nähert sich der maximalen Kapazität an (der Anteil des angeforderten Speichers an der Speicherkapazität ist größer als 80 %) | Zuordnung von Speicheranforderungen (required_mem_percentage). |
| Anzahl an zuordnungsfähigen Pods zu gering. | Zugeordnete Pods nähern sich der maximalen Kapazität (das Verhältnis der zugeordneten Pods/Pods zur Kapazität ist größer als 80%). Für einen Namensbereich werden Pods in den Phasen Pending, Runningund Unknown als zugeordnet gezählt. Die Kapazitätswerte für den Namensbereich basieren auf ResourceQuotas, die pro Namensbereich festgelegt werden können. Weitere Informationen finden Sie in der Kubernetes -Dokumentation. |
Podszuordnung (used_pods_percentage). |
Kubernetes-Knoten
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Zuordnungsfähige CPU zu gering. | Die angeforderte CPU nähert sich der maximalen Kapazität an (der Anteil der angeforderten CPU an der CPU-Kapazität ist größer als 80 %). | Zuordnung der CPU-Anforderungen (required_cpu_percentage). |
| Zuordnungsfähiger Speicher zu gering. | Der angeforderte Speicher nähert sich der maximalen Kapazität an (der Anteil des angeforderten Speichers an der Speicherkapazität ist größer als 80 %). | Zuordnung von Speicheranforderungen (required_mem_percentage). |
| Anzahl an zuordnungsfähigen Pods zu gering. | Zugeordnete Pods nähern sich der maximalen Kapazität (das Verhältnis der zugeordneten Pods/Pods zur Kapazität ist größer als 80%). Für einen Knoten werden Pods in den Phasen Running und Unknown als zugeordnet gezählt. Weitere Informationen finden Sie in der Kubernetes -Dokumentation. |
Podszuordnung (alloc_pods_percentage). |
| Bedingungsstatus von Kubernetes-Knoten. | Der Knoten meldet eine Bedingung, die für über eine Minute nicht bereit ist. Für einen Knoten, der alle Bedingungen außer der Bedingung Ready enthält. Weitere Informationen finden Sie in der Dokumentation zu „ Kubernetes “. |
Instana-Ereignisse mit niedriger Stufe. |
Kubernetes-Pod
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Bedingungsstatus von Kubernetes-Pod. | Ein Pod ist für über eine Minute nicht bereit. Der Grund ist nicht, dass er abgeschlossen ist. (PodCondition=Ready, Status=False, Reason != PodCompleted). Weitere Informationen finden Sie in der Dokumentation zu „ Kubernetes “. | Instana-Ereignisse mit niedriger Stufe. |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter Kubernetes.
Kubernetes Kosten
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Kubecost vCPU Nutzung > 200 | Es wird eine Warnung protokolliert, wenn das Limit der kostenlosen Lizenz für 250 vCPU fast erreicht ist. | coreCountStats.totalCoreCount |
| Kubecost vCPU Nutzung > 250 | Die kostenlose Lizenz unterstützt ausschließlich bis zu 250 „ vCPUs “. | coreCountStats.totalCoreCount |
Große Sprachmodelle (LLMs)
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| OTel Schwellenwert für den Status von LLMs. | Wenn das LLMs ausfällt, werden die Alarme ausgelöst. | Status (llm.status). |
| OTel Antwortdauer von LLMs. | Wenn die Antwortdauer des LLM den festgelegten Schwellenwert überschreitet, werden die Alarme ausgelöst. | Latenz (llm.response.duration.max). |
Memcached-Knoten
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Befehl 'Flush all' ausgeführt. | Erkennt eine hohe Anzahl an Befehlen vom Typ flush_all. |
Löschen (cmd_flush). |
| Hohe Anzahl an Schlüsselbereinigungen. | Erkennt eine hohe Anzahl an Schlüsselbereinigungen. | Bereinigungen (evictions). |
| Die Anzahl der in der Warteschlange befindlichen Verbindungen steigt. | Erkennt eine hohe Anzahl an Verbindungen in der Warteschlange. | In Warteschlange (conn_queued). |
| Die Anzahl an erbrachten Verbindungen steigt. | Erkennt eine hohe Anzahl an erbrachten Verbindungen. | Erbracht (conn_yields). |
| Die von Memcached verwendeten Bytes erreichen den maximalen Grenzwert für Bytes. | Die von Memcached verwendeten Bytes erreichen den maximalen Grenzwert für Bytes. | Verwendete Bytes. |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter Memcached.
MongoDB-Knoten
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Kontinuierlich zunehmende Latenzzeit für Flushoperation im Hintergrund. | Datenbank meldet zunehmende Latenzzeit für Flushoperation im Hintergrund (Stichprobenentnahme in einem Schiebefenster von 150 Sekunden). | Latenzzeit der letzten Flush-Operation im Hintergrund (backgroundFlushingLast). |
| Kontinuierlich zunehmende Länge der Sperrwarteschlange. | Überwacht die Messdaten der MongoDb-Sperrwarteschlange und bewertet, ob die Größe der Sperrwarteschlange zu schnell anwächst. | Länge der Sperrwarteschlange (lockQueue). |
| Zunahme an Fehlseitenbedingungen. | Zunahme an Fehlseitenbedingungen (Stichprobenentnahme in einem Schiebefenster von 150 Sekunden). | Anzahl an Fehlseitenbedingungen (pageFaults). |
| Wachsende Anzahl an Journalfestschreibungen in Schreibsperre | Die Anzahl der Journalfestschreibungen in Schreibsperre wächst (Stichprobenentnahme in einem Schiebefenster von 150 Sekunden). | Journalschreibsperre (journalWriteLock). |
| Anteil an nicht zugeordnetem virtuellem Speicher zu hoch | Anteil an nicht zugeordnetem virtuellem Speicher zu hoch (wird vom Instana-Host-Sensor sofort ausgelöst und gemeldet). | Virtual und mapped. |
MongoDB-Replikatgruppe
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| ReplicaSet verfügt über inaktive Member. | Das Member ist für ein anderes Member in der Gruppe nicht erreichbar. | unreachableNodeCount. |
| Überwachungsstatus für ReplicaSet. | Überwacht den Allgemeinzustand aller Member der MongoDB-Replikagruppe. | Anzahl an Slave-Verzögerungen (slaveDelaysCount), Anzahl an Optimes (optimesCount) und Anzahl überwachter Member (monitoredMembersCount). |
| Die Replikationsverzögerung nimmt zu. | Die Replikationsverzögerung nimmt zu (Stichprobenentnahme in einem Schiebefenster von 150 Sekunden). | Slave-Verzögerungen (slaveDelays) und Optimes (optimes). |
| Die Verbindungsnutzung der Replikatgruppen ist hoch. | Die Anzahl der aktiven Verbindungen überschreitet 90 % der maximalen Anzahl an Verbindungen. | Verbindungen ('connections'). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter MongoDB.
MongoDB Sharded-Cluster (Mongos)
Ereignisse, die in einer Sharded-Cluster-Umgebung von „ MongoDB “ auftreten können.
Die folgende Tabelle beschreibt Ereignisse, die in einer Sharded-Cluster-Umgebung von „ MongoDB “ auftreten können:
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Alle Konfigurationsserver sind nicht erreichbar. | Von der Mongos-Instanz aus sind alle Konfigurationsserver nicht erreichbar. Auf die Cluster-Metadaten kann nicht zugegriffen werden. | Überprüfung der Verbindung zum Konfigurationsserver. |
| Konfigurationsserver teilweise nicht erreichbar | Einige Konfigurationsserver sind von der Mongos-Instanz aus nicht erreichbar. Dieser Zustand kann die Verfügbarkeit der Cluster-Metadaten beeinträchtigen. | Überprüfung der Verbindung zum Konfigurationsserver |
| Shard nicht erreichbar | Ein Shard ist von der Mongos-Instanz aus nicht erreichbar. Dieser Zustand beeinträchtigt die Datenverfügbarkeit für diesen Shard. | Überprüfung der Shard-Konnektivität |
| Der Verbindungspool ist erschöpft. | Der Mongos-Verbindungspool verfügt über keine verfügbaren Verbindungen (0 verfügbar). Anfragen von Neukunden können nicht bearbeitet werden. | Verbindungspool verfügbar (connectionPool.available). |
| Hohe Auslastung des Verbindungspools | Die Auslastung des Mongos-Verbindungspools liegt bei über 90 %. Der Verbindungspool könnte bald erschöpft sein. | Verfügbarer Verbindungspool (connectionPool.available) und Gesamtzahl (connectionPool.total) |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation zur Überwachungs- MongoDB.
MySQL-DB
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Die verfügbaren Serververbindungen haben den Grenzwert erreicht. | Das Verhältnis zwischen den verwendeten Verbindungen und dem Verbindungsgrenzwert übersteigt den konfigurierten Verhältnisschwellenwert. | Verbindungen (status.THREADS_CONNECTED). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter MySQL.
Nginx-Server
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Nginx weist ein Problem mit Offline-Peers auf. | Inaktiver Peer (nur für NGINX Plus verfügbar). | Vorausgehende fehlgeschlagen (nginx_plus.http.upstreams.peers.failed). |
| Nginx löscht Verbindungen. | Gelöschte Verbindungen. | Gelöschte Verbindungen (connections.dropped). |
| Nginx schlägt mit SSL-Handshakes fehl. | Fehlgeschlagene SSL-Handshakes (nur für NGINX Plus verfügbar). | Fehlgeschlagene Handshakes (nginx_plus.ssl.handshakes_failed). |
| Die Anzahl der aktiven Verbindungen nähert sich der maximalen Anzahl. | Der Anteil an verwendeten Verbindungen überschreitet den konfigurierten Schwellenwert für den Anteil an verwendeten Verbindungen. | Aktive Verbindungen (connections.active). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter NGINX.
Node.js-App
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Garbage-Collection-Aktivität hoch. | Überprüft, ob die Zeit, die im angegebenen Fenster in GC verbracht wurde, den angegebenen Schwellenwert überschreitet. | Messwerte zu GC Pause. |
| Die Zustandsprüfungen schlagen fehl. | Überprüft, ob fehlschlagende Zustandsprüfungen vorliegen. Weitere Informationen finden Sie unter „Support für den Health Check“. | Ergebnis der Zustandsprüfung (healthcheckResult). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter Node.js.
OpenShift-Implementierungskonfiguration
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Die Anzahl an verfügbaren Repliken ist geringer als die der erwünschten Repliken. | Überprüft, ob die Gesamtzahl an verfügbaren Repliken geringer ist als die Anzahl an gewünschten Repliken. Dies weist darauf hin, dass in der OpenShift-Implementierungskonfiguration Replikapods fehlen. | Erwünschte (desiredReplicas) und verfügbare (availableReplicas). |
Weitere Informationen zu diesem Sensor finden Sie in der OpenShift -Dokumentation.
OTel-Host
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| CPU Wartezeit überschritten | Es wird geprüft, ob das System eine beträchtliche Zeit mit dem Warten auf Eingabe- oder Ausgabevorgänge verbringt. | CPU-Wartezeit (cpu.wait) |
| CPU Steal-Zeit überschritten | Gibt die Anzahl der zulässigen CPU-Wartezeitverletzungen innerhalb eines Zeitrahmens an. | CPU-Klau (cpu.steal) |
| CPU-Nutzung hoch | Prüft, ob die CPU-Auslastung hoch ist. Dieses Ereignis wertet kontinuierlich die Daten des letzten 180-Sekunden-Intervalls aus. | CPU-Benutzer (cpu.user) |
| Systembelastung zu hoch | Prüft, ob die Systemlast hoch ist, indem die Last mit der doppelten Anzahl der CPU-Kerne des Rechners verglichen wird. Dieses Ereignis wertet kontinuierlich die Daten des letzten 120-Sekunden-Intervalls aus. | Laden (load.avg_1m) |
| Systemspeicher erschöpft | Prüft, ob der Systemspeicher fast vollständig belegt ist (wird sofort ausgelöst). | Freier Speicher (memory.free) und belegter Speicher (memory.used) |
| Festplatte mit geringer Kapazität | Erkennt kurzfristige Kapazitätsprobleme eines Geräts, das weniger als einen statischen Schwellenwert (1GB) oder weniger als 1 % der Gesamtvolumengröße aufweist. Außerdem wird die Kapazität ermittelt, wenn die verbleibende Zeit bis zur Nullstellung der aktuellen Änderungsrate unter 15 Minuten liegt. | Freie Speicherkapazität der Festplatten |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter OpenTelemetry.
OracleDB
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Der Anteil von DB-CPU-Zeit an DB-Zeit ist gering. | Das Verhältnis zwischen der Datenbank-CPU-Zeit und der Datenbankzeit entspricht dem konfigurierten Schwellenwert. | Anteil von DB-CPU-Zeit an DB-Zeit (stats.cpuTimeDbTimeRatio). |
| Die Speicherbelegung des Tabellenbereichs ist hoch. | Der belegte Speicherplatz des Tabellenbereichs ist höher als der konfigurierte maximale Bereich. | Prozentsatz des belegten Speicherplatzes des Tabellenbereichs. |
| Gesamtmenge an Sitzungen, die den Maximalwert aufweisen. | Der Anteil an verwendeten Sitzungen überschreitet den konfigurierten Grenzwert für den Anteil an verwendeten Sitzungen. | Sitzungen/Sitzungsgrenzwert (stats.usedSessionsRatio). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter OracleDB.
OS-Prozess
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| CPU-Auslastung | Der Prozess führt zu einer hohen CPU-Belastung auf dem Host. | Das Ergebnis der Regelauswertung einer hohen CPU-Belastung für den jeweiligen Host und die CPU-Benutzerzeit des jeweiligen Prozesses. |
| Verwendung geöffneter Dateien. | Der Prozess öffnet Dateien schneller, als er sie schließt (das aktuelle vs-max-Verhältnis überschreitet den Schwellenwert). | Verwendet (openFiles.used). |
| Abnormale Beendigung. | Der Prozess wurde aufgrund eines nicht abgefangenen Signals beendet. | |
| Abnormale Beendigung. | Der Prozess wurde mit einem Exit-Code ungleich null beendet. |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation zum Betriebssystemprozess.
PHP-FPM-Laufzeit
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Häufige Neustarts des PHP-FPM-Worker-Pools. | Überprüft auf häufige Neustarts eines PHP-FPM-Worker-Pools durch Bewertung der Anzahl der Neustarts in einem bestimmten Zeitfenster anhand eines bestimmten Schwellenwerts. | Startzeiten für einen Worker-Pool. |
| Listen-Backlog über Kapazität konfiguriert. | Überprüft, ob der Listen-Backlog eines Worker-Pools die konfigurierte Kapazität überschreitet. | Länge der Worker-Pool-Warteschlange. |
| Zu viele Verbindungen zurückgesetzt. | Überprüft die Anzahl an Verbindungsrücksetzungen, die innerhalb des angegebenen Zeitfensters den angegebenen Schwellenwert überschreiten. | Messwert für Verbindungsrücksetzungen für Worker-Pool. |
| Zu viele Anforderungen laufen im Listen-Backlog auf. | Überprüft die Größe für verschiedene PHP-FPM-Worker-Warteschlangen und bewertet sie anhand des Schwellenwerts. | Messdaten für die Größe der Überwachungswarteschlange für verschiedene PHP-FPM-Worker-Warteschlangen. |
| Zu viele langsame Anforderungen. | Überprüft den Anteil langsamer Anforderungen auf allen überwachten PHP-FPM-Worker-Pools. | Messwert für langsame Anforderungen und akzeptierte Verbindungen für einen Worker-Pool einer PHP-FPM-Instanz. |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter PHP.
Synthetic Check
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Das ferne Ziel ist nicht erreichbar. | Überprüft, ob der Prozentsatz an fehlgeschlagenen Kommunikationsversuchen im angegebenen Schiebefenster den angegebenen Schwellenwert überschreitet. | Status des Pingsignals (status) Ein HTTP-Statuscode zwischen 200-206 und 300-307 führt zu einem einwandfreien Status. Für ICMP wird der Exitwert 0 als in einwandfreiem Zustand betrachtet, während der Wert 1 als in nicht einwandfreiem Zustand betrachtet wird. Außerdem wird eine maximale Ausführungszeit von 2 Sekunden festgelegt. |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation zu „Synthetic Check “.
PostgreSQL-DB
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Verwendung aktiver Verbindungen. | Die Anzahl der aktiven Verbindungen überschreitet 90 % der maximalen Anzahl an Verbindungen. | Verwendung von Verbindungen (max_conn_pct). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter PostgreSQL.
Prozess
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Hohe CPU-Belastung. | Bewertet, ob der jeweilige Prozess eine hohe CPU-Belastung auf einem Host verursacht. | Ergebnisse der Regelauswertung einer hohen CPU-Belastung für den jeweiligen Host und der CPU-Benutzerzeit des jeweiligen Prozesses. |
| Zu viele offene Dateien. | Der Prozentsatz an offenen Dateien überschreitet den konfigurierten Schwellenwert. | Verwendet (openFiles.used). |
RabbitMQ
RabbitMQ-Cluster
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| RabbitMQ-Netzpartition erkannt | Erkennt, wenn die Netzpartition im RabbitMQ -Cluster auftritt (alle 5 Sekunden ausgelöst). | Gesamtzahl der Netzpartitionen (net_partitions_count). |
RabbitMQ-Server
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Warteschlangen füllen sich mit Nachrichten | Über einen Zeitraum von 10 Minuten füllen sich Warteschlangen mit Nachrichten, die nicht zugestellt werden. | Bereite Nachrichten (overview.messages_ready) und bestätigte Nachrichten (overview.ack). |
| RabbitMq hat keine Konsumenten | In den letzten 5 Sekunden hatte RabbitMQ keine Konsumenten. | Konsumenten (overview.consumers). |
| RabbitMq hat keine Verbindungen | In den letzten 5 Sekunden hatte RabbitMQ keine Verbindungen. | Verbindungen (overview.connections). |
RabbitMQ-Knoten
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Die Nutzung der RabbitMQ-Dateideskriptoren ist kritisch. | Die Nutzungsrate für Dateideskriptoren ist auf einem bestimmten Knoten kritisch (Warnung: > 90%, Kritisch: > 98%). Dies wird alle 5 Sekunden ausgelöst. | Rate der verwendeten RabbitMQ-Dateideskriptoren (fd_used_rate). |
| Die Nutzung des RabbitMQ-Speichers ist auf dem Knoten kritisch. | Die Speicherbelegungsrate ist auf einem bestimmten Knoten kritisch (Warnung: > 90%, Kritisch: > 98%). Dies wird alle 5 Sekunden ausgelöst. | Rate des verwendeten RabbitMQ-Speichers (mem_used_rate). |
| Die Anzahl der RabbitMQ-Erlang-Prozesse ist kritisch. | Die Anzahl der Erlang-Prozesse ist auf einem bestimmten Knoten kritisch (Warnung > 90%, Kritisch > 98%). Dies wird alle 5 Sekunden ausgelöst. | Rate der RabbitMQ-Prozesse. |
RabbitMQ-Warteschlangen
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Es werden mehr Nachrichten erzeugt als konsumiert. | Es werden mehr Nachrichten in einer Warteschlange veröffentlicht als die Konsumenten aus einer Warteschlange verarbeiten können. | Unbestätigte RabbitMQ-Nachrichten in einer Warteschlange. |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter RabbitMQ.
Redis
Redis-Cluster
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Der Zustand des Redis-Clusters ist nicht fehlerfrei. | Der Cluster befindet sich in ungeeignetem Zustand. | cluster_state. |
Redis-Knoten
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Speicherzuordnungsanalyse. | Der Redis-Server verursacht eine Fragmentierung des externen Speichers. | Anteil von verwendetem Speicher (used_memory) an Speicherfragmentierung (mem_fragmentation_ratio). |
| Die Redis-Trefferquote ist gering. | Die Redis -Trefferrate entspricht dem konfigurierten Schwellenwert. | Cachetrefferquote (hit_rate), Schlüsselbereichstreffer (keyspace_hits), Schlüsselbereichsfehler (keyspace_misses) und bereinigte Redis-Schlüssel (evicted_keys). |
| Die Redis-Speicherbelegung nähert sich dem maximalen Speicherlimit. | Die Redis-Speicherbelegung nähert sich dem maximalen Speicherlimit. | Verwendeter Speicher (used_memory). |
| Redis weist Verbindungen zurück. | Redis weist Verbindungen zurück. | Anzahl der zurückgewiesenen Verbindungen (rejected_connections). |
| Der untergeordnete Redis-Knoten kann keine Verbindung zum Masterknoten herstellen. | Der untergeordnete Redis-Knoten kann keine Verbindung zum Masterknoten herstellen. | master_downtime_seconds. |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter Redis.
SAP ABAP
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Die Sperre besteht seit mehr als 5 Minuten | Erkennt Sperrenkonflikte und stellt Details zum Sperrmodus und zum Sperrobjekt bereit | ABAP-Sperrenkonflikt |
| ABAP-Speicherauszüge generiert | Erkennt ABAP-Dumps, die generiert werden, und liefert Details über den Schweregrad. | Schweregrad der ABAP-Speicherauszüge |
| Es sind Fehler des Typs IDoc Inbound und OutBound aufgetreten. | Erkennt Fehler für eingehende und abgehende IDocs. | Fehler bei eingehenden IDocs und Fehler bei ausgehenden IDocs |
| Hintergrundjob wird abgebrochen oder gestoppt | Erkennt, ob ein Hintergrundjob abgebrochen oder gestoppt wird. | Hintergrundjob wird abgebrochen oder gestoppt |
| Hohe CPU-Belastung festgestellt | Erkennt, wenn die CPU-Auslastung größer als 90% ist. | Hohe CPU-Belastung |
| Hohe Speicherbelegung festgestellt | Erkennt, wenn die Speicherbelegung größer als 90% ist. | Hohe Speicherbelegung |
| Es wurde ein Workprozess im Modus 'stopped', 'shutdown' oder 'PRIV' (privat) erkannt. | Erkennt, wenn sich der Workprozess im PRIV-Modus (privat), gestoppt oder beendet befindet. | Status des Arbeitsprozesses |
| Der Arbeitsprozess „On Hold“ überschreitet den Schwellenwert | Erkennt, ob sich die Anzahl der Arbeitsprozesse im Status „On Hold“ befindet und 5 überschreitet. | Status des Arbeitsprozesses |
| Überschreitung des Schwellenwerts für Dateisystembelegung festgestellt. | Erkennt, wenn die Dateisystembelegung den Schwellenwert von 80% überschreitet. | Dateisystemnutzung |
| Verbindungsprobleme festgestellt | Erkennt falsche Benutzernamen, Passwörter, Gateway-Fehler oder falsche Anmeldeversuche. | Konnektivitätsstatus |
| Fehlende Berechtigung festgestellt | Erkennt, wenn dem Benutzer die Berechtigung zum Ausführen eines Funktionsmoduls fehlt. | Autorisierungsprüfung |
| Benutzerkonto gesperrt erkannt | Erkennt, wenn das Benutzerkonto aufgrund von Anmeldefehlern gesperrt ist. | Benutzerkontosperre |
| Spool-Fehler entdeckt | Erkennt einen Spool-Fehler. | Spoolfehler |
| Dialog-Antwortzeit übersteigt Schwellenwert | Erkennt, ob die Dialogantwortzeit den bevorzugten Schwellenwert überschreitet. | Dialogantwortzeit |
| Dialog-Workprozess überschreitet Schwellenwert | Erkennt, ob der Dialog-Arbeitsprozess länger als 10 Sekunden läuft. | Dialog-Workprozess |
| Datenbank-Latenz überschreitet Schwellenwert | Erkennt, ob die durchschnittliche Datenbanklatenz 5 Sekunden überschreitet. | Datenbanklatenz |
| Transportauftragsfreigabe erkannt | Ermittelt, ob der Transportauftrag freigegeben oder geschützt ist. | Transport Anfrage |
| Die Dauer des Hintergrundprozesses beträgt mehr als 6 Stunden | Erkennt, wenn der Hintergrundjob nicht innerhalb von 6 Stunden abgeschlossen wird. | Hintergrundjobs |
| Die Dauer des Webservice-Aufrufs überschreitet 10 Minuten | Erkennt, wenn ein Webservice-Aufruf (Client oder Ziel) nicht innerhalb von 10 Minuten abgeschlossen wird. | Aufrufe des Web-Service |
| Die Verarbeitungszeit des Gateways beträgt mehr als 60 Sekunden | Erkennt, ob die Verarbeitungszeit für Gateway-Aufrufe 60 Sekunden überschreitet. | Gatewaystatistik |
Weitere Informationen zu diesem Sensor finden Sie unter SAP ABAP.
SAP Java NetWeaver
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Hohe CPU-Belastung festgestellt | Erkennt, wenn die CPU-Auslastung größer als 90% ist. | Hohe CPU-Belastung |
| Hoher Speicherverbrauch festgestellt | Erkennt, wenn die Speicherbelegung größer als 90% ist. | Hohe Speicherbelegung |
| Hohe Festplattenauslastung festgestellt | Erkennt, ob die Festplattenauslastung über 90 % liegt. | Hohe Festplattenauslastung |
| Es wurde ein Authentifizierungsfehler festgestellt | Erkennt einen Authentifizierungsfehler, der durch einen falschen Benutzernamen oder ein falsches Passwort verursacht wurde. | Authentifizierungsfehler |
| Fehler bei der Autorisierung festgestellt | Erkennt einen Autorisierungsfehler, der dadurch verursacht wird, dass dem Benutzer keine „ JMXManageAll “-Aktion zugewiesen wurde. | Berechtigung fehlgeschlagen |
| Zeitüberschreitung bei der Verbindung festgestellt | Erkennt Verbindungszeitüberschreitungen oder netzwerkbezogene Probleme. | Zeitüberschreitung bei der Verbindung festgestellt |
| Hohe Systemauslastung festgestellt | Erkennt, ob die durchschnittliche Systemauslastung über 90 % liegt. | Hohe Systemauslastung |
| GC-Problem erkannt | Erkennt das Problem mit der Garbage Collection (GC). | Es wurden GC-Probleme festgestellt |
| Es wurde ein Systemproblem festgestellt | Erkennt das Systemproblem. | Es wurden Systemprobleme festgestellt |
| Speicherplatzmangel im Heap | Ermittelt, ob der verfügbare Heap-Speicher knapp wird. | Speicherplatzmangel im Heap |
| Speicherkapazität erschöpft | Ermittelt, ob ein Speicherfehler auftritt. | Speicherkapazität erschöpft |
| Es wurde eine hohe Auslastung der High- HTTP -Threads festgestellt | Erkennt, ob die Anzahl der aktiven Threads des „ HTTP “-Pools die konfigurierte Poolgröße erreicht. | Hohe Auslastung der High- HTTP -Threads |
Weitere Informationen zu diesem Sensor finden Sie unter SAP Java Netweaver.
SAP HANA
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Hohe CPU-Auslastung | Erkennt, ob die Gesamt-CPU-Auslastung 90 % überschreitet | Gesamte CPU-Auslastung |
| Hoher HANA-Speicherverbrauch | Erkennt, ob der verwendete Speicher 90 % des zugewiesenen Limits überschreitet | HANA-Speicherbelegung |
| Hoher Host-Speicherverbrauch | Erkennt, ob der Hostspeicher zu mehr als 90 % genutzt wird | Arbeitsspeichernutzung des Hosts |
| Hohe Speicherauslastung im Heap | Erkennt, wenn die Auslastung des Heap-Speichers 90 % überschreitet | Belegung des Heapspeichers |
| Hohe Festplattennutzung | Erkennt, ob die Festplattennutzung 90% überschreitet | Plattenbelegung - Zusammenfassung |
| Hohe Anzahl von Warteschlangenverbindungen | Erkennt, ob die Warteschlangenverbindungen mehr als eine sind | Verbindungen |
| Hohe Anzahl von blockierten Sitzungen | Erkennt, ob die blockierten Sitzungen mehr als eine sind | Sitzungen |
| Hohe Anzahl von Blockierungssitzungen | Erkennt, ob es sich bei den blockierenden Sitzungen um mehr als eine handelt | Sitzungen |
| Hohe Anzahl von blockierten Threads | Erkennt, ob die blockierten Threads mehr als 10 sind | Threads |
| Hohe Anzahl von blockierten SQL-Threads | Erkennt, ob die blockierten SQL-Threads mehr als 10 sind | SQL-Threads |
| Hohe Anzahl von blockierten Job-Worker-Threads | Erkennt, ob die blockierten Job-Worker-Threads mehr als 10 sind | Job-Worker-Threads |
| Hohe Anzahl anhängiger Anträge | Erkennt, ob die Anzahl der ausstehenden Anfragen mehr als 10 beträgt | Anforderungen |
| Hohe Prozess-CPU | Erkennt, ob einer der Prozess-CPUs 90% überschreitet | Servicedetails |
| Dienststatus ist nicht aktiv | Erkennt, ob der Dienststatus nicht aktiv ist | Servicedetails |
| Hoher Speicherverbrauch der HANA-Dienste | Erkennt, wenn die Speicherauslastung der HANA-Dienste 90 % überschreitet | Servicedetails |
| Sicherung fehlgeschlagen | Erkennt die zuletzt fehlgeschlagene Sicherung | Letzte Sicherung |
| Benutzersperren aufgetreten | Erkennt, wenn die Anzahl der Benutzersperren 10 überschreitet | Benutzer Sperren |
| Geplante Aufgaben sind fehlgeschlagen | Erkennt fehlgeschlagene geplante Aufträge | Geplante Jobs |
| Systemereignisse aufgetreten | Erkennt Systemereignisse | Systemereignisse |
| Sicherung des Archivprotokolls fehlgeschlagen | Erkennt fehlgeschlagene Log-Backups | Alle Sicherungen |
| Transaktion ist nicht aktiv | Erkennung von Teilabbrüchen und Abbrüchen von Transaktionen | Transaktionsstatistiken |
| Geblockte Transaktionen | Erkennt, wenn eine Transaktion blockiert wird | Geblockte Transaktionen |
| Hoher Datenverbrauch | Erkennt, wenn die Datenübertragung 90 % überschreitet | Datenvolumen |
| Speicherauslastungsfehler | Erkennt, wenn ein Speicherengpass auftritt | Nicht genügend Speicherkapazität |
Weitere Informationen zum Sensor „ SAP HANA “ finden Sie unter „ SAP HANA überwachen “.
Service
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Vollständiger Abfall bei Aufrufen. | Erkennt einen schnellen Abfall auf null (der Service wird praktisch nicht mehr aufgerufen) in den Werten der KPI-Messdaten der Aufrufe in Relation zu den Werten in den letzten 30 Minuten. Die Größe des Rückgangs der Aufrufe sollte auch die relativen und absoluten Schwellenwertparameter wie folgt überschreiten. | Aufrufe/s (count). |
| Fehlerrate zu hoch. | Eine dauerhaft hohe Fehlerrate beim KPI für durchschnittliche Fehler innerhalb der letzten vier Minuten oberhalb des angegebenen Schwellenwerts wurde erkannt. | Fehlerrate (error_rate). |
| Steigender Trend bei der Fehlerrate. | Überprüft einen bestimmten Messwert auf einen ansteigenden Trend. Die Regel ist so optimiert, dass ein wöchentliches monotones Ansteigen beim jeweiligen Messwert erkannt wird. Der Detektor ist jedoch nicht strikt und toleriert einen gewissen Rückgang des Messwerts innerhalb des Trendkandidaten. | Fehlerrate (error_rate). |
| Plötzlicher Abfall bei Aufrufen. | Erkennt einen schnellen Abfall in den KPI-Werten der Aufrufe in Relation zu den Werten in den letzten 30 Minuten. Die Größe des Rückgangs der Aufrufe sollte auch die relativen und absoluten Schwellenwertparameter wie folgt überschreiten. | Aufrufe/s (count). |
| Plötzlicher Anstieg bei der Fehlerrate. | Erkennt einen schnellen Anstieg in den KPI-Werten der Fehler in Relation zu den KPI-Werten in den letzten 10 Minuten. Die Größe des Fehleranstiegs sollte auch die relativen und absoluten Schwellenwertparameter wie folgt überschreiten. | Fehlerrate (error_rate). |
| Plötzlicher Anstieg der Latenzzeit. | Erkennt einen raschen Anstieg des angegebenen Latenz-KPI-Perzentils im Vergleich zu den KPI-Werten der letzten 30 Minuten. Der Anstieg der Latenz muss die relativen und absoluten Schwellenwerte überschreiten. | Latenz 50. (duration.50th). |
| Plötzlicher Anstieg der Latenzzeit für einen Bruchteil der Anfragen. | Erkennt einen raschen Anstieg des angegebenen Latenz-KPI-Perzentils im Vergleich zu den KPI-Werten der letzten 30 Minuten. Der Anstieg der Latenz muss die relativen und absoluten Schwellenwerte überschreiten. | Latenz 99. (duration.99th). |
Solr
Solr-Cloud-Cluster
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Nicht erreichbare Solr-Knoten. | Ein oder mehrere Knoten sind inaktiv. | unreachableNodes. |
Solr-Knoten
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Die Solr-Cachetrefferquote ist gering. | Die Solr-Cachetrefferrate beträgt in der letzten Minute 80%, möglicherweise aufgrund hoher Bereinigungsraten oder weil Clients falsche Daten abfragen. | Solr-Trefferquote (hitratio) und Solr-Bereinigungen. |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter Apache Solr.
Spark
Spark-Anwendung
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Fehlgeschlagene Tasks auf dem Executor. | Die Anzahl der fehlgeschlagenen Tasks auf einem Executor überschreitet den konfigurierten Schwellenwert. | Fehlerhafte Tasks der Spark-Anwendung. |
| Die Planungsverzögerung ist groß. | Die Planungsverzögerung wird zu schnell größer oder ist zu groß. | Planungsverzögerung (schedulingDelay). |
Spark Standalone
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Der Treiber ist fehlgeschlagen. | Die Anzahl der fehlgeschlagenen Treiber überschreitet den konfigurierten Schwellenwert. | Anzahl der fehlgeschlagenen Treiber (drivers.failed). |
| Der eigenständige Spark-Master meldet inaktive Worker. | Die Anzahl der inaktiven Worker überschreitet den konfigurierten Schwellenwert. | Inaktive Worker (workers.deadWorkers). |
| Der eigenständige Spark-Master meldet Worker in einem unbekannten Zustand. | Die Anzahl der Worker in einem unbekannten Zustand überschreitet den konfigurierten Schwellenwert. | |
| Die übergebene App ist fehlgeschlagen. | Die Anzahl der fehlgeschlagenen Anwendungen überschreitet den konfigurierten Schwellenwert. | Worker in unbekanntem Zustand (workers.workersInUnknownState). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter Apache Spark.
Spring-Boot-App
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Die Anzahl der aktiven Sitzungen hat den maximalen Grenzwert erreicht. | Eine Verarbeitungs-Pipeline erkennt die Anzahl der aktiven Verbindungen der SpringBoot-Anwendung im jeweiligen Zeitfenster. Sie bewertet, ob die Anzahl der aktiven Sitzungen den Schwellenwert überschreitet. | Aktive Sitzungen (metrics.httpsessions.active). |
| Spring Boot-Anwendung inaktiv. | Überwacht den Status der SpringBoot-Anwendung. | Status der SpringBoot-Anwendung (metrics.status). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter Spring Boot.
Sybase-Server
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Die verfügbaren Serververbindungen haben den Grenzwert erreicht. | Die Anzahl der Verbindungen liegt bei fast 100 % des Verbindungslimits pro Server. | Verbindungen (stats.connCount). |
| Die maximale Anzahl an Datenbanken hat den Grenzwert erreicht. | Die Anzahl der Datenbanken liegt bei fast 100 % des Datenbanklimits pro Server. | databasesCount. |
Weitere Informationen zum SQL Anywhere-Sensor von „ SAP “ finden Sie unter „Überwachung von SQL Anywhere mit SAP “.
Synthetischer PoP
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Status synthetischer Pop | Überprüfen Sie, ob „Synthetic PoP “ eine Verbindung zum Backend unter Instana herstellen kann | Status des synthetischen PoP (status) |
| Status der Wiedergabeengine | Überprüfen Sie, ob die Wiedergabeengine überlastet ist. | Workloadstatus der Wiedergabeengines browserscript.workloadStatus, http.workloadStatus, javascript.workloadStatusund ism.workloadStatus. |
| Abrufen der Berechtigungsnachweise fehlgeschlagen | Es ist nicht gelungen, synthetische Anmeldedaten vom Backend „ Instana “ abzurufen. | Fehlercode und - URL en von `pop_get_cred_failed(error.pop_get_cred_failed)`. |
| Abrufen von Tests fehlgeschlagen | Es ist nicht gelungen, synthetische Tests vom Backend unter Instana abzurufen. | Fehlercode und - URL en von `pop_get_test_failed(error.pop_get_test_failed)`. |
| Berichterstellung für Testergebnisse fehlgeschlagen | Das Hochladen des Ergebnisses des synthetischen Tests in das Backend von Instana ist fehlgeschlagen. | Fehlercode und „ URL “ von `pop_report_result_failed(error.pop_report_result_failed)`. |
| Testtesultdetails konnten nicht gemeldet werden | Die Details der synthetischen Testergebnisse konnten nicht an das Backend von Instana gesendet werden. | Fehlercode und „ URL “ von „pop_report_result_details_failed(error.pop_report_result_details_failed)“. |
| Länge der Berichtsergebniswarteschlange ist hoch | Feststellen, ob die Ergebniswarteschlangenlänge hoch ist | ResultQueueDepthHigh (resultQueueDepthHigh). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation zu „Synthetic PoP “.
TIBCO EMS
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Die Anzahl der Verbindungen überschreitet die maximale Anzahl verfügbarer Verbindungen. | Die maximale Anzahl an Verbindungen ist fast erreicht. | Anzahl an Verbindungen (connectionCount). |
| Die Belegung des Nachrichtenspeichers überschreitet das Limit. | Die maximale Nachrichtenspeicherbelegung ist fast erreicht. | Nachrichtenspeicher (messagesMemory). |
| Warteschlangen mit anstehenden Nachrichten überschreiten das Limit. | Die maximale Anzahl anstehender Nachrichten für die Warteschlange ist fast erreicht. | Verwendung durch für die Warteschlange anstehende Nachrichten. |
| Themen mit anstehenden Nachrichten überschreiten das Limit. | Die maximale Anzahl anstehender Nachrichten für das Thema ist fast erreicht. | Verwendung durch für das Thema anstehende Nachrichten. |
Weitere Informationen zu diesem Sensor finden Sie in der TIBCO EMS -Dokumentation.
Tomcat
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Aktive Verbindungen haben das Maximum erreicht. | Erkennt, ob die Anzahl der Verbindungen eines bestimmten Connectors den konfigurierten Maximalwert erreicht. | Verbindungsanzahl für Connector. |
| Plötzlicher Abfall bei der Anzahl der Sitzungen. | Überprüft auf einen deutlichen Abfall bei der Anzahl der Sitzungen. | Gesamtzahl der Sitzungen (totalSessionCount). |
| Plötzlicher Anstieg bei der Anzahl der Sitzungen. | Überprüft auf einen deutlichen Anstieg bei der Anzahl der Sitzungen. | Gesamtzahl der Sitzungen (totalSessionCount). |
| Die Anzahl der Threads hat das Maximum erreicht. | Erkennt, ob die Anzahl der Threads eines bestimmten Connectors den konfigurierten Maximalwert erreicht. | Anzahl der aktiven Connector-Threads. |
Weitere Informationen zu diesem Sensor finden Sie in der Tomcat -Dokumentation.
Varnish-Knoten
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Plötzlicher Abfall bei der Anzahl der Anforderungen. | Überprüft auf einen plötzlichen Abfall der Anzahl der Clientanforderungen. | Empfangene Clientanforderungen (client_req). |
| Plötzlicher Anstieg bei bereinigten Objekten. | Überprüft auf einen plötzlichen Anstieg bei der Anzahl bereinigter Objekte. | Bereinigte Objekte (n_lru_nuked). |
| Die Threaderstellung ist fehlgeschlagen. | Zu viele Threaderstellungen sind fehlgeschlagen. | Fehlgeschlagen (threads_failed) und begrenzt (threads_limited). |
| Der Varnish-Back-End ist als nicht einwandfrei markiert. | Varnish-Back-End-Server ist nicht einwandfrei oder nicht verfügbar. | Nicht einwandfrei (backend_unhealthy). |
| Die Varnish-Trefferquote ist gering. | Die Varnish-Trefferquote ist sehr gering. | Cachetrefferquote (cache_hit_rate). |
| Varnish verfügt über keine Worker-Threads mehr. | Varnish verfügt über keine Worker-Threads mehr. | Verbindungen aufgrund einer vollen Warteschlange gelöscht (sess_dropped). |
Weitere Informationen zu diesem Sensor finden Sie in der Varnish -Dokumentation.
Vault
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Die Vault ist versiegelt. | Erkennt, ob der versiegelte Status auf 'true' gesetzt ist. | Versiegelt (sealed). |
| Plötzlicher Anstieg bei gelesenen geheimen Schlüsseln. | Überprüft auf einen plötzlichen Anstieg (Anstieg um 60 % basierend auf dem Durchschnitt der letzten 5 Minuten) bei der Anzahl an gelesenen geheimen Schlüsseln. | Anzahl an gelesenen geheimen Schlüsseln (secret.read.count). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter Vault.
WebLogic-Server
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Fehlerstatus der Datenquelle. | Eine Verarbeitungs-Pipeline überwacht die Statuscodes der WebLogicApplications-Datenquellen und prüft, ob nicht einwandfreie Datenquellen vorliegen. | Status der WebLogic-Datenquellen. |
| Allgemeinzustand | Erkennt eine allgemeine Verschlechterung des Systems basierend auf dem gemeldeten Allgemeinzustand. | Allgemeinzustand. |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter WebLogic.
WebSphere
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Die aktiven Threads des WebContainer-Thread-Pools haben das Maximum erreicht. | Eine Verarbeitungs-Pipeline bewertet, ob die Anzahl der aktiven Threads im WebContainer-Thread-Pool das Maximallimit erreicht. | Aktive Threads (threadPools.webContainer.activeThreads). |
| WebSphere -Zertifikat läuft in Kürze ab. | Die verbleibenden Tage bis zum Ablauf des Zertifikats liegen unter dem Schwellenwert. | Verbleibende Tage vor Ablauf (certificates.{certificate}.expDaysLeft) |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter WebSphere Application Server.
ZooKeeper
| Ereignis | Beschreibung | Metrik |
|---|---|---|
| Die maximale Latenzzeit für Anforderungen ist hoch. | Eine Verarbeitungs-Pipeline überprüft, ob die maximale Latenzzeit für Anforderungen den Schwellenwert erreicht. | Maximale Latenzzeit für Anforderungen (max_request_latency). |
| Die Anzahl der Anforderungen in der Warteschlange ist groß. | Eine Verarbeitungs-Pipeline erkennt die Anzahl der Anforderungen in der Warteschlange und bewertet, ob die Anzahl sich dem Schwellenwert nähert. | Anzahl der ausstehenden Anforderungen (outstanding_requests). |
Weitere Informationen zu diesem Sensor finden Sie in der Dokumentation unter ZooKeeper.
Die Ereignisse werden von IBM MQ events abgerufen. Instana Der Agent erfasst diese „ IBM MQ “-Ereignisse und meldet sie als „ Instana “-Ereignisse. Zum Erfassen dieser Ereignisse müssen Sie das Leistungsereignis und das Kanalereignis des Warteschlangenmanagers aktivieren. Weitere Informationen finden Sie unter „Zusätzliche Konfiguration von IBM MQ “. ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎