Riferimento eventi integrati

La pagina Eventi visualizza un elenco di tutti gli eventi attualmente disponibili, inclusi gli eventi integrati e gli eventi personalizzati definiti dall'utente. Per visualizzare la pagina Eventi, fare clic su Impostazioni -> Eventi.

L'elenco può essere filtrato per:

  • Tipo: evento integrato o evento personalizzato .
  • Eventi e livello di gravità: eventi, avviso o critico.
  • Ricerca testo completo.

Importante: gli eventi integrati non possono essere modificati. È possibile creare eventi personalizzati basati sulle stesse entità e metriche utilizzate per gli eventi predefiniti. Gli eventi personalizzati attivano problemi o incidenti basati sulle soglie di una singola metrica di una determinata entità.

App .NET

Evento Descrizione Metrica
L'attività di raccolta dei rifiuti è elevata. Controlla il tempo GC (garbage collection) impiegato dalla piattaforma di runtime CLR e lo controlla rispetto al valore percentuale massimo consentito. Tempo GC (mem.time_in_gc).

Per ulteriori informazioni su questo sensore, consultare la documentazione di .NET.

ActiveMQ

Evento Descrizione Metrica
La dimensione della coda dei messaggi non instradabili è in aumento. La dimensione della coda dei messaggi non recapitabili è in aumento. I messaggi inviati non vengono instradati alla destinazione corretta. Dimensione coda ActiveMQ .
L'utilizzo della memoria è prossimo al limite. L'utilizzo della memoria è vicino al 100% del limite di memoria. Utilizzo memoria (memoryPercentage).
L'utilizzo del negozio è prossimo al limite. L'utilizzo del negozio è vicino al 100% del limite del negozio. Utilizzo negozio (storePercentage).

Per ulteriori informazioni su questo sensore, consultare la documentazione di ActiveMQ.

ActiveMQ Artemis

Evento Descrizione Metrica
ActiveMQ Artemis non ha alcun legame. Non ci sono connessioni negli ultimi 5 secondi. Il numero corrente di connessioni è uguale al conteggio NoConnections configurato. Connessioni totali (totalConnectionCount).
ActiveMQ Artemis non ha clienti. Nessun consumer negli ultimi 5 secondi. Il numero corrente di consumer è uguale al conteggio NoConsumers configurato. Totale consumatori (totalConsumerCount).
L'utilizzo della memoria è vicino al limite. L'utilizzo della memoria di tutti gli indirizzi è vicino al 100% del suo limite di memoria. Utilizzo memoria indirizzo (addressMemoryPercentage).

Per ulteriori informazioni su questo sensore, consultare la documentazione di ActiveMQ Artemis.

HTTPd

Evento Descrizione Metrica
Apache i processi figli sono bloccati nell'esecuzione di ricerche nell' DNS. Rileva un utilizzo elevato dei worker del server tramite la ricerca " DNS ". Dns (worker.dns).
L'attività di registrazione sta rallentando le prestazioni di Apache HTTPd. Rileva un elevato utilizzo dei nodi di lavoro del server per scopi di registrazione. Registrazione (worker.logging).
Il numero di lavoratori occupati si sta avvicinando al numero massimo di lavoratori. Rileva alta percentuale di lavoratori occupati. Operatori occupati (busy_workers).

Per ulteriori informazioni su questo sensore, consultare la documentazione di HTTPd.

Applicazione

Evento Descrizione Metrica
Completa eliminazione chiamate Rileva un rapido calo a zero (essenzialmente il servizio non viene più richiamato) nei valori delle chiamate relativi ai valori negli ultimi 30 minuti. L'entità della diminuzione delle chiamate dovrebbe anche superare i parametri di soglia relativi e assoluti elencati. Chiamate (count)
Tasso di errore troppo alto Rileva un tasso di errori costantemente elevato quando il KPI degli errori medi negli ultimi quattro minuti è superiore al valore di soglia fornito. Frequenza errori (error_rate).
Tendenza crescente nel tasso di errore Questa regola controlla la presenza di una tendenza crescente in una determinata metrica. La regola è regolata per rilevare incrementi debolmente monotoni nella metrica fornita. Tuttavia, il rilevatore non è rigido e tollera una certa variazione al ribasso del valore della metrica all'interno del candidato al trend. Frequenza errori (error_rate).
Improvviso calo delle chiamate Rileva un rapido calo dei valori della metrica KPI delle chiamate rispetto ai valori negli ultimi 30 minuti. L'entità della diminuzione delle chiamate dovrebbe anche superare i parametri di soglia relativi e assoluti elencati. Chiamate (count).
Improvviso aumento del tasso di errore Rileva un rapido aumento dei valori del KPI relativo agli errori rispetto ai valori del KPI registrati negli ultimi 10 minuti. L'entità dell'aumento degli errori dovrebbe anche superare i parametri di soglia relativi e assoluti elencati. Frequenza errori (error_rate).
Improvviso aumento della latenza Rileva un rapido aumento del percentile del KPI di latenza specificato rispetto ai valori del KPI registrati negli ultimi 30 minuti. L'entità dell'aumento della latenza deve superare i parametri di soglia relativi e assoluti indicati. Latenza 50° (duration.50th).
Improvviso aumento della latenza per una frazione di richieste Rileva un rapido aumento del percentile del KPI di latenza specificato rispetto ai valori del KPI registrati negli ultimi 30 minuti. L'entità dell'aumento della latenza deve superare i parametri di soglia relativi e assoluti indicati. Latenza al 99° percentile (duration.99th).

AWS DynamoDB

Evento Descrizione Metrica
Il rapporto di letture utilizzate e di cui è stato eseguito il provisioning è critico. Rileva il rapporto elevato di letture utilizzate e di cui è stato eseguito il provisioning. Capacità di lettura utilizzata (consumed_read).
Il rapporto tra scritture utilizzate e di cui è stato eseguito il provisioning è critico. Rileva un rapporto elevato di scritture utilizzate e di cui è stato eseguito il provisioning. Capacità di scrittura utilizzata (consumed_write) e capacità di scrittura fornita (provisioned_write).

Per ulteriori informazioni su questo sensore, consultare la documentazione di AWS DynamoDB.

AWS MSK

Evento Descrizione Metrica
Conteggio controller attivi. Controlla un numero inusuale di controller attivi nel cluster Kafka . Conteggio controller attivi (active_controller_count).
Conteggio partizioni fuori linea. Definisce la percentuale massima consentita di violazioni di partizioni non in linea nella finestra temporale specificata. Conteggio partizioni non in linea (offline_partitions_count).
Tempo di inattività basso processore di rete. Verifica se il thread di rete Kafka è sottoposto a un carico elevato. Tempo di inattività del processore di rete (network_processor_idle).
Tempo di inattività basso gestore richieste. Verifica se il gestore richieste Kafka è sottoposto a un carico elevato. Tempo di inattività del gestore richieste (request_handler_idle).
Conteggio partizioni non replicate. Verifica se il numero di partizioni non replicate supera il numero previsto. Partizioni non replicate (under_replicated_partitions).

Per ulteriori informazioni su questo sensore, consultare la documentazione di AWS MSK.

AWS RDS

Evento Descrizione Metrica
Saldo credito CPU pari a zero. Controlla se il saldo del credito della CPU si sta avvicinando a zero. Saldo credito CPU (cpu_credit_balance).
Il numero di crediti CPU utilizzati è elevato. Controlla se la percentuale di crediti CPU consumati da un'istanza sta raggiungendo la capacità massima. Utilizzo del credito CPU (cpu_credit_usage) e Saldo credito CPU (cpu_credit_balance).

Per ulteriori informazioni su questo sensore, consultare la documentazione di AWS RDS.

Azure API Management Service

Il sensore " Azure API Management " eseguirà automaticamente ogni minuto tutti i controlli di integrità personalizzati configurati. Se i controlli non riescono per almeno un minuto, verrà generato un problema per informare l'utente.

Evento Descrizione Metrica
Azure La capacità di gestione Api si sta avvicinando al limite massimo di capacità. Verifica se « Azure API Management » sta utilizzando più del 90% della capacità disponibile. Capacità (metrics.Capacity).

Per ulteriori informazioni su questo sensore, consultare la documentazione relativa alla gestione delle API di Azure.

Azure CosmosDB

Evento Descrizione Metrica
Azure La capacità di archiviazione CosmosDb si sta avvicinando al limite di capacità massima. Rileva se la capacità di memoria CosmosDb di Azure sta raggiungendo il limite di capacità massima. Capacità di memoria CosmosDb .

Per ulteriori informazioni su questo sensore, consultare la documentazione di Azure CosmosDB.

Azure Redis

Il sensore Cache dell' Azure Redis effettuerà controlli di integrità personalizzati ogni minuto. Se i controlli non riescono per almeno un minuto, verrà generato un problema per informare l'utente.

Evento Descrizione Metrica
Azure Redis Il numero di connessioni del client cache si sta avvicinando al limite massimo di connessioni. Azure Redis La cache sta utilizzando oltre il 90% delle connessioni client disponibili. Client connessi (connectedclients).
Azure Redis L'utilizzo della memoria cache si sta avvicinando al limite massimo di memoria. Azure Redis La cache sta utilizzando oltre il 90% della memoria disponibile. Percentuale di memoria utilizzata (usedmemorypercentage).

Per ulteriori informazioni su questo sensore, consultare la documentazione di Azure Redis.

Azure SQL Database

Il sensore « Azure SQL Database » effettuerà controlli di integrità personalizzati ogni minuto. Se i controlli non riescono per almeno un minuto, verrà generato un problema per informare l'utente.

Evento Descrizione Metrica
Il database sta per esaurire lo spazio. Verifica se su Azure SQL Database lo spazio disponibile sta per esaurirsi. Il limite di avvertenza è 80% e il limite critico è 90% della dimensione utilizzata. metrics.storage_percent.
Stato del database. Lo stato non integro è causato dalla non disponibilità del database. Un database può non essere disponibile se si verifica una delle seguenti condizioni:
  • Il database è stato impostato non in linea dall'utente
  • Il database è in fase di ripristino dal backup
  • Il database è in fase di ripristino
  • Il database è stato danneggiato
  • Il database è stato impostato sullo stato di emergenza dall'amministratore
  • Il database è in fase di creazione copiando un altro database
metrics.statusCode.
L'utilizzo DTU totale si sta avvicinando al limite massimo DTU. Verifica se l'utilizzo delle DTU di Azure SQL Database sta raggiungendo il limite massimo di DTU. Il limite di avvertenza è del 75% e il limite critico è dell ' 85% dell'utilizzo DTU. metrics.dtu_consumption_percent.

Database Azure MySQL

Il sensore del database " Azure MySQL " esegue controlli di integrità personalizzati ogni minuto. Se i controlli hanno esito negativo per almeno un minuto, viene generato un problema per informarvi.

Evento Descrizione Metrica
Le connessioni server disponibili si stanno avvicinando al limite massimo di connessioni L'utilizzo delle connessioni al server di " Azure MySQL " supera l'85% delle connessioni client disponibili. Connessioni attive (active_connections)

Per ulteriori informazioni su questo sensore, consultare la documentazione di Azure MySQL.

Azure Service Bus

Il sensore « Azure Service Bus » esegue controlli di integrità personalizzati ogni minuto. Se i controlli hanno esito negativo per almeno un minuto, viene generato un problema per informarvi.

Evento Descrizione Metrica
Azure Service Bus ha almeno un messaggio nella coda DL Verifica se l' Azure Service Bus e contiene almeno un messaggio nella coda dei messaggi non recapitati. Messaggi con lettera Deead (deadletteredMessages)

Per ulteriori informazioni su questo sensore, consultare la documentazione di Azure Service Bus.

Azure SQL Elastic Pool

Il sensore « Azure SQL Elastic Pool » effettuerà controlli di integrità personalizzati ogni minuto. Se i controlli non riescono per almeno un minuto, verrà generato un problema per informare l'utente.

Evento Descrizione Metrica
L'utilizzo totale di eDTU si sta avvicinando al limite massimo eDTU . Verifica se Azure SQL Elastic Pool eDTU sta raggiungendo il limite massimo di eDTU. metrics.dtu_consumption_percent.

Cassandra

Cluster Cassandra

Evento Descrizione Metrica
Nodi Cassandra non raggiungibili. Uno o più nodi sono inattivi. Numero di nodi non raggiungibili (unreachableNodes).

Nodo Cassandra

Evento Descrizione Metrica
Pool di thread bloccati. Verifica se ci sono fasi con i thread bloccati. Metrica dei thread bloccati per uno stage.
Messaggi eliminati. Verifica se ci sono pool di thread che rilasciano messaggi. Metrica dei messaggi rilasciati per uno stage.
Compattazioni in sospeso. Verifica se le compattazioni in sospeso sono in aumento. Scrittura (in sospeso) (compaction.pending).
Mutazioni in sospeso. Controlla se ci sono mutazioni in sospeso. Mutazione contatore (stage.mutation.pending).
Letture in sospeso. Letture in sospeso. Leggi riparazione (stage.read.pending).
Risposte richieste in sospeso. Risposte richieste in sospeso. Write (Mutazione) (stage.requestresponse.pending).
Calo improvviso delle richieste di scrittura. Verifica un calo improvviso del numero di richieste di scrittura Cassandra . Scritture (clientrequests.write.count).

Per ulteriori informazioni su questo sensore, consultare la documentazione di Cassandra.

Ceph

Evento Descrizione Metrica
Ceph stato del cluster. Ceph il cluster segnala un problema; HEALTH_WARN oppure HEALTH_ERR. Stato del cluster " Ceph " (overall_status).
Il quorum di monitoraggio non è stato raggiunto. Il numero di monitor integri è inferiore al 50% di tutti i monitor. Numero di monitoraggi (num_mons) e numero di monitoraggi attivi (num_active_mons).
Stato capacità completa OSD (s). Alcuni OSD stanno riportando lo stato completo. Numero di pg attivi + puliti (num_full_osds).
Osd (s) vicino allo stato di piena capacità. Alcuni OSD stanno riportando uno stato quasi completo. Numero di osds quasi completi (num_near_full_osds).

Per ulteriori informazioni su questo sensore, consultare la documentazione di Ceph.

Consul (HashiCorp)

Evento Descrizione Metrica
Consul stato del cluster. Rileva l'integrità generale del cluster e se uno dei nodi è considerato non integro da Autopilot. Consul Stato di integrità dell'autopilota (consul.autopilot.healthy).

CRI-O

Evento Descrizione Metrica
Memoria esaurita. Rileva quando l'utilizzo della memoria del contenitore supera i limiti specificati. RSS (memory.total_rss).

Docker

Evento Descrizione Metrica
Memoria esaurita. Quando l'utilizzo della memoria del contenitore supera i limiti specificati, viene visualizzata una soglia di avvertenza della memoria o un avviso di soglia critica della memoria. RSS (memory.total_rss).

Per ulteriori informazioni su questo sensore, consultare la documentazione di Docker.

Elasticsearch

Cluster Elasticsearch

Evento Descrizione Metrica
Stato cluster. Monitora lo stato del cluster Elasticsearch . Numero di nodi Elasticsearch (node_count) e lo stato del cluster Elasticsearch (cluster_status).
Elasticsearch è in una situazione di split - brain. Verifica se un cluster Elasticsearch ha più di un nodo master. Split Brain viene attivato per ambienti con due cluster elastici con lo stesso nome. Il conteggio dei nodi master nel cluster elasticsearch.

Nodo Elasticsearch

Evento Descrizione Metrica
Limite di capacità durante il ribilanciamento. Caratterizza il nodo quando si trova al limite di capacità controllando se sta riposizionando i frammenti al momento di essere al limite di capacità. Risultati della valutazione del limite di capacità e del riposizionamento del frammento.
Sovrassegnazione heap. Valuta se l'impostazione della dimensione heap di Elasticsearch è troppo grande. Dimensione massima dell'heap dell' JVM e sottostante e memoria totale sull'host sottostante.
Utilizzo heap elevato. Controlla l'utilizzo heap del nodo insieme alle recenti caratteristiche del carico di lavoro per rilevare che l'utilizzo heap è troppo elevato. Utilizzo dell'heap da parte dell' JVM e sottostante e caratterizzazione del carico di lavoro.
Nodo ai limiti di capacità. Verifica se il nodo ha raggiunto il limite di capacità, determinato dalla presenza dei seguenti problemi: carico elevato e utilizzo della CPU sull'host, elevato utilizzo dell'heap e tempi di GC elevati nell' Elasticsearch JVM. Carico elevato e tempo di CPU elevato sull'host, elevato utilizzo dell'heap da parte dell' Elasticsearch, nonché tempo di GC elevato sull' JVM sottostante
Stato del nodo. Controlla lo stato del cluster fornito da Elasticsearch. Carico elevato e tempo di CPU elevato sull'host, elevato utilizzo dell'heap da parte dell' Elasticsearch, nonché tempo di GC elevato sull' JVM sottostante.
Azioni rifiutate. Verifica che il numero di thread rifiutati sia troppo elevato. Index (threads.index_rejected), search (threads.search_rejected), bulk (threads.bulk_rejected) e get (threads.get_rejected).

Per ulteriori informazioni su questo sensore, consultare la documentazione di Elasticsearch.

Endpoint

Evento Descrizione Metrica
Eliminazione completa delle chiamate. Rileva un rapido abbassamento a zero (essenzialmente il servizio non viene più richiamato) nei valori della metrica KPI delle chiamate relativi ai valori negli ultimi 30 minuti. L'entità del calo delle chiamate dovrebbe anche superare i parametri di soglia relativi e assoluti come segue. Chiamate (count).
Tasso di errore troppo alto. Rileva un tasso di errori costantemente elevato quando il KPI degli errori medi negli ultimi quattro minuti è superiore al valore di soglia fornito. Frequenza errori (error_rate).
Tasso di errori troppo elevato per un endpoint sintetico. Rileva un tasso di errori costantemente elevato di un endpoint sintetico quando il KPI di errori medio negli ultimi quattro minuti è superiore al valore di soglia fornito. Tasso di errore sintetico (synthetic_error_rate).
Aumento della tendenza del tasso di errore. Controlla la presenza di una tendenza crescente in una determinata metrica. La regola è regolata per rilevare incrementi debolmente monotoni nella metrica fornita. Il rilevatore, tuttavia, non è rigoroso e tollera una certa quantità di riduzioni del valore metrico all'interno del candidato di tendenza. Frequenza errori (error_rate).
Improvviso calo delle chiamate. Rileva un rapido calo dei valori della metrica KPI delle chiamate rispetto ai valori negli ultimi 30 minuti. L'entità del calo delle chiamate dovrebbe anche superare i parametri di soglia relativi e assoluti come segue. Chiamate (count).
Improvviso calo delle chiamate sintetiche. Rileva un rapido calo dei valori della metrica KPI delle chiamate rispetto ai valori negli ultimi 30 minuti. L'entità del calo delle chiamate dovrebbe anche superare i parametri di soglia relativi e assoluti come segue. Chiamate sintetiche (synthetic_count).
Improvviso aumento del tasso di errore. Rileva un rapido aumento dei valori del KPI di errori rispetto ai valori KPI negli ultimi 10 minuti. L'entità dell'aumento degli errori dovrebbe anche superare i parametri di soglia relativi e assoluti come segue. Frequenza errori (error_rate).
Improvviso aumento della latenza. Rileva un rapido aumento del percentile del KPI di latenza specificato rispetto ai valori del KPI registrati negli ultimi 30 minuti. L'entità dell'aumento della latenza deve superare i parametri di soglia relativi e assoluti. Latenza 50° (duration.50th).
Improvviso aumento della latenza per una frazione di richieste. Rileva un rapido aumento del percentile del KPI di latenza specificato rispetto ai valori del KPI registrati negli ultimi 30 minuti. L'entità dell'aumento della latenza deve superare i parametri di soglia relativi e assoluti come indicato di seguito. Latenza al 99° percentile (duration.99th).

etcd

Evento Descrizione Metrica
Durata del commit di backend del disco elevata in modo anomalo. Rileva la durata elevata del commit di backend del disco. Durata del commit di backend del disco (health.disk_backend_commit_duration).
Durata wal fsync del disco elevata in modo anomalo. Rileva la durata elevata del disco wal fsync. Durata fsync disco (health.disk_wal_fsync_duration).
Durata istantanea elevata in modo anomalo. Rileva un'elevata durata del salvataggio di un'istantanea. Durata totale salvataggio istantanea (health.debugging_snap_save_total_duration).
Frequenti cambi di leader visti all'ultimo minuto. Rileva un numero elevato di modifiche del leader nell'ultimo minuto. Modifiche leader del server (health.server_leader_changes).
Il membro non ha un leader. Rileva un membro che non ha un leader (non disponibile). Il server ha il leader (health.server_has_leader).
Analisi del rapporto di proposta. Rileva un calo inusuale delle proposte applicate e un aumento inusuale delle proposte in sospeso e non riuscite. Numero di proposte sottoposte a commit (health.server_proposals_committed), numero di proposte applicate (health.server_proposals_applied), numero di proposte in sospeso (health.server_proposals_pending) e numero di proposte non riuscite (health.server_proposals_failed).
L'utilizzo dei descrittori di file aperti è critico. Rileva un utilizzo elevato dei descrittori di file aperti. Numero di descrittori file aperti (health.process_open_fds) e numero massimo di descrittori file (health.process_max_fds).

Per ulteriori informazioni su questo sensore, consultare la documentazione di etcd.

Contenitore Garden

Evento Descrizione Metrica
Memoria esaurita. L'utilizzo della memoria del contenitore si sta avvicinando al suo limite di memoria. Utilizzo (memory.usage).

Per ulteriori informazioni su questo sensore, consultare la documentazione all'indirizzo Garden.

Glassfish

Evento Descrizione Metrica
Glassfish Il tasso di successo della cache dei file è pari al 70%. Una pipeline di elaborazione controlla la frequenza di riscontri nella cache dei file e convalida se è inferiore al valore di soglia fornito. Tasso di riscontri (file_cache_rate).
Raggiunto il numero massimo di connessioni JDBC . Una pipeline di elaborazione controlla il numero totale di connessioni JDBC . Convalida se sta raggiungendo il limite massimo per la configurazione del server. Utilizzato (jdbc_connection_used).

Per ulteriori informazioni su questo sensore, consultare la documentazione di Glassfish.

Google Cloud Datastore

Evento Descrizione Metrica
Il conteggio delle richieste del datastore è diminuito in modo significativo negli ultimi 30 minuti. Verifica la diminuzione improvvisa del conteggio delle richieste. Richieste (request_count)
Il conteggio delle richieste del datastore è aumentato in modo significativo negli ultimi 30 minuti. Verifica l'aumento improvviso del conteggio delle richieste. Richieste (request_count)

Per ulteriori informazioni su questo sensore, consultare la documentazione all'indirizzo Google Cloud Datastore.

Google Cloud Storage

Evento Descrizione Metrica
Aumento improvviso delle dimensioni di tutti gli oggetti Verifica un aumento improvviso della dimensione di tutti gli oggetti in 24h per i bucket non vuoti La dimensione totale di tutti gli oggetti nel bucket.

Per ulteriori informazioni su questo sensore, consultare la documentazione all'indirizzo Google Cloud Storage.

Google Cloud Pub/Sub

Evento Descrizione Metrica
La latenza della richiesta di push per la sottoscrizione è stata aumentata negli ultimi 10 minuti. Verifica l'aumento improvviso della latenza delle richieste di push per la sottoscrizione. Latenza richiesta (push_request_latencies)
Messaggio meno recente dell'argomento. Controlla se ci sono messaggi sull'argomento più vecchi del valore di soglia. Messaggio più vecchio (oldest_unacked_message_age)

Per ulteriori informazioni su questo sensore, consultare la documentazione di Google Cloud Pub/Sub.

Hadoop YARN

Evento Descrizione Metrica
Il gestore risorse sta notificando la perdita del nodo. Rileva se il gestore risorse riporta la perdita di nodi. Nodi persi (lostNodes).
Il gestore risorse riporta un nodo non integro. Rileva se il gestore risorse riporta nodi non integri. Nodi non integri (unhealthyNodes).
L'app inoltrata non è riuscita. Rileva se l'app inoltrata ha avuto esito negativo. App non riuscite (appsFailed).

Per ulteriori informazioni su questo sensore, consultare la documentazione all'indirizzo Hadoop YARN.

HAProxy

Evento Descrizione Metrica
La dimensione media della coda di backend HAProxy è elevata. La dimensione media della coda di backend HAProxy è elevata. Dimensione coda di backend.
L'utilizzo della sessione di frontend HAProxy è elevato. L'utilizzo della sessione di frontend HAProxy è elevato. Utilizzo sessione frontend.
Aumento improvviso del tempo di risposta medio. Verifica un aumento improvviso del tempo di risposta medio di un singolo backend. Metriche tempo di risposta medio.

Per ulteriori informazioni su questo sensore, consultare la documentazione all'indirizzo HAProxy.

Hazelcast

A partire da Hazelcast 3.3 vengono utilizzati i metodi pubblici HazelcastInstance::getPartitionService()::isLocalMemberSafe() . Nelle versioni precedenti di Hazelcast, lo stato di integrità viene ricavato da uno stato interno che indica se sono in corso migrazioni su ciascun nodo locale.

Lo stato di integrità cluster Hazelcast viene aggregato da ogni nodo Hazelcast . Questo è esattamente ciò che HazelcastInstance::getPartitionService()::isClusterSafe() fa internamente, ma senza creare un ulteriore sovraccarico di richiamo di questo metodo.

Cluster Hazelcast

Evento Descrizione Metrica
Stato cluster. Controlla lo stato del cluster di Hazelcast. Hazelcast 3.3 o superiore. Indicatore di stato del cluster Hazelcast .

Nodo Hazelcast

Evento Descrizione Metrica
Stato del nodo. Controlla lo stato del membro locale. Hazelcast 3.3 o superiore. indicatore di stato del nodo Hazelcast .

Per ulteriori informazioni su questo sensore, consultare la documentazione IMDG all'indirizzo Hazelcast.

HBase

Evento Descrizione Metrica
La differenza tra il numero di negozi e il numero di file di archivio è significativa. Rileva un numero insolitamente basso o insolitamente alto di negozi. Memorizza il conteggio (rs_store_count) e memorizza il numero di file (rs_store_file_count).
Il rapporto di utilizzo cache del blocco del server della regione è basso. Rileva un basso tasso di utilizzo della cache. Frequenza riscontri cache di blocco (rs_blk_cache_hit_rate) e conteggio riscontri cache di blocco (rs_blk_cache_hit_count).
Aumento significativo della lunghezza della coda di compattazione. Verifica un aumento improvviso della lunghezza della coda di compattazione. Questa regola indica che tutte le regioni stanno crescendo a un ritmo simile e devono essere suddivise / compatte nello stesso momento. Questo problema può essere risolto pre - dividendo o disattivando le compattazioni automatiche. Lunghezza della coda di compattazione (rs_comp_queue_length).
Aumento significativo della lunghezza della coda di scaricamento. Verifica un aumento improvviso della lunghezza della coda di svuotamento. Quando attivato, questo può essere un'indicazione di una mancanza di RAM o che le cancellazioni sono più veloci di ciò che i dischi possono gestire. Lunghezza coda di svuotamento (rs_flush_queue_length).

Per ulteriori informazioni su questo sensore, consultare la documentazione di Apache HBase.

Host

Evento Descrizione Metrica
La CPU impiega molto tempo in attesa di input / output. Verifica se il sistema impiega un tempo di attesa significativo per l'input/output (campionamento in una finestra scorrevole di 60 secondi). Attendere (cpu.wait).
Tempo di sottrazione CPU superato. Controlla una seconda finestra mobile, se c'è troppa CPU rubata tra i processi in esecuzione o dal sistema operativo hypervisor / host (campionamento in una finestra scorrevole di 60 secondi). Rubare (cpu.steal).
L'unità ha una capacità ridotta a sinistra o è piena. Rileva i problemi di capacità ridotta del disco per fornire una previsione anticipata per una possibile violazione della capacità fino a 15 minuti in anticipo. Il rilevatore non viene eseguito quando lo spazio su disco rimanente supera 1GB o l'1% della capacità totale. Tuttavia, verrà attivato se lo spazio su disco rimanente è vuoto (<1MB) o se lo spazio su disco si riempirà entro i successivi 15 minuti in base all'andamento corrente. La capacità di memoria libera dei dischi.
Il disco si riempie più velocemente di quanto viene eliminato. Rileva problemi di capacità disco a lungo termine e si attiva quando è probabile che il disco esaurisce la capacità entro le successive 48 ore. Il rilevatore non viene eseguito quando lo spazio su disco rimanente è superiore al 20% della capacità totale. Tuttavia, si attiva quando lo spazio su disco si riempie entro le prossime 48 ore in base alla tendenza corrente. Questa tendenza viene calcolata in base ai minimi locali raccolti nel tempo. Quando questi minimi locali definiscono un periodo di tempo di almeno 4 ore, viene adattato un modello di regressione lineare su questi punti di dati per eseguire finalmente la previsione a lungo termine. La capacità di memoria libera dei dischi.
Errori frequenti di " TCP ". Verifica se l'host presenta un numero insolitamente elevato di errori " TCP " (campionamento in una finestra mobile di 60 secondi). Nei segmenti (tcp.inSegs) ed errore (tcp.errors).
TCP e si blocca spesso. Verifica se l'host presenta un numero insolitamente elevato di errori TCP (campionamento in una finestra mobile di 60 secondi). Errore (tcp.fails) e apertura (tcp.opens).
Ritrasmissioni permanenti su TCP. Verifica se l'host presenta un numero insolitamente elevato di ritrasmissioni TCP (campionamento in una finestra mobile di 60 secondi). Ritrasmissione (tcp.retrans) e out Segmenti / s (tcp.outSegs).
Carico di sistema troppo elevato. Verifica se il carico del sistema è troppo elevato, confrontando il carico con 2 volte i core della CPU della macchina (campionamento in una finestra scorrevole di 120 secondi). Carica (load.1min).
Memoria di sistema esaurita. Verifica se la memoria di sistema è quasi esaurita (attivata istantaneamente). Libero (memory.free) e utilizzato (memory.used).
Troppi file di apertura. I processi stanno aprendo i file più velocemente di quanto li chiudano (il rapporto corrente / massimo supera la soglia). Utilizzato (openFiles.used).
Troppi inode utilizzati. Un livello basso di inode liberi sul filesystem attiva questa regola di integrità (il rapporto corrente / massimo supera la soglia). utilizzo inode.
Utilizzo eccessivo della CPU da parte dei processi utente. Verifica se l'utilizzo CPU dei processi utente è troppo elevato (campionamento in una finestra scorrevole di 180 secondi). Utente (cpu.user) e topPID.
Presto si esaurirà lo spazio su disco. Rileva i problemi di capacità a breve termine di un disco e si attiva quando è probabile che il disco esaurisce la capacità entro l'ora successiva. Il rilevatore non viene eseguito quando il disco ha liberato una quantità considerevole di spazio (>=100MB) nel passato recente o quando lo spazio su disco rimanente è superiore al 20% della capacità totale. Tuttavia, verrà attivato quando lo spazio su disco si riempirà entro l'ora successiva in base alla tendenza corrente. Questa tendenza viene calcolata in base a un modello di regressione lineare adattato ai punti di dati della finestra a scorrimento corrente. La capacità di memoria libera dei dischi.
Windows Lo stato del servizio è stato modificato. Verifica se lo stato del servizio " Windows " è cambiato (campionamento in una finestra mobile di 60 secondi). Windows stato del servizio (state).

Per ulteriori informazioni su questo sensore, consultare la documentazione dell'host.

IBM ACE

Evento Descrizione Metrica
Stato di ACE Integration Server Controllare lo stato di ACE Integration Server. Stato server di integrazione
Formato digitale stato ACE Integration Server Verificare lo stato digitale di ACE Integration Server. Metriche di stato server Integration
Formato digitale dello stato di connessione del gestore code Verificare lo stato digitale tra ACE Integration Server e Gestore code. Metriche stato connessione gestore code
Messaggio con numero di errore Il numero di messaggi che contengono errori. Numero di messaggi con errori
Flusso di messaggi con numero di errori Il numero di errori MQGET per i nodi MQInput o di errori dei servizi Web per i nodi HTTPInput. Numero di errori MQGET
Elaborazione messaggi con numero di errore Il numero di errori che si verificano durante l'elaborazione di un messaggio. Numero di messaggi con errori
Stato flusso di messaggi Controllare lo stato del flusso di messaggi ACE. Stato flusso di messaggi
Formato digitale dello stato del flusso di messaggi Controllare lo stato digitale del flusso di messaggi ACE. Metriche stato flusso di messaggi

Per ulteriori informazioni su questo sensore, consultare la documentazione all'indirizzo IBM ACE.

IBM Db2

Evento Descrizione Metrica
Stato delle metriche dei programmi di utilità tablespace Controllare gli eventi correlati allo spazio tabella e le relative metriche quando la funzione di ridimensionamento automatico è abilitata e disabilitata. Programmi di utilità tablespace
Stato connessione HADR Controllare gli eventi correlati allo stato di connessione dei database standby HADR. L'ID standby viene utilizzato come filtro per generare l'evento HADR_CONNECT_STATUS , che è specifico per qualsiasi nodo standby e può essere impostato con l'ID standby nel campo operatore corrispondente. Gli eventi possono essere creati in base a quanto segue, che rappresenta lo stato corrente di qualsiasi database:
  • Il database è connesso (Connect State = CONNECTED come 1).
  • Il database è in stato disconnesso (Connect State = DISCONNECTED come 0).
HADR_CONNECT_STATUS (hadr.standbyId.HADR_CONNECT_STATUS). Gli operatori corrispondenti impostati su any genereranno gli eventi indipendentemente dall'ID standby.

Per ulteriori informazioni su questo sensore, consultare la documentazione di IBM Db2.

IBM MQ

Gestore code IBM MQ

Evento Descrizione Metrica
Numero di connessioni del gestore code Verifica se non ci sono connessioni al momento sul gestore code. Conteggio connessioni (connectionCount)
Stato gestore code Verifica se il gestore code si trova nello stato arrestato o in standby per attivare l'evento Down o Switchover . Stato gestore code (statusMetric)
Stato dell'iniziatore di canali per il gestore code Controlla se l'iniziatore di canali è in esecuzione. Stato iniziatore canale (channelInitiatorStatus)
Stato del motore di pubblicazione / sottoscrizione per il gestore code Verifica se il motore di pubblicazione o sottoscrizione è in stato di esecuzione. Stato motore di pubblicazione / sottoscrizione (pubsubStatus)
Ponte chiuso [1] Indica che il bridge IMS è arrestato. Dagli eventi dell' IBM MQ

Coda IBM MQ

Evento Descrizione Metrica
Messaggio più vecchio della coda Verifica se la coda contiene messaggi più vecchi del valore di soglia. Messaggio più vecchio sulla coda (oldestMessage)
Diff profondità coda Verifica se la profondità della coda si sta avvicinando al valore massimo di profondità della coda. Profondità della coda (queueDepth) e profondità massima della coda (maxQueueDepth)
Coda piena Controlla se la percentuale di profondità della coda ha raggiunto il valore di avvertenza o critico. Percentuale profondità coda (queueFullPercentage)
Coda di trasmissione elevata Controlla se il numero di messaggi della coda di trasmissione è troppo elevato. Profondità coda (queueDepth)
Intervallo di servizio della coda elevato [1:1] Rileva che nessuna operazione GET riuscita o chiamate MQPUT all'interno di un intervallo è maggiore del limite specificato nell'attributo QServiceInterval . Dagli eventi dell' IBM MQ
Profondità della coda elevata [1:2] Indica che la profondità della coda è stata aumentata ad una soglia predefinita da una chiamata MQPUT o MQPUT1 specificata nell'attributo QDepthHighLimit . Dagli eventi dell' IBM MQ
Coda piena [1:3] Indica un errore di chiamata (su una chiamata MQPUT o MQPUT1 ) perché la coda è piena. Vale a dire, la coda contiene già il numero massimo di messaggi possibili. Dagli eventi dell' IBM MQ

Canale IBM MQ

Evento Descrizione Metrica
Stato dei canali Controlla se il canale è in uno stato integro. Stato canale (channelStatus)
Stato InDoubt canale Controlla se il canale si trova in uno stato dubbio. Stato canale (channelStatus)
Errore di conversione del canale [1:4] Indica un errore quando un canale non è in grado di completare la conversione dei dati e la chiamata MQGET per richiamare un messaggio dalla coda di trasmissione che ha generato un errore di conversione dati. Dagli eventi dell' IBM MQ
Errore del canale SSL [1:5] Indica un errore quando un canale che utilizza Transport Layer Security ( TLS ) o Secure Sockets Layer ( SSL ) non riesce a stabilire una connessione MQ. Dagli eventi dell' IBM MQ

Puoi utilizzare gli eventi integrati per i canali nello stato Arrestato e InDoubt . È necessario creare eventi personalizzati per i canali in un altro stato con metriche integrate. Per i valori dell'enumerazione relativi allo stato del canale, consultare il riferimento alle metriche dei canali all'indirizzo IBM MQ.

Listener IBM MQ

Evento Descrizione Metrica
Stato listener Verifica se il listener si trova in uno stato integro. Stato del listener (listenerStatus)

Per ulteriori informazioni su questo sensore, consultare la documentazione di IBM MQ.

IIS (Internet Information Server )

Evento Descrizione Metrica
Improvvisa diminuzione delle richieste a IIS - site. Verifica un calo improvviso delle richieste per un sito IIS. Metrica di richiesta totale di un IIS - sites.

Per ulteriori informazioni su questo sensore, consultare la documentazione di Microsoft IIS.

IBM DataPower

Dispositivo IBM DataPower

Evento Descrizione Metrica
Percentuale di utilizzo CPU dell'applicazione Verificare se la percentuale di utilizzo della CPU del dispositivo è troppo elevata. Utilizzo CPU (cpuUsage)
Percentuale di utilizzo della memoria del dispositivo Verificare se la percentuale di utilizzo della memoria del dispositivo è troppo elevata. Utilizzo memoria (memoryUsage)
Percentuale di carico del dispositivo del sistema Verificare se la percentuale di applicazione del carico di sistema è troppo elevata. Carico di sistema (systemLoad)
Stato applicazione Verificare se lo stato del dispositivo è integro. Stato (status)

Dominio IBM DataPower

Evento Descrizione Metrica
Percentuale dominio di utilizzo della memoria Verificare se la percentuale di utilizzo della memoria del dominio è troppo elevata. Utilizzo memoria corrente (currentMemUsage)
IBM DataPower Gateway Stato peer Verificare se lo stato di peer del gateway di ciascuna istanza è interrotto. Stato di rottura ('brokenStatus')

Servizio IBM DataPower

Evento Descrizione Metrica
Percentuale di utilizzo memoria del servizio Verificare se la percentuale di utilizzo della memoria del servizio è troppo elevata. Utilizzo memoria corrente (currentMemUsage)
Stato servizio Verificare se lo stato del servizio è integro. Stato (status)

Per ulteriori informazioni su questo sensore, consultare la documentazione Datapower all'indirizzo IBM.

JBoss

Evento Descrizione Metrica
Numero medio di errori sul connettore troppo elevato. Una pipeline di elaborazione rileva il numero di errori che si sono verificati sui connettori nella finestra temporale fornita e controlla se il numero di errori è maggiore del valore di soglia. Errori del connettore Jboss.
ConnectionPool sta esaurendo le connessioni. Una pipeline di elaborazione rileva il rapporto delle connessioni utilizzate e controlla se sta per raggiungere il valore di soglia. Rapporto connessioni pool di connessioni JBoss utilizzate.
Le connessioni sulle origini dati sono esauriti. Una pipeline di elaborazione rileva il numero di connessioni disponibili sulle origini dati nella finestra temporale fornita e controlla se il numero totale di connessioni sta per raggiungere il valore di soglia. Connessioni origini dati jboss utilizzate, connessioni origini dati disponibili.
ThreadPool sta esaurendo i thread. Una pipeline di elaborazione rileva il numero massimo di thread e verifica se il numero di thread correnti sta per raggiungere il valore di soglia. Conteggio thread corrente del pool di thread JBoss, numero massimo thread del pool di thread.

Per ulteriori informazioni su questo sensore, consultare la documentazione di JBoss AS.

JBoss Data Grid

Evento Descrizione Metrica
Le cache non sono in stato di esecuzione. Controlla i rapporti del numero di cache create rispetto al numero di cache in esecuzione in Jboss Data Grid. Se il rapporto è come segue un determinato valore, viene considerato una violazione. Esecuzione e creazione di cache di gestori cache.

Per ulteriori informazioni su questo sensore, consultare la documentazione di JBoss Data Grid.

JVM

Evento Descrizione Metrica
Attività di raccolta dati inutilizzati elevata. Una pipeline di elaborazione monitora il tempo impiegato dalla piattaforma di runtime JVM per la raccolta dei rifiuti e ne verifica la conformità rispetto a una soglia prestabilita. JVM Raccolta dei rifiuti.
JVM La cache del codice è piena. Una pipeline di elaborazione monitora l'utilizzo massimo della cache di codice della piattaforma di runtime JVM. JVM utilizzo massimo della cache del codice.
Perm Gen è pieno (CMS). Una pipeline di elaborazione rileva il numero massimo di pool CMS della generazione permanente utilizzati. pools.CMS Perm Gen
Perm Gen è pieno (G1). Una pipeline di elaborazione rileva il numero massimo di pool Perm Gen G1 utilizzati. pools.G1 Perm Gen
Perm Gen è pieno (PS). Una pipeline di elaborazione rileva il numero massimo di pool Perm Gen PS utilizzati. pools.PS Perm Gen
I thread sono bloccati. Un rilevatore monitora la piattaforma di runtime JVM e individua eventuali thread in situazione di deadlock. Numero di thread in stallo (threads.deadlocked).
J9VM Perdita di memoria. Un rilevatore controlla il tasso di crescita dell'heap utilizzato dopo il GC in MB all'ora e individua eventuali perdite di memoria nell' JVM. IBM J9 VM Il rilevamento delle perdite di memoria è una funzionalità opzionale, disabilitata per impostazione predefinita nel backend Instana. Per abilitare questa funzionalità opzionale, consulta la pagina relativa alla tua installazione di Instana : SaaS, Edizione personalizzata self-hosted ( Kubernetes o Red Hat OpenShift Container Platform ) oppure Edizione classica self-hosted ( Docker ) memory.gc.after memory.gc.before

Per ulteriori informazioni su questo sensore, consultare la documentazione all'indirizzo JVM.

Kafka

Cluster Kafka

Evento Descrizione Metrica
Numero di unità di controllo attive. Controlla un numero inusuale di controller attivi nel cluster Kafka . Conteggio controller attivo broker (broker.activeControllerCount).

Nodo Kafka

Evento Descrizione Metrica
Il thread di rete Kafka è sotto carico elevato. Verifica se il thread di rete Kafka è sottoposto a un carico elevato. Processore di rete (broker.networkProcessorIdle).
Il thread del gestore richieste Kafka è sotto carico elevato. Verifica se il gestore richieste Kafka è sottoposto a un carico elevato. Gestore richieste (broker.requestHandlerIdle).
Le elezioni dei leader sono troppo spesso. Verifica se ci sono troppe elezioni di leader in un determinato periodo di tempo. Elezioni leader (broker.leaderElections).
Potenziale perdita di dati a causa di elezioni leader non pulite. Verifica la potenziale perdita di dati dovuta a elezioni di leader non pulite. Elezioni leader non pulite (broker.uncleanLeaderElections).
Produttori e consumatori sono bloccati. Controlla se i produttori e i consumatori sono bloccati perché le partizioni non sono in linea. Partizioni fuori linea (broker.offlinePartitionsCount).
Il numero di repliche in - sync è stato ridotto. Verifica se il numero di repliche in - sync è stato ridotto e non è stato ripristinato entro l'intervallo specificato. Le espansioni ISR (broker.isrShrinks) e ISR (broker.isrExpansions).
Partizioni non replicate. Verifica se il numero di partizioni non replicate supera il numero previsto. Partizioni non replicate (broker.underReplicatedPartitions).

Per ulteriori informazioni su questo sensore, consultare la documentazione all'indirizzo Kafka.

Kubernetes

Cluster Kubernetes

Evento Descrizione Metrica
Kubernetes Stato del componente cluster. Kubernetes segnala che un Master-Component (server API, scheduler, controller manager) non funziona correttamente. A causa di un bug presente in Kubernetes, i dati relativi alla salute non vengono sempre riportati in modo affidabile. Si tenta di filtrarli e di non generare un avviso visualizzandolo solo nella pagina dei dettagli del cluster. Instana eventi di basso livello.

Kubernetes DaemonSet

Evento Descrizione Metrica
Le repliche disponibili sono inferiori a quelle desiderate. Controlla se il numero totale di repliche disponibili è inferiore al numero di repliche desiderate. Ciò indica che Kubernetes DaemonSet non contiene i pod di replica. Desiderato (desiredReplicas) e disponibile (availableReplicas).

Distribuzione Kubernetes

Evento Descrizione Metrica
Le repliche disponibili sono inferiori a quelle desiderate. Controlla se il numero totale di repliche disponibili è inferiore al numero di repliche desiderate. Ciò indica che nella distribuzione di Kubernetes mancano i pod di replica. Desiderato (desiredReplicas) e disponibile (availableReplicas).

Spazio dei nomi Kubernetes

Evento Descrizione Metrica
Richieste cpu allocabili troppo basse. La CPU richiesta si sta avvicinando alla capacità massima (il rapporto di capacità CPU / CPU richiesto è superiore all ' 80%). Assegnazione richieste CPU (required_cpu_percentage).
Richieste di memoria allocabile troppo basse. La memoria richiesta si sta avvicinando alla capacità massima (il rapporto di capacità memoria / memoria richiesta è superiore all ' 80%) Allocazione richieste di memoria (required_mem_percentage).
Conteggio pod allocabili troppo basso. I pod allocati si stanno avvicinando alla capacità massima (il rapporto di capacità dei pod allocati / pod è superiore all ' 80%). Per uno spazio dei nomi, i pod nelle fasi Pending, Runninge Unknown vengono contati come allocati. I valori di capacità dello spazio dei nomi si basano su ResourceQuotas, che possono essere impostati per ogni spazio dei nomi. Per ulteriori informazioni, consulta la documentazione di Kubernetes . Assegnazione pod (used_pods_percentage).

Nodo Kubernetes

Evento Descrizione Metrica
CPU allocabile troppo bassa. La CPU richiesta si sta avvicinando alla capacità massima (il rapporto di capacità CPU / CPU richiesto è superiore all ' 80%). Assegnazione richieste CPU (required_cpu_percentage).
Memoria allocabile troppo bassa. La memoria richiesta si sta avvicinando alla capacità massima (il rapporto di capacità di memoria / memoria richiesta è superiore all ' 80%). Allocazione richieste di memoria (required_mem_percentage).
Conteggio pod allocabili troppo basso. I pod allocati si stanno avvicinando alla capacità massima (il rapporto di capacità dei pod allocati / pod è superiore all ' 80%). Per un nodo, i pod nelle fasi Running e Unknown vengono contati come allocati. Per ulteriori informazioni, consulta la documentazione di Kubernetes . Assegnazione pod (alloc_pods_percentage).
Kubernetes Stato condizione nodo. Il nodo riporta una condizione che non è pronta per più di un minuto. Per un nodo che rappresenta tutte le condizioni oltre alla condizione Ready . Per ulteriori informazioni, consultare la documentazione di Kubernetes. Instana eventi di basso livello.

Pod Kubernetes

Evento Descrizione Metrica
Stato della condizione pod Kubernetes . Un pod non è pronto per più di un minuto e il motivo non è che è stato completato. ( PodCondition=Ready, Status=False, Reason!= PodCompleted ). Per ulteriori informazioni, consultare la documentazione di Kubernetes. Instana eventi di basso livello.

Per ulteriori informazioni su questo sensore, consultare la documentazione di Kubernetes.

Kubernetes Costo

Evento Descrizione Metrica
Kubecost vCPU utilizzo > 200 Verrà registrato un avviso in caso di avvicinamento al limite di 250 licenze gratuite di vCPU. coreCountStats.totalCoreCount
Kubecost vCPU utilizzo > 250 La licenza gratuita supporta solo un massimo di 250 vCPUs. coreCountStats.totalCoreCount

Modelli linguistici di grandi dimensioni (LLM)

Evento Descrizione Metrica
OTel Soglia di stato dei modelli di linguaggio di grandi dimensioni (LLM). Quando il sistema LLM è inattivo, gli allarmi si attivano. Stato (llm.status).
OTel Durata della risposta dei modelli di linguaggio di grandi dimensioni. Quando la durata della risposta dell'LLM supera la soglia specificata, vengono attivati gli allarmi. Latenza (llm.response.duration.max).

Nodi Memcached

Evento Descrizione Metrica
Eseguire lo svuotamento di tutti i comandi. Rileva un numero elevato di comandi flush_all . Svuotare (cmd_flush).
Rimozione chiave elevata. Rileva un numero elevato di eliminazioni chiave. Eliminazioni (evictions).
Il numero di connessioni in coda aumenta. Rileva un numero elevato di connessioni in coda. Accodato (conn_queued).
Il numero di connessioni rese aumenta. Rileva un numero elevato di connessioni. Rese (conn_yields).
I byte utilizzati da Memcached hanno raggiunto il limite massimo di byte. I byte utilizzati da Memcached hanno raggiunto il limite massimo di byte. Byte utilizzati.

Per ulteriori informazioni su questo sensore, consultare la documentazione di Memcached.

Nodo MongoDB

Evento Descrizione Metrica
Latenza di svuotamento dello sfondo in continuo aumento. Il database riporta l'aumento della latenza di svuotamento dello sfondo (campionamento in una finestra scorrevole di 150 secondi). Ultima latenza di svuotamento in background (backgroundFlushingLast).
Aumento continuo della lunghezza della coda di blocco. Monitora la metrica Coda di blocco MongoDb e convalida se la dimensione della coda di blocco sta aumentando troppo velocemente. Lunghezza coda di blocco (lockQueue).
Aumento degli errori di pagina. Aumento degli errori di pagina (campionamento in una finestra scorrevole di 150 secondi). Numero di errori di pagina (pageFaults).
Commit del giornale in aumento blocco di scrittura Il journal esegue il commit nella crescita del blocco di scrittura (campionamento in una finestra scorrevole di 150 secondi). Blocco scrittura giornale (journalWriteLock).
Rapporto troppo alto di memoria virtuale non mappata Percentuale troppo elevata di memoria virtuale non mappata (segnalazione immediata da parte del sensore " Instana Host"). Virtual e mapped.

Set di Repliche MongoDB

Evento Descrizione Metrica
ReplicaSet ha membri inattivi. Il membro, come visualizzato da un altro membro del gruppo, non è raggiungibile. unreachableNodeCount.
Stato di controllo ReplicaSet . Controlla l'integrità di tutti i membri della serie di repliche MongoDB . Conteggio ritardi secondari (slaveDelaysCount), conteggio optimes (optimesCount) e conteggio membri monitorati (monitoredMembersCount).
Il ritardo di replica è in aumento. Il ritardo di replica è in aumento (campionamento in una finestra scorrevole di 150 secondi). Ritardi slave (slaveDelays) e Optimes (optimes).
L'utilizzo della connessione della serie di repliche è elevato. Il numero di connessioni attive è superiore al 90% del numero massimo di connessioni. Connessioni ('connections ').

Per ulteriori informazioni su questo sensore, consultare la documentazione di MongoDB.

MongoDB cluster shardato (Mongos)

Eventi che possono verificarsi in un ambiente cluster sharded di MongoDB.

La tabella seguente descrive gli eventi che possono verificarsi in un ambiente cluster sharded di MongoDB :

Evento Descrizione Metrica
Tutti i server di configurazione sono irraggiungibili. Tutti i server di configurazione risultano irraggiungibili dall'istanza mongos. Non è possibile accedere ai metadati del cluster. Verifica della connettività del server di configurazione.
I server di configurazione sono parzialmente irraggiungibili Alcuni server di configurazione non sono raggiungibili dall'istanza mongos. Questa condizione potrebbe compromettere la disponibilità dei metadati del cluster. Verifica della connettività del server di configurazione
Shard non raggiungibile Un frammento non è raggiungibile dall'istanza mongos. Questa condizione influisce sulla disponibilità dei dati per quel frammento. Verifica della connettività di Shard
Il pool di connessioni è esaurito. Il pool di connessioni mongos non ha connessioni disponibili (0 disponibili). Non è possibile soddisfare le richieste dei nuovi clienti. Pool di connessioni disponibile (connectionPool.available).
Elevato utilizzo del pool di connessioni L'utilizzo del pool di connessioni di Mongos supera il 90%. Il pool di connessioni potrebbe esaurirsi a breve. Pool di connessioni disponibile (connectionPool.available) e totale (connectionPool.total)

Per ulteriori informazioni su questo sensore, consultare la documentazione relativa al monitoraggio MongoDB.

DB MySQL

Evento Descrizione Metrica
Le connessioni server disponibili sono al limite. Il rapporto tra il limite utilizzato e le connessioni è maggiore della soglia del rapporto configurato. Connessioni (status.THREADS_CONNECTED).

Per ulteriori informazioni su questo sensore, consultare la documentazione all'indirizzo MySQL.

Server Nginx

Evento Descrizione Metrica
Nginx ha un problema con i peer offline. Pari inattivo (disponibile solo per NGINX Plus). Upstream non riusciti (nginx_plus.http.upstreams.peers.failed).
Nginx sta eliminando le connessioni. Connessioni eliminate. Connessioni interrotte (connections.dropped).
Nginx si verifica un errore durante la procedura di handshake con SSL. Handshake falliti con l' SSL (disponibile solo per l' NGINX Plus). Hanshake non riusciti (nginx_plus.ssl.handshakes_failed).
Il numero di connessioni attive è vicino al massimo. Il rapporto delle connessioni utilizzate supera la soglia del rapporto configurato per le connessioni utilizzate. Connessioni attive (connections.active).

Per ulteriori informazioni su questo sensore, consultare la documentazione di NGINX.

App Node.js

Evento Descrizione Metrica
Attività di raccolta dati inutilizzati elevata. Controlla se il tempo trascorso in GC nella finestra fornita è superiore alla soglia fornita. Metriche di pausa GC.
I controlli di integrità non sono riusciti. Verifica se sono presenti controlli di integrità non riusciti. Per ulteriori informazioni, consultare la sezione Assistenza per Health Check. Risultato del controllo di integrità (healthcheckResult).

Per ulteriori informazioni su questo sensore, consultare la documentazione disponibile all'indirizzo Node.js.

Configurazione distribuzione Openshift

Evento Descrizione Metrica
Le repliche disponibili sono inferiori a quelle desiderate. Controlla se il numero totale di repliche disponibili è inferiore al numero di repliche desiderate. Ciò indica che OpenShift DeploymentConfig non contiene i pod di replica. Desiderato (desiredReplicas) e disponibile (availableReplicas).

Per ulteriori informazioni su questo sensore, consultare la documentazione di OpenShift.

Host OTEL

Evento Descrizione Metrica
Tempo di attesa della CPU superato Controlla se il sistema trascorre una quantità significativa di tempo in attesa di operazioni di input o output. Attesa della CPU (cpu.wait)
Tempo di furto della CPU superato Specifica il numero di violazioni di CPU Wait consentite in un intervallo di tempo. Furto di CPU (cpu.steal)
Utilizzo della CPU elevato Controlla se l'utilizzo della CPU è elevato. Questo evento valuta continuamente i dati relativi all'ultimo intervallo di 180 secondi. Utente CPU (cpu.user)
Carico del sistema troppo elevato Controlla se il carico del sistema è elevato confrontando il carico con due volte i core della CPU della macchina. Questo evento valuta continuamente i dati relativi all'ultimo intervallo di 120 secondi. Carico (load.avg_1m)
Memoria di sistema esaurita Controlla se la memoria di sistema è quasi completamente utilizzata (si attiva istantaneamente). Memoria libera (memory.free) e Memoria utilizzata (memory.used)
Disco a bassa capacità Rileva i problemi di capacità a breve termine di un dispositivo che ha meno di una soglia statica (1GB) o meno dell'1% della dimensione totale del volume. Inoltre, rileva la capacità se il tempo rimanente fino allo zero fornisce il tasso di variazione attuale è inferiore a 15 minuti. Capacità di archiviazione libera dei dischi

Per ulteriori informazioni su questo sensore, consultare la documentazione di OpenTelemetry.

OracleDB

Evento Descrizione Metrica
Il rapporto tra Tempo CPU DB e Tempo DB è basso. Il rapporto tra Tempo CPU DB e Tempo DB è il seguente per la soglia configurata. Rapporto tempo CPU DB / Tempo DB (stats.cpuTimeDbTimeRatio).
L'utilizzo dello spazio tablespace è elevato. Lo spazio tablespace utilizzato è più significativo della quantità configurata di spazio massimo. Percentuale di spazio tablespace utilizzato.
Quantità totale di sessioni al massimo. Il rapporto delle sessioni utilizzate supera la soglia del rapporto delle sessioni utilizzate configurata. Limite sessioni / sessioni (stats.usedSessionsRatio).

Per ulteriori informazioni su questo sensore, consultare la documentazione all'indirizzo OracleDB.

Processo os

Evento Descrizione Metrica
Utilizzo CPU Il processo sta causando un elevato utilizzo della CPU sull'host. Il risultato di una valutazione della regola di utilizzo CPU elevata sull'host sottostante e il tempo utente CPU del processo fornito.
Apri utilizzo file. Il processo sta aprendo i file più velocemente di quanto non li chiuda (il rapporto corrente / massimo supera la soglia) Utilizzato (openFiles.used).
Fine anomala. Il processo è terminato come risultato di un segnale non rilevato.
Fine anomala. Processo terminato con un codice di uscita diverso da zero.

Per ulteriori informazioni su questo sensore, consultare la documentazione relativa ai processi del sistema operativo.

Runtime PHP-FPM

Evento Descrizione Metrica
Riavvii frequenti del pool di worker FPM di PHP. Verifica la presenza di riavvii frequenti di un pool di worker FPM ( PHP ) confrontando il numero dei suoi riavvii in un determinato intervallo di tempo con una soglia prestabilita. Ore di inizio per un pool di lavoro.
Backlog di ascolto configurato oltre la capacità. Controlla se il backlog di ascolto di un pool di nodi di lavoro supera la capacità configurata. La lunghezza della coda del pool di lavoro.
Troppe connessioni ripristinate. Verifica che il numero di reimpostazioni di connessione sia superiore alla soglia indicata nella finestra temporale fornita. La connessione reimposta la metrica per il pool di lavoro.
Troppe richieste accumulate nel backlog di ascolto. Verifica le dimensioni delle varie code dei worker FPM ( PHP ) e le confronta con il valore di soglia. Metriche relative alle dimensioni delle code di ascolto per le varie code dei worker FPM ( PHP ).
Troppe richieste lente. Verifica la percentuale di richieste lente su tutti i pool di worker FPM monitorati su PHP. Metriche relative alle richieste lente e alle connessioni accettate per un pool di worker di un'istanza di PHP -FPM.

Per ulteriori informazioni su questo sensore, consultare la documentazione di PHP.

Assegno sintetico

Evento Descrizione Metrica
La destinazione remota non è raggiungibile. Verifica se la percentuale di tentativi di comunicazione non riusciti nella finestra scorrevole fornita è superiore alla soglia fornita. Stato del ping (status). Un codice di stato http compreso tra 200 - 206 e 300 - 307 risulta in uno stato integro, per icmp il valore di uscita 0 è considerato integro mentre il valore 1 è visto come non integro, inoltre è impostato un tempo di esecuzione massimo di 2 secondi

Per ulteriori informazioni su questo sensore, consultare la documentazione relativa a Synthetic Check.

DB PostgreSQL

Evento Descrizione Metrica
Utilizzo connessione attivo. Il numero di connessioni attive è superiore al 90% del numero massimo di connessioni. Utilizzo connessione (max_conn_pct).

Per ulteriori informazioni su questo sensore, consultare la documentazione di PostgreSQL.

Processo

Evento Descrizione Metrica
Utilizzo CPU elevato. Valuta se il processo fornito sta causando un elevato utilizzo della CPU su un host. Risultati della valutazione della regola di utilizzo CPU elevata sull'host sottostante e il tempo utente CPU del processo fornito.
Troppi file di apertura. La percentuale di file aperti è superiore alla soglia configurata. Utilizzato (openFiles.used).

RabbitMQ

Cluster RabbitMQ

Evento Descrizione Metrica
Partizione di rete RabbitMQ rilevata Rileva se la partizione di rete si verifica all'interno del cluster RabbitMQ (attivato ogni 5 secondi). Numero totale di partizioni di rete (net_partitions_count).

RabbitMQ Server

Evento Descrizione Metrica
Le code si stanno riempiendo di messaggi In un periodo di 10 minuti, le code vengono riempite con messaggi non recapitati. Messaggi pronti (overview.messages_ready) e messaggi riconosciuti (overview.ack).
RabbitMq non ha consumer Negli ultimi 5 secondi, RabbitMQ non ha avuto consumer. Consumer (overview.consumers).
RabbitMq non ha connessioni Negli ultimi 5 secondi, RabbitMQ non ha avuto connessioni. Connessioni (overview.connections).

RabbitMQ Nodi

Evento Descrizione Metrica
RabbitMQ L'utilizzo dei descrittori file è critico. Il tasso di utilizzo dei descrittori file è critico su un nodo specifico (Avvertenza:> 90%, Critico:> 98%). Questo viene attivato ogni 5 secondi. Frequenza utilizzata dei descrittori file RabbitMQ (fd_used_rate).
RabbitMQ L'uso della memoria è critico sul nodo. La frequenza di utilizzo della memoria è critica su un nodo specifico (Avvertenza:> 90%, Critico:> 98%). Questo viene attivato ogni 5 secondi. Frequenza di utilizzo della memoria RabbitMQ (mem_used_rate).
RabbitMQ Il conteggio dei processi Erlang è critico. Il conteggio dei processi Erlang è critico su un nodo specifico (Avvertenza:> 90%, Critico:> 98%). Questo viene attivato ogni 5 secondi. Frequenza di processi RabbitMQ .

RabbitMQ Code

Evento Descrizione Metrica
Vengono prodotti più messaggi di quelli consumati. In una coda vengono pubblicati più messaggi di quanti i consumer possano elaborare da una coda. RabbitMQ messaggi non riconosciuti in una coda.

Per ulteriori informazioni su questo sensore, consultare la documentazione di RabbitMQ.

Redis

Cluster Redis

Evento Descrizione Metrica
Lo stato del cluster Redis non è corretto. Il cluster è in uno stato inappropriato. cluster_state.

Nodo Redis

Evento Descrizione Metrica
Analisi di allocazione memoria. Il server Redis sta causando la frammentazione della memoria esterna. Memoria utilizzata (used_memory) e rapporto di frammentazione della memoria (mem_fragmentation_ratio).
La frequenza di hit Redis è bassa. La frequenza di Redis è la seguente alla soglia configurata. Frequenza riscontri cache (hit_rate), riscontri spazio delle chiavi (keyspace_hits), mancati riscontri spazio delle chiavi (keyspace_misses) e Redis chiavi rimosse (evicted_keys).
L'utilizzo della memoria Redis si sta avvicinando al limite massimo di memoria. L'utilizzo della memoria Redis si sta avvicinando al limite massimo di memoria. Memoria utilizzata (used_memory).
Redis rifiuta le connessioni. Redis sta rifiutando le connessioni. Numero di connessioni rifiutate (rejected_connections).
Il nodo slave Redis non può connettersi al nodo master. Il nodo slave Redis non può connettersi al nodo master. master_downtime_seconds.

Per ulteriori informazioni su questo sensore, consultare la documentazione di Redis.

SAP ABAP

Evento Descrizione Metrica
Il blocco dura da più di 5 minuti Rileva il conflitto di blocco e fornisce dettagli relativi alla modalità di blocco e all'oggetto di blocco. Contesa blocco ABAP
Dump ABAP generati Rileva i dump ABAP generati e fornisce dettagli sulla gravità. Gravità dump ABAP
Si sono verificati errori IDoc in entrata e OutBound Rileva errori per IDoc in entrata e in uscita. Errore IDoc in entrata e errore IDoc in uscita
Il processo in background viene interrotto o annullato Rileva se un processo in background viene interrotto o annullato. Il processo in background viene interrotto o annullato
Rilevato utilizzo CPU elevato Rileva se l'utilizzo della CPU è superiore al 90%. Utilizzo CPU elevato
Rilevato utilizzo di memoria elevato Rileva se l'utilizzo di memoria è superiore al 90%. Utilizzo memoria elevato
È stato rilevato un processo di lavoro in modalità arrestata, di arresto o PRIV (privato) Rileva se il processo di lavoro è in modalità PRIV (privato), arrestato o arrestato. Stato processo di lavoro
Il processo di lavoro "In attesa" supera la soglia Rileva se il numero di processi di lavoro è in attesa e supera il valore 5. Stato processo di lavoro
Soglia di utilizzo del file system rilevata Rileva se l'utilizzo del file system supera la soglia dell ' 80%. Utilizzo file system
Rilevati problemi di connessione Rileva un nome utente e una password errati, un errore del gateway o tentativi di accesso errati. Stato connettività
Autorizzazione mancante rilevata Rileva se all'utente manca l'autorizzazione per eseguire un modulo funzione. Verifica autorizzazione
Rilevato account utente bloccato Rileva se l'account utente è bloccato a causa di errori di accesso. Blocco account utente
Rilevato errore di spool Rileva un errore di spool. Errore di spool
Tempo di risposta del dialogo superiore alla soglia Rileva se il tempo di risposta della finestra di dialogo supera la soglia preferita. Tempo di risposta finestra di dialogo
Processo di lavoro dialogico che supera la soglia Rileva se il processo di lavoro della finestra di dialogo è in corso da più di 10 secondi. Processo di lavoro dialogico
La latenza del database supera la soglia Rileva se la latenza media del database supera i 5 secondi. Latenza del database
Rilevato rilascio della richiesta di trasporto Rileva se la richiesta di trasporto è rilasciata o protetta. Richiesta di trasporto
La durata del processo in background supera le 6 ore Rileva se il processo in background non viene completato entro 6 ore. Lavori in background
La durata della chiamata al servizio web supera i 10 minuti Rileva quando una chiamata a un servizio web (cliente o destinazione) non viene completata entro 10 minuti. Chiamate al servizio web
Il tempo di elaborazione del gateway supera i 60 secondi Rileva se il tempo di elaborazione delle chiamate al gateway supera i 60 secondi. Statistiche gateway

Per ulteriori informazioni su questo sensore, consultare SAP ABAP.

SAP Java NetWeaver

Evento Descrizione Metrica
Rilevato utilizzo CPU elevato Rileva se l'utilizzo della CPU è superiore al 90%. Utilizzo CPU elevato
Rilevato un elevato utilizzo della memoria Rileva se l'utilizzo di memoria è superiore al 90%. Utilizzo memoria elevato
Rilevato un elevato utilizzo del disco Rileva se l'utilizzo del disco supera il 90%. Elevato utilizzo del disco
Rilevato errore di autenticazione Rileva gli errori di autenticazione causati da un nome utente o una password errati. Errore di autenticazione
Rilevato errore di autorizzazione Rileva un errore di autorizzazione causato dalla mancata assegnazione di un'azione dell' JMXManageAll e all'utente. Autorizzazione rifiutata
Rilevato timeout di connessione Rileva il timeout della connessione o un problema di rete. Rilevato timeout di connessione
Rilevato un carico elevato del sistema Rileva se il carico medio del sistema è superiore al 90%. Elevato carico di sistema
Rilevato un problema con GC Rileva il problema relativo alla garbage collection (GC). Problemi rilevati da GC
Rilevato un problema di sistema Rileva il problema di sistema. Sono stati rilevati problemi di sistema
Carenza di memoria nell'heap Rileva se vi è una carenza di memoria heap disponibile. Carenza di memoria nell'heap
Memoria non sufficiente Rileva se si verifica un errore di memoria insufficiente. Memoria non sufficiente
Rilevato un utilizzo elevato di thread in " HTTP " Rileva se il numero di thread attivi dell' HTTP e raggiunge la dimensione del pool configurata. Elevato utilizzo dei thread in un' HTTP

Per ulteriori informazioni su questo sensore, consultare SAP Java Netweaver.

SAP HANA

Evento Descrizione Metrica
Elevato utilizzo della CPU Rileva se l'utilizzo totale della CPU supera il 90% Utilizzo CPU totale
Elevato utilizzo della memoria di HANA Rileva se la memoria utilizzata supera il 90% del limite allocato Utilizzo memoria HANA
Utilizzo elevato della memoria host Rileva se l'utilizzo della memoria dell'host supera il 90% Utilizzo memoria host
Elevato utilizzo della memoria heap Rileva quando l'utilizzo della memoria heap supera il 90% Utilizzo memoria heap
Utilizzo elevato del disco Rileva se l'utilizzo del disco supera il 90% Riepilogo utilizzo disco
Numero elevato di connessioni in coda Rileva se le connessioni di accodamento sono più di una Connessioni
Alto numero di sessioni bloccate Rileva se le sessioni bloccate sono più di una Sessioni
Alto numero di sessioni di blocco Rileva se le sessioni di blocco sono più di una Sessioni
Numero elevato di thread bloccati Rileva se i thread bloccati sono più di 10 Thread
Numero elevato di thread SQL bloccati Rileva se i thread SQL bloccati sono più di 10 Thread SQL
Numero elevato di thread di lavoro bloccati Rileva se i thread worker del lavoro bloccati sono più di 10 Thread worker lavoro
Elevato numero di richieste in sospeso Rileva se le richieste in attesa sono più di 10 Richieste
CPU di processo elevata Rileva se una delle CPU del processo supera il 90% Dettagli del servizio
Lo stato del servizio non è attivo Rileva se lo stato di servizio non è attivo Dettagli del servizio
Elevato utilizzo di memoria da parte dei servizi HANA Rileva quando l'utilizzo della memoria dei servizi HANA supera il 90% Dettagli del servizio
Backup non riuscito Rileva l'ultimo backup non riuscito Ultimo backup
Si è verificato un blocco dell'utente Rileva quando il numero di blocchi utente supera i 10 Blocchi utente
I processi pianificati non sono andati a buon fine Rileva i processi pianificati non riusciti Lavori pianificati
Si sono verificati eventi di sistema Rileva gli eventi di sistema Eventi di sistema
Backup del registro di archivio non riuscito Rileva i backup di registro non riusciti Tutti i backup
La transazione non è attiva Rileva l'interruzione parziale e l'interruzione delle transazioni Statistiche della transazione
Transazioni bloccate Rileva quando una transazione viene bloccata Transazioni bloccate
Consumo elevato di dati Rileva quando il consumo di dati supera il 90% Dati di utilizzo del volume
Evento "Memoria insufficiente" Rileva quando si verifica un evento di esaurimento della memoria Memoria esaurita

Per ulteriori informazioni sul sensore " SAP HANA ", consultare la pagina "Monitoraggio" all'indirizzo SAP HANA.

Servizio

Evento Descrizione Metrica
Eliminazione completa delle chiamate. Rileva un rapido abbassamento a zero (essenzialmente il servizio non viene più richiamato) nei valori della metrica KPI delle chiamate relativi ai valori negli ultimi 30 minuti. L'entità del calo delle chiamate dovrebbe anche superare i parametri di soglia relativi e assoluti come segue. Chiamate (count).
Tasso di errore troppo alto. Rileva un tasso di errori costantemente elevato quando il KPI degli errori medi negli ultimi quattro minuti è superiore al valore di soglia fornito. Frequenza errori (error_rate).
Aumento della tendenza del tasso di errore. Controlla la presenza di una tendenza crescente in una determinata metrica. La regola è regolata per rilevare incrementi debolmente monotoni nella metrica fornita. Il rilevatore, tuttavia, non è rigoroso e tollera una certa quantità di riduzioni del valore metrico all'interno del candidato di tendenza. Frequenza errori (error_rate).
Improvviso calo delle chiamate. Rileva un rapido calo dei valori della metrica KPI delle chiamate rispetto ai valori negli ultimi 30 minuti. L'entità del calo delle chiamate dovrebbe anche superare i parametri di soglia relativi e assoluti come segue. Chiamate (count).
Improvviso aumento del tasso di errore. Rileva un rapido aumento dei valori del KPI di errori rispetto ai valori KPI negli ultimi 10 minuti. L'entità dell'aumento degli errori dovrebbe anche superare i parametri di soglia relativi e assoluti come segue. Frequenza errori (error_rate).
Improvviso aumento della latenza. Rileva un rapido aumento del percentile del KPI di latenza specificato rispetto ai valori del KPI registrati negli ultimi 30 minuti. L'entità dell'aumento della latenza deve superare i parametri di soglia relativi e assoluti. Latenza 50° (duration.50th).
Improvviso aumento della latenza per una frazione di richieste. Rileva un rapido aumento del percentile del KPI di latenza specificato rispetto ai valori del KPI registrati negli ultimi 30 minuti. L'entità dell'aumento della latenza deve superare i parametri di soglia relativi e assoluti. Latenza al 99° percentile (duration.99th).

Solr

Cluster Solr Cloud

Evento Descrizione Metrica
Nodi Solr non raggiungibili. Uno o più nodi sono inattivi. unreachableNodes.

Nodo Solr

Evento Descrizione Metrica
La frequenza di riscontri cache Solr è bassa. La percentuale di riscontri della cache Solr è la seguente: 80% nell'ultimo minuto, probabilmente a causa di sfratti elevati o di query di dati errati da parte dei client. Rapporto di utilizzo solr (hitratio) ed eliminazioni solr.

Per ulteriori informazioni su questo sensore, consultare la documentazione di Apache Solr.

Spark

Applicazione Spark

Evento Descrizione Metrica
Attività non riuscite sull'executor. Il numero di attività non riuscite su un executor supera la soglia configurata. Attività non riuscite dell'applicazione Spark.
Il ritardo di pianificazione è elevato. Il ritardo della pianificazione sta aumentando troppo velocemente o è troppo elevato. Ritardo pianificazione (schedulingDelay).

Spark Standalone

Evento Descrizione Metrica
Il driver non è riuscito. Il numero di driver non riusciti supera la soglia configurata. Numero di driver non riusciti (drivers.failed).
Il master autonomo Spark sta segnalando i lavoratori morti. Il numero di nodi di lavoro inattivi supera la soglia configurata. Operatori inattivi (workers.deadWorkers).
Il master autonomo Spark riporta i worker in uno stato sconosciuto. Il numero di worker in uno stato sconosciuto supera la soglia configurata.
L'app inoltrata non è riuscita. Il numero di applicazioni non riuscite supera la soglia configurata. Nodi di lavoro in stato sconosciuto (workers.workersInUnknownState).

Per ulteriori informazioni su questo sensore, consultare la documentazione di Apache Spark.

App Spring Boot

Evento Descrizione Metrica
Il numero di sessioni attive ha raggiunto il numero massimo. Una pipeline di elaborazione rileva il numero di connessioni attive dell'applicazione SpringBoot nella finestra temporale fornita. Convalida se il numero di sessioni attive è maggiore del valore di soglia. Sessioni attive (metrics.httpsessions.active).
Spring Boot Applicazione inattiva. Controlla lo stato dell'applicazione SpringBoot . Stato dell'applicazione SpringBoot (metrics.status).

Per ulteriori informazioni su questo sensore, consultare la documentazione di Spring Boot.

Server Sybase

Evento Descrizione Metrica
Le connessioni server disponibili sono al limite. Il numero di connessioni è vicino al 100% del limite di connessioni per server. Connessioni (stats.connCount).
Il numero massimo di database è al limite. Il numero di database è vicino al 100% del limite di database per server. databasesCount.

Per ulteriori informazioni sul sensore SQL Anywhere di SAP, consultare la sezione "Monitoraggio di SQL Anywhere con SAP ".

PoP sintetico

Evento Descrizione Metrica
Stato pop sintetico Verifica se Synthetic PoP è in grado di connettersi al backend Instana Stato del PoP sintetico (status)
Stato del motore di riproduzione Verificare se il motore di riproduzione è sovraccaricato. Lo stato del carico di lavoro dei motori di riproduzione browserscript.workloadStatus, http.workloadStatus, javascript.workloadStatuse ism.workloadStatus.
Richiamo credenziali non riuscito Impossibile recuperare le credenziali sintetiche dal backend Instana. Codice di errore e URL di pop_get_cred_failed (error.pop_get_cred_failed).
Richiamo test non riuscito Impossibile recuperare i test sintetici dal backend Instana. Codice di errore e URL di pop_get_test_failed(error.pop_get_test_failed).
Segnalazione dei risultati del test non riuscita Impossibile inviare i risultati del test sintetico al backend di Instana. Codice di errore e URL della funzione pop_report_result_failed(error.pop_report_result_failed).
Report dei dettagli del risultato del test non riuscito Impossibile inviare i dettagli dei risultati dei test sintetici al backend di Instana. Codice di errore e URL della funzione pop_report_result_details_failed(error.pop_report_result_details_failed).
La profondità della coda dei risultati di notifica è elevata Rileva se la profondità della coda dei risultati è elevata ResultQueueDepthHigh (resultQueueDepthHigh).

Per ulteriori informazioni su questo sensore, consultare la documentazione relativa a Synthetic PoP.

TIBCO EMS

Evento Descrizione Metrica
Le connessioni superano il numero massimo di connessioni disponibili. Il numero massimo di connessioni è quasi finito. Conteggio connessioni (connectionCount).
L'utilizzo della memoria dei messaggi supera il limite. La memoria massima dei messaggi è quasi esaurita. Memoria messaggi (messagesMemory).
Le code dei messaggi in sospeso superano il limite. Il numero massimo di messaggi in sospeso per la coda è quasi utilizzato. Utilizzo messaggi in sospeso della coda.
I messaggi in sospeso degli argomenti superano il limite. Il numero massimo di messaggi in sospeso per l'argomento è quasi utilizzato. Utilizzo messaggi in sospeso dell'argomento.

Per ulteriori informazioni su questo sensore, consultare la documentazione di TIBCO EMS.

Tomcat

Evento Descrizione Metrica
Le connessioni attive hanno raggiunto il valore massimo. Rileva se il numero di connessioni di un connettore specifico sta raggiungendo il valore massimo configurato. Numero di connessioni del connettore.
Calo improvviso del numero di sessioni. Verifica un calo significativo del numero di sessioni. Conteggio totale sessioni (totalSessionCount).
Improvviso aumento del numero di sessioni. Verifica un aumento significativo del numero di sessioni. Conteggio totale sessioni (totalSessionCount).
Il numero di thread ha raggiunto il massimo. Rileva se il numero di thread occupati di uno specifico connettore sta raggiungendo il valore massimo configurato. Numero di thread del connettore occupati.

Per ulteriori informazioni su questo sensore, consultare la documentazione di Tomcat.

Nodo Varnish

Evento Descrizione Metrica
Improvviso calo del numero di richieste. Verifica una diminuzione improvvisa del numero di richieste client. Richieste client ricevute (client_req).
Improvviso aumento di oggetti evocati. Verifica un aumento improvviso del numero di oggetti eliminati. Oggetti nuked (n_lru_nuked).
Creazione thread non riuscita. Troppe creazioni di thread non riuscite. Non riuscito (threads_failed) e limitato (threads_limited).
Il backend della vernice è contrassegnato come non integro. Il server di backend Varnish non è integro o non è disponibile. Non integro (backend_unhealthy).
Il tasso di hit della vernice è basso. Il tasso di hit della vernice è molto basso. Frequenza riscontri cache (cache_hit_rate).
La vernice è fuori dai thread di lavoro. La vernice è fuori dai thread di lavoro. Connessioni interrotte a causa di una coda completa (sess_dropped).

Per ulteriori informazioni su questo sensore, consultare la documentazione di Varnish.

Vault

Evento Descrizione Metrica
Vault è sigillato. Rileva se lo stato sigillato è impostato su true. Sigillato (sealed).
Improvviso aumento delle letture segrete Verifica un aumento improvviso (aumento del 60% in base alla media degli ultimi 5 minuti) del numero di segreti letti. Conteggio letture dei segreti (secret.read.count).

Per ulteriori informazioni su questo sensore, consultare la documentazione di Vault.

Server WebLogic

Evento Descrizione Metrica
Stato errore origine dati. Una pipeline di elaborazione monitora i codici di stato delle origini dati WebLogicApplications e controlla se un'origine dati non è sana. Stato dell'origine dati WebLogic .
Stato di integrità Rileva la degradazione generale del sistema in base allo stato di integrità riportato. Stato di integrità.

Per ulteriori informazioni su questo sensore, consultare la documentazione di WebLogic.

WebSphere

Evento Descrizione Metrica
I thread attivi del pool di thread WebContainer hanno raggiunto il massimo. Una pipeline di elaborazione convalida che il numero di thread attivi nel pool di thread WebContainer stia raggiungendo il limite massimo. Thread attivi (threadPools.webContainer.activeThreads).
Il certificato WebSphere sta per scadere. I giorni rimanenti prima della scadenza del certificato sono inferiori al valore di soglia. Giorni rimanenti prima della scadenza (certificates.{certificate}.expDaysLeft)

Per ulteriori informazioni su questo sensore, consultare la documentazione di WebSphere Application Server.

ZooKeeper

Evento Descrizione Metrica
La latenza massima della richiesta è elevata. Una pipeline di elaborazione controlla se la latenza massima della richiesta sta raggiungendo il valore di soglia. Latenza massima richiesta (max_request_latency).
Il numero di richieste in coda è elevato. Una pipeline di elaborazione rileva il numero di richieste in coda e convalida se il numero sta raggiungendo il valore di soglia. Conteggio richieste in sospeso (outstanding_requests).

Per ulteriori informazioni su questo sensore, consultare la documentazione di ZooKeeper.

  1. Gli eventi vengono recuperati da IBM MQ events. Instana L'agente raccoglie questi eventi " IBM MQ " e li segnala come eventi " Instana ". Per raccogliere questi eventi, è necessario abilitare l'evento delle prestazioni del Gestore code e l'evento del canale. Per ulteriori informazioni, consultare la sezione "Configurazione aggiuntiva di IBM MQ ". ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎