Indagine intelligente sugli incidenti
L'analisi intelligente degli incidenti individua la probabile causa principale (RCA) di un incidente nell'intero ambiente utilizzando l'intelligenza artificiale basata su agenti, l'analisi causale dell'IA e i modelli linguistici di grandi dimensioni (LLM).
Le moderne applicazioni cloud-native vengono eseguite su centinaia di microservizi, container, cluster Kubernetes e componenti infrastrutturali. Quando si verifica un incidente di produzione, i team di ingegneria delle operazioni ( DevOps ) e di affidabilità del sistema (SRE) devono individuare rapidamente cosa non ha funzionato, dove e perché. La correlazione manuale di metriche, log, tracce ed eventi di modifica tra diversi strumenti può richiedere ore e aumentare notevolmente il tempo medio di risoluzione (MTTR).
La funzionalità di analisi intelligente degli incidenti basata sull'intelligenza artificiale si avvale della piattaforma di osservabilità full-stack di Instana per analizzare automaticamente e in parallelo la topologia di sistema, il tracciamento distribuito, le metriche sulle prestazioni delle applicazioni, i log e gli eventi dell'infrastruttura. Esegue un'indagine su più entità (analisi a livello di sistema dei servizi e delle infrastrutture correlati), offrendo un'esperienza di indagine basata sull'intelligenza artificiale che riduce il tempo medio di risoluzione (MTTR) fino al 60-80% e accelera l'automazione della risposta agli incidenti. I processi di indagine utilizzano l'intelligenza artificiale generativa per sintetizzare i risultati in raccomandazioni formulate in un linguaggio semplice, individuando le cause alla radice che potrebbero trovarsi a diversi livelli di distanza dal punto in cui si sono manifestati i sintomi.
Che cos'è l'analisi intelligente degli incidenti?
- Identificazione causale delle probabili cause alla radice basata sull'intelligenza artificiale.
- Indagine agentica basata su modelli di linguaggio di grandi dimensioni (LLM) e sensibile alla topologia, che copre servizi, infrastrutture e risorse dell' Kubernetes.
- Linee guida investigative scritte in un linguaggio semplice a supporto dell'automazione della risposta agli incidenti.
- Elabora e affina le ipotesi relative all'incidente.
- Esplora il grafico dinamico dei servizi e dell'infrastruttura.
- Mette in relazione gli eventi di modifica, gli aggiornamenti di configurazione e le implementazioni con l'incidente.
- Genera una catena di propagazione dei guasti, un elenco dei componenti interessati ordinato per priorità e le azioni correttive consigliate.
- DevOps e i team SRE che applicano le migliori pratiche di ingegneria dell'affidabilità dei siti (SRE).
- Team di piattaforma che gestiscono l' Kubernetes, i microservizi e l'osservabilità cloud-native.
- I team operativi che desiderano ridurre l'affaticamento da avvisi, migliorare la gestione degli incidenti in produzione e ridurre i tempi di risposta agli incidenti durante i turni di reperibilità.
Vantaggi chiave
- Analisi automatizzata delle cause alla radice (RCA):
- Identifica automaticamente la causa principale più probabile tra servizi, infrastruttura e risorse dell' Kubernetes.
- Riduce la dipendenza da esperti in settori specifici e dalle richieste ad hoc.
- Riduzione del tempo medio di riparazione (MTTR) e risoluzione più rapida degli incidenti:
- Individua rapidamente la causa dei problemi. Queste analisi standard richiedono pochi minuti, anziché ore di analisi manuale.
- Ti aiuta a raggiungere gli obiettivi di livello di servizio (SLO) e i limiti di tolleranza degli errori, accelerando la risoluzione degli incidenti.
- Indagine full-stack su più entità:
- Va oltre la visione limitata ai singoli servizi e analizza l'intera catena di propagazione degli errori attraverso microservizi, database, code e infrastruttura. Questa analisi offre una visione d'insieme completa dell'intera topologia del sistema, anziché limitarsi a singoli componenti, per comprendere come questi interagiscono e si influenzano a vicenda.
- Si integra con il tracciamento distribuito, l'aggregazione dei log e il monitoraggio dell'infrastruttura per garantire l'osservabilità end-to-end.
- Analizza le correlazioni per identificare automaticamente le modifiche di configurazione rilevanti che potrebbero aver contribuito all'incidente.
- Raccomandazioni basate su dati scientifici:
- Fornisce prove concrete (metriche, registri, tracciati ed eventi di modifica) a sostegno di ogni conclusione.
- Genera suggerimenti correttivi redatti dall'intelligenza artificiale in un linguaggio semplice, destinati alle procedure operative per la gestione degli incidenti e alle discussioni nella sala operativa.
- Integrato con la tua piattaforma di osservabilità e i flussi di lavoro AIOps:
- Si integra con le funzionalità esistenti di Instana, quali gli avvisi intelligenti, l'individuazione delle cause probabili, la topologia e il monitoraggio delle prestazioni delle applicazioni (APM).
- Può essere integrato con funzionalità di risoluzione degli incidenti e strumenti di automazione esterni per passare dall'analisi all'automazione della risposta agli incidenti.
Come funziona un'indagine intelligente

Quando si avvia un'indagine, Instana esegue un'analisi completa dell'incidente attraverso un processo automatizzato in più fasi. Mentre l'indagine è in corso, è possibile continuare a utilizzare l'applicazione Instana ed esaminare il contesto infrastrutturale dell'incidente.
Prerequisiti e primi passi
- SaaS requisiti ambientaliNegli ambienti di tipo " SaaS ", l'analisi intelligente degli incidenti è disponibile per impostazione predefinita, ma il proprio ambiente deve comunque soddisfare le seguenti condizioni:
- Deve essere presente un evento Smart Alert relativo all'applicazione per il quale sia stata identificata la causa principale probabile.
- Se utilizzi gli eventi personalizzati, devi passare agli avvisi intelligenti di Instana.
- Autorizzazioni: non sono necessarie autorizzazioni per visualizzare un incidente e avviare un'indagine. Tuttavia, per configurare la creazione di incidenti è necessario disporre di un account con l'autorizzazione " Configurazione della gestione di eventi e avvisi ".
Per ulteriori informazioni sull'impostazione delle autorizzazioni, consultare la sezione " Gestione dell'accesso degli utenti".
- Requisiti per l'ambiente in proprioPer l' Standard Edition e e l'edizione personalizzata, è necessario abilitare il flag di funzionalità
feature.rca.agentic.enabledrichiesto per attivare le funzionalità di analisi intelligente degli incidenti.- Per configurare il flag di funzionalità su Standard Edition, consultare la sezione "Indagine intelligente sugli incidenti ".
- Per configurare il flag della funzionalità nella Custom Edition, consultare la sezione " Abilitazione delle funzionalità opzionali per la Custom Edition".
- Deve essere presente un evento Smart Alert relativo all'applicazione per il quale sia stata identificata la causa principale probabile.
- Se utilizzi gli eventi personalizzati, devi passare agli avvisi intelligenti di Instana.
- Autorizzazioni: non sono necessarie autorizzazioni per visualizzare un incidente e avviare un'indagine. Tuttavia, per configurare la creazione di incidenti è necessario disporre di un account con l'autorizzazione " Configurazione della gestione di eventi e avvisi ".
Per ulteriori informazioni sull'impostazione delle autorizzazioni, consultare la sezione " Gestione dell'accesso degli utenti".
Avvio di un'indagine :
Quando il sistema software presenta un problema o subisce un'interruzione, è possibile aprire l'incidente corrispondente dalla dashboard "Eventi" di Instana per avviare le indagini relative all'incidente.
| Metodo | Quando utilizzare |
|---|---|
| Pagina degli incidenti | Avviare manualmente un'indagine dalla vista dei dettagli aperta di un incidente. |
| Interfaccia di chat con intelligenza artificiale | Chiedi all'assistente AI, utilizzando un linguaggio naturale, di indagare su un incidente specifico mentre ti trovi su una qualsiasi pagina di Instana. |
| REST API | Avviare in modo programmatico un'indagine da un sistema esterno, uno script o una pipeline CI/CD. |
| Genera un'azione (Azioni consigliate) | Al termine di un'indagine, utilizzare la funzione di generazione delle azioni basata sull'intelligenza artificiale nella tabella "Azioni consigliate" per creare un'azione correttiva riutilizzabile che verrà salvata nel catalogo delle azioni. |
Metodo 1: Pagina "Incidenti"
- Dal menu " Instana ", selezionare .
- Filtra gli avvisi intelligenti dell'applicazione e applica la query di focalizzazione dinamica (DFQ) per event.rca.found:true visualizzare gli incidenti per i quali è stata individuata una probabile causa principale.
- Clicca su un incidente per aprire la schermata dei dettagli e scorri fino alla sezione "Analizza le possibili cause alla radice ".
- Fai clic su "Avvia indagine". L'analisi si avvia automaticamente e mostra i risultati in tempo reale.
È possibile chiudere la finestra dell'analisi in corso per far sì che l'analisi venga eseguita in background. È possibile continuare a lavorare mentre il processo è in esecuzione in background, ad esempio per continuare ad analizzare il contesto dell'applicazione e dell'infrastruttura e i sintomi dell'incidente.
- I risultati delle indagini vengono trasmessi in tempo reale man mano che ogni fase viene completata.
- Il riepilogo dei risultati finali dell'indagine viene visualizzato all'inizio della pagina al termine dell'indagine.
- Esamina la catena di propagazione dei guasti per capire come si è diffuso il problema.
- Esaminare i registri di tracciamento e i messaggi di errore di tracciamento per ottenere informazioni dettagliate.
- Consulta la sezione "Azioni consigliate" per i passaggi specifici necessari alla risoluzione del problema.
Metodo 2: Interfaccia di chat con intelligenza artificiale
- Dal menu " Instana ", selezionare .
- Fai clic sul pulsante fluttuante dell'assistente AI nell'angolo in basso a destra della pagina.
- Digita una richiesta in linguaggio naturale che faccia riferimento all'ID dell'incidente. Ad esempio:
L'IDInvestigate incident <incident-id><incident-id>dell'incidente è Instana, visibile nella pagina URL e nei payload degli avvisi. - L'assistente AI invia la richiesta di indagine e mostra in tempo reale i passaggi del ragionamento e i risultati direttamente nella finestra della chat.
Requisito : le opzioni relative alla funzione "Chat con IA" devono essere attivate. Per ulteriori informazioni, consultare la pagina dell'assistente AI Instana.
Metodo 3: REST API
Il eventId è l'ID dell'incidente di Instana visibile nella pagina " URL " e nei payload degli avvisi.
- Avviare un'indagine
curl -X POST "https://<your-instana-host>/api/automated-investigation/trigger/<eventId>" \ -H "Authorization: apiToken <YOUR_API_TOKEN>" \ -H "Content-Type: application/json"Poiché un'indagine può richiedere diversi minuti per essere completata, l'endpoint di trigger restituisce
202 Acceptedinizialmente un valore mentre l'indagine viene eseguita in background. Il corpo della risposta include anche unpollEndpointcampo che indica esattamente dove cercare i risultati:{ "message": "Agentic investigation started successfully", "eventId": "<eventId>", "status": "triggered", "pollEndpoint": "/api/automated-investigation/incidents/<eventId>" } - Verificare se l'indagine è stata completataL'indagine viene archiviata solo una volta completata integralmente. Utilizza il seguente approccio in due fasi per attendere i risultati senza dover recuperare l'intero payload ad ogni controllo:
- Sondaggio da completare (semplice, senza corpo del risultato)
Questo passaggio chiama
existsperiodicamente l'endpoint finché non200 OKrestituisce un valore. Viene restituito200 OKquando l'indagine è in corso o è stata completata, oppure404 Not Foundse l'indagine non esiste affatto.curl -o /dev/null -w "%{http_code}" \ "https://<your-instana-host>/api/automated-investigation/incidents/<eventId>/exists" \ -H "Authorization: apiToken <YOUR_API_TOKEN>" - Recupera i risultati completi (una sola volta, al termine dell'operazione)
Quando sei pronto a leggere i risultati, chiama l'endpoint principale. Restituisce
200 OKil documento completo dell'indagine quando questa è terminata e archiviata, oppure404 Not Foundse l'indagine non è ancora terminata.curl -X GET "https://<your-instana-host>/api/automated-investigation/incidents/<eventId>" \ -H "Authorization: apiToken <YOUR_API_TOKEN>"Una
404risposta proveniente dall'endpoint dei risultati indica che l'indagine non è ancora terminata. Continuare a inviare richieste e riprovare dopo una breve pausa.
- Sondaggio da completare (semplice, senza corpo del risultato)
- Risposte di errore
Stato HTTP Significato Azione 202 AcceptedL'indagine è stata avviata con esito positivo. Avviare il rilevamento dei risultati. 409 ConflictÈ già in corso un'indagine su questo episodio. Interroga invece i risultati già disponibili. 429 Too Many RequestsLimite frequenza API superato. Riprova dopo un breve intervallo. 503 Service UnavailableÈ stato raggiunto il numero massimo di indagini simultanee. Riprova dopo un breve intervallo. - Attivazione automatica tramite le azioni automatizzate
Invece di richiamare manualmente l' API, è possibile configurare un'azione automatizzata in modo che le indagini vengano avviate automaticamente ogni volta che viene aperto un Application Smart Alert corrispondente.
- Dal menu " Instana ", vai su .
- Crea un'azione di tipo
HTTPcon la seguente configurazione:- Metodo:
POST - URL:
https://<your-instana-host>/api/automated-investigation/trigger/@@eventId@@ - Intestazione:
Authorization: apiToken <YOUR_API_TOKEN> - Intestazione:
Content-Type: application/json
- Metodo:
- Dal menu “ Instana ”, vai su .
- Crea una politica che abbia come ambito lo Smart Alert dell'applicazione in questione. Quindi, associare l'azione creata al punto 2 e impostare l'azione in modo che si attivi all 'apertura dell'incidente.
Quando viene aperto un incidente, Instana chiama automaticamente il trigger API e avvia l'indagine in background. I risultati sono disponibili nella vista degli incidenti man mano che vengono trasmessi in tempo reale.
Metodo 4: Generare un'azione dalle "Azioni consigliate"
- Fare clic sull'azione "Genera" nella tabella "Azioni consigliate".
- Controlla e, se lo ritieni opportuno, modifica i campi “Riepilogo dell’indagine” e “Tipo di entità” già precompilati.
- Fai clic su "Genera" per ottenere una serie di passaggi correttivi generati dall'intelligenza artificiale.
- Esamina i passaggi generati e salvali come azione manuale nel catalogo delle azioni oppure, se lo desideri, genera uno script Bash di automazione o un playbook dell' Ansible e ed esportalo su GitHub o GitLab.
Per ulteriori informazioni sulla generazione di azioni tramite IA, consulta la sezione "Generazione di azioni tramite IA".
Fasi dell'indagine
- Approfondimenti iniziali
- Analisi degli eventi di cambiamento
- Analisi delle entità
- Report finale
- Approfondimenti iniziali
In primo luogo, i processi investigativi gettano le basi dell'indagine raccogliendo i dettagli dell'incidente, i dati relativi alle probabili cause alla radice con i punteggi di integrità, gli eventi correlati, i modelli iniziali di errore di tracciamento e le relazioni topologiche.
- Analisi degli eventi di cambiamento
Successivamente, le procedure investigative esaminano le modifiche apportate al sistema in un intervallo di tempo che va da 60 minuti prima dell'inizio dell'incidente a 20 minuti dopo l'inizio dell'incidente. I processi analizzano fino a 200 eventi di modifica, tra cui implementazioni, configurazioni e operazioni di ridimensionamento, per individuare tempistiche sospette.
- Analisi delle entità
L'agente esegue una chiamata allo strumento per raccogliere dati su un'entità di interesse e sulle entità circostanti. Viene quindi effettuata un'analisi completa su sei categorie di entità (entità principale, chiamanti del servizio, chiamati del servizio, entità padre dell'infrastruttura, entità figlio dell'infrastruttura e altre dipendenze dell'infrastruttura) attraverso la raccolta di registri di tracciamento, messaggi di errore, eventi e metriche per ciascuna entità.
- Report finale
Infine, i processi di indagine sintetizzano tutti i risultati in un rapporto completo che include l'identificazione delle cause alla radice, le condizioni di guasto, la visualizzazione della catena di propagazione del guasto, le prove raccolte, la classificazione dei componenti, i suggerimenti per la risoluzione e la correlazione temporale. Il processo nel suo complesso è concepito per essere non invasivo e funzionare in modo asincrono, in modo da consentirti di continuare a lavorare mentre sono in corso le indagini e le analisi. I risultati vengono trasmessi in tempo reale non appena disponibili, offrendoti una visione immediata dello stato di avanzamento dell'indagine.
Raccolta Dati e Analisi
Viene effettuata una raccolta completa dei dati su più livelli del sistema, acquisendo informazioni da ciascun componente della catena di propagazione del guasto. I dati vengono raccolti in batch e trasmessi in modo asincrono ai processi di backend per fornire informazioni in tempo reale man mano che l'indagine procede.

Ambito dell'indagine e categorie di soggetti
- Componente principale : il servizio o la componente che con maggiore probabilità è all'origine del problema.
- Servizi collegati : l'indagine esamina sia i servizi a monte che quelli a valle che interagiscono con il componente principale, al fine di valutare i potenziali effetti a catena.
- Contesto infrastrutturale : l'indagine esamina i sistemi e le piattaforme sottostanti che ospitano tali servizi, nonché eventuali risorse correlate quali database o code di messaggi.
- Relazioni a livello di applicazione : l'analisi prende in considerazione i componenti applicativi correlati e gli elementi di orchestrazione per garantire un quadro completo.
- Eventi di cambiamento : l'analisi tiene conto degli eventi di cambiamento, degli eventi intrinseci e degli eventi " Kubernetes " nell'ambito dell'approccio " incident.This ", contribuendo a individuare rapidamente la causa principale e a comprenderne l'impatto più ampio, consentendo così una risoluzione più rapida e accurata.
Risultati dell'indagine
L'analisi intelligente degli incidenti fornisce un'analisi completa che comprende:
| Componente | Descrizione |
|---|---|
| Identificazione della causa principale probabile | Identificazione precisa del componente all'origine del problema. |
| Catena di propagazione dei guasti | Rappresentazione grafica della diffusione del problema all'interno del sistema. |
| Sintesi delle prove | Metriche consolidate, registri, tracciati ed eventi di modifica a sostegno della conclusione. |
| Classificazione dei componenti | Indicare chiaramente quali componenti sono all'origine dei problemi, anziché limitarsi a descriverne i sintomi. |
Intervallo di tempo dell'analisi
L'indagine analizza i dati di sistema a partire da 60 minuti prima dell'inizio dell'incidente, fornendo un quadro completo degli eventi e dei cambiamenti che hanno portato al problema. Durante un'indagine, l' Instana e raccoglie i dati in lotti da tutte le entità interessate e utilizza processi di backend per analizzarli in modo asincrono. Questo approccio è pensato per fornire risultati in tempi rapidi senza richiedere una correlazione manuale dei dati e per limitare il carico aggiuntivo sui sistemi monitorati.
Domande frequenti (FAQ, Frequently Asked Questions)
Come posso accedere manualmente alla pagina relativa a un incidente con una causa principale probabile per avviare un'indagine?
- Dal menu " Instana ", selezionare .
- Filtra gli avvisi intelligenti dell'applicazione e applica la query di focalizzazione dinamica (DFQ) per event.rca.found:true visualizzare gli incidenti per i quali è stata individuata una probabile causa principale.
- Fai clic su un incidente per aprire la schermata dei dettagli e scorri fino alla sezione "Analisi delle possibili cause alla radice ".
- Fai clic su "Avvia indagine".
L'analisi si avvia automaticamente e mostra i risultati in tempo reale. Puoi continuare a lavorare mentre l'applicazione rimane in esecuzione in background.
Requisiti: l'incidente deve trattarsi di un "Application Smart Alert" per il quale sia stata identificata una probabile causa principale.
Posso condurre più indagini contemporaneamente?
Sì, è possibile condurre indagini su diversi incidenti contemporaneamente. Ogni indagine opera in modo indipendente e mantiene il proprio stato. Il limite predefinito è di 10 indagini simultanee. Quando viene raggiunto tale limite, l'interfaccia utente mette in coda le richieste successive e l' REST API e restituisce 503 Service Unavailable. Per aumentare il limite, invia una richiesta di assistenza.
Esistono limiti di frequenz API i sull'endpoint di trigger?
Sì. Per i limiti standard applicabili, consultare Instana API rate limits. Quando il limite viene superato, la funzione ` API ` restituisce 429 Too Many Requests
Cosa succede se chiudo il browser durante un'indagine?
Le indagini proseguono in sottofondo. Quando torni alla pagina dell'incidente, puoi riprendere a visualizzare i risultati dell'indagine. Il sistema memorizza nella cache lo stato delle indagini, in modo da consentirti di ricollegarti alle indagini in corso.
Posso esportare i risultati dell'indagine?
I risultati delle indagini vengono archiviati e sono consultabili dalla pagina dedicata all'incidente. Il fascicolo completo dell'indagine, comprensivo di tutte le conclusioni e le prove, viene conservato per riferimento futuro.
E se l'indagine non individuasse la causa principale?
Se l'indagine non riesce a individuare con certezza la causa principale, fornisce tutte le prove raccolte, le catene di propagazione dei guasti e le classificazioni dei componenti per aiutarti a indagare manualmente sull'incidente. I dati consolidati e l'analisi basata sull'intelligenza artificiale possono aiutarti a risolvere i problemi in modo più efficiente. Per ulteriori informazioni sull'analisi delle cause alla radice per Instana, consultare la sezione "Analisi delle cause alla radice".
Posso avviare un'indagine dall'interfaccia della chat con l'IA?
Sì, puoi utilizzare l'assistente AI disponibile nelle pagine "Eventi" e "Incidenti" per avviare un'indagine. Dall'assistente è possibile digitare una richiesta in linguaggio naturale, come ad Investigate incident <incident-id> esempio, direttamente nel pannello della chat. L'assistente avvia quindi un'indagine e ti trasmette i risultati in tempo reale. Per ulteriori informazioni, consultare il Metodo 2: Interfaccia della chat con IA.
È possibile avviare un'indagine automaticamente senza cliccare su "Esegui indagine"?
Sì. È possibile configurare un'azione automatizzata in modo che le indagini vengano avviate automaticamente ogni volta che viene visualizzato uno Smart Alert relativo a un'applicazione corrispondente. Per ulteriori informazioni, consulta la sezione "Attivazione automatica tramite azioni automatizzate".
È possibile avviare un'indagine da un sistema esterno o da uno script?
Sì, l'endpoint POST /api/automated-investigation/trigger/{eventId} può essere richiamato da qualsiasi sistema esterno per avviare un'indagine, purché si disponga di un token valido Instana API. 202 AcceptedInizialmente, l'indagine giunge a una conclusione. Poiché l'indagine viene eseguita in modo asincrono in background, eseguire il polling GET /api/automated-investigation/incidents/{eventId}/exists fino a quando 200 OK non viene restituito. Quindi, recupera i risultati completi con GET /api/automated-investigation/incidents/{eventId}. Per la procedura completa passo dopo passo e l'elenco degli errori, consultare il Metodo 3: REST API.