A inteligência artificial (IA) observabilidade é a capacidade de compreender modelos de IA e outras ferramentas e sistemas impulsionados por IA por meio do monitoramento de seus dados exclusivos de telemetria, incluindo uso de tokens, qualidade das respostas e desvio do modelo.
As ferramentas tradicionais de observabilidade compreendem o estado interno ou a condição de um sistema complexo usando os três pilares da observabilidade: logs, rastreamentos e métricas. As aplicações de IA e os agentes de IA introduzem uma camada adicional de complexidade que exige ferramentas de observabilidade específicas, capazes de otimizar o desempenho do modelo ao monitorar saídas específicas de IA e produzir visualizações (frequentemente geradas por IA).
Diferentemente do software tradicional, as saídas de grandes modelos de linguagem (LLMs) e de outras aplicações de IA generativa são probabilísticas. Inputs idênticos podem gerar respostas diferentes, o que pode dificultar o rastreamento de como as entradas moldam as saídas, causando problemas para ferramentas convencionais de observabilidade. Portanto, a solução de problemas, a depuração e o monitoramento de desempenho são mais complexos em sistemas de IA generativa.
Além disso, a explicabilidade em IA — um campo em crescimento que busca reduzir as características de “caixa-preta” de muitos modelos de IA — ainda não consegue explicar totalmente como os modelos interagem com sistemas e fluxos de trabalho de TI mais amplos. As soluções de observabilidade de IA devem priorizar aspectos que possam ser medidos e analisados de forma eficaz. Essa priorização é especialmente importante ao usar modelos de terceiros, como OpenAI ou Google, que executam e gerenciam os modelos de forma privada.
Os agentes de IA — sistemas que atuam de forma autônoma para projetar e executar fluxos de trabalho em todo o ecossistema de TI — apresentam seus próprios desafios exclusivos para a observabilidade e exigem uma abordagem igualmente exclusiva para a coleta de dados. Quase metade dos executivos entrevistados em 2025 pelo IBM Institute for Business Value citou “a falta de visibilidade nos processos de tomada de decisão dos agentes como uma barreira significativa de implementação” para a IA agêntica. A observabilidade desses sistemas é crucial para a adoção.
A observabilidade de IA funciona coletando métricas específicas de IA em toda a pilha tecnológica, em tempo real, e organizando-as em um dashboard. A observabilidade de IA oferece aos administradores uma visão mais aprofundada do funcionamento interno dos modelos de IA, ao mesmo tempo que reduz gargalos, alucinações e latência, entre outros problemas comuns.
As plataformas de observabilidade se concentram em três principais tipos de telemetria, que possuem variações próprias específicas para sistemas de IA: logs, rastreamentos e métricas.
Os logs são registros granulares, com carimbo de data e hora, completos e imutáveis de eventos da aplicação. Entre outras coisas, os logs podem ser usados para criar um registro de alta fidelidade, milissegundo a milissegundo, de todos os eventos em um sistema de TI, com todo o contexto ao redor. No desenvolvimento de IA, os desenvolvedores usam logs para solução de problemas e depuração.
Os rastreamentos registram a “jornada” de ponta a ponta de cada solicitação do usuário, desde a interface do usuário ou aplicativo móvel, passando por toda a arquitetura e pelo modelo de IA, e retornando ao usuário.
As métricas são medidas fundamentais da integridade da aplicação e do sistema ao longo do tempo. Por exemplo, as métricas são usadas para medir quanta memória ou capacidade de CPU uma aplicação utiliza em cinco minutos, ou quanta latência uma aplicação apresenta durante um pico de uso.
Mantenha-se atualizado sobre as tendências mais importantes (e intrigantes) do setor em IA, automação, dados e muito mais com o boletim informativo Think. Consulte a Declaração de privacidade da IBM.
Agentes de IA, IA generativa e outros sistemas de IA, como grandes modelos de linguagem, também produzem seus próprios tipos exclusivos de dados de telemetria que devem ser coletados e analisados para fornecer insights praticáveis aos administradores.
Uso de tokens, desvio do modelo e qualidade das respostas são três pontos de dados centrais para a maioria das iniciativas de observabilidade de IA. Monitorar esses fatores pode ajudar a reduzir problemas de desempenho ao longo do ciclo de vida de um modelo e melhorar a experiência do usuário.
Dados de telemetria mais tradicionais, como uso de GPU, gargalos na infraestrutura de rede e feedback da interface do usuário, também podem ser coletados por ferramentas de observabilidade de IA quando forem relevantes para o modelo.
Um token é uma unidade individual de linguagem, geralmente uma palavra ou parte de uma palavra, que um modelo de IA pode entender. O número de tokens que um modelo processa para entender um input ou produzir um output impacta diretamente o custo e o desempenho de uma aplicação baseada em LLM. Um maior consumo de tokens pode aumentar as despesas operacionais e a latência de resposta.
As principais métricas para rastrear o uso de token incluem:
Essas métricas podem ajudar as organizações a identificar oportunidades de otimização para reduzir o consumo de tokens, como o refinamento de prompts para transmitir mais informações com menos tokens. Ao otimizar a utilização de tokens, as organizações podem manter alta qualidade de resposta e, ao mesmo tempo, reduzir potencialmente os custos de inferência para cargas de trabalho de aprendizado de máquina.
Diferentemente do software tradicional, os modelos de IA correm o risco de mudar gradualmente seu comportamento de maneiras indesejáveis à medida que os dados do mundo real evoluem. Esse fenômeno, conhecido como desvio do modelo, pode degradar significativamente a confiabilidade e o desempenho dos sistemas de IA.
As principais métricas para rastrear o desvio do modelo incluem:
Os mecanismos de detecção de desvios podem fornecer avisos antecipados quando a precisão de um modelo diminui para casos de uso específicos, permitindo que as equipes interfiram antes que o modelo interrompa as operações comerciais.
O monitoramento da qualidade do output de IA é essencial para manter a confiança, a confiabilidade e a conformidade. As principais métricas para rastrear a qualidade da resposta incluem:
O OpenTelemetry (OTel), um framework de código aberto para coleta e transmissão de dados de telemetria, pode ajudar a mitigar os desafios de observabilidade impostos pela IA.
Para provedores de IA, o OpenTelemetry oferece uma forma de padronizar o compartilhamento de dados de desempenho sem expor detalhes proprietários dos modelos ou código-fonte. Para as organizações, ele garante que os dados de observabilidade fluam de forma consistente por pipelines de IA complexos que podem incluir vários modelos, diversas dependências e sistemas de RAG (retrieval augmented generation).
Os principais benefícios do OpenTelemetry para a observabilidade de IA incluem:
Devido ao alto nível de autonomia e automação dentro da rede, os agentes de IA exigem atenção especial das plataformas de observabilidade, especificamente em relação às ações que realizam dentro do sistema e aos logs e rastreamentos associados a essas ações.
Os próprios recursos que tornam os agentes de IA valiosos — o uso de LLMs, a recuperação de conversas anteriores e o uso de ferramentas externas — também podem torná-los difíceis de monitorar, compreender e controlar.
Ações comuns que um agente de IA pode realizar incluem chamar uma interface de programação de aplicativos (API) para interagir com um mecanismo de busca, chamar um LLM para produzir texto ou compreender a entrada do usuário, escalar solicitações para equipes humanas ou encaminhar um alerta automatizado sobre uma violação de segurança ou baixa disponibilidade de capacidade computacional.
Embora esses recursos permitam que os agentes trabalhem de forma independente, eles também os tornam muito menos transparentes do que aplicações tradicionais baseadas em regras e lógicas explícitas e predefinidas. Ao rastrear os dados associados a esses processos agênticos, os administradores podem obter insights sobre o comportamento do agente e ajudar a evitar violações de conformidade, falhas operacionais e a consequente erosão da confiança do usuário.
Logs exclusivos para a observabilidade de agentes de IA incluem:
Os benefícios da observabilidade da IA incluem o controle do custo de uso do modelo, a facilidade de conformidade e a melhoria do próprio modelo.
Obter maior visibilidade sobre como ferramentas impulsionadas por IA interagem com o ecossistema de TI pode identificar desperdícios de recursos. Por exemplo, se uma organização constatar que um modelo utiliza apenas uma pequena parte do poder de processamento disponível, as equipes de DevOps podem reduzir ou redirecionar recursos para onde são mais necessários.
Ferramentas de observabilidade de IA podem coletar, processar e armazenar automaticamente dados de telemetria de agentes de IA para auditorias de conformidade. O suporte a auditorias é cada vez mais importante, pois legislações como o AI Act da União Europeia, bem como diversas regulamentações estaduais propostas nos Estados Unidos, impulsionaram uma onda de esforços para padronizar o uso corporativo da IA e proteger quaisquer informações de identificação pessoal (PII) utilizadas pelos modelos.
Para desenvolvedores de modelos, o volume de telemetria coletado pelas ferramentas de observabilidade pode ajudar a reduzir o desvio do modelo, rastrear quais funcionalidades são mais valiosas e úteis (ou mais disfuncionais) e verificar se há viés e imparcialidade.
Embora a observabilidade da IA seja a prática de entender os sistemas de IA por meio de seus dados de telemetria, a observabilidade do aprendizado de máquina se concentra mais especificamente em como uma ferramenta de IA usa os dados no nível do modelo.
Compreender a telemetria de aprendizado de máquina é crucial porque os dados que um modelo ingere e aprende estão em constante mudança. O detalhamento para entender o funcionamento interno de um modelo pode ensinar aos administradores não apenas que o modelo desviou ou se tornou menos eficaz, mas também o porquê.
As principais métricas para a observabilidade de aprendizado de máquina, e frequentemente para a observabilidade de LLMs, medem a qualidade do modelo, os próprios dados que o modelo ingere e como o modelo interage com a infraestrutura ao seu redor.
Diferentes tipos de modelos possuem métricas de qualidade distintas que uma plataforma de observabilidade pode acompanhar.
Para um modelo de classificação, que classifica dados em classes predefinidas, as métricas de desempenho comuns incluem:
Um modelo de regressão, por outro lado, costuma ser avaliado por métricas como o erro quadrático médio da raiz, que mede a diferença média entre as previsões feitas pelo modelo e os pontos de dados reais em questão.
A observabilidade de aprendizado de máquina pode medir o desvio de dados, como grandes divergências entre os dados de entrada e os dados de treinamento, ou uma mudança na distribuição estatística de suas previsões, bem como métricas de qualidade de dados mais simples, como valores ausentes e tipos de valores incorretos ou inválidos. Usando essas métricas, ferramentas de observabilidade de aprendizado de máquina podem realizar uma análise de causa raiz para compreender o desvio do modelo ou evitá-lo antes que ocorra.
A observabilidade de aprendizado de máquina também costuma medir métricas mais tradicionais que podem ser relevantes para o modelo, como latência, uso de memória e throughput, ou o número de previsões que um modelo consegue realizar em um determinado intervalo de tempo.
Aproveite o poder da IA e da automação para resolver problemas de forma proativa em todo o stack de aplicações.
Maximize a resiliência operacional e garanta a integridade das aplicações nativas da nuvem com a observabilidade impulsionada por IA.
Eleve a automação e as operações de TI com a IA generativa, alinhando todos os aspectos da sua infraestrutura de TI com as prioridades do negócio.