Métricas de avaliação

As métricas de avaliação podem ajudá-lo a monitorar continuamente o desempenho de seus modelos de IA para fornecer insights durante todo o ciclo de vida da IA. Com o watsonx.governance, você pode usar essas métricas para ajudar a garantir a conformidade com os requisitos regulamentares e identificar como fazer melhorias para reduzir os riscos.

Você pode executar avaliações em Watsonx.governance para gerar métricas com monitoramento automatizado que podem fornecer insights acionáveis para ajudá-lo a atingir suas metas de governança de IA. Você pode usar essas métricas para ajudar a atingir os seguintes objetivos:

  • Garanta a conformidade : Rastreie automaticamente a adesão às normas em evolução e às políticas organizacionais com alertas acionados quando os limites são violados.
  • Promover a transparência : Gere documentação detalhada para fornecer percepções claras sobre o comportamento do modelo, o desempenho e a explicabilidade dos resultados.
  • Mitigar riscos : detecte e resolva problemas como viés ou desvios de precisão por meio de avaliações contínuas e proativas dos riscos.
  • Proteger a privacidade e a segurança : Monitore as vulnerabilidades de segurança, como a exposição de informações de identificação pessoal (PII), e aplique proteções para evitar o uso indevido de dados confidenciais.

As métricas que você pode usar para fornecer insights sobre o desempenho do modelo são determinadas pelo tipo de avaliações que você habilita. Cada tipo de avaliação gera métricas diferentes que você pode analisar para obter insights.

Você também pode usar o ibm-watsonx-gov SDK Python para calcular métricas em um ambiente de execução de notebook ou descarregadas como tarefas Spark no IBM Analytics Engine para avaliações. O SDK Python é uma biblioteca Python que você pode usar para monitorar, gerenciar e administrar modelos de aprendizado de máquina de forma programática. Algumas métricas podem estar disponíveis somente com o SDK Python. Para obter mais informações, consulte Computação de métricas com o SDK do Python.

Suporte a métricas por tipo de implantação

A tabela a seguir mostra quais métricas são compatíveis com cada tipo de implantação. O símbolo ✓ indica que a métrica é compatível, enquanto os espaços em branco indicam que ela não é compatível.

Suporte a métricas por tipo de implantação
Grupo de métricas Métrica Aprendizado de máquina online Lote de aprendizado de máquina IA generativa online Lote de IA generativa
Funcionamento do modelo Tamanho de carga útil
Registros
Solicitações de pontuação
usuários
Contagem de tokens de entrada
Contagem de token de saída
Latência de API
Rendimento de API
Latência de registro
Registro de rendimento
Desvio v2 Desvio de integração
Desvio de recurso
Desvio de metadados de entrada
Desvio da qualidade do modelo
Desvio de saída
Desvio de metadados de saída
Desvio de predição
Justiça Diferença média absoluta de chances ✓*
Diferença média de chances ✓*
Impacto desigual ✓*
Diferença da taxa de erro ✓*
Diferença de taxa de descoberta falsa ✓*
Diferença de taxa de falso negativo ✓*
Diferença da taxa de omissão falsa ✓*
Diferença de taxa de falso positivo ✓*
Pontuação de impacto ✓*
Diferença de paridade estatística ✓*
Qualidade de IA generativa BLEU
Correspondência exata
METEOR
Capacidade de leitura
ROUGE
SARI
Similaridade de sentenças
Qualidade do texto
Qualidade de resposta Relevância de resposta
Similaridade de resposta
Fidelidade
Solicitações malsucedidas
Análise de conteúdo Abstração
Compactação
Cobertura
Densidade
Repetitividade
Qualidade da recuperação Precisão média
Relevância do contexto
Taxa de ocorrência
Ganho acumulado descontado normalizado
Classificação recíproca
Precisão de recuperação
Segurança de dados HAP
PII
Classificação multirrotulada Pontuação macro F1
Precisão macro
Rechamada de macro
Pontuação micro F1
Precisão micro
Rechamada de micro
Qualidade Precisão
Área sob RC
Taxa de falso positivo
Taxa de positivos verdadeiros
Área sob ROC
Pontuação de Brier
F1-Measure
Coeficiente de Gini
Defasagem de rótulo
Perda logarítmica
Coeficiente de correlação de Matthews
Erro médio absoluto
Erro absoluto médio em percentual
Erro quadrático médio
Coeficiente de correlação de Pearson
Precisão
Variação explicada da proporção
Rechamada
Raiz do erro de quadrado médio
R-quadrado
coeficiente de correlação de Spearman
Erro absoluto médio em percentual simétrico
Taxa de positivo verdadeiro ponderada
Taxa positiva falsa ponderada
Medida F1 ponderada
Precisão ponderada
Rechamada ponderada
Explicabilidade LIME
SHAP
Explicação contrastiva

* As métricas de equidade para implantações online de IA generativa são compatíveis apenas com casos de uso de classificação de texto.

As seções a seguir descrevem cada grupo de métricas em detalhes, incluindo descrições das métricas individuais e links para informações de configuração.

Drift v2 métricas de avaliação

As métricas de avaliação do Drift v2 podem ajudá-lo a medir as alterações em seus dados ao longo do tempo para garantir resultados consistentes para o seu modelo. Você pode usar essas métricas para identificar alterações na saída do modelo, na precisão das previsões e na distribuição dos dados de entrada. Watsonx.governance suporta as seguintes métricas de drift v2 :

Tabela 2. Drift v2 descrições de métricas de avaliação
Métrica Descrição
Desvio de recurso Mede a mudança na distribuição de valores para recursos importantes
Desvio da qualidade do modelo Compara a precisão estimada do tempo de execução com a precisão do treinamento para medir a queda na precisão.
Desvio de saída Mede a alteração na distribuição de confiança do modelo

Métricas de avaliação da justiça

As métricas de avaliação de imparcialidade podem ajudá-lo a determinar se o seu modelo produz resultados tendenciosos. Você pode usar essas métricas para identificar quando seu modelo mostra uma tendência a fornecer resultados favoráveis com mais frequência para um grupo do que para outro. Watsonx.governance suporta as seguintes métricas de avaliação de justiça:

Tabela 3. Descrições de métricas de avaliação da justiça
Métrica Descrição
Diferença média absoluta de chances Compara a média da diferença absoluta nas taxas de falsos positivos e nas taxas de verdadeiros positivos entre os grupos monitorados e os grupos de referência
Diferença média de chances Mede a diferença nas taxas de falsos positivos e falsos negativos entre os grupos monitorados e de referência
Impacto desigual Compara a porcentagem de resultados favoráveis de um grupo monitorado com a porcentagem de resultados favoráveis de um grupo de referência
Diferença da taxa de erro A porcentagem de transações que são classificadas incorretamente pelo seu modelo
Diferença de taxa de descoberta falsa A quantidade de transações falsas positivas como uma porcentagem de todas as transações com um resultado positivo
Diferença de taxa de falso negativo A porcentagem de transações positivas que foram incorretamente classificadas como negativas pelo seu modelo
Diferença da taxa de omissão falsa O número de transações falsas negativas como uma porcentagem de todas as transações com um resultado negativo
Diferença de taxa de falso positivo A porcentagem de transações negativas que foram incorretamente classificadas como positivas pelo seu modelo.
Pontuação de impacto Compara a taxa em que os grupos monitorados são selecionados para receber resultados favoráveis com a taxa em que os grupos de referência são selecionados para receber resultados favoráveis.
Diferença de paridade estatística Compara a porcentagem de resultados favoráveis dos grupos monitorados com os grupos de referência.

Métricas de avaliação do monitor de saúde do modelo

As métricas de avaliação do monitor de integridade do modelo podem ajudá-lo a entender o comportamento e o desempenho do modelo, determinando a eficiência com que a implantação do modelo processa as transações. As métricas de avaliação da integridade do modelo são ativadas por padrão para avaliações de modelos de aprendizado de máquina em produção. Watsonx.governance suporta as seguintes métricas de avaliação do modelo de monitor de integridade:

Tabela 12. Descrições das métricas de avaliação do monitor de integridade do modelo
Métrica Descrição
Tamanho de carga útil O tamanho total, médio, mínimo, máximo e médio da carga útil dos registros de transação que a implantação do modelo processa nas solicitações de pontuação em kilobytes (KB)
Registros O número total, médio, mínimo, máximo e mediano de registros de transações que são processados em solicitações de avaliação
Solicitações de pontuação O número de solicitações de pontuação que a implantação do modelo recebe
usuários O número de usuários que enviam solicitações de pontuação para suas implantações de modelo

Taxa de transferência e latência

As avaliações do monitor de integridade do modelo calculam a latência rastreando o tempo que leva para processar solicitações de pontuação e registros de transações por milissegundo (ms). A taxa de transferência é calculada rastreando o número de solicitações de pontuação e registros de transações processados por segundo.

As métricas a seguir são calculadas para medir a taxa de transferência e a latência durante as avaliações:

Tabela 12. Descrições de métricas de throughput e latência do monitor de integridade do modelo
Métrica Descrição
Latência de API Tempo necessário (em ms) para processar uma solicitação de pontuação por sua implementação de modelo.
Rendimento de API Número de solicitações de pontuação processadas por sua implantação de modelo por segundo

Métricas de avaliação de qualidade

As avaliações de qualidade podem ajudá-lo a medir a capacidade do seu modelo de fornecer resultados corretos com base no desempenho do modelo. Watsonx.governance suporta as seguintes métricas de avaliação de qualidade:

Tabela 13. Descrições de métricas de avaliação de qualidade
Métrica Descrição
Precisão Mede a correção das previsões do modelo calculando a proporção de resultados corretos entre o número total de resultados.
Área sob RC Mede o quanto seu modelo equilibra a identificação correta de classes positivas com a localização de todas as classes positivas
Área sob ROC Mede o grau em que seu modelo identifica as diferenças entre as classes.
Pontuação de Brier Mede a diferença média ao quadrado entre a probabilidade prevista e o valor-alvo.
F1-Measure Medidas Média harmônica de precisão e recall
Taxa de falso positivo Proporção de previsões incorretas na classe positiva
Coeficiente de Gini Mede a capacidade dos modelos de distinguir entre duas classes
Defasagem de rótulo Mede a assimetria das distribuições de rótulos
Perda logarítmica Média dos logaritmos das probabilidades da classe-alvo (confiança)
Coeficiente de correlação de Matthews A qualidade das classificações binárias e multiclasse, considerando os verdadeiros e falsos positivos e negativos
Erro médio absoluto Média da diferença absoluta entre a predição do modelo e o valor de destino
Erro absoluto médio em percentual Mede a diferença de erro percentual médio entre os valores previstos e reais
Erro quadrático médio Média da diferença ao quadrado entre a previsão do modelo e o valor-alvo
Coeficiente de correlação de Pearson Mede a relação linear entre a previsão do modelo e os valores-alvo.
Precisão Proporção de previsões corretas em previsões de classe positiva
Variação explicada da proporção A razão entre a variância explicada e a variância alvo. A variância explicada é a diferença entre a variância de destino e a variação do erro de predição.
Rechamada Proporção de previsões corretas na classe positiva
Raiz do erro de quadrado médio Raiz quadrada da média de diferença quadrada entre a predição do modelo e o valor de destino
R-quadrado Razão da diferença entre a variância de destino e a variância do erro de previsão para a variância de destino
coeficiente de correlação de Spearman Mede a monotonicidade da relação entre as previsões do modelo e os valores-alvo.
Erro absoluto médio em percentual simétrico Mede a média simétrica do erro percentual de diferença entre os valores previstos e reais
Taxa de positivos verdadeiros Proporção de previsões corretas em previsões de classe positiva
Taxa positiva falsa ponderada Proporção de previsões incorretas na classe positiva
Medida F1 ponderada Média ponderada de F1-measure com pesos iguais à probabilidade de classe
Precisão ponderada Média ponderada de precisão com pesos iguais à probabilidade de classe
Rechamada ponderada Média ponderada de recuperação com pesos iguais à probabilidade de classe