Métricas de avaliação
As métricas de avaliação podem ajudá-lo a monitorar continuamente o desempenho de seus modelos de IA para fornecer insights durante todo o ciclo de vida da IA. Com o watsonx.governance, você pode usar essas métricas para ajudar a garantir a conformidade com os requisitos regulamentares e identificar como fazer melhorias para reduzir os riscos.
Você pode executar avaliações em Watsonx.governance para gerar métricas com monitoramento automatizado que podem fornecer insights acionáveis para ajudá-lo a atingir suas metas de governança de IA. Você pode usar essas métricas para ajudar a atingir os seguintes objetivos:
- Garanta a conformidade : Rastreie automaticamente a adesão às normas em evolução e às políticas organizacionais com alertas acionados quando os limites são violados.
- Promover a transparência : Gere documentação detalhada para fornecer percepções claras sobre o comportamento do modelo, o desempenho e a explicabilidade dos resultados.
- Mitigar riscos : detecte e resolva problemas como viés ou desvios de precisão por meio de avaliações contínuas e proativas dos riscos.
- Proteger a privacidade e a segurança : Monitore as vulnerabilidades de segurança, como a exposição de informações de identificação pessoal (PII), e aplique proteções para evitar o uso indevido de dados confidenciais.
As métricas que você pode usar para fornecer insights sobre o desempenho do modelo são determinadas pelo tipo de avaliações que você habilita. Cada tipo de avaliação gera métricas diferentes que você pode analisar para obter insights.
Você também pode usar o ibm-watsonx-gov SDK Python para calcular métricas em um ambiente de execução de notebook ou descarregadas como tarefas Spark no IBM Analytics Engine para avaliações. O SDK Python é uma biblioteca Python que você pode usar para monitorar, gerenciar e administrar modelos de aprendizado de máquina de forma programática. Algumas métricas podem estar disponíveis somente com o SDK Python. Para obter mais informações, consulte Computação de métricas com o SDK do Python.
Suporte a métricas por tipo de implantação
A tabela a seguir mostra quais métricas são compatíveis com cada tipo de implantação. O símbolo ✓ indica que a métrica é compatível, enquanto os espaços em branco indicam que ela não é compatível.
* As métricas de equidade para implantações online de IA generativa são compatíveis apenas com casos de uso de classificação de texto.
As seções a seguir descrevem cada grupo de métricas em detalhes, incluindo descrições das métricas individuais e links para informações de configuração.
Drift v2 métricas de avaliação
As métricas de avaliação do Drift v2 podem ajudá-lo a medir as alterações em seus dados ao longo do tempo para garantir resultados consistentes para o seu modelo. Você pode usar essas métricas para identificar alterações na saída do modelo, na precisão das previsões e na distribuição dos dados de entrada. Watsonx.governance suporta as seguintes métricas de drift v2 :
| Métrica | Descrição |
|---|---|
| Desvio de recurso | Mede a mudança na distribuição de valores para recursos importantes |
| Desvio da qualidade do modelo | Compara a precisão estimada do tempo de execução com a precisão do treinamento para medir a queda na precisão. |
| Desvio de saída | Mede a alteração na distribuição de confiança do modelo |
Métricas de avaliação da justiça
As métricas de avaliação de imparcialidade podem ajudá-lo a determinar se o seu modelo produz resultados tendenciosos. Você pode usar essas métricas para identificar quando seu modelo mostra uma tendência a fornecer resultados favoráveis com mais frequência para um grupo do que para outro. Watsonx.governance suporta as seguintes métricas de avaliação de justiça:
| Métrica | Descrição |
|---|---|
| Diferença média absoluta de chances | Compara a média da diferença absoluta nas taxas de falsos positivos e nas taxas de verdadeiros positivos entre os grupos monitorados e os grupos de referência |
| Diferença média de chances | Mede a diferença nas taxas de falsos positivos e falsos negativos entre os grupos monitorados e de referência |
| Impacto desigual | Compara a porcentagem de resultados favoráveis de um grupo monitorado com a porcentagem de resultados favoráveis de um grupo de referência |
| Diferença da taxa de erro | A porcentagem de transações que são classificadas incorretamente pelo seu modelo |
| Diferença de taxa de descoberta falsa | A quantidade de transações falsas positivas como uma porcentagem de todas as transações com um resultado positivo |
| Diferença de taxa de falso negativo | A porcentagem de transações positivas que foram incorretamente classificadas como negativas pelo seu modelo |
| Diferença da taxa de omissão falsa | O número de transações falsas negativas como uma porcentagem de todas as transações com um resultado negativo |
| Diferença de taxa de falso positivo | A porcentagem de transações negativas que foram incorretamente classificadas como positivas pelo seu modelo. |
| Pontuação de impacto | Compara a taxa em que os grupos monitorados são selecionados para receber resultados favoráveis com a taxa em que os grupos de referência são selecionados para receber resultados favoráveis. |
| Diferença de paridade estatística | Compara a porcentagem de resultados favoráveis dos grupos monitorados com os grupos de referência. |
Métricas de avaliação do monitor de saúde do modelo
As métricas de avaliação do monitor de integridade do modelo podem ajudá-lo a entender o comportamento e o desempenho do modelo, determinando a eficiência com que a implantação do modelo processa as transações. As métricas de avaliação da integridade do modelo são ativadas por padrão para avaliações de modelos de aprendizado de máquina em produção. Watsonx.governance suporta as seguintes métricas de avaliação do modelo de monitor de integridade:
| Métrica | Descrição |
|---|---|
| Tamanho de carga útil | O tamanho total, médio, mínimo, máximo e médio da carga útil dos registros de transação que a implantação do modelo processa nas solicitações de pontuação em kilobytes (KB) |
| Registros | O número total, médio, mínimo, máximo e mediano de registros de transações que são processados em solicitações de avaliação |
| Solicitações de pontuação | O número de solicitações de pontuação que a implantação do modelo recebe |
| usuários | O número de usuários que enviam solicitações de pontuação para suas implantações de modelo |
Taxa de transferência e latência
As avaliações do monitor de integridade do modelo calculam a latência rastreando o tempo que leva para processar solicitações de pontuação e registros de transações por milissegundo (ms). A taxa de transferência é calculada rastreando o número de solicitações de pontuação e registros de transações processados por segundo.
As métricas a seguir são calculadas para medir a taxa de transferência e a latência durante as avaliações:
| Métrica | Descrição |
|---|---|
| Latência de API | Tempo necessário (em ms) para processar uma solicitação de pontuação por sua implementação de modelo. |
| Rendimento de API | Número de solicitações de pontuação processadas por sua implantação de modelo por segundo |
Métricas de avaliação de qualidade
As avaliações de qualidade podem ajudá-lo a medir a capacidade do seu modelo de fornecer resultados corretos com base no desempenho do modelo. Watsonx.governance suporta as seguintes métricas de avaliação de qualidade:
| Métrica | Descrição |
|---|---|
| Precisão | Mede a correção das previsões do modelo calculando a proporção de resultados corretos entre o número total de resultados. |
| Área sob RC | Mede o quanto seu modelo equilibra a identificação correta de classes positivas com a localização de todas as classes positivas |
| Área sob ROC | Mede o grau em que seu modelo identifica as diferenças entre as classes. |
| Pontuação de Brier | Mede a diferença média ao quadrado entre a probabilidade prevista e o valor-alvo. |
| F1-Measure | Medidas Média harmônica de precisão e recall |
| Taxa de falso positivo | Proporção de previsões incorretas na classe positiva |
| Coeficiente de Gini | Mede a capacidade dos modelos de distinguir entre duas classes |
| Defasagem de rótulo | Mede a assimetria das distribuições de rótulos |
| Perda logarítmica | Média dos logaritmos das probabilidades da classe-alvo (confiança) |
| Coeficiente de correlação de Matthews | A qualidade das classificações binárias e multiclasse, considerando os verdadeiros e falsos positivos e negativos |
| Erro médio absoluto | Média da diferença absoluta entre a predição do modelo e o valor de destino |
| Erro absoluto médio em percentual | Mede a diferença de erro percentual médio entre os valores previstos e reais |
| Erro quadrático médio | Média da diferença ao quadrado entre a previsão do modelo e o valor-alvo |
| Coeficiente de correlação de Pearson | Mede a relação linear entre a previsão do modelo e os valores-alvo. |
| Precisão | Proporção de previsões corretas em previsões de classe positiva |
| Variação explicada da proporção | A razão entre a variância explicada e a variância alvo. A variância explicada é a diferença entre a variância de destino e a variação do erro de predição. |
| Rechamada | Proporção de previsões corretas na classe positiva |
| Raiz do erro de quadrado médio | Raiz quadrada da média de diferença quadrada entre a predição do modelo e o valor de destino |
| R-quadrado | Razão da diferença entre a variância de destino e a variância do erro de previsão para a variância de destino |
| coeficiente de correlação de Spearman | Mede a monotonicidade da relação entre as previsões do modelo e os valores-alvo. |
| Erro absoluto médio em percentual simétrico | Mede a média simétrica do erro percentual de diferença entre os valores previstos e reais |
| Taxa de positivos verdadeiros | Proporção de previsões corretas em previsões de classe positiva |
| Taxa positiva falsa ponderada | Proporção de previsões incorretas na classe positiva |
| Medida F1 ponderada | Média ponderada de F1-measure com pesos iguais à probabilidade de classe |
| Precisão ponderada | Média ponderada de precisão com pesos iguais à probabilidade de classe |
| Rechamada ponderada | Média ponderada de recuperação com pesos iguais à probabilidade de classe |