Configuração das avaliações de qualidade
Você pode configurar avaliações de qualidade para medir a capacidade do seu modelo de fornecer resultados corretos com base no desempenho do modelo.
As avaliações de qualidade medem a capacidade do seu modelo de prever resultados precisos, identificando quando a qualidade do modelo diminui, para que você possa retreinar o modelo adequadamente. Para avaliar o modelo, você fornece dados de feedback, que são dados rotulados onde o resultado é conhecido. As avaliações de qualidade usam métricas para avaliar como o modelo prevê o resultado que corresponde aos resultados reais no conjunto de dados rotulado.
As seções a seguir descrevem como configurar avaliações de qualidade:
Configurando avaliações de qualidade para modelos de aprendizado de máquina
Antes de iniciar: Fornecendo os dados de feedback
Os dados de feedback são como fornecer uma folha de resposta com resultados reais observados. O monitor pode executar o modelo como se as respostas não fossem conhecidas, em seguida, comparar os resultados previstos com os resultados reais e fornecer pontuações de precisão com base em métricas de qualidade.
Para fornecer os dados de feedback que você usará para avaliar o modelo, clique na página Terminais e execute um dos seguintes procedimentos:
- Clique em Fazer upload de dados de feedback e faça upload de um arquivo com dados rotulados.
- Clique na guia Terminais e especifique um terminal que se conecta à origem de dados de feedback.
Para obter detalhes, consulte Gerenciando dados de feedback.
Configurando limites de Qualidade
Depois que seus dados de feedback estiverem disponíveis para a avaliação, configure as configurações do monitor Você configura limites para desempenho aceitável para o modelo em comparação com os resultados conhecidos.
Para configurar os valores limite, na guia Qualidade , clique no ícone Editar
para inserir valores para a caixa Limite de Qualidade e, em seguida, edite os valores para o tamanho da amostra.
Limite de alerta de qualidade
Selecione um valor que represente um nível de precisão aceitável. Por exemplo, na amostra Modelo de risco de crédito alemão fornecida com a configuração automática, o alerta para a métrica Área sob ROC é configurado como 95%. Se a qualidade medida para o modelo estiver abaixo desse valor, um alerta será acionado. Um valor típico para Área sob ROC é 80%.
Tamanhos de amostra mínimos e máximos
Ao configurar um tamanho mínimo de amostra, você evita medir a qualidade até que um número mínimo de registros esteja disponível no conjunto de dados de avaliação. Isso garante que o tamanho da amostra não seja muito pequeno para enviesar resultados. Toda vez que a verificação de qualidade é executada, ela usa o tamanho mínimo de amostra para decidir o número de registros nos quais ela faz o cálculo de métricas de qualidade.
O tamanho máximo da amostra ajuda a gerenciar melhor o tempo e os recursos necessários para avaliar o conjunto de dados Apenas os registros mais recentes são avaliados se esse tamanho for excedido. Por exemplo, na amostra Modelo de risco de crédito alemão , o tamanho mínimo da amostra é configurado como 50 e não há tamanho máximo especificado, pois é uma amostra pequena.
Configuração de avaliações de qualidade para modelos de IA generativa
Quando você avalia modelos de prompt, é possível revisar um resumo de resultados de avaliação de qualidade para o tipo de tarefa de classificação de texto
O resumo exibe pontuações e violações para métricas que são calculadas com configurações padrão.
Para configurar as avaliações de qualidade com suas próprias configurações, é possível configurar um tamanho mínimo de amostra e configurar valores de limite para cada métrica. O tamanho mínimo da amostra indica o número mínimo de registros de transações de modelo que você deseja avaliar e os valores de limites criam alertas quando suas pontuações de métrica violam seus limites.. As pontuações das métricas devem ser superiores aos valores-limite mínimos para evitar violações. Os valores de métrica mais altos indicam melhores pontuações.
Métricas de qualidade suportadas
Ao habilitar as avaliações de qualidade, você pode gerar métricas que o ajudam a determinar a qualidade da previsão de resultados do seu modelo. Os valores que são configurados como limites de métrica determinam como é possível interpretar suas pontuações de métrica. Para métricas que são configuradas com limites inferiores, pontuações mais altas indicam melhores resultados. Para métricas configuradas com limites superiores, as pontuações inferiores indicam melhores resultados.
As avaliações de qualidade geram as seguintes métricas:
Área sob ROC
- Modelos compatíveis : Aprendizado de máquina
- Descrição: Área sob rechamada e curva de taxa de falso positivo para calcular a sensibilidade com relação à taxa de queda
- Limites padrão: limite inferior = 80%
- Tipo de problema: classificação binária
- Valores do gráfico : último valor no período
- Detalhes de métricas disponíveis: matriz de confusão
Área sob RC
- Modelos compatíveis : Aprendizado de máquina
- Descrição: área sob a curva de precisão e rechamada
- Limites padrão: limite inferior = 80%
- Tipo de problema: classificação binária
- Valores do gráfico : último valor no período
- Detalhes de métricas disponíveis: matriz de confusão
- Faça a matemática:
A Área sob Rechamada de precisão fornece o total para Precision + Recall.
n
AveP = ∑ P(k)∆r(k)
k=1
A precisão (P) é definida como o número de positivos verdadeiros (Tp) sobre o número de positivos verdadeiros mais o número de falsos positivos (Fp).
number of true positives
Precision = ______________________________________________________
(number of true positives + number of false positives)
A rechamada (R) é definida como o número de positivos verdadeiros (Tp) sobre o número de positivos verdadeiros mais o número de falsos negativos (Fn).
number of true positives
Recall = ______________________________________________________
(number of true positives + number of false negatives)
Precisão
- Modelos compatíveis : Aprendizado de máquina e IA generativa
- Descrição: a proporção de predições corretas
- Limites padrão: limite inferior = 80%
- Tipos de problemas: classificação binária e classificação de classe múltipla
- Valores do gráfico : último valor no período
- Detalhes de métricas disponíveis: matriz de confusão
- Entendendo o conceito de precisão : a precisão pode ter significados diferentes, dependendo do tipo de algoritmo:
Classificação multiclasse: a Precisão mede o número de vezes que qualquer classe foi prevista corretamente, normalizada pelo número de pontos de dados. Para obter mais detalhes, consulte “Classificação multiclasse” na documentação do Apache Spark.
Classificação binária: para um algoritmo de classificação binária, a precisão é medida como a área sob uma curva ROC. Consulte “Classificação binária” na documentação do Apache Spark para obter mais detalhes.
Regressão: Algoritmos de regressão são medidos usando o Coeficiente de Determinação ou R2. Para obter mais detalhes, consulte a seção “Avaliação do modelo de regressão” na documentação do Apache Spark.
Taxa positiva verdadeira
- Modelos compatíveis : Aprendizado de máquina
- Descrição: proporção de predições corretas em predições de classe positiva
- Limites padrão: limite inferior = 80%
- Tipo de problema: classificação binária
- Valores do gráfico : último valor no período
- Detalhes de métricas disponíveis: matriz de confusão
- Faça a matemática:
A Taxa positiva verdadeira é calculada pela fórmula a seguir:
number of true positives
TPR = _________________________________________________________
(number of true positives + number of false negatives)
taxa de falso positivo
- Modelos compatíveis : Aprendizado de máquina
- Descrição: proporção de predições incorretas na classe positiva
- Limites padrão: limite inferior = 80%
- Tipo de problema: classificação binária
- Valores do gráfico : último valor no período
- Detalhes de métricas disponíveis: matriz de confusão
- Faça a matemática:
A taxa de falso positivo é quociente do número total de falsos positivos que é dividido pela soma de falsos positivos e verdadeiros negativos..
number of false positives
False positive rate = ______________________________________________________
(number of false positives + number of true negatives)
Pontuação de Brier
- Modelos compatíveis : Aprendizado de máquina
- Descrição: mede a diferença quadrática média entre a probabilidade prevista e o valor de destino. Pontuações mais altas indicam que as probabilidades preditas do modelo não correspondem ao valor de destino.
- Limites padrão:
- Limite superior = 80%
- Tipo de problema: classificação binária
- Faça a matemática:
A métrica de escore brier é calculada com a seguinte fórmula:
BrierScore = 1/N * sum( (p - y)^2 )
Where y = actual outcome, and p = predicted probability
Coeficiente de Gini
- Modelos compatíveis : Aprendizado de máquina
- Descrição: o coeficiente de Gini mede como os modelos distinguem entre duas classes. Ele é calculado como o dobro da área entre a curva ROC e a linha diagonal do gráfico. Se o valor do coeficiente gini for 0, o modelo não mostrará capacidade de discriminação e um valor de 1 indicará discriminação perfeita.
- Limites padrão:
- Limite inferior = 80%
- Tipo de problema: classificação binária
- Valores do gráfico : último valor no período
- Detalhes de métricas disponíveis: matriz de confusão
- Faça a matemática:
A métrica do coeficiente de gini é calculada com a seguinte fórmula:
Gini = 2 * Area under ROC - 1
Defasagem de rótulo
- Modelos compatíveis : IA generativa e aprendizado de máquina
- Descrição: Mede a assimetria de distribuições de rótulo. Se a assimetria for 0, o conjunto de dados é perfeitamente equilibrado; se for menor que -1 ou maior que 1, a distribuição é altamente distorcida; qualquer valor intermediário é moderadamente distorcido.
- Limites padrão:
- Limite inferior = -0.5
- Limite superior = 0.5
- Tipo de problema: classificação binária e classificação multiclasse
- Valores do gráfico : último valor no período
Coeficiente de correlação de Matthews
- Modelos compatíveis : IA generativa e aprendizado de máquina
- Descrição: mede a qualidade das classificações binárias e multiclasse, considerando positivos e negativos verdadeiros e falsos. Medida balanceada que pode ser usada mesmo se as classes forem de tamanhos diferentes Um valor de coeficiente de correlação entre -1 e +1. Um coeficiente de +1 representa uma previsão perfeita, 0 uma previsão aleatória média e -1 uma previsão inversa.
- Limites padrão: limite inferior = 80%
- Tipo de problema: classificação binária e classificação multiclasse
- Valores do gráfico : último valor no período
- Detalhes da métrica disponíveis: Matriz de confusão
Erro percentual absoluto médio
- Modelos compatíveis : aprendizado de máquina
- Limites padrão: Limite superior = 0.2
- Tipo de problema: regressão
- Descrição: Mede a diferença de erro percentual médio entre os valores previstos e reais
- Faça a matemática:
O erro percentual absoluto médio é calculado com a seguinte fórmula:
A é o valor real e P é o valor previsto.
Erro percentual absoluto médio simétrico
- Modelos compatíveis : Aprendizado de máquina
- Limites padrão: Limite superior = 0.2
- Tipo de problema: regressão
- Descrição: Mede a média simétrica do erro percentual de diferença entre os valores previstos e reais
- Faça a matemática:
O erro percentual absoluto médio simétrico é calculado com a seguinte fórmula:
A é o valor real e P é o valor previsto.
Coeficiente de correlação de Pearson
- Modelos compatíveis : Aprendizado de máquina
- Limite padrão: Limite inferior = 80%
- Tipo de problema: regressão
- Descrição: A métrica do coeficiente de correlação de Pearson (pearson) mede a relação linear entre a previsão do modelo e os valores-alvo. A métrica de pearson calcula um valor de coeficiente de correlação entre -1 e +1. Um valor de correlação de -1 ou +1 indica que existe uma relação linear exata e um valor de 0 indica que não há correlação. As correlações positivas indicam que as variáveis aumentam simultaneamente e as correlações negativas indicam que, à medida que uma variável aumenta, outra variável diminui. Valores positivos altos indicam que o modelo prevê valores semelhantes aos valores-alvo.
Coeficiente de correlação de Spearman
- Modelos compatíveis : Aprendizado de máquina
- Limite padrão: Limite inferior = 80%
- Tipo de problema: regressão
- Valores do gráfico : último valor no período
- Descrição: a métrica do coeficiente de correlação de ordem de classificação de spearman (spearman) mede a monotonicidade da relação entre as previsões do modelo e os valores-alvo. A métrica de spearman calcula um valor de coeficiente de correlação entre -1 e +1. Um valor de correlação de -1 ou +1 indica que existe uma relação monotônica exata e um valor de 0 indica que não há correlação. As correlações positivas indicam que as variáveis aumentam simultaneamente e as correlações negativas indicam que, à medida que uma variável aumenta, outra variável diminui.
Rechamada
- Modelos compatíveis : Aprendizado de máquina
- Descrição: proporção de predições corretas na classe positiva
- Limites padrão: limite inferior = 80%
- Tipo de problema: classificação binária
- Valores do gráfico : último valor no período
- Detalhes de métricas disponíveis: matriz de confusão
- Faça a matemática:
A rechamada (R) é definida como o número de positivos verdadeiros (Tp) sobre o número de positivos verdadeiros mais o número de falsos negativos (Fn).
number of true positives
Recall = ______________________________________________________
(number of true positives + number of false negatives)
Precisão
- Modelos compatíveis : Aprendizado de máquina
- Descrição: proporção de predições corretas em predições de classe positiva
- Limites padrão: limite inferior = 80%
- Tipo de problema: classificação binária
- Valores do gráfico : último valor no período
- Detalhes de métricas disponíveis: matriz de confusão
- Faça a matemática:
A precisão (P) é definida como o número de positivos verdadeiros (Tp) sobre o número de positivos verdadeiros mais o número de falsos positivos (Fp).
number of true positives
Precision = __________________________________________________________
(number of true positives + the number of false positives)
F1-Measure
- Modelos compatíveis : Aprendizado de máquina
- Descrição: média harmônica de precisão e rechamada
- Limites padrão: limite inferior = 80%
- Tipo de problema: classificação binária
- Valores do gráfico : último valor no período
- Detalhes de métricas disponíveis: matriz de confusão
- Faça a matemática:
A F1-measure é a média harmônica ponderada ou média de precisão e rechamada.
(precision * recall)
F1 = 2 * ____________________
(precision + recall)
Perda logarítmica
- Modelos compatíveis : Aprendizado de máquina
- Descrição: média de probabilidades da classe de destino de logaritmos (confiança). Ela também é conhecida como Log da verossimilhança esperada.
- Limites padrão: limite inferior = 80%
- Tipo de problema: classificação binária e classificação multiclasse
- Valores do gráfico : último valor no período
- Detalhes de métricas disponíveis: nenhum
- Faça a matemática:
Para um modelo binário, a Perda logarítmica é calculada usando a fórmula a seguir:
-(y log(p) + (1-y)log(1-p))
em que p = rótulo verdadeiro e y = probabilidade predita
Para um modelo de várias classes, a Perda logarítmica é calculada usando a fórmula a seguir:
M
-SUM Yo,c log(Po,c)
c=1
em que M > 2, p = rótulo verdadeiro e y = probabilidade predita
Variação explicada proporção
- Modelos compatíveis : Aprendizado de máquina
- Descrição: a variância explicada da proporção é a proporção de variação explicada e a variação de destino. A variação explicada é a diferença entre a variância de destino e a variância do erro de predição.
- Limites padrão: limite inferior = 80%
- Tipo de problema: regressão
- Valores do gráfico : último valor no período
- Detalhes de métricas disponíveis: nenhum
- Faça a matemática:
A variância da proporção explicada é calculada pela média dos números, então para cada número, subtraia a média e quadrava os resultados. Em seguida, trabalhar os quadrados.
sum of squares between groups
Proportion explained variance = ________________________________
sum of squares total
Erro médio absoluto
- Modelos compatíveis : Aprendizado de máquina
- Descrição: média de diferença absoluta entre a previsão do modelo e o valor de destino
- Limites padrão: limite superior = 80%
- Tipo de problema: regressão
- Valores do gráfico : último valor no período
- Detalhes de métricas disponíveis: nenhum
- Faça a matemática:
O Erro médio absoluto é calculado incluindo todos os erros absolutos e dividindo-os pelo número de erros.
SUM | Yi - Xi |
Mean absolute errors = ____________________
number of errors
Erro quadrático médio
- Modelos compatíveis : Aprendizado de máquina
- Descrição: média de diferença quadrática entre predição de modelo e valor de destino
- Limites padrão: limite superior = 80%
- Tipo de problema: regressão
- Valores do gráfico : último valor no período
- Detalhes de métricas disponíveis: nenhum
- Faça a matemática:
O erro do quadrado médio em sua forma mais simples é representado pela fórmula a seguir:
SUM (Yi - ^Yi) * (Yi - ^Yi)
Mean squared errors = ____________________________
number of errors
R²
- Modelos compatíveis : Aprendizado de máquina
- Descrição: proporção de diferença entre a variação de destino e a variação para o erro de predição para a variação de destino
- Limites padrão: limite inferior = 80%
- Tipo de problema: regressão
- Valores do gráfico : último valor no período
- Detalhes de métricas disponíveis: nenhum
- Faça a matemática:
A métrica R-quadrado é definida na seguinte fórmula.
explained variation
R-squared = _____________________
total variation
Raiz do erro de quadrado médio
- Modelos compatíveis : Aprendizado de máquina
- Descrição: raiz quadrada da média da diferença quadrática entre a predição do modelo e o valor de destino
- Limites padrão: limite superior = 80%
- Tipo de problema: regressão
- Valores do gráfico : último valor no período
- Detalhes de métricas disponíveis: nenhum
- Faça a matemática:
A raiz do erro quadrático médio é igual à raiz quadrada da média (previsões menos valores observados) quadrada.
___________________________________________________________
RMSE = √(forecasts - observed values)*(forecasts - observed values)
Taxa positiva verdadeira ponderada
- Modelos compatíveis : Aprendizado de máquina e IA generativa
- Descrição: média ponderada da classe TPR com pesos igual à probabilidade de classe
- Limites padrão: limite inferior = 80%
- Tipo de problema: classificação de multiclasses
- Valores do gráfico : último valor no período
- Detalhes de métricas disponíveis: matriz de confusão
- Faça a matemática:
A Taxa positiva verdadeira é calculada pela fórmula a seguir:
number of true positives
TPR = _________________________________________________________
number of true positives + number of false negatives
Taxa de falso positivo ponderada
- Modelos compatíveis : Aprendizado de máquina e IA generativa
- Descrição: proporção de predições incorretas na classe positiva
- Limites padrão: limite inferior = 80%
- Tipo de problema: classificação de multiclasses
- Valores do gráfico : último valor no período
- Detalhes de métricas disponíveis: matriz de confusão
- Faça a matemática:
A Taxa de falso positivo ponderada é a aplicação do FPR com dados ponderados.
number of false positives
FPR = ______________________________________________________
(number of false positives + number of true negatives)
Rechamada ponderada
- Modelos compatíveis : Aprendizado de máquina e IA generativa
- Descrição: média ponderada de rechamada com pesos igual à probabilidade de classe
- Limites padrão: limite inferior = 80%
- Tipo de problema: classificação de multiclasses
- Valores do gráfico : último valor no período
- Detalhes de métricas disponíveis: matriz de confusão
- Faça a matemática:
A Rechamada ponderada (wR) é definida como o número de positivos verdadeiros (Tp) sobre o número de positivos verdadeiros mais o número de falsos negativos (Fn) usados com dados ponderados.
number of true positives
Recall = ______________________________________________________
number of true positives + number of false negatives
Precisão ponderada
- Modelos compatíveis : Aprendizado de máquina e IA generativa
- Descrição: média ponderada de precisão com pesos igual à probabilidade de classe
- Limites padrão: limite inferior = 80%
- Tipo de problema: classificação de multiclasses
- Valores do gráfico : último valor no período
- Detalhes de métricas disponíveis: matriz de confusão
- Faça a matemática:
A precisão (P) é definida como o número de positivos verdadeiros (Tp) sobre o número de positivos verdadeiros mais o número de falsos positivos (Fp).
number of true positives
Precision = ________________________________________________________
number of true positives + the number of false positives
Weighted F1-Medida
- Modelos compatíveis : Aprendizado de máquina e IA generativa
- Descrição: média ponderada de medida F1 com pesos igual à probabilidade de classe
- Limites padrão: limite inferior = 80%
- Tipo de problema: classificação de multiclasses
- Valores do gráfico : último valor no período
- Detalhes de métricas disponíveis: matriz de confusão
- Faça a matemática:
A Medida F1 ponderada é o resultado do uso de dados ponderados.
precision * recall
F1 = 2 * ____________________
precision + recall
Configuração de avaliações de qualidade com dados históricos
Você também pode configurar avaliações de qualidade para gerar métricas com dados históricos de feedback pontuado de intervalos de tempo anteriores. Você pode usar o SDK do Python para especificar parâmetros e utilizar uma das seguintes opções para configurar avaliações de qualidade com dados históricos de feedback pontuado:
- Calcule as métricas em um único intervalo de tempo, com datas de início e término.
parameters = {
"start_date": "2024-08-05T11:00:18.0000Z",
"end_date": "2024-08-05T14:00:18.0000Z"
}
run_details = wos_client.monitor_instances.run(monitor_instance_id=quality_monitor_instance_id, parameters = run_parameters, background_mode=False).result
- Divida o intervalo de tempo especificado pelo número de avaliações indicado no
compute_windowsparâmetro e calcule as métricas para cada intervalo de tempo.
parameters = {
"start_date": "2024-08-05T11:00:18.0000Z",
"end_date": "2024-08-05T14:00:18.0000Z",
"compute_windows":3
}
run_details = wos_client.monitor_instances.run(monitor_instance_id=quality_monitor_instance_id, parameters = run_parameters, background_mode=False).result
- Divida o intervalo de tempo especificado com base na frequência de programação configurada na assinatura e calcule as métricas para cada intervalo de tempo.
parameters = {
"start_date": "2024-08-05T11:00:18.0000Z",
"end_date": "2024-08-05T14:00:18.0000Z",
"evalute_using_schedule":True
}
run_details = wos_client.monitor_instances.run(monitor_instance_id=quality_monitor_instance_id, parameters = run_parameters, background_mode=False).result
Saiba mais
Análise dos resultados de qualidade dos modelos de aprendizado de máquina