Avaliação de resultados de IA generativa em vários idiomas

Você pode avaliar a saída da IA generativa em vários idiomas usando o monitor de qualidade da IA generativa em watsonx.governance. Você pode selecionar o idioma para o qual deseja calcular as métricas de qualidade ao configurar sua avaliação.

Para executar avaliações multilíngues:

Idiomas suportados

  • Árabe (ar)
  • Dinamarquês (da)
  • Inglês (en)
  • Francês (fr)
  • Alemão (de)
  • Italiano (it)
  • Japonês (ja)
  • Coreano (ko)
  • Português (pt)
  • Espanhol (es)
Observação: para obter resultados mais precisos, use o mesmo idioma para as instruções do prompt, os dados de entrada e a saída gerada. Se forem usados idiomas diferentes, as métricas de avaliação ainda serão computadas, mas os resultados poderão ser menos confiáveis.

Métricas suportadas por tipo de tarefa

  • Sumarização
    • Pontuação ROUGE
    • Similaridade Cosine
    • Similaridade Jaccard
    • Precisão normalizada
    • Recuperação normalizada
    • Pontuação F1 normalizada
    • SARI
    • METEOR
    • Pontuação HAP
    • Detecção de PII
  • Geração
    • Pontuação ROUGE
    • Precisão normalizada
    • Recuperação normalizada
    • Pontuação F1 normalizada
    • METEOR
    • Pontuação HAP
    • Detecção de PII
  • Extração
    • Correspondência Exata
    • Pontuação ROUGE
  • Resposta a perguntas (QA)
    • Correspondência Exata
    • Pontuação ROUGE
    • Pontuação HAP
    • Detecção de PII
  • Geração Aumentada por Recuperação (RAG)
    • Pontuação ROUGE
    • Correspondência Exata
    • Pontuação HAP
    • Detecção de PII

Execução de avaliações na interface do usuário

  1. Crie um projeto: Selecione Novo ativo e crie um novo ativo de modelo de prompt no projeto e, em seguida, selecione Chat e crie prompts com modelos de base com Prompt Lab.

Etapa 1

  1. Crie e salve seu Prompt Template Asset com os dados no idioma em que você deseja avaliar o prompt. Adicione suas variáveis de entrada e uma entrada de amostra.
    • Abaixo está um exemplo de um seguro de carro japonês com o modelo de prompt de resumo de sinistro.

Etapa 2

Etapa 2.2

  1. Salve o Prompt Template Asset com o tipo de tarefa correto.

Etapa 3.1

Etapa 3.2

  1. Você pode iniciar uma avaliação selecionando o botão Avaliar na Prompt Lab página.

Etapa 4

  1. Selecione o idioma para o qual você deseja avaliar as métricas e clique em Next (Avançar ).
    • Depois de selecionar um idioma, você não poderá alterá-lo. Você deve criar um novo Prompt Template Asset para outro idioma.
    • As métricas que não são compatíveis não estão disponíveis para avaliação na interface do usuário.

Etapa 5

Etapa 5.2

  1. Faça o upload do conjunto de dados de teste no idioma selecionado e selecione o mapeamento de colunas. Em seguida, selecione Next para ir para a seção Review and Evaluate (Revisar e avaliar ), onde é possível verificar o idioma selecionado.
Observação: O campo de idioma ainda pode ser alterado voltando à seção Select Dimensions (Selecionar dimensões).

Etapa 6

  1. Clique em Evaluate (Avaliar ) para avaliar as métricas escolhidas com mais precisão para o idioma selecionado. Você também pode ver o idioma selecionado no Resumo do modelo após a conclusão da avaliação.

Etapa 7

Saiba Mais