Avaliação de resultados de IA generativa em vários idiomas
Você pode avaliar a saída da IA generativa em vários idiomas usando o monitor de qualidade da IA generativa em watsonx.governance. Você pode selecionar o idioma para o qual deseja calcular as métricas de qualidade ao configurar sua avaliação.
Para executar avaliações multilíngues:
Em tempo de execução, usando a API ou o SDK, consulte o bloco de notas de suporte multilíngue em tempo de execução.
No momento do design, usando o SDK ou com um tokenizador personalizado, consulte o notebook de suporte multilíngue no momento do design.
Idiomas suportados
- Árabe (ar)
- Dinamarquês (da)
- Inglês (en)
- Francês (fr)
- Alemão (de)
- Italiano (it)
- Japonês (ja)
- Coreano (ko)
- Português (pt)
- Espanhol (es)
Observação: para obter resultados mais precisos, use o mesmo idioma para as instruções do prompt, os dados de entrada e a saída gerada. Se forem usados idiomas diferentes, as métricas de avaliação ainda serão computadas, mas os resultados poderão ser menos confiáveis.
Métricas suportadas por tipo de tarefa
- Sumarização
- Pontuação ROUGE
- Similaridade Cosine
- Similaridade Jaccard
- Precisão normalizada
- Recuperação normalizada
- Pontuação F1 normalizada
- SARI
- METEOR
- Pontuação HAP
- Detecção de PII
- Geração
- Pontuação ROUGE
- Precisão normalizada
- Recuperação normalizada
- Pontuação F1 normalizada
- METEOR
- Pontuação HAP
- Detecção de PII
- Extração
- Correspondência Exata
- Pontuação ROUGE
- Resposta a perguntas (QA)
- Correspondência Exata
- Pontuação ROUGE
- Pontuação HAP
- Detecção de PII
- Geração Aumentada por Recuperação (RAG)
- Pontuação ROUGE
- Correspondência Exata
- Pontuação HAP
- Detecção de PII
Execução de avaliações na interface do usuário
- Crie um projeto: Selecione Novo ativo e crie um novo ativo de modelo de prompt no projeto e, em seguida, selecione Chat e crie prompts com modelos de base com Prompt Lab.

- Crie e salve seu Prompt Template Asset com os dados no idioma em que você deseja avaliar o prompt. Adicione suas variáveis de entrada e uma entrada de amostra.
- Abaixo está um exemplo de um seguro de carro japonês com o modelo de prompt de resumo de sinistro.


- Salve o Prompt Template Asset com o tipo de tarefa correto.


- Você pode iniciar uma avaliação selecionando o botão Avaliar na Prompt Lab página.

- Selecione o idioma para o qual você deseja avaliar as métricas e clique em Next (Avançar ).
- Depois de selecionar um idioma, você não poderá alterá-lo. Você deve criar um novo Prompt Template Asset para outro idioma.
- As métricas que não são compatíveis não estão disponíveis para avaliação na interface do usuário.


- Faça o upload do conjunto de dados de teste no idioma selecionado e selecione o mapeamento de colunas. Em seguida, selecione Next para ir para a seção Review and Evaluate (Revisar e avaliar ), onde é possível verificar o idioma selecionado.
Observação: O campo de idioma ainda pode ser alterado voltando à seção Select Dimensions (Selecionar dimensões).

- Clique em Evaluate (Avaliar ) para avaliar as métricas escolhidas com mais precisão para o idioma selecionado. Você também pode ver o idioma selecionado no Resumo do modelo após a conclusão da avaliação.
