Métrica de avaliação BLEU
A métrica BLEU (Bilingual Evaluation Understudy) compara frases traduzidas de traduções automáticas com frases de traduções de referência para medir a similaridade entre textos de referência e previsões.
Detalhes da métrica
O BLEU é uma métrica de avaliação de qualidade de IA generativa que mede o desempenho dos ativos de IA generativa nas tarefas.
Escopo
A métrica BLEU avalia apenas os ativos de IA generativa.
- Tipos de ativos de IA : Modelos de prompts
- Tarefas de IA generativa :
- Resumo de textos
- Geração de conteúdo
- Resposta à pergunta
- Geração aumentada de recuperação (RAG)
- Idiomas suportados : Inglês
Pontuações e valores
A pontuação da métrica BLEU indica a similaridade entre a tradução automática e as traduções de referência. Pontuações mais altas indicam maior similaridade entre os textos de referência e as previsões.
- Faixa de valores : 0.0-1.0
- Melhor pontuação possível : 1.0
Configurações
- Limiares :
- Limite inferior: 0.8
- Limite superior: 1
- Parâmetros :
- Ordem máxima: Ordem máxima de n-grama a ser usada ao completar a pontuação BLEU
- Suavização: Se deve ou não ser aplicada uma função de suavização para remover o ruído dos dados