Métrica de avaliação BLEU

A métrica BLEU (Bilingual Evaluation Understudy) compara frases traduzidas de traduções automáticas com frases de traduções de referência para medir a similaridade entre textos de referência e previsões.

Detalhes da métrica

O BLEU é uma métrica de avaliação de qualidade de IA generativa que mede o desempenho dos ativos de IA generativa nas tarefas.

Escopo

A métrica BLEU avalia apenas os ativos de IA generativa.

  • Tipos de ativos de IA : Modelos de prompts
  • Tarefas de IA generativa :
    • Resumo de textos
    • Geração de conteúdo
    • Resposta à pergunta
    • Geração aumentada de recuperação (RAG)
  • Idiomas suportados : Inglês

Pontuações e valores

A pontuação da métrica BLEU indica a similaridade entre a tradução automática e as traduções de referência. Pontuações mais altas indicam maior similaridade entre os textos de referência e as previsões.

  • Faixa de valores : 0.0-1.0
  • Melhor pontuação possível : 1.0

Configurações

  • Limiares :
    • Limite inferior: 0.8
    • Limite superior: 1
  • Parâmetros :
    • Ordem máxima: Ordem máxima de n-grama a ser usada ao completar a pontuação BLEU
    • Suavização: Se deve ou não ser aplicada uma função de suavização para remover o ruído dos dados