Avaliando modelos de prompt separados em projetos

É possível avaliar modelos de prompt desconectado em projetos para medir o desempenho de modelos de base que não são criados ou hospedados pela IBM

Um modelo de prompt independente é uma definição de prompt que não está vinculada a um ativo implantado. O modelo contém informações de referência para conectar-se a um modelo externo. Os modelos de prompt independentes são utilizados para avaliar modelos externos ou não IBM es e destinam-se a fins de avaliação e teste, e não para alimentar uma aplicação em produção.

Ao avaliar modelos de prompt separados em projetos, é possível avaliar com que eficiência seu modelo externo gera respostas para os tipos de tarefas a seguir:

  • Resumo de textos
  • Classificação de texto
  • Resposta à pergunta
  • Extração de entidade
  • Geração de conteúdo
  • Geração aumentada de recuperação

Antes de iniciar

Permissões necessárias : É necessário ter as seguintes funções para avaliar modelos de prompt: função de Administrador ou Editor em um projeto

Criar um modelo de prompt independente

Para avaliar um modelo de prompt para um modelo externo, você deve primeiro criar um modelo de prompt independente para conectar seu modelo externo ao watsonx.governance.

É possível criar modelos de prompt independentes em um projeto diretamente pela interface do usuário ou por meio da API. Durante a criação, você define variáveis de prompt e fornece detalhes de conexão, como o nome e o endereço URL do seu modelo externo.

Criar um modelo de prompt desanexado na interface do usuário

É possível criar um modelo de prompt desanexado diretamente na interface de usuário do site watsonx.governance. Os modelos de prompts desvinculados permitem que você avalie os prompts independentemente dos ativos de implementação.

Procedimento:

  1. No seu projeto, acesse a guia “Recursos ”, clique em “Novo recurso ” > “Trabalhar com modelos ” e, em seguida, selecione “Preparar um recurso de IA externo para governança ”.

  2. Se o seu projeto não tiver uma instância do watsonx.governance associada, será solicitado que você selecione uma. Clique em “Associar uma instância de serviço ”, selecione uma instância e, em seguida, clique em “Associar ”.

  3. Insira os detalhes do modelo de prompt independente.

    Campos obrigatórios:

    • Nome: Digite um nome para o modelo de prompt independente.
    • Modelo de prompt URL : O endereço URL para o prompt, caso seja compatível com o provedor.
    • Modelo de base URL : Link para a documentação do modelo ou recursos adicionais.
    • Nome do modelo de base: Nome do modelo de base
    • ID do modelo de base: O identificador exclusivo do modelo provisionado, geralmente no formato ARN ou equivalente.
    • Tipo de tarefa: Selecione o tipo de tarefa que o modelo de prompt executa.
  4. Opcional: Digite o prompt de base que você deseja usar para a avaliação. Esse prompt define a instrução ou a pergunta que será processada pelo modelo de linguagem grande.

  5. Selecione um método de decodificação:

    • Ganancioso: Gera o próximo token mais provável em cada etapa.
    • Amostragem: Introduz a aleatoriedade no processo de geração.
  6. Defina as variáveis de prompt.

    Na seção Variáveis do prompt, defina todas as variáveis utilizadas no prompt. As variáveis são pares de valores-chave que são injetados no prompt durante a avaliação. Essas variáveis não são necessárias quando você cria o modelo, mas pelo menos uma variável deve ser fornecida para avaliar o modelo.

  7. Revise e crie o modelo de prompt independente. Verifique se todos os campos obrigatórios estão preenchidos e, em seguida, clique em Criar para salvar o modelo de prompt independente.

Criar um modelo de prompt desanexado com a API

Para criar um modelo de prompt desanexado usando a API, veja o exemplo a seguir:

{
    "name": "prompt name",
    "description": "prompt description",
    "model_version": {
        "number": "2.0.0.7",
        "tag": "my prompt tag",
        "description": "my description"
    },
    "prompt_variables": {
        "var1": {},
        "var2": {}
    },
    "task_ids": [
        "retrieval_augmented_generation"
    ],
    "input_mode": "detached",
    "prompt": {
        "model_id": "",
        "input": [
            [
                "Some input",
                ""
            ]
        ],
        "data": {},
        "external_information": {
            "external_prompt_id": "external prompt",
            "external_model_id": "external model",
            "external_model_provider": "external provider",
            "external_prompt": {
                "url": "https://company.com?asd=a&32=1",
                "additional_information": [
                    {
                        "additional_key": "additional settings"
                    }
                ]
            },
            "external_model": {
                "name": "An external model",
                "url": "https://company.com?asd=a&32=1"
            }
        }
    }
}

Executando avaliações

Para executar avaliações de modelo de prompt separado em seu projeto, é possível abrir um modelo de prompt separado salvo na guia Ativos e selecionar Avaliar na guia Avaliações em watsonx.governance para abrir o assistente Avaliar modelo de prompt . É possível executar avaliações somente se você estiver designado às funções Admin ou Editor para seu projeto

Executar avaliação do modelo de prompt externo

Selecionar dimensões

O assistente Modelo de prompt de avaliação exibe as dimensões que estão disponíveis para avaliar para o tipo de tarefa que está associado ao seu prompt É possível expandir as dimensões para visualizar a lista de métricas que são usadas para avaliar as dimensões selecionadas.

Selecionar dimensões de llm externas para avaliar

Watsonx.governance configura automaticamente as avaliações para cada dimensão com configurações padrão. Para configurar avaliações com configurações diferentes, é possível selecionar Configurações avançadas para configurar tamanhos mínimos de amostra e valores de limite para cada métrica, conforme mostrado no exemplo a seguir:

Configurar avaliações de llm externas

Selecionar dados de teste

Você deve enviar um arquivo ` CSV ` que contenha dados de teste com colunas de referência que incluam a entrada e a saída esperada do modelo. Os dados de teste que você enviar devem conter a saída do modelo em uma coluna chamada generated_text para permitir avaliações de implantação independentes.

Quando o upload for concluído, você também deverá mapear as variáveis de prompt para as colunas correspondentes dos seus dados de teste. Selecione dados de teste de LLM externos para fazer upload

Revisar e avaliar

É possível revisar as seleções para o tipo de tarefa de prompt, os dados de teste transferidos por upload e o tipo de avaliação executado. Deve-se selecionar Avaliar para executar a avaliação

Revisar e avaliar configurações de avaliação do modelo de prompt desconectado

Analisar os resultados da avaliação

Quando sua avaliação for concluída, será possível revisar um resumo de seus resultados de avaliação na guia Avaliações em watsonx.governance para obter insights sobre o desempenho do modelo. O resumo fornece uma visão geral de pontuações de métrica e violações de limite de pontuação padrão para suas avaliações de modelo de prompt...

Se você tiver designado a função Visualizador para seu projeto, poderá selecionar Avaliar na lista de ativos na guia Ativos para visualizar os resultados da avaliação.

Para analisar os resultados, você pode clicar na seta seta de navegação ao lado da avaliação do seu modelo de prompt para visualizar os resultados ao longo do tempo. Também é possível analisar os resultados da avaliação de funcionamento do modelo que é executada por padrão durante as avaliações de modelo de prompt para entender com que eficiência seu modelo processa seus dados

O menu Ações também fornece as opções a seguir para ajudar a analisar seus resultados:

  • Avaliar agora: execute a avaliação com um conjunto de dados de teste diferente
  • Todas as avaliações: exiba um histórico de suas avaliações para entender como seus resultados mudam com o tempo.
  • Configurar monitores: configure limites de avaliação e tamanhos de amostra.
  • Visualizar informações de modelo: visualize detalhes sobre seu modelo para entender como seu ambiente de implementação está configurado...

Analisar resultados da avaliação do modelo de prompt desconectado

Próximas etapas

Você pode enviar seus modelos de prompt para espaços de implantação a fim de avaliar modelos de prompt independentes nesses espaços e obter insights sobre o desempenho do seu modelo ao longo do ciclo de vida da IA.

Saiba Mais

Se você estiver acompanhando a implantação destacada em um caso de uso de IA, os detalhes sobre o modelo e os resultados da avaliação serão registrados em uma ficha técnica.