Avaliando implementações desconectadas em espaços

Você pode criar um modelo de prompt independente para avaliar modelos de prompt para modelos de base que não tenham sido criados ou hospedados pelo IBM.

Um modelo de prompt independente é uma definição de prompt que não está vinculada a um ativo implantado. O modelo contém informações de referência para conectar-se a um modelo externo. Os modelos de prompt independentes são utilizados para avaliar modelos externos ou não IBM es e destinam-se a fins de avaliação e teste, e não para alimentar uma aplicação em produção.

Os modelos de prompt independentes são avaliados sem qualquer dependência de um ` watsonx.ai `. Você pode avaliar modelos de prompt independentes sem precisar criar implantações para eles.

Observação: se você já possui implantações para modelos de prompt independentes, pode continuar a utilizá-los — não há impacto sobre os seus modelos de prompt independentes existentes que são avaliados por meio de implantações.

Ao avaliar modelos de prompt independentes em espaços de implantação, você pode avaliar a eficácia com que seu modelo externo gera respostas para os seguintes tipos de tarefas:

  • Resumo de textos
  • Classificação de texto
  • Resposta à pergunta
  • Extração de entidade
  • Geração de conteúdo
  • Geração aumentada de recuperação (RAG)

Antes de iniciar

Permissões necessárias: É necessário ter as funções de Administrador ou Editor para avaliar modelos de prompt independentes em um espaço de implantação.

Criar um modelo de prompt independente

Para avaliar um modelo de prompt para um modelo externo, você deve primeiro criar um modelo de prompt independente para conectar seu modelo externo ao watsonx.governance

Você pode criar modelos de prompt independentes em um espaço de implantação diretamente pela interface do usuário ou por meio da API. Antes de avaliar modelos de prompt independentes no Spaces, é necessário fornecer detalhes de conexão, como o nome do seu modelo externo e sua URL, ao criar o modelo de prompt independente.

Criar um modelo de prompt desanexado na interface do usuário

Você pode criar um modelo de prompt independente diretamente a partir da interface do usuário. Os modelos de prompt desvinculados permitem que você avalie os prompts independentemente dos ativos de implementação.

Procedimento:

  1. No seu painel de implantação, clique na guia “Ativos” e selecione “Novo ativo” > “Preparar um ativo de IA externo para governança ”.

  2. Insira os detalhes do modelo de prompt independente.

    Campos obrigatórios:

    • Nome: Digite um nome para o modelo de prompt independente.
    • Modelo de prompt URL : O endereço URL para o prompt, caso seja compatível com o provedor.
    • Modelo de base URL : Link para a documentação do modelo ou recursos adicionais.
    • Nome do modelo de base: Nome do modelo de base
    • ID do modelo de base: O identificador exclusivo do modelo provisionado, geralmente no formato ARN ou equivalente.
    • Tipo de tarefa: Selecione o tipo de tarefa que o modelo de prompt executa.
  3. Opcional: Digite o prompt.

    Na seção " Prompt ", insira o prompt base que você deseja usar para a avaliação. Esse prompt define a instrução ou pergunta que será processada pelo modelo de linguagem grande.

  4. Selecione um método de decodificação:

    • Ganancioso: Gera o próximo token mais provável em cada etapa.
    • Amostragem: Introduz a aleatoriedade no processo de geração.
  5. Definir variáveis de prompt (opcional para a criação, obrigatório para a avaliação)

    Na seção Variáveis do prompt, defina as variáveis utilizadas no prompt. As variáveis são pares de valores-chave que são injetados no prompt durante a avaliação. Essas variáveis não são necessárias quando você cria o modelo, mas pelo menos uma variável deve ser fornecida para avaliar o modelo.

  6. Revise e crie o modelo de prompt independente. Verifique se todos os campos obrigatórios estão preenchidos e, em seguida, clique em Criar para salvar o modelo de prompt independente.

Criar um modelo de prompt desanexado com a API

O exemplo a seguir mostra como criar um modelo de prompt independente usando a API:

{
    "name": "prompt name",
    "description": "prompt description",
    "model_version": {
        "number": "2.0.0.7",
        "tag": "my prompt tag",
        "description": "my description"
    },
    "prompt_variables": {
        "var1": {},
        "var2": {}
    },
    "task_ids": [
        "retrieval_augmented_generation"
    ],
    "input_mode": "detached",
    "prompt": {
        "model_id": "",
        "input": [
            [
                "Some input",
                ""
            ]
        ],
        "data": {},
        "external_information": {
            "external_prompt_id": "external prompt",
            "external_model_id": "external model",
            "external_model_provider": "external provider",
            "external_prompt": {
                "url": "https://company.com?asd=a&32=1",
                "additional_information": [
                    {
                        "additional_key": "additional settings"
                    }
                ]
            },
            "external_model": {
                "name": "An external model",
                "url": "https://company.com?asd=a&32=1"
            }
        }
    }
}

Se você rastrear o modelo de prompt separado em um caso de uso de IA, a implementação separada será incluída no caso de uso.

Avaliando implementações desconectadas em espaços de pré-produção

Executar avaliação

Para executar avaliações de modelos de prompt, clique na guia "Ativos" no espaço de implantação. Clique no menu para abrir um modelo de prompt independente e, em seguida, clique em Avaliar.

Você só poderá executar avaliações se tiver as funções de Administrador ou Editor atribuídas ao seu espaço de implantação.

Selecionar dimensões

O assistente Modelo de prompt de avaliação exibe as dimensões que estão disponíveis para avaliar para o tipo de tarefa que está associado ao seu prompt É possível expandir as dimensões para visualizar a lista de métricas que são usadas para avaliar as dimensões selecionadas.

Selecionar dimensões de llm externas para avaliar

Watsonx.governance configura automaticamente as avaliações para cada dimensão com configurações padrão. Para configurar avaliações com configurações diferentes, é possível selecionar Configurações avançadas para configurar tamanhos mínimos de amostra e valores de limite para cada métrica, conforme mostrado no exemplo a seguir:

Configurar avaliações de llm externas

Selecionar dados de teste

Você deve enviar um arquivo ` CSV ` que contenha dados de teste com colunas de referência que incluam a entrada e a saída esperada do modelo. Os dados de teste que você enviar devem conter a saída do modelo em uma coluna chamada generated_text para permitir avaliações de implantação independentes.

Quando o upload for concluído, você também deverá mapear as variáveis de prompt para as colunas correspondentes dos seus dados de teste. Selecione dados de teste de LLM externos para fazer upload

Revisar e avaliar

É possível revisar as seleções para o tipo de tarefa de prompt, os dados de teste transferidos por upload e o tipo de avaliação executado. Deve-se selecionar Avaliar para executar a avaliação

Revisar e avaliar configurações de avaliação do modelo de prompt desconectado

Revisando resultados da avaliação

Quando sua avaliação for concluída, será possível revisar um resumo de seus resultados de avaliação na guia Avaliações em watsonx.governance para obter insights sobre o desempenho do modelo. O resumo fornece uma visão geral de pontuações de métrica e violações de limite de pontuação padrão para suas avaliações de modelo de prompt...

Para analisar os resultados, você pode clicar na seta seta de navegação ao lado da avaliação do seu modelo de prompt para visualizar os dados dos resultados ao longo do tempo. Também é possível analisar os resultados da avaliação de funcionamento do modelo que é executada por padrão durante as avaliações de modelo de prompt para entender com que eficiência seu modelo processa seus dados

O menu Ações também fornece as opções a seguir para ajudar a analisar seus resultados:

  • Avaliar agora: execute a avaliação com um conjunto de dados de teste diferente
  • Todas as avaliações: exiba um histórico de suas avaliações para entender como seus resultados mudam com o tempo.
  • Configurar monitores: configure limites de avaliação e tamanhos de amostra.
  • Visualizar informações de modelo: visualize detalhes sobre seu modelo para entender como seu ambiente de implementação está configurado...

Analisar resultados da avaliação do modelo de prompt desconectado

Avaliando implementações desconectadas em espaços de produção

Ativar avaliação

Para executar avaliações de modelos de prompt, clique na guia "Ativos" no espaço de implantação. Clique no menu para abrir um modelo de prompt independente e, em seguida, clique em Avaliar.

Você só poderá executar avaliações se tiver as funções de Administrador ou Editor atribuídas ao seu espaço de implantação.

Executar avaliação do modelo de prompt desconectado

Se você não tiver uma instância do watsonx.governance associada ao seu espaço de implantação, será solicitado que você selecione uma. Na caixa de diálogo “Associar uma instância de serviço ”, clique em “Associar uma instância de serviço ”. Na janela “Associar instância para avaliação ”, escolha a instância do “ watsonx.governance ” que você deseja usar e selecione “Associar uma instância de serviço” para associar uma instância ao seu espaço de implantação. Deve-se estar designado à função Admin para o seu espaço de implementação para associar instâncias

Associar a instância watsonx.governance

Se você não tiver um banco de dados associado à sua instância watsonx.governance , também deverá associar um banco de dados antes de poder executar avaliações. Para associar um banco de dados, você também deve clicar em Associar banco de dados na caixa de diálogo Banco de dados necessário para se conectar a um banco de dados. Deve-se ter designado a função Administrador para o seu espaço de implementação e a instância watsonx.governance para associar bancos de dados

Selecionar dimensões

O assistente Modelo de prompt de avaliação exibe as dimensões que estão disponíveis para avaliar para o tipo de tarefa que está associado ao seu prompt É possível fornecer um nome de coluna de rótulo para a saída de referência especificada em seus dados de feedback. Também é possível expandir as dimensões para visualizar a lista de métricas que são usadas para avaliar as dimensões selecionadas.

Selecionar dimensões a serem avaliadas

Watsonx.governance configura automaticamente as avaliações para cada dimensão com configurações padrão. Para configurar avaliações com configurações diferentes, é possível selecionar Configurações avançadas para configurar tamanhos mínimos de amostra e valores de limite para cada métrica, conforme mostrado no exemplo a seguir:

Configurar avaliações

Revisar e avaliar

É possível revisar as seleções para o tipo de tarefa de prompt e o tipo de avaliação executado. Também é possível selecionar Visualizar esquema de carga útil ou Visualizar esquema de feedback para validar que seus nomes de colunas correspondem aos nomes de variável de prompt no modelo de prompt. Deve-se selecionar Ativar para executar a avaliação

Revisar e avaliar seleções

Para gerar resultados de avaliação, selecione Avaliar agora no menu Ações para abrir a janela Importação de dados de teste quando a página de resumo de avaliação for exibida

Selecione avaliar agora

Importar dados de teste

Na janela “Importar dados de teste ”, você pode selecionar “Carregar dados de carga útil” ou “Carregar dados de feedback” para carregar um arquivo ` CSV ` que contenha colunas identificadas que correspondam às colunas dos esquemas de carga útil e de feedback.

Importar dados de teste

Revisando resultados da avaliação

Quando sua avaliação for concluída, será possível revisar um resumo de seus resultados de avaliação na guia Avaliações em watsonx.governance para obter insights sobre o desempenho do modelo. O resumo fornece uma visão geral de pontuações de métrica e violações de limite de pontuação padrão para suas avaliações de modelo de prompt...

Para analisar os resultados, você pode clicar na seta seta de navegação ao lado da avaliação do seu modelo de prompt para visualizar os dados dos seus resultados ao longo do tempo. Também é possível analisar os resultados da avaliação de funcionamento do modelo que é executada por padrão durante as avaliações de modelo de prompt para entender com que eficiência seu modelo processa seus dados

O menu Ações também fornece as opções a seguir para ajudar a analisar seus resultados:

  • Avaliar agora: execute a avaliação com um conjunto de dados de teste diferente
  • Configurar monitores: configure limites de avaliação e tamanhos de amostra.
  • Visualizar informações de modelo: visualize detalhes sobre seu modelo para entender como seu ambiente de implementação está configurado...

Analisar resultados da avaliação do modelo de prompt desconectado

Se você estiver acompanhando a implantação destacada em um caso de uso de IA, os detalhes sobre o modelo e os resultados da avaliação serão registrados em uma planilha que poderá ser visualizada.