Propriedades e parâmetros para modelos de fundação customizados
É possível configurar e ajustar os parâmetros de seu modelo de base customizado para definir seu comportamento
Parâmetros globais para modelos de fundação customizados
É possível usar parâmetros globais para implementar seus modelos de base customizados.. Você deve configurar o valor do parâmetro do modelo base dentro do intervalo especificado na tabela a seguir. Se você não fizer isso, sua implementação poderá falhar e a inferência não será possível.. Se os valores padrão para seus parâmetros de modelo resultarem em um erro, entre em contato com o administrador para modificar o registro do modelo no CR watsonxaiifm.
Parâmetros aplicáveis a todos os modelos
É possível usar os seguintes parâmetros globais dentro do intervalo especificado de valores para implementar seus modelos de base customizados:
| Parâmetro | Tipo | Intervalo de valores | Valor Padrão | Descrição |
|---|---|---|---|---|
Número máximo de sequências(max_num_seqs) |
Número | max_num_seqs >= 1 |
16 | Especifica o número máximo de sequências (solicitações) que são processadas em paralelo durante a inferência. Valores mais altos aumentam a taxa de transferência, mas exigem mais memória de cache KV. |
Comprimento máximo do modelo(max_model_length) |
Número | max_model_length >= 20; max_model_length <= model_context_length x max_num_seqs <= memória disponível do cache KV |
2048 | Especifica o número total máximo de tokens (entrada + saída) por sequência. Deve estar dentro do comprimento do contexto do modelo e ser escolhido com base no valor de max_num_seqs. Esses dois parâmetros afetam o uso da memória cache KV. |
Funções(functions) |
Sequência | N/D | Se o functions campo não for especificado, o modelo assume como padrão a geração de texto e o chat por texto (se houver um modelo de chat disponível): - Se o modelo não incluir um modelo de chat, a tarefa padrão é a geração de texto. - Se o modelo incluir um modelo de chat, as tarefas padrão são: geração de texto e chat por texto. |
Especifique as funções de um modelo. Por exemplo: image_chat, audio_chat, embedding, ou rerank. Primeiro, você deve verificar as funções disponíveis na ficha do modelo. |
Os valores dos parâmetros “Max Concurrent Requests (max_concurrent_requests)” e “Max Batch size (max_batch_size)” são utilizados apenas em modelos que foram implantados em uma versão anterior e utilizam a watsonx-cfm-caikit-1.0 especificação de software. Esta especificação de software não está disponível para novas implantações.
Para obter descrições de parâmetros detalhadas, consulte Propriedades para parâmetros globais para modelos de base customizados.
Propriedades para parâmetros globais para modelos de base customizados
É possível usar as seguintes propriedades para os parâmetros globais para modelos de base customizados:
| Propriedade | Tipo | Requerido ou Opcional | Descrição |
|---|---|---|---|
name |
Sequência | Obrigatório | Use esta propriedade para especificar o nome do parâmetro |
default |
Sequência, número, booleano | Obrigatório | Use essa propriedade para especificar o valor padrão do parâmetro.. |
min |
Número | Opcional | Use esta propriedade para especificar o valor mínimo do parâmetro. O valor min deve ser menor ou igual ao valor inserido. |
max |
Número | Opcional | Use esta propriedade para especificar o valor máximo do parâmetro.. O valor max deve ser maior ou igual ao valor inserido. |
options |
Sequência, número | Opcional | Use esta propriedade para especificar uma lista de opções para escolher para o parâmetro. O valor de tipo de opções deve ser igual ao valor de parâmetro. O valor selecionado deve estar na lista options . |
- Se o administrador do sistema definir parâmetros padrão do modelo na fase de registro do modelo, você poderá substituí-los na fase de criação e durante uma atualização.
- Se o administrador do sistema não definir os parâmetros padrão durante a fase de registro do modelo, o ` watsonx ` definirá os parâmetros padrão na fase de criação. É possível então substituí-los durante uma atualização.
- Os modelos de séries temporais não aceitam parâmetros. Não forneça nenhum parâmetro ao implantar um modelo de série temporal personalizado. Se você fornecer parâmetros ao implementar um modelo de série temporal personalizado, eles não terão efeito.
- Os modelos que utilizam imagens de tempo de execução de inferência personalizadas ignoram os parâmetros definidos na fase de criação da implantação. Um engenheiro de MLOps deve definir parâmetros ao criar uma definição de tempo de execução ou durante o registro do modelo. Além disso, a lista de parâmetros aceitos pode ser diferente da lista de parâmetros utilizados pelos modelos que empregam ambientes de execução de inferência padrão.
Para garantir um menor consumo de tokens e maior velocidade de inferência em cenários de inferência repetida, os modelos que utilizam o mecanismo de execução do vLLM têm o armazenamento em cache de prefixos configurado true por padrão. Se o seu caso de uso for diferente ou se você estiver enfrentando problemas como alto uso de cache e erros de OOM (falta de memória), adicione o enable_prefix_caching parâmetro aos parâmetros do seu modelo e defina seu valor como false.
Parâmetros que se aplicam apenas a modelos que possuem uma API de chat
Esses parâmetros opcionais se aplicam apenas a modelos que possuem uma API de chat e utilizam o mecanismo de execução do vLLM.
Além disso, esses parâmetros só podem ser usados quando você estiver implantando um modelo ou atualizando um modelo já implantado por meio de programação:
| Parâmetro | Tipo | Intervalo de valores | Valor Padrão | Descrição |
|---|---|---|---|---|
| Analisador de ferramentas name ( tool_call_parser) |
Sequência | Nome do analisador da ferramenta que corresponde ao modelo | N/D | Permite a seleção automática a partir de uma lista de ferramentas fornecidas pelo usuário na fase de inferência. Você pode encontrar a lista de analisadores disponíveis na documentação do vLLM |
| Arquivo de modelo de chat( chat_template) |
Sequência | Nome do arquivo de modelo | N/D | Substitui o modelo padrão de bate-papo fornecido com o modelo. Para obter mais informações, consulte a seção “Configurando o armazenamento e enviando o modelo”. |
Próximas etapas
Criando uma implementação para um modelo de base customizado