Tokens e tokenização
Um token é uma coleção de caracteres com significado semântico para um modelo. A tokenização é o processo de conversão das palavras em seu prompt em tokens.
Convertendo palavras em tokens e voltando novamente
O texto do prompt é convertido em tokens antes que o prompt seja processado por modelos de base
A correlação entre palavras e tokens é complexa:
- Às vezes uma única palavra é dividida em vários tokens
- A mesma palavra pode ser dividida em um número diferente de tokens, dependendo do contexto (como: onde a palavra aparece ou em torno de palavras)
- Espaços, caracteres de nova linha e pontuação às vezes são incluídos em tokens e às vezes não
- A maneira como as palavras são divididas em tokens varia de idioma para idioma
- A maneira como as palavras são divididas em tokens varia de modelo para modelo
Para uma ideia aproximada, uma frase que tem 10 palavras pode ter de 15 a 20 tokens. "
A saída bruta de um modelo também está na forma de tokens. No Prompt Lab do IBM watsonx.ai, os tokens de saída do modelo são convertidos em palavras a serem exibidas no editor de prompts.
Exemplo
A imagem a seguir mostra como essa entrada de amostra pode ser convertida em token:
Os tomates são uma das plantas mais populares para hortas. Dica para o sucesso: Se você selecionar variedades que são resistentes a doenças e pragas, cultivar tomates pode ser bastante fácil. Para jardineiros experientes que procuram um desafio, há uma herança infinita e variedades especiais para cultivar. As plantas de tomate vêm em uma gama de tamanhos.

Observe alguns pontos interessantes:
- Algumas palavras são divididas em vários tokens e algumas não são
- A palavra "Tomatoes" é dividida em vários tokens no início, mas mais tarde "tomatoes" é tudo um token
- Os espaços são, por vezes, incluídos no início de um token de palavra e, por vezes, os espaços são um token por si só
- Marcas de pontuação são tokens
Limites do token
Cada modelo possui um limite superior para o número de tokens no prompt de entrada mais o número de tokens na saída gerada do modelo. Esse limite às vezes é chamado de comprimento da janela de contexto, janela de contexto, comprimento do contextoou comprimento máximo da sequência No Prompt Lab, uma mensagem informativa mostra quantos tokens são usados em um envio de prompt e a saída gerada resultante.
No Prompt Lab, você usa o parâmetro Max tokens para especificar um limite superior para o número de tokens de saída a serem gerados pelo modelo. O número máximo de tokens permitidos na saída difere por modelo. Para obter mais informações, consulte as informações de Máximo de tokens em Modelos de base suportados
Saiba mais
- É possível usar a API watsonx.ai para verificar quantos tokens serão calculados para seu prompt por um modelo base antes de enviá-lo. Para obter mais informações, consulte Tokenização de texto.