Ajuste fino de adaptação quantizada de baixa classificação

O ajuste fino da adaptação de baixa classificação quantizada ( QLoRA ) é uma variante do LoRA que incorpora a quantização para reduzir ainda mais o espaço de memória e os recursos computacionais necessários durante o ajuste.

Como funciona o QLoRA

O ajuste de parâmetros de base ( QLoRA ) é um método de ajuste fino eficiente em termos de parâmetros (PEFT) que permite aplicar o método de ajuste de parâmetros de base ( LoRA ) a modelos de base quantizados. Para obter mais informações sobre como funciona a adaptação de baixa classificação, consulte primeiro Ajuste fino da adaptação de baixa classificação.

A quantização do modelo de fundação é um método pelo qual os recursos necessários para armazenar um modelo de fundação são reduzidos pela conversão do tipo de dados dos pesos do modelo em um tipo de dados menos preciso. Em seguida, os pesos são retornados à sua precisão original para a inferência.

Os modelos que suportam a quantização também podem ser quantizados durante o processo de ajuste. Por exemplo, os pesos dos parâmetros de um modelo de fundação que usa um formato flutuante de 16 bits são convertidos em um formato inteiro de 4 bits quando os pesos são armazenados e ajustados durante um experimento de ajuste. Os pesos dos parâmetros do modelo ajustado são então retornados ao seu tipo de dados original para inferência.

Você pode usar o método de ajuste QLoRA em watsonx.ai para fazer o ajuste fino apenas dos modelos de fundação quantizados.

Saiba mais