
Definição numa frase
Reducción de la precisión numérica de pesos o activaciones para usar menos memoria y acelerar la inferencia.
Definição: representar números com menos níveis
A quantização em IA é o processo de representar valores numéricos usando um conjunto mais reduzido de níveis do que o empregado na representação original. Em uma rede neural, esses valores podem ser pesos, ativações intermediárias ou elementos do cache de chaves e valores (KV) de um modelo de linguagem. A redução do número de níveis pode diminuir a quantidade de memória necessária e, se o software e o hardware executarem as operações adequadas, também pode reduzir o custo ou o tempo de cálculo.
A definição descreve uma transformação numérica; por si só, ela não garante que um modelo ocupe uma fração exata do tamanho original, seja executado mais rapidamente ou mantenha a qualidade intacta. O resultado depende dos componentes quantizados, da forma como são codificados e da implementação que os utiliza. Por isso, dizer que um modelo é “de 4 bits” traz informação incompleta, não uma previsão de desempenho.
Nesta ficha, distinguimos duas perguntas: quais valores são transformados e como são atribuídos aos níveis disponíveis. A primeira determina o alcance da quantização; a segunda, sua representação e o possível erro. Para ampliar o vocabulário relacionado, consulte as entradas do glossário sobre quantização, inferência, modelos locais e LoRA, além da seção de comparação.
Como funciona o mapeamento
Em uma quantização linear, uma escala relaciona os níveis inteiros aos valores do domínio original. Muitos esquemas também usam um ponto zero, que indica qual código inteiro representa o zero real; isso pode ser relevante, por exemplo, quando os valores não estão distribuídos simetricamente em torno de zero. O processo costuma incluir arredondamento e, se um valor ficar fora do intervalo representável, o recorte para o nível extremo disponível. Na reconstrução do valor, a escala e o ponto zero permitem voltar a uma aproximação no domínio original.
Não existe uma única convenção para todos os métodos. Alguns formatos usam escalas e pontos zero; outros empregam códigos ou níveis não uniformes. Portanto, escala, ponto zero e código de quantização são conceitos relacionados, mas não intercambiáveis: descrevem partes diferentes da representação. Também pode variar a forma como os parâmetros e os intervalos são escolhidos, bem como os grupos de valores aos quais se aplicam.
Elementos que descrevem uma quantização
Estes termos identificam decisões diferentes dentro de um esquema de quantização.
| Elemento | O que descreve | Por que importa |
|---|---|---|
| Número de bits | Quantos bits codificam cada valor em uma parte específica do modelo. | Limita os códigos disponíveis, mas não resume todos os custos de armazenamento. |
| Escala | A relação entre os códigos e os valores reais. | Afeta a resolução e o erro de reconstrução. |
| Ponto zero | O código que representa o zero real em certos esquemas lineares. | Pode permitir a representação de intervalos não simétricos. |
| Granularidade | Se os parâmetros são compartilhados por tensor, canal ou bloco. | Altera a adaptação da representação e a quantidade de metadados. |
| Calibração | O procedimento e os dados usados para estimar parâmetros ou intervalos. | O resultado pode depender da representatividade desses dados. |
O que o número de bits significa — e o que não significa
Com b bits, é possível codificar no máximo 2 elevado a b padrões distintos. Em um esquema de 4 bits, portanto, há até 16 códigos possíveis por valor. Mas o número de códigos não determina, por si só, quais valores eles representam, qual precisão efetiva será obtida nem quanto o modelo completo ocupará. A distribuição dos níveis e o uso de metadados, como escalas e pontos zero, também contam.
O armazenamento real pode incluir informações auxiliares e estruturas de empacotamento, além dos valores quantizados. Ao mesmo tempo, um modelo em execução precisa de memória para elementos que podem não estar quantizados da mesma forma, como ativações, cache KV, buffers do programa ou outros componentes do runtime. A proporção do modelo que permanece em maior precisão também altera o total.
A velocidade também não pode ser deduzida apenas dos bits. Para obter aceleração, o hardware, os kernels e o runtime precisam oferecer suporte eficiente à representação e às operações pertinentes. Em alguns ambientes, a conversão ou o acesso aos dados pode acrescentar custos; em outros, a menor quantidade de dados pode ser vantajosa. A comparação útil é empírica e deve ser feita na implementação de interesse.
Quais partes de um modelo podem ser quantizadas
A quantização de pesos transforma os parâmetros aprendidos pela rede. É uma opção comum para reduzir o armazenamento de modelos carregados para inferência. Isso não equivale a quantizar o modelo inteiro: as ativações que surgem durante o cálculo podem continuar em outra precisão.
A quantização de ativações representa com menos níveis os valores intermediários que circulam pela rede. Ela pode ser combinada com a quantização de pesos, mas isso não é obrigatório. Por exemplo, o SmoothQuant estuda a quantização pós-treinamento de pesos e ativações em LLMs; seus resultados correspondem ao método e às avaliações publicados, não são uma garantia para qualquer modelo ou dispositivo.
Em modelos de linguagem com geração, o cache KV armazena informações intermediárias associadas aos tokens já processados. Quantizar esse cache é diferente de quantizar os pesos: a transformação afeta outro componente da memória e pode ter outros efeitos sobre a inferência. O trabalho KVQuant trata especificamente da quantização do cache KV, o que ajuda a entender por que é importante nomear com precisão o que foi transformado.
Uma descrição reproduzível de uma configuração deve evitar expressões como “modelo quantizado” sem especificar o que foi quantizado. Convém distinguir, no mínimo, pesos, ativações e cache KV, além de indicar se as partes não mencionadas mantêm uma precisão maior.
Componentes e perguntas práticas
A tabela ajuda a especificar o alcance de uma configuração; não implica que todos os métodos quantizem as três partes.
| Componente | O que é representado com menos níveis | Pergunta ao avaliar |
|---|---|---|
| Pesos | Parâmetros aprendidos. | Quanta memória os pesos ocupam e que precisão mantêm? |
| Ativações | Valores intermediários produzidos durante o cálculo. | Quais operações e camadas participam, e qual é o impacto na tarefa? |
| Cache KV | Estado armazenado para a geração de sequências. | Como mudam o uso de memória e o comportamento no contexto avaliado? |
Quando a quantização acontece: PTQ e QAT
A quantização pós-treinamento, conhecida pela sigla PTQ, é aplicada depois que o modelo foi treinado. Dependendo do método, pode usar dados de calibração para estimar intervalos ou outros parâmetros de quantização. Esses dados não servem necessariamente para retreinar todos os pesos: ajudam a configurar o mapeamento. Assim, a escolha e a representatividade dos dados de calibração podem influenciar o resultado.
A quantização consciente do treinamento, ou QAT, incorpora durante o treinamento uma simulação ou consideração dos efeitos da quantização, permitindo que o modelo se adapte a eles. O trabalho de Jacob e colaboradores apresenta um método de quantização e treinamento voltado à inferência com aritmética inteira. PTQ e QAT diferem no momento e no procedimento; não há base para afirmar que uma opção seja sempre superior. Isso depende da rede, do objetivo e do processo disponível.
A granularidade também importa. Um esquema pode compartilhar parâmetros de quantização por todo um tensor, usar parâmetros por canal ou agrupar valores em blocos. Uma granularidade mais localizada pode representar melhor as diferenças na distribuição dos valores, mas também tem custos e requisitos próprios. Não se deve presumir que duas configurações com o mesmo número nominal de bits, mas granularidades diferentes, sejam equivalentes.
Como interpretar uma configuração quantizada
Antes de comparar dois resultados, identifique os componentes e as condições descritos. Se faltar um dado importante, registre-o como uma incerteza em vez de inferi-lo a partir do número de bits.
- 01Indique se o método é PTQ ou QAT e, quando pertinente, quais dados de calibração foram usados.
- 02Especifique se foram quantizados pesos, ativações, cache KV ou outra parte, e quais elementos ficaram de fora.
- 03Registre bits, tipo de representação, granularidade e metadados relevantes.
- 04Separe a memória dos pesos da memória total durante a execução.
- 05Meça a qualidade e o desempenho na tarefa, no hardware e no runtime em que o modelo será usado.
Três exemplos aplicados
Os exemplos a seguir mostram usos diferentes da quantização; não são recomendações de formatos nem promessas de resultados. Em cada caso, o efeito deve ser verificado com o modelo, a implementação e as condições reais de uso.
O objetivo é destacar que a quantização pode atuar sobre componentes diferentes e participar de etapas distintas do ciclo de vida do modelo. Para tirar conclusões úteis, é preciso avaliar a configuração concreta, em vez de extrapolar a partir do nome de um método ou de uma quantidade de bits.
Conceitos próximos que não devem ser confundidos
A poda remove ou reduz conexões, pesos ou estruturas para obter uma rede mais esparsa ou compacta; a quantização, por sua vez, altera a representação numérica dos valores que são mantidos. Alguns métodos combinam as duas ideias, mas elas não são o mesmo procedimento.
A destilação transfere o comportamento de um modelo professor para outro modelo aluno por meio de um processo de treinamento. Ela pode produzir um modelo menor, mas seu mecanismo não é o mapeamento de valores para menos níveis. Uma rede destilada também pode ser quantizada depois: são decisões compatíveis, mas distintas.
LoRA é uma técnica de ajuste fino que adiciona adaptadores de baixo posto para modificar o comportamento do modelo. QLoRA combina o ajuste dos adaptadores com uma base quantizada. Assim, LoRA não é um formato de quantização, e QLoRA não designa qualquer modelo de baixa precisão.
INT4 costuma se referir a uma representação inteira de quatro bits, enquanto NF4 é um tipo de dado de quatro bits proposto no trabalho do QLoRA para representar valores de pesos. Não são nomes intercambiáveis: descrevem representações diferentes. Além disso, a largura nominal dos dados não informa, por si só, a implementação, o empacotamento nem o custo total.
Por fim, reduzir a precisão não é o mesmo que passar de uma precisão de ponto flutuante para outra sem alterar a finalidade do formato. Formatos de precisão reduzida podem ter intervalos e propriedades diferentes; “menor precisão” é uma descrição ampla, enquanto “quantização” se refere a um processo de mapeamento que precisa ser especificado.
Diferenças em uma frase
Estas categorias podem ser combinadas em um fluxo de trabalho, mas descrevem operações distintas.
| Termo | Operação principal |
|---|---|
| Quantização | Representar valores usando menos níveis. |
| Poda | Remover ou reduzir partes da rede. |
| Destilação | Treinar um modelo aluno com sinais de um professor. |
| LoRA | Ajustar um modelo por meio de adaptadores de baixo posto. |
| QAT | Treinar levando em conta os efeitos da quantização. |
Limites, erros comuns e critérios práticos
O erro de quantização surge porque um valor original pode não ter um nível representável idêntico. A magnitude e a distribuição desses erros podem afetar a saída da rede, e as diferentes camadas ou tarefas não são necessariamente afetadas da mesma maneira. Uma avaliação pertinente deve observar o comportamento importante para a aplicação, e não apenas uma métrica genérica ou o rótulo do formato.
Um erro comum é supor que menos bits garantem uma redução proporcional da memória. Metadados, empacotamento, partes que permanecem em maior precisão e a memória de execução alteram o total. Outro erro é concluir que menos bits sempre aceleram a inferência: se o runtime ou os kernels não aproveitarem a representação no hardware disponível, a latência pode não melhorar ou até ser afetada por custos adicionais.
Também é importante não tratar a calibração como um detalhe irrelevante. Se um método depende de dados representativos para estimar parâmetros, uma calibração pouco parecida com as entradas reais pode não refletir adequadamente o uso previsto. A sensibilidade do modelo, a distribuição das entradas, o tamanho do contexto e a tarefa podem alterar o resultado. Os artigos sobre GPTQ, AWQ, SmoothQuant e KVQuant avaliam métodos e configurações específicos; os números publicados não devem ser extrapolados sem medição.
Ao documentar uma configuração, recomenda-se registrar o método, quais componentes são quantizados, a precisão e a granularidade, os dados de calibração quando pertinentes, a memória observada, as métricas de qualidade, o hardware, o runtime e as condições de teste. Assim, é possível comparar resultados sem transformar um rótulo como “4 bits” em uma afirmação geral sobre qualidade ou velocidade.
Critérios práticos antes de comparar
Uma comparação útil mantém constantes as condições pertinentes e explicita os dados que podem mudar a interpretação.
- 01Defina qual problema o modelo deve resolver e quais entradas deverá receber.
- 02Especifique quais componentes são quantizados e quais mantêm outra precisão.
- 03Registre o método, os bits, a granularidade, o esquema de calibração e o formato.
- 04Meça separadamente a memória dos pesos e o pico de memória durante a execução.
- 05Avalie qualidade, latência e desempenho com o hardware e o runtime de destino.
- 06Informe limitações e dados ausentes; não apresente um teste como garantia universal.
Para continuar
A quantização é uma ferramenta de representação, não uma categoria que, sozinha, descreva o comportamento completo de um sistema. Para interpretar uma ficha técnica ou uma avaliação, comece identificando o que foi quantizado, como os valores são codificados e em que ambiente os resultados foram medidos.
Como percurso conceitual, consulte o índice do glossário e as entradas relacionadas a inferência, modelo local, LoRA, destilação e avaliação. A seção de comparação ajuda a organizar diferenças entre métodos quando houver condições comparáveis; esta ficha não propõe um formato universal nem substitui uma avaliação aplicada.