
Definición en una frase
Reducción de la precisión numérica de pesos o activaciones para usar menos memoria y acelerar la inferencia.
Definición: representar números con menos niveles
La cuantización en IA es el proceso de representar valores numéricos mediante un conjunto más reducido de niveles que el usado por la representación original. En una red neuronal, esos valores pueden ser pesos, activaciones intermedias o elementos de la caché de claves y valores (KV) de un modelo de lenguaje. La reducción de niveles puede disminuir la cantidad de memoria necesaria y, si el software y el hardware ejecutan operaciones adecuadas, también reducir el coste o el tiempo de cálculo.
La definición describe una transformación numérica; no garantiza por sí misma que un modelo ocupe una fracción exacta de su tamaño original, que se ejecute más rápido o que mantenga intacta su calidad. El resultado depende de qué componentes se cuantizan, de cómo se codifican y de la implementación que los usa. Por eso, decir que un modelo es «de 4 bits» es información incompleta, no una predicción de rendimiento.
En esta ficha se distinguen dos preguntas: qué valores se transforman y cómo se asignan a los niveles disponibles. La primera determina el alcance de la cuantización; la segunda, su representación y posible error. Para ampliar el vocabulario relacionado, véanse las entradas de glosario sobre cuantización, inferencia, modelos locales y LoRA, además de la sección de comparación.
Cómo funciona el mapeo
En una cuantización lineal, una escala relaciona los niveles enteros con los valores del dominio original. En muchos esquemas se usa también un punto cero, que indica qué código entero representa el cero real; puede ser relevante, por ejemplo, cuando los valores no están distribuidos simétricamente alrededor de cero. El proceso suele incluir redondeo y, si un valor queda fuera del intervalo representable, recorte al nivel extremo disponible. Al reconstruir el valor, la escala y el punto cero permiten volver a una aproximación en el dominio original.
No hay una única convención para todos los métodos. Algunos formatos usan escalas y puntos cero; otros emplean códigos o niveles no uniformes. Por ello, escala, cero y código de cuantización son conceptos relacionados, pero no intercambiables: describen partes distintas de la representación. También puede cambiar el modo en que se eligen los parámetros, los intervalos y los grupos de valores.
Elementos que describen una cuantización
Estos términos identifican decisiones diferentes dentro de un esquema de cuantización.
| Elemento | Qué describe | Por qué importa |
|---|---|---|
| Número de bits | Cuántos bits codifican cada valor en una parte determinada del modelo. | Limita los códigos disponibles, pero no resume todos los costes de almacenamiento. |
| Escala | La relación entre los códigos y los valores reales. | Afecta a la resolución y al error de reconstrucción. |
| Punto cero | El código que representa el cero real en ciertos esquemas lineales. | Puede permitir representar rangos no simétricos. |
| Granularidad | Si los parámetros se comparten por tensor, canal o bloque. | Cambia la adaptación de la representación y la cantidad de metadatos. |
| Calibración | El procedimiento y los datos usados para estimar parámetros o rangos. | El resultado puede depender de la representatividad de esos datos. |
Qué significa —y qué no significa— el número de bits
Con b bits se pueden codificar, como máximo, 2 elevado a b patrones distintos. En un esquema de 4 bits hay, por tanto, hasta 16 códigos posibles por valor. Pero el número de códigos no determina por sí solo qué valores representan, qué precisión efectiva se obtiene ni cuánto ocupa el modelo completo. La forma de distribuir los niveles y el uso de metadatos como escalas y puntos cero también cuentan.
El almacenamiento real puede incluir información auxiliar y estructuras de empaquetado, además de los valores cuantizados. A su vez, un modelo en ejecución necesita memoria para elementos que pueden no estar cuantizados del mismo modo, como activaciones, caché KV, buffers del programa u otros componentes del runtime. El porcentaje del modelo que permanece en mayor precisión también modifica el total.
La velocidad tampoco se deduce únicamente de los bits. Para obtener una aceleración, el hardware, los kernels y el runtime deben admitir eficientemente la representación y las operaciones pertinentes. En algunos entornos, la conversión o el acceso a datos puede añadir costes; en otros, la menor cantidad de datos puede ser ventajosa. La comparación útil es empírica y debe hacerse en la implementación de interés.
Qué partes de un modelo se pueden cuantizar
La cuantización de pesos transforma los parámetros aprendidos de la red. Es una opción habitual para reducir el almacenamiento de modelos que se cargan para inferencia. No equivale a cuantizar todo el modelo: las activaciones que aparecen durante el cálculo pueden seguir en otra precisión.
La cuantización de activaciones representa con menos niveles los valores intermedios que circulan por la red. Puede combinarse con pesos cuantizados, pero no es obligatorio hacerlo. Por ejemplo, SmoothQuant estudia cuantización posterior al entrenamiento de pesos y activaciones en LLM; sus resultados corresponden al método y a las evaluaciones publicadas, no a una garantía para cualquier modelo o dispositivo.
En los modelos de lenguaje con generación, la caché KV almacena información intermedia asociada a los tokens ya procesados. Cuantizar esa caché es distinto de cuantizar los pesos: afecta a otro componente de la memoria y puede tener otros efectos sobre la inferencia. El trabajo KVQuant se ocupa específicamente de la cuantización de la caché KV, lo que sirve para entender por qué conviene nombrar con precisión qué se transforma.
Una descripción reproducible de una configuración debería evitar expresiones como «modelo cuantizado» si no se indica qué se cuantizó. Conviene distinguir, como mínimo, pesos, activaciones y caché KV, y señalar si las partes no mencionadas conservan una precisión mayor.
Componentes y preguntas prácticas
La tabla ayuda a precisar el alcance de una configuración; no implica que todo método cuantice las tres partes.
| Componente | Qué se representa con menos niveles | Pregunta al evaluar |
|---|---|---|
| Pesos | Parámetros aprendidos. | ¿Cuánta memoria ocupan los pesos y qué precisión conservan? |
| Activaciones | Valores intermedios producidos durante el cálculo. | ¿Qué operaciones y capas participan, y qué impacto tiene en la tarea? |
| Caché KV | Estado almacenado para la generación de secuencias. | ¿Cómo cambia el uso de memoria y el comportamiento en el contexto evaluado? |
Cuándo se cuantiza: PTQ y QAT
La cuantización posterior al entrenamiento, conocida como PTQ por sus siglas en inglés, se aplica después de entrenar el modelo. Según el método, puede usar datos de calibración para estimar rangos u otros parámetros de cuantización. Esos datos no tienen necesariamente la función de volver a entrenar todos los pesos: ayudan a configurar el mapeo. Por tanto, la elección y representatividad de la calibración pueden influir en el resultado.
La cuantización consciente del entrenamiento, o QAT, incorpora durante el entrenamiento una simulación o consideración de los efectos de la cuantización, de modo que el modelo pueda adaptarse a ellos. El trabajo de Jacob y sus colaboradores presenta un método de cuantización y entrenamiento orientado a inferencia con aritmética entera. PTQ y QAT difieren en el momento y el procedimiento; no hay base para afirmar que una opción sea siempre superior: depende de la red, el objetivo y el proceso disponible.
La granularidad también importa. Un esquema puede compartir parámetros de cuantización en todo un tensor, usar parámetros por canal o agrupar valores en bloques. Una granularidad más localizada puede describir mejor diferencias en la distribución de valores, pero también tiene costes y requisitos propios. No se debe asumir que dos configuraciones con el mismo número nominal de bits, pero distinta granularidad, sean equivalentes.
Lectura de una configuración cuantizada
Antes de comparar dos resultados, identifica los componentes y condiciones descritos. Si falta un dato importante, anótalo como incertidumbre en lugar de inferirlo a partir del número de bits.
- 01Indicar si se trata de PTQ o QAT y, cuando corresponda, qué datos de calibración se usaron.
- 02Precisar si se cuantizaron pesos, activaciones, caché KV u otra parte, y qué elementos quedaron fuera.
- 03Registrar bits, tipo de representación, granularidad y metadatos relevantes.
- 04Separar memoria de pesos de memoria total durante la ejecución.
- 05Medir calidad y rendimiento en la tarea, el hardware y el runtime donde se utilizará el modelo.
Tres ejemplos aplicados
Los ejemplos siguientes muestran usos diferentes de la cuantización; no son recomendaciones de formatos ni promesas de resultados. En cada caso, el efecto debe verificarse con el modelo, la implementación y las condiciones reales de uso.
blocks
Conceptos próximos que no conviene confundir
La poda elimina o reduce conexiones, pesos o estructuras para obtener una red más dispersa o compacta; la cuantización, en cambio, cambia la representación numérica de valores que conserva. Hay métodos que combinan ambas ideas, pero no son el mismo procedimiento.
La destilación transfiere comportamiento de un modelo docente a otro modelo estudiante mediante un proceso de entrenamiento. Puede producir un modelo más pequeño, pero su mecanismo no es el mapeo de valores a menos niveles. Una red destilada también podría cuantizarse después: son decisiones compatibles, aunque distintas.
LoRA es una técnica de ajuste fino que añade adaptadores de bajo rango para modificar el comportamiento del modelo. QLoRA combina el ajuste de adaptadores con una base cuantizada. Así, LoRA no es un formato de cuantización y QLoRA no designa cualquier modelo de baja precisión.
INT4 suele aludir a una representación entera de cuatro bits, mientras que NF4 es un tipo de dato de cuatro bits propuesto en el trabajo de QLoRA para representar valores de pesos. No son nombres intercambiables: describen representaciones distintas. Además, el ancho nominal de los datos no informa por sí solo de la implementación, el empaquetado ni el coste total.
Por último, reducir precisión no es lo mismo que cambiar de una precisión flotante a otra sin alterar el propósito del formato. Los formatos de precisión reducida pueden tener rangos y propiedades diferentes; «menor precisión» es una descripción amplia, mientras que «cuantización» se refiere a un proceso de mapeo que debe especificarse.
Diferencias en una frase
Estas categorías pueden combinarse en un flujo de trabajo, pero describen operaciones distintas.
| Término | Operación principal |
|---|---|
| Cuantización | Representar valores mediante menos niveles. |
| Poda | Eliminar o reducir partes de la red. |
| Destilación | Entrenar un modelo estudiante con señales de un docente. |
| LoRA | Ajustar un modelo mediante adaptadores de bajo rango. |
| QAT | Entrenar teniendo en cuenta los efectos de la cuantización. |
Límites, errores frecuentes y criterios prácticos
El error de cuantización aparece porque un valor original puede no tener un nivel representable idéntico. La magnitud y distribución de esos errores pueden afectar a la salida de la red, y no necesariamente afectan por igual a todas las capas o tareas. Una evaluación pertinente debe observar el comportamiento que importa en la aplicación, no solo una métrica genérica o la etiqueta del formato.
Un error frecuente es suponer que menos bits garantizan una reducción proporcional de memoria. Los metadatos, el empaquetado, las partes que permanecen en mayor precisión y la memoria de ejecución alteran el total. Otro error es concluir que menos bits siempre aceleran la inferencia: si el runtime o los kernels no aprovechan la representación en el hardware disponible, la latencia puede no mejorar o incluso verse afectada por costes adicionales.
También conviene evitar tratar la calibración como un detalle irrelevante. Si un método depende de datos representativos para estimar parámetros, una calibración poco parecida a las entradas reales puede no reflejar adecuadamente el uso previsto. La sensibilidad del modelo, la distribución de entradas, la longitud de contexto y la tarea pueden cambiar el resultado. Los artículos sobre GPTQ, AWQ, SmoothQuant y KVQuant evalúan métodos y configuraciones concretos; sus cifras publicadas no deben extrapolarse sin medición.
Al documentar una configuración, se recomienda registrar el método, qué componentes se cuantizan, la precisión y granularidad, los datos de calibración si corresponden, la memoria observada, las métricas de calidad, el hardware, el runtime y las condiciones de prueba. Así se pueden comparar resultados sin convertir una etiqueta como «4 bits» en una afirmación general sobre calidad o velocidad.
Criterios prácticos antes de comparar
Una comparación útil mantiene constantes las condiciones pertinentes y explicita los datos que podrían cambiar la interpretación.
- 01Definir qué problema y qué entradas debe resolver el modelo.
- 02Especificar qué componentes se cuantizan y cuáles conservan otra precisión.
- 03Registrar método, bits, granularidad, esquema de calibración y formato.
- 04Medir memoria de pesos y memoria máxima de ejecución por separado.
- 05Evaluar calidad, latencia y rendimiento con el hardware y runtime de destino.
- 06Informar las limitaciones y datos ausentes; no presentar una prueba como garantía universal.
Para continuar
La cuantización es una herramienta de representación, no una categoría que por sí sola describa el comportamiento completo de un sistema. Para leer una ficha técnica o una evaluación, empieza por identificar qué se cuantizó, cómo se codifican los valores y en qué entorno se midieron los resultados.
Como recorrido conceptual, consulta el índice del glosario y las entradas relacionadas con inferencia, modelo local, LoRA, destilación y evaluación. La sección de comparación permite organizar diferencias entre métodos cuando se disponga de condiciones comparables; esta ficha no propone un formato universal ni sustituye una evaluación aplicada.