Definición·
Optimización

Quantization

Técnica que reduce la precisión numérica de los pesos de un modelo para hacerlo más ligero y más rápido.

Explicación detallada

Pasar un modelo de 16 o 32 bits a 8, 4 o incluso 2 bits reduce drásticamente la memoria y acelera la inferencia, a costa de una ligera pérdida de calidad. Indispensable para ejecutar grandes LLM en GPUs de consumo o en local.

Ejemplos

Llama 70B cuantizado en 4 bits en un Mac M3
Modelos GGUF para llama.cpp
Inferencia en el edge en dispositivos móviles

Preguntas frecuentes

¿Hay pérdida de calidad ?

Sí, pero suele ser marginal en 8 bits y aceptable en 4 bits para la mayoría de los usos.

Términos relacionados

Última actualización: 15/7/2026

Talent AI

Pasa de la teoría a la práctica

Publica una misión o únete a la comunidad de los mejores expertos en IA, Data y Machine Learning.