Définition·
Optimisation

Quantization

Technique qui réduit la précision numérique des poids d'un modèle pour le rendre plus léger et plus rapide.

Explication détaillée

Passer un modèle de 16 ou 32 bits à 8, 4 ou même 2 bits diminue fortement la mémoire et accélère l'inférence, au prix d'une légère perte de qualité. Indispensable pour faire tourner de gros LLM sur GPU grand public ou en local.

Exemples

Llama 70B quantizé en 4 bits sur un Mac M3
Modèles GGUF pour llama.cpp
Inference edge sur mobile

Questions fréquentes

Y a-t-il une perte de qualité ?

Oui mais souvent marginale en 8 bits et acceptable en 4 bits pour la plupart des usages.

Termes associés

Dernière mise à jour : 15/07/2026

Talent AI

Passez de la théorie à la pratique

Publiez une mission ou rejoignez la communauté des meilleurs experts IA, Data et Machine Learning.