Stratégies de quantification — INT8, INT4, AWQ, GPTQ, GGUF
À jour au 2026-07-23
Qu'est-ce que Stratégies de quantification — INT8, INT4, AWQ, GPTQ, GGUF ?
La quantification INT4 réduit l'empreinte d'un modèle 70B de 140 Go à 35 Go — la différence entre deux H100 nécessaires et un seul A100 — pour seulement 1-3 % de perte de précision sur MMLU/HumanEval.
De quoi il s'agit
La quantification réduit les poids d'un modèle de flottants 16 bits (FP16/BF16, le format d'entraînement) à des entiers 8 bits (INT8) ou 4 bits (INT4), coupant la mémoire GPU de 2 à 4 fois et la latence d'inférence de 1,5 à 3 fois — au prix d'une perte de précision faible et contrôlée. Pour un modèle de 70 milliards de paramètres, INT4 transforme une empreinte FP16 de 140 Go en 35 Go, la différence entre deux H100 et un seul A100 — un écart de coût qui décide si un cas d'usage est économiquement viable pour un déploiement sur site ou en edge.
Quatre familles dominent. AWQ (Activation-aware Weight Quantization, MIT 2023) mesure quels canaux de poids portent le plus de signal sur un jeu de calibration, laisse ceux-ci en précision plus élevée, et quantifie agressivement le reste ; préserve la précision à 0,5-1 point de perplexité du FP16 en 4 bits. GPTQ (Frantar et al. 2022) est le quantificateur one-shot plus ancien utilisant l'information de second ordre depuis un jeu de calibration ; très rapide à appliquer, précision légèrement moindre qu'AWQ sur les modèles instruction-tunés. INT8 SmoothQuant déplace les valeurs aberrantes des activations vers la matrice de poids pour que les deux soient en 8 bits proprement ; choix conservateur quand la précision doit rester proche du FP16. GGUF (GPT-Generated Unified Format, écosystème llama.cpp) est un format conteneur avec plusieurs variantes (Q2_K, Q4_K_M, Q5_K_M, Q8_0) ; format de référence pour llama.cpp et les déploiements edge.
Pourquoi c'est important
- AWQ préserve la précision à 0,5-1 point de perplexité du FP16 en 4 bits en laissant les canaux de poids à fort signal en précision plus élevée, devançant GPTQ, plus ancien, sur les modèles instruction-tunés.
- INT8 SmoothQuant est le choix conservateur avec moins de 1 % de dégradation, le défaut pour le service datacenter où la précision ne peut pas être compromise.
- Sous INT4 (3 bits, 2 bits) la dégradation devient dépendante de la tâche — le raisonnement math et code s'effondre en premier, le chat conversationnel se dégrade en dernier.
Points clés
- La quantification réduit les poids de FP16 à INT8 (mémoire ÷ 2) ou INT4 (mémoire ÷ 4) — pour un faible coût de précision.
- AWQ (activation-aware, MIT 2023) — meilleure précision 4 bits, 0,5-1 point de perplexité du FP16 ; défaut pour modèles instruction-tunés.
- GPTQ — quantificateur one-shot plus ancien, rapide à appliquer, légèrement moins bon qu'AWQ sur modèles chat.
- INT8 SmoothQuant — compression conservatrice 2x, <1 % de perte de précision ; défaut pour service datacenter en production.
- GGUF — format conteneur avec variantes Q2_K à Q8_0 ; canonique pour déploiements edge + laptop llama.cpp.
- Sous INT4 (3 bits, 2 bits) — le raisonnement math et code s'effondre en premier ; le chat se dégrade en dernier.
Termes employés sur cette page
- Quantization
- Réduction de la précision numérique des poids d'un modèle (et éventuellement des activations) de FP16/BF16 vers INT8 ou INT4 pour réduire la mémoire et accélérer l'inférence.
- AWQ
- Activation-aware Weight Quantization (MIT 2023) ; identifie les canaux de poids saillants à partir d'un jeu de calibration et les préserve en précision plus élevée tout en quantifiant agressivement le reste.
- GPTQ
- Quantizer post-entraînement en une passe (Frantar et al. 2022) utilisant une information approchée du second ordre issue d'un petit jeu de calibration ; rapide mais légèrement moins précis qu'AWQ sur les modèles ajustés par instructions.
- GGUF
- Format de conteneur pour modèles quantifiés dans l'écosystème llama.cpp ; porte les tenseurs de poids en variantes de Q2_K (2 bits) à Q8_0 (8 bits) avec métadonnées.
- Decision owner
- La personne responsable qui accepte l'arbitrage et finance l'action suivante.
- Semantic contract
- La définition partagée des termes métier, métriques, entités et règles d'accès utilisée par les outils et les équipes.
- Control plane
- La couche qui applique la politique, les accès, la traçabilité (lineage), la supervision et l'escalade à travers le modèle opérationnel.
- Evidence grade
- Un label qui distingue le fait vérifié, le signal directionnel, l'hypothèse modélisée et l'observation de terrain.
Sources
- Lin et al. — AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration
- Frantar et al. — GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers
- Xiao et al. — SmoothQuant: Accurate and Efficient Post-Training Quantization for LLMs
- llama.cpp GGUF format specification
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code.