Stratégies de quantification — INT8, INT4, AWQ, GPTQ, GGUF
À jour au 2026-10-06
Qu'est-ce que Stratégies de quantification ?
La quantification INT4 réduit l'empreinte d'un modèle 70B de 140 Go à 35 Go — la différence entre deux H100 nécessaires et un seul A100 — pour seulement 1-3 % de perte de précision sur MMLU/HumanEval.
De quoi il s'agit
La quantification réduit les poids d'un modèle de flottants 16 bits (FP16/BF16, le format d'entraînement) à des entiers 8 bits (INT8) ou 4 bits (INT4), coupant la mémoire GPU de 2 à 4 fois et la latence d'inférence de 1,5 à 3 fois — au prix d'une perte de précision faible et contrôlée. Pour un modèle de 70 milliards de paramètres, INT4 transforme une empreinte FP16 de 140 Go en 35 Go, la différence entre deux H100 et un seul A100 — un écart de coût qui décide si un cas d'usage est économiquement viable pour un déploiement sur site ou en edge.
Quatre familles dominent. AWQ (Activation-aware Weight Quantization, MIT 2023) mesure quels canaux de poids portent le plus de signal sur un jeu de calibration, laisse ceux-ci en précision plus élevée, et quantifie agressivement le reste ; préserve la précision à 0,5-1 point de perplexité du FP16 en 4 bits. GPTQ (Frantar et al. 2022) est le quantificateur one-shot plus ancien utilisant l'information de second ordre depuis un jeu de calibration ; très rapide à appliquer, précision légèrement moindre qu'AWQ sur les modèles instruction-tunés. INT8 SmoothQuant déplace les valeurs aberrantes des activations vers la matrice de poids pour que les deux soient en 8 bits proprement ; choix conservateur quand la précision doit rester proche du FP16. GGUF (GPT-Generated Unified Format, écosystème llama.cpp) est un format conteneur avec plusieurs variantes (Q2_K, Q4_K_M, Q5_K_M, Q8_0) ; format de référence pour llama.cpp et les déploiements edge.
Pourquoi c'est important
- AWQ préserve la précision à 0,5-1 point de perplexité du FP16 en 4 bits en laissant les canaux de poids à fort signal en précision plus élevée, devançant GPTQ, plus ancien, sur les modèles instruction-tunés.
- INT8 SmoothQuant est le choix conservateur avec moins de 1 % de dégradation, le défaut pour le service datacenter où la précision ne peut pas être compromise.
- Sous INT4 (3 bits, 2 bits) la dégradation devient dépendante de la tâche — le raisonnement math et code s'effondre en premier, le chat conversationnel se dégrade en dernier.
Points clés
- La quantification réduit les poids de FP16 à INT8 (mémoire ÷ 2) ou INT4 (mémoire ÷ 4) — pour un faible coût de précision.
- AWQ (activation-aware, MIT 2023) — meilleure précision 4 bits, 0,5-1 point de perplexité du FP16 ; défaut pour modèles instruction-tunés.
- GPTQ — quantificateur one-shot plus ancien, rapide à appliquer, légèrement moins bon qu'AWQ sur modèles chat.
- INT8 SmoothQuant — compression conservatrice 2x, <1 % de perte de précision ; défaut pour service datacenter en production.
- GGUF — format conteneur avec variantes Q2_K à Q8_0 ; canonique pour déploiements edge + laptop llama.cpp.
- Sous INT4 (3 bits, 2 bits) — le raisonnement math et code s'effondre en premier ; le chat se dégrade en dernier.
Termes employés sur cette page
- Quantization
- Réduction de la précision numérique des poids d'un modèle (et éventuellement des activations) de FP16/BF16 vers INT8 ou INT4 pour réduire la mémoire et accélérer l'inférence.
- AWQ
- Activation-aware Weight Quantization (MIT 2023) ; identifie les canaux de poids saillants à partir d'un jeu de calibration et les préserve en précision plus élevée tout en quantifiant agressivement le reste.
- GPTQ
- Quantizer post-entraînement en une passe (Frantar et al. 2022) utilisant une information approchée du second ordre issue d'un petit jeu de calibration ; rapide mais légèrement moins précis qu'AWQ sur les modèles ajustés par instructions.
- GGUF
- Format de conteneur pour modèles quantifiés dans l'écosystème llama.cpp ; porte les tenseurs de poids en variantes de Q2_K (2 bits) à Q8_0 (8 bits) avec métadonnées.
- SmoothQuant (INT8)
- Une méthode de quantisation qui déplace mathématiquement les valeurs aberrantes d'activation vers la matrice de poids avant quantisation, afin que poids et activations tournent proprement en 8 bits — le choix conservateur, à précision proche du FP16, que cette fiche recommande pour les sorties régulées ou sensibles à la sécurité.
- Jeu de calibration
- Le petit échantillon représentatif d'entrées réelles utilisé par AWQ, GPTQ et des quantiseurs post-entraînement similaires pour décider quels canaux de poids comptent le plus et les préserver en précision plus élevée — la qualité de cet échantillon borne directement la précision du modèle quantifié.
- Distillation vs quantization
- Deux techniques de compression distinctes souvent confondues : la distillation entraîne un modèle plus petit à imiter le comportement d'un plus grand (un nouveau modèle, un nouvel entraînement) ; la quantisation garde la même architecture et les mêmes poids mais les stocke à une précision numérique plus basse (sans réentraînement).
- BYOM (Bring Your Own Model)
- Le chemin documenté de SAP AI Core pour auto-héberger un modèle open source ou quantifié sur mesure — via Ollama, LocalAI, llama.cpp, vLLM ou un serveur Hugging Face Transformers sur mesure — plutôt que de consommer un modèle de fondation hébergé via le generative AI hub.
Sources
- Lin et al. — AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration
- Frantar et al. — GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers
- Xiao et al. — SmoothQuant: Accurate and Efficient Post-Training Quantization for LLMs
- llama.cpp GGUF format specification
- GitHub SAP-samples — btp-generative-ai-hub-use-cases: bring-your-own OSS LLM on SAP AI Core (Ollama, LocalAI, llama.cpp, vLLM, custom HF Transformers server)
- SAP Help Portal — Choose a Resource Plan for training/inference in SAP AI Core (GPU-tier consequence of a quantization choice)
- GitHub — casper-hansen/AutoAWQ (AWQ quantization library)
- GitHub SAP-docs — sap-artificial-intelligence: SAP Domain Models / foundation models overview
- SAP News Center — SAP Sapphire keynote: Business AI Platform to power the Autonomous Enterprise (SAP Domain Models, Early Adopter Care → GA target Q3 2026, 2026-05-12)
- NVIDIA Newsroom — SAP and NVIDIA to Accelerate Generative AI Adoption Across Enterprise Applications
- GitHub NVIDIA — TensorRT-LLM (FP8/INT8 quantized execution graphs)
- ggml-org — llama.cpp release v0.6.0 (NVFP4/MXFP4 W4A4 path, Vulkan sparse flash attention for quantised K/V, imatrix activation statistics; 5 Oct 2026)
- vLLM project — release v0.31.0 (NVFP4 compressed KV cache default, fp8_per_tensor, vllm preload; 5 Oct 2026)
- vLLM — Quantization (supported quantisation methods and hardware matrix)
- ggml-org — llama.cpp quantize tool README (GGUF quantisation types and imatrix usage)
- Hugging Face — Transformers quantization overview (bitsandbytes, AWQ, GPTQ and other backends compared)
Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.