Quantisierungsstrategien — INT8, INT4, AWQ, GPTQ, GGUF
Stand 2026-07-23
Was ist Quantisierungsstrategien — INT8, INT4, AWQ, GPTQ, GGUF?
INT4-Quantisierung verringert den Speicherbedarf eines 70-Milliarden-Parameter-Modells von 140 GB auf 35 GB — der Unterschied zwischen zwei benötigten H100 und nur einer A100 — bei lediglich 1-3 % Genauigkeitsverlust bei MMLU/HumanEval.
Worum es geht
Quantisierung verkleinert die Gewichte eines Modells von 16-Bit-Gleitkommazahlen (FP16/BF16, das Trainingsformat) auf 8-Bit- (INT8) oder 4-Bit-Ganzzahlen (INT4) und senkt so den GPU-Speicherbedarf um das 2- bis 4-Fache und die Inferenzlatenz um das 1,5- bis 3-Fache — auf Kosten eines kleinen, kontrollierten Genauigkeitsverlusts. Bei einem Modell mit 70 Milliarden Parametern verwandelt INT4 einen FP16-Speicherbedarf von 140 GB in 35 GB — der Unterschied zwischen zwei benötigten H100 und nur einer A100 — eine Kostenlücke, die darüber entscheidet, ob ein Anwendungsfall für On-Premises- oder Edge-Deployment wirtschaftlich tragfähig ist.
Vier Familien dominieren. AWQ (Activation-aware Weight Quantization, MIT 2023) misst, welche Gewichtskanäle auf einem Kalibrierungsdatensatz das meiste Signal tragen, belässt diese in höherer Präzision und quantisiert den Rest aggressiv; die Genauigkeit bleibt bei 4-Bit innerhalb von 0,5-1 Perplexitätspunkt von FP16. GPTQ (Frantar et al. 2022) ist der ältere One-Shot-Quantisierer, der Informationen zweiter Ordnung aus einem Kalibrierungsdatensatz nutzt; sehr schnell anzuwenden, bei instruction-getunten Modellen jedoch leicht ungenauer als AWQ. INT8 SmoothQuant verschiebt Aktivierungs-Ausreißer in die Gewichtsmatrix, sodass beide sauber 8-Bit sein können; die konservative Wahl, wenn die Genauigkeit nahe an FP16 liegen muss. GGUF (GPT-Generated Unified Format, llama.cpp-Ökosystem) ist ein Containerformat mit mehreren Quantisierungsvarianten (Q2_K, Q4_K_M, Q5_K_M, Q8_0); das De-facto-Format für llama.cpp und Edge-Deployment.
Warum es zählt
- AWQ hält die Genauigkeit bei 4-Bit innerhalb von 0,5-1 Perplexitätspunkt von FP16, indem es signalstarke Gewichtskanäle in höherer Präzision belässt, und übertrifft damit bei instruction-getunten Modellen das ältere GPTQ.
- INT8 SmoothQuant ist die konservative Wahl mit unter 1 % Verschlechterung, der Standard für Rechenzentrums-Serving, bei dem die Genauigkeit nicht kompromittiert werden darf.
- Unterhalb von INT4 (3-Bit, 2-Bit) wird die Verschlechterung aufgabenabhängig — mathematisches und Code-Reasoning brechen zuerst ein, konversationeller Chat verschlechtert sich zuletzt.
Kernpunkte
- Quantisierung verkleinert Gewichte von FP16 auf INT8 (2-fache Speicherreduktion) oder INT4 (4-fache Speicherreduktion) — bei geringen Genauigkeitskosten.
- AWQ (activation-aware, MIT 2023) — beste 4-Bit-Genauigkeit, 0,5-1 Perplexitätspunkt von FP16; Standard für instruction-getunte Modelle.
- GPTQ — älterer One-Shot-Quantisierer, schnell anzuwenden, bei Chat-Modellen leicht schlechter als AWQ.
- INT8 SmoothQuant — konservative 2-fache Kompression, <1 % Genauigkeitsverlust; Standard für Produktions-Serving im Rechenzentrum.
- GGUF — Containerformat mit Varianten von Q2_K bis Q8_0; kanonisch für llama.cpp-Edge- und Laptop-Deployments.
- Unterhalb von INT4 (3-Bit, 2-Bit) — mathematisches und Code-Reasoning brechen zuerst ein; Chat verschlechtert sich zuletzt.
- Quantisierungsstrategien — INT8, INT4, AWQ, GPTQ, GGUF ist erst dann beherrscht, wenn es eine benannte Kaufentscheidung verändert.
- Beginnen Sie mit dem semantischen Kontrakt und dem Kontrollmodell, bevor Sie das Tool demonstrieren.
- Verwenden Sie aktuelle SAP-, Analysten-, Studien-, Knowledge-Graph- und News-Signale als Belege, nicht als Dekoration.
- Trennen Sie verifizierte Fakten von richtungsweisenden Trends und modellierten Annahmen.
Begriffe auf dieser Seite
- Quantisierung
- Reduzierung der numerischen Präzision der Gewichte eines Modells (und optional der Aktivierungen) von FP16/BF16 auf INT8 oder INT4, um den Speicherbedarf zu verringern und die Inferenz zu beschleunigen.
- AWQ
- Activation-aware Weight Quantization (MIT 2023); identifiziert signalstarke Gewichtskanäle anhand eines Kalibrierungsdatensatzes und belässt diese in höherer Präzision, während der Rest aggressiv quantisiert wird.
- GPTQ
- One-Shot-Post-Training-Quantisierer (Frantar et al. 2022), der näherungsweise Informationen zweiter Ordnung aus einem kleinen Kalibrierungsdatensatz nutzt; schnell, aber bei instruction-getunten Modellen leicht ungenauer als AWQ.
- GGUF
- Containerformat für quantisierte Modelle im llama.cpp-Ökosystem; enthält Gewichtstensoren in Varianten von Q2_K (2-Bit) bis Q8_0 (8-Bit) mit Metadaten.
- Entscheidungsverantwortlicher
- Die verantwortliche Person, die den Trade-off akzeptiert und die nächste Maßnahme finanziert.
- Semantischer Kontrakt
- Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
- Kontrollebene
- Die Schicht, die Richtlinien, Zugriff, Lineage, Monitoring und Eskalation über das Betriebsmodell hinweg durchsetzt.
- Evidenzgrad
- Ein Label, das verifizierte Fakten, richtungsweisende Signale, modellierte Annahmen und Feldbeobachtungen unterscheidet.
Quellen
- Lin et al. — AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration
- Frantar et al. — GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers
- Xiao et al. — SmoothQuant: Accurate and Efficient Post-Training Quantization for LLMs
- llama.cpp GGUF format specification
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke.