Analytics Legends Die Wissensplattform für SAP Analytics
Konzeptkarte

Quantisierungsstrategien — INT8, INT4, AWQ, GPTQ, GGUF

Quantisierungsstrategien — INT8, INT4, AWQ, GPTQ, GGUF — Abschnittsillustration von Analytics Legends für die SAP-Analytics-Wissensdatenbank (Konzepte, Studien, Academy)

Stand 2026-07-23

Was ist Quantisierungsstrategien — INT8, INT4, AWQ, GPTQ, GGUF?

INT4-Quantisierung verringert den Speicherbedarf eines 70-Milliarden-Parameter-Modells von 140 GB auf 35 GB — der Unterschied zwischen zwei benötigten H100 und nur einer A100 — bei lediglich 1-3 % Genauigkeitsverlust bei MMLU/HumanEval.

Worum es geht

Quantisierung verkleinert die Gewichte eines Modells von 16-Bit-Gleitkommazahlen (FP16/BF16, das Trainingsformat) auf 8-Bit- (INT8) oder 4-Bit-Ganzzahlen (INT4) und senkt so den GPU-Speicherbedarf um das 2- bis 4-Fache und die Inferenzlatenz um das 1,5- bis 3-Fache — auf Kosten eines kleinen, kontrollierten Genauigkeitsverlusts. Bei einem Modell mit 70 Milliarden Parametern verwandelt INT4 einen FP16-Speicherbedarf von 140 GB in 35 GB — der Unterschied zwischen zwei benötigten H100 und nur einer A100 — eine Kostenlücke, die darüber entscheidet, ob ein Anwendungsfall für On-Premises- oder Edge-Deployment wirtschaftlich tragfähig ist.

Vier Familien dominieren. AWQ (Activation-aware Weight Quantization, MIT 2023) misst, welche Gewichtskanäle auf einem Kalibrierungsdatensatz das meiste Signal tragen, belässt diese in höherer Präzision und quantisiert den Rest aggressiv; die Genauigkeit bleibt bei 4-Bit innerhalb von 0,5-1 Perplexitätspunkt von FP16. GPTQ (Frantar et al. 2022) ist der ältere One-Shot-Quantisierer, der Informationen zweiter Ordnung aus einem Kalibrierungsdatensatz nutzt; sehr schnell anzuwenden, bei instruction-getunten Modellen jedoch leicht ungenauer als AWQ. INT8 SmoothQuant verschiebt Aktivierungs-Ausreißer in die Gewichtsmatrix, sodass beide sauber 8-Bit sein können; die konservative Wahl, wenn die Genauigkeit nahe an FP16 liegen muss. GGUF (GPT-Generated Unified Format, llama.cpp-Ökosystem) ist ein Containerformat mit mehreren Quantisierungsvarianten (Q2_K, Q4_K_M, Q5_K_M, Q8_0); das De-facto-Format für llama.cpp und Edge-Deployment.

Warum es zählt

  • AWQ hält die Genauigkeit bei 4-Bit innerhalb von 0,5-1 Perplexitätspunkt von FP16, indem es signalstarke Gewichtskanäle in höherer Präzision belässt, und übertrifft damit bei instruction-getunten Modellen das ältere GPTQ.
  • INT8 SmoothQuant ist die konservative Wahl mit unter 1 % Verschlechterung, der Standard für Rechenzentrums-Serving, bei dem die Genauigkeit nicht kompromittiert werden darf.
  • Unterhalb von INT4 (3-Bit, 2-Bit) wird die Verschlechterung aufgabenabhängig — mathematisches und Code-Reasoning brechen zuerst ein, konversationeller Chat verschlechtert sich zuletzt.

Kernpunkte

  • Quantisierung verkleinert Gewichte von FP16 auf INT8 (2-fache Speicherreduktion) oder INT4 (4-fache Speicherreduktion) — bei geringen Genauigkeitskosten.
  • AWQ (activation-aware, MIT 2023) — beste 4-Bit-Genauigkeit, 0,5-1 Perplexitätspunkt von FP16; Standard für instruction-getunte Modelle.
  • GPTQ — älterer One-Shot-Quantisierer, schnell anzuwenden, bei Chat-Modellen leicht schlechter als AWQ.
  • INT8 SmoothQuant — konservative 2-fache Kompression, <1 % Genauigkeitsverlust; Standard für Produktions-Serving im Rechenzentrum.
  • GGUF — Containerformat mit Varianten von Q2_K bis Q8_0; kanonisch für llama.cpp-Edge- und Laptop-Deployments.
  • Unterhalb von INT4 (3-Bit, 2-Bit) — mathematisches und Code-Reasoning brechen zuerst ein; Chat verschlechtert sich zuletzt.
  • Quantisierungsstrategien — INT8, INT4, AWQ, GPTQ, GGUF ist erst dann beherrscht, wenn es eine benannte Kaufentscheidung verändert.
  • Beginnen Sie mit dem semantischen Kontrakt und dem Kontrollmodell, bevor Sie das Tool demonstrieren.
  • Verwenden Sie aktuelle SAP-, Analysten-, Studien-, Knowledge-Graph- und News-Signale als Belege, nicht als Dekoration.
  • Trennen Sie verifizierte Fakten von richtungsweisenden Trends und modellierten Annahmen.

Begriffe auf dieser Seite

Quantisierung
Reduzierung der numerischen Präzision der Gewichte eines Modells (und optional der Aktivierungen) von FP16/BF16 auf INT8 oder INT4, um den Speicherbedarf zu verringern und die Inferenz zu beschleunigen.
AWQ
Activation-aware Weight Quantization (MIT 2023); identifiziert signalstarke Gewichtskanäle anhand eines Kalibrierungsdatensatzes und belässt diese in höherer Präzision, während der Rest aggressiv quantisiert wird.
GPTQ
One-Shot-Post-Training-Quantisierer (Frantar et al. 2022), der näherungsweise Informationen zweiter Ordnung aus einem kleinen Kalibrierungsdatensatz nutzt; schnell, aber bei instruction-getunten Modellen leicht ungenauer als AWQ.
GGUF
Containerformat für quantisierte Modelle im llama.cpp-Ökosystem; enthält Gewichtstensoren in Varianten von Q2_K (2-Bit) bis Q8_0 (8-Bit) mit Metadaten.
Entscheidungsverantwortlicher
Die verantwortliche Person, die den Trade-off akzeptiert und die nächste Maßnahme finanziert.
Semantischer Kontrakt
Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
Kontrollebene
Die Schicht, die Richtlinien, Zugriff, Lineage, Monitoring und Eskalation über das Betriebsmodell hinweg durchsetzt.
Evidenzgrad
Ein Label, das verifizierte Fakten, richtungsweisende Signale, modellierte Annahmen und Feldbeobachtungen unterscheidet.

Quellen

  1. Lin et al. — AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration
  2. Frantar et al. — GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers
  3. Xiao et al. — SmoothQuant: Accurate and Efficient Post-Training Quantization for LLMs
  4. llama.cpp GGUF format specification
  5. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  6. SAP News Center — SAP Unveils the Autonomous Enterprise
  7. SAP News Center — The Future of the Enterprise Is Autonomous
  8. SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. Gartner — research & analyst site
  19. BARC — BI & Analytics research
  20. TDWI — data & analytics research
  21. DSAG — German-speaking SAP user group
  22. ASUG — Americas' SAP User Group
  23. Databricks — official site

Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke.

In der App öffnen →