Analytics Legends Die Wissensplattform für SAP Analytics
Konzeptkarte

LLM-Inferenz-Engines — vLLM vs. TensorRT-LLM vs. llama.cpp vs. SGLang

LLM-Inferenz-Engines — vLLM vs. TensorRT-LLM vs. llama.cpp vs. SGLang — Abschnittsillustration von Analytics Legends für die SAP-Analytics-Wissensdatenbank (Konzepte, Studien, Academy)

Stand 2026-07-24T14:00:00Z

Was ist LLM-Inferenz-Engines — vLLM vs. TensorRT-LLM vs. llama.cpp vs. SGLang?

Nicht das Modell, sondern die Inferenz-Engine ist der größte einzelne Hebel für die Kosten des LLM-Betriebs — dasselbe Llama-3-70B kann auf einer naiven Generate-Schleife 3- bis 10-mal so teuer sein wie auf einem optimierten vLLM- oder TensorRT-LLM-Deployment.

Eine LLM-Inferenz-Engine ist die Laufzeitschicht, die die Gewichte eines trainierten Modells in ausgelieferte Token verwandelt: Sie plant eingehende Anfragen, verwaltet den GPU-Speicher, bündelt Prompts zu Batches und dekodiert Ausgaben Token für Token. Die Wahl der Engine ist wohl der größte einzelne Hebel für die Servierkosten im gesamten Generative-AI-Stack — dasselbe Modell mit siebzig Milliarden Open-Weight-Parametern kann auf einer naiven, unoptimierten Serving-Schleife drei- bis zehnmal teurer im Betrieb sein als auf einer sauber abgestimmten Produktions-Engine, noch bevor jemand an Modellgröße oder Prompt-Design gerührt hat.

Die vier Engines, auf die es ankommt

vLLM, entstanden aus Forschung an der UC Berkeley, ist die Open-Source-Referenzimplementierung, zu der die meisten Teams zuerst greifen. Seine Signaturtechnik, PagedAttention, verwaltet den Key-Value-Cache so, wie ein Betriebssystem virtuellen Speicher verwaltet, was es erlaubt, weit mehr gleichzeitige Anfragen auf dieselbe GPU zu packen als frühere Serving-Stacks. Kombiniert mit Continuous Batching — neue Anfragen in einen laufenden Batch einzufalten, statt zu warten, bis der gesamte Batch fertig ist — deckt vLLM eine riesige Bandbreite an Open-Weight-Modellfamilien ab und ist wirklich einfach zu betreiben, weshalb es zur Standardwahl für Teams geworden ist, die Llama, Mistral, Qwen oder ähnliche Modelle auf NVIDIA- oder AMD-Hardware selbst hosten.

Warum es zählt

  • vLLM ist der Open-Source-Standard für breite Modellabdeckung und Python-Ergonomie; TensorRT-LLM ist 1,5-2x schneller auf H100/H200, braucht aber einen 30-90-minütigen Kompilierungsschritt pro Modellvariante und bindet an NVIDIA.
  • llama.cpp ist die Edge-/Laptop-Engine (10-15 Tok/s auf einem MacBook M-Series), keine Rechenzentrums-Wahl; SGLangs RadixAttention ist 2-5x schneller als vLLM speziell bei agentischen Workloads mit starker Präfix-Wiederverwendung.
  • Die Entscheidung bildet sich direkt auf den Workload ab: TensorRT-LLM für latenzsensiblen Einzelnutzer-Chat, vLLM für hochdurchsatzstarkes Batch-RAG, SGLang für mehrstufige Joule-Agenten mit gemeinsamen System-Prompts.

Kernpunkte

  • Vier dominante Engines — vLLM (Open-Source-Standard), TensorRT-LLM (maximaler Durchsatz auf NVIDIA), llama.cpp (CPU/Edge), SGLang (Präfix-Wiederverwendung für Agenten).
  • vLLM kombiniert PagedAttention (C246) + Continuous Batching (C245) — 10-24x Durchsatz gegenüber der HuggingFace-generate()-Baseline.
  • TensorRT-LLM kompiliert modellspezifische Engines (fusionierte FP8/INT8-Kernel) — 1,5-2x schneller als vLLM auf H100, aber schwererer Build-Schritt + nur NVIDIA.
  • SGLangs RadixAttention teilt den KV-Cache über Anfragen mit gemeinsamen Präfixen — 2-5x Beschleunigung bei agentischen und Few-Shot-Workloads.
  • Die Engine-Wahl ist der größte einzelne Kostenhebel — die falsche Engine kann die GPU-Rechnung ver-3- bis ver-10-fachen, bevor Modell-Tuning überhaupt eine Rolle spielt.
  • LLM-Inferenz-Engines — vLLM vs. TensorRT-LLM vs. llama.cpp vs. SGLang ist erst dann beherrscht, wenn es eine benannte Käuferentscheidung verändert.
  • Beginnen Sie mit dem semantischen Vertrag und dem Kontrollmodell, bevor Sie das Tool demonstrieren.
  • Nutzen Sie aktuelle SAP-, Analysten-, Studien-, KG- und News-Signale als Beleg, nicht als Dekoration.
  • Trennen Sie verifizierte Fakten von richtungsweisenden Trends und modellierten Annahmen.
  • Definieren Sie Owner, Kennzahl, Schwellenwert, Support-Pfad und Rollback, bevor Sie skalieren.

Begriffe auf dieser Seite

Inferenz-Engine
Die Laufzeit, die Modellgewichte in den GPU-/CPU-Speicher lädt, eingehende Anfragen plant, den KV-Cache verwaltet und Ausgabe-Token dekodiert; zu unterscheiden vom Modell selbst.
vLLM
Open-Source-LLM-Inferenz-Engine von der UC Berkeley (2023), aufgebaut um PagedAttention und Continuous Batching; die De-facto-Referenz für das Selbsthosten von Open-Weight-Modellen.
TensorRT-LLM
NVIDIAs kompilierte Inferenz-Engine, die CUDA-Kernel fusioniert und pro Modell FP8/INT8-Quantisierung anwendet; höchster absoluter Durchsatz auf NVIDIA-Hardware.
RadixAttention
SGLangs Technik, den KV-Cache als Präfixbaum zu organisieren, sodass mehrere Anfragen, die System-Prompt bzw. Few-Shot-Beispiele teilen, die zwischengespeicherte Berechnung wiederverwenden.
Entscheidungs-Owner
Die verantwortliche Person, die den Kompromiss akzeptiert und die nächste Aktion finanziert.
Semantischer Vertrag
Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
Kontrollebene
Die Schicht, die Policy, Zugriff, Lineage, Monitoring und Eskalation über das Betriebsmodell hinweg anwendet.
Evidenzgrad
Eine Kennzeichnung, die verifizierte Fakten, richtungsweisende Signale, modellierte Annahmen und Feldbeobachtungen unterscheidet.

Quellen

  1. Kwon et al. — Efficient Memory Management for Large Language Model Serving with PagedAttention (vLLM paper, SOSP 2023)
  2. NVIDIA TensorRT-LLM documentation
  3. ggerganov/llama.cpp GitHub repository
  4. Zheng et al. — SGLang: Efficient Execution of Structured Language Model Programs
  5. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  6. SAP News Center — SAP Unveils the Autonomous Enterprise
  7. SAP News Center — The Future of the Enterprise Is Autonomous
  8. SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. Gartner — research & analyst site
  19. BARC — BI & Analytics research
  20. TDWI — data & analytics research
  21. DSAG — German-speaking SAP user group
  22. ASUG — Americas' SAP User Group
  23. Databricks — official site
  24. SAP Community — Contextualize and reason post sap sapphire sap business data cloud briefing
  25. SAP Help Portal — SAP Autonomous Suite documentation

Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke · die zitierfähigen Kennzahlen.

In der App öffnen →