LLM-Inferenz-Engines — vLLM vs. TensorRT-LLM vs. llama.cpp vs. SGLang
Stand 2026-07-24T14:00:00Z
Was ist LLM-Inferenz-Engines — vLLM vs. TensorRT-LLM vs. llama.cpp vs. SGLang?
Nicht das Modell, sondern die Inferenz-Engine ist der größte einzelne Hebel für die Kosten des LLM-Betriebs — dasselbe Llama-3-70B kann auf einer naiven Generate-Schleife 3- bis 10-mal so teuer sein wie auf einem optimierten vLLM- oder TensorRT-LLM-Deployment.
Eine LLM-Inferenz-Engine ist die Laufzeitschicht, die die Gewichte eines trainierten Modells in ausgelieferte Token verwandelt: Sie plant eingehende Anfragen, verwaltet den GPU-Speicher, bündelt Prompts zu Batches und dekodiert Ausgaben Token für Token. Die Wahl der Engine ist wohl der größte einzelne Hebel für die Servierkosten im gesamten Generative-AI-Stack — dasselbe Modell mit siebzig Milliarden Open-Weight-Parametern kann auf einer naiven, unoptimierten Serving-Schleife drei- bis zehnmal teurer im Betrieb sein als auf einer sauber abgestimmten Produktions-Engine, noch bevor jemand an Modellgröße oder Prompt-Design gerührt hat.
Die vier Engines, auf die es ankommt
vLLM, entstanden aus Forschung an der UC Berkeley, ist die Open-Source-Referenzimplementierung, zu der die meisten Teams zuerst greifen. Seine Signaturtechnik, PagedAttention, verwaltet den Key-Value-Cache so, wie ein Betriebssystem virtuellen Speicher verwaltet, was es erlaubt, weit mehr gleichzeitige Anfragen auf dieselbe GPU zu packen als frühere Serving-Stacks. Kombiniert mit Continuous Batching — neue Anfragen in einen laufenden Batch einzufalten, statt zu warten, bis der gesamte Batch fertig ist — deckt vLLM eine riesige Bandbreite an Open-Weight-Modellfamilien ab und ist wirklich einfach zu betreiben, weshalb es zur Standardwahl für Teams geworden ist, die Llama, Mistral, Qwen oder ähnliche Modelle auf NVIDIA- oder AMD-Hardware selbst hosten.
Warum es zählt
- vLLM ist der Open-Source-Standard für breite Modellabdeckung und Python-Ergonomie; TensorRT-LLM ist 1,5-2x schneller auf H100/H200, braucht aber einen 30-90-minütigen Kompilierungsschritt pro Modellvariante und bindet an NVIDIA.
- llama.cpp ist die Edge-/Laptop-Engine (10-15 Tok/s auf einem MacBook M-Series), keine Rechenzentrums-Wahl; SGLangs RadixAttention ist 2-5x schneller als vLLM speziell bei agentischen Workloads mit starker Präfix-Wiederverwendung.
- Die Entscheidung bildet sich direkt auf den Workload ab: TensorRT-LLM für latenzsensiblen Einzelnutzer-Chat, vLLM für hochdurchsatzstarkes Batch-RAG, SGLang für mehrstufige Joule-Agenten mit gemeinsamen System-Prompts.
Kernpunkte
- Vier dominante Engines — vLLM (Open-Source-Standard), TensorRT-LLM (maximaler Durchsatz auf NVIDIA), llama.cpp (CPU/Edge), SGLang (Präfix-Wiederverwendung für Agenten).
- vLLM kombiniert PagedAttention (C246) + Continuous Batching (C245) — 10-24x Durchsatz gegenüber der HuggingFace-generate()-Baseline.
- TensorRT-LLM kompiliert modellspezifische Engines (fusionierte FP8/INT8-Kernel) — 1,5-2x schneller als vLLM auf H100, aber schwererer Build-Schritt + nur NVIDIA.
- SGLangs RadixAttention teilt den KV-Cache über Anfragen mit gemeinsamen Präfixen — 2-5x Beschleunigung bei agentischen und Few-Shot-Workloads.
- Die Engine-Wahl ist der größte einzelne Kostenhebel — die falsche Engine kann die GPU-Rechnung ver-3- bis ver-10-fachen, bevor Modell-Tuning überhaupt eine Rolle spielt.
- LLM-Inferenz-Engines — vLLM vs. TensorRT-LLM vs. llama.cpp vs. SGLang ist erst dann beherrscht, wenn es eine benannte Käuferentscheidung verändert.
- Beginnen Sie mit dem semantischen Vertrag und dem Kontrollmodell, bevor Sie das Tool demonstrieren.
- Nutzen Sie aktuelle SAP-, Analysten-, Studien-, KG- und News-Signale als Beleg, nicht als Dekoration.
- Trennen Sie verifizierte Fakten von richtungsweisenden Trends und modellierten Annahmen.
- Definieren Sie Owner, Kennzahl, Schwellenwert, Support-Pfad und Rollback, bevor Sie skalieren.
Begriffe auf dieser Seite
- Inferenz-Engine
- Die Laufzeit, die Modellgewichte in den GPU-/CPU-Speicher lädt, eingehende Anfragen plant, den KV-Cache verwaltet und Ausgabe-Token dekodiert; zu unterscheiden vom Modell selbst.
- vLLM
- Open-Source-LLM-Inferenz-Engine von der UC Berkeley (2023), aufgebaut um PagedAttention und Continuous Batching; die De-facto-Referenz für das Selbsthosten von Open-Weight-Modellen.
- TensorRT-LLM
- NVIDIAs kompilierte Inferenz-Engine, die CUDA-Kernel fusioniert und pro Modell FP8/INT8-Quantisierung anwendet; höchster absoluter Durchsatz auf NVIDIA-Hardware.
- RadixAttention
- SGLangs Technik, den KV-Cache als Präfixbaum zu organisieren, sodass mehrere Anfragen, die System-Prompt bzw. Few-Shot-Beispiele teilen, die zwischengespeicherte Berechnung wiederverwenden.
- Entscheidungs-Owner
- Die verantwortliche Person, die den Kompromiss akzeptiert und die nächste Aktion finanziert.
- Semantischer Vertrag
- Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
- Kontrollebene
- Die Schicht, die Policy, Zugriff, Lineage, Monitoring und Eskalation über das Betriebsmodell hinweg anwendet.
- Evidenzgrad
- Eine Kennzeichnung, die verifizierte Fakten, richtungsweisende Signale, modellierte Annahmen und Feldbeobachtungen unterscheidet.
Quellen
- Kwon et al. — Efficient Memory Management for Large Language Model Serving with PagedAttention (vLLM paper, SOSP 2023)
- NVIDIA TensorRT-LLM documentation
- ggerganov/llama.cpp GitHub repository
- Zheng et al. — SGLang: Efficient Execution of Structured Language Model Programs
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
- SAP Community — Contextualize and reason post sap sapphire sap business data cloud briefing
- SAP Help Portal — SAP Autonomous Suite documentation
Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke · die zitierfähigen Kennzahlen.