Kosten-pro-Token-Ökonomie 2026 — Spitzenmodelle vs. offene Gewichte
Stand 2026-07-24T15:00:00Z
Was ist Kosten-pro-Token-Ökonomie 2026 — Spitzenmodelle vs. offene Gewichte?
Die Kosten pro Token unterscheiden sich im Mai 2026 um zwei Größenordnungen — von Gemini 2.5 Pro mit 1,25 US-Dollar/Mio. Input-Tokens bis Claude Opus 4.7 mit 75 US-Dollar/Mio. Output-Tokens — und der größte Hebel besteht darin, 70 % der Aufrufe an ein kleines Modell zu leiten.
Worum es geht
Kosten pro Token sind die Einheitsökonomie, die darüber entscheidet, ob ein LLM-gestütztes Feature ein Rundungsfehler auf der Cloud-Rechnung ist oder der Posten, wegen dessen ein Finanzdirektor bei einer Budgetprüfung gezielte Fragen stellt. Jeder produktive Sprachmodell-Workload lässt sich, unabhängig vom Anwendungsfall, letztlich auf wenige miteinander multiplizierte Variablen reduzieren: verbrauchte Tokens pro Aufruf, Aufrufe pro Tag und Preis pro Token — und jede dieser drei Variablen hat sich in den letzten Jahren an verschiedenen Punkten um rund eine Größenordnung verändert, in Richtungen, die nicht immer intuitiv sind.
Warum es zählt
- Reasoning-Modelle erzeugen 5-20× mehr interne Tokens, als sie ausgeben, abgerechnet zu Output-Sätzen — ein Deep-Research-Aufruf, der 500 sichtbare Tokens zurückgibt, kann 8.000 interne Reasoning-Tokens verbrauchen und bei Opus 4.7 0,60 US-Dollar kosten.
- Prompt-Caching ist die größte Stellschraube bei wiederholten Kontextkosten und senkt die Input-Kosten für wiederholte System-Prompts in hochvolumigen RAG-Anwendungen um 80-90 %.
- Self-Hosting von Llama-3.1-70B auf einer einzelnen H100 zu 3 €/Stunde erreicht bei rund 50 % Auslastung Kostenparität mit der Claude-Sonnet-API — darunter bleibt die API günstiger.
Kernpunkte
- Listenpreise Spitzenmodelle Mai 2026: GPT-5 5$/15$ pro M In/Out; Claude Opus 4.7 15$/75$; Gemini 2.5 Pro 1,25$/10$; Cached-Input-Stufen 25-90 % Rabatt.
- Mittelklasse (GPT-5 mini, Claude Sonnet, Gemini Flash) bei 0,15-3$/M Input — der richtige Standard für 60-80 % der produktiven Aufrufe.
- Selbst gehostete offene Gewichte bei effektiv 0,20-1,50$/M; verwaltete Endpunkte (Together/Fireworks/Groq) 0,20-0,90$/M.
- Interne Tokens von Reasoning-Modellen (Extended Thinking, Reasoning-Tokens) werden zu Output-Sätzen abgerechnet — 8.000 interne Tokens für eine 500-Token-Antwort = 0,60$/Aufruf bei Opus 4.7.
- Prompt-Caching ist die einzelne größte API-Kosten-Stellschraube: 80-90 % Reduktion bei wiederholten System-Prompts; einsetzen für jeden über Aufrufe hinweg wiederholten RAG-System-Prompt.
- Self-Host-Break-even gegenüber API bei ~50 % Auslastung auf einer einzelnen H100 mit 70B bei TP=8; darunter ist die API pro effektivem Token günstiger.
- Model-Routing (70 % klein / 30 % Spitzenmodell) senkt die Gesamtrechnung um 60-80 % bei vernachlässigbarem Qualitätsverlust, wenn der Router anhand eines Held-out-Eval-Sets kalibriert ist.
- Das SAP-AI-Core-Konsumverbrauchsmodell abstrahiert Anbieter-Listenpreise; die vier Kostentreiber (Prompt-Größe, Output-Länge, Modellstufe, Auslastung) gelten weiterhin für die interne Kostenzuordnung.
- Kostenzuordnung pro Anfrage (Kennzeichnung nach Workflow + Nutzer + Mandant, Ledger-Eintrag, Drift-Alarm) ist die FinOps-Mindestdisziplin vor einem Rollout mit 10.000 Nutzern.
- Ein Joule-Deployment mit 10.000 Nutzern bei 200 Aufrufen/Nutzer/Tag auf Spitzenmodell ohne Caching: ~40 Mio. $/Jahr zum Opus-4.7-Listenpreis; mit Caching + Sonnet-Routing: ~2-4 Mio. $/Jahr — eine 10- bis 20-fache Spanne.
Begriffe auf dieser Seite
- Prompt caching
- API-Funktion, bei der wiederholte identische Input-Präfixe (System-Prompts, RAG-Kontext) serverseitig gespeichert und zu 10-25 % des Standard-Input-Satzes abgerechnet werden; Anthropics Implementierung bietet ~90 % Rabatt, die von OpenAI ~75 %.
- Reasoning tokens
- Interne Chain-of-Thought-Tokens, die von Thinking-Modellen erzeugt werden (Claude Extended Thinking, GPT-5-Reasoning, DeepSeek-R1) — zu Output-Sätzen abgerechnet, aber nicht in der sichtbaren Antwort zurückgegeben; können die effektiven Output-Kosten um das 5- bis 20-Fache erhöhen.
- Model router
- Dienst, der jede Anfrage an das kleinste Modell weiterleitet, von dem erwartet wird, dass es die Qualitätsanforderungen erfüllt; das dominierende Kostensenkungsmuster in produktiven LLM-Stacks — ein gut kalibrierter Router senkt 60-80 % der Ausgaben für Spitzenmodelle bei vernachlässigbarem Qualitätsverlust.
- Cost-per-1k-tokens
- Branchenüblicher Stückpreis; seit 2024, als die Preise unter 0,01 $/1k fielen, auf Anbieter-Preisseiten meist pro M Tokens (=1000 × pro 1k) angegeben.
- SAP AI Core consumption unit
- SAPs Abstraktionsschicht über den zugrunde liegenden Modell-API-Kosten auf der BTP; Enterprise-Kunden sehen SAP-gemischte Stückkosten statt Anthropic-/OpenAI-Listenpreise, aber Prompt-Größe, Output-Länge, Modellstufe und Auslastung treiben weiterhin die interne Rechnung.
- FinOps for LLM
- Operative Disziplin, jeden LLM-API-Aufruf mit Workflow-, Nutzer- und Mandanten-IDs zu kennzeichnen; die Nutzung in ein Abrechnungs-Ledger zu schreiben; Kostenalarme pro Mandant zu setzen; und Model-Routing sowie Prompt-Caching vor dem Go-live als erstklassige architektonische Entscheidungen zu implementieren.
- Batch inference pricing
- Die meisten Anbieter bieten 50 % Rabatt für asynchrone Batch-Jobs (kein Echtzeit-SLA); geeignet für nächtliche Analytics-Anreicherung, Dokumentklassifikation und Massen-Zusammenfassung — nicht für interaktive Joule-Anfragen.
- Token budget controller
- System-Prompt-Direktive oder API-Parameter, der die maximale Anzahl an Tokens begrenzt, die ein Modell für internes Reasoning nutzt (z. B. Anthropics `budget_tokens` bei Extended Thinking); entscheidend für die Kostenvorhersehbarkeit bei Workloads der Opus-Klasse.
Quellen
- OpenAI — API Pricing
- Anthropic — Pricing
- Google AI — Gemini API Pricing
- Artificial Analysis — Inference Provider Leaderboard
- Together AI — Open Model Pricing
- SAP AI Core — Consumption-Based Pricing
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
- SAP HANA Platform — Help Portal
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke · die zitierfähigen Kennzahlen.