Reasoning-Modelle — Claude Extended Thinking, GPT-o4, Gemini Thinking
Stand 2026-07-23
Was ist Reasoning-Modelle — Claude Extended Thinking, GPT-o4, Gemini Thinking?
Reasoning-Modelle wenden pro schwieriger Anfrage über eine interne Gedankenkette (Chain-of-Thought) das 10- bis 100-Fache an Inferenz-Rechenleistung auf, und die richtige Architektur leitet nur die 5-15 % der tatsächlich schwierigen Agenten-Aufrufe an sie weiter, nicht jeden Aufruf.
Worum es geht
Reasoning-Modelle sind der architektonische Wendepunkt von 2026, den der Stanford HAI AI Index 2026 als technisches Fundament der Agentic-AI-Kategorie dokumentiert. Sie unterscheiden sich von Baseline-LLMs in einer entscheidenden Achse: Zur Inferenzzeit wenden sie zusätzliche Rechenleistung auf eine interne Gedankenkette (Chain-of-Thought) an, bevor sie die endgültige Antwort erzeugen — das „Denken“ des Modells ist selbst ein Rechenschritt, kein bloßer Prompt-Engineering-Trick. Die drei produktionsreifen Varianten im Jahr 2026 sind Anthropics Claude Extended Thinking, OpenAIs GPT-o4 und Googles Gemini Thinking.
Warum es zählt
- Die Benchmark-Signatur ist unverkennbar: GPQA Diamond springt von 40-50 % Baseline auf 70-85 % mit aktiviertem Reasoning, und Reasoning-Modelle überschreiten Wettbewerbsmathematik-Schwellenwerte, die Baseline-Modelle nie erreichen.
- Die Kosten sind real — 30-120 Sekunden pro schwieriger Antwort gegenüber 2-5 Sekunden bei einem Baseline-LLM, und 5- bis 20-fach höhere Token-Kosten pro Anfrage.
- Jeder Anbieter liefert eine eigene Variante in ein eigenes Produkt: Claude Extended Thinking (sichtbare Spuren, SAPs autonome Supply-Chain-Agenten), GPT-o4 (standardmäßig verborgen, Microsoft Copilot Studio), Gemini Thinking (sichtbar, Databricks Mosaic AI).
Kernpunkte
- Reasoning-Modelle wenden variable Rechenleistung zur Inferenzzeit auf eine interne Gedankenkette an, bevor sie antworten — der architektonische Wendepunkt von 2026 laut Stanford HAI AI Index 2026.
- Benchmark-Signatur bei GPQA Diamond — 70-85 % mit Reasoning gegenüber 40-50 % Baseline; die Lücke ist die kanonische Kennzahl für den „Wert des Reasoning-Modus“.
- Drei produktionsreife Varianten — Claude Extended Thinking (Anthropic, sichtbare Spuren, von SAP für Supply-Chain-Agenten genutzt) · GPT-o4 (OpenAI, standardmäßig verborgen, Copilot Studio) · Gemini Thinking (Google, Vertex AI, Databricks Mosaic AI).
- Abwägung — 30-120 s Latenz gegenüber 2-5 s Baseline · 5- bis 20-fache Kosten pro Anfrage · nur gerechtfertigt für die 5-15 % der Agenten-Aufrufe, bei denen die Frage wirklich schwierig ist.
- Hybrides Routing-Muster — Joule Studio 2.0 (Juni 2026) routet automatisch zwischen Reasoning und Baseline; die Architekturentscheidung, die ein Berater gegenüber dem CFO des Kunden verteidigt.
- Reasoning-Modelle — Claude Extended Thinking, GPT-o4, Gemini Thinking ist erst beherrscht, wenn es eine benannte Kaufentscheidung verändert.
- Beginnen Sie mit dem semantischen Vertrag und dem Kontrollmodell, bevor Sie das Tool demonstrieren.
- Nutzen Sie aktuelle SAP-, Analysten-, Studien-, Knowledge-Graph- und News-Signale als Beleg, nicht als Dekoration.
- Trennen Sie verifizierte Fakten von richtungsweisenden Trends und modellierten Annahmen.
- Definieren Sie Verantwortlichen, Kennzahl, Schwellenwert, Support-Pfad und Rollback, bevor Sie skalieren.
Begriffe auf dieser Seite
- Extended Thinking
- Anthropics Bezeichnung für den Modus variabler Rechenleistung zur Inferenzzeit bei Claude, bei dem das Modell vor der endgültigen Antwort eine sichtbare Chain-of-Thought-Spur erzeugt; der Thinking-Budget-Parameter ist vom aufrufenden Agenten steuerbar.
- GPT-o4
- OpenAIs 2026er Reasoning-Modell-Variante; standardmäßig verborgene Gedankenkette, optionale zusammengefasste Spuren; die Variante, die Microsoft Copilot Studio für hochkomplexe Agenten-Workflows bereitstellt.
- Gemini Thinking
- Googles 2026er Reasoning-Modell-Variante; sichtbares Denken, native Vertex-AI-Integration; die Variante, die am stärksten in Databricks-Mosaic-AI-Agenten eingebettet ist.
- Hybrides Routing
- Das architektonische Muster, bei dem eine Agentenplattform jeden Aufruf zwischen einem Reasoning-Modell (5-15 % schwieriger Fragen) und einem Baseline-LLM (85 % Routine) routet, um Genauigkeit, Latenz und Kosten auszubalancieren; Joule Studio 2.0 (Juni 2026) implementiert dies nativ.
- Entscheidungsverantwortlicher
- Die verantwortliche Person, die den Trade-off akzeptiert und die nächste Maßnahme finanziert.
- Semantischer Vertrag
- Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
- Kontrollebene
- Die Schicht, die Policy, Zugriff, Lineage, Monitoring und Eskalation über das Betriebsmodell hinweg durchsetzt.
- Evidenzgrad
- Eine Kennzeichnung, die verifizierte Fakten, richtungsweisende Signale, modellierte Annahmen und Feldbeobachtungen unterscheidet.
Quellen
- Stanford HAI AI Index Report 2026 §1 Technical performance — reasoning-model inflection
- Anthropic — Claude Extended Thinking documentation
- Analytics Legends news — SAP autonomous supply chain agents (Claude embedded) Sapphire 2026
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
- SAP Help Portal — Administering SAP Datasphere: Enable Joule for SAP Datasphere
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- SAP Business AI — official product page
- SAP Joule (work companion) — official product page
- SAP Generative AI — official product page
- Stanford HAI — AI Index Report
- Meta AI — Llama model research
- arXiv — preprint archive (cs.CL/cs.AI)
- HuggingFace — model hub
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke.