Incident- und Problem-Management
Stand 2026-09-03
Ein Ausfall der Analytics-Plattform ist nicht der Moment, um die Ursache zu untersuchen — es ist der Moment, den Service auf dem schnellsten sicheren Weg wiederherzustellen, gemäß der ITIL-Kernunterscheidung zwischen Incident Management (Service wiederherstellen, MTTR-getrieben) und Problem Management (dauerhafte Behebung, verhindert Wiederholung). Dieses Modul definiert ein vierstufiges Schweregradmodell für Datasphere-/SAC-/BW-Incidents, ein geschichtetes On-Call-Design (Tier 1 First Responder bis Tier 3 SAP-Support), die Runbook-Inhalte, die jedes Plattformteam pflegen muss (benannte Runbooks für Datenfluss-Ausfälle, HANA-OOM, SAC-Ladefehler, BW/4HANA-Prozesskettenausfälle), die Five-Whys-RCA-Methode angewendet auf eine reale Incident-Kette und die MTTR-/Problem-Closure-/Wiederholungsvorfall-Metriken, die reife Operations von Feuerwehreinsätzen unterscheiden. Der Teilnehmer geht mit einer Schweregradmatrix, einem On-Call-Design und einer Governance-Vorlage für Problem-Records.
Was Sie lernen
- Die Kernkonzepte hinter Incident- und Problem-Management verstehen
- ITIL in einem typischen SAP-Analytics-Engagement anwenden
- Die 3-5 häufigen Fehler erkennen und wissen, wie man sie vermeidet
- Diese Fähigkeit in der eigenen Personal-Brand- und Tagessatz-Konversation positionieren
Incident- und Problem-Management für SAP-Analytics-Plattformen
Die Unterscheidung zwischen Service wiederherstellen und Wiederholung verhindern ist das Kernprinzip von ITIL Incident- und Problem-Management — und sie wird im Betrieb von Analytics-Plattformen häufig verwischt, mit kostspieligen Folgen. Ein Ausfall der Analytics-Plattform um 07:30 an einem Montagmorgen, wenn CFO-Reporting-Dashboards schwarz sind, ist nicht der Moment, um Ursachen zu untersuchen. Es ist der Moment, den Service auf dem schnellsten sicheren Weg wiederherzustellen. Die Untersuchung folgt später, in einem strukturierten Problem-Record, und führt zu einer dauerhaften Behebung, die verhindert, dass diese Incident-Klasse erneut auftritt.
ITIL-Konzepte, angewendet auf Analytics-Plattformen
Ein Incident ist jede ungeplante Unterbrechung oder Qualitätsminderung eines IT-Service. Für eine Analytics-Plattform gehören dazu: SAP Analytics Cloud, das 503-Fehler zurückgibt; ein Datasphere-Datenfluss, der mit einem Verbindungs-Timeout fehlschlägt; SAP HANA Cloud, das in einen Speicherdruck-Zustand gerät, der Query-Ablehnungen verursacht; ein BTP-Subaccount-Authentifizierungsdienst, der nicht erreichbar ist; ein geplanter Report, der bis zu seiner SLA-Frist nicht aktualisiert wird. Incidents werden vom Service Desk und dem On-Call-Engineering gemanagt, gegen eine Ziel-MTTR (Mean Time to Restore) gelöst und geschlossen, sobald der normale Service wiederhergestellt ist — nicht sobald die Ursache verstanden ist.
Voraussetzungen
- Fortgeschrittene Praxiserfahrung in SAP-Analytics-Projekten
- Kernkonzepte zuerst wiederholen: C038, C041, C040
Lernergebnisse
- Ein realistisches Szenario durcharbeiten: Ein europäischer Handelskonzern, der Datasphere, SAC betreibt.
- Das Anti-Pattern erkennen und vermeiden: HANA Cloud als erste Reaktion auf ein OOM neu starten.
- Die Kernentscheidung des Moduls anwenden: Wo die Sev-1-Grenze gezogen wird — Sev-1 für vollständige Nichtverfügbarkeit oder einen Single-Point-Failure, der alle Nutzer trifft, reservieren.
- Mastery mit dem KPI verfolgen: Severity-1-MTTR (Median) (Ziel: unter 2 Stunden; Warnsignal: Der Median verbessert sich, während der P90-MTTR derselben Stufe sich verschlechtert -- der Incident-Mix wird manipuliert, nicht die Reaktion).
Vollständiges Modul für Mitglieder. Das vollständige Modul ergänzt: den Entscheidungsrahmen · das durchgehende Szenario · die KPI-Scorecard · die Anti-Muster · die Codeblöcke · die Wissenskontrolle · die Schemata.