Audio- und Sprach-Foundation-Modelle in SAP-Workflows
Stand 2026-07-24T14:00:00Z
Was ist Audio- und Sprach-Foundation-Modelle in SAP-Workflows?
Whisper-basierte Transkription senkt die Zeit für die Einreichung von Spesennotizen in SAP Concur von 4,2 auf 1,1 Minuten pro Position, indem Sprachnotizen, die für SAP-Analysen bisher unsichtbar waren, in strukturierte Felder umgewandelt werden.
Worum es geht
Audio- und Sprach-Foundation-Modelle wandeln gesprochene Sprache in strukturierten Text um — automatische Spracherkennung, oder ASR — und übernehmen zunehmend auch semantische Aufgaben direkt am Audiosignal selbst, etwa Speaker-Diarisation, Emotionserkennung und Spracherkennung. Das Modell, das diese Kategorie definiert, ist Whisper, 2022 von OpenAI veröffentlicht: ein Transformer-Sequence-to-Sequence-Modell, trainiert auf 680.000 Stunden mehrsprachigem Audio, das mit Wortfehlerraten aufwartet, die mit kommerziellen ASR-APIs konkurrieren können — zu praktisch null Grenzkosten, sobald selbst gehostet. Der SAP-Schmerzpunkt, den Whisper adressiert, ist struktureller Natur: Audio, das von Außendiensttechnikern, Callcenter-Agenten, Spesenerläuterungen und Meeting-Aufnahmen erzeugt wird, ist für SAP-Analysen aus einem einfachen Grund unsichtbar — es liegt in MP3- oder WAV-Dateien vor, nicht in Tabellenfeldern, und nichts in einer Standard-S/4HANA-Landschaft kann eine Audio-Wellenform abfragen.
Warum es zählt
- Whisper ist auf 680.000 Stunden mehrsprachigem Audio trainiert und erreicht kommerzielle ASR-APIs bei null Grenzkosten, sobald selbst gehostet.
- Callcenter-QA diarisiert und bewertet jeden Anruf gegen eine Compliance-Checkliste und speist strukturierte Bewertungen in ein CRM-Fallfeld und ein SAC-Dashboard ein.
- Field-Service-Sprachnotizen werden transkribiert und entitätenextrahiert, um S/4HANA-PM-Meldungen vorzufüllen, wodurch die manuelle Dateneingabe für Techniker entfällt.
Kernpunkte
- Whisper large-v3: trainiert auf 680.000 Stunden mehrsprachigem Audio, Open Source, läuft 50× Echtzeit auf einer A10G-GPU.
- Keine native Diarisation — pyannote.audio für die Sprechertrennung in Callcenter-QA-Anwendungsfällen anhängen.
- SAP-Concur-Spesenerläuterung: 4,2 Min. → 1,1 Min. pro Position in Enterprise-Pilots.
- Streaming-Latenz: 300-800 ms zusätzliche Pufferung gegenüber Batch — für Echtzeit-IVR vermeiden.
- SAP Meeting Insights (GA H1 2025) ist der SAP-native Wrapper für Meeting-Transkription + strukturierte Ausgabe.
- Audio- und Sprach-Foundation-Modelle in SAP-Workflows ist erst beherrscht, wenn sie die Entscheidung eines konkret benannten Buyers verändert.
- Zuerst den semantischen Vertrag und das Kontrollmodell klären, bevor das Tool vorgeführt wird.
- Aktuelle SAP-, Analysten-, Studien-, KG- und News-Signale als Beleg nutzen, nicht als Dekoration.
- Verifizierte Fakten klar von richtungsweisenden Trends und modellierten Annahmen trennen.
- Vor dem Skalieren Owner, Kennzahl, Schwellenwert, Support-Pfad und Rollback festlegen.
Begriffe auf dieser Seite
- Whisper
- OpenAI-2022-Sequence-to-Sequence-ASR-Modell. Trainiert auf 680.000 Stunden mehrsprachigem Audio. Verfügbar als Open-Source-Gewichte (small/medium/large-v3). Keine native Diarisation.
- WER
- Word Error Rate — die Standard-Genauigkeitskennzahl für ASR. WER = (Substitutionen + Auslassungen + Einfügungen) / Anzahl Referenzwörter. Whisper large-v3 erreicht ~2,7 % WER auf englischem LibriSpeech clean.
- Diarisation
- Trennung von Audio nach Sprecheridentität — „wer hat wann gesprochen". Whisper enthält dies nicht nativ; pyannote.audio ist die Standard-Begleitbibliothek.
- SAP Meeting Insights
- SAP-BTP-Service (GA H1 2025), der Meeting-Aufnahmen transkribiert, zusammenfasst und Aktionspunkte extrahiert und strukturierte Ausgaben in verknüpfte SAP-Collaboration-Datensätze schreibt.
- Entscheidungsverantwortlicher
- Die verantwortliche Person, die den Trade-off akzeptiert und die nächste Maßnahme finanziert.
- Semantischer Vertrag
- Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
- Kontrollebene
- Die Schicht, die Policy, Zugriff, Lineage, Monitoring und Eskalation über das gesamte Betriebsmodell hinweg durchsetzt.
- Evidenzgrad
- Eine Kennzeichnung, die verifizierte Fakten, richtungsweisende Signale, modellierte Annahmen und Feldbeobachtungen voneinander unterscheidet.
Quellen
- Whisper paper — Radford et al. OpenAI 2022
- SAP Concur Expense — SAP Help Portal
- SAP Field Service Management — SAP Help Portal
- pyannote.audio speaker diarisation library
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- SAP Business AI — official product page
- SAP Joule (work companion) — official product page
- SAP Generative AI — official product page
- Stanford HAI — AI Index Report
- Meta AI — Llama model research
- arXiv — preprint archive (cs.CL/cs.AI)
- HuggingFace — model hub
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke · die zitierfähigen Kennzahlen.