Détection d'anomalies sur des données financières — HANA PAL et une explication par LLM
À jour au 2026-09-25
Associe la détection d'anomalies déterministe de SAP HANA PAL (via hana-ml) à une couche d'explication du generative AI hub, et fait de la frontière entre les deux la leçon centrale : PAL décide ce qui est anormal, le modèle ne fait que raconter. Couvre OutlierDetectionTS de hana-ml pour les séries temporelles financières (trois méthodes d'extraction de résidu — filtre médian, décomposition saisonnière, combinée — et cinq méthodes de notation avec seuils par défaut documentés : Z1/Z2 à 3, IQR à 1,5, MAD à 3, score Isolation Forest à 0,7) et la classe IsolationForest distincte pour la détection au niveau enregistrement multi-caractéristiques (n_estimators=100, max_samples=256, max_features=0, bootstrap=False par défaut, contamination dans (0, 0,5] valant 0,1 par défaut). Montre comment combiner les deux pour une revue de clôture mensuelle, puis construit un prompt de narration strictement limité aux champs qui interdit explicitement de conclure à une fraude ou une erreur. Se termine par une évaluation en trois volets : précision du détecteur, ancrage de la narration, temps du réviseur.
Ce que vous apprendrez
- Distinguer une question d'anomalie en série temporelle d'une question d'anomalie au niveau enregistrement multi-caractéristiques, et choisir l'outil hana-ml correspondant
- Choisir une méthode d'extraction de résidu (filtre médian, décomposition saisonnière, ou les deux) dans OutlierDetectionTS pour une série temporelle financière donnée
- Choisir parmi les méthodes de notation Z1, Z2, IQR, MAD et Isolation Forest et leurs seuils par défaut, et régler le seuil au regard d'une tolérance aux faux positifs
- Configurer délibérément les paramètres clés d'IsolationForest (n_estimators, max_samples, max_features, bootstrap, contamination) pour une population d'enregistrements
- Écrire un prompt d'orchestration qui raconte une anomalie signalée par PAL à partir de ses seuls champs, en interdisant explicitement une conclusion de fraude ou d'erreur
- Évaluer un pipeline d'anomalie sur la précision du détecteur, la fidélité de la narration et le temps du réviseur — pas sur un seul cas de démonstration
Aperçu du module
À qui s'adresse ce module. Ce module associe deux éléments souvent mal assemblés : un détecteur statistique déterministe et un modèle de langage. La Predictive Analysis Library (PAL) de SAP HANA, via son enveloppe Python hana-ml, effectue le scoring d'anomalie proprement dit — auditable, à seuil, reproductible. Le generative AI hub transforme un enregistrement signalé en une phrase qu'un réviseur peut exploiter. Le vrai sujet du module est la frontière entre les deux : PAL décide ce qui est anormal ; le modèle ne fait que raconter. Inversez cette frontière et vous avez construit un détecteur de fraude non auditable qui hallucine occasionnellement un verdict.
Prérequis
- M333 — Fondamentaux IA et LLM pour consultants SAP (modèles tabulaires face aux LLM, discipline d'ancrage)
- Aisance avec Python et hana-ml, et une connexion HANA Cloud opérationnelle
- Recommandé en parallèle de M338 (SAP HANA PAL en pratique) pour les fondamentaux PAL au-delà de la détection d'anomalies
- Statistiques de base : moyenne, écart-type, quartiles, écart absolu médian
Acquis
- Construire un détecteur d'anomalies en série temporelle sur un vrai KPI financier avec une méthode d'extraction de résidu et de notation justifiée.
- Construire un détecteur Isolation Forest multi-caractéristiques sur une population de transactions avec des paramètres fixés délibérément.
- Écrire un prompt de narration qui résume fidèlement un résultat de PAL et refuse explicitement de conclure à une fraude ou une erreur.
- Mettre en place une évaluation en trois volets (précision, ancrage, temps du réviseur) et l'utiliser pour recalibrer le détecteur.
Module complet réservé aux abonnés. Le module complet ajoute : le cadre de décision · le cas guidé de bout en bout · la grille de KPI · les anti-patterns · les blocs de code · le contrôle de connaissances · les schémas.