AI & Analytics Legends La plateforme de connaissance SAP Analytics
Module d'académie

Post-entraînement et fine-tuning — SFT, RLHF, Constitutional AI, DPO et LoRA, et quand une équipe SAP doit-elle affiner un modèle

Post-entraînement et fine-tuning — SFT, RLHF, Constitutional AI, DPO et LoRA, et quand une équipe SAP doit-elle affiner un modèle — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-10-04

Explique comment les modèles deviennent des assistants après le pré-entraînement (fine-tuning supervisé, RLHF, Constitutional AI et RLAIF, DPO), comment LoRA et QLoRA rendent l'adaptation abordable, et ce que SAP documente sur SAP AI Core : consommation et orchestration de modèles de fournisseurs, grounding, optimisation de prompt, SAP-ABAP-1 entraîné par SAP, prédiction en contexte avec SAP-RPT-1 et restriction sur la génération de données d'entraînement synthétiques. Il propose ensuite un cadre de décision RAG contre fine-tuning contre apprentissage en contexte, fondé sur des preuves publiées (le RAG bat le fine-tuning pour les faits ; LIMA et LoRA pour le comportement) et un cadrage honnête de coût et d'effort où données, évaluation, service et retrait du modèle de base dominent. L'atelier aboutit à une note « affiner ou non ».

Ce que vous apprendrez

  • Situer pré-entraînement, fine-tuning supervisé, RLHF, Constitutional AI/RLAIF, DPO et pré-entraînement continu dans le cycle de vie d'un modèle et dire quelle opération une demande client décrit réellement
  • Expliquer les trois étapes du RLHF (SFT, modèle de récompense, PPO avec pénalité KL) et pourquoi la sur-optimisation de la récompense en fait une activité de fournisseur de modèle
  • Expliquer les deux phases de la Constitutional AI et le RLAIF, ainsi que la perte DPO sur des paires choisi/rejeté face à un modèle de référence gelé
  • Expliquer LoRA et QLoRA (base gelée, matrices de bas rang entraînables, base quantifiée) et leurs conséquences opérationnelles : petits adaptateurs interchangeables, oubli et limites de qualité
  • Lire la documentation SAP avec précision : ce que propose le generative AI hub (consommation, orchestration, grounding, optimisation de prompt), ce que SAP a affiné lui-même (SAP-ABAP-1), où l'apprentissage en contexte remplace l'entraînement (SAP-RPT-1) et la restriction sur les données d'entraînement synthétiques
  • Appliquer un cadre de décision (RAG contre fine-tuning contre apprentissage en contexte) avec un jeu de référence et une estimation honnête de coût et d'effort, et rédiger une note « affiner ou non »

Aperçu du module

À qui s'adresse ce module. Vous savez construire un assistant ancré sur le SAP generative AI hub et on vient de vous poser la question que reçoit toute équipe IA SAP : « faut-il affiner (fine-tuner) le modèle sur nos données ? » Ce module explique comment les modèles deviennent utiles et sûrs après le pré-entraînement (fine-tuning supervisé, RLHF, Constitutional AI, DPO), comment fonctionne le fine-tuning économe en paramètres avec LoRA, et ce que SAP propose réellement sur SAP AI Core, pour que vous répondiez par une décision plutôt que par un réflexe. Il suppose M333 (fondamentaux IA et LLM) et gagne à suivre M391 (rouages des LLM), M325 (generative AI hub en pratique) et M365 (coût des LLM). Il est volontairement sceptique : pour la plupart des problèmes de connaissance SAP, le fine-tuning est le mauvais outil, preuves à l'appui. Les sources primaires sont les articles originaux et la documentation des éditeurs ; les chiffres de coût et d'effort que SAP ne publie pas sont signalés comme des estimations éditoriales de planification.

Prérequis

  • Avoir suivi M333 (fondamentaux IA et LLM pour consultants SAP) ou disposer d'une connaissance équivalente des tokens, plongements, grounding et contexte
  • Recommandé : M391 (rouages des LLM pour architectes SAP) pour les bases sur l'attention, le cache KV et la quantification
  • Facultatif : un accès à un tenant SAP AI Core avec le plan étendu, ou la documentation SAP sur le generative AI hub, l'orchestration et le grounding, pour réaliser les mesures de base de l'atelier

Acquis

  • Dire précisément quel type d'adaptation une demande client décrit (style, tâche, faits, sécurité) et quelle méthode, le cas échéant, y répond.
  • Expliquer RLHF, Constitutional AI, DPO et LoRA à un sponsor technique en deux minutes chacun, avec les bons compromis.
  • Décrire ce que SAP AI Core documente aujourd'hui pour la consommation de modèles, les modèles entraînés par SAP et la prédiction en contexte, sans promettre un service de fine-tuning managé que la documentation examinée ne décrit pas.
  • Mener une comparaison sur jeu de référence entre prompt, few-shot, grounding et (si justifié) un pilote LoRA, et en défendre le résultat.
  • Rédiger une note « affiner ou non » avec une estimation honnête de coût et d'effort incluant données, évaluation, service et retrait du modèle.

Module complet réservé aux abonnés. Le module complet ajoute : le cadre de décision · le cas guidé de bout en bout · la grille de KPI · les anti-patterns · les blocs de code · le contrôle de connaissances · les schémas.

Ouvrir dans l'application →