AI & Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Génération de données synthétiques — Self-Instruct, Self-Play

Génération de données synthétiques — Self-Instruct, Self-Play — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-09-27

Qu'est-ce que Génération de données synthétiques ?

La génération de données synthétiques dépasse le plafond des données étiquetées humainement en faisant générer un modèle enseignant capable et apprendre un modèle étudiant — Self-Instruct a prouvé qu'un enseignant 175B pouvait bootstraper un étudiant 7B compétitif à partir de seulement 175 prompts seed.

Ce que c'est

La génération de données synthétiques consiste à utiliser un modèle « enseignant » suffisamment puissant pour fabriquer des exemples d'entraînement — paires question-réponse, traductions de code, traces d'appels d'outils, tours de dialogue jugés — qui servent ensuite à entraîner un modèle « élève », plutôt que de payer des humains pour rédiger chaque exemple à la main. C'est devenu la stratégie de fine-tuning par défaut en entreprise dès lors que les modèles de pointe sont devenus capables d'écrire des données de domaine métier constamment justes, plus vite qu'aucune équipe d'annotation ne pourrait en recruter et en calibrer une.

Pourquoi c'est important

Le goulot d'étranglement de presque tout projet de fine-tuning n'est ni le calcul ni l'algorithme — c'est le corpus de départ (« seed »). Une équipe qui veut un modèle capable de traduire de l'ABAP en SQL, ou de répondre à des questions sur un modèle spécifique de SAP Business Data Cloud, dispose typiquement d'une poignée d'exemples rédigés à la main et d'aucune voie réaliste pour recruter des annotateurs qui maîtrisent à la fois le domaine et le format cible suffisamment bien pour en produire des milliers de plus. La génération synthétique transforme cette poignée d'exemples de départ en dizaines, voire centaines de milliers de paires d'entraînement, pour un coût mesuré en tokens d'API plutôt qu'en effectifs d'annotateurs.

Comment ça fonctionne

Trois familles dominent la pratique, et elles résolvent des problèmes différents.

Pourquoi c'est important, en pratique

  • Trois modes d'échec nommés reviennent dans toutes les approches : l'effondrement de mode, l'amplification d'hallucinations (les erreurs de l'enseignant deviennent des étiquettes d'entraînement pour l'étudiant), et la copie verbatim qui crée une exposition au droit d'auteur en aval.
  • Les garde-fous sont précis, pas génériques : déduplication agressive (MinHash + SemDeDup), filtrage factuel contre une vérité de terrain, et journalisation de provenance pour les pistes d'audit Art. 10 + Art. 53 du règlement IA européen.
  • Pour l'analytique SAP, le schéma canonique est concret : générer 50 000-200 000 paires ABAP-vers-SQL et BW-vers-Datasphere à partir d'un jeu seed façonné à la main, filtrer sévèrement, puis LoRA-fine-tuner (C258) sur le résultat.

Points clés

  • Trois familles — Self-Instruct (enseignant génère depuis seeds), Self-Play (modèle joue les deux rôles), Distillation (imiter un enseignant plus fort).
  • Modes d'échec — effondrement de mode, amplification d'hallucinations, copie verbatim depuis l'enseignant ; mitigés par déduplication agressive et filtrage factuel.
  • Garde-fous — déduplication MinHash + SemDeDup, filtrage factuel contre base de référence, journalisation de provenance Art. 10 + Art. 53 du règlement IA sur chaque échantillon.
  • Schéma SAP — API frontière génère 50 K-200 K paires ABAP-SQL / BW-Datasphere / Q-R depuis seeds faits main ; filtrer agressivement ; fine-tuning LoRA (C258).
  • Économie — 50 à 200x moins cher que l'étiquetage humain aux tarifs frontière 2026 ; l'écart de qualité se referme à chaque sortie.
  • La bibliothèque de modèles du generative AI hub de SAP atteint Claude, les modèles OpenAI GPT, Gemini et Mistral via un seul service d'orchestration gouverné — router les appels de génération de données synthétiques à travers lui pour que le masquage de données retire le contenu client réel des prompts seed avant qu'ils n'atteignent un modèle externe.
  • Journaliser la provenance à l'intérieur de la piste d'audit propre de SAP AI Core, pas dans un tableur à part — c'est l'artefact qu'une revue de gouvernance Art. 10/53 du règlement IA croira réellement.
  • À partir du 1ᵉʳ octobre 2026, ABAP AI passe du palier promotionnel gratuit de SAP à un accès commercial mesuré en AI Units — tarifer un pipeline de données synthétiques à 50 K-200 K échantillons par rapport à cette date, pas à une hypothèse de proof-of-concept en palier gratuit.

Termes employés sur cette page

Self-Instruct
Méthode (Wang et al. 2023) où un LLM enseignant amorce un jeu de données d'instructions à partir d'un petit ensemble de départ en générant de nouvelles paires instruction-réponse dans le même style ; l'Alpaca de 7 Md fut la première démonstration largement reconnue.
Self-Play (SPIN)
Procédure d'entraînement où le même modèle génère puis évalue ses propres sorties, un signal de récompense ou un juge sélectionnant les sorties préférées pour le tour d'entraînement suivant ; réduit la dépendance aux étiquettes externes.
Distillation
Entraîner un modèle élève plus petit à imiter les sorties d'un modèle enseignant plus grand (Hinton et al., 2015) ; déplace le coût d'inférence du temps de service vers le temps d'entraînement et produit des modèles compacts conservant une grande partie de la capacité de l'enseignant.
Mode collapse
Mode de défaillance de la génération de données synthétiques où l'enseignant émet de façon répétée une bande étroite de motifs ; l'élève se sur-spécialise alors sur cette bande et échoue sur des entrées hors distribution.
Data masking (orchestration service)
Un module de pipeline configurable dans le service d'orchestration du generative AI hub de SAP qui retire ou pseudonymise les champs sensibles avant qu'un prompt n'atteigne un endpoint LLM — le contrôle pertinent quand les exemples seed pour la génération de données synthétiques proviennent de vrai code ABAP client, de tickets ou de données de configuration.
Provenance logging
Enregistrer quel modèle a généré un échantillon, à partir de quel prompt, et quand, pour chaque exemple d'entraînement synthétique ; exigé par l'Art. 10 (gouvernance des données) et l'Art. 53 (transparence GPAI) du règlement IA européen, et le registre qu'un réviseur de gouvernance demandera réellement à voir.
Golden set
Un petit ensemble d'évaluation étiqueté par des humains et tenu à l'écart, utilisé pour vérifier la qualité réelle d'un modèle entraîné sur données synthétiques ; ne jamais se fier à une évaluation purement synthétique, car elle peut partager les mêmes angles morts que les données d'entraînement synthétiques.

Sources

  1. arXiv: Self-Instruct — Aligning Language Models with Self-Generated Instructions (Wang et al. 2023)
  2. arXiv: Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models (Chen et al. 2024 — SPIN)
  3. Anthropic Responsible Scaling Policy — training-data governance
  4. NIST AI Risk Management Framework 1.0
  5. SAP Business AI — official product page
  6. arXiv — Bai et al. (Anthropic), "Constitutional AI: Harmlessness from AI Feedback" (2022, fetched 2026-09-27)
  7. arXiv — Hinton, Vinyals & Dean, "Distilling the Knowledge in a Neural Network" (2015, fetched 2026-09-27)
  8. Stanford CRFM — Alpaca: A Strong, Replicable Instruction-Following Model (2023-03-13, fetched 2026-09-27)
  9. SAP Help Portal — Orchestration service (data masking, content filtering) in the generative AI hub (fetched 2026-09-27)
  10. SAP Help Portal — generative AI hub model access overview, SAP AI Core (fetched 2026-09-27)
  11. SAP Community — SAP Joule for Developers: end of the promotional period and the path forward (2026, fetched 2026-09-27)
  12. EUR-Lex — Regulation (EU) 2024/1689 (EU AI Act), consolidated text incl. Art. 10 and Art. 53 (fetched 2026-09-27)

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →