Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Instruction tuning (SFT) — Du pré-entraîné à l'utile

Instruction tuning (SFT) — Du pré-entraîné à l'utile — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-07-24T14:00:00Z

Qu'est-ce que Instruction tuning (SFT) — Du pré-entraîné à l'utile ?

Le SFT transforme l'habitude d'un LLM pré-entraîné brut à « continuer le texte » en suivi d'instructions, via fine-tuning sur des paires (instruction, réponse) curées — mais il n'enseigne que le comportement, jamais de nouvelles connaissances.

L'instruction tuning — généralement appelé Supervised Fine-Tuning, ou SFT — est l'étape d'entraînement qui transforme un modèle de langage brut, pré-entraîné, en quelque chose qui se comporte comme un assistant. Un modèle pré-entraîné n'a appris qu'à prédire le mot suivant dans d'énormes quantités de texte ; il n'a aucune notion intégrée qu'une question devrait être suivie d'une réponse plutôt que d'autres questions. Demandez à un modèle purement pré-entraîné « Quelle est la capitale de la France ? » et il pourrait tout aussi bien continuer par « Quelle est la capitale de l'Allemagne ? », parce que, statistiquement, c'est souvent ce qui suit une question dans son corpus d'entraînement. Le SFT est ce qui apprend au modèle qu'une question mérite une réponse, qu'une instruction mérite d'être suivie, et qu'une demande mérite une réponse utile et bien formatée.

Comment cela fonctionne

Le mécanisme est simple au regard de ce qu'il produit. Un jeu de données organisé de paires instruction-réponse — allant de dix mille à quelques millions d'exemples — est utilisé pour poursuivre l'entraînement du modèle pré-entraîné, avec la même fonction de perte de prédiction du mot suivant que le pré-entraînement, mais sur un petit jeu de données soigneusement rédigé plutôt qu'une collecte brute d'internet. Les poids du modèle se déplacent vers la production du style de réponse démontré étant donné un style d'instruction démontré. Point crucial, le SFT n'ajoute pas de nouvelles connaissances sur le monde — celles-ci résident dans l'énorme corpus de pré-entraînement. Le SFT enseigne un comportement : conformité de format, ton, schémas de refus, suivi des instructions.

Pourquoi c'est important

  • Sans SFT, un modèle pré-entraîné répond à « Quelle est la capitale de la France ? » par d'autres questions, pas une réponse — c'est précisément ce défaut que corrige le SFT.
  • Le modèle SFT 1,3 B d'InstructGPT a battu le GPT-3 brut à 175 B dans les évaluations humaines — la preuve que l'alignement pèse plus que l'échelle brute.
  • Le SFT ne fait qu'imiter les démonstrations, sans classer leur qualité — il hérite de chaque exemple confidemment faux du jeu d'entraînement, exactement le vide que comblent RLHF, Constitutional AI et DPO.

Points clés

  • SFT enseigne le comportement (suivi d'instructions, format, ton, refus), PAS la connaissance — la connaissance vient du pré-entraînement.
  • Forme du dataset — 10 k à 1 M paires (instruction, réponse) ; la qualité domine la quantité au-delà de ~50 k exemples (LIMA 2023).
  • Travaux fondateurs — FLAN (Google 2021) multi-tâche ; InstructGPT (OpenAI 2022) libre écrit humain ; Self-Instruct / Alpaca bootstrappé par enseignant.
  • Résultat clé — modèle 1,3 B SFT-tuné préféré au GPT-3 brut 175 B par des humains (InstructGPT 2022) — alignement > échelle sur l'utilité.
  • Limites — pas de notion de classement de qualité, ne peut pas apprendre des négatifs, propage les erreurs de démonstration ; nécessite RLHF/DPO/CAI par-dessus.

Termes employés sur cette page

Supervised Fine-Tuning (SFT)
La phase d'instruction-tuning qui recourt à la prédiction supervisée standard du token suivant sur un jeu de données curé de paires (instruction, réponse) pour apprendre à un LLM pré-entraîné à suivre des instructions et à se comporter comme un assistant ; la phase fondatrice avant toute optimisation par préférences.
FLAN
Travaux de Google en 2021 (Finetuned Language Net) ayant démontré que l'instruction-tuning multi-tâches sur plus de 60 jeux de données NLP formatés en instructions produit une forte généralisation zero-shot vers des tâches inédites.
InstructGPT
Article d'OpenAI en 2022 (Ouyang et al.) combinant le SFT sur des démonstrations libres rédigées par des humains avec le RLHF ; la recette canonique derrière ChatGPT et la preuve qu'un modèle aligné de 1,3 Md de paramètres surpasse un modèle brut de 175 Md sur l'utilité.
LIMA
Résultat de Meta en 2023 (Less Is More for Alignment) montrant que 1 000 exemples de SFT soigneusement curés produisent un modèle compétitif face à plus de 50 000 exemples — la qualité l'emporte sur la quantité dans les données d'instruction.
Decision owner
La personne responsable qui accepte l'arbitrage et finance l'action suivante.
Semantic contract
La définition partagée des termes métier, indicateurs, entités et règles d'accès utilisée par les outils et les équipes.
Control plane
La couche qui applique politique, accès, traçabilité (lineage), supervision et escalade à travers le modèle opérationnel.
Evidence grade
Une étiquette qui distingue le fait vérifié, le signal directionnel, l'hypothèse modélisée et l'observation de terrain.

Sources

  1. Ouyang et al. — Training language models to follow instructions with human feedback (InstructGPT, OpenAI 2022)
  2. Wei et al. — Finetuned Language Models Are Zero-Shot Learners (FLAN, Google 2021)
  3. Zhou et al. — LIMA: Less Is More for Alignment (Meta 2023)
  4. Stanford Alpaca — instruction-tuned LLaMA via Self-Instruct
  5. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  6. SAP News Center — SAP Unveils the Autonomous Enterprise
  7. SAP News Center — The Future of the Enterprise Is Autonomous
  8. SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. SAP Business AI — official product page
  19. SAP Joule (work companion) — official product page
  20. SAP Generative AI — official product page
  21. Stanford HAI — AI Index Report
  22. Meta AI — Llama model research
  23. arXiv — preprint archive (cs.CL/cs.AI)
  24. HuggingFace — model hub
  25. Gartner — research & analyst site
  26. BARC — BI & Analytics research
  27. TDWI — data & analytics research
  28. DSAG — German-speaking SAP user group
  29. ASUG — Americas' SAP User Group
  30. Databricks — official site

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →