RAG vs Fine-tuning vs Apprentissage en contexte — Cadre de décision pour la connaissance SAP
À jour au 2026-10-06
RAG vs Fine-tuning vs Apprentissage en contexte : quelle est la différence ?
La bonne méthode de restitution de connaissance se décide par trois questions — tient-elle dans la fenêtre de contexte, nécessite-t-elle un réentraînement, le corpus dépasse-t-il 128K tokens — pas par la technique la plus à la mode.
Chaque projet d'IA SAP qui place un modèle de langage au-dessus de la connaissance d'entreprise se heurte à la même bifurcation dans ses deux premières semaines : récupère-t-on la connaissance au moment de la requête (RAG), l'intègre-t-on dans les poids du modèle (fine-tuning), ou la remet-on simplement au modèle dans le prompt (apprentissage en contexte) ? Se tromper dans ce choix coûte cher de trois façons différentes — infrastructure doublée, mois de latence ajoutés avant une mise en production, ou modèle qui hallucine avec assurance des codes de transaction SAP devant un client — et la différence entre un architecte IA expérimenté et une équipe pilote enthousiaste se voit généralement dans cette seule décision.
Les trois approches
L'apprentissage en contexte (in-context learning, ICL) place les exemples ou la connaissance pertinents directement dans le prompt au moment de l'inférence. Il ne nécessite aucun pipeline d'entraînement, se déploie en quelques heures, et constitue le choix par défaut correct pour les prototypes et les cas d'usage à faible volume. Son plafond est la fenêtre de contexte — 128 000 tokens pour les modèles Joule sur BTP — et chaque token de cette fenêtre est payé et traité à chaque appel, si bien que le coût croît linéairement avec la quantité de contexte injectée, indépendamment de ce dont le modèle a réellement besoin. La connaissance paramétrique du modèle est en outre figée à la date limite d'entraînement, donc l'ICL seul ne peut pas rendre un modèle conscient de ce qui s'est produit après cette date.
Pourquoi c'est important
- L'apprentissage en contexte se déploie en quelques heures et reste le bon défaut pour les prototypes, mais tout doit tenir dans la fenêtre de 128K tokens de Joule et le coût évolue à chaque appel.
- Le RAG est le standard de production car il gère des millions de pages (SAP Help Portal), reste à jour sans réentraînement, et fournit des citations de sources auditables.
- Le fine-tuning se réserve aux cas exigeant un format de sortie cohérent ou un changement de comportement implicite — pas à l'injection de connaissances fraîches.
Points clés
- ICL : aucun entraînement, déploiement en heures, connaissances dans le prompt — adapté aux PoC et au contenu SAP fréquemment modifié ; limité par la taille de la fenêtre de contexte.
- RAG : index vectoriel externe, récupération au moment de la requête, gère des corpus arbitrairement grands, reste à jour sans réentraînement, fournit des citations sources — standard de production.
- Fine-tuning : met à jour les poids du modèle — justifié uniquement si la conformité au format est non négociable ET les connaissances sont stables ET le volume dépasse ~1M appels/jour.
- La documentation SAP change tous les trimestres : les modèles fine-tunés deviennent obsolètes à chaque cycle ; le RAG reste à jour en réindexant la nouvelle documentation.
- Pattern hybride : RAG (ancrage factuel) + ICL (formatage few-shot) + fine-tuning (structure de sortie uniquement) remporte 80%+ des déploiements enterprise SAP.
- HANA Cloud Vector Engine élimine le besoin d'une base de données vectorielle séparée ; SAP AI Core héberge les modèles d'embedding et de complétion dans le périmètre BTP.
Termes employés sur cette page
- RAG (Retrieval-Augmented Generation)
- Architecture qui récupère les chunks de documents pertinents depuis un index vectoriel au moment de l'inférence et les injecte comme contexte dans le prompt du LLM, ancrant les réponses dans des sources à jour et citables.
- Fine-tuning
- Processus de mise à jour des poids d'un modèle pré-entraîné sur un jeu de données étiquetées spécifique au domaine afin de spécialiser son comportement, son format ou sa connaissance implicite.
- In-context learning (ICL)
- Technique où les instructions de tâche, les exemples et/ou la connaissance sont placés directement dans le prompt au moment de l'inférence ; ne requiert aucun entraînement.
- Few-shot prompting
- Forme d'ICL où 3 à 10 exemples entrée-sortie sont inclus dans le prompt pour démontrer le format de réponse ou le schéma de raisonnement souhaité.
- Knowledge cutoff
- La date jusqu'à laquelle s'étend la connaissance paramétrique (figée dans les poids) d'un modèle ; ICL et fine-tuning y sont tous deux bornés pour les faits non fournis à l'inférence — seul le RAG peut faire surgir une information créée après cette date, car il récupère plutôt qu'il ne se souvient.
- Grounding d'orchestration
- Le terme de SAP (dans le generative AI hub) pour le mécanisme RAG configuré comme module du service d'orchestration — récupère et injecte le contenu pertinent avant l'appel au LLM ; l'implémentation de production du schéma RAG que décrit cette fiche, sur la pile propre de SAP.
- Nombre de passages récupérés (k)
- Le nombre de chunks les mieux classés qu'un pipeline RAG renvoie par requête ; un k trop petit risque de manquer la réponse, un k trop grand réintroduit la dégradation lost-in-the-middle et gonfle le coût en tokens — à régler par corpus et type de requête, pas fixé globalement.
- Oubli catastrophique
- Le risque qu'un fine-tuning sur un jeu de données étroit dégrade les capacités générales d'un modèle hors du périmètre de ce jeu de données ; une raison de garder le fine-tuning étroitement cadré sur le format ou le comportement plutôt que de l'utiliser comme méthode générale d'injection de connaissance.
Sources
- Lewis et al. — Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (2020)
- SAP AI Core — model fine-tuning guide on BTP
- Gao et al. — Retrieval-Augmented Generation for Large Language Models: A Survey (2023)
- SAP HANA Cloud Vector Engine — developer guide
- SAP Business AI — official product page
- SAP Joule (work companion) — official product page
- SAP Help Portal — Generative AI Hub overview, SAP AI Core (2026)
- Hu et al. — LoRA: Low-Rank Adaptation of Large Language Models, arXiv:2106.09685 (2021)
- OpenAI — Fine-tuning guide (platform documentation)
- Brown et al. — Language Models are Few-Shot Learners (GPT-3, in-context learning), arXiv:2005.14165 (2020)
- Anthropic — Prompt engineering / few-shot prompting documentation
- Wei et al. — Finetuned Language Models Are Zero-Shot Learners, arXiv:2109.01652 (2021)
Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.