Stratégies d'échantillonnage
À jour au 2026-07-24T14:00:00Z
Qu'est-ce que Stratégies d'échantillonnage ?
Un échantillonneur mal configuré est la cause la plus fréquente de variance inexpliquée en production — et pour les flux SAP/Joule critiques d'audit, T=0 avec seed fixe et version de modèle journalisée est ce qui satisfait réellement la reproductibilité de l'EU AI Act Article 9.
Les stratégies d'échantillonnage sont les algorithmes qui décident comment un modèle de langage choisit le prochain token à partir de la distribution de probabilité que produit sa dernière couche. Elles se situent à la toute dernière étape entre un modèle entraîné et ce qui apparaît réellement à l'écran, ce qui fait d'un échantillonneur mal configuré l'une des causes les plus courantes — et les plus négligées — d'un comportement incohérent dans un déploiement LLM en production.
Le problème qu'elles résolvent
Toujours choisir le token le plus probable, appelé décodage glouton, produit un texte qui dégénère en boucles : comme chaque choix renforce la probabilité de choisir quelque chose de similaire ensuite, le modèle se retrouve à répéter une expression ou une structure de phrase. L'échantillonnage purement aléatoire à partir de la distribution brute va dans l'autre sens et produit un texte fluide mot à mot mais incohérent dans son ensemble. Tout déploiement pratique se situe quelque part entre ces deux extrêmes, et l'endroit où il doit se situer dépend entièrement de la tâche.
Les principaux paramètres
La température rééchelonne la distribution de sortie du modèle avant l'étape finale de normalisation : une température de un laisse la distribution entraînée telle quelle, une température inférieure à un l'aiguise vers les tokens les plus probables et pousse la sortie vers le déterminisme, et une température s'approchant de zéro la fait s'effondrer vers un décodage glouton.
Pourquoi c'est important
- Température et top-p sont largement redondants — la plupart des praticiens fixent l'un et font varier l'autre, simplifiant ce qui semble être une large surface de réglage.
- Une pénalité de répétition au-dessus de 1,15 peut casser activement les sorties structurées (tableaux JSON, clauses SQL) en supprimant la répétition légitime — un mode d'échec concret à tester.
- Le min-p gagne en adoption car plus stable que le top-p à haute température — à connaître avant de généraliser l'échantillonnage nucleus partout.
Points clés
- La température T=0 donne une sortie déterministe greedy (argmax) ; T=1.0 laisse la distribution entraînée inchangée ; T>1 aplatit vers l'uniforme.
- Top-p et température sont largement redondants — choisir un seul axe à ajuster. Top-p=0.9 avec T=1.0 est la référence créative la plus robuste.
- Top-k=40 est un défaut créatif courant ; top-k=1 équivaut au greedy et est totalement déterministe.
- Une pénalité de répétition au-delà de 1.15 supprime les répétitions légitimes dans les sorties structurées (JSON, SQL, XML) — la maintenir à 1.0–1.1 pour les tâches de code et d'extraction.
- Min-p (2023) : fixe un plancher de probabilité comme fraction de la masse du token le mieux classé ; min_p=0.05 est plus stable en température que top-p et gagne en adoption dans les runtimes open-weight (llama.cpp, vLLM).
- Le beam search (k=4–8 beams) améliore la qualité pour les sorties structurées contraintes mais multiplie le calcul d'inférence par k — prohibitif en coût dans les pipelines à haut débit ou agentiques.
- Reproductibilité EU AI Act Art. 9 : T=0, seed fixe, version de modèle + configuration de sampling journalisées sont obligatoires pour les intégrations SAP critiques pour l'audit classées systèmes à haut risque.
- SAP Joule utilise des configurations de sampling gérées en interne ; comprendre ces paramètres compte lors de la construction d'agents LLM personnalisés via BTP AI Core ou de modèles open-weight aux côtés de Joule.
- Pour l'extraction, la classification et la génération SQL : toujours T=0. Pour l'explication, la synthèse, le brainstorming : T=0.7–1.0 avec top-p=0.9–0.95.
- Journaliser la configuration de sampling complète (T, top-p, top-k, seed, version du modèle) avec chaque sortie LLM en production — sans cela, déboguer des échecs non déterministes est structurellement impossible.
Termes employés sur cette page
- Temperature (T)
- Facteur d'échelle appliqué aux logits avant le softmax : z/T. T<1 accentue la distribution vers l'argmax ; T>1 l'aplatit vers l'uniforme ; T=0 correspond au greedy déterministe (argmax).
- Nucleus sampling (top-p)
- Restreint la sélection des tokens au plus petit ensemble de candidats dont la probabilité cumulée ≥ p, ajustant dynamiquement la taille du pool de candidats selon l'entropie de la distribution (Holtzman et al. 2019).
- Top-k sampling
- Restreint la sélection des tokens aux k tokens de plus forte probabilité exactement, indépendamment de leur masse de probabilité cumulée.
- Min-p sampling
- Fixe un plancher de probabilité en fraction de la probabilité du token de tête : les tokens tels que p < min_p × p_top sont exclus. Plus stable que le top-p à température élevée ; adoption croissante dans les runtimes à poids ouverts (2023).
- Repetition penalty
- Multiplicateur >1 appliqué aux logits des tokens déjà générés pour réduire les boucles ; au-delà de 1,15, il peut supprimer des répétitions légitimes dans des sorties structurées telles que les tableaux JSON ou les clauses SQL.
- Greedy decoding
- Échantillonnage déterministe qui sélectionne toujours le token suivant de plus forte probabilité ; équivalent à T→0 ou top-k=1. Le mode requis pour les tâches critiques pour l'audit et à sortie structurée.
- Beam search
- Maintient k séquences candidates (beams) en parallèle à chaque étape de décodage, en retenant à la fin la séquence globalement la plus probable ; améliore la qualité des sorties contraintes au prix d'un coût de calcul multiplié par k.
- KV cache
- Les projections clé-valeur mises en cache issues des étapes d'attention précédentes, permettant un décodage autorégressif efficace sans recalculer l'attention sur l'ensemble du contexte à chaque étape.
Sources
- Holtzman et al. 2019 — The Curious Case of Neural Text Degeneration (nucleus sampling)
- OpenAI API reference — sampling parameters
- Anthropic API reference — sampling parameters
- Stahlberg & Byrne 2019 — On NMT Search Errors and Model Errors
- EU AI Act Article 9 — Risk Management System (reproducibility requirements)
- Shah et al. 2024 — FlashAttention-3: Fast and Accurate Attention on Hopper GPUs
- vLLM documentation — sampling parameters
- SAP BTP AI Core — Generative AI Hub documentation
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- SAP Business AI — official product page
- SAP Joule (work companion) — official product page
- SAP Generative AI — official product page
- Stanford HAI — AI Index Report
- Meta AI — Llama model research
- arXiv — preprint archive (cs.CL/cs.AI)
- HuggingFace — model hub
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.