Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Stratégies d'échantillonnage

Stratégies d'échantillonnage — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-07-24T14:00:00Z

Qu'est-ce que Stratégies d'échantillonnage ?

Un échantillonneur mal configuré est la cause la plus fréquente de variance inexpliquée en production — et pour les flux SAP/Joule critiques d'audit, T=0 avec seed fixe et version de modèle journalisée est ce qui satisfait réellement la reproductibilité de l'EU AI Act Article 9.

Les stratégies d'échantillonnage sont les algorithmes qui décident comment un modèle de langage choisit le prochain token à partir de la distribution de probabilité que produit sa dernière couche. Elles se situent à la toute dernière étape entre un modèle entraîné et ce qui apparaît réellement à l'écran, ce qui fait d'un échantillonneur mal configuré l'une des causes les plus courantes — et les plus négligées — d'un comportement incohérent dans un déploiement LLM en production.

Le problème qu'elles résolvent

Toujours choisir le token le plus probable, appelé décodage glouton, produit un texte qui dégénère en boucles : comme chaque choix renforce la probabilité de choisir quelque chose de similaire ensuite, le modèle se retrouve à répéter une expression ou une structure de phrase. L'échantillonnage purement aléatoire à partir de la distribution brute va dans l'autre sens et produit un texte fluide mot à mot mais incohérent dans son ensemble. Tout déploiement pratique se situe quelque part entre ces deux extrêmes, et l'endroit où il doit se situer dépend entièrement de la tâche.

Les principaux paramètres

La température rééchelonne la distribution de sortie du modèle avant l'étape finale de normalisation : une température de un laisse la distribution entraînée telle quelle, une température inférieure à un l'aiguise vers les tokens les plus probables et pousse la sortie vers le déterminisme, et une température s'approchant de zéro la fait s'effondrer vers un décodage glouton.

Pourquoi c'est important

  • Température et top-p sont largement redondants — la plupart des praticiens fixent l'un et font varier l'autre, simplifiant ce qui semble être une large surface de réglage.
  • Une pénalité de répétition au-dessus de 1,15 peut casser activement les sorties structurées (tableaux JSON, clauses SQL) en supprimant la répétition légitime — un mode d'échec concret à tester.
  • Le min-p gagne en adoption car plus stable que le top-p à haute température — à connaître avant de généraliser l'échantillonnage nucleus partout.

Points clés

  • La température T=0 donne une sortie déterministe greedy (argmax) ; T=1.0 laisse la distribution entraînée inchangée ; T>1 aplatit vers l'uniforme.
  • Top-p et température sont largement redondants — choisir un seul axe à ajuster. Top-p=0.9 avec T=1.0 est la référence créative la plus robuste.
  • Top-k=40 est un défaut créatif courant ; top-k=1 équivaut au greedy et est totalement déterministe.
  • Une pénalité de répétition au-delà de 1.15 supprime les répétitions légitimes dans les sorties structurées (JSON, SQL, XML) — la maintenir à 1.0–1.1 pour les tâches de code et d'extraction.
  • Min-p (2023) : fixe un plancher de probabilité comme fraction de la masse du token le mieux classé ; min_p=0.05 est plus stable en température que top-p et gagne en adoption dans les runtimes open-weight (llama.cpp, vLLM).
  • Le beam search (k=4–8 beams) améliore la qualité pour les sorties structurées contraintes mais multiplie le calcul d'inférence par k — prohibitif en coût dans les pipelines à haut débit ou agentiques.
  • Reproductibilité EU AI Act Art. 9 : T=0, seed fixe, version de modèle + configuration de sampling journalisées sont obligatoires pour les intégrations SAP critiques pour l'audit classées systèmes à haut risque.
  • SAP Joule utilise des configurations de sampling gérées en interne ; comprendre ces paramètres compte lors de la construction d'agents LLM personnalisés via BTP AI Core ou de modèles open-weight aux côtés de Joule.
  • Pour l'extraction, la classification et la génération SQL : toujours T=0. Pour l'explication, la synthèse, le brainstorming : T=0.7–1.0 avec top-p=0.9–0.95.
  • Journaliser la configuration de sampling complète (T, top-p, top-k, seed, version du modèle) avec chaque sortie LLM en production — sans cela, déboguer des échecs non déterministes est structurellement impossible.

Termes employés sur cette page

Temperature (T)
Facteur d'échelle appliqué aux logits avant le softmax : z/T. T<1 accentue la distribution vers l'argmax ; T>1 l'aplatit vers l'uniforme ; T=0 correspond au greedy déterministe (argmax).
Nucleus sampling (top-p)
Restreint la sélection des tokens au plus petit ensemble de candidats dont la probabilité cumulée ≥ p, ajustant dynamiquement la taille du pool de candidats selon l'entropie de la distribution (Holtzman et al. 2019).
Top-k sampling
Restreint la sélection des tokens aux k tokens de plus forte probabilité exactement, indépendamment de leur masse de probabilité cumulée.
Min-p sampling
Fixe un plancher de probabilité en fraction de la probabilité du token de tête : les tokens tels que p < min_p × p_top sont exclus. Plus stable que le top-p à température élevée ; adoption croissante dans les runtimes à poids ouverts (2023).
Repetition penalty
Multiplicateur >1 appliqué aux logits des tokens déjà générés pour réduire les boucles ; au-delà de 1,15, il peut supprimer des répétitions légitimes dans des sorties structurées telles que les tableaux JSON ou les clauses SQL.
Greedy decoding
Échantillonnage déterministe qui sélectionne toujours le token suivant de plus forte probabilité ; équivalent à T→0 ou top-k=1. Le mode requis pour les tâches critiques pour l'audit et à sortie structurée.
Beam search
Maintient k séquences candidates (beams) en parallèle à chaque étape de décodage, en retenant à la fin la séquence globalement la plus probable ; améliore la qualité des sorties contraintes au prix d'un coût de calcul multiplié par k.
KV cache
Les projections clé-valeur mises en cache issues des étapes d'attention précédentes, permettant un décodage autorégressif efficace sans recalculer l'attention sur l'ensemble du contexte à chaque étape.

Sources

  1. Holtzman et al. 2019 — The Curious Case of Neural Text Degeneration (nucleus sampling)
  2. OpenAI API reference — sampling parameters
  3. Anthropic API reference — sampling parameters
  4. Stahlberg & Byrne 2019 — On NMT Search Errors and Model Errors
  5. EU AI Act Article 9 — Risk Management System (reproducibility requirements)
  6. Shah et al. 2024 — FlashAttention-3: Fast and Accurate Attention on Hopper GPUs
  7. vLLM documentation — sampling parameters
  8. SAP BTP AI Core — Generative AI Hub documentation
  9. SAP News Center — SAP Unveils the Autonomous Enterprise
  10. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  11. SAP Datasphere — Help Portal
  12. SAP Datasphere — official product page
  13. SAP Analytics Cloud — Help Portal
  14. SAP Analytics Cloud — official product page
  15. SAP BW/4HANA — Help Portal
  16. SAP S/4HANA — Help Portal
  17. SAP News Center
  18. SAP Community
  19. SAP — industries overview
  20. SAP Business AI — official product page
  21. SAP Joule (work companion) — official product page
  22. SAP Generative AI — official product page
  23. Stanford HAI — AI Index Report
  24. Meta AI — Llama model research
  25. arXiv — preprint archive (cs.CL/cs.AI)
  26. HuggingFace — model hub
  27. Gartner — research & analyst site
  28. BARC — BI & Analytics research
  29. TDWI — data & analytics research
  30. DSAG — German-speaking SAP user group
  31. ASUG — Americas' SAP User Group
  32. Databricks — official site

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →