Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

LayerNorm et RMSNorm

LayerNorm et RMSNorm — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-07-23

Qu'est-ce que LayerNorm et RMSNorm ?

RMSNorm coûte 7-15 % de calcul en moins que LayerNorm pour une perte de qualité négligeable — ce qui explique pourquoi tous les grands LLM 2026 (Llama, Mistral, Qwen) l'utilisent, et pourquoi la pré-norme, pas la post-norme, rend entraînables les modèles à plus de 80 couches sans préchauffage.

De quoi il s'agit

LayerNorm et RMSNorm sont des couches de normalisation qui stabilisent la distribution des activations sur la dimension des caractéristiques de chaque token à chaque couche du transformer. Elles ne sont pas des options — sans elles, les transformers profonds (>12 couches) divergent à l'entraînement dans les premiers milliers de pas.

Le problème qu'elles résolvent est le décalage de covariance interne : lors du passage des activations à travers de nombreuses multiplications matricielles, leur échelle croît ou décroît exponentiellement, saturant les non-linéarités et provoquant l'explosion ou la disparition des gradients. La normalisation ancre le vecteur de caractéristiques de chaque token à une échelle stable avant qu'il n'entre dans les sous-couches d'attention et FFN.

Pourquoi c'est important

  • Les transformers profonds (>12 couches) divergent à l'entraînement dans les premiers milliers de pas sans normalisation — ce n'est pas une optimisation, c'est une exigence dure.
  • Le bénéfice de flux de gradient de la pré-norme est chiffré dans son effet : c'est ce qui rend stable une profondeur au-delà de 80 couches.
  • La post-norme (conception originale de 2017) échoue sans préchauffage soigneux du taux d'apprentissage au-delà de 24 couches — pertinent uniquement pour la compatibilité avec les modèles de l'ère BERT.

Points clés

  • RMSNorm supprime la soustraction de moyenne et le biais par rapport à LayerNorm — 7–15% de FLOPs en moins, perte de qualité négligeable.
  • Le placement pre-norm (Norm avant la sous-couche) permet un entraînement stable au-delà de 80 couches ; post-norm nécessite un warmup soigné.
  • Llama 3.3 applique RMSNorm à 3 positions par couche : input_layernorm (avant MHSA), post_attention_layernorm (avant FFN), et model.norm (sortie finale).
  • Le poids γ de RMSNorm est le vecteur d'échelle — de grandes valeurs de γ indiquent des caractéristiques à forte variance sensibles à la quantisation.
  • La quantisation INT8 du KV interagit avec la normalisation : une quantisation dynamique par token est nécessaire quand γ varie fortement d'un token à l'autre.
  • LayerNorm and RMSNorm n'est maîtrisé que lorsqu'il change une décision d'acheteur nommée.
  • Commencer par le contrat sémantique et le modèle de contrôle avant de démontrer l'outil.
  • Utiliser les signaux SAP, analystes, études, KG et actualité comme preuve, pas comme décoration.
  • Séparer les faits vérifiés des tendances directionnelles et des hypothèses modélisées.
  • Définir le propriétaire, la métrique, le seuil, le chemin de support et le plan de retour arrière avant de passer à l'échelle.

Termes employés sur cette page

LayerNorm
Couche de normalisation (Ba 2016) qui soustrait la moyenne et divise par l'écart-type du vecteur de features de chaque token, puis applique une échelle apprise γ et un biais β.
RMSNorm
Normalisation Root Mean Square (Zhang 2019) : normalise par la seule RMS, abandonne la soustraction de la moyenne et le terme de biais, 7 à 15 % moins coûteuse que LayerNorm.
Pre-norm
Placement de la couche de normalisation à l'ENTRÉE de chaque sous-couche : x + Sublayer(Norm(x)). Adopté par tous les LLM modernes pour la stabilité d'entraînement en profondeur.
Post-norm
Placement de la normalisation à la SORTIE de chaque sous-couche : Norm(x + Sublayer(x)). Conception d'origine de Vaswani 2017 ; requiert un warmup soigné du taux d'apprentissage.
Internal covariate shift
Changement de la distribution des entrées d'une couche durant l'entraînement à mesure que les paramètres se mettent à jour ; les couches de normalisation l'atténuent pour stabiliser le flux de gradient.
Decision owner
La personne responsable qui accepte l'arbitrage et finance l'action suivante.
Semantic contract
La définition partagée des termes métier, indicateurs, entités et règles d'accès utilisée par les outils et les équipes.
Control plane
La couche qui applique les politiques, les accès, la traçabilité, la supervision et l'escalade sur l'ensemble du modèle opérationnel.

Sources

  1. Ba et al. 2016 — Layer Normalisation
  2. Zhang & Sennrich 2019 — Root Mean Square Layer Normalisation
  3. Wang et al. 2020 — On Layer Normalisation in the Transformer Architecture (pre-norm analysis)
  4. Meta AI — Llama 3 Model Card
  5. AutoGPTQ documentation — quantisation and outlier handling
  6. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  7. SAP News Center — SAP Unveils the Autonomous Enterprise
  8. SAP News Center — The Future of the Enterprise Is Autonomous
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. SAP Business AI — official product page
  19. SAP Joule (work companion) — official product page
  20. SAP Generative AI — official product page
  21. Stanford HAI — AI Index Report
  22. Meta AI — Llama model research
  23. arXiv — preprint archive (cs.CL/cs.AI)
  24. HuggingFace — model hub
  25. Gartner — research & analyst site
  26. BARC — BI & Analytics research
  27. TDWI — data & analytics research
  28. DSAG — German-speaking SAP user group
  29. ASUG — Americas' SAP User Group
  30. Databricks — official site

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code.

Ouvrir dans l'application →