AI & Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

LayerNorm et RMSNorm

LayerNorm et RMSNorm — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-09-27

Qu'est-ce que LayerNorm et RMSNorm ?

RMSNorm coûte 7-15 % de calcul en moins que LayerNorm pour une perte de qualité négligeable — ce qui explique pourquoi tous les grands LLM 2026 (Llama, Mistral, Qwen) l'utilisent, et pourquoi la pré-norme, pas la post-norme, rend entraînables les modèles à plus de 80 couches sans préchauffage.

De quoi il s'agit

LayerNorm et RMSNorm sont des couches de normalisation qui stabilisent la distribution des activations sur la dimension des caractéristiques de chaque token à chaque couche du transformer. Elles ne sont pas des options — sans elles, les transformers profonds (>12 couches) divergent à l'entraînement dans les premiers milliers de pas.

Le problème qu'elles résolvent est le décalage de covariance interne : lors du passage des activations à travers de nombreuses multiplications matricielles, leur échelle croît ou décroît exponentiellement, saturant les non-linéarités et provoquant l'explosion ou la disparition des gradients. La normalisation ancre le vecteur de caractéristiques de chaque token à une échelle stable avant qu'il n'entre dans les sous-couches d'attention et FFN.

Pourquoi c'est important

  • Les transformers profonds (>12 couches) divergent à l'entraînement dans les premiers milliers de pas sans normalisation — ce n'est pas une optimisation, c'est une exigence dure.
  • Le bénéfice de flux de gradient de la pré-norme est chiffré dans son effet : c'est ce qui rend stable une profondeur au-delà de 80 couches.
  • La post-norme (conception originale de 2017) échoue sans préchauffage soigneux du taux d'apprentissage au-delà de 24 couches — pertinent uniquement pour la compatibilité avec les modèles de l'ère BERT.

Points clés

  • RMSNorm supprime la soustraction de moyenne et le biais par rapport à LayerNorm — 7–15% de FLOPs en moins, perte de qualité négligeable.
  • Le placement pre-norm (Norm avant la sous-couche) permet un entraînement stable au-delà de 80 couches ; post-norm nécessite un warmup soigné.
  • Llama 3.3 applique RMSNorm à 3 positions par couche : input_layernorm (avant MHSA), post_attention_layernorm (avant FFN), et model.norm (sortie finale).
  • Le poids γ de RMSNorm est le vecteur d'échelle — de grandes valeurs de γ indiquent des caractéristiques à forte variance sensibles à la quantisation.
  • La quantisation INT8 du KV interagit avec la normalisation : une quantisation dynamique par token est nécessaire quand γ varie fortement d'un token à l'autre.
  • La mantisse plus grossière de l'entraînement en bf16 rend l'arithmétique plus simple de RMSNorm (sans soustraction de moyenne glissante) nettement moins sujette aux erreurs d'annulation que LayerNorm aux positions de séquence extrêmes — l'une des raisons sous-estimées de son remplacement de LayerNorm depuis que le bf16 est devenu le format d'entraînement par défaut après 2022.
  • À profondeur extrême (le DeepNet de Wang et al. a atteint 1 000 couches), la pre-norm seule contrôle mal la croissance de la variance du flux résiduel ; DeepNorm (un facteur d'échelle α constant sur la branche résiduelle, fixé à l'initialisation) et la « sandwich norm » (normalisation avant ET après chaque sous-couche, utilisée par Gemma 2) sont les deux correctifs documentés au-delà de la pre-norm classique.

Termes employés sur cette page

LayerNorm
Couche de normalisation (Ba 2016) qui soustrait la moyenne et divise par l'écart-type du vecteur de features de chaque token, puis applique une échelle apprise γ et un biais β.
RMSNorm
Normalisation Root Mean Square (Zhang 2019) : normalise par la seule RMS, abandonne la soustraction de la moyenne et le terme de biais, 7 à 15 % moins coûteuse que LayerNorm.
Pre-norm
Placement de la couche de normalisation à l'ENTRÉE de chaque sous-couche : x + Sublayer(Norm(x)). Adopté par tous les LLM modernes pour la stabilité d'entraînement en profondeur.
Post-norm
Placement de la normalisation à la SORTIE de chaque sous-couche : Norm(x + Sublayer(x)). Conception d'origine de Vaswani 2017 ; requiert un warmup soigné du taux d'apprentissage.
Internal covariate shift
Changement de la distribution des entrées d'une couche durant l'entraînement à mesure que les paramètres se mettent à jour ; les couches de normalisation l'atténuent pour stabiliser le flux de gradient.

Sources

  1. Ba et al. 2016 — Layer Normalisation
  2. Zhang & Sennrich 2019 — Root Mean Square Layer Normalisation
  3. Wang et al. 2020 — On Layer Normalisation in the Transformer Architecture (pre-norm analysis)
  4. Meta AI — Llama 3 Model Card
  5. AutoGPTQ documentation — quantisation and outlier handling
  6. SAP Generative AI — official product page
  7. Meta AI — Llama model research
  8. SAP Help Portal — Generative AI Hub in SAP AI Core, model library overview (2026)
  9. SAP Help Portal — Orchestration service, prompting vs fine-tuning guidance (2026)
  10. Wang et al. — DeepNet: Scaling Transformers to 1,000 Layers, arXiv:2203.00555 (2022)
  11. PyTorch documentation — torch.nn.LayerNorm reference
  12. Jiang et al. — Mistral 7B technical report, arXiv:2310.06825 (2023)

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →