Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

LoRA et QLoRA — Fine-tuning à paramètres efficaces en production

LoRA et QLoRA — Fine-tuning à paramètres efficaces en production — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-07-24T14:00:00Z

Qu'est-ce que LoRA et QLoRA — Fine-tuning à paramètres efficaces en production ?

LoRA gèle le modèle de base et n'entraîne que de petites matrices de rang r injectées dans les projections d'attention — une réduction de 128× des paramètres entraînables qui permet de fine-tuner un modèle 70B sur un seul GPU au lieu d'un cluster de 8.

LoRA (Low-Rank Adaptation) et sa variante quantifiée QLoRA constituent en 2026 la technique par défaut en production pour adapter un grand modèle de langage à un domaine ou à un comportement spécifique sans réentraîner l'ensemble de ses poids. Plutôt que de mettre à jour chacun des sept à soixante-dix milliards de paramètres d'un modèle, LoRA gèle entièrement les poids de base et injecte une petite paire de matrices de rang faible entraînables dans chaque projection d'attention. L'empreinte entraînable se réduit de deux à trois ordres de grandeur, ce qui fait toute la différence entre avoir besoin d'un cluster de huit GPU et pouvoir affiner un modèle de soixante-dix milliards de paramètres sur un seul accélérateur haut de gamme.

Comment cela fonctionne

Pourquoi c'est important

  • La mathématique est exacte et bon marché : à r=16, d=4096, cela représente 131 072 paramètres entraînables par matrice contre 16 777 216 pour un fine-tuning complet — une réduction de 128×, dont Dettmers et al. ont prouvé qu'elle égale la qualité pleine précision à la marge de bruit près.
  • La quantification 4-bit NF4 de QLoRA divise encore la mémoire par 4, rendant possible le fine-tuning d'un 70B sur un seul GPU 48 Go (L40S, A6000, H100 PCIe) — un déblocage de coût matériel, pas seulement d'efficacité.
  • Ne cibler que l'attention en sautant les projections de porte MLP (gate_proj, up_proj) laisse ~30 % des paramètres adaptables non entraînés — une erreur de configuration précise et évitable.

Points clés

  • Mécanisme : geler W ; injecter B et A entraînables de rang r pour que W_eff = W + (α/r)×BA ; n'entraîner que B et A — 100-1000× moins de paramètres qu'un fine-tuning complet.
  • QLoRA : quantification NF4 4-bit sur la base gelée, mémoire divisée par 4 ; 70B fine-tuné sur un GPU 48 Go unique ; égale la qualité pleine précision (Dettmers et al. 2023).
  • Hyperparamètres : r=8-32 pour l'adaptation comportementale, r=64 pour le raisonnement complexe ; alpha=2r ; LR=1e-4 à 3e-4 ; 3-5 époques sur 10K-100K exemples.
  • Modules cibles : q_proj, k_proj, v_proj, o_proj + gate_proj, up_proj — ignorer les portes MLP laisse ~30% de capacité adaptable inutilisée.
  • Service hot-swap : plusieurs adaptateurs partagent un modèle de base en mémoire ; commutation à ~1ms de latence dans le mode LoRA de vLLM.
  • Quand utiliser LoRA vs alternatives : LoRA pour le comportement spécifique (10K-1M exemples étiquetés) ; RAG pour la récupération ; CPT pour la pré-formation langage domaine.
  • Fusion d'adaptateur pour zéro latence : `peft.merge_adapter()` avant export ONNX — modèle fusionné identique en taille et vitesse à la base.
  • Obligation EU AI Act Art. 9-49 pour les adaptateurs dans des systèmes à haut risque : données d'entraînement, résultats d'évaluation et delta de performance vs base doivent être journalisés.
  • Benchmark coût : QLoRA sur 7B pour classification SAP sur 50K exemples ≈ 2h sur un A100 pour ~5€ de compute.
  • Mode d'échec : adaptateur sous-performant le modèle de base sur ≥20% des tâches — cause racine : données d'entraînement insuffisantes ou mal étiquetées.

Termes employés sur cette page

LoRA
Low-Rank Adaptation ; gèle les poids de base W et entraîne des facteurs de rang faible B (d×r) et A (r×k) de sorte que le poids effectif soit W + (α/r)×BA ; réduit les paramètres entraînables de 100 à 1000× avec une perte de qualité négligeable pour l'adaptation comportementale.
QLoRA
LoRA combiné à une quantification NF4 sur 4 bits des poids de base gelés ; permet le fine-tuning d'un modèle de 70 Md de paramètres sur un unique GPU de 48 Go à une qualité pleine précision (Dettmers et al. 2023, arXiv:2305.14314).
NF4 (Normal Float 4)
Un type de donnée sur 4 bits optimisé pour les valeurs de poids normalement distribuées dans les LLM ; stocke chaque poids sur 4 bits contre 16 bits pour le BF16, réduisant la mémoire de 4× avec une erreur de quantification moindre que l'INT4 ou le FP4 standard sur les distributions de poids de transformeurs.
Adapter hot-swap
Schéma de service où le modèle de base est chargé une seule fois en mémoire GPU et où les adaptateurs LoRA par tâche ou par locataire sont chargés/déchargés au moment de la requête ; le mode de service LoRA de vLLM le prend en charge avec une latence de bascule d'environ 1 ms.
Rank r
La dimension interne de la décomposition LoRA B (d×r) et A (r×k) ; contrôle la capacité adaptable — r=16 à d=4096 donne 131 072 paramètres entraînables par matrice de poids contre 16 777 216 pour un fine-tuning complet (réduction de 128×).
Alpha (LoRA scaling)
Constante d'échelle dans W_eff = W + (α/r)×BA qui contrôle l'intensité avec laquelle la mise à jour LoRA est appliquée ; alpha=2r est le point de départ canonique ; un alpha plus élevé amplifie le signal de l'adaptateur et peut provoquer une instabilité d'entraînement.
PEFT (Parameter-Efficient Fine-Tuning)
Famille de techniques — LoRA, QLoRA, Prefix Tuning, IA³, couches d'Adapter — qui adaptent de grands modèles pré-entraînés en n'entraînant qu'une infime fraction des paramètres ; LoRA est le choix de production dominant en 2026 en raison de son surcoût d'inférence nul après fusion.
Merge adapter
Opération qui ajoute le produit BA de façon permanente dans le poids de base W, produisant un modèle dense standard avec la mise à jour LoRA intégrée ; `peft.merge_adapter()` dans HuggingFace PEFT ; élimine le coût d'exécution du calcul de l'adaptateur.

Sources

  1. arXiv: LoRA — Low-Rank Adaptation of Large Language Models (Hu et al. 2021)
  2. arXiv: QLoRA — Efficient Finetuning of Quantized LLMs (Dettmers et al. 2023)
  3. Hugging Face PEFT library documentation
  4. NIST AI Risk Management Framework 1.0 — model lifecycle governance
  5. arXiv: DoRA — Weight-Decomposed Low-Rank Adaptation (Liu et al. 2024)
  6. EU AI Act — Art. 9-49 documentation requirements for high-risk AI systems
  7. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  8. SAP News Center — SAP Unveils the Autonomous Enterprise
  9. SAP News Center — The Future of the Enterprise Is Autonomous
  10. SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
  11. SAP Datasphere — Help Portal
  12. SAP Datasphere — official product page
  13. SAP Analytics Cloud — Help Portal
  14. SAP Analytics Cloud — official product page
  15. SAP BW/4HANA — Help Portal
  16. SAP S/4HANA — Help Portal
  17. SAP News Center
  18. SAP Community
  19. SAP — industries overview
  20. SAP Business AI — official product page
  21. SAP Joule (work companion) — official product page
  22. SAP Generative AI — official product page
  23. Stanford HAI — AI Index Report
  24. Meta AI — Llama model research
  25. arXiv — preprint archive (cs.CL/cs.AI)
  26. HuggingFace — model hub
  27. Gartner — research & analyst site
  28. BARC — BI & Analytics research
  29. TDWI — data & analytics research
  30. DSAG — German-speaking SAP user group
  31. ASUG — Americas' SAP User Group
  32. Databricks — official site

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →