Parallélisme Tensoriel vs Pipeline — Inférence Multi-GPU
À jour au 2026-07-24T14:00:00Z
Qu'est-ce que Parallélisme Tensoriel vs Pipeline — Inférence Multi-GPU ?
Le parallélisme tensoriel exige NVLink et scale jusqu'à 8 GPU dans un nœud ; le parallélisme pipeline tolère des interconnexions plus lentes entre nœuds mais gaspille du compute dans la bulle de pipeline — les piles de production combinent les deux, servant Llama-3.1-405B en TP=8×PP=2 sur 16 H100.
Le parallélisme de tenseurs (Tensor Parallelism) et le parallélisme de pipeline (Pipeline Parallelism) sont les deux stratégies fondamentales pour servir un grand modèle de langage dont les poids sont trop volumineux pour tenir sur un seul GPU. Un modèle de soixante-dix milliards de paramètres en demi-précision standard nécessite environ cent quarante gigaoctets de mémoire, avant même d'ajouter la marge nécessaire au cache clé-valeur — bien au-delà des quatre-vingts gigaoctets d'un seul GPU de data-centre haut de gamme. Répartir le modèle sur plusieurs dispositifs n'est pas optionnel, et la façon dont cette répartition est conçue détermine directement la latence, le débit et le coût d'interconnexion de l'ensemble du déploiement.
Comment chaque stratégie découpe le modèle
Pourquoi c'est important
- Le TP déclenche un AllReduce à chaque couche, donc les nœuds purement PCIe s'effondrent sous la demande de bande passante — NVLink (900 Go/s sur H100 SXM) est obligatoire, et le TP inter-nœuds ajoute une latence qui se cumule sur 80+ couches transformer.
- La fraction de bulle du PP est (P-1)/(M+P-1) — à 8 micro-batches et une profondeur de pipeline de 4, cela représente 27 % d'inactivité, acceptable pour le service batch mais inacceptable pour les workloads interactifs mono-flux.
- Un modèle 70B en FP16 nécessite ~140 Go, bien au-delà des 80 Go d'un H100 unique, donc toute pile de service à cette échelle doit choisir une stratégie de répartition — il n'y a pas d'échappatoire.
Points clés
- Le TP découpe les matrices de poids horizontalement — chaque GPU exécute chaque couche en parallèle, AllReduce somme les résultats partiels ; NVLink obligatoire, passe à l'échelle jusqu'à TP=8 dans un nœud.
- Le PP découpe le modèle verticalement par plages de couches — les activations circulent de GPU à GPU une fois par passe avant ; fonctionne sur InfiniBand/Ethernet entre nœuds.
- Le TP minimise la latence d'une requête unique au prix de la bande passante d'interconnexion ; le PP minimise le trafic d'interconnexion au prix du temps d'inactivité de la bulle de pipeline.
- Règle de production : TP dans le nœud (limité par NVLink), PP entre nœuds (limité par le réseau) ; Llama-3.1-405B typiquement TP=8 × PP=2 sur 16 H100.
- Frameworks : vLLM ≥0.5, TensorRT-LLM, SGLang, DeepSpeed-Inference exposent les deux leviers ; les valeurs par défaut sont rarement optimales pour votre mix de workloads.
- Anti-pattern : TP entre GPUs sur PCIe (sans NVLink) — AllReduce sature le bus, débit effondré de 30-50% en temps jusqu'au premier token.
- Formule de fraction de bulle : (P-1)/(M+P-1) avec P = profondeur de pipeline, M = nombre de micro-batches ; viser <20% pour les workloads interactifs.
- La mémoire cache KV évolue comme batch_size × longueur_contexte × num_couches × hidden_dim × 2 × octets_par_élément — dimensionner avant de choisir le degré TP.
- Les hôtes d'inférence SAP BTP AI en 2026 sont des pods NVLink SXM ; vérifier la topologie NVLink avant de spécifier TP>4.
- Le parallélisme de séquence (SP) étend le TP à la dimension séquence de l'attention — utilisé dans vLLM quand la longueur de contexte dépasse 8K pour éviter les OOM sur le shard KV.
Termes employés sur cette page
- AllReduce
- Primitive de communication collective qui somme les tenseurs partiels sur tous les GPU participants et diffuse le résultat ; le coût dominant des passes avant en parallélisme de tenseurs — sur NVLink H100, prend ~5 µs par couche à TP=8.
- Pipeline bubble
- Temps GPU inactif en parallélisme de pipeline pendant que les étages ultérieurs attendent les étages antérieurs sur les premiers/derniers micro-lots d'une étape ; fraction = (P-1)/(M+P-1) où P est la profondeur du pipeline et M le nombre de micro-lots.
- NVLink
- L'interconnexion GPU-à-GPU à haute bande passante de NVIDIA (900 Go/s bidirectionnel sur NVSwitch H100 SXM5) — prérequis pour un parallélisme de tenseurs efficace ; la bande passante PCIe (~64 Go/s) est 14× plus lente et s'effondre sous le trafic AllReduce.
- KV-cache
- Tenseurs d'attention clé/valeur mis en cache et conservés à travers les étapes de décodage ; consomme de la mémoire GPU proportionnelle à longueur de contexte × taille de lot × num_layers × hidden_dim × 2 ; la principale contrainte de budget mémoire lors du dimensionnement du degré TP.
- Sequence Parallelism (SP)
- Extension du parallélisme de tenseurs qui répartit la séquence d'entrée entre GPU pendant le calcul d'attention, réduisant l'empreinte de KV-cache par GPU aux longs contextes ; implémentée dans vLLM et Megatron-LM.
- TTFT
- Time To First Token — la latence entre la soumission de la requête et le premier token de sortie ; la métrique UX dominante pour les applications interactives ; TP=8 au sein d'un nœud NVLink minimise le TTFT ; le PP ajoute une latence de bulle qui dégrade le TTFT.
- Micro-batch
- Une subdivision du lot global en parallélisme de pipeline ; plusieurs micro-lots circulant simultanément dans le pipeline suppriment la bulle de pipeline et améliorent l'utilisation du GPU.
- Tensor shard
- La part d'un GPU dans une matrice de poids en parallélisme de tenseurs ; pour une dimension cachée d=8192 à TP=4, chaque GPU détient un fragment de 2048 colonnes de chaque poids, calculant sa multiplication matricielle partielle avant l'AllReduce.
Sources
- NVIDIA TensorRT-LLM — Parallelism Guide
- vLLM Documentation — Distributed Inference
- MLPerf Inference v4.1 Results
- Anyscale — Llama 70B Serving Cost Analysis
- Megatron-LM: Training Multi-Billion Parameter Language Models (Shoeybi et al. 2020)
- GPipe: Efficient Training of Giant Neural Networks using Pipeline Parallelism (Huang et al. 2019)
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
- SAP HANA Platform — Help Portal
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.