đ§© Stations Multi-GPU : NVIDIA, PCIe et VRAM
AprĂšs la mĂ©moire unifiĂ©e, lâautre grande famille de machines IA on-premise est la station multi-GPU : plusieurs cartes NVIDIA dans une mĂȘme tour, ou plusieurs accĂ©lĂ©rateurs dans un serveur.
LâidĂ©e paraĂźt simple : additionner la VRAM de plusieurs cartes pour charger des modĂšles plus gros. En pratique, le multi-GPU nâest pas un simple âpool de mĂ©moireâ. Il faut choisir un mode de parallĂ©lisme, accepter des Ă©changes entre cartes, et comprendre si ces Ă©changes passent par PCIe, NVLink ou un fabric RDMA / RoCE.
đŻ Pourquoi du multi-GPU ?
Une station multi-GPU répond à trois besoins différents :
- Capacité mémoire : charger un modÚle qui ne tient pas sur une seule carte.
- DĂ©bit : servir plus de requĂȘtes en parallĂšle, souvent en rĂ©pliquant le modĂšle.
- Latence : accélérer un gros modÚle en répartissant ses calculs sur plusieurs GPU.
Ces trois objectifs ne demandent pas la mĂȘme architecture. Une machine Ă deux cartes peut ĂȘtre excellente pour servir deux utilisateurs indĂ©pendants, mais dĂ©cevante pour accĂ©lĂ©rer un seul modĂšle si les cartes ne communiquent que par PCIe.
𧱠Le paysage matériel : workstation vs serveur
1. GPU workstation PCIe
Les cartes professionnelles de workstation maximisent la flexibilitĂ© : elles entrent dans des stations x86 classiques, utilisent CUDA, et restent compatibles avec les moteurs dâinfĂ©rence courants.
| Carte | Mémoire | Bande passante mémoire | Interface | Puissance |
|---|---|---|---|---|
| NVIDIA RTX 6000 Ada | 48 Go GDDR6 ECC | 960 Go/s (datasheet) | PCIe 4.0 x16 | 300 W |
| NVIDIA RTX PRO 6000 Blackwell Workstation | 96 Go GDDR7 ECC | 1 792 Go/s | PCIe 5.0 | 600 W |
La RTX 6000 Ada reste une base workstation solide avec 48 Go de GDDR6 ECC et PCIe Gen 4 x16 1. La RTX PRO 6000 Blackwell double la capacité à 96 Go, passe à la GDDR7 ECC, annonce 1 792 Go/s de bande passante mémoire et le support PCIe Gen 5 2.
Ce sont des cartes trĂšs intĂ©ressantes pour lâon-premise car elles offrent de la VRAM locale rapide et un Ă©cosystĂšme logiciel mature. Mais dans une station multi-GPU standard, les Ă©changes entre cartes dĂ©pendent exclusivement du bus PCIe.
2. Serveurs dâinfĂ©rence SaaS (L40S, A100)
Entre les stations workstation PCIe et les nĆuds HGX datacenter, il existe une catĂ©gorie souvent ignorĂ©e mais centrale pour les dĂ©ploiements souverains Ă lâĂ©chelle dâune Ă©quipe ou dâun SaaS : le serveur dâinfĂ©rence rack, optimisĂ© pour servir 10 Ă 200 utilisateurs simultanĂ©s Ă un coĂ»t par token maĂźtrisĂ©.
| GPU | VRAM | Bande passante | FP8 natif | Positionnement |
|---|---|---|---|---|
| NVIDIA L40S | 48 Go GDDR6 | 864 Go/s | â Oui (Ada Lovelace) | InfĂ©rence SaaS â meilleur coĂ»t/token en production |
| NVIDIA A100 (80 Go) | 80 Go HBM2e | 2 000 Go/s | â Non (FP16 max) | Legacy solide, disponible chez hĂ©bergeurs souverains FR |
| NVIDIA A100 (40 Go) | 40 Go HBM2e | 1 555 Go/s | â Non | Compromis capacitĂ©/coĂ»t pour modĂšles 13â34B |
| RTX 6000 Ada / RTX 4090 | 48 / 24 Go | 960 / 1 008 Go/s | â ïž Partiel | On-prem client air-gapped (matĂ©riel fourni par le client) |
Le NVIDIA L40S â le âjoyau cachĂ©â de lâinfĂ©rence 2026
Le L40S (architecture Ada Lovelace) est souvent sous-estimĂ© car il nâa pas la bande passante HBM dâun H100. Il compense par deux avantages dĂ©cisifs pour lâinfĂ©rence de production3 :
- Tensor Cores 4á” gĂ©nĂ©ration avec FP8 natif : la quantification FP8 du modĂšle et du KV Cache est native, sans contournement logiciel. Sur les architectures Hopper (H100), vLLM doit passer par des Ă©mulations FP8 logicielles ; sur Ada, câest du silicium4.
- Meilleur coĂ»t/token en infĂ©rence : les benchmarks MLPerf Inference Datacenter 2024 placent le L40S comme le GPU offrant le plus faible coĂ»t par token gĂ©nĂ©rĂ© pour les modĂšles de la classe 70B en production â devant lâA100 et Ă Ă©galitĂ© approximative avec lâH100 sur ce ratio spĂ©cifique4.
Un serveur bare-metal équipé de deux L40S (96 Go de VRAM totale) constitue la topologie de référence pour héberger un modÚle 70B en quantification FP8 et servir 20 à 80 utilisateurs simultanés avec un TTFT < 2 s.
LâA100 â le cheval de trait historique
LâA100 reste le GPU datacenter le plus disponible chez les hĂ©bergeurs souverains français (OVHcloud, Scaleway, Outscale). Son immense bande passante HBM2e compense lâabsence de FP8 natif pour les modĂšles en FP16 ou BF16. Il reste pertinent pour :
- Les modÚles non encore disponibles en FP8 optimisé.
- Les dĂ©ploiements chez des hĂ©bergeurs certifiĂ©s HDS/SecNumCloud oĂč le L40S nâest pas encore proposĂ©.
RTX workstation pour lâon-prem client (Tier Air-Gapped)
Lorsquâun client dĂ©ploie la stack sur son propre matĂ©riel (Tier 3 / air-gapped), il nâest pas nĂ©cessaire dâimposer des GPU datacenter Ă 15 000 âŹ. Une station Ă©quipĂ©e dâune ou deux RTX 6000 Ada (48 Go PCIe) suffit pour servir les requĂȘtes internes dâune Ă©quipe de 10 Ă 30 personnes, Ă condition que le moteur dâinfĂ©rence (vLLM ou SGLang) soit correctement configurĂ©.
3. Serveurs NVLink / NVSwitch
Les serveurs datacenter NVIDIA changent de catégorie : dans un systÚme HGX/DGX, les GPU peuvent communiquer via NVLink et NVSwitch plutÎt que seulement via PCIe.
NVIDIA dĂ©crit les systĂšmes HGX H100/H200 Ă huit GPU comme des machines oĂč chaque GPU Hopper peut communiquer Ă 900 Go/s avec les autres via NVLink/NVSwitch, avec un fabric non bloquant dans le nĆud 5. Pour Blackwell, NVIDIA indique que la cinquiĂšme gĂ©nĂ©ration de NVLink double la vitesse par GPU Ă 1 800 Go/s dans les systĂšmes adaptĂ©s 5.
Ce niveau dâinterconnexion nâest pas un dĂ©tail : il rend le tensor parallelism beaucoup plus viable, car les GPU doivent Ă©changer des activations et rĂ©sultats intermĂ©diaires Ă chaque gĂ©nĂ©ration.
đŁïž PCIe : le goulot discret
PCIe est le bus généraliste qui relie CPU, GPU, SSD et cartes réseau. PCI-SIG indique que PCIe 5.0 monte à 32 GT/s par lane, soit le double de PCIe 4.0 6.
Pour une carte GPU en x16, cela donne un ordre de grandeur thĂ©orique dâenviron 64 Go/s par direction en PCIe 5.0, avant de tenir compte des contraintes rĂ©elles de plateforme. Câest Ă©levĂ© pour de lâI/O gĂ©nĂ©raliste, mais trĂšs faible comparĂ© Ă la bande passante interne dâune carte GPU moderne : 960 Go/s sur RTX 6000 Ada, 1 792 Go/s sur RTX PRO 6000 Blackwell 12.
graph TD
A[RAM systĂšme] -->|PCIe x16: dizaines de Go/s| B[GPU 0 - VRAM locale]
A -->|PCIe x16: dizaines de Go/s| C[GPU 1 - VRAM locale]
B -. echanges inter-GPU via PCIe .-> C
B -->|GDDR/HBM: centaines a milliers de Go/s| D[Calcul GPU 0]
C -->|GDDR/HBM: centaines a milliers de Go/s| E[Calcul GPU 1]
ConsĂ©quence : si un moteur dâinfĂ©rence doit beaucoup synchroniser deux GPU via PCIe, lâaccĂ©lĂ©ration attendue peut disparaĂźtre. Le multi-GPU PCIe fonctionne mieux quand les communications sont rares, quand les requĂȘtes sont indĂ©pendantes, ou quand le moteur sait choisir un parallĂ©lisme adaptĂ©.
Les Switches PCIe (Broadcom PLX) â le P2P sans passer par le CPU
Dans une station standard, les Ă©changes GPUâGPU transitent via le CPU : GPU 0 Ă©crit en RAM systĂšme, le CPU relit, et envoie Ă GPU 1. Câest lent et charge le processeur inutilement.
Les meilleures stations IA (et certains serveurs de workstation denses) utilisent des puces Switch PCIe â principalement les sĂ©ries Broadcom PLX PEX â intĂ©grĂ©es Ă la carte mĂšre ou Ă une carte dâexpansion. Ces puces permettent un transfert Peer-to-Peer (P2P DMA) direct :
flowchart LR
A["GPU 0 VRAM"] -->|"P2P DMA\n(sans CPU ni RAM systĂšme)"| B["Switch PCIe (PLX)"]
B --> C["GPU 1 VRAM"]
Avantages concrets :
- La latence de transfert inter-GPU chute significativement
- Le CPU est libĂ©rĂ© pour dâautres tĂąches pendant la synchronisation
- Le dĂ©bit reste plafonnĂ© Ă ~64 Go/s (PCIe 5.0 x16) â mais avec une latence bien infĂ©rieure au trajet CPU
Identifier une carte mĂšre avec switch PLX : Cherchez dans les specs carte mĂšre les mentions âPCIe switchâ, âPLXâ, âPEX switchâ, ou âNVMe bifurcation with PLXâ. Les cartes mĂšres HEDT (High-End Desktop) et les plateformes serveur entry-level (AMD EPYC, Intel Xeon) incluent souvent ces puces nativement.
đ§ Les modes de parallĂ©lisme
Data Parallel : plusieurs copies du modĂšle
Le data parallel rĂ©plique le modĂšle sur plusieurs GPU. Chaque carte sert des requĂȘtes diffĂ©rentes.
- Avantage : trÚs efficace pour augmenter le débit multi-utilisateur si le modÚle tient sur une carte.
- Limite : la VRAM ne sâadditionne pas pour un seul modĂšle, car chaque GPU garde sa propre copie.
TensorRT-LLM décrit ce mode comme adapté aux grands lots et scénarios de débit élevé 7.
Tensor Parallel : un modÚle coupé dans chaque couche
Le tensor parallelism dĂ©coupe les poids dâune mĂȘme couche sur plusieurs GPU. Câest le mode intuitif quand un modĂšle est trop gros pour une seule carte.
vLLM recommande ce mode quand le modĂšle ne tient pas sur un GPU mais tient dans un nĆud multi-GPU ; on configure par exemple --tensor-parallel-size 4 pour quatre GPU 8. TensorRT-LLM dĂ©crit aussi le TP comme un sharding des poids Ă travers les GPU 7.
- Avantage : peut réduire la pression VRAM par GPU et exploiter plusieurs bandes passantes mémoire.
- Limite : demande des communications fréquentes ; NVLink/NVSwitch aide beaucoup, PCIe peut devenir limitant.
Pipeline Parallel : le modÚle coupé par blocs de couches
Le pipeline parallelism distribue des groupes de couches sur plusieurs GPU. Les activations passent dâune carte Ă lâautre.
vLLM recommande de combiner tensor parallel et pipeline parallel quand le modĂšle dĂ©passe un seul nĆud, avec tensor_parallel_size pour les GPU par nĆud et pipeline_parallel_size pour le nombre de nĆuds 8. TensorRT-LLM liste aussi ce mode comme stratĂ©gie centrale 7.
- Avantage : plus tolérant aux interconnexions lentes que le TP pur dans certains cas.
- Limite : peut crĂ©er des âbullesâ oĂč certains GPU attendent, surtout avec de petits lots.
âïž Choisir entre APU, mono-GPU, multi-GPU PCIe et serveur NVLink
| Besoin | Architecture souvent rationnelle | Pourquoi |
|---|---|---|
| LLM 70B quantifiĂ©, faible bruit, grande RAM | APU / mĂ©moire unifiĂ©e | Simple, grande capacitĂ©, pas de copie RAMâVRAM |
| ModĂšle qui tient en 48â96 Go VRAM | Mono-GPU workstation | Simple, rapide, peu de synchronisation |
| Plusieurs utilisateurs / plusieurs modÚles | Multi-GPU en réplication | Chaque GPU sert une charge indépendante |
| SaaS souverain, 10â200 users, coĂ»t/token optimisĂ© | Serveur L40S ou A100 | FP8 natif, meilleur TCO infĂ©rence, disponible chez hĂ©bergeurs FR |
| ModĂšle trop gros pour une carte, mĂȘme nĆud | Multi-GPU avec TP/PP | Possible si le moteur supporte le sharding |
| TrÚs gros modÚles, faible latence, production | Serveur NVLink/NVSwitch | Fabric inter-GPU adapté aux communications fréquentes |
Le piĂšge classique est dâacheter â2 Ă 48 Goâ en pensant obtenir une carte virtuelle de 96 Go. Câest seulement vrai si le moteur sait rĂ©partir le modĂšle et si lâinterconnexion ne dĂ©truit pas le gain.
đ Le Conseil de lâArchitecte
Pour un déploiement souverain on-premise :
- Commencer par le besoin de service, pas par le nombre de GPU. Un seul utilisateur sur un gros modĂšle dense nâa pas les mĂȘmes contraintes quâun serveur multi-utilisateur.
- PrivilĂ©gier le mono-GPU quand le modĂšle tient. Une RTX PRO 6000 Blackwell 96 Go peut ĂȘtre plus simple quâune station 2 Ă 48 Go pour un modĂšle qui tient dans 96 Go 2.
- Utiliser le multi-GPU PCIe pour le débit. Plusieurs cartes peuvent servir plusieurs répliques ou plusieurs modÚles avec peu de communication entre elles.
- Pour un SaaS souverain ou un service multi-utilisateurs, Ă©valuer le L40S ou lâA100. Un serveur bare-metal 2Ă L40S offre le meilleur TCO infĂ©rence pour un modĂšle 70B en production. LâA100 reste le choix par dĂ©faut chez les hĂ©bergeurs souverains français dĂ©jĂ certifiĂ©s HDS.
- RĂ©server le tensor parallel exigeant aux interconnexions rapides. vLLM et TensorRT-LLM supportent le TP, mais les docs insistent sur lâimportance du rĂ©seau/interconnect pour Ă©viter que les communications dominent 78.
- Ne pas confondre station et datacenter. NVLink/NVSwitch change radicalement le profil, mais il appartient surtout aux plateformes serveur NVIDIA compatibles 5.
đ AccĂ©lĂ©rateurs non-NVIDIA : Ă©tat en 2026
Au-delĂ de NVIDIA, plusieurs constructeurs positionnent des alternatives pour lâinfĂ©rence et lâentraĂźnement on-premise. LâĂ©tat du marchĂ© en 2026 reste celui dâun Ă©cosystĂšme en formation â intĂ©ressant Ă surveiller, pas encore recommandĂ© pour des dĂ©ploiements B2B stricts.
Tenstorrent (Wormhole / Blackhole)
Tenstorrent (fondĂ© par Jim Keller) commercialise les accĂ©lĂ©rateurs Wormhole (N150, N300) et annonce la gĂ©nĂ©ration Blackhole. Lâarchitecture est software-first, basĂ©e sur des cĆurs RISC-V avec une SRAM locale massive et de la GDDR6 externe, et une interconnexion Ethernet intĂ©grĂ©e entre puces 9.
Avantages revendiquĂ©s : coĂ»t dâachat nettement infĂ©rieur Ă des GPU NVIDIA Ă©quivalents en TFLOPS, pile logicielle open-source TT-Forge (TT-Metal + compilateur MLIR), interconnexion Ethernet native pour le scale-out sans switch propriĂ©taire.
Limites réelles en 2026 :
- vLLM standard incompatible : il faut utiliser le fork
tenstorrent/vllmavec un environnementtt-metalcompilĂ© manuellement â procĂ©dure non triviale, non maintenue par lâĂ©quipe vLLM principale. Source communautaire 9 â voir aussi la note dans Moteurs d'InfĂ©rence. - CompatibilitĂ© modĂšles partielle : le compilateur TT-Forge ne supporte pas encore tous les opĂ©rateurs des architectures rĂ©centes â une compatibilitĂ© « 90 % des modĂšles » est insuffisante pour des dĂ©ploiements B2B qui doivent garantir le comportement de chaque modĂšle.
- ĂcosystĂšme logiciel jeune : pas encore de support officiel HuggingFace, LangChain, ni des outils de monitoring courants (Prometheus metrics, OpenTelemetry).
đ Sources et RĂ©fĂ©rences
Footnotes
-
NVIDIA, RTX 6000 Ada Generation Graphics Card (48 Go GDDR6 ECC, PCIe Gen 4 x16, 300 W). https://www.nvidia.com/en-us/products/workstations/rtx-6000/ â© â©2 â©3
-
NVIDIA, RTX PRO 6000 Blackwell Workstation Edition (96 Go GDDR7 ECC, 1 792 Go/s, PCIe Gen 5, 600 W). https://www.nvidia.com/en-us/products/workstations/professional-desktop-gpus/rtx-pro-6000/ â© â©2 â©3 â©4
-
NVIDIA, L40S Product Page (Ada Lovelace, FP8 Tensor Cores, 48 Go GDDR6 ECC). https://www.nvidia.com/en-us/data-center/l40s/ â©
-
MLCommons, MLPerf Inference Datacenter v4.1 Results (benchmark infĂ©rence datacenter, coĂ»t/token). https://mlcommons.org/benchmarks/inference-datacenter/ â© â©2
-
NVIDIA Technical Blog, NVIDIA NVLink and NVIDIA NVSwitch Supercharge Large Language Model Inference (NVLink/NVSwitch, 900 Go/s Hopper, 1 800 Go/s Blackwell). https://developer.nvidia.com/blog/nvidia-nvlink-and-nvidia-nvswitch-supercharge-large-language-model-inference/ â© â©2 â©3
-
PCI-SIG, PCI Express 5.0 FAQ (32 GT/s par lane, double PCIe 4.0). https://pcisig.com/faq?field_category_value%5B%5D=pci_express_5.0 â©
-
NVIDIA TensorRT-LLM, Parallelism in TensorRT LLM (TP, PP, DP, EP, CP). https://nvidia.github.io/TensorRT-LLM/features/parallel-strategy.html â© â©2 â©3 â©4
-
vLLM, Parallelism and Scaling (tensor parallel, pipeline parallel, Ray, multiprocessing, GPUDirect RDMA). https://docs.vllm.ai/en/stable/serving/parallelism_scaling/ â© â©2 â©3
-
Tenstorrent, vLLM integration with TT-Metal (architecture Wormhole, fork tenstorrent/vllm, compatibilitĂ© partielle vLLM standard), 2025. https://github.com/tenstorrent/tt-metal/blob/main/tech_reports/LLMs/vLLM_integration.md â© â©2