đ RĂ©seau IA : RoCE, InfiniBand et Thunderbolt
AprĂšs la station multi-GPU, la question suivante est naturelle : peut-on relier plusieurs machines pour obtenir un âsuper ordinateurâ IA on-premise ?
Oui, mais le rĂ©seau devient vite plus important que le nombre de GPU. Une carte moderne lit sa VRAM Ă des centaines ou milliers de Go/s, alors quâun lien rĂ©seau se compte souvent en dizaines ou centaines de Gb/s. MĂȘme RDMA ne transforme pas un cluster de bureau en systĂšme NVLink externe.
đŻ Le vrai rĂŽle du rĂ©seau
Dans une architecture IA on-premise, le réseau sert surtout à trois choses :
- Distribuer des requĂȘtes entre plusieurs machines.
- Synchroniser des GPU pour du parallĂ©lisme multi-nĆuds.
- Déplacer des données entre stockage, CPU, GPU et services applicatifs.
Ces usages nâont pas le mĂȘme niveau dâexigence. Servir plusieurs utilisateurs avec plusieurs machines indĂ©pendantes tolĂšre trĂšs bien Ethernet classique. En revanche, dĂ©couper un mĂȘme modĂšle sur plusieurs nĆuds demande des Ă©changes frĂ©quents : latence, congestion, dĂ©bit rĂ©el et support RDMA deviennent critiques.
graph TD
A[Utilisateur / API] --> B[Routeur applicatif]
B --> C[Noeud GPU 1]
B --> D[Noeud GPU 2]
B --> E[Noeud GPU 3]
C -. synchronisation modele .-> D
D -. synchronisation modele .-> E
La bonne question nâest donc pas âquel est le dĂ©bit maximal du cĂąble ?â, mais âquelles donnĂ©es doivent traverser le rĂ©seau pendant lâinfĂ©rence ?â.
𧱠Ethernet classique, RoCE, InfiniBand : trois niveaux différents
1. Ethernet classique
Ethernet standard est parfait pour lâaccĂšs utilisateur, lâadministration, les API, le stockage lĂ©ger et les architectures oĂč chaque machine sert une charge indĂ©pendante.
Son avantage est Ă©vident : coĂ»t raisonnable, matĂ©riel disponible, compĂ©tences rĂ©seau courantes. Sa limite est tout aussi claire : le protocole TCP/IP classique passe par plus de couches CPU et nâoffre pas les mĂȘmes garanties de latence quâun fabric RDMA correctement configurĂ©.
2. RoCE : RDMA sur Ethernet
RoCE signifie RDMA over Converged Ethernet. Il apporte une partie des bĂ©nĂ©fices RDMA sur une infrastructure Ethernet adaptĂ©e : les transferts peuvent Ă©viter une partie des copies et du traitement CPU, ce qui aide les communications entre nĆuds GPU 12.
Mais RoCE nâest pas un bouton magique. La documentation NVIDIA indique que RoCE sâappuie sur ECN et PFC pour fonctionner en environnement Ethernet lossless ou semi-lossless, et que la configuration doit ĂȘtre cohĂ©rente cĂŽtĂ© hĂŽtes, switches, prioritĂ©s et files de trafic 3. En pratique, RoCE demande donc :
- des NIC compatibles, souvent NVIDIA ConnectX
- des switches adaptés
- une configuration PFC/ECN comprise et testée
- une surveillance de congestion
- une pile logicielle compatible avec le runtime IA
Sur un rĂ©seau mal configurĂ©, RoCE peut ĂȘtre pire quâEthernet classique : pauses PFC excessives, congestion invisible, performances instables.
3. InfiniBand : fabric dédié HPC/IA
InfiniBand est historiquement le choix des clusters HPC et IA quand la latence et la prédictibilité priment. Il combine réseau, transport RDMA et gestion de fabric dans un écosystÚme pensé pour les communications intensives.
Pour un particulier ou une petite PME, InfiniBand peut ĂȘtre trop coĂ»teux ou trop spĂ©cialisĂ©. Pour un cluster IA sĂ©rieux avec parallĂ©lisme multi-nĆuds, il reste une rĂ©fĂ©rence parce quâil rĂ©duit les surprises rĂ©seau et sâintĂšgre bien avec les bibliothĂšques de communication GPU.
đ GPUDirect RDMA : Ă©viter le dĂ©tour par la RAM
NVIDIA GPUDirect RDMA permet Ă une carte rĂ©seau ou un autre pĂ©riphĂ©rique tiers dâĂ©changer directement avec la mĂ©moire GPU via PCIe, sans recopier systĂ©matiquement les donnĂ©es en RAM systĂšme 4. La documentation NVIDIA prĂ©cise que la technologie fonctionne avec InfiniBand et RoCE sur matĂ©riel compatible 4.
graph LR
A[GPU local - VRAM] -->|GPUDirect RDMA| B[NIC RDMA]
B --> C[Fabric RoCE / InfiniBand]
C --> D[NIC RDMA distant]
D --> E[GPU distant - VRAM]
Ce mécanisme est important pour les moteurs distribués, mais il ne supprime pas les limites physiques :
- le trafic traverse toujours PCIe, la NIC, le switch et les liens réseau
- le gain dĂ©pend du moteur dâinfĂ©rence et des bibliothĂšques de communication
- la topologie PCIe de la machine reste importante
- la compatibilitĂ© driver/kernel peut devenir un sujet dâexploitation
NVIDIA recommande désormais DMA-BUF comme approche moderne pour certains déploiements GPUDirect RDMA dans le GPU Operator, plutÎt que le chemin historique nvidia-peermem quand les conditions de plateforme sont remplies 1.
⥠Thunderbolt : utile, mais pas un fabric IA
Thunderbolt est sĂ©duisant pour lâon-premise : un cĂąble compact, des docks, du stockage rapide, parfois du rĂ©seau point-Ă -point. Mais il faut garder les ordres de grandeur.
Intel dĂ©crit Thunderbolt 4 comme un lien Ă 40 Gb/s bidirectionnel avec 32 Gb/s de donnĂ©es PCIe minimales 5. Thunderbolt 5 monte Ă 80 Gb/s bidirectionnels, avec un mode Bandwidth Boost pouvant rĂ©allouer le lien jusquâĂ 120 Gb/s en Ă©mission et 40 Gb/s en rĂ©ception, principalement pour les usages vidĂ©o 6.
MĂȘme Thunderbolt 5 reste trĂšs loin dâun fabric NVLink/NVSwitch de serveur GPU. Il peut ĂȘtre utile pour :
- stockage externe rapide
- station de travail compacte
- dock réseau ou 10/25 GbE
- expérimentation homelab
- liaison simple entre machines dans certains scénarios
Il ne faut pas le vendre comme :
- une extension transparente de VRAM
- un NVLink externe
- une solution robuste pour tensor parallel multi-nĆuds
- un réseau datacenter IA
Pour un mini-cluster de bureau, Thunderbolt peut aider à prototyper. Pour de la production multi-GPU distribuée, RoCE ou InfiniBand deviennent beaucoup plus crédibles.
đ§ ParallĂ©lisme IA : quel rĂ©seau pour quel usage ?
| Usage | Réseau acceptable | Commentaire |
|---|---|---|
| Plusieurs utilisateurs, modĂšles rĂ©pliquĂ©s | Ethernet classique | Le load balancer distribue les requĂȘtes, peu de synchronisation GPU |
| RAG + services applicatifs | Ethernet classique ou 10/25 GbE | La latence applicative compte plus que RDMA |
| Stockage partagé performant | 25/100 GbE, parfois RDMA | Dépend fortement du backend stockage |
| Multi-nĆuds avec pipeline parallel | RoCE ou InfiniBand recommandĂ© | Les activations traversent le rĂ©seau |
| Tensor parallel multi-nĆuds | InfiniBand ou RoCE trĂšs bien configurĂ© | Communications frĂ©quentes, rĂ©seau critique |
| Prototype homelab | Ethernet / Thunderbolt | Utile pour apprendre, pas pour promettre des gains linéaires |
vLLM recommande de raisonner sur la topologie : tensor parallel dans un nĆud quand le modĂšle tient sur les GPU du nĆud, puis pipeline parallel entre nĆuds quand il faut dĂ©passer cette limite. La documentation mentionne aussi GPUDirect RDMA pour les communications rĂ©seau GPU efficaces dans les dĂ©ploiements compatibles 7.
đ Le Conseil de lâArchitecte
Pour un déploiement souverain on-premise :
- Commencer par rĂ©pliquer avant de distribuer. Deux machines qui servent chacune leur propre modĂšle sont souvent plus fiables quâun modĂšle coupĂ© en deux sur un rĂ©seau fragile.
- Ne pas confondre débit marketing et débit utile. Un lien réseau annoncé en Gb/s ne dit rien de la latence, de la congestion, du CPU bypass ou du comportement NCCL.
- Réserver RoCE aux environnements maßtrisés. RoCE est pertinent si vous contrÎlez les NIC, switches, QoS, PFC/ECN et monitoring.
- Choisir InfiniBand pour le multi-nĆuds sĂ©rieux. Si lâobjectif est un cluster IA Ă faible latence, InfiniBand Ă©vite beaucoup de bricolage.
- Utiliser Thunderbolt comme outil de station, pas comme promesse cluster. TrÚs pratique pour le stockage et les docks ; trop limité pour remplacer un fabric GPU.
Le rĂ©seau IA on-premise nâest donc pas âplus de cĂąblesâ. Câest une dĂ©cision dâarchitecture : quelle part du modĂšle, du cache et des requĂȘtes accepte-t-on de faire traverser entre machines ?
đ Sources et RĂ©fĂ©rences
Footnotes
-
NVIDIA, GPUDirect RDMA and GPUDirect Storage â GPU Operator (DMA-BUF,
nvidia-peermem, configuration GPUDirect RDMA). https://docs.nvidia.com/datacenter/cloud-native/gpu-operator/26.3/gpu-operator-rdma.html â© â©2 -
NVIDIA, RDMA over Converged Ethernet â DOCA SDK (RDMA, RoCE, faible latence, lossless Ethernet). https://docs.nvidia.com/doca/sdk/rdma-over-converged-ethernet.pdf â©
-
NVIDIA, RDMA over Converged Ethernet - RoCE | Cumulus Linux (PFC, ECN, modes lossy/lossless). https://docs.nvidia.com/networking-ethernet-software/cumulus-linux/Layer-1-and-Switch-Ports/Quality-of-Service/RDMA-over-Converged-Ethernet-RoCE/ â©
-
NVIDIA, GPUDirect RDMA 13.2 documentation (Ă©changes directs entre GPU et pĂ©riphĂ©riques tiers, support InfiniBand/RoCE). https://docs.nvidia.com/cuda/gpudirect-rdma/ â© â©2
-
Intel, What Is Thunderbolt 4? (40 Gb/s bidirectionnel, PCIe 32 Gb/s). https://www.intel.com/content/www/us/en/gaming/resources/upgrade-gaming-accessories-thunderbolt-4.html â©
-
Thunderbolt Technology, Thunderbolt 5 Technology Brief (80 Gb/s bidirectionnel, 120/40 Gb/s Bandwidth Boost, PCIe 64 Gb/s). https://www.thunderbolttechnology.net/sites/default/files/Thunderbolt_5_TechBrief_2023_09_12.pdf â©
-
vLLM, Parallelism and Scaling (tensor parallel, pipeline parallel, multi-nĆuds, GPUDirect RDMA). https://docs.vllm.ai/en/stable/serving/parallelism_scaling/ â©