Aller au contenu

🌐 RĂ©seau IA : RoCE, InfiniBand et Thunderbolt

Aprùs la station multi-GPU, la question suivante est naturelle : peut-on relier plusieurs machines pour obtenir un “super ordinateur” IA on-premise ?

Oui, mais le rĂ©seau devient vite plus important que le nombre de GPU. Une carte moderne lit sa VRAM Ă  des centaines ou milliers de Go/s, alors qu’un lien rĂ©seau se compte souvent en dizaines ou centaines de Gb/s. MĂȘme RDMA ne transforme pas un cluster de bureau en systĂšme NVLink externe.


🎯 Le vrai rĂŽle du rĂ©seau

Dans une architecture IA on-premise, le réseau sert surtout à trois choses :

  1. Distribuer des requĂȘtes entre plusieurs machines.
  2. Synchroniser des GPU pour du parallĂ©lisme multi-nƓuds.
  3. Déplacer des données entre stockage, CPU, GPU et services applicatifs.

Ces usages n’ont pas le mĂȘme niveau d’exigence. Servir plusieurs utilisateurs avec plusieurs machines indĂ©pendantes tolĂšre trĂšs bien Ethernet classique. En revanche, dĂ©couper un mĂȘme modĂšle sur plusieurs nƓuds demande des Ă©changes frĂ©quents : latence, congestion, dĂ©bit rĂ©el et support RDMA deviennent critiques.

graph TD
    A[Utilisateur / API] --> B[Routeur applicatif]
    B --> C[Noeud GPU 1]
    B --> D[Noeud GPU 2]
    B --> E[Noeud GPU 3]
    C -. synchronisation modele .-> D
    D -. synchronisation modele .-> E

La bonne question n’est donc pas “quel est le dĂ©bit maximal du cĂąble ?”, mais “quelles donnĂ©es doivent traverser le rĂ©seau pendant l’infĂ©rence ?”.


đŸ§± Ethernet classique, RoCE, InfiniBand : trois niveaux diffĂ©rents

1. Ethernet classique

Ethernet standard est parfait pour l’accĂšs utilisateur, l’administration, les API, le stockage lĂ©ger et les architectures oĂč chaque machine sert une charge indĂ©pendante.

Son avantage est Ă©vident : coĂ»t raisonnable, matĂ©riel disponible, compĂ©tences rĂ©seau courantes. Sa limite est tout aussi claire : le protocole TCP/IP classique passe par plus de couches CPU et n’offre pas les mĂȘmes garanties de latence qu’un fabric RDMA correctement configurĂ©.

2. RoCE : RDMA sur Ethernet

RoCE signifie RDMA over Converged Ethernet. Il apporte une partie des bĂ©nĂ©fices RDMA sur une infrastructure Ethernet adaptĂ©e : les transferts peuvent Ă©viter une partie des copies et du traitement CPU, ce qui aide les communications entre nƓuds GPU 12.

Mais RoCE n’est pas un bouton magique. La documentation NVIDIA indique que RoCE s’appuie sur ECN et PFC pour fonctionner en environnement Ethernet lossless ou semi-lossless, et que la configuration doit ĂȘtre cohĂ©rente cĂŽtĂ© hĂŽtes, switches, prioritĂ©s et files de trafic 3. En pratique, RoCE demande donc :

  • des NIC compatibles, souvent NVIDIA ConnectX
  • des switches adaptĂ©s
  • une configuration PFC/ECN comprise et testĂ©e
  • une surveillance de congestion
  • une pile logicielle compatible avec le runtime IA

Sur un rĂ©seau mal configurĂ©, RoCE peut ĂȘtre pire qu’Ethernet classique : pauses PFC excessives, congestion invisible, performances instables.

3. InfiniBand : fabric dédié HPC/IA

InfiniBand est historiquement le choix des clusters HPC et IA quand la latence et la prédictibilité priment. Il combine réseau, transport RDMA et gestion de fabric dans un écosystÚme pensé pour les communications intensives.

Pour un particulier ou une petite PME, InfiniBand peut ĂȘtre trop coĂ»teux ou trop spĂ©cialisĂ©. Pour un cluster IA sĂ©rieux avec parallĂ©lisme multi-nƓuds, il reste une rĂ©fĂ©rence parce qu’il rĂ©duit les surprises rĂ©seau et s’intĂšgre bien avec les bibliothĂšques de communication GPU.


🚀 GPUDirect RDMA : Ă©viter le dĂ©tour par la RAM

NVIDIA GPUDirect RDMA permet Ă  une carte rĂ©seau ou un autre pĂ©riphĂ©rique tiers d’échanger directement avec la mĂ©moire GPU via PCIe, sans recopier systĂ©matiquement les donnĂ©es en RAM systĂšme 4. La documentation NVIDIA prĂ©cise que la technologie fonctionne avec InfiniBand et RoCE sur matĂ©riel compatible 4.

graph LR
    A[GPU local - VRAM] -->|GPUDirect RDMA| B[NIC RDMA]
    B --> C[Fabric RoCE / InfiniBand]
    C --> D[NIC RDMA distant]
    D --> E[GPU distant - VRAM]

Ce mécanisme est important pour les moteurs distribués, mais il ne supprime pas les limites physiques :

  • le trafic traverse toujours PCIe, la NIC, le switch et les liens rĂ©seau
  • le gain dĂ©pend du moteur d’infĂ©rence et des bibliothĂšques de communication
  • la topologie PCIe de la machine reste importante
  • la compatibilitĂ© driver/kernel peut devenir un sujet d’exploitation

NVIDIA recommande désormais DMA-BUF comme approche moderne pour certains déploiements GPUDirect RDMA dans le GPU Operator, plutÎt que le chemin historique nvidia-peermem quand les conditions de plateforme sont remplies 1.


⚡ Thunderbolt : utile, mais pas un fabric IA

Thunderbolt est sĂ©duisant pour l’on-premise : un cĂąble compact, des docks, du stockage rapide, parfois du rĂ©seau point-Ă -point. Mais il faut garder les ordres de grandeur.

Intel dĂ©crit Thunderbolt 4 comme un lien Ă  40 Gb/s bidirectionnel avec 32 Gb/s de donnĂ©es PCIe minimales 5. Thunderbolt 5 monte Ă  80 Gb/s bidirectionnels, avec un mode Bandwidth Boost pouvant rĂ©allouer le lien jusqu’à 120 Gb/s en Ă©mission et 40 Gb/s en rĂ©ception, principalement pour les usages vidĂ©o 6.

MĂȘme Thunderbolt 5 reste trĂšs loin d’un fabric NVLink/NVSwitch de serveur GPU. Il peut ĂȘtre utile pour :

  • stockage externe rapide
  • station de travail compacte
  • dock rĂ©seau ou 10/25 GbE
  • expĂ©rimentation homelab
  • liaison simple entre machines dans certains scĂ©narios

Il ne faut pas le vendre comme :

  • une extension transparente de VRAM
  • un NVLink externe
  • une solution robuste pour tensor parallel multi-nƓuds
  • un rĂ©seau datacenter IA

Pour un mini-cluster de bureau, Thunderbolt peut aider à prototyper. Pour de la production multi-GPU distribuée, RoCE ou InfiniBand deviennent beaucoup plus crédibles.


🧠 ParallĂ©lisme IA : quel rĂ©seau pour quel usage ?

UsageRéseau acceptableCommentaire
Plusieurs utilisateurs, modĂšles rĂ©pliquĂ©sEthernet classiqueLe load balancer distribue les requĂȘtes, peu de synchronisation GPU
RAG + services applicatifsEthernet classique ou 10/25 GbELa latence applicative compte plus que RDMA
Stockage partagé performant25/100 GbE, parfois RDMADépend fortement du backend stockage
Multi-nƓuds avec pipeline parallelRoCE ou InfiniBand recommandĂ©Les activations traversent le rĂ©seau
Tensor parallel multi-nƓudsInfiniBand ou RoCE trĂšs bien configurĂ©Communications frĂ©quentes, rĂ©seau critique
Prototype homelabEthernet / ThunderboltUtile pour apprendre, pas pour promettre des gains linéaires

vLLM recommande de raisonner sur la topologie : tensor parallel dans un nƓud quand le modĂšle tient sur les GPU du nƓud, puis pipeline parallel entre nƓuds quand il faut dĂ©passer cette limite. La documentation mentionne aussi GPUDirect RDMA pour les communications rĂ©seau GPU efficaces dans les dĂ©ploiements compatibles 7.


📋 Le Conseil de l’Architecte

Pour un déploiement souverain on-premise :

  1. Commencer par rĂ©pliquer avant de distribuer. Deux machines qui servent chacune leur propre modĂšle sont souvent plus fiables qu’un modĂšle coupĂ© en deux sur un rĂ©seau fragile.
  2. Ne pas confondre débit marketing et débit utile. Un lien réseau annoncé en Gb/s ne dit rien de la latence, de la congestion, du CPU bypass ou du comportement NCCL.
  3. Réserver RoCE aux environnements maßtrisés. RoCE est pertinent si vous contrÎlez les NIC, switches, QoS, PFC/ECN et monitoring.
  4. Choisir InfiniBand pour le multi-nƓuds sĂ©rieux. Si l’objectif est un cluster IA Ă  faible latence, InfiniBand Ă©vite beaucoup de bricolage.
  5. Utiliser Thunderbolt comme outil de station, pas comme promesse cluster. TrÚs pratique pour le stockage et les docks ; trop limité pour remplacer un fabric GPU.

Le rĂ©seau IA on-premise n’est donc pas “plus de cĂąbles”. C’est une dĂ©cision d’architecture : quelle part du modĂšle, du cache et des requĂȘtes accepte-t-on de faire traverser entre machines ?


📚 Sources et RĂ©fĂ©rences

Footnotes

  1. NVIDIA, GPUDirect RDMA and GPUDirect Storage — GPU Operator (DMA-BUF, nvidia-peermem, configuration GPUDirect RDMA). https://docs.nvidia.com/datacenter/cloud-native/gpu-operator/26.3/gpu-operator-rdma.html ↩ ↩2

  2. NVIDIA, RDMA over Converged Ethernet — DOCA SDK (RDMA, RoCE, faible latence, lossless Ethernet). https://docs.nvidia.com/doca/sdk/rdma-over-converged-ethernet.pdf ↩

  3. NVIDIA, RDMA over Converged Ethernet - RoCE | Cumulus Linux (PFC, ECN, modes lossy/lossless). https://docs.nvidia.com/networking-ethernet-software/cumulus-linux/Layer-1-and-Switch-Ports/Quality-of-Service/RDMA-over-Converged-Ethernet-RoCE/ ↩

  4. NVIDIA, GPUDirect RDMA 13.2 documentation (Ă©changes directs entre GPU et pĂ©riphĂ©riques tiers, support InfiniBand/RoCE). https://docs.nvidia.com/cuda/gpudirect-rdma/ ↩ ↩2

  5. Intel, What Is Thunderbolt 4? (40 Gb/s bidirectionnel, PCIe 32 Gb/s). https://www.intel.com/content/www/us/en/gaming/resources/upgrade-gaming-accessories-thunderbolt-4.html ↩

  6. Thunderbolt Technology, Thunderbolt 5 Technology Brief (80 Gb/s bidirectionnel, 120/40 Gb/s Bandwidth Boost, PCIe 64 Gb/s). https://www.thunderbolttechnology.net/sites/default/files/Thunderbolt_5_TechBrief_2023_09_12.pdf ↩

  7. vLLM, Parallelism and Scaling (tensor parallel, pipeline parallel, multi-nƓuds, GPUDirect RDMA). https://docs.vllm.ai/en/stable/serving/parallelism_scaling/ ↩