Aller au contenu

đŸŽïž La Bande Passante MĂ©moire & Le "Memory Wall"

Vous avez peut-ĂȘtre dĂ©jĂ  entendu : “Pour faire tourner un LLM, il faut un GPU puissant.” C’est vrai, mais incomplet. En pratique, la carte la plus rapide du marchĂ© peut saturer et devenir aussi lente qu’une carte d’entrĂ©e de gamme — si la mĂ©moire ne suit pas.

C’est le paradoxe que ce chapitre va expliquer. Comprendre la bande passante mĂ©moire, c’est comprendre pourquoi votre config gĂ©nĂšre 4 tokens/s au lieu de 40 — et comment y remĂ©dier.

En architecture systĂšme appliquĂ©e Ă  l’IA, une rĂ©alitĂ© revient en permanence : en infĂ©rence LLM, la limite est souvent la mĂ©moire avant le calcul brut1.

Ce phĂ©nomĂšne est classiquement appelĂ© “Memory Wall”. Pendant la gĂ©nĂ©ration auto-rĂ©gressive, le GPU/CPU alterne des phases de calcul trĂšs rapides et des phases d’attente de donnĂ©es depuis la mĂ©moire. Le dĂ©bit final est donc fortement corrĂ©lĂ© Ă  la bande passante mĂ©moire (Go/s), pas seulement aux TFLOPS1.


🧠 La Physique de l’InfĂ©rence : Prefill vs Decoding

Pour comprendre le goulot d’étranglement, il faut sĂ©parer deux phases :

graph TD
    A[Saisie du Prompt] --> B(Phase 1: Prefill)
    B -->|Calcul parallÚle lourd| C[Calculé en TFLOPS]
    C --> D(Phase 2: Decoding / Génération)
    D -->|Lecture séquentielle de la RAM| E[Bloqué par la Bande Passante]

1. La Phase de “Prefill” (Ingestion du Prompt)

Le modĂšle traite le prompt d’entrĂ©e en parallĂšle (matrices de grande taille).

  • Comportement matĂ©riel : meilleure utilisation des unitĂ©s de calcul.
  • Facteur dominant : mix calcul + mĂ©moire, souvent plus favorable au calcul qu’en decoding.

2. La Phase de “Decoding” (GĂ©nĂ©ration Mot Ă  Mot)

Le modÚle génÚre un token puis recommence le cycle pour le token suivant. Ce processus est séquentiel.

  • Comportement matĂ©riel : lecture rĂ©pĂ©tĂ©e des poids + gestion du KV Cache ; l’intensitĂ© arithmĂ©tique est plus faible qu’en prefill.
  • Facteur dominant : la bande passante mĂ©moire, surtout Ă  batch faible1.

📐 L’Équation MathĂ©matique du DĂ©bit

Pour dimensionner rapidement une machine, on utilise une borne supérieure :

Vitesse Max (tokens/s)=Bande Passante Meˊmoire (Go/s)Taille du Modeˋle en Meˊmoire (Go)\text{Vitesse Max (tokens/s)} = \frac{\text{Bande Passante MĂ©moire (Go/s)}}{\text{Taille du ModĂšle en MĂ©moire (Go)}}

Cas Pratique : ModĂšle dense 70B en quantification 4-bit (Q4)

Un modÚle dense de 70B quantifié en 4-bit occupe environ 40 Go en mémoire de poids (ordre de grandeur).

  1. Sur un PC classique (RAM DDR5 Dual Channel) :
    • Bande passante rĂ©elle : ∌100 Go/s\sim 100 \text{ Go/s}
    • Calcul : 100 Go/s40 Go=2,5 tokens/s\frac{100 \text{ Go/s}}{40 \text{ Go}} = \mathbf{2,5 \text{ tokens/s}} (borne thĂ©orique).
  2. Sur un systĂšme AMD Ryzen AI Max PRO 495 (Gorgon Halo) :
    • Bande passante rĂ©elle : ∌273 Go/s\sim 273 \text{ Go/s}
    • Calcul : 273 Go/s40 Go=6,8 tokens/s\frac{273 \text{ Go/s}}{40 \text{ Go}} = \mathbf{6,8 \text{ tokens/s}} (borne thĂ©orique).
  3. Sur un Mac Studio M4 Max (Mémoire Unifiée haut de gamme) :
    • Bande passante rĂ©elle : 546 Go/s546 \text{ Go/s}
    • Calcul : 546 Go/s40 Go=13,6 tokens/s\frac{546 \text{ Go/s}}{40 \text{ Go}} = \mathbf{13,6 \text{ tokens/s}} (borne thĂ©orique).
  4. Sur une carte Nvidia RTX 5090 (VRAM GDDR7 dédiée - Blackwell) :
    • Bande passante rĂ©elle : 1 792 Go/s1\ 792 \text{ Go/s}
    • Calcul : 1792 Go/s40 Go=44,8 tokens/s\frac{1792 \text{ Go/s}}{40 \text{ Go}} = \mathbf{44,8 \text{ tokens/s}} (borne thĂ©orique).

📊 Le Grand Comparatif des Technologies de Stockage (2026)

Valeurs ci-dessous : ordres de grandeur utiles pour l’architecture (les performances rĂ©elles varient selon le stack logiciel et la charge).

TechnologieBande passante (ordre de grandeur)SourceImpact pour l’infĂ©rence
Ethernet 10 GbE∌1,25 Go/s\sim 1,25 \text{ Go/s}conversion 10 Gbit/strop faible pour â€œĂ©tendre” un modĂšle en ligne sans forte pĂ©nalitĂ©
PCIe 5.0 x16∌64 Go/s\sim 64 \text{ Go/s} (agrĂ©gĂ©)spĂ©cification busdevient un goulot lors des transferts frĂ©quents CPU↔GPU
RAM DDR5 desktop∌80\sim 80 Ă  100 Go/s100 \text{ Go/s}plateformes dual-channel typiquescapacitĂ© Ă©levĂ©e, dĂ©bit limitĂ© pour grands LLM
MĂ©moire unifiĂ©e AMD Ryzen AI Max PRO 400jusqu’à ∌273 Go/s\sim 273 \text{ Go/s}3compromis capacitĂ©/dĂ©bit intĂ©ressant en x86
Mémoire unifiée Apple M4 Max / M3 Ultra546546 à 819 Go/s819 \text{ Go/s}4excellent débit local sans offload PCIe
VRAM RTX 5090 (GDDR7)∌1,79 To/s\sim 1{,}79 \text{ To/s}56trĂšs haut dĂ©bit pour decoding rapide

Les Limites du Clustering Réseau


📚 Sources et RĂ©fĂ©rences

Footnotes

  1. Amir Gholami et al., AI and Memory Wall (arXiv:2403.14123), 2024. https://arxiv.org/abs/2403.14123 ↩ ↩2 ↩3

  2. Meta, Llama 4 Model Card (Scout/Maverick, MoE, pas de variante “70B” dense), 2025. https://raw.githubusercontent.com/meta-llama/llama-models/main/models/llama4/MODEL_CARD.md ↩

  3. ServeTheHome, AMD Ups Ante With 192GB Ryzen AI Max PRO 400 Chips for AI Systems, 2026. https://www.servethehome.com/amd-reveals-ryzen-ai-max-pro-400-series-192gb-ram-for-ai-systems/ ↩

  4. Apple, Mac Studio - Technical Specifications, 2026. https://www.apple.com/mac-studio/specs/ ↩

  5. NVIDIA, GeForce RTX 5090 product page (32 GB GDDR7, bus 512-bit, TGP 575 W). https://www.nvidia.com/fr-fr/geforce/graphics-cards/50-series/rtx-5090/ ↩

  6. TechPowerUp, NVIDIA GeForce RTX 5090 Specs (bandwidth mĂ©moire 1.79 TB/s), 2026. https://www.techpowerup.com/gpu-specs/geforce-rtx-5090.c4216 ↩