đïž La Bande Passante MĂ©moire & Le "Memory Wall"
Vous avez peut-ĂȘtre dĂ©jĂ entendu : âPour faire tourner un LLM, il faut un GPU puissant.â Câest vrai, mais incomplet. En pratique, la carte la plus rapide du marchĂ© peut saturer et devenir aussi lente quâune carte dâentrĂ©e de gamme â si la mĂ©moire ne suit pas.
Câest le paradoxe que ce chapitre va expliquer. Comprendre la bande passante mĂ©moire, câest comprendre pourquoi votre config gĂ©nĂšre 4 tokens/s au lieu de 40 â et comment y remĂ©dier.
En architecture systĂšme appliquĂ©e Ă lâIA, une rĂ©alitĂ© revient en permanence : en infĂ©rence LLM, la limite est souvent la mĂ©moire avant le calcul brut1.
Ce phĂ©nomĂšne est classiquement appelĂ© âMemory Wallâ. Pendant la gĂ©nĂ©ration auto-rĂ©gressive, le GPU/CPU alterne des phases de calcul trĂšs rapides et des phases dâattente de donnĂ©es depuis la mĂ©moire. Le dĂ©bit final est donc fortement corrĂ©lĂ© Ă la bande passante mĂ©moire (Go/s), pas seulement aux TFLOPS1.
đ§ La Physique de lâInfĂ©rence : Prefill vs Decoding
Pour comprendre le goulot dâĂ©tranglement, il faut sĂ©parer deux phases :
graph TD
A[Saisie du Prompt] --> B(Phase 1: Prefill)
B -->|Calcul parallÚle lourd| C[Calculé en TFLOPS]
C --> D(Phase 2: Decoding / Génération)
D -->|Lecture séquentielle de la RAM| E[Bloqué par la Bande Passante]
1. La Phase de âPrefillâ (Ingestion du Prompt)
Le modĂšle traite le prompt dâentrĂ©e en parallĂšle (matrices de grande taille).
- Comportement matériel : meilleure utilisation des unités de calcul.
- Facteur dominant : mix calcul + mĂ©moire, souvent plus favorable au calcul quâen decoding.
2. La Phase de âDecodingâ (GĂ©nĂ©ration Mot Ă Mot)
Le modÚle génÚre un token puis recommence le cycle pour le token suivant. Ce processus est séquentiel.
- Comportement matĂ©riel : lecture rĂ©pĂ©tĂ©e des poids + gestion du KV Cache ; lâintensitĂ© arithmĂ©tique est plus faible quâen prefill.
- Facteur dominant : la bande passante mémoire, surtout à batch faible1.
đ LâĂquation MathĂ©matique du DĂ©bit
Pour dimensionner rapidement une machine, on utilise une borne supérieure :
Cas Pratique : ModĂšle dense 70B en quantification 4-bit (Q4)
Un modÚle dense de 70B quantifié en 4-bit occupe environ 40 Go en mémoire de poids (ordre de grandeur).
- Sur un PC classique (RAM DDR5 Dual Channel) :
- Bande passante réelle :
- Calcul : (borne théorique).
- Sur un systĂšme AMD Ryzen AI Max PRO 495 (Gorgon Halo) :
- Bande passante réelle :
- Calcul : (borne théorique).
- Sur un Mac Studio M4 Max (Mémoire Unifiée haut de gamme) :
- Bande passante réelle :
- Calcul : (borne théorique).
- Sur une carte Nvidia RTX 5090 (VRAM GDDR7 dédiée - Blackwell) :
- Bande passante réelle :
- Calcul : (borne théorique).
đ Le Grand Comparatif des Technologies de Stockage (2026)
Valeurs ci-dessous : ordres de grandeur utiles pour lâarchitecture (les performances rĂ©elles varient selon le stack logiciel et la charge).
| Technologie | Bande passante (ordre de grandeur) | Source | Impact pour lâinfĂ©rence |
|---|---|---|---|
| Ethernet 10 GbE | conversion 10 Gbit/s | trop faible pour âĂ©tendreâ un modĂšle en ligne sans forte pĂ©nalitĂ© | |
| PCIe 5.0 x16 | (agrĂ©gĂ©) | spĂ©cification bus | devient un goulot lors des transferts frĂ©quents CPUâGPU |
| RAM DDR5 desktop | à | plateformes dual-channel typiques | capacité élevée, débit limité pour grands LLM |
| MĂ©moire unifiĂ©e AMD Ryzen AI Max PRO 400 | jusquâĂ | 3 | compromis capacitĂ©/dĂ©bit intĂ©ressant en x86 |
| Mémoire unifiée Apple M4 Max / M3 Ultra | à | 4 | excellent débit local sans offload PCIe |
| VRAM RTX 5090 (GDDR7) | 56 | trÚs haut débit pour decoding rapide |
Les Limites du Clustering Réseau
đ Sources et RĂ©fĂ©rences
Footnotes
-
Amir Gholami et al., AI and Memory Wall (arXiv:2403.14123), 2024. https://arxiv.org/abs/2403.14123 â© â©2 â©3
-
Meta, Llama 4 Model Card (Scout/Maverick, MoE, pas de variante â70Bâ dense), 2025. https://raw.githubusercontent.com/meta-llama/llama-models/main/models/llama4/MODEL_CARD.md â©
-
ServeTheHome, AMD Ups Ante With 192GB Ryzen AI Max PRO 400 Chips for AI Systems, 2026. https://www.servethehome.com/amd-reveals-ryzen-ai-max-pro-400-series-192gb-ram-for-ai-systems/ â©
-
Apple, Mac Studio - Technical Specifications, 2026. https://www.apple.com/mac-studio/specs/ â©
-
NVIDIA, GeForce RTX 5090 product page (32 GB GDDR7, bus 512-bit, TGP 575 W). https://www.nvidia.com/fr-fr/geforce/graphics-cards/50-series/rtx-5090/ â©
-
TechPowerUp, NVIDIA GeForce RTX 5090 Specs (bandwidth mĂ©moire 1.79 TB/s), 2026. https://www.techpowerup.com/gpu-specs/geforce-rtx-5090.c4216 â©