🏭 Serveurs rack GPU
Après les APU mémoire unifiée (PME légère) et les stations bureau, les serveurs rack GPU sont la brique standard des scénarios B (appliance rackable) et D (datacenter) — voir Scénario B et Scénario D.
1. Formats et capacité GPU
| Format | GPU typiques | Usage inférence |
|---|---|---|
| 1U | 1–2 GPU (souvent RTX/L40S) | PME, edge, modèles ≤ 30B quantifiés |
| 2U | 2–4 GPU PCIe | Sweet spot PME / ETI — [[00-lexique/vllm |
| 4U | 4–8 GPU, parfois NVLink intra-nœud | Modèles 70B+, tensor parallelism |
| HGX / OAM | 8× H100/H200/B200, [[00-lexique/nvswitch | NVSwitch]] |
La contrainte n°1 reste la VRAM totale adressable : un Llama 3 70B en FP16 demande ~140 Go de poids seuls, sans compter le KV Cache concurrent.
2. RTX consumer vs GPU datacenter
| Critère | RTX 4090 / 5090 (workstation/rack 2U) | H100 / H200 / B200 (HGX) |
|---|---|---|
| VRAM | 24–32 Go | 80–192 Go [[00-lexique/hbm |
| Bande passante mémoire | ~1–1,5 To/s | ~3–8 To/s |
| NVLink multi-GPU | Limité (2 GPU bridge) | [[00-lexique/nvswitch |
| Coût d’acquisition | Ordre de grandeur ×5–×10 inférieur au HGX | TCO datacenter, support enterprise |
| Meilleur pour | Scénario B, labo charge modérée | Scénario D, SLA strict, gros modèles |
3. Dimensionnement rapide
Étape 1 — Poids du modèle cible
Utilisez quantification 4/8-bit et Choisir son modèle pour estimer la VRAM poids.
Étape 2 — KV Cache concurrent
Référez-vous à KV Cache et contexte : chaque session active consomme de la VRAM proportionnelle à la longueur de contexte.
Étape 3 — Moteur
Ollama sur 1 GPU RTX convient au test ; la production multi-user bascule vers vLLM ou TensorRT-LLM — ⚙️ Moteurs d'inférence.
Étape 4 — Réseau multi-nœuds
Au-delà d’un nœud, le fabric RoCE ou InfiniBand devient obligatoire pour le tensor parallelism inter-serveurs.
4. Pièges d’achat
- Sous-estimer le refroidissement et l’alimentation : GPU datacenter en 1U = bruit et thermique extrêmes ; prévoir salle ou baie adaptée.
- PCIe x16 partagé : vérifier le découpage des lanes quand 4 GPU partagent le même CPU — voir Stations multi-GPU (mêmes principes).
- Licences et support : certains constructeurs restreignent l’usage « datacenter » des cartes gaming — lire les EULA avant déploiement prod.
- Oublier le front applicatif : le rack GPU sert vLLM ; l’UI utilisateur reste Open WebUI ou équivalent.
📋 Le conseil de l’architecte
Pour une PME qui veut un rack 2U × 2× L40S ou RTX pro : dimensionnez pour un modèle 32B–70B quantifié + 10–20 utilisateurs concurrents, front Open WebUI, vLLM derrière reverse proxy — blueprint B.
Pour un datacenter : commencez par le modèle cible (405B ? 70B dense ? MoE ?) et descendez vers le nombre de GPU HGX — blueprint D.