Aller au contenu

🏭 Serveurs rack GPU

Après les APU mémoire unifiée (PME légère) et les stations bureau, les serveurs rack GPU sont la brique standard des scénarios B (appliance rackable) et D (datacenter) — voir Scénario B et Scénario D.


1. Formats et capacité GPU

FormatGPU typiquesUsage inférence
1U1–2 GPU (souvent RTX/L40S)PME, edge, modèles ≤ 30B quantifiés
2U2–4 GPU PCIeSweet spot PME / ETI — [[00-lexique/vllm
4U4–8 GPU, parfois NVLink intra-nœudModèles 70B+, tensor parallelism
HGX / OAM8× H100/H200/B200, [[00-lexique/nvswitchNVSwitch]]

La contrainte n°1 reste la VRAM totale adressable : un Llama 3 70B en FP16 demande ~140 Go de poids seuls, sans compter le KV Cache concurrent.


2. RTX consumer vs GPU datacenter

CritèreRTX 4090 / 5090 (workstation/rack 2U)H100 / H200 / B200 (HGX)
VRAM24–32 Go80–192 Go [[00-lexique/hbm
Bande passante mémoire~1–1,5 To/s~3–8 To/s
NVLink multi-GPULimité (2 GPU bridge)[[00-lexique/nvswitch
Coût d’acquisitionOrdre de grandeur ×5–×10 inférieur au HGXTCO datacenter, support enterprise
Meilleur pourScénario B, labo charge modéréeScénario D, SLA strict, gros modèles

3. Dimensionnement rapide

Étape 1 — Poids du modèle cible
Utilisez quantification 4/8-bit et Choisir son modèle pour estimer la VRAM poids.

Étape 2 — KV Cache concurrent
Référez-vous à KV Cache et contexte : chaque session active consomme de la VRAM proportionnelle à la longueur de contexte.

Étape 3 — Moteur
Ollama sur 1 GPU RTX convient au test ; la production multi-user bascule vers vLLM ou TensorRT-LLM — ⚙️ Moteurs d'inférence.

Étape 4 — Réseau multi-nœuds
Au-delà d’un nœud, le fabric RoCE ou InfiniBand devient obligatoire pour le tensor parallelism inter-serveurs.


4. Pièges d’achat

  • Sous-estimer le refroidissement et l’alimentation : GPU datacenter en 1U = bruit et thermique extrêmes ; prévoir salle ou baie adaptée.
  • PCIe x16 partagé : vérifier le découpage des lanes quand 4 GPU partagent le même CPU — voir Stations multi-GPU (mêmes principes).
  • Licences et support : certains constructeurs restreignent l’usage « datacenter » des cartes gaming — lire les EULA avant déploiement prod.
  • Oublier le front applicatif : le rack GPU sert vLLM ; l’UI utilisateur reste Open WebUI ou équivalent.

📋 Le conseil de l’architecte

Pour une PME qui veut un rack 2U × 2× L40S ou RTX pro : dimensionnez pour un modèle 32B–70B quantifié + 10–20 utilisateurs concurrents, front Open WebUI, vLLM derrière reverse proxy — blueprint B.

Pour un datacenter : commencez par le modèle cible (405B ? 70B dense ? MoE ?) et descendez vers le nombre de GPU HGX — blueprint D.


📚 Sources