Aller au contenu

🧠 APU & Mémoire Unifiée

Pour un déploiement souverain d’IA en entreprise, la mémoire unifiée est l’une des ruptures matérielles les plus importantes de la décennie.

En supprimant la copie RAM → VRAM via PCIe, les SoC APU (CPU + GPU + NPU sur la même puce) accèdent à un pool de LPDDR5X partagé — jusqu’à 192 Go sur les plateformes AMD Ryzen AI Max PRO 400, et jusqu’à 512 Go sur le Mac Studio M3 Ultra 123. C’est l’architecture de référence pour exécuter des modèles 70B+ quantifiés (ex. Llama 3.1 70B en Q4_K_M, ~40 Go de poids) sur une station de bureau silencieuse, sans serveur GPU datacenter 45.


⚔️ Le Paysage Matériel : Apple Silicon vs AMD Gorgon Halo

Deux écosystèmes dominent la mémoire unifiée hautes performances en 2026 :

1. Apple Silicon (Mac Studio 2025)

Apple intègre CPU, GPU et NPU sur un même package, avec des barrettes LPDDR5X soudées à proximité immédiate du silicium 43.

  • Mac Studio M4 Max (CTO 16c CPU / 40c GPU) : jusqu’à 128 Go unifiés, 546 Go/s de bande passante 43.
  • Mac Studio M3 Ultra (CTO 32c CPU / 80c GPU) : jusqu’à 512 Go unifiés (192 Go est une config courante pour le local LLM), 819 Go/s 36. Apple n’a pas publié de M4 Ultra en 2025 : l’UltraFusion reste réservé à la génération M3 6.
  • Forces : bande passante très élevée, écosystèmes MLX et Metal matures, silence et faible consommation 47.
  • Limites : macOS, mémoire non évolutive (soudée), tarif élevé en configuration 128 Go+ 3.

2. AMD Ryzen AI Max PRO 400 (« Gorgon Halo »)

Refresh professionnel de la plateforme Strix Halo (Zen 5 + RDNA 3.5), annoncé mai 2026 pour des systèmes OEM au T3 2026 12.

  • Architecture : jusqu’à 16 cœurs Zen 5, iGPU Radeon 8065S (40 CU sur le SKU flagship Max+ PRO 495), bus mémoire 256-bit LPDDR5X-8533 12.
  • Capacité : jusqu’à 192 Go unifiés (+50 % vs la série 300 à 128 Go) 12.
  • Bande passante : ~273 Go/s (contre ~256 Go/s théoriques sur Strix Halo 128 Go — gain ~7 % lié au clock mémoire) 12.
  • Allocation GPU : jusqu’à 160 Go réservables comme VRAM iGPU, 32 Go laissés au système 12.
  • Forces : x86 ouvert (Linux / Windows / Docker natif), rapport capacité/prix attractif sur la plateforme Ryzen AI Halo (~3 999 $ pour la config 128 Go actuelle) 89.
  • Limites : bande passante ~2× inférieure au M4 Max — le décodage des modèles denses 70B reste memory-bound (~5 tok/s mesurés sur Strix Halo 395, profil similaire attendu sur PRO 400) 2105.

3. NVIDIA Grace Blackwell (DGX Spark / RTX Spark)

Annoncé en 2025 et disponible à partir de 2026, le DGX Spark (anciennement Project Digits) est le premier produit NVIDIA combinant un SoC ARM et un GPU Blackwell sur un boîtier de bureau 11.

  • Architecture : SoC Grace Blackwell — CPU ARM 20 cœurs (Grace) + GPU Blackwell, co-développé avec MediaTek, gravé TSMC 3nm 11.
  • Mémoire unifiée LPDDR5x : 128 Go sur le DGX Spark (~3 999 $) ; la DGX Station monte à 748 Go pour des modèles > 400B 11.
  • Bande passante : ~273 Go/s (LPDDR5x) — proche de l’AMD Gorgon Halo 11.
  • Consommation : ~240 W (DGX Spark) vs ~1 100 W pour une station 2× RTX 4090 11.
  • FP4 natif (Blackwell) : contrairement à l’architecture Ada Lovelace (RTX 4090 — FP4 émulé), Blackwell implémente le FP4 dans le silicium — sans surcoût logiciel 12.
  • Scale-out QSFP 200 Gbps : un port dédié permet d’interconnecter plusieurs boîtiers DGX Spark en fabric mesh, sans switch externe supplémentaire 11.
  • Logiciel NVIDIA Sync : environnement CUDA complet pré-installé pour réduire la friction au démarrage.

🏎️ Pourquoi l’unifié supprime le « goulot PCIe » ?

Sur un PC avec GPU discret, charger un LLM implique souvent une copie des poids de la RAM système vers la VRAM via PCIe (typiquement ~32–64 Go/s effectifs en pratique, loin des ~1 500+ Go/s internes au GPU) 13.

graph TD
    subgraph "PC Classique (Goulot PCIe)"
        A[SSD / NVMe] -->|Lecture| B[RAM Système DDR5]
        B -->|Copie via PCIe ~32-64 Go/s| C[VRAM dédiée GDDR]
        C -->|Calcul ~1500+ Go/s| D[Cœurs GPU]
    end
graph TD
    subgraph "Mémoire Unifiée (Apple / AMD)"
        E[SSD / NVMe] -->|Lecture| F[LPDDR5X unifiée]
        F -->|Bus direct 273-819 Go/s| G[Cœurs CPU et GPU]
    end

En mémoire unifiée, CPU et GPU adressent le même pool physique : pas de duplication des poids ni de transfert PCIe pour les tensors déjà en RAM 13. Le compromis : une bande passante globale partagée et inférieure à une VRAM GDDR7 dédiée, mais une capacité bien plus grande par machine 13.


🛠️ Guide Pratique : Configurer l’allocation mémoire GPU

Les OS limitent par défaut la part de RAM unifiée utilisable par le GPU — il faut relever ce plafond pour les LLM lourds.

1. Côté AMD (Ryzen AI Max 300 / PRO 400)

Sur Strix Halo et Gorgon Halo, l’allocation se fait surtout via BIOS/firmware OEM 12 :

  1. Redémarrer → BIOS/UEFI.
  2. Menu AdvancedUMA Frame Buffer Size (libellé variable selon OEM).
  3. Sur un système 192 Go, AMD documente jusqu’à 160 Go pour le GPU et 32 Go pour l’OS 12.

Les systèmes PRO 400 arrivent en T3 2026 (HP, Lenovo, ASUS…) ; les guides Strix Halo 395 restent pertinents pour llama.cpp/Vulkan/ROCm en attendant 109.

2. Côté Apple Silicon (macOS)

Par défaut, macOS plafonne la working set Metal du GPU à environ 75 % de la RAM unifiée (via recommendedMaxWorkingSetSize) — sur 128 Go, seuls ~96 Go sont exploitables sans tweak 1415.

Pour relever la limite (ex. ~120 Go sur une machine 128 Go), la commande documentée par la communauté llama.cpp/MLX est :

Fenêtre de terminal
# Valeur en MÉGABYTES (ex. 120 Go → 120 × 1024 = 122880)
sudo sysctl iogpu.wired_limit_mb=122880
  • Vérifier : sysctl iogpu.wired_limit_mb (0 = politique par défaut).
  • Revenir au défaut : sudo sysctl iogpu.wired_limit_mb=0 1415.
  • Laisser 8–16 Go au système pour éviter pression mémoire / swap 1415.
  • La modification est volatile (perdue au reboot) ; pour la persistance, utiliser un LaunchDaemon ou équivalent — non supporté officiellement par Apple 1415.

📊 Arbitrage Économique et Performance (2026)

Comparaison de stations unifiées pour Llama 3.1 70B Q4_K_M (~40 Go de poids). Vitesses = décodage (génération), ordres de grandeur mesurés ou publiés — varient selon backend (MLX vs llama.cpp vs CUDA), contexte et build.

CritèreMac Studio (M4 Max 128 Go)Mac Studio (M3 Ultra 192 Go)AMD Ryzen AI (Halo / PRO 400)NVIDIA DGX Spark
Puce (config LLM)M4 Max 16c/40c GPU 3M3 Ultra 32c/80c GPU 3Ryzen AI Max+ PRO 495 12Grace Blackwell SoC 11
RAM unifiée max128 Go 3512 Go (192 Go courant) 3192 Go 12128 Go LPDDR5x 11
VRAM GPU max allouable~120 Go (sysctl, 128 Go machine) 14~160–184 Go (selon RAM totale) 14160 Go (BIOS max) — en pratique ~130–140 Go 12~128 Go (accès CUDA direct) 11
Bande passante546 Go/s 43819 Go/s 3~273 Go/s 12~273 Go/s 11
Débit 70B Q4 (decode)~10–12 tok/s (MLX) 57~12–15 tok/s (MLX) 57~4,5–5 tok/s (Strix Halo 395) 105non publié officiellement
FP4 natif✅ Blackwell 12
Scale-out✅ QSFP 200 Gbps 11
OSmacOSmacOSLinux / Windows 12Linux (CUDA) 11
Tarif indicatif~4 500–5 500 € (128 Go, CTO) 36~5 000–7 500 € (192 Go+, CTO) 36~3 700 € (128 Go) 89~3 999 $ (128 Go) 11

📋 Le Conseil de l’Architecte

Pour un déploiement souverain on-premise :

  1. Souveraineté x86 + Docker (AMD Halo / PRO 400) : si la stack repose sur Linux, Docker et Python, la plateforme AMD est la plus rationnelle : 160 Go VRAM allouables, écosystème ouvert, prix inférieur au Mac Studio équivalent en capacité 128. Acceptez un débit ~5 tok/s sur un 70B dense — privilégiez les MoE (Qwen3.5-A3B, etc.) pour l’interactivité 10.
  2. Vitesse et confort (Mac Studio) : pour le meilleur ressenti sur un 70B dense (~12–15 tok/s en MLX sur M3 Ultra), le Mac Studio M3 Ultra 192 Go+ reste le roi de la bande passante unifiée en 2026 ; le M4 Max 128 Go est un excellent compromis si 128 Go suffisent 357. Budget macOS et conteneurs à anticiper.
  3. CUDA + FP4 + scale-out (NVIDIA DGX Spark) : si votre équipe est déjà dans l’écosystème NVIDIA (CUDA, TensorRT, vLLM), le DGX Spark offre 128 Go LPDDR5x accessibles nativement via CUDA, le FP4 natif Blackwell, et la possibilité d’interconnecter plusieurs boîtiers via QSFP 200 Gbps sans reconfigurer l’infrastructure 11. Il n’est pas le meilleur choix pour l’inférence pure sur modèles ≤ 34B : une station 2× RTX 4090 reste plus rapide à ce cas d’usage.
  4. Dimensionnez dès l’achat : la mémoire LPDDR5X est soudée — impossible d’upgrader après coup. Prévoyez marge pour poids + KV cache + OS + page cache de chargement (voir chapitres fondations). Sur un système 192 Go AMD, allouer 160 Go au GPU laisse 32 Go système — suffisant au repos, mais serré lors du premier chargement d’un modèle ≥ 100 Go.

📚 Sources et Références

Footnotes

  1. AMD, AMD Powers Next-Generation Agent Computers — Ryzen AI Max PRO 400 Series, mai 2026. https://www.amd.com/en/blogs/2026/amd-powers-next-generation-agent-computers-with-new-ryzen-ai-hal.html 2 3 4 5 6 7 8 9 10 11 12 13 14

  2. ServeTheHome, AMD Ups Ante With 192GB Ryzen AI Max PRO 400 Chips for AI Systems, mai 2026. https://www.servethehome.com/amd-reveals-ryzen-ai-max-pro-400-series-192gb-ram-for-ai-systems/ 2 3 4 5 6 7 8 9 10 11 12 13 14 15

  3. Apple, Mac Studio — Technical Specifications (M4 Max / M3 Ultra, RAM, bande passante), 2025. https://www.apple.com/mac-studio/specs/ 2 3 4 5 6 7 8 9 10 11 12 13 14

  4. Apple Newsroom, Apple introduces M4 Pro and M4 Max, octobre 2024 (546 Go/s, 128 Go max M4 Max). https://www.apple.com/newsroom/2024/10/apple-introduces-m4-pro-and-m4-max/ 2 3 4 5

  5. CraftRigs, How to Run Llama 3 70B on a Mac with 128 GB RAM (vitesses MLX M3 Ultra / M4 Max), 2025. https://craftrigs.com/guides/run-llama-70b-mac-128gb-ram/ 2 3 4 5 6 7

  6. Apple Support, Mac Studio (2025) — Tech Specs (configurations CTO, RAM). https://support.apple.com/en-us/122211 2 3 4

  7. llmhardware.io, Mac Studio M4 Max for LLMs (Llama 3.3 70B Q4 ~14–20 tok/s MLX), 2025. https://llmhardware.io/guides/mac-studio-m4-max-llm-guide 2 3 4 5

  8. TweakTown, AMD launches Ryzen AI Max PRO 400 — up to 192GB unified memory, mai 2026. https://www.tweaktown.com/news/111752/amd-launches-the-ryzen-ai-max-pro-400-series-of-cpus-up-to-16-cores-with-192gb-of-unified-memory/index.html 2 3

  9. VideoCardz, AMD confirms Ryzen AI MAX 400 Gorgon Halo — 192GB / 160GB VRAM, mai 2026. https://videocardz.com/newz/amd-confirms-ryzen-ai-max-400-gorgon-halo-will-support-up-to-192gb-memory-and-160gb-vram 2 3

  10. ignasivt, Strix Halo Guide (benchmarks llama.cpp Llama 3.1 70B Q4 ~4,7–4,9 tok/s), 2026. https://github.com/ignasivt/strix-halo-guide 2 3 4

  11. NVIDIA, Project DIGITS / DGX Spark — page produit officielle (Grace Blackwell SoC, 128 Go LPDDR5x, ~273 Go/s, ~240 W TDP, QSFP 200 Gbps, 3 999 $, NVIDIA Sync). https://www.nvidia.com/en-us/project-digits/ 2 3 4 5 6 7 8 9 10 11 12 13 14

  12. NVIDIA, NVIDIA Blackwell Architecture Technical Brief (FP4 Tensor Cores natifs vs FP4 émulé Ada Lovelace). https://resources.nvidia.com/en-us-blackwell-architecture 2

  13. NVIDIA Technical Blog, Mastering LLM Techniques: Inference Optimization (goulots mémoire, quantification), novembre 2023. https://developer.nvidia.com/blog/mastering-llm-techniques-inference-optimization/ 2 3

  14. ggml-org/llama.cpp, Issue #16646 (iogpu.wired_limit_mb), 2025. https://github.com/ggml-org/llama.cpp/issues/16646 2 3 4 5 6

  15. ivanopcode, Override macOS Metal VRAM cap (iogpu.wired_limit_mb, tableaux par RAM), 2025. https://github.com/ivanopcode/devnote-override-macos-metal-vram-cap 2 3 4