Aller au contenu

🏢 Scénario B : L'Appliance PME (Mémoire Unifiée)

Votre client (une agence d’avocats, un cabinet médical, une PME) a besoin d’un assistant local capable de traiter des documents confidentiels. Le modèle retenu est un LLM lourd (classe 70B quantifié, soit ~40 Go de poids).

Comme vu dans le Scénario A, un PC classique s’effondre à cause du CPU Offloading. Acheter un serveur multi-GPU coûte très cher, fait le bruit d’un avion au décollage et consomme énormément d’électricité. La solution la plus élégante en 2026 est l’Appliance à Mémoire Unifiée.


🏗️ L’Architecture Matérielle

L’objectif est d’avoir une seule puce (SoC) où le CPU et le GPU piochent dans la même énorme réserve de mémoire. Deux choix s’offrent à vous :

  • Option Apple (Le standard du silence) : Un Mac Studio M4 Max (128 Go) ou M3 Ultra (192 Go).
  • Option PC x86 (La souveraineté Docker) : Une station de travail basée sur l’APU AMD Ryzen AI Max PRO 400 (“Gorgon Halo”) avec 192 Go de RAM.

Budget estimé (2026) : Entre 3 700 € et 7 500 € (selon la puce et la quantité de mémoire soudée). Avantages physiques : Consommation électrique très faible (souvent moins de 150W en pleine charge), format compact, aucun bruit de ventilation excessif.


⚙️ La Stack Logicielle

Ici, la stack logicielle diffère selon le matériel choisi :

  • Sur Mac Studio : Le moteur de référence est llama.cpp (ou son dérivé serveur natif MLX Server optimisé par Apple). Il permet d’exploiter la bande passante maximale via l’API graphique Metal.
  • Sur AMD Gorgon Halo (Linux) : Vous pouvez utiliser vLLM via la surcouche logicielle ROCm d’AMD, ce qui permet d’activer des optimisations serveurs comme le Continuous Batching.

Les Performances Attendues

Puisque le modèle de 40 Go rentre intégralement dans la Mémoire unifiée (qui agit ici comme une immense VRAM), les vitesses de génération sont excellentes et stables :

  • Mac Studio (M4 Max, ~546 Go/s) : Entre 10 et 15 tokens/s en phase de Decoding1 — cohérent avec la borne théorique de ~13,6 t/s calculée dans le chapitre bande passante.
  • AMD Ryzen AI Max PRO 400 (~273 Go/s) : De l’ordre de 5 à 7 tokens/s selon les benchmarks disponibles2 — également cohérent avec la formule (borne théorique ~6,8 t/s).

Le Piège du KV Cache Concurrent


📋 Le Verdict de l’Architecte

✅ Quand utiliser ce Blueprint ?

  • C’est le cœur de cible de l’IA on-premise pour les PME.
  • Parfait pour un déploiement “sous le bureau” ou dans une petite baie de brassage non climatisée.
  • Excellent pour exécuter un assistant ou agent souverain local servant une dizaine de requêtes concurrentes modérées.

❌ Quand fuir ce Blueprint ?

  • Si votre client a un besoin de croissance non prévisible. La mémoire unifiée est soudée à la carte mère. Il est impossible de rajouter de la RAM dans un Mac Studio ou un APU Gorgon Halo après l’achat. Si le modèle métier de l’entreprise passe de 70B à 200B l’année suivante, il faudra jeter la machine et en racheter une.

Pour dépasser cette contrainte de capacité fixe et rester sur du matériel de bureau abordable, le prochain blueprint propose une approche évolutive : Le Cluster Bureau — relier plusieurs machines via Thunderbolt.


🛡️ Sauvegarde et Reprise (DRP)

Ce qu’il faut sauvegarder sur le Blueprint B

DonnéesEmplacement typiqueFréquence
Base vectorielle (Qdrant / Chroma)/qdrant/storage/ ou volume DockerQuotidien — snapshot API
Historiques de conversations (SQLite)~/.open-webui/data/ ou volume DockerQuotidien ou horaire
Configuration Ollama / vLLM~/.ollama/ ou config.yamlÀ chaque modification (Git)
Adaptateurs LoRA fine-tunésRépertoire dédiéAprès chaque session d’entraînement
Modèles de base (GGUF)~/.ollama/models/Non prioritaire — re-téléchargeable

Procédure de reprise minimale

  1. Démarrer une instance temporaire (autre Mac, VM cloud souverain) avec Ollama
  2. Restaurer la base vectorielle depuis le dernier snapshot
  3. Restaurer l’historique SQLite
  4. Pointer les clients (Open WebUI, LiteLLM) vers la nouvelle IP

RTO indicatif Blueprint B : < 45 minutes avec une sauvegarde quotidienne à jour.


📚 Sources et Références

Footnotes

  1. llmhardware.io, Mac Studio M4 Max / M3 Ultra for LLMs (Performances Llama 3 70B Q4_K_M avec MLX et allocation de mémoire Metal maximale), 2025-2026. https://llmhardware.io/guides/mac-studio-m4-max-llm-guide

  2. ServeTheHome & ignasivt (GitHub), Strix Halo / Gorgon Halo 192GB Unified Memory Benchmarks (Débit decoding attendu sur modèle dense 70B), Mai 2026. https://www.servethehome.com/amd-reveals-ryzen-ai-max-pro-400-series-192gb-ram-for-ai-systems/ · https://github.com/ignasivt/strix-halo-guide