🚀 Index Zero to Hero
Bienvenue dans le “Zero to Hero” de l’IA Locale. Ce Vault est conçu comme un jardin numérique : ne le lisez pas de manière linéaire. Suivez vos besoins, cliquez sur les concepts que vous ne maîtrisez pas encore, et construisez votre expertise pas à pas.
🔒 Pourquoi faire tourner l’IA en local ?
Vous utilisez peut-être déjà ChatGPT ou Claude au quotidien. Pourquoi alors se donner la peine d’héberger un modèle soi-même ?
1. Souveraineté des données Chaque prompt envoyé à un service cloud est traité sur des serveurs tiers, souvent hors de l’Union Européenne. Dans un cabinet médical, un service juridique, une administration ou une entreprise industrielle, certaines données ne peuvent légalement pas sortir de vos locaux — RGPD, secret professionnel, classification. L’IA on-premise est la seule réponse technique à cette contrainte. Pour une grille d’audit en 6 critères et le cadre RGPD/AI Act, voir 🔒 Souveraineté & Confidentialité.
2. Coût prévisible à l’échelle Une API cloud facture à la requête. À faible volume, c’est négligeable. À 50 employés qui interrogent un assistant toute la journée, la facture mensuelle peut dépasser le coût d’amortissement d’une machine dédiée en quelques mois.
3. Contrôle total : modèle, comportement, disponibilité En local, vous choisissez le modèle, vous le personnalisez, il fonctionne sans connexion Internet et sa disponibilité ne dépend pas des politiques tarifaires ou des conditions d’utilisation d’un tiers.
🗺️ Sommaire du Vault
📁 01 - Les Fondations (La Physique de l’IA)
Pour comprendre pourquoi un ordinateur à 4000€ peut être trop lent pour l’IA.
- 🧠 Le Voyage d'un Prompt (Fonctionnement)
- 🏎️ La Bande Passante Mémoire (Memory Bandwidth)
- ⚔️ Mémoire Unifiée vs RAM vs VRAM
- 💾 KV Cache et Contexte
- 🗜️ Quantification 4-bit & 8-bit
📁 02 - Le Matériel (Le Fer)
Le catalogue des architectures.
- 🖥️ Index Matériel — parcours par blueprint
- 🧠 APU & Mémoire Unifiée (AMD Strix Halo & Mac)
- 🧩 Stations Multi-GPU (Nvidia, PCIe)
- 🏭 Serveurs rack GPU (1U–HGX, RTX vs datacenter)
- 🌐 Réseau IA : RoCE, InfiniBand et Thunderbolt
📁 03 - La Stack Logicielle (Les Moteurs)
Comment donner vie aux puces.
- ⚙️ Moteurs d'Inférence : vLLM, Ollama et TensorRT-LLM
- 🌐 Clustering IA : Relier les GPU avec Exo et Ray
- 🧩 RAG & Agents : L'architecture de la connaissance
- 🗺️ Choisir son modèle local — familles 2026, tailles, spécialisations, correspondance blueprints
📁 04 - Les Blueprints d’Architecture (Scénarios)
Des configurations prêtes à être proposées à vos clients.
- 🛠️ Scénario A : Le Labo Dev (CPU Offloading)
- 🏢 Scénario B : L'Appliance PME (Mémoire Unifiée)
- 🖥️ Scénario C : Le Cluster Bureau (Exo & Thunderbolt)
- 🏭 Scénario D : Datacenter (RoCE & Multi-GPU)
- 💰 Comparaison TCO : On-Premise vs Cloud API — point de rentabilité par scénario
📁 05 - Agents & Assistants On-Premise
La couche applicative : l’IA qui vous connaît et l’IA qui agit pour vous.
- 🤖 Vue d'ensemble : deux pistes, une question de souveraineté
- 🔒 Souveraineté & Confidentialité — grille d’audit en 6 critères, RGPD/AI Act
- 🏗️ Architectures Possibles — assistant, custodien, hybride
- 🧑💼 Assistants Personnels (l'IA qui apprend de vos données)
- 🤖 Agents Custodiens (l'IA qui maintient votre vault)
- Agent custodien · Human-in-the-loop · Memory Tree
📁 06 - Mise en œuvre pratique
Comment tester et décider avant de déployer.
- 🧪 Vue d'ensemble : protocoles pratiques
- 🚀 Démarrer avec Ollama — installation, premier modèle, API, réglages de base
- 🧪 Évaluer un modèle local — qualité, hallucinations, RAG, agents, KPI et performances
- 🔒 Sécurité de l'inférence locale — auth API, isolation réseau, OWASP LLM Top 10, agents
- ⚙️ Configurer vLLM multi-GPU — tensor parallelism, Ray, production
- 📊 Monitoring Prometheus + Grafana — métriques GPU, KV Cache, alertes
- 🔄 Migrer d'Ollama vers vLLM — bascule sans coupure, compatibilité API
🧭 Quel blueprint choisir ?
Vous avez un besoin concret ? Ce tableau vous oriente en 30 secondes.
| Utilisateurs simultanés | Taille de modèle | Budget matériel | → Blueprint |
|---|---|---|---|
| 1 (dev / test) | 8–14B | < 3 500 € | [[04-blueprints/scenario-a-dev-lab |
| 1 (dev / test) | 70B avec offloading | < 3 500 € | [[04-blueprints/scenario-a-dev-lab |
| 2–20 (PME, équipe) | 70B | 4 000–8 000 € | [[04-blueprints/scenario-b-sme-appliance |
| 2–20 (PME, équipe) | 200B+ / MoE | 10 000–15 000 € | [[04-blueprints/scenario-c-desktop-cluster |
| 50+ (production) | 70B–400B | > 300 000 € | [[04-blueprints/scenario-d-datacenter |
| Contrainte SLA < 500 ms | Tout | — | [[04-blueprints/scenario-d-datacenter |
🚶 Je découvre : par où commencer ?
Première visite ? Suivez ce chemin avant d’explorer librement :
- LLM (c’est quoi un grand modèle de langage ?)
- Inférence (LLM) (comment on l’utilise au quotidien)
- 🧠 Le Voyage d'un Prompt (ce qui se passe vraiment quand vous lui parlez)
- 🏎️ La Bande Passante Mémoire (pourquoi votre machine peut ramer)
- 🛠️ Scénario A : Le Labo Dev (votre premier blueprint concret)
📖 Dictionnaire & Concepts
Retrouvez ici la définition rapide de tous les termes techniques. 👉 Glossaire IA