Ce glossaire centralise les notions clés de l’IA on-premise.
Utilisez-le comme point d’entrée rapide, puis ouvrez les fiches détaillées.
Index complet : toutes les fiches du lexique (liste alphabétique, mise à jour au build).
🚶 Débutant — je découvre
Je ne sais pas par où commencer :
LLM → Inférence (LLM) → 🧠 Le Voyage d'un Prompt → Prefill / Decoding → Memory Wall → 🏎️ La Bande Passante Mémoire
Parcours recommandé
- Performance d’inférence : Inférence (LLM), Memory Wall, Bande passante mémoire, Prefill, Decoding, Tokens par seconde, TTFT.
- Mémoire & matériel : VRAM, RAM, Mémoire unifiée, PCIe, Multi-GPU, NVLink, NVSwitch.
- Systèmes IA en production : Quantification, Quantification Q4, KV Cache, RAG, RDMA, RoCE, InfiniBand.
- Réseau datacenter : PFC, ECN, NCCL, GPUDirect RDMA.
- Évaluation des modèles : Benchmark LLM, LLM-as-a-judge, RAGAS.
Index des acronymes
| Acronyme | Signification |
|---|
| APU | Accelerated Processing Unit |
| ECN | Explicit Congestion Notification |
| HBM | High Bandwidth Memory |
| IB | InfiniBand |
| KV | Key-Value |
| LLM | Large Language Model |
| MoE | Mixture of Experts |
| NCCL | NVIDIA Collective Communications Library |
| NPU | Neural Processing Unit |
| PCIe | Peripheral Component Interconnect Express |
| PFC | Priority Flow Control |
| Q4 | Quantification 4-bit |
| RAG | Retrieval-Augmented Generation |
| RAM | Random Access Memory |
| RDMA | Remote Direct Memory Access |
| RoCE | RDMA over Converged Ethernet |
| TFLOPS | Tera Floating Point Operations Per Second |
| TTFT | Time To First Token |
| VRAM | Video RAM |
Fondations LLM
| Terme | Définition rapide |
|---|
| Tokenisation | Découpage du texte en unités numériques traitées par le modèle. |
| Embedding | Vecteur de coordonnées qui encode le sens d’un token. |
| Attention | Mécanisme qui pondère l’importance de chaque token dans le contexte. |
| Terme | Définition rapide |
|---|
| Memory Wall | Limite de performance due aux transferts mémoire plutôt qu’au calcul. |
| Bande passante mémoire | Débit de transfert de données mémoire, souvent exprimé en Go/s. |
| Prefill | Phase d’ingestion du prompt, plus parallèle. |
| Decoding | Phase auto-régressive token par token, souvent memory-bound. |
| KV Cache | Cache des clés/valeurs d’attention pour accélérer la génération. |
| Tokens/s | Débit de génération mesuré en tokens par seconde. |
Stack logicielle
| Terme | Définition rapide |
|---|
| [[00-lexique/ollama | Ollama]] |
| [[00-lexique/vllm | vLLM]] |
| [[00-lexique/sglang | SGLang]] |
| [[00-lexique/radixattention | RadixAttention]] |
| [[00-lexique/speculative-decoding | Speculative Decoding]] |
| [[00-lexique/pagedattention | PagedAttention]] |
| GGUF | Format portable pour l’inférence locale avec llama.cpp/Ollama. |
| TensorRT-LLM | SDK NVIDIA de compilation ultra-optimisée pour GPU datacenter. |
| Exo | Orchestrateur P2P pour cluster IA de bureau (Mac Mini + Thunderbolt). |
| Ray | Framework distribué pour déploiement multi-nœuds en production. |
| Pipeline Parallelism | Découpage d’un modèle en tranches de couches entre nœuds. |
| Tensor Parallelism | Découpage des matrices au sein d’un nœud multi-GPU NVLink. |
| Thunderbolt | Interconnexion bureau jusqu’à 80 Gb/s pour les clusters Exo. |
Infrastructure & architecture
| Terme | Définition rapide |
|---|
| Mémoire unifiée | Pool mémoire partagé CPU/GPU/NPU dans un SoC. |
| Offloading | Déplacement partiel de poids/activations entre mémoires selon la capacité. |
| Multi-GPU | Plusieurs GPU pour plus de capacité et/ou de débit. |
| NVLink | Interconnexion GPU à haut débit (gammes pro/datacenter). |
| NVSwitch | Fabric NVLink non bloquant entre tous les GPU d’un nœud HGX. |
| PCIe | Bus standard CPU↔GPU ; goulot inter-GPU sans NVLink. |
Réseau & Clustering
| Terme | Définition rapide |
|---|
| RDMA | Transfert mémoire-à-mémoire sans copie CPU pour clusters multi-nœuds. |
| RoCE | RDMA sur Ethernet ; nécessite PFC + ECN pour être lossless. |
| InfiniBand | Fabric réseau dédié HPC/IA, lossless natif, ~400–800 Gb/s. |
| GPUDirect RDMA | Transfert direct VRAM↔carte réseau sans copie CPU. |
| NCCL | Bibliothèque NVIDIA de communication collective GPU-à-GPU. |
| PFC | Priority Flow Control — pause par priorité pour réseau lossless RoCE. |
| ECN | Explicit Congestion Notification — gestion proactive de la congestion. |
Concepts fondateurs
| Terme | Définition rapide |
|---|
| On-Premise | Infrastructure IA hébergée sur les équipements propres de l’organisation. |
| LLM | Grand modèle de langage entraîné sur de vastes corpus textuels. |
| Inférence (LLM) | Utilisation d’un LLM entraîné pour générer du texte à la demande. |
IA applicative
| Terme | Définition rapide |
|---|
| Inférence (LLM) | Utilisation d’un LLM entraîné pour générer du texte à la demande. |
| RAG | Architecture qui enrichit le contexte d’un LLM avec une base documentaire. |
| Base de données vectorielle | Stockage et recherche de documents par similarité d’embeddings. |
| GraphRAG | RAG basé sur un graphe de connaissances pour les requêtes globales. |
| Memory Tree | Mémoire hiérarchique qui charge seulement les résumés et nœuds utiles. |
| Agent autonome | LLM équipé d’outils qui raisonne en boucle pour accomplir des tâches. |
| Agent custodien | Agent de maintenance qui propose des corrections et attend validation humaine. |
| Human-in-the-loop | Gouvernance où l’humain valide les actions critiques avant application. |
| Excessive Agency | Vulnérabilité OWASP LLM06 : agent trop permissif en outils, droits ou autonomie. |
| LiteLLM | Gateway OpenAI-compatible pour router vers modèles locaux ou cloud. |
| SmolAgents | Framework léger Hugging Face pour agents souverains sans télémétrie cloud. |
| LangGraph | Graphe d’états pour agents et RAG agentique multi-étapes. |
| Appel d'outils | Function / tool calling — LLM vers fonctions externes structurées. |
| Prompt injection | OWASP LLM01 — détournement via contenu non fiable (RAG, web). |
| Zero Data Retention | Clause ZDR : absence de persistance cloud des prompts. |
| Multi-tenant | Isolation multi-organisations ; risque RAG inter-tenant. |
| Fenêtre de contexte | Nombre maximal de tokens que le modèle peut traiter en entrée active. |
| Quantification | Réduction de précision numérique pour diminuer mémoire et coût de calcul. |
| MoE | Architecture avec experts spécialisés activés partiellement par token. |
Évaluation des modèles
| Terme | Définition rapide |
|---|
| Benchmark LLM | Jeu de tests standardisé pour comparer des modèles de langage. |
| LLM-as-a-judge | Usage d’un LLM comme juge pour noter ou comparer des réponses. |
| RAGAS | Framework d’évaluation des pipelines RAG : retrieval, fidélité et pertinence. |
Chapitres liés