Aller au contenu

📖 Glossaire IA

Ce glossaire centralise les notions clés de l’IA on-premise.
Utilisez-le comme point d’entrée rapide, puis ouvrez les fiches détaillées.

Index complet : toutes les fiches du lexique (liste alphabétique, mise à jour au build).


🚶 Débutant — je découvre

Je ne sais pas par où commencer :

LLMInférence (LLM)🧠 Le Voyage d'un PromptPrefill / DecodingMemory Wall🏎️ La Bande Passante Mémoire


Parcours recommandé


Index des acronymes

AcronymeSignification
APUAccelerated Processing Unit
ECNExplicit Congestion Notification
HBMHigh Bandwidth Memory
IBInfiniBand
KVKey-Value
LLMLarge Language Model
MoEMixture of Experts
NCCLNVIDIA Collective Communications Library
NPUNeural Processing Unit
PCIePeripheral Component Interconnect Express
PFCPriority Flow Control
Q4Quantification 4-bit
RAGRetrieval-Augmented Generation
RAMRandom Access Memory
RDMARemote Direct Memory Access
RoCERDMA over Converged Ethernet
TFLOPSTera Floating Point Operations Per Second
TTFTTime To First Token
VRAMVideo RAM

Fondations LLM

TermeDéfinition rapide
TokenisationDécoupage du texte en unités numériques traitées par le modèle.
EmbeddingVecteur de coordonnées qui encode le sens d’un token.
AttentionMécanisme qui pondère l’importance de chaque token dans le contexte.

Mémoire & performance

TermeDéfinition rapide
Memory WallLimite de performance due aux transferts mémoire plutôt qu’au calcul.
Bande passante mémoireDébit de transfert de données mémoire, souvent exprimé en Go/s.
PrefillPhase d’ingestion du prompt, plus parallèle.
DecodingPhase auto-régressive token par token, souvent memory-bound.
KV CacheCache des clés/valeurs d’attention pour accélérer la génération.
Tokens/sDébit de génération mesuré en tokens par seconde.

Stack logicielle

TermeDéfinition rapide
[[00-lexique/ollamaOllama]]
[[00-lexique/vllmvLLM]]
[[00-lexique/sglangSGLang]]
[[00-lexique/radixattentionRadixAttention]]
[[00-lexique/speculative-decodingSpeculative Decoding]]
[[00-lexique/pagedattentionPagedAttention]]
GGUFFormat portable pour l’inférence locale avec llama.cpp/Ollama.
TensorRT-LLMSDK NVIDIA de compilation ultra-optimisée pour GPU datacenter.
ExoOrchestrateur P2P pour cluster IA de bureau (Mac Mini + Thunderbolt).
RayFramework distribué pour déploiement multi-nœuds en production.
Pipeline ParallelismDécoupage d’un modèle en tranches de couches entre nœuds.
Tensor ParallelismDécoupage des matrices au sein d’un nœud multi-GPU NVLink.
ThunderboltInterconnexion bureau jusqu’à 80 Gb/s pour les clusters Exo.

Infrastructure & architecture

TermeDéfinition rapide
Mémoire unifiéePool mémoire partagé CPU/GPU/NPU dans un SoC.
OffloadingDéplacement partiel de poids/activations entre mémoires selon la capacité.
Multi-GPUPlusieurs GPU pour plus de capacité et/ou de débit.
NVLinkInterconnexion GPU à haut débit (gammes pro/datacenter).
NVSwitchFabric NVLink non bloquant entre tous les GPU d’un nœud HGX.
PCIeBus standard CPU↔GPU ; goulot inter-GPU sans NVLink.

Réseau & Clustering

TermeDéfinition rapide
RDMATransfert mémoire-à-mémoire sans copie CPU pour clusters multi-nœuds.
RoCERDMA sur Ethernet ; nécessite PFC + ECN pour être lossless.
InfiniBandFabric réseau dédié HPC/IA, lossless natif, ~400–800 Gb/s.
GPUDirect RDMATransfert direct VRAM↔carte réseau sans copie CPU.
NCCLBibliothèque NVIDIA de communication collective GPU-à-GPU.
PFCPriority Flow Control — pause par priorité pour réseau lossless RoCE.
ECNExplicit Congestion Notification — gestion proactive de la congestion.

Concepts fondateurs

TermeDéfinition rapide
On-PremiseInfrastructure IA hébergée sur les équipements propres de l’organisation.
LLMGrand modèle de langage entraîné sur de vastes corpus textuels.
Inférence (LLM)Utilisation d’un LLM entraîné pour générer du texte à la demande.

IA applicative

TermeDéfinition rapide
Inférence (LLM)Utilisation d’un LLM entraîné pour générer du texte à la demande.
RAGArchitecture qui enrichit le contexte d’un LLM avec une base documentaire.
Base de données vectorielleStockage et recherche de documents par similarité d’embeddings.
GraphRAGRAG basé sur un graphe de connaissances pour les requêtes globales.
Memory TreeMémoire hiérarchique qui charge seulement les résumés et nœuds utiles.
Agent autonomeLLM équipé d’outils qui raisonne en boucle pour accomplir des tâches.
Agent custodienAgent de maintenance qui propose des corrections et attend validation humaine.
Human-in-the-loopGouvernance où l’humain valide les actions critiques avant application.
Excessive AgencyVulnérabilité OWASP LLM06 : agent trop permissif en outils, droits ou autonomie.
LiteLLMGateway OpenAI-compatible pour router vers modèles locaux ou cloud.
SmolAgentsFramework léger Hugging Face pour agents souverains sans télémétrie cloud.
LangGraphGraphe d’états pour agents et RAG agentique multi-étapes.
Appel d'outilsFunction / tool calling — LLM vers fonctions externes structurées.
Prompt injectionOWASP LLM01 — détournement via contenu non fiable (RAG, web).
Zero Data RetentionClause ZDR : absence de persistance cloud des prompts.
Multi-tenantIsolation multi-organisations ; risque RAG inter-tenant.
Fenêtre de contexteNombre maximal de tokens que le modèle peut traiter en entrée active.
QuantificationRéduction de précision numérique pour diminuer mémoire et coût de calcul.
MoEArchitecture avec experts spécialisés activés partiellement par token.

Évaluation des modèles

TermeDéfinition rapide
Benchmark LLMJeu de tests standardisé pour comparer des modèles de langage.
LLM-as-a-judgeUsage d’un LLM comme juge pour noter ou comparer des réponses.
RAGASFramework d’évaluation des pipelines RAG : retrieval, fidélité et pertinence.

Chapitres liés