Aller au contenu

Index du lexique

Liste générée automatiquement au build. Pour une lecture guidée, voir Glossaire IA.

TermeDéfinition
⚡ SGLangFramework open-source d’inférence et de serving LLM, alternative à vLLM pour les workloads agentiques et les sorties structurées.
🌳 RadixAttentionTechnique de gestion du KV Cache par arbre de préfixes, introduite par SGLang pour réutiliser les contextes communs entre requêtes.
🏢 Multi-tenantArchitecture SaaS IA où une même infrastructure sert plusieurs organisations isolées, avec risque de fuite inter-tenant en RAG.
🔐 Zero Data Retention (ZDR)Clause contractuelle d’API cloud LLM garantissant l’absence de persistance, de réutilisation et de revue humaine des prompts et réponses.
Agent autonome (LLM)Système où un LLM pilote lui-même des outils et des décisions pour accomplir une tâche multi-étapes.
Agent custodienAgent autonome chargé de maintenir un vault, dépôt ou corpus documentaire en proposant des corrections validées par l’humain.
Appel d’outils (Tool / Function Calling)Capacité d’un LLM à émettre des requêtes structurées vers des fonctions externes (API, SQL, code) plutôt que du texte libre.
APUPuce combinant CPU, GPU et NPU sur un même SoC, avec mémoire unifiée partagée.
Attention (mécanisme)Mécanisme central du Transformer qui permet à chaque token de pondérer l’importance des autres tokens du contexte.
Bande passante mémoireDébit auquel la mémoire alimente les unités de calcul.
Base de données vectorielleBase de données spécialisée dans le stockage et la recherche de vecteurs d’embeddings pour le RAG.
Benchmark LLMJeu de tests standardisé pour comparer les capacités, limites et risques de modèles de langage.
DecodingPhase de génération auto-régressive token par token.
ECNExplicit Congestion Notification — mécanisme de signalement de congestion réseau utilisé avec RoCE pour éviter les pertes de paquets.
EmbeddingReprésentation numérique dense d’un token ou d’un document dans un espace vectoriel.
Excessive AgencyVulnérabilité OWASP LLM06 (2025) — un agent IA dispose de trop de fonctionnalités, permissions ou autonomie, permettant des actions réelles non souhaitées.
ExoOrchestrateur P2P open-source pour fusionner la mémoire de plusieurs machines en un cluster IA local.
Fenêtre de contexteNombre maximal de tokens qu’un LLM peut traiter en entrée active — détermine le coût mémoire dynamique de l’inférence.
GGUFFormat de fichier portable pour l’inférence locale avec llama.cpp, optimisé pour les quantifications K-quant.
GPUDirect RDMAMécanisme permettant aux GPU d’échanger des données directement avec des périphériques réseau sans copie CPU.
GraphRAGÉvolution du RAG basée sur un graphe de connaissances plutôt qu’une base vectorielle.
HBMMémoire empilée à très haute bande passante, utilisée sur les accélérateurs IA professionnels.
Human-in-the-loopMode de gouvernance où une action automatisée importante attend une validation humaine avant d’être appliquée.
Inférence (LLM)Utilisation d’un modèle entraîné pour générer du texte à la demande.
InfiniBandFabric réseau dédié hautes performances pour les clusters GPU, standard HPC et datacenter IA.
KV CacheCache des clés/valeurs d’attention utilisé pendant la génération.
LangGraphFramework de graphe d’états pour orchestrer des agents LLM multi-étapes avec boucles, mémoire et contrôle de flux.
LiteLLMGateway OpenAI-compatible qui route les appels LLM vers des modèles locaux ou cloud depuis une interface unique.
LLMLarge Language Model.
LLM-as-a-judgeTechnique d’évaluation où un modèle de langage sert de juge pour noter ou comparer des réponses.
Mémoire unifiéeArchitecture mémoire partagée entre CPU/GPU/NPU.
Memory TreeArchitecture mémoire qui organise documents et résumés en arbre hiérarchique pour limiter le contexte injecté au LLM.
Memory WallLimite de performance causée par la mémoire plus que par le calcul.
MoEMixture of Experts — architecture où seuls certains sous-réseaux sont activés par token, permettant des modèles énormes avec un coût d’inférence maîtrisé.
Multi-GPUUtilisation conjointe de plusieurs GPU.
NCCLBibliothèque NVIDIA de communication collective optimisée pour les transferts GPU-à-GPU à grande échelle.
NPUNeural Processing Unit — accélérateur spécialisé IA intégré aux SoC modernes, utile pour certaines tâches mais limité pour les grands LLM.
NVLinkInterconnexion haut débit entre GPU NVIDIA.
NVSwitchCommutateur NVIDIA qui connecte plusieurs GPU en un fabric NVLink totalement non bloquant à l’intérieur d’un nœud.
OffloadingTechnique qui place une partie du modèle en RAM ou sur SSD quand la VRAM est insuffisante, au prix d’un débit réduit.
OllamaRuntime local simplifié pour télécharger et exécuter des LLM via llama.cpp, avec API OpenAI-compatible.
On-Premise (IA)Infrastructure IA hébergée et opérée sur les équipements propres de l’organisation, sans délégation à un fournisseur cloud.
PagedAttentionTechnique de gestion du KV Cache par blocs de mémoire virtuelle, popularisée par vLLM.
PCIeBus d’interconnexion haut débit entre composants.
PFCPriority Flow Control — mécanisme Ethernet de pause par priorité pour garantir un réseau lossless nécessaire à RoCE.
Pipeline ParallelismStratégie de distribution d’un LLM en tranches de couches entre plusieurs machines.
PrefillPhase d’inférence qui traite le prompt initial en parallèle avant la génération mot à mot.
Prompt injectionAttaque où du contenu non fiable dans le contexte du LLM détourne ses instructions système pour exfiltrer des données ou exécuter des actions non autorisées.
QuantificationRéduction de précision numérique des poids d’un LLM pour diminuer l’empreinte mémoire et accélérer l’inférence.
Quantification Q4Format de quantification 4-bit le plus utilisé en pratique pour l’inférence locale — en particulier Q4_K_M dans l’écosystème GGUF/Ollama.
RAGArchitecture qui combine recherche documentaire et génération LLM pour ancrer les réponses dans des sources internes.
RAGASFramework d’évaluation automatique pour pipelines RAG.
RAMMémoire vive système, second choix pour l’inférence LLM quand la VRAM est insuffisante.
RayFramework de calcul distribué pour l’orchestration multi-nœuds de LLM en production.
RDMAAccès mémoire distant direct sans copie CPU classique.
RoCEImplémentation d’RDMA sur Ethernet convergé.
SmolAgentsFramework léger de Hugging Face pour l’orchestration agentique locale, alternative souveraine à LangChain.
Speculative DecodingTechnique d’accélération d’inférence où un petit modèle rapide génère des tokens candidats que le grand modèle vérifie en un seul passage. Nécessite deux modèles chargés simultanément.
Tensor ParallelismStratégie de distribution d’un LLM par découpage des matrices mathématiques entre plusieurs GPU d’un même nœud.
TensorRT-LLMSDK NVIDIA de compilation et d’inférence ultra-optimisée pour GPU datacenter.
TFLOPSMesure de débit de calcul en opérations flottantes.
ThunderboltInterface câblée haut débit pour postes de travail et clusters de bureau IA.
TokenisationDécoupage d’un texte en unités numériques (tokens) avant traitement par un LLM.
Tokens par secondeMesure du débit de génération d’un modèle.
TTFTTime To First Token.
vLLMMoteur open-source d’inférence LLM haut débit pour GPU NVIDIA/AMD, standard de production multi-utilisateurs.
VRAMMémoire vidéo dédiée au GPU.