Index du lexique
Liste générée automatiquement au build. Pour une lecture guidée, voir Glossaire IA.
| Terme | Définition |
|---|---|
| ⚡ SGLang | Framework open-source d’inférence et de serving LLM, alternative à vLLM pour les workloads agentiques et les sorties structurées. |
| 🌳 RadixAttention | Technique de gestion du KV Cache par arbre de préfixes, introduite par SGLang pour réutiliser les contextes communs entre requêtes. |
| 🏢 Multi-tenant | Architecture SaaS IA où une même infrastructure sert plusieurs organisations isolées, avec risque de fuite inter-tenant en RAG. |
| 🔐 Zero Data Retention (ZDR) | Clause contractuelle d’API cloud LLM garantissant l’absence de persistance, de réutilisation et de revue humaine des prompts et réponses. |
| Agent autonome (LLM) | Système où un LLM pilote lui-même des outils et des décisions pour accomplir une tâche multi-étapes. |
| Agent custodien | Agent autonome chargé de maintenir un vault, dépôt ou corpus documentaire en proposant des corrections validées par l’humain. |
| Appel d’outils (Tool / Function Calling) | Capacité d’un LLM à émettre des requêtes structurées vers des fonctions externes (API, SQL, code) plutôt que du texte libre. |
| APU | Puce combinant CPU, GPU et NPU sur un même SoC, avec mémoire unifiée partagée. |
| Attention (mécanisme) | Mécanisme central du Transformer qui permet à chaque token de pondérer l’importance des autres tokens du contexte. |
| Bande passante mémoire | Débit auquel la mémoire alimente les unités de calcul. |
| Base de données vectorielle | Base de données spécialisée dans le stockage et la recherche de vecteurs d’embeddings pour le RAG. |
| Benchmark LLM | Jeu de tests standardisé pour comparer les capacités, limites et risques de modèles de langage. |
| Decoding | Phase de génération auto-régressive token par token. |
| ECN | Explicit Congestion Notification — mécanisme de signalement de congestion réseau utilisé avec RoCE pour éviter les pertes de paquets. |
| Embedding | Représentation numérique dense d’un token ou d’un document dans un espace vectoriel. |
| Excessive Agency | Vulnérabilité OWASP LLM06 (2025) — un agent IA dispose de trop de fonctionnalités, permissions ou autonomie, permettant des actions réelles non souhaitées. |
| Exo | Orchestrateur P2P open-source pour fusionner la mémoire de plusieurs machines en un cluster IA local. |
| Fenêtre de contexte | Nombre maximal de tokens qu’un LLM peut traiter en entrée active — détermine le coût mémoire dynamique de l’inférence. |
| GGUF | Format de fichier portable pour l’inférence locale avec llama.cpp, optimisé pour les quantifications K-quant. |
| GPUDirect RDMA | Mécanisme permettant aux GPU d’échanger des données directement avec des périphériques réseau sans copie CPU. |
| GraphRAG | Évolution du RAG basée sur un graphe de connaissances plutôt qu’une base vectorielle. |
| HBM | Mémoire empilée à très haute bande passante, utilisée sur les accélérateurs IA professionnels. |
| Human-in-the-loop | Mode de gouvernance où une action automatisée importante attend une validation humaine avant d’être appliquée. |
| Inférence (LLM) | Utilisation d’un modèle entraîné pour générer du texte à la demande. |
| InfiniBand | Fabric réseau dédié hautes performances pour les clusters GPU, standard HPC et datacenter IA. |
| KV Cache | Cache des clés/valeurs d’attention utilisé pendant la génération. |
| LangGraph | Framework de graphe d’états pour orchestrer des agents LLM multi-étapes avec boucles, mémoire et contrôle de flux. |
| LiteLLM | Gateway OpenAI-compatible qui route les appels LLM vers des modèles locaux ou cloud depuis une interface unique. |
| LLM | Large Language Model. |
| LLM-as-a-judge | Technique d’évaluation où un modèle de langage sert de juge pour noter ou comparer des réponses. |
| Mémoire unifiée | Architecture mémoire partagée entre CPU/GPU/NPU. |
| Memory Tree | Architecture mémoire qui organise documents et résumés en arbre hiérarchique pour limiter le contexte injecté au LLM. |
| Memory Wall | Limite de performance causée par la mémoire plus que par le calcul. |
| MoE | Mixture of Experts — architecture où seuls certains sous-réseaux sont activés par token, permettant des modèles énormes avec un coût d’inférence maîtrisé. |
| Multi-GPU | Utilisation conjointe de plusieurs GPU. |
| NCCL | Bibliothèque NVIDIA de communication collective optimisée pour les transferts GPU-à-GPU à grande échelle. |
| NPU | Neural Processing Unit — accélérateur spécialisé IA intégré aux SoC modernes, utile pour certaines tâches mais limité pour les grands LLM. |
| NVLink | Interconnexion haut débit entre GPU NVIDIA. |
| NVSwitch | Commutateur NVIDIA qui connecte plusieurs GPU en un fabric NVLink totalement non bloquant à l’intérieur d’un nœud. |
| Offloading | Technique qui place une partie du modèle en RAM ou sur SSD quand la VRAM est insuffisante, au prix d’un débit réduit. |
| Ollama | Runtime local simplifié pour télécharger et exécuter des LLM via llama.cpp, avec API OpenAI-compatible. |
| On-Premise (IA) | Infrastructure IA hébergée et opérée sur les équipements propres de l’organisation, sans délégation à un fournisseur cloud. |
| PagedAttention | Technique de gestion du KV Cache par blocs de mémoire virtuelle, popularisée par vLLM. |
| PCIe | Bus d’interconnexion haut débit entre composants. |
| PFC | Priority Flow Control — mécanisme Ethernet de pause par priorité pour garantir un réseau lossless nécessaire à RoCE. |
| Pipeline Parallelism | Stratégie de distribution d’un LLM en tranches de couches entre plusieurs machines. |
| Prefill | Phase d’inférence qui traite le prompt initial en parallèle avant la génération mot à mot. |
| Prompt injection | Attaque où du contenu non fiable dans le contexte du LLM détourne ses instructions système pour exfiltrer des données ou exécuter des actions non autorisées. |
| Quantification | Réduction de précision numérique des poids d’un LLM pour diminuer l’empreinte mémoire et accélérer l’inférence. |
| Quantification Q4 | Format de quantification 4-bit le plus utilisé en pratique pour l’inférence locale — en particulier Q4_K_M dans l’écosystème GGUF/Ollama. |
| RAG | Architecture qui combine recherche documentaire et génération LLM pour ancrer les réponses dans des sources internes. |
| RAGAS | Framework d’évaluation automatique pour pipelines RAG. |
| RAM | Mémoire vive système, second choix pour l’inférence LLM quand la VRAM est insuffisante. |
| Ray | Framework de calcul distribué pour l’orchestration multi-nœuds de LLM en production. |
| RDMA | Accès mémoire distant direct sans copie CPU classique. |
| RoCE | Implémentation d’RDMA sur Ethernet convergé. |
| SmolAgents | Framework léger de Hugging Face pour l’orchestration agentique locale, alternative souveraine à LangChain. |
| Speculative Decoding | Technique d’accélération d’inférence où un petit modèle rapide génère des tokens candidats que le grand modèle vérifie en un seul passage. Nécessite deux modèles chargés simultanément. |
| Tensor Parallelism | Stratégie de distribution d’un LLM par découpage des matrices mathématiques entre plusieurs GPU d’un même nœud. |
| TensorRT-LLM | SDK NVIDIA de compilation et d’inférence ultra-optimisée pour GPU datacenter. |
| TFLOPS | Mesure de débit de calcul en opérations flottantes. |
| Thunderbolt | Interface câblée haut débit pour postes de travail et clusters de bureau IA. |
| Tokenisation | Découpage d’un texte en unités numériques (tokens) avant traitement par un LLM. |
| Tokens par seconde | Mesure du débit de génération d’un modèle. |
| TTFT | Time To First Token. |
| vLLM | Moteur open-source d’inférence LLM haut débit pour GPU NVIDIA/AMD, standard de production multi-utilisateurs. |
| VRAM | Mémoire vidéo dédiée au GPU. |