Inférence (LLM)
📝 Définition courte
Phase où un LLM déjà entraîné produit une réponse à partir d’un prompt, token par token.
📖 Définition détaillée
On distingue l’entraînement (apprentissage des poids sur de vastes corpus) et l’inférence (exécution du modèle pour répondre). En IA on-premise, l’inférence locale est le cas dominant : Ollama, llama.cpp, vLLM, etc.
Une requête se décompose en deux phases : le Prefill (traitement du prompt) puis le Decoding (génération auto-régressive).
💡 Pourquoi c’est important en IA on-premise
Tout le dimensionnement matériel (RAM, VRAM, bande passante, tokens/s, TTFT) vise l’inférence, pas l’entraînement. C’est aussi le goulet que décrit le Memory Wall en decoding.
⚠️ Pièges fréquents
- Confondre les TFLOPS annoncés et le débit réel en génération.
- Oublier que l’inférence et l’entraînement n’ont pas les mêmes contraintes matérielles.
📚 Pour comprendre en profondeur
Vous voulez voir l’inférence en action, pas à pas ?
- 🧠 Le Voyage d'un Prompt (le cycle complet : tokenisation → prefill → decoding)
- 🏎️ La Bande Passante Mémoire (pourquoi la mémoire plafonne la vitesse de génération)
- ⚙️ Moteurs d'Inférence (les logiciels qui font tourner l’inférence : Ollama, vLLM, TensorRT-LLM)