Aller au contenu

Inférence (LLM)

📝 Définition courte

Phase où un LLM déjà entraîné produit une réponse à partir d’un prompt, token par token.

📖 Définition détaillée

On distingue l’entraînement (apprentissage des poids sur de vastes corpus) et l’inférence (exécution du modèle pour répondre). En IA on-premise, l’inférence locale est le cas dominant : Ollama, llama.cpp, vLLM, etc.

Une requête se décompose en deux phases : le Prefill (traitement du prompt) puis le Decoding (génération auto-régressive).

💡 Pourquoi c’est important en IA on-premise

Tout le dimensionnement matériel (RAM, VRAM, bande passante, tokens/s, TTFT) vise l’inférence, pas l’entraînement. C’est aussi le goulet que décrit le Memory Wall en decoding.

⚠️ Pièges fréquents

  • Confondre les TFLOPS annoncés et le débit réel en génération.
  • Oublier que l’inférence et l’entraînement n’ont pas les mêmes contraintes matérielles.

📚 Pour comprendre en profondeur

Vous voulez voir l’inférence en action, pas à pas ?

  1. 🧠 Le Voyage d'un Prompt (le cycle complet : tokenisation → prefill → decoding)
  2. 🏎️ La Bande Passante Mémoire (pourquoi la mémoire plafonne la vitesse de génération)
  3. ⚙️ Moteurs d'Inférence (les logiciels qui font tourner l’inférence : Ollama, vLLM, TensorRT-LLM)

🔗 Voir aussi