đ§ Le Voyage d'un Prompt : Comment fonctionne un LLM ?
Quand vous tapez une question dans un modĂšle dâIA local, il y a une illusion de magie : la machine semble âcomprendreâ le texte et ârĂ©flĂ©chirâ Ă la rĂ©ponse.
En rĂ©alitĂ©, un processeur ne comprend pas le français. Il ne fait quâexĂ©cuter des milliards de multiplications Ă une vitesse fulgurante. Pour comprendre pourquoi lâIA demande autant de matĂ©riel (et pourquoi votre PC peut ramer), il faut soulever le capot et regarder comment un texte est transformĂ© en calculs mathĂ©matiques.
Voici le voyage exact de votre prompt, étape par étape.
Ătape 1 : La Tokenisation (Le hachoir Ă texte)
Un ordinateur ne sait calculer que sur des nombres. La toute premiÚre étape consiste donc à découper votre phrase en morceaux appelés tokens, puis à assigner un numéro à chaque morceau.
Chaque modĂšle a son propre dictionnaire, appris pendant son entraĂźnement. En 2026, un modĂšle standard comme Llama 3 possĂšde un vocabulaire dâenviron 128 256 tokens possibles1. Chaque numĂ©ro est lâindex exact dâun de ces mots ou sous-mots.
Ătape 2 : LâEmbedding (La carte au trĂ©sor)
Avoir le numĂ©ro 4502 pour le mot âOĂčâ nâaide pas le modĂšle Ă comprendre son sens.
Lâordinateur va donc convertir chaque numĂ©ro en une longue liste de coordonnĂ©es mathĂ©matiques (un vecteur). Câest ce quâon appelle lâEmbedding.
Imaginez une carte en 3D oĂč les concepts similaires sont proches. Le mot âRoiâ sera proche de âReineâ et de âCouronneâ. Dans un grand modĂšle (LLM), cette âcarteâ ne fait pas 3 dimensions, mais souvent 4 096 ou 8 192 dimensions.
Ă la fin de cette Ă©tape, votre petite phrase de 4 mots sâest transformĂ©e en une gigantesque grille de milliers de nombres dĂ©cimaux. Le vrai calcul peut commencer.
Ătape 3 : Le âPrefillâ (Lâingestion du contexte)
Câest ici que le moteur dâinfĂ©rence (le logiciel qui fait tourner lâIA) lance ses calculs les plus lourds. Le modĂšle va faire passer votre grille de nombres Ă travers des dizaines de âcouchesâ de neurones artificiels.
Cette phase sâappelle le Prefill. Le modĂšle lit tout votre prompt dâun seul coup, en parallĂšle.
Le cĆur de cette Ă©tape est le mĂ©canisme d'Attention : le modĂšle croise tous les mots entre eux pour comprendre le contexte. Il calcule mathĂ©matiquement que, dans votre phrase, le point dâinterrogation est fortement liĂ© au mot âOĂčâ.
- Ce quâil se passe dans la machine : Vos puces (CPU ou GPU) tournent Ă 100% de leur capacitĂ© de calcul (TFLOPS) parce quâelles peuvent exĂ©cuter toutes ces multiplications matricielles simultanĂ©ment.
Ătape 4 : Le KV Cache (La mĂ©moire Ă court terme)
Pendant le Prefill, le modĂšle a calculĂ© lâimportance et le contexte de chaque mot de votre historique. Sâil devait recalculer tout cela Ă chaque nouveau mot quâil va gĂ©nĂ©rer, il serait effroyablement lent.
Pour Ă©viter ça, il sauvegarde tous ces calculs intermĂ©diaires dans la VRAM de votre carte graphique. Câest le fameux KV Cache (Key-Value Cache). Plus votre prompt est long (ex: si vous lui donnez un PDF de 200 pages Ă lire), plus ce KV Cache devient Ă©norme et sature la mĂ©moire de votre machine.
Ătape 5 : Le âDecodingâ (La gĂ©nĂ©ration mot Ă mot)
Maintenant que le modĂšle a âdigĂ©rĂ©â votre question et stockĂ© le contexte dans le KV Cache, il va produire sa rĂ©ponse. Il le fait un seul token Ă la fois. Câest la phase de Decoding.
- Le modĂšle regarde votre prompt, regarde son KV Cache, et prĂ©dit mathĂ©matiquement que le mot le plus probable pour commencer la rĂ©ponse est âParisâ.
- Il Ă©crit âParisâ.
- Le cycle recommence : il prend votre prompt + le mot âParisâ, relit le KV Cache, et calcule que le mot suivant est âestâ.
- Il Ă©crit âestâ.
Cette boucle continue jusquâĂ ce que le modĂšle gĂ©nĂšre un token spĂ©cial qui signifie <FIN>.
- Ce quâil se passe dans la machine : Câest une phase trĂšs sĂ©quentielle. Le processeur doit constamment faire des allers-retours avec la mĂ©moire pour rĂ©cupĂ©rer les poids du modĂšle et le KV Cache, juste pour gĂ©nĂ©rer un malheureux token. Câest pour cela que la vitesse de gĂ©nĂ©ration dĂ©pend de la Bande Passante MĂ©moire et non plus de la puissance de calcul brute.
đŻ En rĂ©sumĂ© pour lâarchitecte
Quand un utilisateur se plaint que âlâIA est lenteâ, vous devez savoir de quelle phase il parle :
- Elle met trop de temps Ă dĂ©marrer ? Câest le Prefill. Le processeur manque de puissance de calcul brute (TFLOPS) pour digĂ©rer le prompt initial, ou le contexte envoyĂ© est trop long.
- Elle Ă©crit la rĂ©ponse trop lentement ? Câest le Decoding. La machine souffre du âMemory Wallâ : la mĂ©moire de la carte graphique ne peut pas envoyer les donnĂ©es assez vite vers la puce pour calculer le token suivant.
đ Sources et RĂ©fĂ©rences
Footnotes
-
Meta, Llama 3.1 Model Card (Architecture, vocabulaire 128 256 tokens, tokenizer Tiktoken), 2024. GitHub â llama-models â©