Aller au contenu

🧠 Le Voyage d'un Prompt : Comment fonctionne un LLM ?

Quand vous tapez une question dans un modĂšle d’IA local, il y a une illusion de magie : la machine semble “comprendre” le texte et “rĂ©flĂ©chir” Ă  la rĂ©ponse.

En rĂ©alitĂ©, un processeur ne comprend pas le français. Il ne fait qu’exĂ©cuter des milliards de multiplications Ă  une vitesse fulgurante. Pour comprendre pourquoi l’IA demande autant de matĂ©riel (et pourquoi votre PC peut ramer), il faut soulever le capot et regarder comment un texte est transformĂ© en calculs mathĂ©matiques.

Voici le voyage exact de votre prompt, étape par étape.


Étape 1 : La Tokenisation (Le hachoir à texte)

Un ordinateur ne sait calculer que sur des nombres. La toute premiÚre étape consiste donc à découper votre phrase en morceaux appelés tokens, puis à assigner un numéro à chaque morceau.

Chaque modĂšle a son propre dictionnaire, appris pendant son entraĂźnement. En 2026, un modĂšle standard comme Llama 3 possĂšde un vocabulaire d’environ 128 256 tokens possibles1. Chaque numĂ©ro est l’index exact d’un de ces mots ou sous-mots.

Étape 2 : L’Embedding (La carte au trĂ©sor)

Avoir le numĂ©ro 4502 pour le mot “OĂč” n’aide pas le modĂšle Ă  comprendre son sens. L’ordinateur va donc convertir chaque numĂ©ro en une longue liste de coordonnĂ©es mathĂ©matiques (un vecteur). C’est ce qu’on appelle l’Embedding.

Imaginez une carte en 3D oĂč les concepts similaires sont proches. Le mot “Roi” sera proche de “Reine” et de “Couronne”. Dans un grand modĂšle (LLM), cette “carte” ne fait pas 3 dimensions, mais souvent 4 096 ou 8 192 dimensions.

À la fin de cette Ă©tape, votre petite phrase de 4 mots s’est transformĂ©e en une gigantesque grille de milliers de nombres dĂ©cimaux. Le vrai calcul peut commencer.


Étape 3 : Le “Prefill” (L’ingestion du contexte)

C’est ici que le moteur d’infĂ©rence (le logiciel qui fait tourner l’IA) lance ses calculs les plus lourds. Le modĂšle va faire passer votre grille de nombres Ă  travers des dizaines de “couches” de neurones artificiels.

Cette phase s’appelle le Prefill. Le modùle lit tout votre prompt d’un seul coup, en parallùle.

Le cƓur de cette Ă©tape est le mĂ©canisme d'Attention : le modĂšle croise tous les mots entre eux pour comprendre le contexte. Il calcule mathĂ©matiquement que, dans votre phrase, le point d’interrogation est fortement liĂ© au mot “OĂč”.

  • Ce qu’il se passe dans la machine : Vos puces (CPU ou GPU) tournent Ă  100% de leur capacitĂ© de calcul (TFLOPS) parce qu’elles peuvent exĂ©cuter toutes ces multiplications matricielles simultanĂ©ment.

Étape 4 : Le KV Cache (La mĂ©moire Ă  court terme)

Pendant le Prefill, le modĂšle a calculĂ© l’importance et le contexte de chaque mot de votre historique. S’il devait recalculer tout cela Ă  chaque nouveau mot qu’il va gĂ©nĂ©rer, il serait effroyablement lent.

Pour Ă©viter ça, il sauvegarde tous ces calculs intermĂ©diaires dans la VRAM de votre carte graphique. C’est le fameux KV Cache (Key-Value Cache). Plus votre prompt est long (ex: si vous lui donnez un PDF de 200 pages Ă  lire), plus ce KV Cache devient Ă©norme et sature la mĂ©moire de votre machine.


Étape 5 : Le “Decoding” (La gĂ©nĂ©ration mot Ă  mot)

Maintenant que le modĂšle a “digĂ©rĂ©â€ votre question et stockĂ© le contexte dans le KV Cache, il va produire sa rĂ©ponse. Il le fait un seul token Ă  la fois. C’est la phase de Decoding.

  1. Le modĂšle regarde votre prompt, regarde son KV Cache, et prĂ©dit mathĂ©matiquement que le mot le plus probable pour commencer la rĂ©ponse est “Paris”.
  2. Il Ă©crit “Paris”.
  3. Le cycle recommence : il prend votre prompt + le mot “Paris”, relit le KV Cache, et calcule que le mot suivant est “est”.
  4. Il Ă©crit “est”.

Cette boucle continue jusqu’à ce que le modĂšle gĂ©nĂšre un token spĂ©cial qui signifie <FIN>.

  • Ce qu’il se passe dans la machine : C’est une phase trĂšs sĂ©quentielle. Le processeur doit constamment faire des allers-retours avec la mĂ©moire pour rĂ©cupĂ©rer les poids du modĂšle et le KV Cache, juste pour gĂ©nĂ©rer un malheureux token. C’est pour cela que la vitesse de gĂ©nĂ©ration dĂ©pend de la Bande Passante MĂ©moire et non plus de la puissance de calcul brute.

🎯 En rĂ©sumĂ© pour l’architecte

Quand un utilisateur se plaint que “l’IA est lente”, vous devez savoir de quelle phase il parle :

  • Elle met trop de temps Ă  dĂ©marrer ? C’est le Prefill. Le processeur manque de puissance de calcul brute (TFLOPS) pour digĂ©rer le prompt initial, ou le contexte envoyĂ© est trop long.
  • Elle Ă©crit la rĂ©ponse trop lentement ? C’est le Decoding. La machine souffre du “Memory Wall” : la mĂ©moire de la carte graphique ne peut pas envoyer les donnĂ©es assez vite vers la puce pour calculer le token suivant.

📚 Sources et RĂ©fĂ©rences

Footnotes

  1. Meta, Llama 3.1 Model Card (Architecture, vocabulaire 128 256 tokens, tokenizer Tiktoken), 2024. GitHub — llama-models ↩