đșïž Choisir son modĂšle local
Trois questions avant de choisir
Avant de regarder un leaderboard, rĂ©pondez Ă ces trois questions dans lâordre :
1. Quelle est votre tĂąche principale ?
| Tùche | Profil modÚle recommandé |
|---|---|
| Chat / assistant général | ModÚle instruction-tuned généraliste |
| RAG documentaire (en français) | ModÚle fort en instruction following, bon contexte long |
| Agent custodien / code editing | ModÚle coder spécialisé, 14B minimum |
| RĂ©sumĂ©, extraction, classification | ModĂšle compact rapide, 7â8B suffisent souvent |
| Raisonnement / calcul complexe | ModĂšle de type âthinkingâ (chain-of-thought intĂ©grĂ©) |
2. Combien de VRAM avez-vous ?
Voir Quantification pour calculer lâempreinte exacte. En Q4_K_M, rĂšgle approximative1 :
| VRAM disponible | Taille de modĂšle accessible |
|---|---|
| 8â12 Go | 7â8B |
| 16â24 Go | 14B â 24B avec Q4 |
| 48 Go | 32â34B confortablement |
| 80 Go (H100) | 70B en BF16 ou 140B en Q4 |
| 128â160 Go (APU) | 70B Q8 ou 120B Q4 |
3. Combien dâutilisateurs simultanĂ©s ?
Plus il y a dâutilisateurs, plus le modĂšle doit ĂȘtre petit pour laisser de la VRAM au KV Cache concurrent. Un modĂšle 70B qui rĂ©pond parfaitement Ă un seul utilisateur peut sâeffondrer Ă cinq.
Le paysage open weights en 2026
Le marchĂ© sâest stabilisĂ© autour de quelques familles dominantes. Voici comment les lire.
Llama 3.x (Meta)
La référence généraliste des versions précédentes. Les modÚles Llama 3.1/3.3 sont disponibles en 8B, 70B et 405B. Bien documentés, supportés par tous les moteurs (Ollama, vLLM, TensorRT-LLM), avec une licence commerciale permissive.
- Llama 3.3 70B : le meilleur rapport qualité/taille pour la plupart des usages PME. Fort en instruction following, raisonnement et multilingual (dont le français).
- Llama 3.1 8B : bon pour les postes contraints ou les tĂąches simples. Limite visible sur des tĂąches de raisonnement complexes.
- Llama 3.1 405B : nécessite un cluster multi-GPU (scénario D). Performances proches des modÚles frontiÚre sur les tùches générales.
Llama 4 (Meta) â scĂ©nario D uniquement
Nativement multimodaux (texte + image), architecture MoE.
- Llama 4 Scout (109B total / 17B actifs, 16 experts) : contexte 10M tokens. Tient sur un seul H100 avec quantification int4. Pertinent uniquement pour le scénario D (datacenter).
- Llama 4 Maverick (400B total / 17B actifs, 128 experts) : contexte 1M tokens. Requiert un host DGX complet en FP8 ou BF16. Performances comparables aux modĂšles frontiĂšre sur les benchmarks STEM.
Qwen 2.5 / Qwen3 (Alibaba)
La famille la plus polyvalente du paysage open weights en 2026, avec une excellente couverture multilingue (y compris le français) et des variantes spécialisées.
- Qwen 2.5 72B : concurrent direct de Llama 3.3 70B, souvent légÚrement supérieur sur les tùches de code et de raisonnement.
- Qwen 2.5 Coder 32B : le meilleur candidat pour les agents custodiens â spĂ©cialisĂ© code editing, search-and-replace, gĂ©nĂ©ration de patches. 32B tient sur une station 48 Go VRAM.
- Qwen3-A3B (MoE) : 3B paramÚtres actifs, ~18 Go en Q4. Excellent débit, qualité surprenante pour sa taille active, idéal sur les APU contraints.
DeepSeek (DeepSeek AI)
- DeepSeek-R1 : modÚle de raisonnement avec chain-of-thought intégré. Excellentes performances sur les tùches mathématiques et logiques. Disponible en distillations 7B à 70B et en version complÚte 671B (MoE).
- DeepSeek V3 (MoE, 671B) : paramÚtres totaux trÚs élevés mais ~37B actifs par token. Qualité proche de GPT-4o sur de nombreux benchmarks. Nécessite un cluster (scénario C ou D).
Mistral / Mixtral (Mistral AI)
- Mistral 7B : modÚle compact, performant, licence Apache 2.0. Bon point de départ pour les tests.
- Mixtral 8x7B (MoE) : 47B paramĂštres totaux, ~13B actifs. 26 Go en Q4 â tient sur une station 32 Go. Bon dĂ©bit sur les tĂąches de synthĂšse et de RAG.
- Mistral Large 2 (123B) : performances comparables à Llama 3.1 405B sur certains benchmarks, mais moins utilisé en on-premise en raison de la taille.
Phi-4 / Phi-3 (Microsoft)
ModĂšles compacts (3.8Bâ14B) avec une qualitĂ© de raisonnement Ă©levĂ©e pour leur taille. IntĂ©ressants pour les usages sur machine de bureau avec peu de VRAM.
- Phi-4 14B : performances proches de certains 70B sur les tĂąches de raisonnement et de code, pour 8 Go de VRAM en Q4.
Correspondance modĂšle â scĂ©nario on-premise
| ScĂ©nario | MatĂ©riel type | ModĂšle recommandĂ© | Cas dâusage |
|---|---|---|---|
| [[04-blueprints/scenario-a-dev-lab | A â Labo Dev]] | PC 16 Go VRAM + offloading | Llama 3.1 8B / Phi-4 14B |
| B â Appliance PME | APU 128 Go mĂ©moire unifiĂ©e | Qwen 2.5 72B Q4 ou Llama 3.3 70B Q4 | Assistant Ă©quipe, RAG documentaire |
| C â Cluster Bureau | 2â4 machines Thunderbolt | DeepSeek V3 (MoE) ou Llama 405B | PME avancĂ©e, modĂšle trĂšs capable |
| D â Datacenter | Multi-H100 / MI300X | Llama 3.1 405B BF16, DeepSeek V3, Llama 4 Scout/Maverick | Production 50+ utilisateurs, SLA, multimodal |
Spécialisations : quand choisir un modÚle coder ?
Les modĂšles gĂ©nĂ©ralistes (Llama, Qwen gĂ©nĂ©raliste) peuvent Ă©crire du code, mais ils ne sont pas faits pour modifier un dĂ©pĂŽt existant de façon fiable. Un agent custodien qui doit faire des search-and-replace prĂ©cis dans du Markdown ou du code a besoin dâun modĂšle coder.
RĂšgle pratique :
| Usage | ModÚle minimal | ModÚle recommandé |
|---|---|---|
| Complétion de code dans un IDE | Qwen 2.5 Coder 7B | Qwen 2.5 Coder 14B |
| Agent custodien (corrections contrÎlées) | Qwen 2.5 Coder 14B | Qwen 2.5 Coder 32B |
| Agent autonome (maintenance réguliÚre) | Qwen 2.5 Coder 32B | DeepSeek Coder V2 (16B actifs) |
ModĂšles de raisonnement : quand en avez-vous besoin ?
Les modĂšles âthinkingâ (DeepSeek-R1, Qwen3 en mode thinking, Llama avec chain-of-thought prompting) gĂ©nĂšrent un raisonnement interne avant la rĂ©ponse. Ils sont utiles pour :
- les problÚmes mathématiques ou logiques ;
- les analyses multi-étapes (due diligence, audit) ;
- les tĂąches oĂč une erreur de raisonnement est coĂ»teuse.
En contrepartie :
- le TTFT est plus long (le modĂšle ârĂ©flĂ©chitâ avant de rĂ©pondre) ;
- les tokens de raisonnement consomment du contexte et de la VRAM ;
- ils sont surdimensionnés pour les tùches simples (extraction, classification, chat).
Comment lire un leaderboard sans se tromper
Les classements publics (Chatbot Arena, Open LLM Leaderboard, HELM) sont utiles pour une premiĂšre orientation, mais ne remplacent pas vos tests.
Ce que les leaderboards disent quand mĂȘme dâutile :
- Chatbot Arena (LMSYS)4 : comparaison par prĂ©fĂ©rence humaine, multi-tour â bon indicateur de la qualitĂ© conversationnelle gĂ©nĂ©rale.
- Open LLM Leaderboard (HuggingFace)5 : suivi des modĂšles open weights, versions et quantifications disponibles.
- SWE-bench6 : le seul leaderboard vraiment reprĂ©sentatif pour les agents de code â mesure sur de vraies issues GitHub.
Checklist de sélection
Avant de télécharger un modÚle :
- La licence autorise-t-elle lâusage commercial ? (Apache 2.0, MIT, Llama Community License)
- Le modÚle tient-il dans votre VRAM avec la quantification visée + marge KV Cache ?
- Le moteur dâinfĂ©rence cible le supporte-t-il ? (GGUF pour Ollama, safetensors pour vLLM)
- Des Ă©valuations communautaires existent-elles sur votre langue ? (le français est moins couvert que lâanglais)
- Avez-vous un golden dataset pour le tester sur vos données réelles ?
- Pour un agent : avez-vous un 14B+ coder, pas un généraliste 7B ?
Voir aussi
- đ§Ș Ăvaluer un modĂšle local â protocole de test, KPI, golden dataset
- đïž La Quantification â calculer lâempreinte VRAM
- âïž Moteurs d'infĂ©rence â choisir le bon moteur selon lâusage
- MoE â comprendre les architectures Mixture of Experts
- Benchmark LLM
đ Sources et RĂ©fĂ©rences
Footnotes
-
SitePoint, Quantization Explained: Run 70B Models on Consumer GPUs (rĂšgle empreinte Q4_K_M â 0,5 byte/paramĂštre + marge KV Cache), 2026. https://www.sitepoint.com/quantization-explained-consumer-gpu/ â©
-
Meta AI, The Llama 4 herd: natively multimodal AI innovation (Scout 109B/17B actifs, Maverick 400B/17B actifs, architecture MoE), Avril 2025. https://ai.meta.com/blog/llama-4-multimodal-intelligence/ â©
-
LLMHardware.io, DeepSeek V3 Hardware Requirements (MoE 671B â tous les experts rĂ©sidents en VRAM, ~390 Go en Q4_K_M), 2026. https://llmhardware.io/guides/deepseek-v3-hardware-requirements â©
-
LMSYS, Chatbot Arena (classement par prĂ©fĂ©rence humaine multi-tour). https://chat.lmsys.org/ â©
-
Hugging Face, Open LLM Leaderboard (benchmarks modĂšles open weights). https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard â©
-
SWE-bench, Software Engineering Benchmark (Ă©valuation agents de code sur issues GitHub rĂ©elles). https://www.swebench.com/ â©