Aller au contenu

đŸ—ș Choisir son modĂšle local


Trois questions avant de choisir

Avant de regarder un leaderboard, rĂ©pondez Ă  ces trois questions dans l’ordre :

1. Quelle est votre tĂąche principale ?

TùcheProfil modÚle recommandé
Chat / assistant généralModÚle instruction-tuned généraliste
RAG documentaire (en français)ModÚle fort en instruction following, bon contexte long
Agent custodien / code editingModÚle coder spécialisé, 14B minimum
RĂ©sumĂ©, extraction, classificationModĂšle compact rapide, 7–8B suffisent souvent
Raisonnement / calcul complexeModĂšle de type “thinking” (chain-of-thought intĂ©grĂ©)

2. Combien de VRAM avez-vous ?

Voir Quantification pour calculer l’empreinte exacte. En Q4_K_M, rùgle approximative1 :

VRAM disponibleTaille de modĂšle accessible
8–12 Go7–8B
16–24 Go14B — 24B avec Q4
48 Go32–34B confortablement
80 Go (H100)70B en BF16 ou 140B en Q4
128–160 Go (APU)70B Q8 ou 120B Q4

3. Combien d’utilisateurs simultanĂ©s ?

Plus il y a d’utilisateurs, plus le modĂšle doit ĂȘtre petit pour laisser de la VRAM au KV Cache concurrent. Un modĂšle 70B qui rĂ©pond parfaitement Ă  un seul utilisateur peut s’effondrer Ă  cinq.


Le paysage open weights en 2026

Le marchĂ© s’est stabilisĂ© autour de quelques familles dominantes. Voici comment les lire.

Llama 3.x (Meta)

La référence généraliste des versions précédentes. Les modÚles Llama 3.1/3.3 sont disponibles en 8B, 70B et 405B. Bien documentés, supportés par tous les moteurs (Ollama, vLLM, TensorRT-LLM), avec une licence commerciale permissive.

  • Llama 3.3 70B : le meilleur rapport qualitĂ©/taille pour la plupart des usages PME. Fort en instruction following, raisonnement et multilingual (dont le français).
  • Llama 3.1 8B : bon pour les postes contraints ou les tĂąches simples. Limite visible sur des tĂąches de raisonnement complexes.
  • Llama 3.1 405B : nĂ©cessite un cluster multi-GPU (scĂ©nario D). Performances proches des modĂšles frontiĂšre sur les tĂąches gĂ©nĂ©rales.

Llama 4 (Meta) — scĂ©nario D uniquement

Nativement multimodaux (texte + image), architecture MoE.

  • Llama 4 Scout (109B total / 17B actifs, 16 experts) : contexte 10M tokens. Tient sur un seul H100 avec quantification int4. Pertinent uniquement pour le scĂ©nario D (datacenter).
  • Llama 4 Maverick (400B total / 17B actifs, 128 experts) : contexte 1M tokens. Requiert un host DGX complet en FP8 ou BF16. Performances comparables aux modĂšles frontiĂšre sur les benchmarks STEM.

Qwen 2.5 / Qwen3 (Alibaba)

La famille la plus polyvalente du paysage open weights en 2026, avec une excellente couverture multilingue (y compris le français) et des variantes spécialisées.

  • Qwen 2.5 72B : concurrent direct de Llama 3.3 70B, souvent lĂ©gĂšrement supĂ©rieur sur les tĂąches de code et de raisonnement.
  • Qwen 2.5 Coder 32B : le meilleur candidat pour les agents custodiens — spĂ©cialisĂ© code editing, search-and-replace, gĂ©nĂ©ration de patches. 32B tient sur une station 48 Go VRAM.
  • Qwen3-A3B (MoE) : 3B paramĂštres actifs, ~18 Go en Q4. Excellent dĂ©bit, qualitĂ© surprenante pour sa taille active, idĂ©al sur les APU contraints.

DeepSeek (DeepSeek AI)

  • DeepSeek-R1 : modĂšle de raisonnement avec chain-of-thought intĂ©grĂ©. Excellentes performances sur les tĂąches mathĂ©matiques et logiques. Disponible en distillations 7B Ă  70B et en version complĂšte 671B (MoE).
  • DeepSeek V3 (MoE, 671B) : paramĂštres totaux trĂšs Ă©levĂ©s mais ~37B actifs par token. QualitĂ© proche de GPT-4o sur de nombreux benchmarks. NĂ©cessite un cluster (scĂ©nario C ou D).

Mistral / Mixtral (Mistral AI)

  • Mistral 7B : modĂšle compact, performant, licence Apache 2.0. Bon point de dĂ©part pour les tests.
  • Mixtral 8x7B (MoE) : 47B paramĂštres totaux, ~13B actifs. 26 Go en Q4 — tient sur une station 32 Go. Bon dĂ©bit sur les tĂąches de synthĂšse et de RAG.
  • Mistral Large 2 (123B) : performances comparables Ă  Llama 3.1 405B sur certains benchmarks, mais moins utilisĂ© en on-premise en raison de la taille.

Phi-4 / Phi-3 (Microsoft)

ModĂšles compacts (3.8B–14B) avec une qualitĂ© de raisonnement Ă©levĂ©e pour leur taille. IntĂ©ressants pour les usages sur machine de bureau avec peu de VRAM.

  • Phi-4 14B : performances proches de certains 70B sur les tĂąches de raisonnement et de code, pour 8 Go de VRAM en Q4.

Correspondance modĂšle → scĂ©nario on-premise

ScĂ©narioMatĂ©riel typeModĂšle recommandĂ©Cas d’usage
[[04-blueprints/scenario-a-dev-labA — Labo Dev]]PC 16 Go VRAM + offloadingLlama 3.1 8B / Phi-4 14B
B — Appliance PMEAPU 128 Go mĂ©moire unifiĂ©eQwen 2.5 72B Q4 ou Llama 3.3 70B Q4Assistant Ă©quipe, RAG documentaire
C — Cluster Bureau2–4 machines ThunderboltDeepSeek V3 (MoE) ou Llama 405BPME avancĂ©e, modĂšle trĂšs capable
D — DatacenterMulti-H100 / MI300XLlama 3.1 405B BF16, DeepSeek V3, Llama 4 Scout/MaverickProduction 50+ utilisateurs, SLA, multimodal

Spécialisations : quand choisir un modÚle coder ?

Les modĂšles gĂ©nĂ©ralistes (Llama, Qwen gĂ©nĂ©raliste) peuvent Ă©crire du code, mais ils ne sont pas faits pour modifier un dĂ©pĂŽt existant de façon fiable. Un agent custodien qui doit faire des search-and-replace prĂ©cis dans du Markdown ou du code a besoin d’un modĂšle coder.

RĂšgle pratique :

UsageModÚle minimalModÚle recommandé
Complétion de code dans un IDEQwen 2.5 Coder 7BQwen 2.5 Coder 14B
Agent custodien (corrections contrÎlées)Qwen 2.5 Coder 14BQwen 2.5 Coder 32B
Agent autonome (maintenance réguliÚre)Qwen 2.5 Coder 32BDeepSeek Coder V2 (16B actifs)

ModĂšles de raisonnement : quand en avez-vous besoin ?

Les modĂšles “thinking” (DeepSeek-R1, Qwen3 en mode thinking, Llama avec chain-of-thought prompting) gĂ©nĂšrent un raisonnement interne avant la rĂ©ponse. Ils sont utiles pour :

  • les problĂšmes mathĂ©matiques ou logiques ;
  • les analyses multi-Ă©tapes (due diligence, audit) ;
  • les tĂąches oĂč une erreur de raisonnement est coĂ»teuse.

En contrepartie :

  • le TTFT est plus long (le modĂšle “rĂ©flĂ©chit” avant de rĂ©pondre) ;
  • les tokens de raisonnement consomment du contexte et de la VRAM ;
  • ils sont surdimensionnĂ©s pour les tĂąches simples (extraction, classification, chat).

Comment lire un leaderboard sans se tromper

Les classements publics (Chatbot Arena, Open LLM Leaderboard, HELM) sont utiles pour une premiĂšre orientation, mais ne remplacent pas vos tests.

Ce que les leaderboards disent quand mĂȘme d’utile :

  • Chatbot Arena (LMSYS)4 : comparaison par prĂ©fĂ©rence humaine, multi-tour — bon indicateur de la qualitĂ© conversationnelle gĂ©nĂ©rale.
  • Open LLM Leaderboard (HuggingFace)5 : suivi des modĂšles open weights, versions et quantifications disponibles.
  • SWE-bench6 : le seul leaderboard vraiment reprĂ©sentatif pour les agents de code — mesure sur de vraies issues GitHub.

Checklist de sélection

Avant de télécharger un modÚle :

  • La licence autorise-t-elle l’usage commercial ? (Apache 2.0, MIT, Llama Community License)
  • Le modĂšle tient-il dans votre VRAM avec la quantification visĂ©e + marge KV Cache ?
  • Le moteur d’infĂ©rence cible le supporte-t-il ? (GGUF pour Ollama, safetensors pour vLLM)
  • Des Ă©valuations communautaires existent-elles sur votre langue ? (le français est moins couvert que l’anglais)
  • Avez-vous un golden dataset pour le tester sur vos donnĂ©es rĂ©elles ?
  • Pour un agent : avez-vous un 14B+ coder, pas un gĂ©nĂ©raliste 7B ?

Voir aussi


📚 Sources et RĂ©fĂ©rences

Footnotes

  1. SitePoint, Quantization Explained: Run 70B Models on Consumer GPUs (rĂšgle empreinte Q4_K_M ≈ 0,5 byte/paramĂštre + marge KV Cache), 2026. https://www.sitepoint.com/quantization-explained-consumer-gpu/ ↩

  2. Meta AI, The Llama 4 herd: natively multimodal AI innovation (Scout 109B/17B actifs, Maverick 400B/17B actifs, architecture MoE), Avril 2025. https://ai.meta.com/blog/llama-4-multimodal-intelligence/ ↩

  3. LLMHardware.io, DeepSeek V3 Hardware Requirements (MoE 671B — tous les experts rĂ©sidents en VRAM, ~390 Go en Q4_K_M), 2026. https://llmhardware.io/guides/deepseek-v3-hardware-requirements ↩

  4. LMSYS, Chatbot Arena (classement par prĂ©fĂ©rence humaine multi-tour). https://chat.lmsys.org/ ↩

  5. Hugging Face, Open LLM Leaderboard (benchmarks modĂšles open weights). https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard ↩

  6. SWE-bench, Software Engineering Benchmark (Ă©valuation agents de code sur issues GitHub rĂ©elles). https://www.swebench.com/ ↩