Le code IA 100% local rattrape le cloud : Qwen3.6-27B sur une simple RTX 3090
IA & Développement

Le code IA 100 % local rattrape enfin le cloud

Comment un modèle de 27 milliards de paramètres, téléchargé en un seul fichier, tourne sur une carte graphique d’occasion à moins de 800 € — et pourquoi tout le monde en parle depuis avril 2026.

Voici une affirmation qui mérite d’être testée : le meilleur assistant de code que vous puissiez faire tourner aujourd’hui, sans abonnement, sans cloud, sans qu’une seule ligne de votre code ne quitte votre machine, tient désormais sur une carte graphique d’occasion qui coûte à peu près le prix d’un smartphone correct. Le modèle s’appelle Qwen3.6-27B, et sur des tâches de correction de bugs réels issus de GitHub, il obtient un score qui n’a rien d’un chiffre de démonstration gonflé.

1Pourquoi ça explose maintenant

Le déclencheur est daté : le 4 avril 2026, Anthropic a changé les règles de ses abonnements Claude Pro et Max. Les frameworks d’agents tiers (comme OpenClaw) ne pouvaient plus puiser dans les crédits d’abonnement classique et devaient basculer sur une facturation à l’usage, potentiellement beaucoup plus chère pour un usage intensif. Du jour au lendemain, une partie des utilisateurs a vu — ou redouté de voir — sa facture d’agent IA grimper, et la question « qu’est-ce qui tourne vraiment en local, et est-ce enfin suffisant ? » s’est répandue partout.

Le calcul est simple à poser : un abonnement coûte un montant fixe chaque mois, indéfiniment. Une carte graphique d’occasion est un achat unique. Sur deux ou trois ans, la machine locale finit par coûter moins cher — et elle ne change jamais ses conditions d’utilisation du jour au lendemain.

La vraie question n’est pas « est-ce que le local peut tout remplacer ? » mais « où se situe exactement la limite, pour que vous puissiez décider avant de dépenser un centime ».

2Qwen3.6-27B, la carte d’identité

Publié le 22 avril 2026 par l’équipe Qwen (Alibaba) sous licence Apache 2.0, Qwen3.6-27B est un modèle dense de 27 milliards de paramètres — c’est-à-dire que tous ses paramètres travaillent sur chaque token, contrairement aux architectures « mixture of experts » qui n’en activent qu’une fraction. Sur les benchmarks de code, il dépasse le précédent modèle open source phare de la même équipe, Qwen3.5-397B-A17B (397 milliards de paramètres au total, 17 milliards actifs) — un modèle près de 15 fois plus gros sur le papier. C’est ce genre d’annonce qui appelle une réaction du type « prouvez-le », et Qwen n’en est pas à son coup d’essai : la lignée « coder » de la famille progresse depuis plusieurs générations, chacune resserrant un peu plus l’écart avec les modèles propriétaires.

Assistant cloud

  • Abonnement mensuel récurrent
  • Code envoyé sur les serveurs du fournisseur
  • Conditions modifiables à tout moment
  • Scores de pointe absolus

Qwen3.6-27B en local

  • Un seul achat de matériel
  • Rien ne quitte la machine
  • Aucune limite d’usage, aucune coupure
  • À 3-4 points des meilleurs modèles cloud sur le code

3Les benchmarks qui comptent vraiment

Le test de référence en 2026 pour évaluer un assistant de code, c’est SWE-bench Verified : on donne au modèle un vrai dépôt open source et un vrai rapport de bug, et on ne compte la réussite que si le correctif compile et passe les tests existants. Voici les scores officiels communiqués par Qwen (évalués avec leur propre harnais d’agent) :

SWE-bench Verified77,2 %
Terminal-Bench 2.0 (usage d’outils, shell)59,3 %
SkillsBench48,2 %
GPQA Diamond (raisonnement)87,8 %

Ce ne sont pas des scores isolés sur un seul test : c’est une compétence large. Comparé aux meilleurs modèles cloud actuels (Claude Opus 4.6 tourne autour de 80-81 % sur SWE-bench Verified), l’écart n’est plus que de 3 à 4 points — pour un modèle qu’on héberge soi-même, gratuitement, hors coût du matériel.

Il faut rester honnête sur un point : ce sont des chiffres auto-rapportés par Qwen, avec son propre harnais d’évaluation. Les vérifications indépendantes progressent mais restent partielles. Ce qui est plus difficile à truquer, c’est l’adoption communautaire : dès la sortie, la communauté r/LocalLLaMA a branché ses éditeurs et boucles d’agents dessus, avec un avis qui revenait sans cesse dans les fils de discussion — le modèle « code juste bien », sans drame.

Il n’est pas homogène partout : Python et JavaScript sont son terrain de prédilection, avec une sortie propre et confiante. Rust et C++ sont les langages où un modèle dense de 27B tire son épingle du jeu face à des modèles plus petits, car le vérificateur d’emprunt (borrow checker) de Rust punit sévèrement un modèle qui ne comprend qu’à moitié ce qu’il écrit.

4Comment le faire tourner chez soi

On télécharge un seul fichier : un GGUF quantifié. La version 4 bits (Q4_K_M) pèse environ 16,8 Go. Pas d’installeur, pas de compte, pas de mur de connexion — le fichier se pose sur le SSD et attend d’être chargé.

La quantification est le mot qui fait tout le travail ici : le modèle brut stocke chaque poids sur 16 bits ; la quantification 4 bits compresse chaque valeur à environ un quart de sa taille, avec très peu de perte de qualité perceptible. C’est cette compression qui fait tenir un modèle de 27 milliards de paramètres sur une carte grand public. Une communauté comme Unsloth publie des GGUF prêts à l’emploi sur Hugging Face dès la sortie d’un modèle, calibrés pour perdre le moins de qualité possible.

Résultat : le modèle tient sur une RTX 3090 d’occasion (24 Go de VRAM, de l’ordre de 700 à 800 €/$ sur le marché de l’occasion) — une carte de cinq ans d’âge que beaucoup revendent après avoir changé de configuration devient un poste de travail de code privé et compétent.

💶 Le coût réel

Sous pleine charge, ce type de carte consomme de l’ordre de 300 à 350 W, uniquement pendant qu’elle génère activement du texte. Utilisée quelques heures par jour, la facture d’électricité reste marginale — sans commune mesure avec un abonnement mensuel récurrent.

🔒 La confidentialité

Aucun dépôt envoyé, aucun prompt qui traîne dans un journal serveur, aucune évolution de politique d’usage qui vous tombe dessus par email le mois suivant. Pour du code sous NDA, c’est souvent la seule réponse acceptable.

5Quelle configuration selon votre carte graphique

C’est votre VRAM qui détermine votre modèle : mieux vaut identifier son palier avant de choisir.

VRAM disponibleOption recommandée
8 GoPetits modèles « coder » compacts
16 à 24 GoQwen3.6-35B-A3B (35 Md de paramètres, ~3 Md actifs par token — le gros du modèle vit en RAM système, seule la tranche active sollicite le GPU)
24 Go (ex : RTX 3090)Qwen3.6-27B dense, en usage quotidien
Mac Apple SiliconMémoire unifiée partagée CPU/GPU — le même 27B tourne via MLX ou llama.cpp

6Le vrai frein : la vitesse — et comment MTP change tout

Un modèle de langage écrit un token, puis relit tout le contexte pour écrire le suivant, un mot à la fois, strictement en série. Le GPU passe l’essentiel de chaque étape à attendre la mémoire plutôt qu’à calculer : il est puissant, mais largement inactif la plupart du temps. Sur une RTX 3090, en configuration simple, Qwen3.6-27B tourne autour d’une vingtaine à une quarantaine de tokens par seconde selon la configuration — lisible, utilisable, mais loin de l’instantanéité à laquelle le cloud a habitué.

C’est là qu’intervient le MTP (Multi-Token Prediction) : au lieu de deviner un seul token, le modèle en rédige plusieurs d’un coup, puis vérifie ce petit brouillon en un seul passage et garde tout ce qu’il a deviné juste. Moins de passages, pour le même GPU, plus de mots livrés — une forme d’auto-complétion appliquée à la propre sortie du modèle.

Cette technique est passée du stade de papier de recherche à celui d’usage courant en mai 2026 : le support MTP a été fusionné dans llama.cpp (le moteur qui fait tourner la plupart des installations locales) le 16 mai 2026. Du jour au lendemain, chaque RTX 3090 de chambre à coucher a reçu une mise à niveau gratuite.

Sur une même carte, avec le même modèle, activer le MTP a fait passer une RTX 3090 d’environ 38-40 tokens par seconde à environ 59-65 tokens par seconde selon les configurations testées par la communauté — certaines installations (notamment sur du matériel AMD Strix Halo) rapportent des gains encore plus marqués, proches du double.

Un point de vigilance honnête : le gain est le plus net sur les modèles denses comme le 27B, précisément parce que ce sont eux qui laissaient le plus le GPU inactif. Il faut aussi des poids GGUF compatibles MTP et une version récente de llama.cpp — c’est une fonctionnalité encore jeune, qui mérite d’être testée mais pas encore activée les yeux fermés en un clic.

7Les autres options du moment

Qwen3.6-27B n’est pas seul sur le terrain — la mi-2026 est une période particulièrement dense en sorties open source de qualité.

  • Kimi K2.6 (Moonshot AI) — un modèle « mixture of experts » massif, avec des scores très élevés sur les benchmarks les plus exigeants, mais qui relève clairement de la salle serveur, pas du bureau.
  • DeepSeek V4 Flash — 284 milliards de paramètres (13 milliards actifs), fenêtre de contexte d’un million de tokens, tarif API très bas. En local en revanche, il faut compter une quantité de mémoire de l’ordre de 150 Go — un projet de home lab, pas un ordinateur portable.
  • Gemma 4 (Google) — un petit modèle mixture qui frappe au-dessus de son poids et tourne très vite sur une carte récente.

Le point n’est pas que Qwen soit le seul jeu en ville : c’est que le terrain local est soudain riche d’options sérieuses, et que la concurrence tire tout le monde vers le haut. Cette hiérarchie a néanmoins une durée de vie courte, comptée en semaines : c’est un domaine qui bouge chaque mois.

8Installation pratique

  1. Télécharger le GGUFVersion 4 bits compatible MTP, par exemple via Unsloth sur Hugging Face.
  2. Le lancerAvec Ollama pour la simplicité (une seule commande), ou llama.cpp pour garder la main sur tous les réglages, dont le MTP.
  3. Régler l’échantillonnageTempérature 0,6, top_p 0,95, top_k 20 — ignorer ces réglages donne l’impression d’un modèle moins intelligent qu’il ne l’est.
  4. Calibrer le contexteLe modèle tient nativement 262 144 tokens, mais chaque token de contexte mange de la VRAM. Donnez-lui un module de code à la fois, pas tout le dépôt.
  5. Le brancher dans son éditeurContinue (VS Code) ou Aider (terminal) parlent tous deux à un simple point d’accès local. Gardez un petit modèle « coder » à part pour l’auto-complétion : la famille 3.6 ne fait pas de fill-in-the-middle.
ollama pull qwen3.6:27b
# ou, pour activer le MTP avec llama.cpp
llama-server -m Qwen3.6-27B-Q4_K_M-mtp.gguf --spec-type mtp \
  --temp 0.6 --top-p 0.95 --top-k 20 -ngl 99 -c 65536

9Où ça coince encore

Les gros refactors transversaux — ceux qui touchent une dizaine de fichiers et demandent un vrai plan d’ensemble avant d’agir — restent clairement le terrain des modèles cloud les plus puissants. Le modèle local peut aussi, occasionnellement, relancer un appel d’outil qui a échoué sans s’en rendre compte. Il est très bon ; il n’est pas magique.

Mais les tâches qui remplissent réellement la majorité d’une journée de travail — corriger un bug, écrire un test, expliquer un fichier hérité, faire un petit refactor — sont traitées proprement, et localement. Et local ne veut pas dire sans supervision : on relit toujours le diff avant de l’accepter, exactement comme avec un modèle cloud. Le modèle propose, vous décidez.

À retenir

Il ne faut plus la permission de personne, ni un abonnement mensuel, pour avoir un assistant de code sérieux à ses côtés. La carte déjà posée sur le bureau suffit.

🔎 Vérifications effectuées sur cette retranscription

  • Nom du modèle corrigé : « Quinn 3 627B » de la retranscription automatique correspond bien à Qwen3.6-27B (Alibaba), sorti le 22 avril 2026 — confirmé sur le blog officiel Qwen et Hugging Face.
  • Scores SWE-bench Verified (77,2 %), Terminal-Bench 2.0 (59,3 %), SkillsBench (48,2 %) et GPQA Diamond (87,8 %) confirmés via la publication officielle Qwen — présentés ici comme des chiffres auto-rapportés par l’éditeur.
  • Le chiffre de LiveCodeBench mentionné dans l’audio n’a pas pu être confirmé auprès d’une source officielle ; il a été retiré plutôt que republié sans certitude.
  • Fusion du support MTP dans llama.cpp confirmée au 16 mai 2026 (PR #22673), avec des gains communautaires réels mais variables (environ 1,4x à 2,4x selon le matériel) plutôt qu’un chiffre unique universel.
  • Le changement de politique d’abonnement Anthropic est confirmé : effectif depuis le 4 avril 2026, il concernait les frameworks d’agents tiers (comme OpenClaw), pas l’ensemble de l’usage de Claude.
  • DeepSeek V4 Flash : 284 milliards de paramètres (13 milliards actifs) et contexte d’un million de tokens confirmés ; l’estimation « environ 150 Go » de mémoire correspond à l’ordre de grandeur rapporté pour un déploiement local quantifié.
Best Local Coding Model Right Now in 2026 — miniature vidéo YouTube

🎬 Regarder la vidéo source : Best Local Coding Model Right Now in 2026

📑 Sommaire de la vidéo

Repères construits à partir du déroulé du contenu (minutages approximatifs, la vidéo n’expose pas de chapitres officiels) — cliquez pour aller directement au passage correspondant dans cet article.

  1. Le déclic : le changement de règles d’Anthropic~0:00
  2. Qwen3.6-27B, la carte d’identité~2:00
  3. Les benchmarks qui comptent~4:30
  4. Quantification et matériel nécessaire~7:00
  5. Choisir sa configuration selon sa VRAM~8:30
  6. Le problème de vitesse et l’arrivée du MTP~10:00
  7. Les alternatives (Kimi K2.6, DeepSeek V4 Flash, Gemma 4)~12:00
  8. Installation pratique pas à pas~13:00
  9. Les limites honnêtes du local~14:00

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *

Retour en haut