Qwen 3.8 27B gratuit et illimité dans VS Code : le guide pas à pas
Un modèle open-weight qui bat Claude Sonnet 4.6 sur plusieurs benchmarks de code, un endpoint Hugging Face compatible OpenAI sans inscription, et deux extensions pour l'apprivoiser. Voici le guide complet. 🚀
📣 L'annonce qui fait du bruit
Publié le 5 août 2026, Qwen 3.8 est le nouveau modèle open-weight d'Alibaba : 27 milliards de paramètres en architecture dense, nativement multimodal (texte + images) et distribué sous licence Apache-2.0, en BF16 non quantisé.
La promesse : des progrès agentiques majeurs par rapport à Qwen 3.6-27B — exactement ce qu'on demande à un assistant de programmation. Et la cerise sur le gâteau : un endpoint communautaire gratuit, sans clé API ni inscription, à brancher directement dans Visual Studio Code. 😍
🏆 Des benchmarks impressionnants
Qwen 3.8 27B surpasse nettement son prédécesseur Qwen 3.6-27B, et devance Claude Sonnet 4.6 sur les benchmarks de code cités dans la vidéo :
| Benchmark | Qwen 3.8 27B | Qwen 3.6 27B | Claude Sonnet 4.6 |
|---|---|---|---|
| Terminal-Bench 2.1 (code agentique en terminal) | 73,0 ✅ | 63,4 | 67 |
| SWE-bench Pro (résolution de bugs réels) | 61,7 ✅ | 53,5 | 58 |
| OSWorld-Verified (tâches agentiques sur OS) | 84,3 ✅ | 63,9 | — |
Côté mémoire, le déploiement sert la fenêtre de contexte native complète de 262 144 tokens (extensible jusqu'à 1 M selon la fiche du modèle) — de quoi voir venir sur de grosses bases de code.
🔌 L'endpoint gratuit & ses specs
La vidéo s'appuie sur l'endpoint communautaire de Victor (Space victor/Qwen3.8-27B-free-endpoint) : une API Chat Completions compatible OpenAI, hébergée sur Hugging Face Inference Endpoints. Aucun token Hugging Face n'est requis : il suffit de pointer n'importe quel SDK OpenAI, curl ou framework agentique vers la Base URL.
La fiche technique du déploiement
48× Gated-DeltaNet + 16× attention (3:1)
fenêtre native complète
vidéo désactivée
BF16 non quantisé
~1,7× plus rapide
50 requêtes parallèles vérifiées
429 + en-tête Retry-After. Et il sera retiré une fois retombée la fièvre du lancement — profitez-en, soyez sympas. 🤝🛠️ Méthode 1 : configurer Cline
- Installez l'extensionDans le marketplace de VS Code, cherchez « Cline » (« Cline – AI Coding, Open Source and Uncompromised ») et installez-la.
- Ouvrez la configuration APICliquez sur la liste des modèles en bas du champ de texte : la section API Configuration s'ouvre.
- Choisissez le fournisseurDans API Provider, sélectionnez « OpenAI Compatible ».
- Collez la Base URLCollez l'URL du endpoint (voir section 3) dans le champ Base URL.
- Renseignez la clé APIEntrez
none(ou n'importe quelle chaîne, ou laissez vide) — aucune clé n'est requise. - Indiquez l'ID du modèleDans Model ID, saisissez :
Qwen/Qwen3.8-27B. - Testez !Ouvrez une nouvelle fenêtre, posez une question… et l'agent répond. 🎉
⚡ Méthode 2 : configurer Kilo Code
- Installez l'extensionDans le marketplace, cherchez « Kilo Code : AI Coding Agent, Copilot, and Autocomplete ».
- Créez un fournisseur personnaliséDans Settings → Provider, choisissez Custom Provider, donnez-lui un nom (par ex. « Victor ») et le type OpenAI Compatible.
- Collez la Base URLUne fois l'URL collée, le modèle apparaît automatiquement dans la liste. ✨
- Validez la cléÉditez le fournisseur, indiquez
nonecomme clé API, puis soumettez. - Sélectionnez-le et codezChoisissez ce fournisseur, passez en Plan mode ou Act mode selon vos besoins, et lancez-vous.
🧠 Aller plus loin : raisonnement, vision & API
💭 Une pensée réglable comme un thermostat
Le raisonnement est activé par défaut : le fil de pensée arrive séparément dans message.reasoning, tandis que message.content reste propre. Réglez la profondeur avec le champ standard reasoning_effort :
Sur cette instance partagée, un effort non défini = low (files d'attente courtes). Demandez medium ou xhigh explicitement pour un raisonnement plus profond.
🎛️ Réglages d'échantillonnage recommandés (fiche du modèle)
| Mode | Température | Top_p | Top_k | Presence penalty |
|---|---|---|---|---|
| Pensée activée (défaut) | 1.0 | 0.95 | 20 | 0.0 |
Sans pensée (reasoning_effort="none") | 0.7 | 0.80 | 20 | 1.5 |
👁️ Il sait voir
Vision native : envoyez des images à la façon OpenAI standard, jusqu'à 4 par requête (la vidéo est désactivée sur l'instance partagée). Pratique pour debugger une capture d'écran ! Le streaming, le tool calling (tools=[...]) et les allers-retours multi-tours fonctionnent comme avec l'API OpenAI.
⌨️ Deux extraits pour tester en dehors de VS Code
Terminal — curlchat/completions curl https://g9hnto0u7lvbu837.us-east-2.aws.endpoints.huggingface.cloud/v1/chat/completions \ -H 'Content-Type: application/json' \ -d '{ "model": "Qwen/Qwen3.8-27B", "messages": [{"role": "user", "content": "Explique le cache KV en un paragraphe."}] }'quickstart.py — SDK OpenAIpython from openai import OpenAIclient = OpenAI( base_url="https://g9hnto0u7lvbu837.us-east-2.aws.endpoints.huggingface.cloud/v1", api_key="none", # aucune clé requise )r = client.chat.completions.create( model="Qwen/Qwen3.8-27B", messages=[{"role": "user", "content": "Trois faits amusants sur les phares ?"}], temperature=1.0, top_p=0.95, )print(r.choices[0].message.reasoning) # le fil de pensée print(r.choices[0].message.content) # la réponse finalepreserve_thinking) — top pour les flux agentiques, mais gourmand. Pour le comportement classique, passez extra_body={"chat_template_kwargs": {"preserve_thinking": False}}.🧭 Conseils & limites à connaître
429 avec Retry-After peut tomber. Soyez patients — et raisonnables.🎯 Conclusion
Avec Qwen 3.8 27B, une simple Base URL Hugging Face et l'extension Cline ou Kilo Code, vous obtenez un assistant de codage agentique, multimodal et capable de raisonner… sans clé API et sans frais, sur un H200 qui tourne à ~110 tok/s.
Alors, à vos claviers : happy coding ! 👩👨💻 Et si le sujet vous plaît, la vidéo originale et la chaîne CodingLab méritent un petit abonnement. 😉
🔍 Transcription audio : corrections appliquées (cliquer pour dérouler)
- « Coin / Coin 3.8 » → Qwen / Qwen 3.8 (modèle d'Alibaba).
- « terminal bench 2.7 » → Terminal-Bench 2.1 (score 73,0).
- « SWE bench » → SWE-bench Pro (score 61,7).
- « Client » → Cline ; « Kilo » → Kilo Code (noms officiels des extensions).
- « 262 native context / 1 million » → 262 144 tokens natifs (extensible à 1 M selon la fiche du modèle).
- « claude.chat » → claude.ai ; « broad code » → VS Code.
- Model ID « coin/coin3.8 27 billion » → Qwen/Qwen3.8-27B.
- Date de publication des poids → 5 août 2026 selon la page du Space (MTP activé le 15/08/2026).
🎬 La vidéo originale & ses chapitres
6:14
Use Qwen 3.8 27B FREE in VS Code — Unlimited?
Chaîne CodingLab · 16 août 2026 · youtu.be/BlgfJxzZBQM
Sommaire cliquable de la vidéo :
- 0:00 Intro & annonce de Qwen 3.8
- 0:40 Benchmarks vs Claude Sonnet 4.6
- 1:35 Endpoint Hugging Face (Victor), sans clé API
- 2:15 Les 2 extensions : Cline & Kilo Code
- 2:40 Configuration dans Cline (Base URL + Model ID)
- 3:50 Test dans Cline & fenêtre de contexte
- 4:25 Configuration dans Kilo Code
- 5:25 Test final, conseils & conclusion
