Qwen 3.8 27B gratuit & illimité dans VS Code — le guide pas à pas
🤖 Tutoriel IA · VS Code · 100 % gratuit · sans clé API

Qwen 3.8 27B gratuit et illimité dans VS Code : le guide pas à pas

Un modèle open-weight qui bat Claude Sonnet 4.6 sur plusieurs benchmarks de code, un endpoint Hugging Face compatible OpenAI sans inscription, et deux extensions pour l'apprivoiser. Voici le guide complet. 🚀

📅 19 août 2026 ⏱️ ~8 min de lecture 🎬 D'après la vidéo de CodingLab 🧠 27B DENSE · HYBRID ATTENTION 📚 262 144 TOKENS 👁️ VISION 🖥️ 1× H200 · vLLM 📜 APACHE-2.0

📣 L'annonce qui fait du bruit

Publié le 5 août 2026, Qwen 3.8 est le nouveau modèle open-weight d'Alibaba : 27 milliards de paramètres en architecture dense, nativement multimodal (texte + images) et distribué sous licence Apache-2.0, en BF16 non quantisé.

La promesse : des progrès agentiques majeurs par rapport à Qwen 3.6-27B — exactement ce qu'on demande à un assistant de programmation. Et la cerise sur le gâteau : un endpoint communautaire gratuit, sans clé API ni inscription, à brancher directement dans Visual Studio Code. 😍

💡 Bonne nouvelle : ce tutoriel fonctionne avec un solde de 0, sans carte bancaire. Une simple Base URL suffit — n'importe quelle chaîne fait office de clé API.

🏆 Des benchmarks impressionnants

Qwen 3.8 27B surpasse nettement son prédécesseur Qwen 3.6-27B, et devance Claude Sonnet 4.6 sur les benchmarks de code cités dans la vidéo :

BenchmarkQwen 3.8 27BQwen 3.6 27BClaude Sonnet 4.6
Terminal-Bench 2.1 (code agentique en terminal)73,0 ✅63,467
SWE-bench Pro (résolution de bugs réels)61,7 ✅53,558
OSWorld-Verified (tâches agentiques sur OS)84,3 ✅63,9

Côté mémoire, le déploiement sert la fenêtre de contexte native complète de 262 144 tokens (extensible jusqu'à 1 M selon la fiche du modèle) — de quoi voir venir sur de grosses bases de code.

ℹ️ Atouts clés pour le dev : l'exécution agentique, le tool calling et la pensée réglable (mode raisonnement), idéaux pendant le codage.

🔌 L'endpoint gratuit & ses specs

La vidéo s'appuie sur l'endpoint communautaire de Victor (Space victor/Qwen3.8-27B-free-endpoint) : une API Chat Completions compatible OpenAI, hébergée sur Hugging Face Inference Endpoints. Aucun token Hugging Face n'est requis : il suffit de pointer n'importe quel SDK OpenAI, curl ou framework agentique vers la Base URL.

🔗 Endpoint URL (Base URL)copiez-moi ✂️ https://g9hnto0u7lvbu837.us-east-2.aws.endpoints.huggingface.cloud/v1

La fiche technique du déploiement

27B denseVLM · 64 couches
48× Gated-DeltaNet + 16× attention (3:1)
262 144tokens de contexte
fenêtre native complète
Texte + images4 images max / requête
vidéo désactivée
1× H200141 GB · autoscale à 2
BF16 non quantisé
vLLM + MTPdécodage spéculatif
~1,7× plus rapide
~0,7 s / ~110 tok/s1ᵉ token · débit
50 requêtes parallèles vérifiées
🚦 Endpoint communautaire = partagé : environ 30 requêtes en rafale, rechargées à ± 30 requêtes/min par IP. Les tool-calls parallèles d'un agent passent très bien ; harceler l'API avec un script, non. Au-delà : 429 + en-tête Retry-After. Et il sera retiré une fois retombée la fièvre du lancement — profitez-en, soyez sympas. 🤝
⚠️ Essai préalable : dans la vidéo, l'auteur teste d'abord l'endpoint dans un autre outil et obtient une erreur 404. C'est bien dans VS Code (via Cline ou Kilo Code) que tout fonctionne.

🛠️ Méthode 1 : configurer Cline

  1. Installez l'extensionDans le marketplace de VS Code, cherchez « Cline » (« Cline – AI Coding, Open Source and Uncompromised ») et installez-la.
  2. Ouvrez la configuration APICliquez sur la liste des modèles en bas du champ de texte : la section API Configuration s'ouvre.
  3. Choisissez le fournisseurDans API Provider, sélectionnez « OpenAI Compatible ».
  4. Collez la Base URLCollez l'URL du endpoint (voir section 3) dans le champ Base URL.
  5. Renseignez la clé APIEntrez none (ou n'importe quelle chaîne, ou laissez vide) — aucune clé n'est requise.
  6. Indiquez l'ID du modèleDans Model ID, saisissez : Qwen/Qwen3.8-27B.
  7. Testez !Ouvrez une nouvelle fenêtre, posez une question… et l'agent répond. 🎉
️ Récap de configurationCline / Kilo Code Base URL : https://g9hnto0u7lvbu837.us-east-2.aws.endpoints.huggingface.cloud/v1 API Key : none # aucune clé requise Model ID : Qwen/Qwen3.8-27B

Méthode 2 : configurer Kilo Code

  1. Installez l'extensionDans le marketplace, cherchez « Kilo Code : AI Coding Agent, Copilot, and Autocomplete ».
  2. Créez un fournisseur personnaliséDans Settings → Provider, choisissez Custom Provider, donnez-lui un nom (par ex. « Victor ») et le type OpenAI Compatible.
  3. Collez la Base URLUne fois l'URL collée, le modèle apparaît automatiquement dans la liste. ✨
  4. Validez la cléÉditez le fournisseur, indiquez none comme clé API, puis soumettez.
  5. Sélectionnez-le et codezChoisissez ce fournisseur, passez en Plan mode ou Act mode selon vos besoins, et lancez-vous.
💡 Astuce : le mode Plan est parfait pour réfléchir avant d'agir, le mode Act laisse l'agent exécuter les étapes directement.

🧠 Aller plus loin : raisonnement, vision & API

💭 Une pensée réglable comme un thermostat

Le raisonnement est activé par défaut : le fil de pensée arrive séparément dans message.reasoning, tandis que message.content reste propre. Réglez la profondeur avec le champ standard reasoning_effort :

xhighmediumlow · défaut (instance partagée)none · pensée désactivée

Sur cette instance partagée, un effort non défini = low (files d'attente courtes). Demandez medium ou xhigh explicitement pour un raisonnement plus profond.

🎛️ Réglages d'échantillonnage recommandés (fiche du modèle)

ModeTempératureTop_pTop_kPresence penalty
Pensée activée (défaut)1.00.95200.0
Sans pensée (reasoning_effort="none")0.70.80201.5

👁️ Il sait voir

Vision native : envoyez des images à la façon OpenAI standard, jusqu'à 4 par requête (la vidéo est désactivée sur l'instance partagée). Pratique pour debugger une capture d'écran ! Le streaming, le tool calling (tools=[...]) et les allers-retours multi-tours fonctionnent comme avec l'API OpenAI.

⌨️ Deux extraits pour tester en dehors de VS Code

Terminal — curlchat/completions curl https://g9hnto0u7lvbu837.us-east-2.aws.endpoints.huggingface.cloud/v1/chat/completions \ -H 'Content-Type: application/json' \ -d '{ "model": "Qwen/Qwen3.8-27B", "messages": [{"role": "user", "content": "Explique le cache KV en un paragraphe."}] }'quickstart.py — SDK OpenAIpython from openai import OpenAIclient = OpenAI( base_url="https://g9hnto0u7lvbu837.us-east-2.aws.endpoints.huggingface.cloud/v1", api_key="none", # aucune clé requise )r = client.chat.completions.create( model="Qwen/Qwen3.8-27B", messages=[{"role": "user", "content": "Trois faits amusants sur les phares ?"}], temperature=1.0, top_p=0.95, )print(r.choices[0].message.reasoning) # le fil de pensée print(r.choices[0].message.content) # la réponse finale
Note multi-tours : par défaut, la pensée des tours précédents est conservée dans le contexte (preserve_thinking) — top pour les flux agentiques, mais gourmand. Pour le comportement classique, passez extra_body={"chat_template_kwargs": {"preserve_thinking": False}}.

🧭 Conseils & limites à connaître

🚦 Rate-limit : ± 30 req/min par IP. En cas d'affluence, les réponses peuvent être plus lentes, et un 429 avec Retry-After peut tomber. Soyez patients — et raisonnables.
Durée de vie limitée : l'endpoint est gratuit « le temps que la fièvre du lancement retombe ». S'il disparaît, la méthode reste valable avec n'importe quel endpoint compatible OpenAI (ou le vôtre).
🧪 Testez par vous-même : chaque modèle a ses forces selon votre cas d'usage. Essayez-le sur vos propres projets avant de l'adopter définitivement.
🤝 Jouez collectif : cet endpoint est hébergé bénévolement. Utilisez-le pour découvrir le modèle, sans en abuser.

🎯 Conclusion

Avec Qwen 3.8 27B, une simple Base URL Hugging Face et l'extension Cline ou Kilo Code, vous obtenez un assistant de codage agentique, multimodal et capable de raisonner… sans clé API et sans frais, sur un H200 qui tourne à ~110 tok/s.

Alors, à vos claviers : happy coding ! 👩‍👨‍💻 Et si le sujet vous plaît, la vidéo originale et la chaîne CodingLab méritent un petit abonnement. 😉

🔍 Transcription audio : corrections appliquées (cliquer pour dérouler)
  • « Coin / Coin 3.8 » → Qwen / Qwen 3.8 (modèle d'Alibaba).
  • « terminal bench 2.7 » → Terminal-Bench 2.1 (score 73,0).
  • « SWE bench » → SWE-bench Pro (score 61,7).
  • « Client » → Cline ; « Kilo » → Kilo Code (noms officiels des extensions).
  • « 262 native context / 1 million » → 262 144 tokens natifs (extensible à 1 M selon la fiche du modèle).
  • « claude.chat » → claude.ai ; « broad code » → VS Code.
  • Model ID « coin/coin3.8 27 billion » → Qwen/Qwen3.8-27B.
  • Date de publication des poids → 5 août 2026 selon la page du Space (MTP activé le 15/08/2026).

🎬 La vidéo originale & ses chapitres

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *

Retour en haut