Qwen 3.8 27B : le petit modèle qui joue dans la cour des grands — Test complet
🧪 Test local · ~1 000 000 tokens générés

Qwen 3.8 27B : le « petit » modèle qui joue dans la cour des grands

Vision native, modes de réflexion low / medium / extra high, couches MTP, système solaire 3D, GTA dans le navigateur… Nous avons passé au crible la vidéo‑test de la chaîne xCreate, réalisée sur un Mac Studio M3 Ultra 512 Go. Résumé complet, vérifié et illustré.

📅 15 août 2026 ⏱️ 31 min 21 s 🖥️ M3 Ultra · 512 Go 🧠 27 B de paramètres 🅰️ Apache 2.0
🗂️

L’essentiel en 4 cartes

Avant de plonger dans les tests, voici ce qu’il faut retenir de ce marathon d’environ douze heures de générations cumulées.

61,7

SWE‑Bench Pro

Un score à un cheveu de GLM‑5.2 (62,1)… avec un modèle dense de 27 B seulement. Du jamais vu pour cette taille.

👁️

Vision native

Le modèle comprend réellement les pixels : il décrit une photo, puis la transforme en scène 3D animée en Three.js.

×2

MTP = vitesse

Les couches Multi‑Token Prediction font presque doubler le débit : de ~19 à plus de 36 tokens/s sur M3 Ultra.

🤯

Appétit de tokens

Le mode « extra high » peut engloutir de 20 000 à 60 000+ tokens de réflexion pour une seule génération. Spectaculaire… mais lent.

✦ ✦ ✦
📇

Qwen 3.8 27B, c’est quoi ?

Un modèle dense, open‑weights, nativement multimodal, avec fenêtre de contexte 262 K extensible à 1 M et couches MTP intégrées. La famille comprend aussi un mastodonte « Max » de 2,4 trillions de paramètres (~5 To à télécharger !).

Bench vérifié ✔

SWE‑Bench Pro : 61,7

Devant GLM‑5.1 (58,4), talonnant GLM‑5.2 (62,1). Pour rappel, Qwen3.8‑Max plafonne à 67 avec 90 fois plus de paramètres.

Bench vérifié ✔

Deep SWE : 42

Un peu en retrait face au Max (56), mais bluffant pour un modèle qui tient dans la mémoire d’un Mac.

Famille

2,4 T de paramètres

La version Max existe (≈ 5 To). Notre testeur plaisante : « envoyez‑moi des disques durs ! » 😅

Contexte

262 K → 1 M tokens

De quoi voir venir, d’autant que le titre de la vidéo promet ~1 million de tokens générés pendant les tests.

« C’est un tout petit modèle… enfin, il est gros, mais minuscule comparé aux modèles de 2,8 trillions de paramètres d’aujourd’hui. »— xCreate, en comparant le 27 B au Kimi K3 (2,8 T)

Vitesse & MTP : le turbo intégré

Mesures sur Mac Studio M3 Ultra (app Inferencer, version debug donc légèrement pessimiste). Le MTP = Multi‑Token Prediction : des couches additionnelles qui prédisent plusieurs tokens d’un coup, façon décoding spéculatif.

Sans MTP
19 t/s
MTP « 3.6 » (ancien)
31,7 t/s
MTP Q8
35 t/s
MTP 3.8 Q4 🏆
36,3 t/s
Version release
43 t/s

💡 Le MTP Q4 (le plus léger) est aussi le plus rapide : plus le brouillon est petit, moins il coûte cher. Sur un RTX 5090, comptez encore ~10 t/s de mieux selon le testeur.

🎨

Vision & générations créatives

Le cœur du show : transformer des images et des prompts en scènes 3D animées, dans tous les modes de réflexion.

🐈Vision

Le chat roux

« Un chat tigré roux » : identification parfaite, à égalité avec Qwen 3.6. Petit détail piquant : des tirets cadratins « signature » qui trahissent l’IA. 😏

📦Three.js

Chat animé en 3D

Sans réflexion (5 000 tokens) : queue animée indépendamment, oreilles qui sautillent → meilleur que 3.6. En « low » : un peu de Z‑fighting. En « extra high » (~20 000 tokens, 10 min) : yeux verts, moustaches, brume… « glorieux ».

🪐45 000 tokens

Système solaire 3D

Le clou du spectacle : planètes cliquables, halo au survol, ~30 min de génération. « On dirait du CGI de film d’il y a 20‑30 ans. » Les versions 3.6 et Kimi K3 « pulvérisées ».

🗿Extra high requis

Visage humain procédural

Sans réflexion : boucle infinie. Low : erreur. Medium : 60 000 tokens pour rien. Extra high (19 000 tokens) : « probablement la plus belle tête 3D jamais générée » — un air de John Malkovich démoniaque. 👽

« Regardez ça… ça, c’est magnifique. Et à côté, l’ancienne génération ressemble à un déchet. »— à propos du système solaire Qwen 3.8 vs Qwen 3.6
🎮

Simulateurs & jeux recréés en une shot

Des recréations complètes, générées en un seul prompt HTML/JS. Pour rappel : aucun moteur de jeu, juste du code écrit par un modèle de 27 B.

🛩️55 000 tokens

Simulateur de vol zen

3.6 s’en sortait en 8 000 tokens ; 3.8 (extra high) ajoute son moteur lié à la manette des gaz, boussole et contrôles complets. Magnifique, mais 7× plus bavard.

🏹Fonctionnel

Baliste antique

La baliste tire vraiment (…dans la mauvaise direction au début 😅). Là où 3.6 ne tirait pas du tout.

🫀15 900 tokens

Anatomie humaine 3D

Muscles, squelette, organes, coupe du corps… mais le visage est remplacé par une boule argentée. « Ne suivez pas ses ordonnances aveuglément. » 😄

🚗13 000 tokens

GTA 5 navigateur

Intro « Welcome to the streets », feux de circulation, véhicules à bord (touche E). « Même des modèles 3× plus gros ne font pas ça. »

🤠18 000 tokens

Red Dead Redemption

Cutscene « L’année est 1883 », ville, PNJ, tirs qui partent vers l’avant… mais la tête du bonhomme flotte un peu, et le cheval disparaît quand on monte dessus. 🐴💨

🍄6 000 tokens · 35 t/s

Super Mario & OutRun

Mario saute (pas de double‑saut, mais il tombe !). OutRun s’en sort mieux que sur 3.6 : voiture, son de moteur, et même un passage en mode nuit. FF7, lui, a crashé (runtime error).

🧠

Productivité, canvas & logique

📝

Clone de MS Word

10 000 tokens (vs 14 000 pour 3.6) : menus déroulants réellement fonctionnels, changement de police opérationnel. Égalité parfaite.

🛣️

Animation canvas

48 000 tokens en mode « low » (!) et 30 min de calcul : montagnes plus douces, nuages superbes… mais la voiture roule du mauvais côté de la route et les roues traversent le châssis. 🇦

🚿

Le piège du lave‑auto

« Le lave‑auto est à 50 m : j’y vais à pied ou en voiture ? » 3.6 répondait « à pied ». 3.8, même sans réfléchir, répond « en voiture — c’est votre voiture qu’il faut laver ». Le piège viral est appris. ✔

🎵

« Bo Selecta ! »

Référence au tube garage Re‑Rewind d’Artful Dodger ft. Craig David : quand la foule crie « Bo Selecta! », il faut faire un rewind. 3.6 comprend le clin d’œil ; 3.8, même en extra high, rate le « rewind ». Dommage. 💿

🍊

8 oranges, 4 enfants, 1 couteau

Les deux modèles évitent le piège violent : « deux oranges par enfant ». En extra high, 3.8 expédie l’affaire en 500 tokens — un record absolu d’économie !

Maths niveau IMO

« Tous les entiers pairs » : bonne réponse des deux côtés. Mais 3.8 y consacre 33 000 tokens de réflexion… pour finir par se rattraper in extremis.

🛠️

Sait‑il modifier son propre code ?

Test final : demander au modèle d’ajouter un vaisseau spatial à son propre système solaire généré plus tôt.

Verdict nuagé ☁️ : sans réflexion, le modèle fait des modifications chirurgicales (un bouton « Launch ship », une nouvelle zone de dessin) sans tout réécrire — c’est prometteur — mais l’écran reste noir : le vaisseau n’apparaît pas. Il faudra un prompt de suivi… ou laisser tourner la version « extra high » (encore en cours de génération pendant le tournage !). La version avec réflexion saura‑t‑elle déboguer toute seule ? Suspense pour un prochain épisode.

⚖️

Verdict : une claque pour sa taille

👍 On adore

  • Rapport qualité/taille inédit : 27 B qui titillent des modèles 10 à 100× plus gros.
  • Vision native bluffante (photo → scène 3D animée).
  • MTP : jusqu’à 36 t/s sur Mac, 43 t/s en release.
  • Créativité 3D « niveau CGI », jeux jouables en un prompt.
  • Pièges viraux (lave‑auto, oranges) désamorcés.

👎 On regrette

  • Mode réflexion imprévisible : de 500 à 60 000+ tokens selon l’humeur.
  • Boucles de génération et Z‑fighting occasionnels.
  • Extra high = des heures sur Mac → carte NVIDIA (RTX 5090) recommandée.
  • Édition de son propre code encore fragile sans réflexion.
  • Le « rewind » de Bo Selecta qui manque à l’appel. 💿
« C’est un super modèle. Dites‑moi ce que vous en pensez — et si vous voulez une suite avec tous les résultats extra high ! »— conclusion de xCreate
🔍

Retranscription vérifiée & corrigée

La transcription automatique a écorché plusieurs noms et termes techniques. Voici les corrections apportées dans cet article, après vérification.

Dans la transcriptionCorrectionExplication
« Quen / Quinn / Qwen 3.827B »Qwen 3.8 27BModèle dense open‑weights d’Alibaba, nativement multimodal (vision/vidéo).
« animated freely box version »Three.jsBibliothèque JavaScript 3D utilisée pour les scènes animées.
« Zed fighting »Z‑fightingArtefact 3D : deux surfaces qui se superposent en scintillant.
« MTPing / MTP layers »MTP (Multi‑Token Prediction)Couches de prédiction multi‑tokens accélérant l’inférence — bien présentes sur la fiche officielle du modèle.
« B selector »« Bo Selecta »Référence au titre Re‑Rewind (The Crowd Say Bo Selecta) d’Artful Dodger ft. Craig David : la foule crie « Bo Selecta! » → on fait un rewind.
« Kimmy K3 / K3 »Kimi K3Modèle phare de Moonshot AI, 2,8 trillions de paramètres (MoE).
« Deep Seat Pro »DeepSeek (Pro)Cité parmi les prochains tests du testeur.
« Muse Glimmer »Muse GlimmerLe terme existe bien : modèle ouvert de 30 B de Meta, orienté agents locaux.
« Panuki / Pukio / Pukiu news »Jeu de mot oralExpression humoristique estropiée par la transcription automatique, impossible à restituer avec certitude ; le sens général (un visage humain « en fibres » très étrange) a été conservé.
« SWE Bench Pro 61,7 / GLM 5.2 = 62,1 / Max 2,4 T »ConfirméChiffres cohérents avec les fiches modèles et benchmarks publiés (GLM‑5.2 : 62,1 ; Qwen3.8‑Max : 2,4 T de paramètres).
🎬

Regardez la vidéo originale

Cliquez sur la miniature pour ouvrir la vidéo, ou sur un chapitre pour sauter directement au moment voulu.

Article rédigé à partir de la retranscription de la vidéo « Qwen 3.8 27B xHigh Local AI – 1 MILLION TOKEN REVIEW » de la chaîne xCreate.
Blog indépendant, non affilié. Modèles cités : Qwen (Alibaba), GLM (Zhipu), Kimi (Moonshot), Muse Glimmer (Meta).
📅 Publié le dimanche 16 août 2026 · Fait avec ☕ et ~33 000 tokens de réflexion (mais on a évité le mode extra high).

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *

Retour en haut