Qwen 3.8 27B : le « petit » modèle qui joue dans la cour des grands
Vision native, modes de réflexion low / medium / extra high, couches MTP, système solaire 3D, GTA dans le navigateur… Nous avons passé au crible la vidéo‑test de la chaîne xCreate, réalisée sur un Mac Studio M3 Ultra 512 Go. Résumé complet, vérifié et illustré.
L’essentiel en 4 cartes
Avant de plonger dans les tests, voici ce qu’il faut retenir de ce marathon d’environ douze heures de générations cumulées.
SWE‑Bench Pro
Un score à un cheveu de GLM‑5.2 (62,1)… avec un modèle dense de 27 B seulement. Du jamais vu pour cette taille.
Vision native
Le modèle comprend réellement les pixels : il décrit une photo, puis la transforme en scène 3D animée en Three.js.
MTP = vitesse
Les couches Multi‑Token Prediction font presque doubler le débit : de ~19 à plus de 36 tokens/s sur M3 Ultra.
Appétit de tokens
Le mode « extra high » peut engloutir de 20 000 à 60 000+ tokens de réflexion pour une seule génération. Spectaculaire… mais lent.
Qwen 3.8 27B, c’est quoi ?
Un modèle dense, open‑weights, nativement multimodal, avec fenêtre de contexte 262 K extensible à 1 M et couches MTP intégrées. La famille comprend aussi un mastodonte « Max » de 2,4 trillions de paramètres (~5 To à télécharger !).
SWE‑Bench Pro : 61,7
Devant GLM‑5.1 (58,4), talonnant GLM‑5.2 (62,1). Pour rappel, Qwen3.8‑Max plafonne à 67 avec 90 fois plus de paramètres.
Deep SWE : 42
Un peu en retrait face au Max (56), mais bluffant pour un modèle qui tient dans la mémoire d’un Mac.
2,4 T de paramètres
La version Max existe (≈ 5 To). Notre testeur plaisante : « envoyez‑moi des disques durs ! » 😅
262 K → 1 M tokens
De quoi voir venir, d’autant que le titre de la vidéo promet ~1 million de tokens générés pendant les tests.
« C’est un tout petit modèle… enfin, il est gros, mais minuscule comparé aux modèles de 2,8 trillions de paramètres d’aujourd’hui. »— xCreate, en comparant le 27 B au Kimi K3 (2,8 T)
Vitesse & MTP : le turbo intégré
Mesures sur Mac Studio M3 Ultra (app Inferencer, version debug donc légèrement pessimiste). Le MTP = Multi‑Token Prediction : des couches additionnelles qui prédisent plusieurs tokens d’un coup, façon décoding spéculatif.
💡 Le MTP Q4 (le plus léger) est aussi le plus rapide : plus le brouillon est petit, moins il coûte cher. Sur un RTX 5090, comptez encore ~10 t/s de mieux selon le testeur.
Vision & générations créatives
Le cœur du show : transformer des images et des prompts en scènes 3D animées, dans tous les modes de réflexion.
Le chat roux
« Un chat tigré roux » : identification parfaite, à égalité avec Qwen 3.6. Petit détail piquant : des tirets cadratins « signature » qui trahissent l’IA. 😏
Chat animé en 3D
Sans réflexion (5 000 tokens) : queue animée indépendamment, oreilles qui sautillent → meilleur que 3.6. En « low » : un peu de Z‑fighting. En « extra high » (~20 000 tokens, 10 min) : yeux verts, moustaches, brume… « glorieux ».
Système solaire 3D
Le clou du spectacle : planètes cliquables, halo au survol, ~30 min de génération. « On dirait du CGI de film d’il y a 20‑30 ans. » Les versions 3.6 et Kimi K3 « pulvérisées ».
Visage humain procédural
Sans réflexion : boucle infinie. Low : erreur. Medium : 60 000 tokens pour rien. Extra high (19 000 tokens) : « probablement la plus belle tête 3D jamais générée » — un air de John Malkovich démoniaque. 👽
« Regardez ça… ça, c’est magnifique. Et à côté, l’ancienne génération ressemble à un déchet. »— à propos du système solaire Qwen 3.8 vs Qwen 3.6
Simulateurs & jeux recréés en une shot
Des recréations complètes, générées en un seul prompt HTML/JS. Pour rappel : aucun moteur de jeu, juste du code écrit par un modèle de 27 B.
Simulateur de vol zen
3.6 s’en sortait en 8 000 tokens ; 3.8 (extra high) ajoute son moteur lié à la manette des gaz, boussole et contrôles complets. Magnifique, mais 7× plus bavard.
Baliste antique
La baliste tire vraiment (…dans la mauvaise direction au début 😅). Là où 3.6 ne tirait pas du tout.
Anatomie humaine 3D
Muscles, squelette, organes, coupe du corps… mais le visage est remplacé par une boule argentée. « Ne suivez pas ses ordonnances aveuglément. » 😄
GTA 5 navigateur
Intro « Welcome to the streets », feux de circulation, véhicules à bord (touche E). « Même des modèles 3× plus gros ne font pas ça. »
Red Dead Redemption
Cutscene « L’année est 1883 », ville, PNJ, tirs qui partent vers l’avant… mais la tête du bonhomme flotte un peu, et le cheval disparaît quand on monte dessus. 🐴💨
Super Mario & OutRun
Mario saute (pas de double‑saut, mais il tombe !). OutRun s’en sort mieux que sur 3.6 : voiture, son de moteur, et même un passage en mode nuit. FF7, lui, a crashé (runtime error).
Productivité, canvas & logique
Clone de MS Word
10 000 tokens (vs 14 000 pour 3.6) : menus déroulants réellement fonctionnels, changement de police opérationnel. Égalité parfaite.
Animation canvas
48 000 tokens en mode « low » (!) et 30 min de calcul : montagnes plus douces, nuages superbes… mais la voiture roule du mauvais côté de la route et les roues traversent le châssis. 🇦
Le piège du lave‑auto
« Le lave‑auto est à 50 m : j’y vais à pied ou en voiture ? » 3.6 répondait « à pied ». 3.8, même sans réfléchir, répond « en voiture — c’est votre voiture qu’il faut laver ». Le piège viral est appris. ✔
« Bo Selecta ! »
Référence au tube garage Re‑Rewind d’Artful Dodger ft. Craig David : quand la foule crie « Bo Selecta! », il faut faire un rewind. 3.6 comprend le clin d’œil ; 3.8, même en extra high, rate le « rewind ». Dommage. 💿
8 oranges, 4 enfants, 1 couteau
Les deux modèles évitent le piège violent : « deux oranges par enfant ». En extra high, 3.8 expédie l’affaire en 500 tokens — un record absolu d’économie !
Maths niveau IMO
« Tous les entiers pairs » : bonne réponse des deux côtés. Mais 3.8 y consacre 33 000 tokens de réflexion… pour finir par se rattraper in extremis.
Sait‑il modifier son propre code ?
Test final : demander au modèle d’ajouter un vaisseau spatial à son propre système solaire généré plus tôt.
Verdict nuagé ☁️ : sans réflexion, le modèle fait des modifications chirurgicales (un bouton « Launch ship », une nouvelle zone de dessin) sans tout réécrire — c’est prometteur — mais l’écran reste noir : le vaisseau n’apparaît pas. Il faudra un prompt de suivi… ou laisser tourner la version « extra high » (encore en cours de génération pendant le tournage !). La version avec réflexion saura‑t‑elle déboguer toute seule ? Suspense pour un prochain épisode.
Verdict : une claque pour sa taille
👍 On adore
- Rapport qualité/taille inédit : 27 B qui titillent des modèles 10 à 100× plus gros.
- Vision native bluffante (photo → scène 3D animée).
- MTP : jusqu’à 36 t/s sur Mac, 43 t/s en release.
- Créativité 3D « niveau CGI », jeux jouables en un prompt.
- Pièges viraux (lave‑auto, oranges) désamorcés.
👎 On regrette
- Mode réflexion imprévisible : de 500 à 60 000+ tokens selon l’humeur.
- Boucles de génération et Z‑fighting occasionnels.
- Extra high = des heures sur Mac → carte NVIDIA (RTX 5090) recommandée.
- Édition de son propre code encore fragile sans réflexion.
- Le « rewind » de Bo Selecta qui manque à l’appel. 💿
« C’est un super modèle. Dites‑moi ce que vous en pensez — et si vous voulez une suite avec tous les résultats extra high ! »— conclusion de xCreate
Retranscription vérifiée & corrigée
La transcription automatique a écorché plusieurs noms et termes techniques. Voici les corrections apportées dans cet article, après vérification.
| Dans la transcription | Correction | Explication |
|---|---|---|
| « Quen / Quinn / Qwen 3.827B » | Qwen 3.8 27B | Modèle dense open‑weights d’Alibaba, nativement multimodal (vision/vidéo). |
| « animated freely box version » | Three.js | Bibliothèque JavaScript 3D utilisée pour les scènes animées. |
| « Zed fighting » | Z‑fighting | Artefact 3D : deux surfaces qui se superposent en scintillant. |
| « MTPing / MTP layers » | MTP (Multi‑Token Prediction) ✔ | Couches de prédiction multi‑tokens accélérant l’inférence — bien présentes sur la fiche officielle du modèle. |
| « B selector » | « Bo Selecta » | Référence au titre Re‑Rewind (The Crowd Say Bo Selecta) d’Artful Dodger ft. Craig David : la foule crie « Bo Selecta! » → on fait un rewind. |
| « Kimmy K3 / K3 » | Kimi K3 ✔ | Modèle phare de Moonshot AI, 2,8 trillions de paramètres (MoE). |
| « Deep Seat Pro » | DeepSeek (Pro) | Cité parmi les prochains tests du testeur. |
| « Muse Glimmer » | Muse Glimmer ✔ | Le terme existe bien : modèle ouvert de 30 B de Meta, orienté agents locaux. |
| « Panuki / Pukio / Pukiu news » | Jeu de mot oral | Expression humoristique estropiée par la transcription automatique, impossible à restituer avec certitude ; le sens général (un visage humain « en fibres » très étrange) a été conservé. |
| « SWE Bench Pro 61,7 / GLM 5.2 = 62,1 / Max 2,4 T » | Confirmé ✔ | Chiffres cohérents avec les fiches modèles et benchmarks publiés (GLM‑5.2 : 62,1 ; Qwen3.8‑Max : 2,4 T de paramètres). |
Regardez la vidéo originale
Cliquez sur la miniature pour ouvrir la vidéo, ou sur un chapitre pour sauter directement au moment voulu.
▶
31:21
Qwen 3.8 27B xHigh Local AI – 1 MILLION TOKEN REVIEW 🧐 · xCreate
Sommaire cliquable de la vidéo :
⏱️ Horodatage approximatif reconstitué à partir de la retranscription (la vidéo ne comporte pas de chapitres officiels).
