GLM 5.3 : le meilleur modèle ouvert jamais publié ? | Le Blog IA
🤖 Test de modèle IA · 16 août 2026 · ☕ ~8 min de lecture

GLM 5.3 est arrivé : le meilleur modèle ouvert jamais publié ?

Un modèle ouvert de ~753 milliards de paramètres qui boxe dans la catégorie des géants fermés, un OS entier généré dans un navigateur, un jeu de catch des années 80, un moteur 6 cylindres modélisé en 3D… et même un iPod nano transformé en cobaye de rétro-ingénierie. On vous raconte le test marathon de Bijan Bowen, sans jargon et avec le sourire. 😄

🎥 D’après la vidéo de Bijan Bowen · 🔗 youtu.be/3TeW8L9wy-Y

GLM 5.3 en bref

Deuxième gros modèle ouvert publié ce jour-là, et pas des moindres.

🧠

~753 MdS de paramètres

Architecture « Mixture of Experts » avec ±40 MdS actifs par token. Gros, mais bien plus léger que ses rivaux.

🚀

Simple post-training

Z.ai n’a fait que mettre à l’échelle le post-entraînement de GLM-5.2… et le bond de capacité est bien réel.

🥊

Niveau « frontier »

Des benchmarks comparables aux meilleurs modèles fermés, et un score coding qui taquine DeepSeek-V4-Pro.

🔐

Cyber-capacités émergentes

Entraîné à la découverte de vulnérabilités, il enchaîne désormais des exploits multi-étapes en plans cohérents.

📉

Plus concis

Moins de tokens générés par tâche que GLM-5.2, même au niveau de raisonnement maximal.

Poids « bientôt » ouverts

Lien Hugging Face « coming soon » : publication dans quelques semaines, après préparation sécurité. Et non, on ne peut plus désactiver le « thinking ».

⚖️David contre les Goliath

Le vrai exploit : rivaliser avec des modèles 2 à 4 fois plus gros. (MdS = milliards de paramètres)

Kimi K3 Moonshot AI
2 800 MdS
Qwen3.8-Max Alibaba
2 400 MdS
DeepSeek-V4-Pro DeepSeek
1 600 MdS
GLM-5.3 Z.ai ⭐
±753 MdS

Autant dire qu’un modèle « sous le trillion » qui échange des coups à ce niveau, c’est un peu le Saint Graal de l’open source. 🏆 Encore trop gros pour tourner localement chez 99,9 % d’entre nous, même quantisé, mais le ratio performance/empreinte est impressionnant.

🛠️Le setup de test

  • 💳 GLM Coding Plan payé de sa poche : 65 $/mois (usage « 5× »), avec boost de quota ×1,5 jusqu’au 31 août pour le lancement.
  • 🖥️ ZCode, l’application de coding officielle de Z.ai (très semblable à Codex d’OpenAI) — déjà adorée lors du test de GLM-5.2.
  • 🧮 Tous les tests lancés en mode raisonnement maximal (« max thinking »).
  • 👀 Pas de vision native : le modèle compense avec des scripts de vérification maison et l’outil image intégré à ZCode. Un contournement malin !

🏃Le marathon des 7 tests

Du très bon, du décevant, du bizarre : tout y passe.

🖥️

1. Un OS complet dans le navigateur (v2.7)

⏱ 40 min 48 s✅ Bluffant

Un « ordinateur dans l’onglet » : fichiers unique, zéro dépendance, fenêtres minimisables, plein écran, clic droit, effets sonores et fonds d’écran procéduraux animés (Warp Starfield, Liquid Light, Neon Horizon, Aurora Flow…). Le tout avec un vrai client mail qui notifie l’arrivée de… nouveaux mails de maman. 😂

  • Omni City : clone de GTA avec police, étoiles de recherche, amendes et minimap.
  • Void Runner : shoot d’astéroïdes fluide, pilotable au clavier et au curseur.
  • Bloc-notes + synthé : fréquences affichées, octaves (Z/X), formes d’onde square/sawtooth/triangle, delay réglable.
  • Fonction spéciale : journalisation inter-apps sauvegardée dans le système de fichiers virtuel (ex. envoyer son score GTA par mail).
🛹

2. Simulateur de skate C++ (New York, début 2000)

⏱ 38 min 48 s❌ Décevant

Verdict sans appel : « carrément mauvais ». Les tricks fonctionnent (board indépendant du joueur, grind sur la fontaine, piétons, voitures), mais le résultat est très loin du niveau attendu d’un tel modèle — un Qwen3.8-27B avait fait mieux. 😬

  • Le rebond qui fâche : sommée de « tout refaire en haute qualité », l’IA rend une v2 avec de meilleures textures de rue… mais un gameplay totalement cassé (impossible de bouger). Autant dire pire. 🙃
🤼

3. Jeu de catch 3D années 80 — « Mega Slam 86 »

🆕 Nouveau prompt😅 80 % là…

Nouveau test inédit (donc absent des données d’entraînement) : un jeu de catch 80s niveau « indie haut de gamme ». Résultat : écran-titre avec orbite 3D du ring, musique procédurale, catcheurs aux noms savoureux (Buck « The Hammer » Hansen, LT Gray, Rocko Rebel, The Tiger Torpedo), foule avec pancartes…

  • 🔦 Éclairage complètement cramé au départ → corrigé en un seul prompt (« baisse le bloom et l’exposition »).
  • 🙃 Mais l’orientation des catcheurs est cassée : projections à travers les tables illisibles, gameplay gâché. « 80 % présents, 20 % manquants. »
  • 📉 Au passage : énormément d’erreurs réseau du service pendant la génération. Frustrant.
⚙️

4. Moteur 3D imprimable : le 6 cylindres RB26

⏱ ±33 min✅ Impressionnant

Modélisation OpenSCAD du légendaire 6 cylindres en ligne RB26 (celui de la Skyline GT-R 🏁), exportable pièce par pièce en STL. Turbos soignés, texte extrudé proprement, poulies et courroies crédibles.

  • 🧐 Le modèle a auto-analysé l’imprimabilité : repéré les pièces flottantes, les ergots sous le plateau, les ponts trop larges… et corrigé ses propres erreurs.
  • 💬 Petit bémol : turbos orientés à plat plutôt que verticalement. Mais au rendu final : « résultat vraiment stellaire. »

5. Site vitrine de montre — « Riviera Solstice »

🎨 Front-end + 3D✅ Matériaux superbes

Une montre 3D rendue en direct dans le navigateur avec effet caméra cinématique. Le dos de boîte brossé avec texte gravé ? Du jamais vu dans ce test. Réflexions façon KeyShot, cadran texturé, couronne réussie.

  • 🤨 Mais : bracelet orienté bizarrement, caméra capricieuse… et une montre à quatre aiguilles. Qui a dit que le temps file ? ⏰
🍕

6. Street Yeet avec cutscene cinématique

⏱ ±40 min😐 Sous les attentes

Intro cinématique avec voix générées via l’API OpenAI (la dernière part de pizza volée, le drame absolu 🍕), puis le jeu de « yeet » de piétons. Les projections orbitales sont là, mais la ville est statique, les piétons immobiles.

  • « On dirait qu’il en fait le moins possible. » Un Qwen-27B faisait jeu égal, voire mieux. Aïe.
🚇

7. FPS dans le métro

⏱ 22 min 30 s✅ Compétent

Ambiance creepy à souhait, bon modèle d’arme, rechargement, course, impacts de balles qui trouent le décor, slider de luminosité poussé à 220 %.

  • 🥤 « Les meilleurs distributeurs automatiques jamais vus dans ce test. »
  • 🐀 Bonus inédits : un rat de métro et des taches persistantes entre les manches. Charmant.

🎧Le test ultime : l’iPod nano jaune

Objectif : faire afficher à un baladeur de 2008 le taux d’utilisation GPU du PC. Sans aucune modification matérielle. Oui, oui.

Cru 5 génération, prouvé 4 génération (nom de code N58). Des heures de travail, deux plafonds de 5 h du Coding Plan explosés, ±20 redémarrages électriques… et une véritable archéologie de firmware :

  • 📦 Bundle firmware N58 téléchargé depuis le CDN d’Apple, déchiffré et disséqué.
  • 🧬 Payload ARM v6 Thumb indépendant en position, écrit from scratch, emballé en PE32 construit à la main et injecté dans des volumes firmware Apple via un outillage Go maison.
  • 🔋 Buffer DFU plafonnant à ~152 Ko (uploads qui meurent au chunk 149), batterie totalement morte, ordre de dispatch EFI positionnel…
  • 🧱 Bloqueur final : le noyau DXE ne lance que des sections compressées en LZMA… et les réglages exacts de l’encodeur LZMA d’Apple restent non rétro-ingénierés.

Pas de résultat fonctionnel (même GPT-5.6 en mode Ultra avait échoué sur un défi similaire), mais un debrief auto-généré façon « document technique interne Apple » avec maquette 3D de l’iPod. Élégant jusqu’au bout. 🍏

Verdict final

🌟

Excellent

Raisonnement profond, rétro-ingénierie, CAO 3D, auto-débogage, OS navigateur très complet.

Inégal

Jeux 3D / Three.js souvent « effort minimal », très en dessous des benchmarks promis. Le skate C++ a même empiré au 2ᵉ essai.

🤔

À suivre

Écart notable entre benchmarks (niveau Kimi K3) et ressenti réel — le tout en max thinking, donc pas un problème de réglage. La communauté tranchera !

📝Notes sur la transcription

La retranscription audio a été vérifiée et corrigée. Principales rectifications appliquées dans cet article :

Voir le détail des corrections ✔️
  • « Kimmy K3 » → Kimi K3 (Moonshot AI, 2 800 MdS de paramètres).
  • « Quen 3.8 Max / 3.8 27B / 3.6 27B » → Qwen3.8-Max (2 400 MdS) et Qwen3.8 / 3.6 (27B) (Alibaba).
  • « Deepseek V4 Pro0813 » → DeepSeek-V4-Pro (1 600 MdS, 49 MdS actifs), suffixe 0813 = mise à jour du 13/08.
  • « Zcode » → ZCode, le harness officiel de Z.ai pour GLM-5.3.
  • « Street Eat » → Street Yeet, nom du test récurrent de la chaîne.
  • « subway red » → un rat de métro (confirmé plus loin dans la transcription).
  • « N58 » ✔️ : c’est bien le nom de code interne de l’iPod nano 4ᵉ génération (2008).
  • Chiffres confirmés : GLM-5.3 ≈ 753 MdS (MoE, ±40 MdS actifs) ; capacités cyber émergentes annoncées officiellement par Z.ai ; GLM Coding Plan avec limites 5 h / hebdo et boost ×1,5 jusqu’au 31 août.

🎬La vidéo originale & son sommaire cliquable

Cliquez sur la miniature pour regarder, ou sur un chapitre pour sauter directement au bon moment. ⏩

Article rédigé à partir de la vidéo de Bijan Bowen · Fait avec ❤️ et un peu de café · 16 août 2026

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *

Retour en haut