GLM 5.3 est arrivé : le meilleur modèle ouvert jamais publié ?
Un modèle ouvert de ~753 milliards de paramètres qui boxe dans la catégorie des géants fermés, un OS entier généré dans un navigateur, un jeu de catch des années 80, un moteur 6 cylindres modélisé en 3D… et même un iPod nano transformé en cobaye de rétro-ingénierie. On vous raconte le test marathon de Bijan Bowen, sans jargon et avec le sourire. 😄
⚡GLM 5.3 en bref
Deuxième gros modèle ouvert publié ce jour-là, et pas des moindres.
~753 MdS de paramètres
Architecture « Mixture of Experts » avec ±40 MdS actifs par token. Gros, mais bien plus léger que ses rivaux.
Simple post-training
Z.ai n’a fait que mettre à l’échelle le post-entraînement de GLM-5.2… et le bond de capacité est bien réel.
Niveau « frontier »
Des benchmarks comparables aux meilleurs modèles fermés, et un score coding qui taquine DeepSeek-V4-Pro.
Cyber-capacités émergentes
Entraîné à la découverte de vulnérabilités, il enchaîne désormais des exploits multi-étapes en plans cohérents.
Plus concis
Moins de tokens générés par tâche que GLM-5.2, même au niveau de raisonnement maximal.
Poids « bientôt » ouverts
Lien Hugging Face « coming soon » : publication dans quelques semaines, après préparation sécurité. Et non, on ne peut plus désactiver le « thinking ».
⚖️David contre les Goliath
Le vrai exploit : rivaliser avec des modèles 2 à 4 fois plus gros. (MdS = milliards de paramètres)
Autant dire qu’un modèle « sous le trillion » qui échange des coups à ce niveau, c’est un peu le Saint Graal de l’open source. 🏆 Encore trop gros pour tourner localement chez 99,9 % d’entre nous, même quantisé, mais le ratio performance/empreinte est impressionnant.
🛠️Le setup de test
- 💳 GLM Coding Plan payé de sa poche : 65 $/mois (usage « 5× »), avec boost de quota ×1,5 jusqu’au 31 août pour le lancement.
- 🖥️ ZCode, l’application de coding officielle de Z.ai (très semblable à Codex d’OpenAI) — déjà adorée lors du test de GLM-5.2.
- 🧮 Tous les tests lancés en mode raisonnement maximal (« max thinking »).
- 👀 Pas de vision native : le modèle compense avec des scripts de vérification maison et l’outil image intégré à ZCode. Un contournement malin !
🏃Le marathon des 7 tests
Du très bon, du décevant, du bizarre : tout y passe.
1. Un OS complet dans le navigateur (v2.7)
Un « ordinateur dans l’onglet » : fichiers unique, zéro dépendance, fenêtres minimisables, plein écran, clic droit, effets sonores et fonds d’écran procéduraux animés (Warp Starfield, Liquid Light, Neon Horizon, Aurora Flow…). Le tout avec un vrai client mail qui notifie l’arrivée de… nouveaux mails de maman. 😂
- Omni City : clone de GTA avec police, étoiles de recherche, amendes et minimap.
- Void Runner : shoot d’astéroïdes fluide, pilotable au clavier et au curseur.
- Bloc-notes + synthé : fréquences affichées, octaves (Z/X), formes d’onde square/sawtooth/triangle, delay réglable.
- Fonction spéciale : journalisation inter-apps sauvegardée dans le système de fichiers virtuel (ex. envoyer son score GTA par mail).
2. Simulateur de skate C++ (New York, début 2000)
Verdict sans appel : « carrément mauvais ». Les tricks fonctionnent (board indépendant du joueur, grind sur la fontaine, piétons, voitures), mais le résultat est très loin du niveau attendu d’un tel modèle — un Qwen3.8-27B avait fait mieux. 😬
- Le rebond qui fâche : sommée de « tout refaire en haute qualité », l’IA rend une v2 avec de meilleures textures de rue… mais un gameplay totalement cassé (impossible de bouger). Autant dire pire. 🙃
3. Jeu de catch 3D années 80 — « Mega Slam 86 »
Nouveau test inédit (donc absent des données d’entraînement) : un jeu de catch 80s niveau « indie haut de gamme ». Résultat : écran-titre avec orbite 3D du ring, musique procédurale, catcheurs aux noms savoureux (Buck « The Hammer » Hansen, LT Gray, Rocko Rebel, The Tiger Torpedo), foule avec pancartes…
- 🔦 Éclairage complètement cramé au départ → corrigé en un seul prompt (« baisse le bloom et l’exposition »).
- 🙃 Mais l’orientation des catcheurs est cassée : projections à travers les tables illisibles, gameplay gâché. « 80 % présents, 20 % manquants. »
- 📉 Au passage : énormément d’erreurs réseau du service pendant la génération. Frustrant.
4. Moteur 3D imprimable : le 6 cylindres RB26
Modélisation OpenSCAD du légendaire 6 cylindres en ligne RB26 (celui de la Skyline GT-R 🏁), exportable pièce par pièce en STL. Turbos soignés, texte extrudé proprement, poulies et courroies crédibles.
- 🧐 Le modèle a auto-analysé l’imprimabilité : repéré les pièces flottantes, les ergots sous le plateau, les ponts trop larges… et corrigé ses propres erreurs.
- 💬 Petit bémol : turbos orientés à plat plutôt que verticalement. Mais au rendu final : « résultat vraiment stellaire. »
5. Site vitrine de montre — « Riviera Solstice »
Une montre 3D rendue en direct dans le navigateur avec effet caméra cinématique. Le dos de boîte brossé avec texte gravé ? Du jamais vu dans ce test. Réflexions façon KeyShot, cadran texturé, couronne réussie.
- 🤨 Mais : bracelet orienté bizarrement, caméra capricieuse… et une montre à quatre aiguilles. Qui a dit que le temps file ? ⏰
6. Street Yeet avec cutscene cinématique
Intro cinématique avec voix générées via l’API OpenAI (la dernière part de pizza volée, le drame absolu 🍕), puis le jeu de « yeet » de piétons. Les projections orbitales sont là, mais la ville est statique, les piétons immobiles.
- « On dirait qu’il en fait le moins possible. » Un Qwen-27B faisait jeu égal, voire mieux. Aïe.
7. FPS dans le métro
Ambiance creepy à souhait, bon modèle d’arme, rechargement, course, impacts de balles qui trouent le décor, slider de luminosité poussé à 220 %.
- 🥤 « Les meilleurs distributeurs automatiques jamais vus dans ce test. »
- 🐀 Bonus inédits : un rat de métro et des taches persistantes entre les manches. Charmant.
🎧Le test ultime : l’iPod nano jaune
Objectif : faire afficher à un baladeur de 2008 le taux d’utilisation GPU du PC. Sans aucune modification matérielle. Oui, oui.
Cru 5 génération, prouvé 4 génération (nom de code N58). Des heures de travail, deux plafonds de 5 h du Coding Plan explosés, ±20 redémarrages électriques… et une véritable archéologie de firmware :
- 📦 Bundle firmware N58 téléchargé depuis le CDN d’Apple, déchiffré et disséqué.
- 🧬 Payload ARM v6 Thumb indépendant en position, écrit from scratch, emballé en PE32 construit à la main et injecté dans des volumes firmware Apple via un outillage Go maison.
- 🔋 Buffer DFU plafonnant à ~152 Ko (uploads qui meurent au chunk 149), batterie totalement morte, ordre de dispatch EFI positionnel…
- 🧱 Bloqueur final : le noyau DXE ne lance que des sections compressées en LZMA… et les réglages exacts de l’encodeur LZMA d’Apple restent non rétro-ingénierés.
Pas de résultat fonctionnel (même GPT-5.6 en mode Ultra avait échoué sur un défi similaire), mais un debrief auto-généré façon « document technique interne Apple » avec maquette 3D de l’iPod. Élégant jusqu’au bout. 🍏
Verdict final
Excellent
Raisonnement profond, rétro-ingénierie, CAO 3D, auto-débogage, OS navigateur très complet.
Inégal
Jeux 3D / Three.js souvent « effort minimal », très en dessous des benchmarks promis. Le skate C++ a même empiré au 2ᵉ essai.
À suivre
Écart notable entre benchmarks (niveau Kimi K3) et ressenti réel — le tout en max thinking, donc pas un problème de réglage. La communauté tranchera !
📝Notes sur la transcription
La retranscription audio a été vérifiée et corrigée. Principales rectifications appliquées dans cet article :
Voir le détail des corrections ✔️
- « Kimmy K3 » → Kimi K3 (Moonshot AI, 2 800 MdS de paramètres).
- « Quen 3.8 Max / 3.8 27B / 3.6 27B » → Qwen3.8-Max (2 400 MdS) et Qwen3.8 / 3.6 (27B) (Alibaba).
- « Deepseek V4 Pro0813 » → DeepSeek-V4-Pro (1 600 MdS, 49 MdS actifs), suffixe 0813 = mise à jour du 13/08.
- « Zcode » → ZCode, le harness officiel de Z.ai pour GLM-5.3.
- « Street Eat » → Street Yeet, nom du test récurrent de la chaîne.
- « subway red » → un rat de métro (confirmé plus loin dans la transcription).
- « N58 » ✔️ : c’est bien le nom de code interne de l’iPod nano 4ᵉ génération (2008).
- Chiffres confirmés : GLM-5.3 ≈ 753 MdS (MoE, ±40 MdS actifs) ; capacités cyber émergentes annoncées officiellement par Z.ai ; GLM Coding Plan avec limites 5 h / hebdo et boost ×1,5 jusqu’au 31 août.
🎬La vidéo originale & son sommaire cliquable
Cliquez sur la miniature pour regarder, ou sur un chapitre pour sauter directement au bon moment. ⏩
▶
GLM 5.3 Is HERE – Is THIS the BEST Open Model Yet? 42:33
par Bijan Bowen · youtu.be/3TeW8L9wy-Y
