Grok 4.6 vient de sortir :
le modèle le plus RENTABLE du monde ?
Décryptage convivial de la vidéo de Melvynx : benchmarks vérifiés, prix imbattable, tests réels dans Cursor (Car Crash, Gmail clone, Simulation Life…) et verdict sans langue de bois. Spoiler : il n’est pas magique, mais il est rapide, cheap… et il fait exactement ce qu’on lui dit.
⚡ TL;DR — l’essentiel en 4 points
- 🚀 Grok 4.6 (xAI/SpaceXAI) débarque dans Cursor et l’API le 12 août 2026 : 2 $/6 $ par million de tokens, usage doublé dans Cursor la première semaine.
- 📈 Scores frontier : 61 à l’AA Intelligence Index, à égalité avec GPT‑5.6 Sol, juste derrière Fable 5 Max (62).
- 💸 Jusqu’à 5× moins cher en input et ~8× en output que Fable 5, pour un niveau quasi équivalent.
- 🧠 Pas magique pour autant : créativité et grosse architecture restent l’apanage de Opus et Sol. Mais sa vitesse change tout.
Sommaire de l’article
C’est quoi, Grok 4.6 ?
Après un Grok 4.5 qui avait déjà redonné de l’espoir à Melvynx quant à la course à l’IA, xAI (SpaceXAI) a remis le couvert le 12 août 2026 avec Grok 4.6. La promesse officielle : un modèle bâti sur 4.5, mais avec plus d’ambition sur l’interactif, le visuel et les agents longs — ces tâches qui durent, qui enchaînent les étapes et qui transforment une simple idée en application fonctionnelle.
Disponibilité immédiate dans Cursor et Grok Build (avec 2× plus d’usage inclus la première semaine), ainsi que sur l’API et chez des partenaires comme OpenRouter, Vercel ou Cloudflare. Et comme le modèle est hébergé sur les serveurs de SpaceXAI, « ils ont beaucoup de serveurs, et ça ne coûte pas très cher » — l’argument rentabilité est lancé. 🏟️
Blog post & scores : il se rapproche dangereusement du sommet
Le billet officiel « Introducing Grok 4.6 » montre des gains nets par rapport à Grok 4.5 : FrontierCode et CursorBench grimpent, et le modèle se rapproche dangereusement de Fable 5 (le modèle d’Anthropic que Melvynx cite sous le nom de « Fable »). Sur Terminal‑Bench, on observe même un bond d’environ +10 points par rapport à 4.5 — et on sait à quel point ce genre de progression traduit un vrai gain d’intelligence.
📊 AA Intelligence Index (score officiel publié)
🧾 Les benchmarks officiels en détail
| Benchmark | Grok 4.6 | Grok 4.5 | GPT‑5.6 Sol | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| CursorBench v3.2 | 69,9 % | 66,7 % | 67,2 % | 70,5 % |
| FrontierCode v1.1 | 61,3 % | 56,6 % | 60,6 % | 63,6 % |
| Terminal‑Bench v3.0 | 26 % | 15,7 % | 34,6 % | 34,1 % |
| GDPVal‑AA v2 (Elo) | 1753 | 1526 | 1728 | 1741 |
Le prix : 5× moins cher, l’argument massue 💸
C’est LE point qui fait briller les yeux : 2 $ par million de tokens en input, 6 $ en output — même tarif que Grok 4.5, alors que l’intelligence, elle, a grimpé. Sur OpenRouter, la comparaison pique les yeux des concurrents : Fable 5 est à 10 $ / 50 $. Autrement dit, Grok 4.6 est 5× moins cher en input et presque 8 à 10× moins cher en output. Une variante « fast » existe au double du prix.
| Modèle | Input ($/M) | Output ($/M) | Positionnement |
|---|---|---|---|
| Grok 4.6 | 2 $ | 6 $ | Le challenger rentable ⚡ |
| Claude Opus 5 | 5 $ | 25 $ | La référence créative |
| GPT‑5.6 Sol | 5 $ | 30 $ | Le roi architecte (selon Melvynx) |
| Fable 5 Max | 10 $ | 50 $ | Le plus cher du lot |
« On rentre dans l’âge où le prix de l’IA est plus important que jamais, parce que ça change tout », résume Melvynx. Un modèle pas cher qui délivre des résultats solides, c’est la possibilité d’itérer 10 fois plus pour le même budget. 🔁
Le parcours de tests dans Cursor 🧪
Place à la pratique ! Melvynx a lancé Grok 4.6 sur toute sa suite de benchmarks maison. Voici les runs montrés en vidéo (durées et coûts affichés par sa plateforme — pas des moyennes scientifiques !).
Car Crash
Le test préféré de la communauté… mais la physique reste « plus ou moins catastrophique » : la voiture se crash mais continue sa route un moment. Loin du rendu fantastique d’Opus.
Timezone Checker
Features respectées, UI minimaliste, responsive. Surtout : aucun style demandé → aucun style inventé. Il fait exactement ce qu’on lui dit, sans chercher « midi à quatorze heures ».
Simulation Life
Proies, prédateurs, courbes de population : une app riche en logique, complète et fonctionnelle, avec même un contrôle absent du run Opus comparé.
SaveIt.now landing
Restyle de sa page existante : propre mais « un peu boring », avec un look qui rappelle furieusement Shipfast (le boilerplate de Marc Lou). Correct, sans folie.
Rocket Launch
Opus produit un rendu bien plus impressionnant… mais le ratio temps/prix de Grok est indécent : 16 min et 1 $ contre 1 h 30 et 20 $. « C’est QFD. » 😂
One‑Button Boss Fight
Un mini‑jeu où il faut cliquer au bon moment. Résultat rapide et quasi gratuit, mais visuellement « slopesque » face à la tuerie créative de Fable 5.
Gmail clone
Qualité clairement inférieure au run Opus (le « reply » tousse un peu, le « forward » fonctionne), mais 5 $ contre 30 $ : le rapport résultat/coût reste impressionnant.
Kliq : exécution incroyable, créativité bof 🎨
Dernier terrain de jeu, plus personnel : Kliq, le SaaS de Melvynx. Mission 1 — reprendre des idées de la page Luma pour restyler l’interface. Résultat : des onglets overview/analytics, quelques concepts intéressants… mais des infos moins visibles et des actions disparues. Verdict net : en créativité, Opus garde l’avantage.
Mission 2 — l’exécution pure : « mets à jour toute la documentation ». Et là, c’est le feu : pages de docs complètes, tutoriels (sublinks, tags, analytics, attribution multi‑domaine, API…), captures d’écran incluses. Le tout en 24 minutes. 📚
Mission 3 — corrections en direct : hauteur automatique des champs OG (corrigé en ~1 min 30), slug « taken » à afficher en rouge, génération de slugs disponibles, tags existants à proposer… Grok comprend vite, agit vite, et reste au plus près de la demande.
Live : la vitesse change tout ⚡
Le moment le plus bluffant de la vidéo, c’est le direct : Grok 4.6 enchaîne les appels d’outils en parallèle, explore des dizaines de fichiers à la seconde, édite 18 fichiers sans respirer. Face à lui, un Opus en mode medium semble « séquentiel et paisible ». vs 🐇
Pourquoi c’est si important ? Parce qu’un modèle rapide transforme la boucle demande → test → correction en un confort quotidien. « La rapidité, ça change tout : un modèle rapide fait des choses de fou. » Même avec une fenêtre de contexte affichée à 256k dans Cursor (alors que 500k sont annoncés officiellement), le confort d’usage reste le vrai argument vente.
Avis final : rentable pour exécuter, pas (encore) architecte 👨⚖️
✅ On adore
- ⚡ Vitesse folle : tool calls parallèles, fixes en 1 min 30
- 💰 Prix plancher : 2 $/6 $ le M de tokens, runs à 1‑5 $
- 🎯 Obéissance au brief : fait ce qu’on lui dit, rien de plus
- 📚 Exécution exceptionnelle : docs, screenshots, corrections
- 📈 Scores frontier (61 AA Index = GPT‑5.6 Sol)
⚠️ On regrette
- 🎨 Créativité et finition limitées (restyle Kliq « bof », look Shipfast)
- 🚗 Physique/rendus 3D en retrait (Car Crash, Rocket Launch)
- 🐛 Quelques bugs fonctionnels (reply du Gmail clone)
- 🧠 Pas le choix n°1 pour l’architecture : Sol reste la référence de Melvynx
- 🪟 256k de contexte observés dans Cursor vs 500k annoncés
La conclusion de Melvynx : « Grok 4.6, c’est une petite amélioration par rapport à 4.5, rien de fantastique… mais ça reste très intéressant. » Un modèle parfait pour les corrections ciblées, la doc, les UI simples et tout ce qui est facile à vérifier — en gardant Sol pour l’architecture et la logique métier critique. Et de conclure, taquin : « Grok 5, ça va être quelque chose… » 👀
Fact‑check : corrections de la retranscription 🩺
La transcription audio automatique contenait quelques approximations. Voici les corrections vérifiées (sources : x.ai, Artificial Analysis, blog de Melvynx) :
- 🔧 « Grock / Grok 4 » → Grok 4.6, par xAI (SpaceXAI), sorti le 12/08/2026.
- 🔧 « Fable » → Claude Fable 5 (Anthropic), à 10 $/50 $ le M de tokens sur OpenRouter.
- 🔧 « Sol » → GPT‑5.6 Sol (OpenAI) ; « Opus 5 » → Claude Opus 5 (5 $/25 $).
- 🔧 « 10 PSWE » → Terminal‑Bench : ≈ +10 pts vs Grok 4.5 (26 % vs 15,7 % en v3.0).
- 🔧 « Chip Fast / la fonte de Marc Lou » → Shipfast, le boilerplate de Marc Lou, dont le style a « déteint » sur la landing générée.
- 🔧 « modèle à 256 tokens » → fenêtre de contexte de 256k affichée dans Cursor (500k annoncés officiellement).
- 🔧 « 5× moins cher » (output) → 5× en input, ≈ 8× en output vs Fable 5 (50 $ vs 6 $).
- 🔧 ⚠️ Les durées/coûts cités sont des runs uniques montrés en vidéo, pas des moyennes — comme le précise Melvynx lui‑même.
La vidéo originale & son sommaire cliquable
▶
26:13
Grok 4.6 vient de sortir : les modèles LE PLUS RENTABLE au monde ?
Par Melvynx · 13 août 2026 · Science & Technologie
▶ Regarder sur YouTube