🤖 Intelligence artificielle 💻 Codage & Agents

Gemini 3.7 Flash : le petit prix qui fait mal aux gros modèles

📅 14 août 2026 · ⏱️ Lecture ~9 min · Source : chaîne YouTube Meydeey | Automatisation IA

Trois semaines seulement après Gemini 3.6 Flash, Google remet ça avec la 3.7 : deux fois moins chère, plus douée en code, et testée en direct sur une vingtaine d’interfaces par Meydeey — avant un passage obligé par la case sécurité et biais, qui réserve quelques surprises.

Le rythme de sortie des modèles Google devient difficile à suivre : à peine trois semaines après Gemini 3.6 Flash, voici Gemini 3.7 Flash, sorti le 13 août 2026. Google le présente comme son meilleur modèle « workhorse » à ce jour pour le codage et les agents, avec des améliorations substantielles sur les workflows d’ingénierie logicielle, de travail intellectuel et de développement web — le tout à un prix de lancement divisé par deux par rapport à la version précédente.

Plutôt que de se contenter des chiffres marketing, Meydeey (chaîne Automatisation IA) a soumis le modèle à une vingtaine de générations d’interfaces en direct, puis à deux batteries de tests bien plus sérieuses : sécurité du développement et détection de biais discriminatoires. Ce sont ces résultats — croisés avec les données officielles publiées par Google DeepMind — que cet article résume.

📊Les chiffres clés du lancement

13 aoûtDate de sortie 2026
3 semainesDepuis Gemini 3.6 Flash
-50%Prix vs 3.6 Flash (promo)
1MTokens de contexte

Le modèle accepte texte, images, audio et vidéo en entrée (jusqu’à 1 million de tokens) et répond en texte sur jusqu’à 64K tokens. Il est disponible dès le lancement dans l’API Gemini, Google AI Studio, Antigravity, Vertex AI, Google Cloud Console et Gemini Enterprise — donc quasiment partout où on utilise déjà un modèle Google.

🚀Les benchmarks officiels : 3.7 vs 3.6 Flash

Sur le papier, les gains sont significatifs pour un intervalle de seulement trois semaines entre les deux versions. Meydeey le souligne d’emblée dans sa vidéo : « il a pris 10 points sur la production de code de qualité » et « presque 20 points » sur la résolution de bugs — des chiffres qui collent aux données publiées par Google.

FrontierCode 1.1 Main (qualité du code)3.6 Flash 34,4% → 3.7 Flash 43,6%
DeepSWE v1.1 (debug & résolution de bugs)3.6 Flash 49,0% → 3.7 Flash 65,3%
GDP.pdf (compréhension de documents complexes)3.6 Flash 22,0% → 3.7 Flash 34,0%
AutomationBench (automatisation d’entreprise)3.6 Flash 17,0% → 3.7 Flash 30,4%

Scores communiqués par Google au lancement (13 août 2026) — à considérer comme indicatifs en attendant une vérification indépendante.

Face à la concurrence sur le développement web

Sur le classement WebDev Arena, Gemini 3.7 Flash dépasse non seulement son prédécesseur, mais aussi Claude Sonnet 5 et GPT-5.6 Terra :

Nouveau
Gemini 3.7 Flash
1588
Elo WebDev Arena
Prédécesseur
Gemini 3.6 Flash
1538
Elo WebDev Arena
Concurrent
Claude Sonnet 5
1541
Elo WebDev Arena
Concurrent
GPT-5.6 Terra
1523
Elo WebDev Arena

Un score honorable sur un modèle « Flash », positionné comme le petit frère économique de la gamme et non comme le porte-étendard de Google. Sur d’autres bancs d’essai plus orientés terminal et agents (Terminal-bench 2.1 notamment), GPT-5.6 Terra garde une légère avance — Gemini 3.7 Flash n’écrase pas tout, mais tient très bien la comparaison pour son positionnement tarifaire.

🛠️Le vrai test : une vingtaine d’interfaces générées en direct

Les benchmarks théoriques, c’est bien, mais Meydeey préfère mettre le modèle à l’épreuve sur des cas concrets — et parfois volontairement absurdes, histoire de le pousser dans ses retranchements. Voici les moments les plus révélateurs de la session.

Bâtisseur de cubes 3D

Placement, rotation, suppression au clic droit, gomme fonctionnelle : la perspective 3D tient bien la route dès le premier essai.

✅ Réussi

Application « annulation définitive » brutaliste

Un test volontairement absurde pour évaluer la logique pure : lancement, préparation, succès… le journal d’état fonctionne mais reste peu compréhensible dans l’usage.

😐 Moyen

Catalogue d’archives de constellations

Édition de fiches, changement de couleurs, sauvegarde ou abandon des modifications : tout répond correctement, sans fioriture particulière.

✅ Réussi

Fascicule trimestriel — test du responsive

Mise en page à trois colonnes avec plusieurs polices de tailles différentes : bien agencée sur desktop et sur mobile, ce qui n’est pas le cas le plus simple à réussir.

✅ Réussi

Survol de relief généré (terrain 3D)

Altitude ajustable, changement de couleurs, affichage des FPS en temps réel. Un exercice sur lequel d’autres modèles récents avaient déçu — ici, net progrès.

✅ Très bon

Clinique vétérinaire, style fanzine photocopié

Effet « scotch » et papier découpé, pas évident à reproduire visuellement. Tarifs, prise de rendez-vous, système de filtrage : le modèle s’en sort plutôt bien sur un style graphique inhabituel.

✅ Réussi

Bibliothèque de prompts, terminal rétro

Ambiance « Matrix », couleurs personnalisables (rare sur ce type d’interface), système de filtres qui fonctionne. En revanche la suppression d’éléments et l’édition du prompt final restent buggées.

🐛 Bug identifié

Composeur de miniatures / carte de visite (SVG)

Texte déplaçable, contours colorés, inclinaison, échelle, ajout de titres et de coins : une interface d’édition graphique étonnamment complète et fluide.

✅ Très bon

Atelier de dessin (canvas)

Gomme, palette de couleurs, opacité, annuler/effacer : cohérent de bout en bout. L’export PNG échoue, mais uniquement à cause des limites du bac à sable de démonstration.

✅ Réussi

Explication d’API en style film noir

Un détective qui interroge « la centrale » pour illustrer une requête GET, puis POST pour publier des données : la pédagogie fonctionne, la lisibilité globale est perfectible mais l’ambiance graphique est réussie.

✅ Créatif

Dashboard style aquarelle « papier déchiré »

Un rendu peu commun (blocs texturés façon pages froissées) plutôt bien exécuté sur desktop et tablette — la barre de filtres, en revanche, casse en mobile.

😐 Responsive à revoir

Démineur en pâte à modeler + calculateur de runway

Le démineur fonctionne (avec un style visuel très chargé). Plus intéressant : un calculateur de runway financier avec scénarios pessimiste/optimiste en plus du calcul de référence — une fonctionnalité que Meydeey dit ne pas avoir vue ailleurs, y compris avec Claude Code ou Codex.

✅ Utile

Site de déménageur, style Y2K

Un camion animé qui suit le sens du scroll (gauche/droite), un estimateur de volume interactif pour cartons et m² additionnels. Esthétique décalée, mais bien pensée.

✅ Original

Calculatrice avec historique

Le grand classique de fin de test : opérations en chaîne, historique conservé. Fonctionne sans accroc.

✅ Réussi

Le constat général de Meydeey : le modèle est étonnamment polyvalent d’un style à l’autre — du film noir à l’agence spatiale en passant par l’aquarelle déstructurée — et il estime que Gemini 3.7 Flash est actuellement sous-estimé, avec un potentiel pour remplacer Gemini 3.1 Pro en attendant la prochaine génération « Pro » de Google.

// Extrait de la démo « film noir » : le détective interroge la centrale
GET /dossier/{id} → 200 OK (information récupérée)
POST /dossier → création d’une nouvelle entrée dans le système

💸 Le prix, et le piège à connaître

Jusqu’au 31 décembre 2026, Gemini 3.7 Flash coûte 0,75 $ par million de tokens en entrée et 3,75 $ en sortie — soit la moitié du tarif de Gemini 3.6 Flash. Ce prix est un tarif de lancement promotionnel, pas un tarif définitif : à partir du 1er janvier 2027, il remonte à 1,50 $ / 7,50 $, soit exactement le tarif que payait déjà Gemini 3.6 Flash. Autrement dit, à long terme vous obtenez un modèle meilleur pour le même prix, avec une fenêtre à moitié prix bien réelle jusqu’à fin 2026.

Un mode batch est également disponible pour l’envoi de lots de requêtes en volume, à un tarif encore réduit — pratique pour les traitements massifs qui n’ont pas besoin d’une réponse immédiate.

🛡️Sécurité et biais : deux visages du même modèle

C’est la partie la plus intéressante de la vidéo, et la moins « marketing ». Meydeey a soumis Gemini 3.7 Flash à deux batteries de tests indépendantes, construites à partir de travaux de recherche (type Arxiv) sur le racisme, la discrimination et les demandes potentiellement nuisibles.

Premier test : Dev Safety Census

15
Décisions correctes
14 / 1
Paires cohérentes / échec
0 fuite
Aucune fuite exploitable
12 / 0 / 8
Demandes légitimes traitées / échecs / manquantes
5
Échecs sur « alternative surproposée »

Sur ce premier test, les demandes clairement nuisibles sont bien refusées. Le point faible se situe ailleurs : sur plusieurs scénarios, le modèle a « dérivé » — au lieu de traiter la demande A ou de refuser explicitement, il part sur autre chose, ou ne répond pas du tout. Les catégories où des échecs ont été relevés :

Hiérarchies entre groupes Hostilité religieuse Violence ciblée maquillée (3 échecs / 4) Pseudo-science discriminatoire maquillée Détection de propagande Décision de crédit discriminatoire

« Ce n’est pas fameux-fameux, ce n’est pas l’objectif qu’il soit bon partout — ça n’existe pas pour l’instant. » — Meydeey

Second test : détection pure des biais discriminatoires

Sur une seconde batterie, cette fois focalisée exclusivement sur la discrimination (dont certains items déjà ratés au premier passage, comme l’hostilité religieuse) : zéro échec, zéro manquant. Un résultat parfait, en contradiction directe avec le test précédent sur les mêmes thématiques.

La leçon que Meydeey en tire est plus importante que le score lui-même : les modèles ne sont pas déterministes. Une même requête peut donner un résultat correct neuf fois… et échouer la dixième. D’où l’intérêt, selon lui, de na pas se reposer sur un seul modèle ni sur un seul fournisseur, mais de croiser plusieurs LLM et plusieurs origines géographiques (« multiterritorialité ») plutôt que de tout miser sur des agents uniquement américains ou uniquement chinois.

Côté officiel, le model card de Google DeepMind confirme que Gemini 3.7 Flash performe globalement comme Gemini 3.6 Flash sur la sécurité et le ton, avec un taux de refus injustifiés faible, et qu’il n’atteint aucun niveau de capacité critique (« CCL ») au sens du Frontier Safety Framework. Le modèle embarque des garde-fous renforcés sur les domaines chimique, biologique, radiologique, nucléaire (CBRN) et la cyberoffensive.

🎯Le verdict

Gemini 3.7 Flash confirme la stratégie de Google en 2026 : itérer vite, casser les prix, et gagner le marché du milieu plutôt que de ne viser que le haut du panier. Trois semaines pour un tel saut de performance, obtenu par des améliorations algorithmiques plutôt que par un modèle plus gros, c’est un rythme qui met la pression sur toute l’industrie — d’autant que les rumeurs évoquent un Gemini 3.5 Pro repoussé au profit d’un futur Gemini 4.

  • Pour le développement web et les agents à petit budget : un excellent rapport qualité-prix, surtout pendant la fenêtre à moitié prix jusqu’à fin 2026.
  • Pour les usages sensibles (RH, crédit, modération) : les résultats contrastés sur les tests de biais rappellent qu’aucun modèle ne doit être utilisé seul et sans supervision sur ce type de décision.
  • Pour un besoin de raisonnement de pointe : Flash reste la gamme « valeur », pas la gamme frontière — il faut regarder plus haut dans la famille Gemini.

🔗Sources

▶️Regarder la vidéo source

Gemini 3.7 Flash est sorti (bon et 2x moins cher) - Meydeey

Meydeey | Automatisation IA — « Gemini 3.7 Flash est sorti (bon et 2x moins cher) »

🧭 Ce que couvre la vidéo

Les liens ci-dessus renvoient vers la section correspondante de cet article — l’ordre suit celui de la vidéo.

1 réflexion sur “Gemini 3.7 Flash : le petit prix qui fait mal aux gros modèles”

  1. Bài viết rất hữu ích, cảm ơn đã chia sẻ! Letco là công ty tư vấn du học Hàn Quốc uy tín, hỗ trợ trọn gói từ hồ sơ, visa đến học bổng. Tham khảo thêm tại letco.vn nhé.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *

Retour en haut