🌙🤖

Claude Sonnet 5 : le Sonnet qui met la pression à Opus 4.8

Analyse complète (et vérifiée) de la release la plus agentique jamais sortie par Anthropic

📅 30 juin 2026 🤖 IA & Anthropic ⏱️ Lecture 8 min
Anthropic vient de sortir Claude Sonnet 5, et le détail qui rend cette release complètement folle, c’est qu’un modèle « milieu de gamme » affiche des performances à quelques points seulement d’Opus 4.8 — pour une fraction du prix. Il y a même un benchmark où Sonnet 5 dépasse carrément Opus. On décortique tout : le modèle, les benchmarks, le prix, et le volet sécurité.

🚀 Partie 1 — Le Sonnet le plus agentique jamais sorti

C’est avec les modèles Sonnet que l’ère de l’IA agentique a vraiment commencé : les versions 3.5, 3.6 puis 3.7 ont été les premières à montrer de vraies compétences en code et en utilisation d’outils. Mais depuis un moment, la vraie puissance agentique était surtout réservée aux modèles Opus. Avec Sonnet 5, Anthropic annonce recoller à l’écart : des performances proches d’Opus 4.8, à un prix nettement inférieur.

Côté specs, Sonnet 5 embarque 1 million de tokens de contexte et jusqu’à 128 000 tokens de sortie. Petite précision technique honnête : le modèle utilise un nouveau tokenizer (le même qu’Opus 4.7/4.8), ce qui signifie qu’un même texte peut désormais représenter entre 1 et 1,35 fois plus de tokens qu’avant. Bonne nouvelle : Anthropic a calibré le prix de lancement pour que le passage depuis Sonnet 4.6 reste quasiment neutre au niveau du coût.

🧠 Deux comportements qui changent tout

Ce qui ressort le plus des retours en accès anticipé, ce sont deux réflexes nouveaux chez Sonnet 5 :

Il va au bout des tâches complexes

Là où les anciens Sonnet abandonnaient en cours de route, Sonnet 5 tient la distance sur des tâches longues et multi-étapes.

Il vérifie son propre travail sans qu’on le lui demande

Un ingénieur en accès anticipé raconte avoir demandé au modèle d’investiguer un bug : sans instruction supplémentaire, Sonnet 5 a écrit un test qui reproduit le bug, implémenté le correctif, puis retiré temporairement le changement pour vérifier que le bug réapparaissait bien — le tout en une seule passe.

Un autre testeur a confié au modèle une tâche en deux temps : mettre à jour des comptes commerciaux dans un CRM, puis envoyer une annonce de lancement aux contacts clés. Résultat : la tâche a été menée de bout en bout, là où un modèle plus ancien se serait arrêté à mi-chemin. — Retour d’un partenaire en accès anticipé, rapporté par Anthropic

📊 Les benchmarks, sans filtre

Voici le tableau officiel comparant Sonnet 4.6, Sonnet 5 et Opus 4.8 (référence haut de gamme) sur les évaluations publiées par Anthropic :

💻 Codage agentique — SWE-bench Pro

Sonnet 4.658,1 %
Sonnet 563,2 %
Opus 4.869,2 %

⌨️ Terminal-Bench 2.1

Sonnet 4.667,0 %
Sonnet 580,4 %
Opus 4.882,7 %

➡️ Un bond de +13,4 points pour Sonnet 5 face à son prédécesseur, à seulement 2,3 points d’Opus 4.8.

🧩 Raisonnement multidisciplinaire — Humanity’s Last Exam (avec outils)

Sonnet 4.646,8 %
Sonnet 557,4 %
Opus 4.857,9 %

➡️ Sur le benchmark de raisonnement le plus dur qui existe, Sonnet 5 est quasiment à égalité avec Opus 4.8 (écart de 0,5 point).

🖱️ Computer use — OSWorld-Verified

Sonnet 4.678,5 %
Sonnet 581,2 %
Opus 4.883,4 %

🏆 Travail de connaissance — GDPval-AA v2 (Sonnet 5 devant Opus 4.8 !)

Sonnet 4.61 395 pts
Sonnet 51 618 pts
Opus 4.81 615 pts

➡️ Un Sonnet qui dépasse le haut de gamme du moment sur le travail de connaissance : il y a quelques mois, c’était impensable.

En résumé : sur le code et le computer use, Opus 4.8 garde une légère avance. Sur le raisonnement avec outils, c’est quasiment une égalité. Et sur le travail de connaissance, Sonnet 5 passe devant. Pour un modèle facturé une fraction du prix d’Opus, c’est du jamais-vu.


💡 Partie 2 — Ce qui change concrètement pour vous

💶 Le prix : la vraie révolution

C’est LE détail qui rend tout le reste intéressant. En prix de lancement — valable jusqu’au 31 août 2026 :

🎉

Sonnet 5 — Lancement

2 $ / 10 $
par million de tokens (entrée / sortie) — jusqu’au 31 août 2026
📈

Sonnet 5 — Standard

3 $ / 15 $
par million de tokens — à partir du 1ᵉʳ septembre 2026
💎

Opus 4.8

5 $ / 25 $
par million de tokens — tarif de référence haut de gamme

En prix de lancement, Sonnet 5 est 2,5 fois moins cher qu’Opus 4.8 pour des performances à quelques points d’écart. Après le 31 août, le tarif remonte un peu mais reste environ 40 % moins cher qu’Opus. Et grâce au calibrage du prix de lancement, passer de Sonnet 4.6 à Sonnet 5 reste quasiment neutre en coût, malgré le nouveau tokenizer plus gourmand en tokens.

🎚️ L’effort de contrôle : 5 niveaux entre vos mains

Sonnet 5 est le premier modèle Sonnet à supporter tous les niveaux d’effort disponibles chez Anthropic. Vous choisissez votre curseur entre rapidité/coût et intelligence maximale :

Low

Tâches courtes, latence prioritaire

💬
Medium

Chat et volume, coût réduit

⚙️
High

Réglage par défaut de l’API

🔥
Xhigh

Code et agentique difficiles

🚀
Max

Capacité maximale, sans limite de tokens

Détail important à connaître : comparé à Sonnet 4.6, Sonnet 5 respecte les niveaux d’effort de manière beaucoup plus stricte, surtout en bas de gamme. En low, il fait exactement ce qu’on lui demande sans « broder » autour — parfait pour le coût, mais sur un problème vraiment complexe, mieux vaut monter d’un cran. Le conseil général : rester sur high par défaut, et basculer sur xhigh pour du code ou de l’agentique costaud.

🌍 Disponibilité : déjà chez vous

Sonnet 5 est désormais le modèle par défaut sur les plans Free et Pro de claude.ai : si vous êtes sur l’un de ces plans, vous l’utilisez déjà sans rien changer. Il est également disponible sur Max, Team et Enterprise, dans Claude Code, sur le Claude Developer Platform, et via l’API sous l’identifiant claude-sonnet-5. Anthropic a par ailleurs augmenté les limites de débit sur Claude, Cowork, Claude Code et la plateforme, pour absorber la consommation plus élevée des niveaux d’effort hauts.

Côté comportement général, Sonnet 5 est plus agentique par défaut que Sonnet 4.6 : il va chercher les outils plus volontiers et relance des boucles de vérification de lui-même. Il suit aussi les instructions de façon plus littérale — si vos prompts étaient taillés pour du 4.6 avec des formulations très insistantes, vérifiez qu’il ne surdéclenche pas ses outils.


🛡️ Partie 3 — Confiance, alignement et sécurité

⚖️ Comportement désaligné : moins bien qu’Opus, mais net progrès

Sur l’audit comportemental automatisé d’Anthropic (score où plus bas = mieux), Sonnet 5 s’améliore nettement par rapport à son prédécesseur, tout en restant derrière les modèles plus capables du haut de gamme :

Sonnet 4.62,89
Sonnet 52,53
Opus 4.82,10
Claude Mythos Preview1,95

Score plus bas = comportement plus aligné. Valeurs telles que présentées lors du lancement.

Au-delà du score global, Anthropic indique que Sonnet 5 hallucine moins et flatte moins l’utilisateur que Sonnet 4.6 (fini le réflexe de dire « oui, vous avez raison » juste pour faire plaisir). Côté sécurité agentique, il refuse mieux les requêtes malveillantes et résiste mieux aux tentatives de contournement par injection de prompt — un vrai gain de tranquillité pour qui fait tourner des agents en autonomie.

🔒 Cybersécurité : volontairement bridé

Anthropic n’a pas délibérément entraîné Sonnet 5 sur les tâches cyber jugées dangereuses. Preuve à l’appui : un test de développement d’exploit sur le navigateur Firefox, mené en collaboration avec Mozilla.

🦊 Exploit fonctionnel sur Firefox 147 (taux de réussite complète)

Sonnet 4.60 %
Sonnet 50 %
Opus 4.868,8 %
Claude Mythos 588,4 %

Ni Sonnet 4.6 ni Sonnet 5 n’ont jamais réussi à produire un exploit complet et fonctionnel (0 % dans les deux cas) — Sonnet 5 montre juste un taux de succès partiel légèrement supérieur (13,2 % contre 8,8 % pour Sonnet 4.6), qu’Anthropic attribue à des gains de capacités générales plutôt qu’à un entraînement ciblé. Sonnet 5 reste donc délibérément faible en cyber-offensif, très loin derrière Opus 4.8 et Mythos 5. C’est rassurant : Anthropic a tout de même activé par défaut les mêmes garde-fous cyber que sur Opus 4.7 et 4.8. Pour un travail cyber légitime nécessitant moins de restrictions, c’est Opus 4.8 qui reste recommandé, pas Sonnet 5.

À noter : Claude Mythos 5 (et Claude Fable 5) restent à ce jour suspendus suite à une directive de contrôle des exportations américaine, sans date de retour officiellement confirmée.


⚖️ Le verdict

Pour la grande majorité des usages — code, agentique, travail de connaissance, automatisation — Sonnet 5 devient le nouveau choix par défaut. Il offre presque toute la qualité d’Opus 4.8 pour une fraction du prix, et il est gratuit par défaut sur les plans Free et Pro.

  • ✅ Performances collées à Opus 4.8 sur le coding et le computer use
  • ✅ Quasi-égalité sur le raisonnement avec outils
  • ✅ Devant Opus 4.8 sur le travail de connaissance (GDPval-AA v2)
  • ✅ 2,5x moins cher qu’Opus 4.8 en prix de lancement
  • ✅ Moins d’hallucinations, meilleure résistance aux injections de prompt
  • ⚠️ Opus 4.8 garde l’avantage sur la précision pure et le travail cyber légitime
  • ⚠️ Alignement encore un cran derrière Opus 4.8 et Mythos Preview
  • ⚠️ Nouveau tokenizer à surveiller une fois le tarif standard appliqué (après le 31 août)

🔍 Vérification des faits

Comme toujours, la retranscription audio a été comparée aux sources officielles (annonce et system card d’Anthropic, presse spécialisée) avant publication. Voici les points corrigés :

Niveaux d’effort : la retranscription mentionnait « low, medium, high, xi ou max ». Le niveau mal transcrit « xi » correspond en réalité à Xhigh (« effort extra-élevé »), soit bien 5 niveaux officiels : low, medium, high, xhigh, max.
Test cyber sur Firefox : la vidéo indiquait qu’Opus 4.8 « monte à 8,8 % ». En réalité, 8,8 % correspond au taux de succès partiel de Sonnet 4.6. Le vrai chiffre d’Opus 4.8 pour le développement d’un exploit fonctionnel est de 68,8 %. Sonnet 5, lui, affiche 13,2 % de succès partiel (toujours 0 % d’exploit complet). Le chiffre de Mythos 5 (« plus de 88 % ») est confirmé à 88,4 %.
Noms de benchmarks : « SW Bench Pro » a été corrigé en SWE-bench Pro, et « Knowledge Work GPDVAA V2 » en GDPval-AA v2, les intitulés officiels utilisés par Anthropic.
Retour de Mythos 5 : la vidéo évoquait un retour « courant juillet », en précisant elle-même le doute. À ce jour, aucune date officielle de retour n’est confirmée : Mythos 5 et Fable 5 restent suspendus suite à la directive de contrôle des exportations américaine.

💬 Envie d’aller plus loin ?

Un deep dive sur les usages concrets de Sonnet 5 dans Claude Code arrive bientôt sur la chaîne — abonnez-vous pour ne rien manquer.

🎬 Voir la vidéo complète

Sources : Anthropic — Introducing Claude Sonnet 5 & System Card (30 juin 2026), presse spécialisée IA.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *

Retour en haut