Claude Sonnet 5 est arrivé : benchmarks, tarification et ma première analyse
Tech
Claude Sonnet 5
Anthropic
AI Models
Claude Code

Claude Sonnet 5 est arrivé : benchmarks, tarification et ma première analyse

Claude Sonnet 5 est officiel. Les benchmarks montrent un modèle Sonnet moins cher se rapprochant du travail d'agent de classe Opus, avec des limites importantes.

Uygar DuzgunUUygar Duzgun
Jul 1, 2026
Mis à jour 4 juil. 2026
7 min read

Claude Sonnet 5 est le modèle que je m'attendais à voir Anthropic lancer après le drame de Fable 5 : moins spectaculaire que Mythos, plus pratique qu'une petite mise à niveau, et clairement conçu pour le travail quotidien des agents.

Anthropic a lancé Claude Sonnet 5 le 30 juin 2026. Le titre n'est pas que Sonnet bat soudainement tous les modèles de classe Opus. Ce n'est pas le cas. L'histoire utile est celle du rapport coût-performance. Sonnet 5 se rapproche beaucoup d'Opus 4.8 sur le travail agentique, conserve la tarification de Sonnet et devient le nouveau modèle par défaut pour de nombreux utilisateurs de Claude.

Cela importe pour la façon dont j'utilise les agents AI. Je me soucie moins des réponses de chat en un seul coup et plus de savoir si un modèle peut inspecter un repo, utiliser des outils, rester concentré sur la tâche et terminer un travail sans faire de dégâts.

L'instantané des benchmarks

Le tableau de lancement d'Anthropic compare Sonnet 5 avec Sonnet 4.6 et Opus 4.8. Le motif est clair : Sonnet 5 est un vrai bond par rapport à Sonnet 4.6, mais Opus 4.8 mène toujours sur certaines des tâches agentiques les plus difficiles.

Tableau de benchmark de Claude Sonnet 5 d'Anthropic comparant Sonnet 5, Sonnet 4.6 et Opus 4.8
Tableau de benchmark de Claude Sonnet 5 d'Anthropic comparant Sonnet 5, Sonnet 4.6 et Opus 4.8
BenchmarkSonnet 5Sonnet 4.6Opus 4.8
------:---:---:
SWE-bench Pro63.2%58.1%69.2%
Terminal-Bench 2.180.4%67.0%82.7%
Humanity's Last Exam, sans outils43.2%34.6%49.8%
Humanity's Last Exam, avec outils57.4%46.8%57.9%
OSWorld-Verified81.2%78.5%83.4%
GDPval-AA v2161813951615

Le signal le plus fort est Terminal-Bench 2.1. Sonnet 5 passe de 67,0 % pour Sonnet 4.6 à 80,4 %, proche d'Opus 4.8 à 82,7 %. C'est le genre de réduction d'écart qui compte pour les agents de codage, car le travail terminal pénalise les modèles qui ne peuvent pas planifier, récupérer et utiliser des outils.

SWE-bench Pro est plus conservateur. Sonnet 5 s'améliore par rapport à Sonnet 4.6, mais Opus 4.8 reste en tête. Je lirais cela comme une réponse d'approvisionnement, pas une réponse de battage médiatique : utilisez Sonnet 5 pour les exécutions d'agents normales, gardez Opus pour les cas où la fiabilité supplémentaire vaut le prix.

Le rapport coût-performance est la vraie histoire du lancement

Anthropic a également publié des graphiques de coût-performance pour BrowseComp et OSWorld-Verified à travers différents niveaux d'effort. Ceux-ci sont plus utiles qu'un seul score global car Sonnet 5 offre désormais aux équipes un bouton de réglage : dépenser moins pour un effort moyen, ou pousser l'effort plus haut lorsque la tâche l'exige.

Courbe de performance coût-agent de recherche de Claude Sonnet 5 sur BrowseComp
Courbe de performance coût-agent de recherche de Claude Sonnet 5 sur BrowseComp
Courbe de performance coût-utilisation informatique agentique de Claude Sonnet 5 sur OSWorld-Verified
Courbe de performance coût-utilisation informatique agentique de Claude Sonnet 5 sur OSWorld-Verified

C'est exactement là qu'un modèle de classe Sonnet devrait gagner. Opus existe pour un raisonnement plus difficile, mais la plupart des flux de travail ont besoin de suffisamment d'intelligence à un prix où vous pouvez exécuter l'agent à plusieurs reprises. Le débogage, l'assurance qualité du navigateur, l'inspection de repo, les opérations de contenu et les petites tâches d'automatisation bénéficient tous d'un modèle moins cher à exécuter sans perdre le fil en cours de route.

Anthropic indique que Sonnet 5 est disponible à un tarif API introductif de 2 $ par million de tokens d'entrée et 10 $ par million de tokens de sortie jusqu'au 31 août 2026. Après cela, il passe à 3 $ en entrée et 15 $ en sortie par million de tokens. Ce prix standard correspond à celui de Sonnet 4.6 par token, mais il y a un piège : la documentation indique que Sonnet 5 utilise un nouveau tokenizer qui produit environ 30 % de tokens en plus pour le même texte.

Je ne dirais donc pas que la migration est automatiquement neutre en termes de coûts. Je recompterais les prompts avant de déplacer les agents à longue exécution de Sonnet 4.6 vers Sonnet 5.

Ce qui change pour les développeurs

L'ID du modèle est `claude-sonnet-5`. Anthropic le décrit comme une mise à niveau transparente par rapport à Sonnet 4.6, mais la documentation liste des changements de comportement qui comptent dans les applications réelles.

Premièrement, la pensée adaptative est activée par défaut. Si vous ne passez pas de champ thinking, Sonnet 5 s'exécute tout de même avec la pensée adaptative. Vous pouvez la désactiver, mais la valeur par défaut a changé.

Deuxièmement, la pensée étendue manuelle a disparu. L'ancien modèle `thinking: { type: "enabled", budget_tokens: N }` renvoie une erreur 400. Anthropic veut que les développeurs utilisent la pensée adaptative avec le paramètre effort à la place.

Troisièmement, les paramètres d'échantillonnage non par défaut sont rejetés. Les requêtes qui définissent `temperature`, `top_p` ou `top_k` à des valeurs non par défaut renvoient une erreur 400. C'est un vrai problème de migration si vos wrappers définissent automatiquement des valeurs par défaut d'échantillonnage.

Le bon côté : Sonnet 5 prend en charge une fenêtre de contexte de 1 million de tokens par défaut et jusqu'à 128k tokens de sortie. Pour le travail à l'échelle du repo et les flux de travail à long contexte, cela donne aux agents plus de place pour inspecter avant d'éditer.

Sécurité et benchmarks cyber

Anthropic positionne Sonnet 5 comme plus sûr pour l'utilisation ordinaire des agents que Sonnet 4.6. L'article de lancement indique que Sonnet 5 a un taux plus faible de comportement indésirable que Sonnet 4.6 et est plus sûr dans les contextes agentiques.

Le graphique cyber est la limite la plus importante. Anthropic indique qu'il n'a pas délibérément entraîné Sonnet 5 sur des tâches de cybersécurité. Sur une évaluation de développement d'exploit Firefox 147, Sonnet 5 n'a jamais produit d'exploit complet fonctionnel. Il a obtenu 0,0 % de succès d'exploit fonctionnel et 13,2 % de succès partiel. Opus 4.8 et Mythos 5 sont beaucoup plus forts sur cette évaluation, ce qui explique exactement pourquoi Anthropic maintient différents accès et politiques de garde-fou autour des modèles à risque plus élevé.

Évaluation du développement d'exploit Firefox 147 de Claude Sonnet 5 par Anthropic
Évaluation du développement d'exploit Firefox 147 de Claude Sonnet 5 par Anthropic

Ce cadrage a du sens. Sonnet 5 devrait être assez puissant pour le codage normal et le travail d'agent, mais pas optimisé pour des capacités cyber dangereuses. Anthropic indique également que Sonnet 5 est lancé avec des sauvegardes de cybersécurité en temps réel activées par défaut.

Ma première analyse

Je traiterais Claude Sonnet 5 comme le nouveau modèle de travail par défaut pour les agents Claude.

Ce n'est pas le modèle que je choisirais pour chaque problème de base de code difficile. Opus 4.8 gagne toujours dans certains benchmarks de codage agentique et d'utilisation informatique. Fable 5 reste l'histoire de frontière plus spectaculaire. Mais Sonnet 5 atterrit dans la partie du marché que la plupart des constructeurs ressentent réellement : le prix, le contexte, l'utilisation des outils et si l'agent continue.

Pour Claude Code, c'est probablement l'angle le plus intéressant. Un modèle moins cher qui peut s'exécuter plus longtemps, mieux utiliser les outils et rester proche d'Opus sur de nombreuses tâches change l'économie des boucles d'agents. Vous pouvez réserver les modèles de classe Opus pour la révision, le débogage difficile ou les changements à haut risque, tout en utilisant Sonnet 5 pour la passe d'exécution principale.

C'est ainsi que je le testerais en premier :

un repo sale
un build échoué
une tâche QA de navigateur
une migration à long contexte
un flux de travail de contenu avec de vrais liens et images
une petite étape de déploiement nécessitant de la retenue
Recommandé pour vous

Un modèle qui obtient de bons scores sur les benchmarks doit toujours se comporter dans un flux de travail réel. Il doit lire les fichiers actuels, éviter les modifications non pertinentes, exécuter des vérifications et s'arrêter lorsque l'étape suivante nécessite une décision humaine. J'ai écrit sur ce style opérationnel dans mon article Claude Code /loop et /goal.

Verdict

Claude Sonnet 5 ressemble à la réponse coût-performance d'Anthropic pour l'ère des agents. Il réduit l'écart avec Opus 4.8 sans prétendre le remplacer partout.

Les benchmarks disent qu'il est beaucoup plus fort que Sonnet 4.6 sur le travail terminal, l'utilisation d'outils, l'utilisation informatique, le travail de la connaissance et le raisonnement. La documentation dit que les développeurs doivent surveiller les comptes de tokens, la pensée adaptative et les changements de paramètres d'échantillonnage. L'histoire de la sécurité dit qu'Anthropic veut que Sonnet 5 soit puissant pour les agents quotidiens sans lui donner le même profil cyber qu'Opus ou Mythos.

C'est un lancement pratique. Je le testerai comme un modèle pratique.

Sources vérifiées le 1er juillet 2026