GPT-5.6 Sol est officiel : ce qui change par rapport à Claude Fable 5
Tech
OpenAI
GPT-5.6
GPT-5.6 Sol
GPT-5.6 Sol Ultra

GPT-5.6 Sol est officiel : ce qui change par rapport à Claude Fable 5

OpenAI GPT-5.6 Sol est officiel. Voici ce qui a changé, ce que signifie Sol Ultra, quels benchmarks existent et comment il se compare à Claude Fable 5.

Uygar DuzgunUUygar Duzgun
Jun 26, 2026
Mis à jour 22 août 2026
7 min read

GPT-5.6 n'est plus une rumeur. OpenAI a publié la GPT-5.6 Preview System Card le 26 juin 2026, et le détail important concerne la forme du lancement : une famille de modèles, des contrôles d'accès en preview et une grande attention portée à la sécurité des agents.

Recommandé pour vous

Il y a deux semaines, j'ai publié une vérification des rumeurs précédentes sur GPT-5.6. Cet article était exact à l'époque : GPT-5.6 n'était pas encore public. La situation a changé aujourd'hui.

Mon analyse est simple. GPT-5.6 est la réponse d'OpenAI à la même pression qu'Anthropic a créée avec Claude Fable 5 : les modèles sont désormais jugés sur leur capacité à exécuter un vrai travail, à utiliser les outils en toute sécurité et à rester fiables lorsque la tâche devient longue et désordonnée.

Ce qu'OpenAI a annoncé

OpenAI présente GPT-5.6 comme une nouvelle famille composée de trois modèles : Sol, Terra et Luna. Sol est le modèle phare, Terra est l'option performante à moindre coût et Luna est le membre le plus rapide et le plus économique de la famille.

OpenAI ne présente pas cela comme une simple amélioration d'un modèle de chat. L'entreprise met en avant le raisonnement complexe, le coding, l'utilisation d'ordinateurs, l'utilisation d'outils, la factualité et un comportement plus sûr des agents. C'est le bon ensemble d'affirmations à surveiller, car ce sont les domaines où les modèles de pointe deviennent soit des opérateurs utiles, soit de l'autocomplétion coûteuse.

La system card fournit également des signaux utiles. OpenAI affirme que GPT-5.6 réduit les erreurs factuelles majeures par rapport à GPT-5.5 sur LongFact et diminue les taux d'hallucination dans une analyse du trafic de production. Le document consacre aussi beaucoup d'espace à la prompt injection, aux actions accidentelles susceptibles de détruire des données, aux confirmations demandées à l'utilisateur lors de l'utilisation d'un ordinateur, à l'alignement et aux catégories de préparation telles que les risques cyber et bio/chimiques.

Cela me montre qu'OpenAI veut que GPT-5.6 soit évalué comme une plateforme d'agents, et pas seulement comme une boîte à réponses plus intelligente.

Sol Ultra et signaux des benchmarks

Il y a également un volet Sol Ultra, mais je choisirais mes mots avec prudence. OpenAI décrit un nouvel effort de raisonnement `max` pour Sol ainsi qu'un nouveau mode `ultra` qui utilise des sous-agents pour accélérer les tâches complexes. Je comprends cela comme un mode Sol utilisant davantage de calcul, et non comme un quatrième modèle de base. La famille de base présentée dans la system card reste composée de Sol, Terra et Luna.

OpenAI indique qu'il partagera un ensemble d'évaluations plus large lorsque les modèles seront généralement disponibles. Pour l'instant, voici les signaux de benchmark qui méritent d'être présentés :

Benchmark ou évaluationSignal publié concernant GPT-5.6
------
Terminal-Bench 2.1OpenAI affirme que GPT-5.6 Sol établit un nouvel état de l'art sur les workflows en ligne de commande nécessitant planification, itération et coordination d'outils.
GeneBench v1OpenAI affirme que Sol dépasse GPT-5.5 sur les workflows de génomique à long horizon et de biologie quantitative, tout en utilisant moins de tokens.
ExploitBenchOpenAI affirme que Sol est compétitif avec Mythos Preview tout en utilisant environ un tiers des tokens de sortie.
ExploitGymOpenAI affirme que Sol, Terra et Luna s'améliorent à mesure que le raisonnement augmente.
Tâches CTF internesLa system card indique que GPT-5.6 Sol atteint 96,7 % et sature l'évaluation.
Irregular FrontierCyberGPT-5.6 Sol a résolu 19 défis sur 197 ; le taux de réussite indiqué était de 11 % en Easy, 12 % en Medium, 5 % en Hard et 0 % en Elite.
CyScenarioBench et Atomic ChallengesIrregular a indiqué 28 % sur CyScenarioBench. Sur Atomic Challenges, Sol a obtenu 98 % en Network Attack Simulation, 91 % en Vulnerability Research and Exploitation et 56 % en Evasion.

C'est utile, mais ce n'est pas encore l'heure de célébrer une victoire finale. La plupart des chiffres publics concrets concernent fortement la cybersécurité. Les affirmations générales sur le coding et les agents sont solides, mais nous avons encore besoin de tests tiers plus larges avant d'affirmer que Sol Ultra est meilleur que Claude Fable 5 pour le travail logiciel courant.

Ce qui semble similaire à Claude Fable 5

Claude Fable 5 a fait progresser la même frontière, mais dans un style différent. Anthropic l'a lancé le 9 juin comme un modèle de classe Mythos disponible pour un usage général. Anthropic a présenté Fable 5 autour des tâches longues et complexes : software engineering, travail intellectuel, vision, recherche scientifique et travail d'agents à long horizon.

Le chevauchement est évident.

DomaineGPT-5.6 SolClaude Fable 5
---------
Promesse principaleModèle phare pour les agents et le raisonnementModèle frontier de classe Mythos à usage général
Cas d'utilisation les plus solidesCoding, utilisation d'outils, utilisation d'ordinateurs, factualité, agentsSoftware engineering, tâches longues, travail intellectuel, vision
Positionnement en matière de sécuritéSystem card en preview, catégories de préparation, travail sur la prompt injection et l'alignementProtections Fable, séparation Mythos, routage de secours pour les domaines sensibles
Question de l'acheteurPuis-je lui faire confiance pour agir dans des outils ?Puis-je y accéder et le conserver comme dépendance stable ?

Les deux entreprises convergent vers la même réalité produit : le modèle doit fonctionner au sein d'un système. Il doit suivre les instructions, gérer les outils, éviter les actions destructrices et fournir aux équipes suffisamment d'éléments pour faire confiance au résultat.

Recommandé pour vous

C'est la partie qui m'intéresse pour les coding agents. Je n'ai pas besoin d'un autre modèle qui rédige une prose assurée. J'ai besoin d'un modèle capable d'inspecter un repo, de comprendre les contraintes, d'exécuter les vérifications et de s'arrêter avant de toucher à un travail sans rapport. J'ai écrit davantage sur ce style de fonctionnement dans mon workflow d'objectif et de boucle pour les agents AI.

Où GPT-5.6 et Fable 5 diffèrent

La première différence concerne l'accès.

OpenAI commence avec GPT-5.6 via des contrôles en preview. C'est prudent, mais c'est clair. Anthropic a lancé Fable 5 plus largement, puis a publié le 12 juin une déclaration indiquant qu'il devait suspendre l'accès à Fable 5 et Mythos 5 après une directive du gouvernement américain relative aux contrôles à l'exportation. Anthropic a précisé que l'accès aux autres modèles Claude n'était pas affecté, mais Fable 5 est devenu du jour au lendemain une dépendance de production difficile à gérer.

Cela change la comparaison. Un modèle peut être brillant tout en étant difficile à intégrer si son accès change sans fenêtre normale de migration.

La deuxième différence concerne l'accent produit.

Le récit de Fable 5 chez Anthropic était axé sur les capacités : travail plus solide à long horizon, contexte très étendu et séparation entre Fable 5 pour l'usage général et Mythos 5 pour l'accès à la cyberdéfense de confiance. Le récit de GPT-5.6 chez OpenAI est davantage axé sur le déploiement : famille de modèles, contrôles en preview, system card de sécurité, travail sur la prompt injection et attention explicite portée aux modes d'échec des agents.

La troisième différence concerne le ton.

Anthropic a donné à Fable 5 l'image d'un bond en avant par rapport à la génération Claude précédente. OpenAI positionne GPT-5.6 comme une couche opérationnelle plus sûre et plus fiable pour les tâches difficiles. Cela peut sembler moins spectaculaire, mais c'est exactement là que les agents AI de production échouent : permissions des outils, contrôle du contexte, factualité, effets secondaires cachés et capacité du modèle à reconnaître son incertitude.

Mon test pratique pour GPT-5.6

Je ne jugerais pas GPT-5.6 Sol uniquement à partir des graphiques de lancement. Le premier test que je veux lui faire passer est une vraie tâche d'ingénierie :

un arbre git désordonné
une documentation obsolète
des tests en échec
un bug réparti sur plusieurs fichiers
une surface d'outils MCP
une étape de déploiement ou de publication qui exige de la retenue
Recommandé pour vous

Un bon modèle doit lire avant de modifier, effectuer le changement sûr le plus limité possible, vérifier le résultat et signaler les blocages au lieu de prétendre que tout est terminé. GPT-5.5 a déjà amélioré ce fonctionnement dans Codex, comme je l'ai expliqué dans mon test du modèle de coding GPT-5.5. GPT-5.6 doit être meilleur dans les aspects ennuyeux : moins de suppositions erronées, des appels d'outils plus propres et des conditions d'arrêt plus fiables.

Recommandé pour vous

Fable 5 reste important parce qu'il a placé la barre pour le travail long et complexe. Ma review de Claude Fable 5 publiée le jour de son lancement était positive pour cette raison. Le problème d'accès n'efface pas l'histoire des capacités, mais il ajoute une leçon en matière d'approvisionnement : les choix d'AI de pointe incluent désormais un risque politique, et pas seulement un risque lié aux benchmarks.

Verdict

GPT-5.6 Sol ressemble à la réponse sérieuse d'OpenAI au moment Fable 5. Les modèles ont une ambition similaire : tâches longues, coding, agents et utilisation sûre de capacités élevées. Ils diffèrent par leur stratégie de déploiement. Anthropic a montré à quoi pouvait ressembler un bond de capacités. OpenAI essaie de faire en sorte que le prochain bond paraisse déployable.

Sol Ultra rend le lancement plus intéressant, car il pointe vers une exécution multi-agents, et pas seulement vers un raisonnement plus approfondi au sein d'un seul modèle. Mais je continuerais à l'évaluer sur le travail qu'il accomplit : inspection d'un repo, utilisation des outils, récupération après les erreurs et capacité à laisser une trace claire pour l'humain responsable du système.

Pour les builders, le gagnant n'est pas le modèle dont le lancement est le plus bruyant. Le gagnant est le modèle capable d'accomplir un vrai travail, d'utiliser les outils en toute sécurité et de laisser une piste d'audit claire.

C'est ce que je testerai en premier.

Sources vérifiées le 26 juin 2026

Article de lancement d'OpenAI : Previewing GPT-5.6 Sol, consulté dans le navigateur le 26 juin 2026