ai-machine-learning

GPT-5.6 Sol Ultra dans Codex : ce que fait vraiment le mode subagents (et son coût)

Écrit par Mert Batur
Mis à jour Jul 6, 2026
21 lecture
GPT-5.6 Sol Ultra dans Codex : ce que fait vraiment le mode subagents (et son coût)

GPT-5.6 Sol Ultra dans Codex : ce que fait vraiment le mode subagents (et son coût)

En juillet 2026, GPT-5.6 Sol Ultra est en preview fermée pour un petit groupe d'environ 20 partenaires approuvés par les autorités, accessible via l'API OpenAI et Codex. Ce n'est pas encore largement disponible. OpenAI n'a publié aucune date de disponibilité générale, et le score de 91,9% sur Terminal-Bench largement cité n'apparaît pas sur la page de preview officielle d'OpenAI.

Le 26/06/2026, OpenAI a présenté en preview la famille GPT-5.6 Sol, et quelques jours plus tard, Thibault Sottiaux a conseillé aux utilisateurs de Codex de "garder leurs prompts les plus difficiles sous la main" pour le palier Sol Ultra. Ce simple teaser a déclenché une vague de captures d'écran de benchmarks. La plupart répètent un chiffre qu'OpenAI n'a jamais publié. Alors avant d'organiser votre workflow Codex autour de GPT-5.6 Sol Ultra, voici ce qui est réellement confirmé, comment fonctionne le mode subagents, et le calcul de tokens qui détermine si ça vaut le coup de l'activer.

Points clés :

  • Sol Ultra est le palier d'effort le plus élevé de GPT-5.6 : des subagents coopérants qui communiquent entre eux pendant une même tâche.
  • Il est en preview fermée pour environ 20 partenaires approuvés par les autorités via l'API et Codex, pas encore largement disponible (en juillet 2026).
  • La presse rapporte 91,9% sur Terminal-Bench 2.1, mais OpenAI n'a pas publié ce chiffre, donc à traiter comme non vérifié.
  • Sol facture 5$ en entrée / 30$ en sortie par million de tokens ; les subagents multiplient les appels, donc Ultra peut coûter plusieurs fois le prix d'une exécution mono-agent.

GPT-5.6 Sol Ultra dans Codex : ce qui est réellement confirmé

Voici la distinction nette. Confirmé : OpenAI a présenté en preview la famille Sol (Sol, Terra, Luna) le 26/06/2026, Sol Ultra est le palier de raisonnement le plus élevé, et il a été annoncé pour Codex. Non confirmé : le score de 91,9% sur Terminal-Bench 2.1 et toute date de disponibilité générale. Tout le reste que vous avez vu relève du reportage, pas de données officielles.

Cette distinction compte parce que ce lancement a été mené vite et de façon peu rigoureuse. La page de preview d'OpenAI décrit les paliers et le contrôle de sécurité en termes qualitatifs. Le tableau de benchmarks accrocheur qui circule sur X et dans les guides provient de couvertures secondaires, pas de la page officielle d'OpenAI. À l'époque du pré-lancement, nous avions passé en revue les rumeurs, et voici ce qui a effectivement été livré par rapport à ce qui est resté spéculation. La même discipline s'applique ici.

Donc si vous êtes développeur et que vous essayez de décider si Ultra a sa place dans votre workflow Codex, ignorez les chiffres tape-à-l'œil un instant. Les faits confirmés (le mécanisme, les tarifs, le statut de preview) suffisent pour raisonner sur le coût et la pertinence. Les faits non confirmés (le score exact, la date de lancement) ne devraient encore piloter aucune décision. Sources : la page Previewing GPT-5.6 Sol d'OpenAI et la couverture de lancement de 9to5Mac.

Qu'est-ce que Sol Ultra ? Subagents coopérants vs agents parallèles de Pro

Sol Ultra est le palier de raisonnement le plus élevé de GPT-5.6, et sa caractéristique définissante ce sont les subagents coopérants : un coordinateur découpe votre tâche en morceaux, confie chaque morceau à un subagent, et ces subagents s'échangent des messages entre eux pendant que le travail est encore en cours. Cette communication en cours de tâche est tout l'enjeu, et c'est ce qui sépare Ultra de tous les paliers en dessous.

Imaginez une petite équipe d'ingénieurs face à un groupe de freelances. Les agents parallèles de GPT-5.5 Pro fonctionnent comme des freelances à qui vous confiez trois tickets séparés. Chacun fait sa partie de son côté, isolément, et dépose le résultat sur votre bureau. Personne ne se parle. Les subagents de Sol Ultra travaillent comme une équipe dans une même salle : l'un remarque que le schéma de base de données a changé, le signale aux autres, et ils ajustent leur travail avant de terminer. Cette coordination explique pourquoi OpenAI le positionne pour des tâches longues, difficiles, multi-étapes plutôt que pour des modifications rapides.

Là où les agents de Pro travaillent sur des voies séparées, les subagents de Sol Ultra s'échangent des notes tant que la tâche est en cours.

Diagramme comparatif : subagents coopérants de Sol Ultra à gauche, agents parallèles indépendants de GPT-5.5 Pro à droite
Les subagents coopérants de Sol Ultra communiquent en cours de tâche ; les agents parallèles de Pro fonctionnent sur des voies isolées et indépendantes.

Le mécanisme lui-même est confirmé, décrit par OpenAI et repris par les couvertures de DataCamp et deeplearning.ai. Le piège, et on y revient plus bas, c'est que chaque subagent que vous lancez est un appel de modèle supplémentaire qui consomme des tokens. La coordination n'est pas gratuite.

Qu'est-ce que l'"effort de raisonnement max" et quand l'activer ?

L'"effort de raisonnement max" est l'échelon le plus haut de l'échelle d'effort de GPT-5.6, qui va de faible à élevé jusqu'au réglage max qu'utilise Sol Ultra. Un effort plus élevé signifie que le modèle passe plus de calcul à réfléchir avant de répondre, ce qui aide généralement sur les problèmes difficiles et gaspille de l'argent sur les problèmes faciles. C'est un curseur, pas un interrupteur qu'on laisse enclenché en permanence.

Pensez à un joueur d'échecs. En effort faible, il joue vite à l'instinct, ce qui convient pour une prise évidente. En effort max, il s'assoit et calcule dix coups à l'avance, exactement ce qu'il faut pour une finale compliquée, et totalement inutile pour ouvrir une porte. L'effort de raisonnement fonctionne pareil. Le calcul (et la facture) évolue selon l'intensité que vous demandez au modèle.

Alors, quand ça vaut le coup ? Activez l'effort max pour du travail agentique long et multi-fichiers : une migration qui touche vingt fichiers, une refonte compliquée, un bug qui traverse trois services. C'est le territoire du développement agentique de longue haleine où un raisonnement plus profond change réellement le résultat. Laissez-le désactivé pour renommer une variable, écrire un test unique ou corriger une faute de frappe, parce que vous paierez des tokens premium pour zéro bénéfice.

L'effort de raisonnement max justifie son coût seulement quand la tâche est assez difficile pour qu'un premier essai raté vous coûte plus cher que les tokens supplémentaires.

La règle honnête : si vous ne pouvez pas expliquer pourquoi une tâche est difficile, vous n'avez probablement pas besoin de l'effort max pour elle.

Les chiffres de Terminal-Bench 2.1 : le 91,9% est-il vraiment vérifié ?

Non. Le chiffre de 91,9% est rapporté par la presse secondaire, il n'apparaît pas sur la page de preview officielle d'OpenAI, la preview est fermée, et aucune méthodologie d'évaluation n'a été divulguée. Il n'est donc pas indépendamment vérifié. Traitez-le comme une affirmation de presse invérifiable, pas comme un résultat établi.

Voici la situation précise. Des couvertures proches d'OpenAI (DataCamp, AI Weekly, deeplearning.ai) placent Sol Ultra à 91,9% sur Terminal-Bench 2.1. Mais comme la preview est réservée à environ 20 partenaires et qu'OpenAI n'a publié ni le chiffre ni les conditions de test, personne en dehors de ce cercle ne peut le reproduire. Notez aussi que le chiffre de Claude Mythos 5 change selon qui le rapporte : certaines sources disent 84,3%, d'autres 88,0%. Quand les propres chiffres d'un tableau comparatif se contredisent selon la source, c'est le signal pour les prendre avec des pincettes.

ModèleTerminal-Bench 2.1 (rapporté, non indépendamment vérifié)
Sol Ultra91,9%
Sol (base)88,8%
GPT-5.588,0%
Claude Mythos 584,3-88,0% (varie selon la source)
Gemini 3.1 Pro Preview70,7%

Le 91,9% que tout le monde cite n'apparaît pas sur la page de preview officielle d'OpenAI, donc traitez-le comme une affirmation de presse, pas un résultat établi.

Rien de tout cela ne signifie que Sol Ultra est faible. Il pourrait très bien dominer le classement une fois qu'OpenAI publiera une méthodologie réelle. Cela signifie simplement que vous ne devriez pas router du trafic de production sur la base d'un chiffre invérifiable. Sources : le guide GPT-5.6 Sol de DataCamp, The Batch de deeplearning.ai, et AI Weekly.

Comment utiliser Sol Ultra + l'effort de raisonnement max dans Codex

Sol Ultra lui-même est verrouillé, donc vous ne pouvez pas l'activer à moins que votre organisation soit dans la preview. Mais l'échelle d'effort sur laquelle il repose fonctionne déjà aujourd'hui dans le CLI Codex, sur les modèles que vous avez. Voici comment le réglage fonctionne, et où Ultra se glisse une fois que vous y aurez accès.

  1. Trouvez le réglage. L'effort de raisonnement se trouve dans votre fichier de config Codex à ~/.codex/config.toml, ou en flag par exécution. Ce n'est pas enfoui dans un menu ; c'est une seule clé.
  2. Configurez le modèle et l'effort. Pointez Codex vers votre chaîne de modèle et fixez le niveau d'effort. Aujourd'hui vous pouvez régler de faible à élevé ; l'échelon "max" ainsi que le palier subagents de Sol Ultra se débloquent une fois votre organisation dans la preview.
  3. Surchargez au cas par cas. Utilisez le flag -c pour augmenter l'effort sur une seule exécution difficile sans modifier votre config.
  4. Activez-le sélectivement. Réservez l'effort max aux tâches longues et multi-fichiers évoquées plus haut. Laissez votre défaut sur medium ou high.
toml
# ~/.codex/config.toml
model = "gpt-5.6-sol"
model_reasoning_effort = "high"   # minimal | low | medium | high (disponible aujourd'hui)

# effort "max" + le palier subagents coopérants de Sol Ultra
# à activer une fois votre organisation dans la preview fermée :
# model = "gpt-5.6-sol-ultra"
# model_reasoning_effort = "max"

# surcharge par exécution, sans modifier la config :
# codex -c model_reasoning_effort="high" "refactor the auth module"

Astuce pro : réglez le défaut de votre projet sur high, pas max. Puis passez à max seulement sur l'exécution spécifique qui en a besoin. Cette seule habitude garde votre facture de base raisonnable et réserve le palier coûteux aux tâches qui le méritent vraiment. Les détails de disponibilité figurent dans l'article de preview du Centre d'aide d'OpenAI.

Ce que coûte réellement Ultra : le multiplicateur de tokens des subagents

Voici la partie que personne ne modélise : parce qu'Ultra lance des subagents coopérants, une seule tâche déclenche plusieurs appels de modèle au lieu d'un, et chaque appel facture des tokens. Les tarifs confirmés de Sol sont de 5$ par million de tokens en entrée, 0,50$ en cache, et 30$ par million en sortie. La sortie est le côté coûteux, et Ultra en produit beaucoup plus.

Prenons un exemple concret. Une tâche agentique modérément complexe sur Sol de base, mono-agent :

ModèleComposantTokensTarif / 1MCoût
Sol (base)Entrée40 0005$0,20$
Sol (base)Sortie15 00030$0,45$
Sol (base)Total0,65$

Maintenant la même tâche sur Ultra avec un coordinateur plus trois subagents coopérants. Le contexte partagé se cache à bon marché à 0,50$, mais chaque subagent produit tout de même sa propre sortie à 30$ :

ModèleComposantTokensTarif / 1MCoût
Sol Ultra (modélisé)Entrée coordinateur40 0005$0,20$
Sol Ultra (modélisé)Entrée subagents, en cache90 0000,50$0,045$
Sol Ultra (modélisé)Entrée subagents, fraîche30 0005$0,15$
Sol Ultra (modélisé)Sortie coordinateur + inter-agents20 00030$0,60$
Sol Ultra (modélisé)Sortie subagents (3 x 15K)45 00030$1,35$
Sol Ultra (modélisé)Total~2,35$

Cela représente environ 3,6x le coût de Sol de base pour la même tâche, et selon le nombre de subagents lancés et la part de contexte mise en cache, vous verrez des écarts de 2x à 4x. Ce multiplicateur est notre estimation modélisée à partir des tarifs publiés, pas une mesure sur un benchmark Ultra réel, mais les tarifs et le mécanisme sont tous deux confirmés, donc l'ordre de grandeur est réel.

Le coût caché d'Ultra n'est pas le tarif par token, c'est qu'une seule tâche devient discrètement quatre appels de modèle.

Deux choses atténuent cela : la mise en cache de prompts (ce tarif en cache à 0,50$) sur le contexte partagé, et un routage discipliné pour ne payer les tarifs Ultra que sur les tâches qui en ont besoin. Si vous êtes sérieux sur la facture, notre guide pour garder vos coûts d'API LLM sous contrôle couvre les patterns de routage que nous utilisons sur les pipelines de nos clients. Tarifs sourcés depuis DataCamp et deeplearning.ai, datés de juin à juillet 2026.

Peut-on déjà l'utiliser ? La preview limitée, ~20 partenaires, et le calendrier

Pas à moins d'être l'un des environ 20 partenaires de confiance approuvés par les autorités. Sol Ultra est en preview fermée, accessible via l'API OpenAI et Codex, verrouillée derrière une revue de sécurité gouvernementale avant une sortie plus large. OpenAI a dit qu'un accès plus large arrivait "dans les prochaines semaines", et rien de plus précis.

Vous avez peut-être vu circuler une date du "7 juillet". Ignorez-la. OpenAI n'a donné aucune date de lancement, donc traitez toute date précise comme une rumeur non confirmée, pas comme un fait sur lequel planifier. Ce qui est confirmé, c'est le cadrage "dans les prochaines semaines" et le fait que Cerebras est prévu pour servir Sol jusqu'à 750 tokens par seconde à partir de juillet (selon deeplearning.ai).

Alors que faire si vous n'êtes pas partenaire ? Préparez-vous dès maintenant. Réglez votre config Codex et votre échelle d'effort sur les modèles que vous avez déjà, pour que lorsque Ultra s'ouvrira, changer la chaîne de modèle soit le seul changement à faire. Boîte de décision : Êtes-vous un partenaire de confiance ? Non ? Alors mettez en place votre routage par niveau d'effort dès aujourd'hui et soyez prêt à basculer en une ligne. Sources : Centre d'aide d'OpenAI et deeplearning.ai.

Sol Ultra vs Sol vs GPT-5.5 vs Claude Mythos 5 : lequel choisir ?

Routez par tâche, pas par classement, surtout quand les chiffres du classement ne sont pas vérifiés. Privilégiez Sol de base pour la majorité du codage agentique quotidien, réservez Sol Ultra aux tâches vraiment difficiles et de longue haleine, gardez GPT-5.5 si c'est déjà câblé dans votre stack, et envisagez Claude Mythos 5 là où vous faites déjà confiance à la dernière version de Claude pour votre workflow.

Voici le cadrage pratique :

  • Choisissez Sol de base quand la tâche est normalement difficile : une fonctionnalité, une refonte contenue, une suite de tests. Il affiche un score rapporté de 88,8% et coûte une fraction d'Ultra.
  • Choisissez Sol Ultra quand la tâche est longue, touche de nombreux fichiers, et qu'un premier essai raté coûterait un temps réel. Les subagents coopérants justifient leur multiplicateur ici, si tant est qu'ils le justifient nulle part.
  • Choisissez GPT-5.5 quand il est déjà intégré et que l'écart avec Sol ne justifie pas une migration.
  • Choisissez Claude Mythos 5 quand l'outillage existant de votre équipe le favorise. Son score rapporté varie selon la source (84,3% à 88,0%), donc ne basculez pas sur ce seul chiffre.

Pour des comparaisons de routage de modèles plus approfondies entre outils, notre comparatif d'agents de codage détaille où chacun excelle. En résumé : choisissez le palier le moins cher qui franchit la barre de difficulté de votre tâche.

Ce que disent vraiment les développeurs sur Reddit

Les benchmarks, c'est une chose. Ce que les gens rapportent depuis leur propre terminal en est une autre, et en ce moment les fils r/codex constituent le signal le plus honnête que nous ayons. Notre lecture de l'ambiance : prudemment impressionnés, profondément sceptiques, et surtout occupés à se disputer sur le prix.

Les premiers retours d'utilisation sont précis. Dans un fil r/codex à 335 upvotes, un développeur qui a remarqué que ses prompts étaient routés vers 5.6 a dit que ça donnait l'impression d'être "deux fois plus rapide" et de "réussir ses prompts en un coup", corrigeant même "de manière préventive" des cas limites qui demandaient auparavant plusieurs allers-retours avec 5.5. Sa comparaison a marqué les esprits : ça "ressemble exactement à Fable 5 quand je l'avais brièvement eu dans Claude, mais bien plus rapide." Un commentateur affirmant avoir un accès interne a ajouté que faire tourner des "tâches au niveau de raisonnement max" prend "beaucoup moins de temps que ne le ferait 5.5."

Puis les vétérans font leur apparition. Le contre-courant le plus bruyant, c'est ce qu'on appellerait le cynisme "lune de miel puis nerf" : "C'est toujours comme ça et ça dure environ 2 semaines avant le nerf", a écrit l'un. Un autre a été plus direct : "Il faut juste s'acharner dessus fort pendant 2 semaines parce que ça sera Einstein seulement pendant 2 semaines." Quelques-uns ont pointé le timing lui-même, remarquant que les posts élogieux sur 5.6 apparaissent juste quand les plaintes sur le déclin de 5.5 atteignent leur pic. Signe révélateur, les réponses les plus votées dans ce fil n'étaient même pas de l'analyse ; c'étaient des blagues ("j'utilise déjà gpt 6"), ce qui en dit long sur la lassitude des développeurs face au cycle d'emballement autour des versions.

Dans le fil d'annonce de Sol Ultra Codex, la conversation a presque entièrement basculé sur le coût, visant directement Claude. Les développeurs pèsent le palier Codex à 200$ d'OpenAI contre la promo Fable d'Anthropic, et plusieurs ont dit résilier leur Claude Max 20x, surtout parce que Fable "brûle les crédits deux fois plus vite." L'espoir récurrent : "une vraie concurrence pour Claude Fable. Tant mieux pour nous, utilisateurs." La crainte récurrente, qu'on partage nous aussi : "je me suis déjà fait avoir par OpenAI qui annonce des choses puis les verrouille derrière des paliers plus chers, donc j'y croirai quand je le verrai tourner en local."

Notre avis chez Techsy : les retours sur la vitesse correspondent à ce qu'une infrastructure de service à plus haut débit devrait produire, donc on les croit. Les affirmations sur la réussite en un coup, on les traite comme prometteuses mais non prouvées à grande échelle, parce que le schéma "ça devient plus bête après deux semaines" est réel et on l'a déjà vu se produire sur des lancements précédents. Et le scepticisme sur le coût est parfaitement fondé. Tant que Sol Ultra n'est pas dans votre CLI, stable, sur un cycle de facturation complet, traitez l'enthousiasme comme un aperçu, pas comme un verdict.

Ce que nous avons observé en faisant tourner des tâches agentiques dans Codex

Soyons directs : nous ne pouvons pas faire tourner Sol Ultra. C'est verrouillé à environ 20 partenaires et nous n'en faisons pas partie, donc nous ne citerons pas de nombre de tokens ou de score que nous n'avons pas mesuré. Ce que nous pouvons faire, c'est la chose honnête la plus proche possible. Nous avons fait tourner des tâches agentiques via le CLI Codex sur notre palier actuel et calculé le coût exact des subagents à partir des tarifs publiés d'OpenAI à 5$/30$.

L'échelle d'effort se comporte exactement comme prévu sur le palier que nous avons testé. En effort faible et medium, Codex répond vite et réussit surtout des modifications contenues. Poussez une tâche difficile et multi-fichiers en effort faible, et elle a tendance à s'arrêter en cours de route ou à manquer une dépendance inter-fichiers ; la même tâche en effort élevé passe nettement plus de temps à réfléchir avant d'agir, et applique une plus grande part du changement en un seul passage. Ce compromis temps-réel contre qualité est la raison même pour laquelle l'échelon max existe.

La modélisation de coût ci-dessus (l'exemple à environ 3,6x) est la véritable analyse de première main que nous pouvons assumer : c'est du calcul appliqué à des tarifs confirmés et au mécanisme confirmé des subagents, présenté comme un modèle, pas comme une mesure. Sur les pipelines agentiques de nos clients, nous routons déjà les paliers de modèles par coût, et c'est exactement ce calcul que nous ferions avant d'activer Ultra pour quiconque.

Le seul changement de configuration qui compte, c'est la ligne model_reasoning_effort dans le config.toml montré plus haut : nous gardons notre défaut de projet sur high et passons à max au cas par cas, exactement comme le décrit l'astuce pro plus haut. Quand Ultra s'ouvrira au-delà de la preview, cette configuration signifie que changer la chaîne de modèle sera le seul changement à faire, et le calcul de coût ci-dessus est déjà celui qu'on appliquera avant de l'activer. Nous mettrons à jour cette section avec des chiffres Ultra mesurés dès que nous aurons un vrai accès, pas avant.

À propos de l'auteur

Mert Batur est cofondateur de Techsy.io, où l'équipe conçoit des agents IA, des systèmes d'automatisation et des pipelines voix/SDR pour des clients B2B. Il écrit sur la stack d'outils LLM que l'équipe Techsy utilise réellement en production. Connectez-vous sur LinkedIn.

Cofondateur, Techsy.io.

Questions fréquentes

Qu'est-ce que GPT-5.6 Sol Ultra ?

Sol Ultra est le palier d'effort de raisonnement le plus élevé de GPT-5.6. Sa caractéristique définissante, ce sont les subagents coopérants : un coordinateur découpe une tâche et les subagents s'échangent des messages pendant qu'ils travaillent. OpenAI le positionne pour des tâches agentiques longues, difficiles et multi-étapes plutôt que pour des modifications rapides, et l'a présenté en preview dans la famille Sol le 26/06/2026.

Sol Ultra est-il disponible dans Codex dès maintenant ?

Pas pour la plupart des gens. En juillet 2026, Sol Ultra est en preview fermée, accessible via l'API OpenAI et Codex, réservée à environ 20 partenaires de confiance approuvés par les autorités après une revue de sécurité. OpenAI dit qu'un accès plus large arrive "dans les prochaines semaines" mais n'a publié aucune date précise, donc vous ne pouvez pas simplement l'activer aujourd'hui.

Comment fonctionnent les subagents coopérants dans Sol Ultra ?

Un coordinateur découpe votre tâche en morceaux et assigne chacun à un subagent. À la différence des agents parallèles indépendants, ces subagents communiquent en cours de tâche, partageant ce qu'ils apprennent pour que les autres ajustent leur travail avant de terminer. Cette coordination aide sur du travail complexe et multi-fichiers, mais chaque subagent est un appel de modèle séparé qui consomme ses propres tokens.

Qu'est-ce que l'"effort de raisonnement max" dans GPT-5.6 ?

L'effort de raisonnement max est l'échelon le plus haut de l'échelle d'effort de GPT-5.6, qui va de faible, à medium, à élevé, puis à max. Un effort plus élevé signifie que le modèle passe plus de calcul à raisonner avant de répondre. Ça aide sur des tâches difficiles et de longue haleine, et ça gaspille de l'argent sur des tâches simples, donc traitez-le comme un curseur à monter seulement quand une tâche est vraiment difficile.

Combien coûte Sol Ultra à faire tourner ?

Sol de base est tarifé à 5$ par million de tokens en entrée, 0,50$ en cache, et 30$ par million en sortie (sourcé depuis DataCamp et deeplearning.ai, daté mi-2026). Ultra lance des subagents coopérants, donc une tâche déclenche plusieurs appels de modèle. Notre exemple modélisé montre qu'une seule tâche coûte environ 2x à 4x une exécution Sol de base, porté surtout par les tokens de sortie supplémentaires.

Sol Ultra est-il vraiment meilleur que Claude Mythos 5 ?

Sur les chiffres rapportés, Sol Ultra (91,9%) dépasse Claude Mythos 5 sur Terminal-Bench 2.1, mais c'est non vérifié. OpenAI n'a pas publié le chiffre, la preview est fermée, et le propre score rapporté de Mythos 5 varie de 84,3% à 88,0% selon la source. La réponse honnête, c'est donc : on ne sait pas encore, et vous ne devriez pas router du trafic de production sur cette base.

Quand Sol Ultra sera-t-il disponible pour tout le monde ?

OpenAI a dit qu'un accès plus large à la famille Sol sur ChatGPT, Codex et l'API arrive "dans les prochaines semaines", mais n'a publié aucune date de disponibilité générale. Toute date précise qui circule (y compris le "7 juillet") est une rumeur non confirmée, pas une annonce officielle. Surveillez la page de preview officielle d'OpenAI pour le calendrier confirmé.

Le score de 91,9% sur Terminal-Bench 2.1 est-il vérifié ?

Non. Le chiffre de 91,9% provient de la presse secondaire, pas de la page de preview officielle d'OpenAI. La preview est fermée à environ 20 partenaires, et aucune méthodologie d'évaluation n'a été divulguée, donc personne en dehors de ce cercle ne peut le reproduire. Il pourrait s'avérer exact plus tard, mais pour l'instant c'est une affirmation de presse non vérifiée, pas un résultat de benchmark établi.

En quoi Sol Ultra diffère-t-il des agents parallèles de GPT-5.5 Pro ?

Les agents parallèles de Pro travaillent indépendamment sur des voies séparées : chacun fait sa partie isolément et retourne un résultat, sans communication. Les subagents de Sol Ultra coopèrent, en s'échangeant des messages en cours de tâche pour ajuster leur travail au fur et à mesure. Cette coordination convient mieux au travail multi-étapes difficile, mais elle multiplie aussi la consommation de tokens à travers les appels.

Ai-je besoin de Sol Ultra, ou Sol de base suffit-il ?

Pour la majorité du codage agentique, Sol de base ou un effort de raisonnement élevé suffit largement et coûte bien moins cher. Réservez Ultra aux tâches longues et multi-fichiers où un premier essai raté coûterait plus de temps que les tokens supplémentaires. Si vous ne pouvez pas clairement expliquer pourquoi une tâche est difficile, vous n'avez pas besoin d'Ultra pour elle. Routez par difficulté, pas par classement.

Que disent les développeurs sur GPT-5.6 Sol sur Reddit ?

Les premiers retours sur r/codex sont positifs sur la vitesse ("deux fois plus rapide") et sur la réussite en un coup, plusieurs développeurs comparant la sensation à Fable 5 de Claude. Mais les vétérans mettent en garde contre un schéma "lune de miel puis nerf" où les modèles se dégradent après le lancement, et une grande partie du débat porte sur le coût face aux plans d'Anthropic plutôt que sur la capacité brute.

Tags

GPT-5.6 Sol Ultra dans CodexSol Ultra Codexeffort de raisonnement maxsubagentsTerminal-Bench 2.1

Partager cet article

Démarrez Votre Projet

Prêt à construire quelque chose d'extraordinaire ?

Transformons votre vision en réalité. Notre équipe est prête à vous aider à créer un logiciel qui fait la différence.