
GPT-5.5 Pro Benchmarks : Les chiffres publiés par OpenAI (et ceux qu'il a gardés secrets)
OpenAI a lancé GPT-5.5 Pro le 23 avril 2026, à 30 $ le million de tokens en entrée et 180 $ en sortie. C'est 6× le tarif de base GPT-5.5 à 5 $/30 $. Pour ce prix, vous obtenez une variante à calcul augmenté qui affiche 90,1 % sur BrowseComp. Mais voilà ce que personne ne met en titre : le propre tableau d'évaluation d'OpenAI laisse la ligne codage de GPT-5.5 Pro vide. Idem pour l'utilisation d'ordinateur. Idem pour le contexte long. Quand vous cherchez le score SWE-Bench Pro du modèle, il n'existe pas. Nous avons extrait le tableau publié et vérifié chaque chiffre un par un.
Réponse rapide :
- GPT-5.5 Pro est la variante à calcul élevé de GPT-5.5 (sortie le 23 avril 2026), pas un nouveau modèle.
- Il domine sur la navigation (BrowseComp 90,1 %) et les maths avancées, mais OpenAI n'a pas publié les lignes codage, utilisation d'ordinateur et contexte long.
- Sur les lignes codage disponibles, GPT-5.5 base est en retrait sur Claude Fable 5 (SWE-Bench Pro 58,6 % vs 80,3 %).
- Claude Fable 5 est actuellement suspendu (directive de contrôle des exportations américaine, vers le 12 juin 2026), donc ses victoires s'accompagnent d'un astérisque « indisponible à l'achat ».
Une note sur la méthode, car la précision compte plus que la rapidité sur un article de benchmarks : les chiffres ci-dessous sont croisés avec les tableaux publiés d'OpenAI et d'Anthropic, ainsi qu'avec le papier SWE-Bench Pro (arXiv 2509.16941). Quand un seul fournisseur rapporte un chiffre, nous le précisons. Quand OpenAI n'a jamais publié de score Pro, nous écrivons « non publié » plutôt que de substituer discrètement le chiffre base.
GPT-5.5 Pro Benchmarks : ce qu'OpenAI a réellement publié
Les benchmarks publiés de GPT-5.5 Pro couvrent un périmètre étroit : navigation web, maths avancées, travail de connaissance professionnel, génétique et raisonnement général. OpenAI a exécuté chaque évaluation à un effort de raisonnement xhigh dans un environnement de recherche, qui diffère du paramètre de production par défaut de ChatGPT. Le chiffre phare est BrowseComp 90,1 %, bien devant le GPT-5.5 base à 84,4 %.
Voici le tableau principal, avec une colonne indiquant si OpenAI a publié un score Pro distinct pour chaque test :
| Benchmark | Ce qu'il mesure | GPT-5.5 Pro | GPT-5.5 base | Score Pro publié ? | Notes |
|---|---|---|---|---|---|
| BrowseComp | Navigation web difficile | 90,1 % | 84,4 % | Oui | Avantage le plus net de Pro sur base |
| FrontierMath T1-3 | Maths difficiles | 52,4 % | 51,7 % | Oui | Dépasse Opus 4.7 rapporté (43,8 %) |
| FrontierMath T4 | Maths de frontière | 39,6 % | 35,4 % | Oui | Niveau le plus difficile |
| GDPval | Travail de connaissance pro | 82,3 % (revendiqué) | 84,9 % | Oui (attribué) | Le tableau d'OpenAI place Pro en dessous du base |
| GeneBench | Génétique multi-étapes | 33,2 % (revendiqué) | 25,0 % | Oui (attribué) | OpenAI rapporte un bond significatif |
| HLE (sans outils) | Raisonnement difficile | 43,1 % | 41,4 % | Oui | Sous Opus 4.7 rapporté (46,9 %) |
| HLE (avec outils) | Raisonnement avec outils | 57,2 % (revendiqué) | 52,2 % | Partiel | Base 52,2 % confirmé ; Pro 57,2 % revendiqué |
| Investment Banking Modeling | Modélisation financière | 88,6 % (interne) | 88,5 % | Évaluation interne | Marqué INTERNE par OpenAI ; à traiter avec réserve |
| SWE-Bench Pro | Codage agentique | non publié | 58,6 % | Non | L'absence la plus remarquée |
| OSWorld-Verified | Utilisation d'ordinateur | non publié | 78,7 % | Non | Vide pour Pro |
| Cybersecurity | Tâches de sécurité | non publié | non publié | Non | Vide pour Pro |
| Long-context | Rappel sur document long | non publié | non publié | Non | Vide pour Pro |
Lisez attentivement ce bloc inférieur. OpenAI a publié des scores GPT-5.5 Pro pour la navigation et les maths, mais a laissé les lignes codage, utilisation d'ordinateur, cybersécurité et contexte long vides. Les chiffres BrowseComp, FrontierMath et GDPval base sont confirmés par des trackers indépendants ; le GDPval Pro à 82,3 %, GeneBench à 33,2 % et le score Investment Banking sont rapportés par OpenAI sans vérification indépendante, donc nous les attribuons plutôt que de les présenter comme des faits.
Ce que « Pro » signifie vraiment : calcul parallèle à l'inférence, pas un nouveau modèle
GPT-5.5 Pro est le même modèle GPT-5.5 qui fonctionne avec beaucoup plus d'effort de raisonnement, pas une architecture différente. Pensez-y moins comme un nouveau moteur et plus comme le même moteur qui tourne plus longtemps et en parallèle avant de répondre. OpenAI appelle ce réglage effort de raisonnement, et Pro le fixe au niveau supérieur : xhigh.
GPT-5.5 Pro est-il un modèle différent de GPT-5.5 ?
Non. Mêmes poids, même entraînement. Quand les gens cherchent gpt 5.5 pro vs gpt 5.5 thinking ou vs xhigh, ils posent en réalité une question sur un seul curseur : à quel point le modèle réfléchit avant de répondre. Le « calcul parallèle à l'inférence » signifie que le modèle explore plusieurs chemins de raisonnement simultanément et choisit le meilleur, ce qui consomme plus de tokens et plus de temps réel. Ce calcul supplémentaire, c'est pour ça que vous payez 6×.
Les caractéristiques sont par ailleurs identiques. GPT-5.5 Pro dispose d'une fenêtre de contexte d'environ 1,1 M tokens en entrée et 128 K en sortie. Vous n'achetez donc pas une mémoire plus grande ni un modèle de base plus intelligent. Vous achetez du temps de réflexion supplémentaire sur le modèle que vous connaissez déjà.
GPT-5.5 Pro vs GPT-5.5 standard : là où le prix 6× vous rapporte quelque chose
GPT-5.5 Pro dépasse GPT-5.5 base sur les tâches les plus difficiles : navigation, maths avancées et génétique. Il vous apporte le moins sur le travail courant. Le gain le plus net est BrowseComp 90,1 % vs 84,4 %, soit +5,7 points sur la recherche web approfondie. Sur FrontierMath Tier 4, il passe à 39,6 % contre 35,4 %.
Mais plus de calcul ne signifie pas toujours un score plus élevé. Sur GDPval, le tableau d'OpenAI liste en fait Pro en dessous du base (82,3 % revendiqué vs 84,9 % confirmé). C'est contre-intuitif, et cela est rapporté comme Pro sacrifiant quelques victoires brutes au profit de la calibration. Le point reste valable : payer plus n'est pas une garantie.
Là où Pro prend l'avantage :
- BrowseComp : 90,1 % vs 84,4 % (+5,7)
- FrontierMath T4 : 39,6 % vs 35,4 % (+4,2)
- GeneBench : 33,2 % vs 25,0 % (revendiqué par OpenAI)
- HLE avec outils : 57,2 % (revendiqué) vs 52,2 % (base confirmé)
Là où c'est stable ou en recul :
- GDPval : 82,3 % (revendiqué) vs 84,9 % base
- HLE sans outils : 43,1 % vs 41,4 %, quasi imperceptible
Si votre travail consiste essentiellement en rédaction quotidienne, revue de code et résumés, le surcoût 6× est difficile à justifier. La donne change seulement quand la tâche est vraiment difficile. Tant qu'on parle de coûts : si votre facture pose problème, notre guide pour réduire les coûts API LLM explique comment router les modèles moins chers pour les 80 % faciles et réserver Pro pour les 20 % difficiles.
GPT-5.5 Pro vs Claude Fable 5
Sur les benchmarks de codage que les deux fournisseurs publient, Claude Fable 5 bat GPT-5.5 base nettement. Mais Fable 5 est actuellement suspendu, donc la victoire s'accompagne d'un astérisque. Et la comparaison est plus complexe qu'elle n'y paraît, parce qu'OpenAI n'a tout simplement pas publié les scores de codage de GPT-5.5 Pro. L'affrontement honnête oppose donc vraiment Fable 5 à GPT-5.5 base sur le codage, Pro étant absent.
Voici le tableau à trois colonnes. Les chiffres de Fable 5 sont attribués au tableau publié d'Anthropic ; les cellules Pro vides le sont réellement :
| Test | GPT-5.5 base | GPT-5.5 Pro | Claude Fable 5 | Vainqueur |
|---|---|---|---|---|
| SWE-Bench Pro | 58,6 % | non publié | 80,3 % | Fable 5 |
| FrontierCode Diamond | 5,7 % | non publié | 29,3 % | Fable 5 |
| Terminal-Bench | 83,4 % (v2.1) | non publié | 88,0 % (v2.1) | Fable 5 |
| OSWorld-Verified | 78,7 % | non publié | 85,0 % | Fable 5 |
| HLE (sans outils) | 41,4 % | 43,1 % | 56,8–59,0 % | Fable 5 |
| HLE (avec outils) | 52,2 % | 57,2 % (revendiqué) | 64,5 % | Fable 5 |
| BrowseComp | 84,4 % | 90,1 % | non publié | GPT-5.5 Pro |
| FrontierMath T4 | 35,4 % | 39,6 % | non rapporté | GPT-5.5 Pro |
| GDPval-AA | 1769 | non publié | 1932 | Fable 5 |
Deux mises en garde s'imposent pour ce tableau. Première : Terminal-Bench — GPT-5.5 base affiche 82,7 % en v2.0 et 83,4 % en v2.1, tandis que le 88,0 % de Fable est en v2.1 ; assurez-vous de lire la même version avant d'affirmer un écart. Deuxième : GDPval-AA n'est pas un pourcentage. C'est un score de style Elo (1932 pour Fable vs 1769 pour GPT-5.5 base), une échelle différente, donc ne l'alignez pas mentalement avec les lignes en pourcentage. Le chiffre HLE sans outils de Fable varie aussi selon la source : CodingFleet indique 56,8 % tandis que d'autres résumés donnent 59,0 %, d'où l'intervalle que nous rapportons.
SWE-Bench Pro est le benchmark de référence pour le codage agentique. Il comprend 1 865 problèmes sur 41 dépôts actifs (selon arXiv 2509.16941), avec des tâches qui prendraient des heures ou des jours à un ingénieur senior et nécessitent des correctifs multi-fichiers. Sur ce test, le 80,3 % de Fable 5 contre le 58,6 % de GPT-5.5 base représente un écart considérable.
Voici l'astérisque. Claude Fable 5 a été suspendu en juin 2026 dans le cadre d'une directive de contrôle des exportations américaine (vers le 12 juin). Donc « Fable gagne en codage » est vrai sur les chiffres et actuellement sans intérêt pratique pour l'achat. Pour le tableau de bord complet côté Anthropic, voici notre analyse complète de Claude Fable 5. Pour le modèle auquel GPT-5.5 se compare sur les maths, voir Claude Opus 4.8.
Les benchmarks qu'OpenAI n'a PAS publiés pour Pro
OpenAI n'a jamais publié de scores GPT-5.5 Pro pour le codage (SWE-Bench Pro), l'utilisation d'ordinateur (OSWorld-Verified), la cybersécurité, le rappel sur contexte long ni le raisonnement abstrait. Ces lignes sont vides dans le tableau officiel. Vide ne signifie pas que le modèle est mauvais dans ces domaines. Cela signifie qu'aucun chiffre n'a été publié, et quiconque en cite un soit devine, soit reprend par erreur le score du modèle base.
C'est important parce que c'est le manque le plus recherché. Si vous avez cherché le score SWE-Bench Pro de GPT-5.5 Pro, il n'existe pas. OpenAI ne l'a jamais publié. Le seul chiffre qui existe pour ce benchmark dans la famille GPT-5.5 est le 58,6 % du modèle base, et c'est un chiffre base, pas Pro. Nous le signalons délibérément.
Ce que nous pouvons dire de façon responsable :
- Codage (SWE-Bench Pro) : Pro non publié. GPT-5.5 base = 58,6 % (base, pas Pro).
- Utilisation d'ordinateur (OSWorld-Verified) : Pro non publié. Base = 78,7 % (base, pas Pro).
- Cybersécurité : Pro non publié, pas de proxy base utilisable dans le tableau.
- Contexte long : Pro non publié, pas de proxy base utilisable.
- Raisonnement abstrait : Pro non publié.
Le calcul parallèle de Pro pourrait-il élever ces chiffres base ? Probablement, vu le schéma observé sur la navigation et les maths. Mais « probablement » n'est pas un benchmark, et nous n'allons pas imprimer un chiffre qu'OpenAI n'a pas publié. Cette retenue est la raison d'être de cette section.
Tarification : 5 $/30 $ vs 30 $/180 $ vs 10 $/50 $ — Pro vaut-il 6× ?
GPT-5.5 Pro coûte environ 6× GPT-5.5 base : 30 $ en entrée et 180 $ en sortie par million de tokens, contre 5 $/30 $ pour le base. Claude Fable 5 se situe entre les deux à 10 $/50 $. Justifié pour la recherche difficile et les maths avancées, rarement justifié pour le travail quotidien.
| Modèle | Entrée / 1M | Sortie / 1M | Coût relatif |
|---|---|---|---|
| GPT-5.5 base | 5 $ | 30 $ | 1× (référence) |
| Claude Fable 5 | 10 $ | 50 $ | ~2× entrée, ~1,7× sortie |
| GPT-5.5 Pro | 30 $ | 180 $ | ~6× base |
À qui le surcoût se justifie vraiment ? Un verdict rapide par cas d'usage :
- Recherche difficile, maths avancées, navigation multi-étapes approfondie : GPT-5.5 Pro le mérite. Les gains benchmark sont réels et la valeur de la tâche est élevée.
- Codage agentique sur grands dépôts : Fable 5 si vous pouvez l'obtenir, sinon GPT-5.5 base dans un scaffold de codage. Payer le tarif Pro pour un score de codage non publié est un mauvais pari.
- Rédaction quotidienne, résumés, revue de code, support : GPT-5.5 base. Le surcoût 6× n'apporte presque rien ici.
Le piège est de tout envoyer par défaut en Pro « pour être sûr ». Sur les charges de travail à forte sortie, ce 180 $ s'accumule vite. Routez par difficulté et vous conservez l'essentiel de la qualité pour une fraction de la facture (plus de détails dans notre guide des coûts API LLM).
Comment nous avons vérifié ces chiffres (et où les sources divergent)
Avant que l'un de ces chiffres n'entre dans cet article, nous avons fait le travail ingrat : nous avons extrait le tableau d'évaluation GPT-5.5 publié par OpenAI et vérifié chaque ligne Pro contre des trackers indépendants plutôt que de faire confiance à une seule capture d'écran. Les sources que nous avons croisées sont llm-stats, BenchLM, le compte-rendu Fable 5 de DataCamp, CodingFleet et le papier arXiv SWE-Bench Pro (2509.16941). Voici ce qui a tenu et ce qui n'a pas tenu.
La plupart des chiffres Pro headline se recoupent parfaitement. BrowseComp 90,1 %, FrontierMath Tier 1-3 52,4 % et Tier 4 39,6 %, ainsi que les tarifs 30 $/180 $, concordaient dans toutes les sources consultées. SWE-Bench Pro à 80,3 % pour Fable 5 contre 58,6 % pour GPT-5.5 base, et FrontierCode Diamond à 29,3 % contre 5,7 %, ont aussi été vérifiés — et le nombre de problèmes SWE-Bench Pro (1 865 problèmes sur 41 dépôts) vient directement du papier, pas d'un blog fournisseur.
Trois points n'ont pas convergé, et vous devez le savoir :
- Humanity's Last Exam avec outils pour Fable 5 apparaît entre 56,8 % et 59,0 % selon la source. Nous citons l'intervalle plutôt que de choisir un favori.
- Les chiffres Terminal-Bench flottent entre la version 2.0 et 2.1 dans les tableaux d'OpenAI et d'Anthropic, donc l'écart GPT-5.5 (83,4 %) vs Fable (88,0 %) n'est pas une comparaison nette.
- Le score Investment Banking Modeling (88,6 % Pro) est qualifié d'« interne » par OpenAI, ce qui signifie qu'aucun tracker indépendant ne peut le confirmer. Nous le signalons comme une affirmation fournisseur chaque fois qu'il apparaît.
Voilà la version honnête. Les chiffres présentés comme des faits ont été confirmés par au moins deux sources indépendantes ; tout le reste est attribué à celui qui le rapporte. Nous n'avons pas exécuté GPT-5.5 Pro nous-mêmes — à 30 $/180 $ par million de tokens, un vrai test tête à tête n'est pas quelque chose que nous allons simuler, alors nous ne prétendrons pas avoir des résultats de laboratoire que nous n'avons pas.
Résultats terrain rapportés par les fournisseurs
Ce sont des affirmations fournisseurs, pas des résultats de laboratoire indépendants, donc lisez-les comme des preuves proches du marketing. OpenAI et Anthropic ont chacun publié des études de cas qui brossent un tableau flatteur. Nous les listons attribués, avec la réserve qu'aucun n'a été vérifié par nos soins.
Du côté OpenAI, la société indique qu'une équipe finance a utilisé Codex avec GPT-5.5 pour passer en revue 24 771 formulaires fiscaux K-1 (71 637 pages), en terminant environ deux semaines plus tôt que l'année précédente. OpenAI rapporte également une application de géométrie algébrique construite à partir d'un seul prompt en 11 minutes, et une analyse GPT-5.5 Pro d'un jeu de données d'expression génique couvrant 62 échantillons et environ 28 000 gènes.
Du côté Anthropic, Stripe (rapporté via Anthropic) a utilisé Fable 5 pour effectuer une migration à l'échelle d'un dépôt de 50 millions de lignes Ruby en une seule journée, contre une estimation de plus de deux mois à la main. Anthropic indique aussi que Fable 5 a terminé Pokémon FireRed à partir de captures d'écran brutes, là où les anciens modèles Claude avaient besoin d'outils d'échafaudage supplémentaires, et qu'avec une mémoire persistante basée sur des fichiers, il a joué à Slay the Spire environ 3× mieux qu'Opus 4.8.
Des démos impressionnantes, sans exception. N'oubliez pas simplement qu'elles sont choisies par les fournisseurs et ne sont pas reproductibles à partir du communiqué de presse seul.
Quel modèle devriez-vous réellement utiliser ?
Faites correspondre le modèle à la tâche, pas à la réputation. Pour les agents de codage et les grands dépôts, choisissez Claude Fable 5 s'il est accessible, et GPT-5.5 base dans un scaffold de codage sinon. Pour la recherche, les maths avancées et la navigation approfondie, GPT-5.5 Pro est le bon choix. Pour le travail quotidien et l'efficacité des coûts, GPT-5.5 base gagne presque à chaque fois.
Quelques conseils si vous choisissez une infrastructure plutôt qu'un seul appel. Si vous voulez vraiment un système de codage autonome, vous avez besoin d'un outil, pas d'un modèle brut : commencez par les meilleurs agents de codage IA en 2026 et le comparatif agents de codage en arrière-plan pour le contexte Codex et Devin. Curieux de savoir où va la famille ensuite ? Voici ce qui fuite sur GPT-5.6.
Chez Techsy, nous routons par tâche dans nos pipelines d'agents — modèles de raisonnement haut de gamme pour les décisions difficiles et modèles moins chers pour le reste, plutôt que de payer des tarifs premium sur chaque requête. Si vous voulez un second avis sur votre propre mix de modèles, obtenez une consultation gratuite.
À propos de l'auteur
Mert Batur est co-fondateur de Techsy.io, où l'équipe développe des agents IA, des systèmes d'automatisation et des pipelines voice/SDR pour des clients B2B. Il écrit sur la pile LLM que l'équipe Techsy utilise réellement en production. Retrouvez-le sur LinkedIn.
Foire aux questions
GPT-5.5 Pro vaut-il le surcoût ?
Ça dépend de la tâche. Pour la recherche difficile, les maths avancées et la navigation approfondie, les gains de GPT-5.5 Pro sur base (BrowseComp 90,1 % vs 84,4 %) justifient le tarif 6× environ de 30 $/180 $ par million de tokens. Pour la rédaction quotidienne, la revue de code et les résumés, GPT-5.5 base offre quasiment la même qualité pour un sixième du coût.
GPT-5.5 Pro est-il meilleur que Claude Fable 5 ?
Sur les benchmarks de codage publiés, non : Claude Fable 5 dépasse GPT-5.5 base sur SWE-Bench Pro (80,3 % vs 58,6 %), et OpenAI n'a jamais publié de score de codage Pro pour comparer. GPT-5.5 Pro gagne sur la navigation et les maths avancées. Un point à noter : Fable 5 est actuellement suspendu dans le cadre d'une directive de contrôle des exportations américaine, donc la disponibilité compte autant que le benchmark.
Quelle est la capacité de GPT-5.5 Pro en codage ?
Honnêtement, on ne peut pas le dire à partir des chiffres d'OpenAI, parce qu'OpenAI n'a pas publié de score de codage pour GPT-5.5 Pro. Le seul chiffre de codage pour la famille est le résultat SWE-Bench Pro de GPT-5.5 base : 58,6 %, en retrait par rapport aux 80,3 % de Claude Fable 5. Quiconque cite un « benchmark de codage Pro » reprend probablement le score base par erreur.
GPT-5.5 Pro vs GPT-5.5 standard — lequel choisir ?
Utilisez GPT-5.5 Pro pour la recherche difficile, les maths avancées et la navigation multi-étapes approfondie, là où son calcul parallèle supplémentaire justifie le prix 6×. Utilisez GPT-5.5 base pour le travail quotidien, la revue de code et les résumés, où le surcoût n'apporte presque rien. Sur certains tests, comme GDPval, le tableau d'OpenAI liste même Pro légèrement en dessous du base.
Combien coûte GPT-5.5 Pro ?
GPT-5.5 Pro coûte 30 $ par million de tokens en entrée et 180 $ par million en sortie, soit environ 6× le tarif 5 $/30 $ de GPT-5.5 base. Pour comparaison, Claude Fable 5 est à 10 $/50 $. Sur les charges de travail à forte sortie, le surcoût Pro s'accumule vite, donc router par difficulté de tâche plutôt que de passer tout par défaut en Pro représente une vraie économie.
Qu'est-ce que l'effort de raisonnement « xhigh » ?
L'effort de raisonnement est le curseur qui contrôle l'intensité de réflexion de GPT-5.5 avant de répondre. « xhigh » est le niveau le plus élevé, où le modèle utilise le calcul parallèle à l'inférence pour explorer plusieurs chemins de raisonnement et choisir le meilleur. OpenAI a exécuté ses évaluations GPT-5.5 Pro publiées à xhigh dans un environnement de recherche, qui diffère du paramètre de production par défaut de ChatGPT.
GPT-5.5 Pro est-il disponible dans Codex ?
Oui. Vous pouvez appeler GPT-5.5 Pro dans Codex CLI en utilisant la chaîne de modèle gpt-5.5-pro, et régler l'effort de raisonnement à xhigh pour le comportement à calcul maximal. Attendez-vous à une latence plus élevée et un coût en tokens sensiblement plus élevé qu'avec GPT-5.5 base, donc réservez-le aux tâches vraiment difficiles plutôt que de l'utiliser comme modèle de codage par défaut.
GPT-5.5 Pro est-il un nouveau modèle ?
Non. GPT-5.5 Pro est le même modèle GPT-5.5 fonctionnant avec plus d'effort de raisonnement et du calcul parallèle à l'inférence au réglage xhigh, pas une architecture séparée. Il partage les mêmes poids et la même fenêtre de contexte d'environ 1,1 M tokens en entrée et 128 K en sortie. Vous payez pour plus de temps de réflexion, pas pour un modèle de base plus intelligent.
Quelle est la fenêtre de contexte de GPT-5.5 Pro ?
GPT-5.5 Pro dispose d'une fenêtre de contexte d'environ 1,1 M tokens en entrée et 128 K tokens en sortie, identique à GPT-5.5 base. C'est suffisant pour charger de grands dépôts ou de longs documents en un seul appel. La différence entre Pro et base n'est pas la taille de la mémoire ; c'est la quantité de calcul de raisonnement que le modèle dépense avant de répondre.