
GPT-5.5 Pro Benchmarks: De Cijfers Die OpenAI Publiceerde (en de Ontbrekende)
OpenAI lanceerde GPT-5.5 Pro op 23 april 2026, geprijsd op $30 per miljoen invoertokens en $180 per miljoen uitvoertokens. Dat is 6× de $5/$30 van basis GPT-5.5. Voor dat geld krijg je een variant met hogere rekenkracht die 90,1% scoort op BrowseComp. Maar hier is wat niemand in de kop zet: OpenAI's eigen evaluatietabel laat de GPT-5.5 Pro coderij leeg. Hetzelfde geldt voor computergebruik. Hetzelfde voor lange context. Zoek je dus de SWE-Bench Pro-score van het model, dan is die er gewoon niet. We hebben de gepubliceerde tabel opgepakt en elk cijfer zelf beoordeeld.
Kort antwoord:
- GPT-5.5 Pro is OpenAI's hogere-rekenkrachtvariant van GPT-5.5 (uitgebracht op 23 april 2026), geen nieuw model.
- Het loopt voorop bij browsing (BrowseComp 90,1%) en frontier-wiskunde, maar OpenAI liet de rijen voor coderen, computergebruik en lange context leeg.
- Op de bestaande coderrijen loopt basis GPT-5.5 achter op Claude Fable 5 (SWE-Bench Pro 58,6% vs. 80,3%).
- Claude Fable 5 is momenteel opgeschort (US exportcontrolebesluit, rond 12 juni 2026), dus de winsten komen met een sterretje: "nu niet te koop".
Een korte methodologische noot, want nauwkeurigheid telt zwaarder dan snelheid bij een benchmarkpost: de onderstaande cijfers zijn gekruiscontroleerd met de gepubliceerde tabellen van OpenAI en Anthropic en het SWE-Bench Pro-paper (arXiv 2509.16941). Waar slechts één leverancier een getal meldt, vermelden we dat. Waar OpenAI nooit een Pro-score publiceerde, schrijven we "niet gepubliceerd" in plaats van stilletjes het basisgetal in te vullen.
GPT-5.5 Pro Benchmarks: Wat OpenAI Werkelijk Publiceerde
De gepubliceerde benchmarks van GPT-5.5 Pro beslaan een smalle selectie: browsing, frontier-wiskunde, professioneel kenniswerk, genetica en breed redeneren. OpenAI voerde alle evaluaties uit op redeneerinspanning xhigh in een onderzoeksomgeving, wat verschilt van de standaard ChatGPT-productie-instelling. Het kopgetal is BrowseComp 90,1%, ruim boven de 84,4% van basis GPT-5.5.
Hier is de hoofdtabel, met een kolom die aangeeft of OpenAI een aparte Pro-score publiceerde voor elke test:
| Benchmark | Wat het test | GPT-5.5 Pro | GPT-5.5 basis | Pro gepubliceerd? | Noten |
|---|---|---|---|---|---|
| BrowseComp | Zwaar webzoeken / informatie vinden | 90,1% | 84,4% | Ja | Duidelijkste Pro-winst op basis |
| FrontierMath T1-3 | Zware wiskunde | 52,4% | 51,7% | Ja | Verslaat gerapporteerde Opus 4.7 (43,8%) |
| FrontierMath T4 | Frontier-wiskunde | 39,6% | 35,4% | Ja | Moeilijkste wiskundeniveau |
| GDPval | Professioneel kenniswerk | 82,3% (geclaimd) | 84,9% | Ja (toegeschreven) | OpenAI's tabel plaatst Pro onder basis |
| GeneBench | Meerfasige genetica | 33,2% (geclaimd) | 25,0% | Ja (toegeschreven) | "OpenAI meldt" een grote sprong |
| HLE (zonder tools) | Breed zwaar redeneren | 43,1% | 41,4% | Ja | Onder gerapporteerde Opus 4.7 (46,9%) |
| HLE (met tools) | Tool-ondersteund redeneren | 57,2% (geclaimd) | 52,2% | Gedeeltelijk | Basis 52,2% bevestigd; Pro 57,2% geclaimd |
| Investment Banking Modeling | Financieel modelleren | 88,6% (intern) | 88,5% | Interne evaluatie | OpenAI markeerde dit INTERN; beschouw als indicatief |
| SWE-Bench Pro | Agentisch coderen | niet gepubliceerd | 58,6% | Nee | De meest gezochte leemte |
| OSWorld-Verified | Computergebruik | niet gepubliceerd | 78,7% | Nee | Leeg voor Pro |
| Cybersecurity | Beveiligingstaken | niet gepubliceerd | niet weergegeven | Nee | Leeg voor Pro |
| Lange context | Lange-documentherinnering | niet gepubliceerd | niet weergegeven | Nee | Leeg voor Pro |
Lees dat onderste blok goed. OpenAI publiceerde GPT-5.5 Pro-scores voor browsing en wiskunde, maar liet de rijen voor coderen, computergebruik, cybersecurity en lange context leeg. De BrowseComp-, FrontierMath- en GDPval-basiscijfers zijn bevestigd via secundaire trackers; de GDPval-Pro 82,3%, GeneBench 33,2% en het Investment Banking-getal worden door OpenAI gerapporteerd maar niet onafhankelijk geverifieerd, dus we schrijven ze toe in plaats van ze als vaststaand te presenteren.
Wat "Pro" Eigenlijk Betekent: Parallelle Test-Time Compute, Geen Nieuw Model
GPT-5.5 Pro is hetzelfde GPT-5.5-model dat met veel meer redeneerinspanning draait, geen andere architectuur. Zie het minder als een nieuwe motor en meer als dezelfde motor die langer en parallel draait voordat hij antwoordt. OpenAI noemt de instelling redeneerinspanning, en Pro zet die op het hoogste niveau: xhigh.
Is GPT-5.5 Pro een ander model dan GPT-5.5?
Nee. Dezelfde gewichten, dezelfde training. Wie zoekt op gpt 5.5 pro vs gpt 5.5 thinking of vs xhigh, vraagt eigenlijk naar één knop: hoe hard het model denkt voordat het antwoordt. "Parallelle test-time compute" betekent dat het model meerdere redeneerpaden tegelijk verkent en de beste kiest, wat meer tokens en meer kloktijd kost. Die extra rekenkracht is waarvoor je 6× betaalt.
De overige specificaties zijn gedeeld. GPT-5.5 Pro heeft een contextvenster van ongeveer 1,1M invoertokens en 128K uitvoertokens. Je koopt dus geen groter geheugen of een slimmer basismodel. Je koopt meer denktijd op het model dat je al kent.
GPT-5.5 Pro vs. GPT-5.5 (Standaard): Waar de 6× Prijs Iets Oplevert
GPT-5.5 Pro verslaat basis GPT-5.5 op de zwaarste taken: browsing, frontier-wiskunde en genetica. Bij routinewerk levert het het minst op. De scherpste winst is BrowseComp 90,1% vs. 84,4%, een sprong van 5,7 procentpunt op diep webonderzoek. Op FrontierMath Tier 4 stijgt het naar 39,6% van 35,4%.
Maar meer rekenkracht leidt niet altijd tot een hogere score. Op GDPval staat Pro in OpenAI's eigen tabel lager dan basis GPT-5.5 (82,3% geclaimd vs. 84,9% bevestigd). Dat is tegenstrijdig, en het wordt gerapporteerd als dat Pro wat ruwe winsten inruilt voor kalibratie. Het punt blijft: meer betalen is geen garantie.
Waar Pro uitsteekt:
- BrowseComp: 90,1% vs. 84,4% (+5,7)
- FrontierMath T4: 39,6% vs. 35,4% (+4,2)
- GeneBench: 33,2% vs. 25,0% (geclaimd door OpenAI)
- HLE met tools: 57,2% (geclaimd) vs. 52,2% (bevestigde basis)
Waar het gelijk staat of slechter is:
- GDPval: 82,3% (geclaimd) vs. 84,9% basis
- HLE zonder tools: 43,1% vs. 41,4%, nauwelijks een verschil
Als je werk voornamelijk uit alledaagse concepten, codereview en samenvattingen bestaat, is de 6× toeslag moeilijk te rechtvaardigen. De rekening kantelt pas als de taak werkelijk zwaar is. Over kosten gesproken: als je rekening het probleem is, behandelt onze gids voor het verlagen van LLM API-kosten het doorsturen van goedkopere modellen voor de makkelijke 80% en het reserveren van Pro voor de zware 20%.
GPT-5.5 Pro vs. Claude Fable 5
Op de codeerbenchmarks die beide leveranciers rapporteren, verslaat Claude Fable 5 basis GPT-5.5 overtuigend. Maar Fable 5 is momenteel opgeschort, dus de winst komt met een sterretje. En de vergelijking is rommelig, omdat OpenAI GPT-5.5 Pro-codeerschotten helemaal niet publiceerde. De eerlijke confrontatie is daarmee eigenlijk Fable 5 vs. basis GPT-5.5 op coderen, met Pro afwezig.
Hier is de driewegtabel. De Fable 5-cijfers zijn toegeschreven aan Anthropic's gepubliceerde tabel; lege Pro-cellen zijn precies dat:
| Test | GPT-5.5 basis | GPT-5.5 Pro | Claude Fable 5 | Winnaar |
|---|---|---|---|---|
| SWE-Bench Pro | 58,6% | niet gepubliceerd | 80,3% | Fable 5 |
| FrontierCode Diamond | 5,7% | niet gepubliceerd | 29,3% | Fable 5 |
| Terminal-Bench | 83,4% (v2.1) | niet gepubliceerd | 88,0% (v2.1) | Fable 5 |
| OSWorld-Verified | 78,7% | niet gepubliceerd | 85,0% | Fable 5 |
| HLE (zonder tools) | 41,4% | 43,1% | 56,8–59,0% | Fable 5 |
| HLE (met tools) | 52,2% | 57,2% (geclaimd) | 64,5% | Fable 5 |
| BrowseComp | 84,4% | 90,1% | niet gepubliceerd | GPT-5.5 Pro |
| FrontierMath T4 | 35,4% | 39,6% | niet gerapporteerd | GPT-5.5 Pro |
| GDPval-AA | 1769 | niet gepubliceerd | 1932 | Fable 5 |
Twee voorbehouden bij die tabel. Ten eerste Terminal-Bench: basis GPT-5.5 scoort 82,7% op v2.0 en 83,4% op v2.1, terwijl Fable's 88,0% op v2.1 staat, dus zorg dat je dezelfde versie leest voordat je een kloof constateert. Ten tweede is GDPval-AA geen percentage. Het is een Elo-achtige score (1932 voor Fable vs. 1769 voor basis GPT-5.5), een volledig andere schaal, dus leg hem niet mentaal naast de percentagerijen. Het HLE zonder tools-getal van Fable varieert ook per bron: CodingFleet geeft 56,8%, andere samenvattingen zeggen 59,0%, dus we rapporteren de bandbreedte.
SWE-Bench Pro is de benchmark om op te baseren voor agentisch coderen. Die draait 1.865 problemen door 41 actieve repositories (via arXiv 2509.16941), met taken die een senior engineer uren of dagen kosten en meerdere bestanden vereisen. Op die test is Fable 5's 80,3% tegen basis GPT-5.5's 58,6% een groot verschil.
Dan het sterretje. Claude Fable 5 werd in juni 2026 opgeschort via een US exportcontrolebesluit (rond 12 juni). "Fable wint op coderen" klopt op de cijfers en is momenteel irrelevant aan de kassa. Voor het bredere Anthropic-verhaal, bekijk onze volledige Claude Fable 5-analyse. Voor het model waartegen GPT-5.5 op wiskunde afgemeten wordt, zie Claude Opus 4.8.
De Benchmarks Die OpenAI Niet Publiceerde voor Pro
OpenAI heeft nooit GPT-5.5 Pro-scores vrijgegeven voor coderen (SWE-Bench Pro), computergebruik (OSWorld-Verified), cybersecurity, lange-contextherinnering of abstract redeneren. Die rijen zijn leeg in de officiële tabel. Leeg betekent niet dat het model er slecht in is. Het betekent dat er geen gepubliceerd getal bestaat, en iedereen die er toch één citeert, gokt of haalt per vergissing het basisgetal aan.
Dit is relevant omdat het de meest gezochte leemte is. Zocht je naar GPT-5.5 Pro's SWE-Bench Pro-score, dan is die er niet. OpenAI publiceerde hem nooit. Het enige getal dat bestaat voor die benchmark binnen de GPT-5.5-familie is de 58,6% van het basismodel, en dat is een basiscijfer, geen Pro-cijfer. We markeren dat hier bewust zo.
Wat we verantwoord kunnen zeggen:
- Coderen (SWE-Bench Pro): Pro niet gepubliceerd. Basis GPT-5.5 = 58,6% (basis, niet Pro).
- Computergebruik (OSWorld-Verified): Pro niet gepubliceerd. Basis = 78,7% (basis, niet Pro).
- Cybersecurity: Pro niet gepubliceerd, geen bruikbare basisproxy in de tabel.
- Lange context: Pro niet gepubliceerd, geen bruikbare basisproxy.
- Abstract redeneren: Pro niet gepubliceerd.
Zou Pro's parallelle compute die basisscores optillen? Waarschijnlijk wel, gezien het patroon bij browsing en wiskunde. Maar "waarschijnlijk" is geen benchmark, en we printen geen getal dat OpenAI niet heeft gepubliceerd. Die terughoudendheid is precies de reden dat dit deel bestaat.
Prijsstelling: $5/$30 vs. $30/$180 vs. $10/$50 — Is Pro 6× Waard?
GPT-5.5 Pro kost ruwweg 6× basis GPT-5.5: $30 invoer en $180 uitvoer per miljoen tokens, tegenover $5/$30 voor basis. Claude Fable 5 zit er tussenin op $10/$50. Het loont voor zwaar onderzoek en frontier-wiskunde, zelden voor alledaags werk.
| Model | Invoer / 1M | Uitvoer / 1M | Relatieve kosten |
|---|---|---|---|
| GPT-5.5 basis | $5 | $30 | 1× (referentie) |
| Claude Fable 5 | $10 | $50 | ~2× invoer, ~1,7× uitvoer |
| GPT-5.5 Pro | $30 | $180 | ~6× basis |
Wie moet de toeslag dan betalen? Een grove verdeling per taak:
- Zwaar onderzoek, frontier-wiskunde, diep meerstaps-browsen: GPT-5.5 Pro verdient het. De benchmarkwinsten zijn reëel en de taakwaarde is hoog.
- Agentisch coderen op grote repositories: Fable 5 als je het kunt krijgen, anders basis GPT-5.5 in een coderscaffold. Pro betalen voor een niet-gepubliceerde codescore is een slechte gok.
- Dagelijks schrijven, samenvattingen, codereview, ondersteuning: basis GPT-5.5. De 6× toeslag brengt hier vrijwel niets extra.
De valkuil is alles standaard op Pro zetten "voor de zekerheid". Op uitvoergerichte workloads loopt dat $180-getal snel op. Doorsturen op taakniveau houdt het grootste deel van de kwaliteit bij een fractie van de kosten (meer in onze LLM API-kostengids).
Hoe We Deze Cijfers Controleerden (en Waar Bronnen Het Oneens Zijn)
Voordat welk getal dan ook in dit artikel belandde, deden we het saaie deel: we trokken OpenAI's gepubliceerde GPT-5.5-evaluatietabel en controleerden elke Pro-rij op onafhankelijke trackers in plaats van één screenshot te vertrouwen. De bronnen die we kruiscontroleerden waren llm-stats, BenchLM, DataCamp's Fable 5-analyse, CodingFleet en het arXiv SWE-Bench Pro-paper (2509.16941). Hier is wat standhield en wat niet.
De meeste Pro-kopgetallen kloppen netjes. BrowseComp 90,1%, FrontierMath Tier 1–3 52,4% en Tier 4 39,6%, en de $30/$180-prijsstelling kwamen overeen in elke bron die we raadpleegden. SWE-Bench Pro op 80,3% voor Fable 5 versus 58,6% voor basis GPT-5.5, en FrontierCode Diamond op 29,3% versus 5,7%, hielden ook stand — en het aantal SWE-Bench Pro-taken (1.865 problemen in 41 repositories) komt rechtstreeks uit het paper, niet uit een leveranciersblog.
Drie dingen kwamen niet overeen, en je moet dat weten:
- Humanity's Last Exam met tools voor Fable 5 varieert tussen 56,8% en 59,0% afhankelijk van de bron. We noemen de bandbreedte in plaats van één getal te kiezen.
- Terminal-Bench-getallen wisselen tussen versie 2.0 en 2.1 in de tabellen van OpenAI en Anthropic, dus het verschil tussen GPT-5.5 (83,4%) en Fable (88,0%) is geen zuivere appels-met-appels-vergelijking.
- De Investment Banking Modeling-score (88,6% Pro) is door OpenAI als "intern" bestempeld, wat betekent dat geen onafhankelijke tracker hem kan bevestigen. We markeren hem elke keer dat hij verschijnt als leveranciersclaim.
Dat is de eerlijke versie. De getallen die we als feit presenteren, kwamen overeen in minstens twee onafhankelijke bronnen; al het andere is toegeschreven aan degene die het rapporteerde. We hebben GPT-5.5 Pro niet zelf gedraaid — bij $30/$180 per miljoen tokens is een serieuze head-to-head-test niets wat we nep gaan doen, dus we doen niet alsof we labresultaten hebben die we niet hebben.
Praktijkresultaten Die Leveranciers Melden
Dit zijn leveranciersclaims, geen onafhankelijke labresultaten. Lees ze als marketingadjacent bewijs. OpenAI en Anthropic publiceerden elk casestudies met een flatterend beeld. We noemen ze toegeschreven, met de kanttekening dat geen ervan door ons geverifieerd is.
Aan OpenAI's kant zegt het bedrijf dat een financeteam Codex met GPT-5.5 gebruikte om 24.771 K-1-belastingformulieren (71.637 pagina's) te beoordelen, ongeveer twee weken sneller dan het voorgaande jaar. OpenAI meldt ook een werkende algebraïsche-geometrie-app gebouwd vanuit één prompt in 11 minuten, en een GPT-5.5 Pro-analyse van een genexpressiedataset over 62 samples en ongeveer 28.000 genen.
Aan Anthropic's kant gebruikte Stripe (gemeld via Anthropic) Fable 5 voor een codebase-brede migratie van een Ruby-codebase van 50 miljoen regels op één dag, tegenover een geschatte 2-plus maanden handmatig. Anthropic zegt ook dat Fable 5 Pokémon FireRed voltooide vanuit ruwe schermafbeeldingen, waar eerdere Claude-modellen extra scaffolding-tools nodig hadden, en dat het met persistent bestandsgeheugen Slay the Spire ongeveer 3× beter speelde dan Opus 4.8.
Indrukwekkende demo's, allemaal. Onthoud alleen dat ze door de leveranciers zijn uitgekozen en niet reproduceerbaar zijn vanuit het persbericht alleen.
Welk Model Moet Je Eigenlijk Gebruiken?
Koppel het model aan de taak, niet aan de hype. Voor codeeragenten en grote repositories: pak Claude Fable 5 als je er toegang toe hebt, en basis GPT-5.5 in een codeerschreisteiger als dat niet zo is. Voor onderzoek, frontier-wiskunde en diep browsen is GPT-5.5 Pro de keuze. Voor dagelijks werk en kostenefficiëntie wint basis GPT-5.5 op waarde bijna altijd.
Een paar aanwijzingen als je een stack kiest in plaats van één losse aanroep. Als je echt een autonoom codeersysteem wilt, heb je een tool nodig, geen kaal model — begin dus bij de beste AI-codeeragenten in 2026 en de achtergrond-codeeragenten-vergelijking voor de Codex- en Devin-context. Benieuwd waar de familie naartoe gaat? Hier is wat er uitlekt over GPT-5.6.
Bij Techsy sturen we per taak door onze agentpipelines: topklasse redeneermodellen voor de zware aanroepen en goedkopere voor de rest, in plaats van premiumtarieven op elk verzoek te betalen. Wil je een second opinion over je eigen modelkeuze, vraag dan een gratis adviesgesprek aan.
Over de Auteur
Mert Batur is mede-oprichter van Techsy.io, waar het team AI-agenten, automatiseringssystemen en voice/SDR-pipelines bouwt voor B2B-klanten. Hij schrijft over de LLM-toolingstack die het Techsy-team in productie gebruikt. Verbinden op LinkedIn.
Veelgestelde Vragen
Is GPT-5.5 Pro het waard?
Dat hangt af van de taak. Voor zwaar onderzoek, frontier-wiskunde en diep browsen rechtvaardigen Pro's winsten ten opzichte van basis (BrowseComp 90,1% vs. 84,4%) de ruwweg 6× prijs van $30/$180 per miljoen tokens. Voor alledaags schrijven, codereview en samenvattingen geeft basis GPT-5.5 vrijwel dezelfde kwaliteit voor een zesde van de kosten.
Is GPT-5.5 Pro beter dan Claude Fable 5?
Op gepubliceerde codeerbenchmarks niet: Claude Fable 5 verslaat basis GPT-5.5 op SWE-Bench Pro (80,3% vs. 58,6%), en OpenAI publiceerde nooit een Pro-codescore om te vergelijken. GPT-5.5 Pro wint op browsing en frontier-wiskunde. Één kanttekening: Fable 5 is momenteel opgeschort vanwege een US exportcontrolebesluit, dus beschikbaarheid telt net zo zwaar als de benchmark.
Hoe goed is GPT-5.5 Pro bij coderen?
Eerlijk gezegd kunnen we dat niet zeggen op basis van OpenAI's cijfers, omdat OpenAI geen GPT-5.5 Pro-codescore publiceerde. Het enige coderenderesultaat voor de familie is SWE-Bench Pro van basis GPT-5.5 op 58,6%, wat achterblijft bij Claude Fable 5's 80,3%. Wie een "Pro-codeerbenchmark" citeert, haalt waarschijnlijk per vergissing het basisgetal aan.
GPT-5.5 Pro vs. GPT-5.5 standaard — welke moet ik gebruiken?
Gebruik GPT-5.5 Pro voor zwaar onderzoek, frontier-wiskunde en diep meerstaps-browsen, waar de extra parallelle rekenkracht de 6× prijs rechtvaardigt. Gebruik basis GPT-5.5 voor dagelijks werk, codereview en samenvattingen, waar de toeslag weinig toevoegt. Op sommige tests, zoals GDPval, staat Pro in OpenAI's eigen tabel zelfs iets onder basis.
Hoeveel kost GPT-5.5 Pro?
GPT-5.5 Pro kost $30 per miljoen invoertokens en $180 per miljoen uitvoertokens, ruwweg 6× basis GPT-5.5's $5/$30. Ter vergelijking: Claude Fable 5 zit op $10/$50. Op uitvoergerichte workloads loopt de Pro-toeslag snel op, dus doorsturen op taakniveau in plaats van standaard op Pro bespaart je echt geld.
Wat is redeneerinspanning "xhigh"?
Redeneerinspanning is de instelling die bepaalt hoe hard GPT-5.5 denkt voordat het antwoordt. "xhigh" is het hoogste niveau, waarbij het model parallelle test-time compute gebruikt om meerdere redeneerpaden te verkennen en de beste te kiezen. OpenAI voerde zijn gepubliceerde GPT-5.5 Pro-evaluaties uit op xhigh in een onderzoeksomgeving, wat verschilt van de standaard ChatGPT-productie-instelling.
Is GPT-5.5 Pro beschikbaar in Codex?
Ja. Je kunt GPT-5.5 Pro aanroepen in Codex CLI met de modelstring gpt-5.5-pro, en de redeneerinspanning instellen op xhigh voor het hoogste rekeningsdrag. Verwacht hogere latentie en merkbaar hogere tokenkosten dan basis GPT-5.5, dus reserveer het voor de werkelijk zware taken in plaats van het als standaard codemodel te draaien.
Is GPT-5.5 Pro een nieuw model?
Nee. GPT-5.5 Pro is hetzelfde GPT-5.5-model dat met meer redeneerinspanning en parallelle test-time compute op de xhigh-instelling draait, geen aparte architectuur. Het deelt dezelfde gewichten en hetzelfde contextvenster van ongeveer 1,1M invoer- en 128K uitvoertokens. Je betaalt voor meer denktijd, niet voor een slimmer basismodel.
Wat is het contextvenster van GPT-5.5 Pro?
GPT-5.5 Pro heeft een contextvenster van ongeveer 1,1M invoertokens en 128K uitvoertokens, hetzelfde als basis GPT-5.5. Dat is genoeg om grote codebases of lange documenten in één aanroep te laden. Het verschil tussen Pro en basis zit niet in de geheugenomvang, maar in hoeveel redeneerrekenkracht het model inzet voordat het antwoordt.