
Benchmarks do GPT-5.5 Pro: Os Números que a OpenAI Publicou (e os que Não Publicou)
A OpenAI lançou o GPT-5.5 Pro a 23 de abril de 2026, com um preço de 30 $ por milhão de tokens de entrada e 180 $ por milhão de tokens de saída. São 6× os 5 $/30 $ do GPT-5.5 base. Por esse valor, obtém uma variante de maior capacidade computacional que alcança 90,1% no BrowseComp. Mas aqui está a parte que ninguém põe no título: a própria tabela de avaliações da OpenAI deixa a linha de código do GPT-5.5 Pro em branco. O mesmo para uso de computador. O mesmo para contexto longo. Por isso, quando procura a pontuação do modelo no SWE-Bench Pro, não há nenhuma para encontrar. Recolhemos a tabela publicada e classificámos cada número nós próprios.
Resposta rápida:
- O GPT-5.5 Pro é a variante de maior capacidade computacional do GPT-5.5 da OpenAI (lançada a 23 de abril de 2026), não um modelo novo.
- Lidera em navegação (BrowseComp 90,1%) e matemática de fronteira, mas a OpenAI deixou as linhas de código, uso de computador e contexto longo em branco.
- Nas linhas de código que existem, o GPT-5.5 base fica atrás do Claude Fable 5 (SWE-Bench Pro 58,6% vs 80,3%).
- O Claude Fable 5 está atualmente suspenso (diretiva de controlo de exportações dos EUA, por volta de 12 de junho de 2026), pelo que as suas vitórias vêm com um asterisco de "não o pode comprar agora".
Uma nota rápida sobre o método, porque a precisão importa mais do que a velocidade num artigo sobre benchmarks: os números abaixo foram cruzados com as tabelas publicadas da OpenAI e da Anthropic e com o artigo do SWE-Bench Pro (arXiv 2509.16941). Quando apenas um fornecedor reporta um número, dizemo-lo. Quando a OpenAI nunca publicou um resultado Pro, escrevemos "não publicado" em vez de substituir discretamente pelo número base.
Benchmarks do GPT-5.5 Pro: O que a OpenAI Publicou Realmente
Os benchmarks publicados do GPT-5.5 Pro cobrem uma fatia estreita: navegação, matemática de fronteira, trabalho de conhecimento profissional, genética e raciocínio amplo. A OpenAI executou todas as avaliações com esforço de raciocínio xhigh num ambiente de investigação, o que difere do padrão de produção do ChatGPT. O número de destaque é BrowseComp 90,1%, bem acima dos 84,4% do GPT-5.5 base.
Aqui está a tabela principal, com uma coluna a indicar se a OpenAI publicou um resultado Pro separado para cada teste:
| Benchmark | O que testa | GPT-5.5 Pro | GPT-5.5 base | Pro publicado? | Notas |
|---|---|---|---|---|---|
| BrowseComp | Navegação web difícil / pesquisa de informação | 90,1% | 84,4% | Sim | Vitória mais clara do Pro sobre o base |
| FrontierMath T1-3 | Matemática difícil | 52,4% | 51,7% | Sim | Supera o Opus 4.7 reportado (43,8%) |
| FrontierMath T4 | Matemática de fronteira | 39,6% | 35,4% | Sim | Nível mais difícil de matemática |
| GDPval | Trabalho de conhecimento profissional | 82,3% (alegado) | 84,9% | Sim (atribuído) | A tabela da OpenAI coloca o Pro abaixo do base |
| GeneBench | Genética multi-etapas | 33,2% (alegado) | 25,0% | Sim (atribuído) | "A OpenAI reporta" um salto significativo |
| HLE (sem ferramentas) | Raciocínio amplo e difícil | 43,1% | 41,4% | Sim | Abaixo do Opus 4.7 reportado (46,9%) |
| HLE (com ferramentas) | Raciocínio com ferramentas | 57,2% (alegado) | 52,2% | Parcial | Base 52,2% confirmado; Pro 57,2% alegado |
| Modelação de Banca de Investimento | Modelação financeira | 88,6% (interno) | 88,5% | Avaliação interna | A OpenAI marcou isto como INTERNO; tratar como indicativo |
| SWE-Bench Pro | Código agêntico | não publicado | 58,6% | Não | A lacuna principal |
| OSWorld-Verified | Uso de computador | não publicado | 78,7% | Não | Em branco para o Pro |
| Cibersegurança | Tarefas de segurança | não publicado | não mostrado | Não | Em branco para o Pro |
| Contexto longo | Memorização de documentos longos | não publicado | não mostrado | Não | Em branco para o Pro |
Leia esse bloco inferior com atenção. A OpenAI publicou resultados do GPT-5.5 Pro para navegação e matemática, mas deixou as linhas de código, uso de computador, cibersegurança e contexto longo em branco. Os números do BrowseComp, FrontierMath e GDPval-base estão confirmados por rastreadores secundários; o GDPval-Pro 82,3%, o GeneBench 33,2% e o número de Banca de Investimento são reportados pela OpenAI mas não verificados de forma independente, pelo que os atribuímos em vez de os afirmar categoricamente.
O que "Pro" Realmente Significa: Capacidade Computacional Paralela em Tempo de Teste, Não um Modelo Novo
O GPT-5.5 Pro é o mesmo modelo GPT-5.5 a funcionar com muito mais esforço de raciocínio, não uma arquitetura diferente. Pense nele menos como um motor novo e mais como o mesmo motor a funcionar durante mais tempo e em paralelo antes de responder. A OpenAI chama a esta definição esforço de raciocínio, e o Pro fixa-o no nível máximo: xhigh.
O GPT-5.5 Pro é um modelo diferente do GPT-5.5?
Não. Mesmos pesos, mesmo treino. Quando as pessoas procuram gpt 5.5 pro vs gpt 5.5 thinking ou vs xhigh, estão na verdade a perguntar sobre um único dial: quão intensamente o modelo pensa antes de responder. "Capacidade computacional paralela em tempo de teste" significa que o modelo explora vários caminhos de raciocínio em simultâneo e escolhe o melhor, o que custa mais tokens e mais tempo real. É por essa capacidade adicional que paga 6×.
As especificações são, de resto, partilhadas. O GPT-5.5 Pro tem uma janela de contexto de aproximadamente 1,1M tokens de entrada e 128K de saída. Portanto, não está a comprar mais memória nem um modelo base mais inteligente. Está a comprar mais tempo de pensamento no modelo que já conhece.
GPT-5.5 Pro vs GPT-5.5 (Standard): Onde o Preço 6× Lhe Dá Algo
O GPT-5.5 Pro supera o GPT-5.5 base nas tarefas mais difíceis: navegação, matemática de fronteira e genética. É onde menos ganha no trabalho de rotina. O ganho mais limpo é BrowseComp 90,1% vs 84,4%, uma subida de 5,7 pontos em investigação web profunda. No FrontierMath Tier 4, sobe de 35,4% para 39,6%.
Mas mais capacidade computacional nem sempre significa uma pontuação mais alta. No GDPval, a tabela da OpenAI coloca o Pro abaixo do GPT-5.5 base (82,3% alegado vs 84,9% confirmado). Isso é contra-intuitivo, e é reportado como o Pro a trocar algumas vitórias brutas por calibração. O ponto mantém-se: pagar mais não é garantia de nada.
Onde o Pro se destaca:
- BrowseComp: 90,1% vs 84,4% (+5,7)
- FrontierMath T4: 39,6% vs 35,4% (+4,2)
- GeneBench: 33,2% vs 25,0% (alegado pela OpenAI)
- HLE com ferramentas: 57,2% (alegado) vs 52,2% (base confirmado)
Onde está igual ou pior:
- GDPval: 82,3% (alegado) vs 84,9% base
- HLE sem ferramentas: 43,1% vs 41,4%, mal se nota a diferença
Se o seu trabalho é maioritariamente redação quotidiana, revisão de código e resumos, o prémio de 6× é difícil de justificar. A matemática só muda quando a tarefa é genuinamente difícil. Já que falamos de custos: se a sua fatura é o problema, o nosso guia para reduzir os custos de API de LLM cobre o encaminhamento de modelos mais baratos para os 80% fáceis e a reserva do Pro para os 20% difíceis.
GPT-5.5 Pro vs Claude Fable 5
Nos benchmarks de código que ambos os fornecedores reportam, o Claude Fable 5 bate o GPT-5.5 base de forma decisiva. Mas o Fable 5 está atualmente suspenso, pelo que a vitória vem com um asterisco. E a comparação é mais confusa do que parece, porque a OpenAI não publicou de todo os resultados de código do GPT-5.5 Pro. Portanto, o confronto honesto é realmente Fable 5 vs GPT-5.5 base em código, com o Pro ausente.
Aqui está a tabela a três. Os números do Fable 5 são atribuídos à tabela publicada da Anthropic; as células Pro em branco são exatamente isso:
| Teste | GPT-5.5 base | GPT-5.5 Pro | Claude Fable 5 | Vencedor |
|---|---|---|---|---|
| SWE-Bench Pro | 58,6% | não publicado | 80,3% | Fable 5 |
| FrontierCode Diamond | 5,7% | não publicado | 29,3% | Fable 5 |
| Terminal-Bench | 83,4% (v2.1) | não publicado | 88,0% (v2.1) | Fable 5 |
| OSWorld-Verified | 78,7% | não publicado | 85,0% | Fable 5 |
| HLE (sem ferramentas) | 41,4% | 43,1% | 56,8-59,0% | Fable 5 |
| HLE (com ferramentas) | 52,2% | 57,2% (alegado) | 64,5% | Fable 5 |
| BrowseComp | 84,4% | 90,1% | não publicado | GPT-5.5 Pro |
| FrontierMath T4 | 35,4% | 39,6% | não reportado | GPT-5.5 Pro |
| GDPval-AA | 1769 | não publicado | 1932 | Fable 5 |
Há duas ressalvas nessa tabela. Primeiro, o Terminal-Bench: o GPT-5.5 base obtém 82,7% na v2.0 e 83,4% na v2.1, enquanto os 88,0% do Fable são na v2.1, por isso certifique-se de que está a ler a mesma versão antes de declarar uma diferença. Segundo, o GDPval-AA não é uma percentagem. É uma pontuação do tipo Elo (1932 para o Fable vs 1769 para o GPT-5.5 base), uma escala completamente diferente, por isso não o alinhe mentalmente com as linhas de percentagens. O número do Fable no HLE sem ferramentas também varia conforme a fonte: o CodingFleet lista 56,8% enquanto outros resumos dizem 59,0%, pelo que reportamos o intervalo.
O SWE-Bench Pro é o benchmark de referência para código agêntico. Executa 1.865 problemas em 41 repositórios ativos (segundo arXiv 2509.16941), com tarefas que levam horas ou dias a um engenheiro sénior e requerem patches multi-ficheiro. Nesse teste, os 80,3% do Fable 5 contra os 58,6% do GPT-5.5 base representam uma margem ampla.
Agora o asterisco. O Claude Fable 5 foi suspenso em junho de 2026 ao abrigo de uma diretiva de controlo de exportações dos EUA (por volta de 12 de junho). Portanto, "o Fable ganha em código" é verdadeiro nos números e atualmente irrelevante na hora de pagar. Se quer o panorama mais aprofundado do lado da Anthropic, aqui está a nossa análise completa do Claude Fable 5. Para o modelo com o qual a tabela do GPT-5.5 se compara em matemática, veja Claude Opus 4.8.
Os Benchmarks que a OpenAI NÃO Publicou para o Pro
A OpenAI nunca publicou resultados do GPT-5.5 Pro para código (SWE-Bench Pro), uso de computador (OSWorld-Verified), cibersegurança, memorização de contexto longo ou raciocínio abstrato. Essas linhas estão em branco na tabela oficial. Em branco não significa que o modelo seja mau nessas áreas. Significa que não há número publicado, e quem citar um está ou a adivinhar ou a citar o número base por engano.
Isto importa porque é a lacuna mais pesquisada. Se procurou a pontuação do GPT-5.5 Pro no SWE-Bench Pro, não existe nenhuma. A OpenAI nunca a publicou. O único número que existe para esse benchmark na família GPT-5.5 é os 58,6% do modelo base, e isso é um número base, não um número Pro. Estamos a sinalizá-lo assim de propósito.
O que podemos dizer de forma responsável:
- Código (SWE-Bench Pro): Pro não publicado. GPT-5.5 base = 58,6% (base, não Pro).
- Uso de computador (OSWorld-Verified): Pro não publicado. Base = 78,7% (base, não Pro).
- Cibersegurança: Pro não publicado, sem proxy base utilizável na tabela.
- Contexto longo: Pro não publicado, sem proxy base utilizável.
- Raciocínio abstrato: Pro não publicado.
Poderia a capacidade computacional paralela do Pro melhorar esses números base? Provavelmente, dado o padrão em navegação e matemática. Mas "provavelmente" não é um benchmark, e não vamos imprimir um número que a OpenAI não publicou. Essa contenção é a razão de ser desta secção.
Preços: 5 $/30 $ vs 30 $/180 $ vs 10 $/50 $ — O Pro Vale 6×?
O GPT-5.5 Pro custa aproximadamente 6× o GPT-5.5 base: 30 $ de entrada e 180 $ de saída por milhão de tokens, contra 5 $/30 $ do base. O Claude Fable 5 situa-se entre os dois, a 10 $/50 $. Vale a pena para investigação difícil e matemática de fronteira; raramente vale para trabalho quotidiano.
| Modelo | Entrada / 1M | Saída / 1M | Custo relativo |
|---|---|---|---|
| GPT-5.5 base | 5 $ | 30 $ | 1× (referência) |
| Claude Fable 5 | 10 $ | 50 $ | ~2× entrada, ~1,7× saída |
| GPT-5.5 Pro | 30 $ | 180 $ | ~6× base |
Então quem deve realmente pagar o prémio? Um veredicto aproximado por tipo de trabalho:
- Investigação difícil, matemática de fronteira, navegação profunda multi-etapas: o GPT-5.5 Pro justifica-o. Os ganhos nos benchmarks são reais e o valor da tarefa é elevado.
- Código agêntico em repositórios grandes: Fable 5 se o conseguir obter, caso contrário GPT-5.5 base integrado num scaffold de código. Pagar preços Pro por uma pontuação de código não publicada é uma aposta arriscada.
- Redação diária, resumos, revisão de código, suporte: GPT-5.5 base. O gasto 6× quase não compra nada aqui.
A armadilha é encaminhar tudo para o Pro "por segurança". Em cargas de trabalho com muita saída, esse valor de 180 $ acumula-se rapidamente. Encaminhe por dificuldade e mantém a maior parte da qualidade por uma fração da fatura (mais sobre isso no nosso guia de custos de API de LLM).
Como Verificámos Estes Números (e Onde as Fontes Discordam)
Antes de qualquer destes números entrar neste artigo, fizemos a parte pouco glamorosa: recolhemos a tabela de avaliações publicada do GPT-5.5 da OpenAI e verificámos cada linha Pro com rastreadores independentes, em vez de confiar numa captura de ecrã. As fontes que cruzámos foram llm-stats, BenchLM, a análise do Fable 5 da DataCamp, CodingFleet e o artigo do SWE-Bench Pro no arXiv (2509.16941). Aqui está o que se confirmou e o que não se confirmou.
A maioria dos números de destaque do Pro reconcilia-se de forma limpa. BrowseComp 90,1%, FrontierMath Tier 1–3 52,4% e Tier 4 39,6%, e o preço de 30 $/180 $ coincidiram em todas as fontes que verificámos. SWE-Bench Pro a 80,3% para o Fable 5 versus 58,6% para o GPT-5.5 base, e FrontierCode Diamond a 29,3% versus 5,7%, também se confirmaram — e a contagem de tarefas do SWE-Bench Pro (1.865 problemas em 41 repositórios) vem diretamente do artigo, não de um blog de fornecedor.
Três coisas não se reconciliaram, e deve saber disso:
- O Humanity's Last Exam, com ferramentas, para o Fable 5 aparece entre 56,8% e 59,0% dependendo da fonte. Citamos o intervalo em vez de escolher um favorito.
- Os números do Terminal-Bench oscilam entre a versão 2.0 e 2.1 nas tabelas da OpenAI e da Anthropic, pelo que a diferença GPT-5.5 (83,4%) vs Fable (88,0%) não é uma comparação limpa.
- A pontuação de Modelação de Banca de Investimento (88,6% Pro) está rotulada como "interna" pela OpenAI, o que significa que nenhum rastreador independente a pode confirmar. Sinalizamo-la como alegação do fornecedor sempre que aparece.
Essa é a versão honesta. Os números que apresentamos como facto reconciliaram-se em pelo menos duas fontes independentes; tudo o resto é atribuído a quem o reportou. Não executámos o GPT-5.5 Pro nós próprios — a 30 $/180 $ por milhão de tokens, uma comparação séria não é algo que vamos fingir, pelo que não vamos pretender ter resultados laboratoriais que não temos.
Resultados do Mundo Real que os Fornecedores Estão a Reportar
Estas são alegações dos fornecedores, não resultados laboratoriais independentes, pelo que as deve ler como evidência próxima de marketing. A OpenAI e a Anthropic publicaram cada uma estudos de caso que pintam um quadro favorável. Listamo-los atribuídos, com a ressalva de que nenhum foi verificado por nós.
Do lado da OpenAI, a empresa diz que uma equipa financeira usou o Codex com GPT-5.5 para rever 24.771 formulários fiscais K-1 (71.637 páginas), terminando aproximadamente duas semanas mais rápido do que o processo do ano anterior. A OpenAI reporta também uma aplicação de geometria algébrica funcional construída a partir de um único prompt em 11 minutos, e uma análise do GPT-5.5 Pro de um conjunto de dados de expressão génica abrangendo 62 amostras e cerca de 28.000 genes.
Do lado da Anthropic, a Stripe (reportada via Anthropic) usou o Fable 5 para executar uma migração de toda a base de código num codebase Ruby de 50 milhões de linhas num único dia, contra uma estimativa de mais de 2 meses manualmente. A Anthropic diz também que o Fable 5 completou o Pokémon FireRed a partir de capturas de ecrã brutas, onde modelos Claude anteriores precisavam de ferramentas de scaffolding adicionais, e que com memória persistente baseada em ficheiros jogou Slay the Spire aproximadamente 3× melhor que o Opus 4.8.
Demonstrações impressionantes, todas elas. Apenas lembre-se de que são escolhidas pelos fornecedores e não reproduzíveis apenas a partir do comunicado de imprensa.
Que Modelo Deve Realmente Usar?
Adapte o modelo ao trabalho, não ao hype. Para agentes de código e repositórios grandes, recorra ao Claude Fable 5 se estiver disponível para si, e ao GPT-5.5 base integrado num scaffold de código se não estiver. Para investigação, matemática de fronteira e navegação profunda, o GPT-5.5 Pro é a escolha. Para trabalho diário e eficiência de custos, o GPT-5.5 base ganha em valor quase sempre.
Algumas orientações se está a escolher uma stack em vez de uma única chamada. Se quer realmente um sistema de código autónomo, quer uma ferramenta, não um modelo bruto, por isso comece com os melhores agentes de código IA em 2026 e o comparativo de agentes de código em segundo plano para o contexto do Codex e Devin. Curioso sobre para onde a família vai a seguir? Aqui está o que se sabe sobre o GPT-5.6.
Na Techsy, encaminhamos por tarefa nas nossas pipelines de agentes — modelos de raciocínio de topo para as decisões difíceis e modelos mais baratos para o resto — em vez de pagar tarifas premium em cada pedido. Se quer uma segunda opinião sobre a sua própria combinação de modelos, obtenha uma consulta gratuita.
Sobre o Autor
Mert Batur Gurbuz é Co-Fundador da Techsy.io, onde a equipa entrega agentes de IA, sistemas de automação e pipelines de voz/SDR para clientes B2B. Estuda na University of Birmingham e escreve sobre a stack de ferramentas de LLM que a equipa Techsy realmente usa em produção. Ligue-se no LinkedIn.
Perguntas Frequentes
O GPT-5.5 Pro vale a pena?
Depende do trabalho. Para investigação difícil, matemática de fronteira e navegação profunda, os ganhos do GPT-5.5 Pro sobre o base (BrowseComp 90,1% vs 84,4%) justificam o preço aproximadamente 6× de 30 $/180 $ por milhão de tokens. Para redação quotidiana, revisão de código e resumos, o GPT-5.5 base dá-lhe quase a mesma qualidade por um sexto do custo.
O GPT-5.5 Pro é melhor que o Claude Fable 5?
Nos benchmarks de código publicados, não: o Claude Fable 5 bate o GPT-5.5 base no SWE-Bench Pro (80,3% vs 58,6%), e a OpenAI nunca publicou um resultado de código Pro para comparar. O GPT-5.5 Pro ganha em navegação e matemática de fronteira. Um senão: o Fable 5 está atualmente suspenso ao abrigo de uma diretiva de controlo de exportações dos EUA, pelo que a disponibilidade importa tanto quanto o benchmark.
Quão bom é o GPT-5.5 Pro em código?
Honestamente, não podemos dizer a partir dos números da OpenAI, porque a OpenAI não publicou um resultado de código do GPT-5.5 Pro. O único número de código para a família é o resultado do GPT-5.5 base no SWE-Bench Pro de 58,6%, que fica atrás dos 80,3% do Claude Fable 5. Quem citar um "benchmark de código Pro" está provavelmente a citar o número base por engano.
GPT-5.5 Pro vs GPT-5.5 standard — qual devo usar?
Use o GPT-5.5 Pro para investigação difícil, matemática de fronteira e navegação profunda multi-etapas, onde a sua capacidade computacional paralela extra justifica o preço 6×. Use o GPT-5.5 base para trabalho diário, revisão de código e resumos, onde o prémio compra pouco. Em alguns testes, como o GDPval, a tabela da OpenAI até coloca o Pro ligeiramente abaixo do base.
Quanto custa o GPT-5.5 Pro?
O GPT-5.5 Pro custa 30 $ por milhão de tokens de entrada e 180 $ por milhão de tokens de saída, aproximadamente 6× os 5 $/30 $ do GPT-5.5 base. Para comparação, o Claude Fable 5 situa-se nos 10 $/50 $. Em cargas de trabalho com muita saída, o prémio Pro acumula-se rapidamente, pelo que encaminhar por dificuldade de tarefa em vez de usar o Pro por defeito poupa dinheiro real.
O que é o esforço de raciocínio "xhigh"?
O esforço de raciocínio é o dial que controla quão intensamente o GPT-5.5 pensa antes de responder. "xhigh" é o nível máximo, onde o modelo usa capacidade computacional paralela em tempo de teste para explorar vários caminhos de raciocínio e escolher o melhor. A OpenAI executou as suas avaliações publicadas do GPT-5.5 Pro em xhigh num ambiente de investigação, o que difere do padrão de produção do ChatGPT.
O GPT-5.5 Pro está disponível no Codex?
Sim. Pode invocar o GPT-5.5 Pro no Codex CLI usando a string de modelo gpt-5.5-pro, e definir o esforço de raciocínio para xhigh para o comportamento de maior capacidade computacional. Espere latência mais elevada e custo de tokens notavelmente superior ao GPT-5.5 base, pelo que deve reservá-lo para tarefas genuinamente difíceis em vez de o usar como modelo de código padrão.
O GPT-5.5 Pro é um modelo novo?
Não. O GPT-5.5 Pro é o mesmo modelo GPT-5.5 a funcionar com mais esforço de raciocínio e capacidade computacional paralela em tempo de teste na definição xhigh, não uma arquitetura separada. Partilha os mesmos pesos e a mesma janela de contexto de aproximadamente 1,1M tokens de entrada e 128K de saída. Está a pagar por mais tempo de pensamento, não por um modelo base mais inteligente.
Qual é a janela de contexto do GPT-5.5 Pro?
O GPT-5.5 Pro tem uma janela de contexto de cerca de 1,1M tokens de entrada e 128K tokens de saída, o mesmo que o GPT-5.5 base. É suficiente para carregar codebases grandes ou documentos longos numa única chamada. A diferença entre Pro e base não é o tamanho da memória; é quanta capacidade computacional de raciocínio o modelo gasta antes de responder.