
O prompting de cadeia de pensamento tem um problema em 2026 que os principais guias ignoram: o mesmo truque que tornou os modelos mais inteligentes em 2022 pode, hoje, silenciosamente piorar o desempenho de um modelo de raciocínio. Wei et al. introduziram-no em 2022, e este aumentou a precisão em matemática complexa e lógica ao levar os modelos a mostrar os seus passos de raciocínio. Havia uma ressalva. Só funcionava efetivamente quando os modelos ultrapassavam aproximadamente 100 mil milhões de parâmetros. Atualmente, os modelos de raciocínio da série o e o GPT-5 realizam esse pensamento internamente, pelo que dizer-lhes para "pensarem passo a passo" muitas vezes apenas consome tokens. Quando deve ainda utilizá-lo e quando deve ignorá-lo?
Principais conclusões:
- O prompting de cadeia de pensamento mostra os passos de raciocínio de um modelo e aumenta a precisão em tarefas de matemática, lógica e código com múltiplos passos.
- É uma capacidade emergente: mal ajuda modelos pequenos, e os modelos de raciocínio já o fazem internamente.
- Na série o, no raciocínio do GPT-5 e no pensamento estendido do Claude, o comando manual "pense passo a passo" é frequentemente redundante.
- Continue a usar CoT manual em modelos não dedicados ao raciocínio e em modelos open-source locais, ou quando precisar de um caminho de raciocínio auditável.
O Que É o Prompting de Cadeia de Pensamento?
O prompting de cadeia de pensamento (CoT) é uma técnica que pede a um modelo de linguagem para resolver um problema através de passos intermédios explícitos antes de fornecer uma resposta final. Introduzido por Wei et al. em 2022, melhora a precisão em tarefas de matemática com múltiplos passos, lógica e senso comum, e torna visível o raciocínio do modelo.
Se fizer uma pergunta complexa a um modelo simples sem contexto, este muitas vezes dá a resposta errada precipitadamente. Se lhe pedir para raciocinar primeiro, as probabilidades de acerto aumentam. Considere: "Uma prateleira tem 3 caixas com 7 livros cada; retiro 5. Quantos sobram?" Sem contexto, um modelo pequeno pode responder "21". Adicione "Vamos pensar passo a passo" e ele escreve: 3 x 7 = 21, depois 21 - 5 = 16. O mesmo modelo, uma resposta melhor, e consegue ver onde errou se tal acontecer. O CoT é uma ferramenta dentro do conjunto mais vasto do nosso guia de engenharia de prompts; este post foca-se exclusivamente nele.
Como Funciona (e Por Que Só Resultou em Grande Escala)
O CoT funciona fazendo com que o modelo gere um caminho de raciocínio em linguagem natural, token por token, de modo que cada conclusão intermédia condiciona a seguinte. Wei et al. (2022) descobriram que esta é uma capacidade emergente: mal ajuda modelos pequenos e só produz grandes ganhos de precisão quando os modelos ultrapassam aproximadamente 100 mil milhões de parâmetros.
Pense nisto como mostrar o seu trabalho numa aula de matemática. Um modelo prevê um token de cada vez, e cada palavra que escreve faz parte do input para a próxima palavra. Quando escreve "21" como resultado intermédio, esse "21" fica agora no contexto, orientando o passo final para "16". Se saltar os passos, o modelo tem de saltar diretamente para a resposta sem nada em que se apoiar. A parte estranha é que este benefício só aparece em escala. No artigo fundador, a equipa de Wei descobriu que modelos minúsculos quase não obtinham melhorias e, às vezes, tinham um desempenho pior. É por isso que o mesmo prompt que falha num modelo local de 7B pode transformar um modelo de ponta.
As Três Variantes: Zero-Shot, Few-Shot e Autoconsistência
Existem três variantes principais de CoT. Zero-shot CoT apenas acrescenta "Vamos pensar passo a passo" (Kojima et al., 2022). Few-shot CoT mostra primeiro exemplos de raciocínio resolvidos. Autoconsistência (Wang et al., 2022) amostra vários caminhos de raciocínio e aceita a maioria dos votos para a resposta, sendo a mais fiável e a mais cara das três.
Zero-shot é o truque de magia preguiçoso. Adiciona uma frase e o modelo raciocina sem quaisquer exemplos. Kojima et al. mostraram que "Vamos pensar passo a passo" por si só transforma um grande modelo num razoável solucionador zero-shot.
# Zero-shot CoT: append the trigger phrase. Best on non-reasoning models.
# Model names change fast, so treat the string below as a placeholder.
from openai import OpenAI
client = OpenAI()
prompt = (
"Q: A shelf holds 3 boxes. Each box has 7 books. "
"I remove 5 books. How many are left?\n"
"A: Let's think step by step."
)
resp = client.chat.completions.create(
model="your-non-reasoning-model",
messages=[{"role": "user", "content": prompt}],
)
print(resp.choices[0].message.content)O Few-shot CoT vai mais longe: fornece ao modelo dois ou três exemplos resolvidos para que este copie o padrão de raciocínio para o seu domínio. A autoconsistência é o botão de precisão. Em vez de confiar numa única cadeia, amostra cinco a uma temperatura mais elevada e deixa-as votar. Wang et al. descobriram que a resposta majoritária está geralmente correta, mesmo quando cadeias individuais se desviam.
# Self-consistency: sample N reasoning paths, majority-vote the answer.
# More accurate, more expensive. Wang et al., 2022.
from collections import Counter
def self_consistency(prompt, n=5, temperature=0.7):
answers = []
for _ in range(n):
resp = client.chat.completions.create(
model="your-non-reasoning-model",
messages=[{"role": "user", "content": prompt}],
temperature=temperature, # diversity across paths
)
answers.append(extract_final_answer(resp.choices[0].message.content))
return Counter(answers).most_common(1)[0][0] # majority voteQuer esse raciocínio em JSON limpo em vez de texto livre? Combine o CoT com os padrões do nosso guia de saídas estruturadas para que um passo subsequente o possa analisar.
A Mudança de 2026: Os Modelos de Raciocínio Mudaram as Regras
Os modelos de raciocínio, como a série o e o GPT-5 reasoning da OpenAI, o pensamento estendido do Claude e o DeepSeek R1, realizam a cadeia de pensamento internamente antes de responder. A própria orientação da OpenAI afirma explicitamente que dizer a estes modelos para "pensarem passo a passo" é desnecessário, e que pedir a um modelo de raciocínio para raciocinar mais pode realmente prejudicar o desempenho. A estrutura já está integrada.
Esta é a parte que os guias mais antigos fingem que não está a acontecer. Um modelo de raciocínio produz uma cadeia de pensamento privada antes de sequer lhe mostrar uma resposta, pelo que o passo a passo que costumava escrever manualmente agora acontece nos bastidores. As melhores práticas de raciocínio da OpenAI são claras: "Evite prompts de cadeia de pensamento: Uma vez que estes modelos realizam raciocínio internamente, solicitá-los a 'pensar passo a passo' ou 'explicar o seu raciocínio' é desnecessário." O seu guia de prompting para o3/o4-mini vai um passo além: "Pedir a um modelo de raciocínio para raciocinar mais pode realmente prejudicar o desempenho."
O pensamento estendido da Anthropic é a mesma ideia transformada em produto. Dá ao Claude um orçamento de pensamento em vez de um script passo a passo, e os modelos mais recentes decidem por si próprios quão profundamente devem pensar. Neste tipo de modelo, ajusta-se o reasoning_effort ou o orçamento de pensamento, não a redação. Para o lado dos modelos de raciocínio open-source, incluindo o DeepSeek R1, consulte a nossa análise Qwen vs DeepSeek vs GLM.
Quando o CoT Manual Ainda Ajuda vs Quando Prejudica
O CoT manual ainda ajuda em modelos não dedicados ao raciocínio e em modelos open-source pequenos ou locais, ou quando precisa de uma estrutura de raciocínio específica ou de um rasto auditável. Prejudica em modelos de raciocínio nativos (redundante e mais lento), em tarefas simples de um único passo e em caminhos sensíveis à latência ou ao custo, onde apenas consome tokens sem ganho de precisão.
| O CoT manual ainda ajuda quando | O CoT manual prejudica quando |
|---|---|
| Está a usar um modelo não dedicado ao raciocínio (GPT antigo, Llama base) | Está a usar um modelo de raciocínio (série o, GPT-5 reasoning, pensamento do Claude) |
| Executa um modelo open-source pequeno ou local | A tarefa é uma consulta, classificação ou mudança de formato de um único passo |
| Precisa de uma estrutura de raciocínio fixa e auditável | Está num caminho sensível à latência e em tempo real |
| A tarefa envolve matemática, lógica ou planeamento com múltiplos passos | Está num endpoint de alto volume e sensível ao custo |
| Quer um rasto visível que possa inspecionar ou filtrar | O modelo já raciocina internamente, pelo que os passos apenas se repetem |
Eis um exemplo real da nossa própria operação. O pipeline de 12 agentes que escreveu este post funciona em modelos Claude, e deliberadamente nunca dizemos a esses agentes para "pensarem passo a passo", porque os modelos já raciocinam internamente e isso apenas adicionaria ruído. O que escrevemos manualmente são estruturas de raciocínio rígidas e filtráveis. O nosso agente validador executa uma rubrica fixa de 100 pontos (50 qualidade, 50 SEO) mais oito verificações sequenciais. O tradutor segue uma lista de verificação definida: corresponder à contagem de H2 da fonte, executar uma filtragem de diacríticos que tem de retornar mais que zero, e manter-se dentro de uma banda de contagem de linhas entre 80 e 120 por cento. O editor executa verificações pré e pós-publicação que verificam via regex a datetime publishedAt, e depois consulta o CMS para confirmar que o corpo não está vazio.
Nada disto tem a ver com pensar mais. É um caminho fixo e auditável que podemos inspecionar e filtrar, que é exatamente o caso em que "o CoT manual ainda ajuda". Adicionámos estas verificações por uma razão: um valor publishedAt apenas com data ocultou silenciosamente um post inteiro do nosso índice do blog, pelo que a sequência rígida de passos existe agora para impedir que o modelo salte uma verificação. Uma ressalva honesta: isto é uma observação operacional, não um benchmark. Não executámos um teste A/B controlado de precisão entre "pensar passo a passo" e nenhuma instrução, pelo que considere isto como uma lição sobre estrutura e auditabilidade, não uma afirmação numérica.
Executa modelos locais onde o CoT manual ainda vale a pena? A nossa compilação dos melhores LLMs open-source de 2026 cobre o campo. E se alguma vez expuser a cadeia de pensamento de um modelo aos utilizadores, trate-a como output não confiável; o nosso guia de prevenção de injeção de prompts explica porquê.
O Custo Oculto: Tokens, Latência e a Sua Fatura
O CoT não é gratuito. Cada passo de raciocínio são tokens de output pelos quais paga, e gerações mais longas aumentam a latência. Os modelos de raciocínio faturam tokens de raciocínio ocultos além da resposta visível. Em endpoints de alto volume ou em tempo real, forçar o output passo a passo pode silenciosamente multiplicar o custo, pelo que deve orçamentar para isso ou limitá-lo com reasoning_effort.
Cada "passo 1, passo 2, passo 3" que o modelo escreve são tokens de output, e os tokens de output são os mais caros. Uma cadeia cinco vezes mais longa que a resposta nua custa aproximadamente cinco vezes mais nessa chamada, e é transmitida mais lentamente. Os modelos de raciocínio adicionam uma nuance: faturam tokens de raciocínio pelo pensamento interno que nunca vê, pelo que uma resposta final curta pode esconder uma cadeia longa e paga. Num endpoint de baixo volume, isso é irrelevante; num de alto tráfego, aumenta rapidamente. Dois hábitos mantêm a situação sob controlo. Coloque em cache as partes estáveis do seu contexto para não pagar para as reler (o nosso guia de caching de prompts mostra como), e meça se os tokens extra realmente compram precisão antes de implementar o CoT em todo o lado. O nosso guia de avaliação de LLM cobre essa medição, para que não pague por raciocínio que não melhora a pontuação.
Como Usar CoT em 2026: Uma Lista de Verificação de Decisão
Primeiro, identifique a classe do seu modelo. Num modelo de raciocínio, ignore o CoT manual e ajuste o reasoning_effort ou o orçamento de pensamento. Num modelo não dedicado ao raciocínio ou local, adicione zero-shot "Vamos pensar passo a passo", atualize para few-shot para tarefas de domínio e adicione autoconsistência apenas quando a precisão importar mais do que o custo dos tokens.
Eis toda a decisão em cinco passos:
- Identifique a classe do seu modelo. Modelo de raciocínio ou não? Esse único facto decide tudo o que se segue.
- Num modelo de raciocínio, não escreva CoT manualmente. Ajuste o
reasoning_effortou o orçamento de pensamento e deixe o modelo raciocinar internamente. - Num modelo não dedicado ao raciocínio ou local, adicione zero-shot "Vamos pensar passo a passo". É uma linha e é grátis experimentar.
- Para tarefas específicas de domínio, atualize para CoT few-shot com dois ou três exemplos resolvidos. Adicione autoconsistência apenas quando a precisão superar o custo dos tokens.
- Se expuser o raciocínio, meça-o com avaliações e trate a cadeia visível como output não confiável.
A frase de gatilho geralmente reside no seu prompt de sistema. Os nossos exemplos de prompts de sistema mostram onde colocar e como formular.
# On a reasoning model, don't hand-write CoT. Tune the effort instead.
# Param names and levels change per provider and version, so check current docs.
resp = client.responses.create(
model="your-reasoning-model",
reasoning={"effort": "medium"}, # e.g. low | medium | high
input="Prove that the square root of 2 is irrational.",
)
# Anthropic equivalent: an extended-thinking budget.
# budget_tokens MUST be less than max_tokens.
# thinking = {"type": "enabled", "budget_tokens": 4000}Integrar isto numa stack de produção é mais complicado do que um exemplo de blog sugere. Se preferir não ajustar orçamentos de raciocínio e harnesses de avaliação você mesmo, a nossa equipa constrói estes pipelines de ponta a ponta. Consulte integração de IA ou entre em contacto.
Sobre o Autor
Mert Batur Gurbuz é Co-Fundador da Techsy.io, onde a equipa desenvolve agentes de IA, sistemas de automação e pipelines de voz/SDR para clientes B2B. Estuda na Universidade de Birmingham e escreve sobre a stack de ferramentas LLM que a equipa da Techsy realmente usa em produção.
Co-Fundador, Techsy.io, Universidade de Birmingham. Conecte-se no LinkedIn.
Perguntas Frequentes
O prompting de cadeia de pensamento ainda é relevante em 2026?
Sim, mas o seu papel diminuiu. Em modelos não dedicados ao raciocínio e em modelos open-source pequenos ou locais, o CoT manual ainda aumenta a precisão em tarefas com múltiplos passos. Em modelos de raciocínio, é maioritariamente redundante. O uso restante mais forte é forçar um caminho de raciocínio fixo e auditável que possa inspecionar.
O prompting de cadeia de pensamento funciona em modelos de raciocínio como o GPT-5, o3 ou Claude?
Estes modelos já raciocinam internamente, pelo que o CoT manual é geralmente redundante e às vezes prejudicial. A documentação da OpenAI afirma que solicitar-lhes que "pensem passo a passo" é desnecessário, e que pedir-lhes para raciocinarem mais "pode realmente prejudicar o desempenho". Ajuste o esforço de raciocínio em vez de escrever passos.
O que é o prompting de cadeia de pensamento zero-shot?
Zero-shot CoT significa adicionar uma frase de gatilho, geralmente "Vamos pensar passo a passo", sem fornecer quaisquer exemplos resolvidos previamente. Kojima et al. (2022) mostraram que isto por si só transforma um grande modelo num razoável solucionador. É a variante de CoT mais barata: uma linha, sem curadoria de exemplos, rápida de testar.
O que é a autoconsistência no prompting de cadeia de pensamento?
A autoconsistência, de Wang et al. (2022), amostra várias cadeias de raciocínio independentes a uma temperatura mais elevada, e depois aceita a maioria dos votos para a resposta final. É a variante de CoT mais precisa porque cadeias erradas raramente concordam, mas paga por cada caminho amostrado, pelo que é também a mais cara.
Qual é a diferença entre cadeia de pensamento e prompting few-shot?
O prompting few-shot mostra ao modelo pares de input-output de exemplo. A cadeia de pensamento foca-se no raciocínio entre o input e o output. Combinam-se bem: o CoT few-shot fornece exemplos resolvidos que incluem os passos de raciocínio, para que o modelo copie o seu padrão de raciocínio, não apenas o formato da sua resposta.
Cadeia de pensamento vs encadeamento de prompts vs árvore de pensamento: qual é a diferença?
A cadeia de pensamento raciocina dentro de um único prompt. O encadeamento de prompts divide uma tarefa em várias chamadas separadas ao modelo, passando os outputs para a frente. A árvore de pensamento explora múltiplos ramos de raciocínio e poda os fracos. O CoT é um único caminho linear; os outros dois adicionam estrutura externa em torno do modelo.
Quem inventou o prompting de cadeia de pensamento?
O prompting de cadeia de pensamento foi introduzido por Jason Wei e colegas da Google no artigo de 2022 "Chain-of-Thought Prompting Elicits Reasoning in Large Language Models". Kojima et al. adicionaram posteriormente o CoT zero-shot, e Wang et al. adicionaram a autoconsistência, ambos também em 2022.
O prompting de cadeia de pensamento funciona para geração de código?
Sim, em modelos não dedicados ao raciocínio. Pedir ao modelo para planear a lógica antes de escrever código deteta casos extremos e reduz erros em tarefas complexas. Em modelos de raciocínio, o planeamento acontece internamente, pelo que uma instrução simples geralmente funciona melhor do que um prefixo manual "raciocine passo a passo".