Techsy
Contacto
Começar
Voltar ao blog
ai-machine-learning

Prompting de Cadeia de Pensamento em 2026: Quando Funciona, Quando Prejudica

Escrito por Mert Batur Gürbüz
Jul 19, 2026
13 min de leitura
Índice
Prompting de Cadeia de Pensamento em 2026: Quando Funciona, Quando Prejudica

O prompting de cadeia de pensamento tem um problema em 2026 que os principais guias ignoram: o mesmo truque que tornou os modelos mais inteligentes em 2022 pode, hoje, silenciosamente piorar o desempenho de um modelo de raciocínio. Wei et al. introduziram-no em 2022, e este aumentou a precisão em matemática complexa e lógica ao levar os modelos a mostrar os seus passos de raciocínio. Havia uma ressalva. Só funcionava efetivamente quando os modelos ultrapassavam aproximadamente 100 mil milhões de parâmetros. Atualmente, os modelos de raciocínio da série o e o GPT-5 realizam esse pensamento internamente, pelo que dizer-lhes para "pensarem passo a passo" muitas vezes apenas consome tokens. Quando deve ainda utilizá-lo e quando deve ignorá-lo?

Principais conclusões:

  • O prompting de cadeia de pensamento mostra os passos de raciocínio de um modelo e aumenta a precisão em tarefas de matemática, lógica e código com múltiplos passos.
  • É uma capacidade emergente: mal ajuda modelos pequenos, e os modelos de raciocínio já o fazem internamente.
  • Na série o, no raciocínio do GPT-5 e no pensamento estendido do Claude, o comando manual "pense passo a passo" é frequentemente redundante.
  • Continue a usar CoT manual em modelos não dedicados ao raciocínio e em modelos open-source locais, ou quando precisar de um caminho de raciocínio auditável.

O Que É o Prompting de Cadeia de Pensamento?

O prompting de cadeia de pensamento (CoT) é uma técnica que pede a um modelo de linguagem para resolver um problema através de passos intermédios explícitos antes de fornecer uma resposta final. Introduzido por Wei et al. em 2022, melhora a precisão em tarefas de matemática com múltiplos passos, lógica e senso comum, e torna visível o raciocínio do modelo.

Se fizer uma pergunta complexa a um modelo simples sem contexto, este muitas vezes dá a resposta errada precipitadamente. Se lhe pedir para raciocinar primeiro, as probabilidades de acerto aumentam. Considere: "Uma prateleira tem 3 caixas com 7 livros cada; retiro 5. Quantos sobram?" Sem contexto, um modelo pequeno pode responder "21". Adicione "Vamos pensar passo a passo" e ele escreve: 3 x 7 = 21, depois 21 - 5 = 16. O mesmo modelo, uma resposta melhor, e consegue ver onde errou se tal acontecer. O CoT é uma ferramenta dentro do conjunto mais vasto do nosso guia de engenharia de prompts; este post foca-se exclusivamente nele.

Como Funciona (e Por Que Só Resultou em Grande Escala)

O CoT funciona fazendo com que o modelo gere um caminho de raciocínio em linguagem natural, token por token, de modo que cada conclusão intermédia condiciona a seguinte. Wei et al. (2022) descobriram que esta é uma capacidade emergente: mal ajuda modelos pequenos e só produz grandes ganhos de precisão quando os modelos ultrapassam aproximadamente 100 mil milhões de parâmetros.

Pense nisto como mostrar o seu trabalho numa aula de matemática. Um modelo prevê um token de cada vez, e cada palavra que escreve faz parte do input para a próxima palavra. Quando escreve "21" como resultado intermédio, esse "21" fica agora no contexto, orientando o passo final para "16". Se saltar os passos, o modelo tem de saltar diretamente para a resposta sem nada em que se apoiar. A parte estranha é que este benefício só aparece em escala. No artigo fundador, a equipa de Wei descobriu que modelos minúsculos quase não obtinham melhorias e, às vezes, tinham um desempenho pior. É por isso que o mesmo prompt que falha num modelo local de 7B pode transformar um modelo de ponta.

As Três Variantes: Zero-Shot, Few-Shot e Autoconsistência

Existem três variantes principais de CoT. Zero-shot CoT apenas acrescenta "Vamos pensar passo a passo" (Kojima et al., 2022). Few-shot CoT mostra primeiro exemplos de raciocínio resolvidos. Autoconsistência (Wang et al., 2022) amostra vários caminhos de raciocínio e aceita a maioria dos votos para a resposta, sendo a mais fiável e a mais cara das três.

Zero-shot é o truque de magia preguiçoso. Adiciona uma frase e o modelo raciocina sem quaisquer exemplos. Kojima et al. mostraram que "Vamos pensar passo a passo" por si só transforma um grande modelo num razoável solucionador zero-shot.

python
# Zero-shot CoT: append the trigger phrase. Best on non-reasoning models.
# Model names change fast, so treat the string below as a placeholder.
from openai import OpenAI
client = OpenAI()

prompt = (
    "Q: A shelf holds 3 boxes. Each box has 7 books. "
    "I remove 5 books. How many are left?\n"
    "A: Let's think step by step."
)

resp = client.chat.completions.create(
    model="your-non-reasoning-model",
    messages=[{"role": "user", "content": prompt}],
)
print(resp.choices[0].message.content)

O Few-shot CoT vai mais longe: fornece ao modelo dois ou três exemplos resolvidos para que este copie o padrão de raciocínio para o seu domínio. A autoconsistência é o botão de precisão. Em vez de confiar numa única cadeia, amostra cinco a uma temperatura mais elevada e deixa-as votar. Wang et al. descobriram que a resposta majoritária está geralmente correta, mesmo quando cadeias individuais se desviam.

python
# Self-consistency: sample N reasoning paths, majority-vote the answer.
# More accurate, more expensive. Wang et al., 2022.
from collections import Counter

def self_consistency(prompt, n=5, temperature=0.7):
    answers = []
    for _ in range(n):
        resp = client.chat.completions.create(
            model="your-non-reasoning-model",
            messages=[{"role": "user", "content": prompt}],
            temperature=temperature,  # diversity across paths
        )
        answers.append(extract_final_answer(resp.choices[0].message.content))
    return Counter(answers).most_common(1)[0][0]  # majority vote

Quer esse raciocínio em JSON limpo em vez de texto livre? Combine o CoT com os padrões do nosso guia de saídas estruturadas para que um passo subsequente o possa analisar.

A Mudança de 2026: Os Modelos de Raciocínio Mudaram as Regras

Os modelos de raciocínio, como a série o e o GPT-5 reasoning da OpenAI, o pensamento estendido do Claude e o DeepSeek R1, realizam a cadeia de pensamento internamente antes de responder. A própria orientação da OpenAI afirma explicitamente que dizer a estes modelos para "pensarem passo a passo" é desnecessário, e que pedir a um modelo de raciocínio para raciocinar mais pode realmente prejudicar o desempenho. A estrutura já está integrada.

Esta é a parte que os guias mais antigos fingem que não está a acontecer. Um modelo de raciocínio produz uma cadeia de pensamento privada antes de sequer lhe mostrar uma resposta, pelo que o passo a passo que costumava escrever manualmente agora acontece nos bastidores. As melhores práticas de raciocínio da OpenAI são claras: "Evite prompts de cadeia de pensamento: Uma vez que estes modelos realizam raciocínio internamente, solicitá-los a 'pensar passo a passo' ou 'explicar o seu raciocínio' é desnecessário." O seu guia de prompting para o3/o4-mini vai um passo além: "Pedir a um modelo de raciocínio para raciocinar mais pode realmente prejudicar o desempenho."

O pensamento estendido da Anthropic é a mesma ideia transformada em produto. Dá ao Claude um orçamento de pensamento em vez de um script passo a passo, e os modelos mais recentes decidem por si próprios quão profundamente devem pensar. Neste tipo de modelo, ajusta-se o reasoning_effort ou o orçamento de pensamento, não a redação. Para o lado dos modelos de raciocínio open-source, incluindo o DeepSeek R1, consulte a nossa análise Qwen vs DeepSeek vs GLM.

Quando o CoT Manual Ainda Ajuda vs Quando Prejudica

O CoT manual ainda ajuda em modelos não dedicados ao raciocínio e em modelos open-source pequenos ou locais, ou quando precisa de uma estrutura de raciocínio específica ou de um rasto auditável. Prejudica em modelos de raciocínio nativos (redundante e mais lento), em tarefas simples de um único passo e em caminhos sensíveis à latência ou ao custo, onde apenas consome tokens sem ganho de precisão.

O CoT manual ainda ajuda quandoO CoT manual prejudica quando
Está a usar um modelo não dedicado ao raciocínio (GPT antigo, Llama base)Está a usar um modelo de raciocínio (série o, GPT-5 reasoning, pensamento do Claude)
Executa um modelo open-source pequeno ou localA tarefa é uma consulta, classificação ou mudança de formato de um único passo
Precisa de uma estrutura de raciocínio fixa e auditávelEstá num caminho sensível à latência e em tempo real
A tarefa envolve matemática, lógica ou planeamento com múltiplos passosEstá num endpoint de alto volume e sensível ao custo
Quer um rasto visível que possa inspecionar ou filtrarO modelo já raciocina internamente, pelo que os passos apenas se repetem

Eis um exemplo real da nossa própria operação. O pipeline de 12 agentes que escreveu este post funciona em modelos Claude, e deliberadamente nunca dizemos a esses agentes para "pensarem passo a passo", porque os modelos já raciocinam internamente e isso apenas adicionaria ruído. O que escrevemos manualmente são estruturas de raciocínio rígidas e filtráveis. O nosso agente validador executa uma rubrica fixa de 100 pontos (50 qualidade, 50 SEO) mais oito verificações sequenciais. O tradutor segue uma lista de verificação definida: corresponder à contagem de H2 da fonte, executar uma filtragem de diacríticos que tem de retornar mais que zero, e manter-se dentro de uma banda de contagem de linhas entre 80 e 120 por cento. O editor executa verificações pré e pós-publicação que verificam via regex a datetime publishedAt, e depois consulta o CMS para confirmar que o corpo não está vazio.

Nada disto tem a ver com pensar mais. É um caminho fixo e auditável que podemos inspecionar e filtrar, que é exatamente o caso em que "o CoT manual ainda ajuda". Adicionámos estas verificações por uma razão: um valor publishedAt apenas com data ocultou silenciosamente um post inteiro do nosso índice do blog, pelo que a sequência rígida de passos existe agora para impedir que o modelo salte uma verificação. Uma ressalva honesta: isto é uma observação operacional, não um benchmark. Não executámos um teste A/B controlado de precisão entre "pensar passo a passo" e nenhuma instrução, pelo que considere isto como uma lição sobre estrutura e auditabilidade, não uma afirmação numérica.

Executa modelos locais onde o CoT manual ainda vale a pena? A nossa compilação dos melhores LLMs open-source de 2026 cobre o campo. E se alguma vez expuser a cadeia de pensamento de um modelo aos utilizadores, trate-a como output não confiável; o nosso guia de prevenção de injeção de prompts explica porquê.

O Custo Oculto: Tokens, Latência e a Sua Fatura

O CoT não é gratuito. Cada passo de raciocínio são tokens de output pelos quais paga, e gerações mais longas aumentam a latência. Os modelos de raciocínio faturam tokens de raciocínio ocultos além da resposta visível. Em endpoints de alto volume ou em tempo real, forçar o output passo a passo pode silenciosamente multiplicar o custo, pelo que deve orçamentar para isso ou limitá-lo com reasoning_effort.

Cada "passo 1, passo 2, passo 3" que o modelo escreve são tokens de output, e os tokens de output são os mais caros. Uma cadeia cinco vezes mais longa que a resposta nua custa aproximadamente cinco vezes mais nessa chamada, e é transmitida mais lentamente. Os modelos de raciocínio adicionam uma nuance: faturam tokens de raciocínio pelo pensamento interno que nunca vê, pelo que uma resposta final curta pode esconder uma cadeia longa e paga. Num endpoint de baixo volume, isso é irrelevante; num de alto tráfego, aumenta rapidamente. Dois hábitos mantêm a situação sob controlo. Coloque em cache as partes estáveis do seu contexto para não pagar para as reler (o nosso guia de caching de prompts mostra como), e meça se os tokens extra realmente compram precisão antes de implementar o CoT em todo o lado. O nosso guia de avaliação de LLM cobre essa medição, para que não pague por raciocínio que não melhora a pontuação.

Como Usar CoT em 2026: Uma Lista de Verificação de Decisão

Primeiro, identifique a classe do seu modelo. Num modelo de raciocínio, ignore o CoT manual e ajuste o reasoning_effort ou o orçamento de pensamento. Num modelo não dedicado ao raciocínio ou local, adicione zero-shot "Vamos pensar passo a passo", atualize para few-shot para tarefas de domínio e adicione autoconsistência apenas quando a precisão importar mais do que o custo dos tokens.

Eis toda a decisão em cinco passos:

  1. Identifique a classe do seu modelo. Modelo de raciocínio ou não? Esse único facto decide tudo o que se segue.
  2. Num modelo de raciocínio, não escreva CoT manualmente. Ajuste o reasoning_effort ou o orçamento de pensamento e deixe o modelo raciocinar internamente.
  3. Num modelo não dedicado ao raciocínio ou local, adicione zero-shot "Vamos pensar passo a passo". É uma linha e é grátis experimentar.
  4. Para tarefas específicas de domínio, atualize para CoT few-shot com dois ou três exemplos resolvidos. Adicione autoconsistência apenas quando a precisão superar o custo dos tokens.
  5. Se expuser o raciocínio, meça-o com avaliações e trate a cadeia visível como output não confiável.

A frase de gatilho geralmente reside no seu prompt de sistema. Os nossos exemplos de prompts de sistema mostram onde colocar e como formular.

python
# On a reasoning model, don't hand-write CoT. Tune the effort instead.
# Param names and levels change per provider and version, so check current docs.
resp = client.responses.create(
    model="your-reasoning-model",
    reasoning={"effort": "medium"},   # e.g. low | medium | high
    input="Prove that the square root of 2 is irrational.",
)

# Anthropic equivalent: an extended-thinking budget.
# budget_tokens MUST be less than max_tokens.
# thinking = {"type": "enabled", "budget_tokens": 4000}

Integrar isto numa stack de produção é mais complicado do que um exemplo de blog sugere. Se preferir não ajustar orçamentos de raciocínio e harnesses de avaliação você mesmo, a nossa equipa constrói estes pipelines de ponta a ponta. Consulte integração de IA ou entre em contacto.

Sobre o Autor

Mert Batur Gurbuz é Co-Fundador da Techsy.io, onde a equipa desenvolve agentes de IA, sistemas de automação e pipelines de voz/SDR para clientes B2B. Estuda na Universidade de Birmingham e escreve sobre a stack de ferramentas LLM que a equipa da Techsy realmente usa em produção.

Co-Fundador, Techsy.io, Universidade de Birmingham. Conecte-se no LinkedIn.

Perguntas Frequentes

O prompting de cadeia de pensamento ainda é relevante em 2026?

Sim, mas o seu papel diminuiu. Em modelos não dedicados ao raciocínio e em modelos open-source pequenos ou locais, o CoT manual ainda aumenta a precisão em tarefas com múltiplos passos. Em modelos de raciocínio, é maioritariamente redundante. O uso restante mais forte é forçar um caminho de raciocínio fixo e auditável que possa inspecionar.

O prompting de cadeia de pensamento funciona em modelos de raciocínio como o GPT-5, o3 ou Claude?

Estes modelos já raciocinam internamente, pelo que o CoT manual é geralmente redundante e às vezes prejudicial. A documentação da OpenAI afirma que solicitar-lhes que "pensem passo a passo" é desnecessário, e que pedir-lhes para raciocinarem mais "pode realmente prejudicar o desempenho". Ajuste o esforço de raciocínio em vez de escrever passos.

O que é o prompting de cadeia de pensamento zero-shot?

Zero-shot CoT significa adicionar uma frase de gatilho, geralmente "Vamos pensar passo a passo", sem fornecer quaisquer exemplos resolvidos previamente. Kojima et al. (2022) mostraram que isto por si só transforma um grande modelo num razoável solucionador. É a variante de CoT mais barata: uma linha, sem curadoria de exemplos, rápida de testar.

O que é a autoconsistência no prompting de cadeia de pensamento?

A autoconsistência, de Wang et al. (2022), amostra várias cadeias de raciocínio independentes a uma temperatura mais elevada, e depois aceita a maioria dos votos para a resposta final. É a variante de CoT mais precisa porque cadeias erradas raramente concordam, mas paga por cada caminho amostrado, pelo que é também a mais cara.

Qual é a diferença entre cadeia de pensamento e prompting few-shot?

O prompting few-shot mostra ao modelo pares de input-output de exemplo. A cadeia de pensamento foca-se no raciocínio entre o input e o output. Combinam-se bem: o CoT few-shot fornece exemplos resolvidos que incluem os passos de raciocínio, para que o modelo copie o seu padrão de raciocínio, não apenas o formato da sua resposta.

Cadeia de pensamento vs encadeamento de prompts vs árvore de pensamento: qual é a diferença?

A cadeia de pensamento raciocina dentro de um único prompt. O encadeamento de prompts divide uma tarefa em várias chamadas separadas ao modelo, passando os outputs para a frente. A árvore de pensamento explora múltiplos ramos de raciocínio e poda os fracos. O CoT é um único caminho linear; os outros dois adicionam estrutura externa em torno do modelo.

Quem inventou o prompting de cadeia de pensamento?

O prompting de cadeia de pensamento foi introduzido por Jason Wei e colegas da Google no artigo de 2022 "Chain-of-Thought Prompting Elicits Reasoning in Large Language Models". Kojima et al. adicionaram posteriormente o CoT zero-shot, e Wang et al. adicionaram a autoconsistência, ambos também em 2022.

O prompting de cadeia de pensamento funciona para geração de código?

Sim, em modelos não dedicados ao raciocínio. Pedir ao modelo para planear a lógica antes de escrever código deteta casos extremos e reduz erros em tarefas complexas. Em modelos de raciocínio, o planeamento acontece internamente, pelo que uma instrução simples geralmente funciona melhor do que um prefixo manual "raciocine passo a passo".

Etiquetas

prompting de cadeia de pensamentoprompting cotzero-shot cotautoconsistênciamodelos de raciocínioengenharia de prompts

Partilhar este artigo

Artigos relacionados

Mais em ai-machine-learning

ai-machine-learning
Jul 20, 2026

8 Melhores APIs de Web Scraping com IA em 2026 (Testadas na Nossa Própria Stack de Agentes)

Testámos 8 APIs de web scraping com IA com preços reais de 2026, obtidos através da nossa própria stack de agentes. Firecrawl, Bright Data, ScrapingBee e mais 5, classificadas por output pronto para LLM, anti-bot e suporte MCP.

9 min read min de leitura
Ler
ai-machine-learning
Jul 20, 2026

Engenharia de Prompts para Programação: 7 Padrões Que Usamos Diariamente no Claude Code e Cursor (2026)

A maioria dos artigos sobre 'prompts de IA para programação' oferece 50 modelos para copiar. Este ensina os 7 padrões que usamos todos os dias para gerir um pipeline de 16 agentes no Claude Code, com exemplos reais de antes e depois, além de indicar onde cada padrão se encaixa no Claude Code, Cursor e Copilot em 2026.

11 min read min de leitura
Ler
ai-machine-learning
Jul 19, 2026

Da PoC de IA à Produção: O Checklist de 12 Pontos Antes de Lançar

Uma demo de IA funcional não é um sistema em produção. Este checklist de 12 pontos percorre as três fases que qualquer funcionalidade de IA precisa antes do lançamento: reforçar, estabilizar e implementar, com limites concretos para tetos de custos, limites de taxa, fallbacks e gatilhos de rollback.

10 min read min de leitura
Ler
Ver todos os artigos
Inicia o Teu Projeto

Pronto para criar algo extraordinário?

Vamos transformar a sua visão em realidade. A nossa equipa está pronta para o ajudar a criar software que faz a diferença.

Marca uma chamada de scope 30 minVer o Nosso Trabalho

Destaque da biblioteca

Skills do Claude

Ver tudo
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automações AI

Ver tudo
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Destaque da biblioteca

Skills do Claude

Ver tudo
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automações AI

Ver tudo
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Serviços

  • Soluções Empresariais
  • Aplicações Móveis
  • Aplicações Web

Soluções

  • Sistemas CRM
  • Integração de IA
  • Soluções ERP
  • Agentes de Voz
  • Automação de Processos
  • Cibersegurança

Biblioteca

  • Blogue
  • Portfólio

Comunidade

  • Automações AI
  • Skills do Claude

Ferramentas

  • Calculadora de Custo de App Móvel
  • Calculadora de Custo de API OpenAI / LLM
  • Calculadora de Custo de MVP
  • Calculadora de Custo de Agente de Voz AI

Empresa

  • Sobre
  • Parceiros
  • Contacto

Legal

  • Política de Privacidade
  • Termos de Serviço
  • Política de Cookies

Serviços

  • Soluções Empresariais
  • Aplicações Móveis
  • Aplicações Web

Soluções

  • Sistemas CRM
  • Integração de IA
  • Soluções ERP
  • Agentes de Voz
  • Automação de Processos
  • Cibersegurança

Biblioteca

  • Blogue
  • Portfólio

Comunidade

  • Automações AI
  • Skills do Claude

Ferramentas

  • Calculadora de Custo de App Móvel
  • Calculadora de Custo de API OpenAI / LLM
  • Calculadora de Custo de MVP
  • Calculadora de Custo de Agente de Voz AI

Empresa

  • Sobre
  • Parceiros
  • Contacto
LegalPolítica de PrivacidadeTermos de ServiçoPolítica de Cookies
TECHSY
© 2026 Techsy. Todos os direitos reservados.