
El chain of thought prompting (cadena de pensamiento) tiene un problema en 2026 que las guías principales pasan por alto: el mismo truco que hizo más inteligentes a los modelos en 2022 hoy puede empeorar silenciosamente a un modelo de razonamiento. Wei et al. lo introdujeron en 2022, y mejoraba la precisión en matemáticas y lógica complejas al hacer que los modelos mostraran sus pasos de razonamiento. Había una trampa: solo funcionaba una vez que los modelos superaban los 100.000 millones de parámetros aproximadamente. Ahora los modelos de razonamiento de la serie o y GPT-5 hacen ese pensamiento internamente, así que decirles "piensa paso a paso" a menudo solo quema tokens. ¿Cuándo conviene seguir usándolo y cuándo conviene saltárselo?
Puntos clave:
- El chain of thought prompting muestra los pasos de razonamiento de un modelo y mejora la precisión en tareas de matemáticas, lógica y código de varios pasos.
- Es una capacidad emergente: apenas ayuda a los modelos pequeños, y los modelos de razonamiento ya lo hacen internamente.
- En la serie o, GPT-5 reasoning y el extended thinking de Claude, pedir manualmente "piensa paso a paso" suele ser redundante.
- Sigue usando CoT manual en modelos sin razonamiento y modelos locales de código abierto, o cuando necesites un camino de razonamiento auditable.
¿Qué Es el Chain of Thought Prompting?
El chain of thought (CoT) prompting es una técnica que le pide a un modelo de lenguaje que resuelva un problema en pasos intermedios explícitos antes de dar una respuesta final. Introducida por Wei et al. en 2022, mejora la precisión en tareas de matemáticas, lógica y sentido común de varios pasos, y hace visible el razonamiento del modelo.
Pregúntale a un modelo normal un problema con palabras sin más y a menudo suelta el número equivocado. Pídele que razone primero, y las probabilidades suben. Toma este ejemplo: "Un estante tiene 3 cajas de 7 libros; quito 5. ¿Cuántos quedan?" En frío, un modelo pequeño podría responder "21". Añade "Pensemos paso a paso" y escribe: 3 x 7 = 21, luego 21 - 5 = 16. Mismo modelo, mejor respuesta, y puedes ver dónde se equivocó si lo hace. El CoT es una herramienta más dentro del conjunto más amplio de nuestra guía de ingeniería de prompts; este artículo se centra por completo en ella.
Cómo Funciona (y Por Qué Solo Encajó a Gran Escala)
El CoT funciona haciendo que el modelo genere una ruta de razonamiento en lenguaje natural token a token, de modo que cada conclusión intermedia condiciona la siguiente. Wei et al. (2022) descubrieron que se trata de una capacidad emergente: apenas ayuda a los modelos pequeños y solo produce mejoras grandes de precisión una vez que los modelos superan aproximadamente los 100.000 millones de parámetros.
Piénsalo como mostrar tu trabajo en clase de matemáticas. Un modelo predice un token a la vez, y cada palabra que escribe pasa a formar parte de la entrada para la siguiente palabra. Cuando escribe "21" como resultado intermedio, ese "21" ya está en el contexto, orientando el paso final hacia "16". Sáltate los pasos y el modelo tiene que saltar directo a la respuesta sin nada en qué apoyarse. Lo curioso es que este beneficio solo aparece a gran escala. En el artículo fundacional, el equipo de Wei descubrió que los modelos diminutos apenas mejoraban, y a veces empeoraban. Por eso el mismo prompt que falla en un modelo local de 7B puede transformar a uno de última generación.
Las Tres Variantes: Zero-Shot, Few-Shot y Autoconsistencia
Hay tres variantes principales de CoT. El zero-shot CoT simplemente añade "pensemos paso a paso" (Kojima et al., 2022). El few-shot CoT muestra antes ejemplos de razonamiento ya resueltos. La autoconsistencia (self-consistency, Wang et al., 2022) muestrea varias rutas de razonamiento y elige la respuesta por mayoría de votos: la más fiable y también la más cara de las tres.
El zero-shot es el truco de magia perezoso. Añades una sola frase y el modelo razona sin ningún ejemplo. Kojima et al. demostraron que "pensemos paso a paso" por sí solo convierte a un modelo grande en un razonador zero-shot decente.
# Zero-shot CoT: append the trigger phrase. Best on non-reasoning models.
# Model names change fast, so treat the string below as a placeholder.
from openai import OpenAI
client = OpenAI()
prompt = (
"Q: A shelf holds 3 boxes. Each box has 7 books. "
"I remove 5 books. How many are left?\n"
"A: Let's think step by step."
)
resp = client.chat.completions.create(
model="your-non-reasoning-model",
messages=[{"role": "user", "content": prompt}],
)
print(resp.choices[0].message.content)El few-shot CoT va más allá: le das al modelo dos o tres ejemplos resueltos para que copie el patrón de razonamiento en tu dominio. La autoconsistencia es el dial de la precisión. En lugar de confiar en una sola cadena, muestreas cinco a una temperatura más alta y dejas que voten. Wang et al. descubrieron que la respuesta mayoritaria suele ser correcta incluso cuando cadenas individuales se desvían.
# Self-consistency: sample N reasoning paths, majority-vote the answer.
# More accurate, more expensive. Wang et al., 2022.
from collections import Counter
def self_consistency(prompt, n=5, temperature=0.7):
answers = []
for _ in range(n):
resp = client.chat.completions.create(
model="your-non-reasoning-model",
messages=[{"role": "user", "content": prompt}],
temperature=temperature, # diversity across paths
)
answers.append(extract_final_answer(resp.choices[0].message.content))
return Counter(answers).most_common(1)[0][0] # majority vote¿Quieres ese razonamiento en JSON limpio en lugar de texto libre? Combina el CoT con los patrones de nuestra guía de salidas estructuradas para que un paso posterior pueda analizarlo.
El Cambio de 2026: los Modelos de Razonamiento Cambiaron las Reglas
Los modelos de razonamiento (la serie o de OpenAI y GPT-5 reasoning, el extended thinking de Claude, y DeepSeek R1) hacen el chain of thought internamente antes de responder. La propia guía de OpenAI dice que decirles explícitamente a estos modelos que "piensen paso a paso" es innecesario, y que pedirle a un modelo de razonamiento que razone más puede incluso perjudicar su rendimiento. El andamiaje ya viene incorporado.
Esta es la parte que las guías más antiguas prefieren ignorar. Un modelo de razonamiento genera una cadena de pensamiento privada antes de mostrarte nunca una respuesta, así que el paso a paso que antes escribías a mano ahora ocurre por debajo. Las buenas prácticas de razonamiento de OpenAI lo dicen sin rodeos: "Evita los prompts de chain-of-thought: dado que estos modelos razonan internamente, pedirles que 'piensen paso a paso' o 'expliquen su razonamiento' es innecesario." Su guía de prompting para o3/o4-mini va un paso más allá: "Pedirle a un modelo de razonamiento que razone más puede en realidad perjudicar el rendimiento."
El extended thinking de Anthropic es la misma idea convertida en producto. Le das a Claude un presupuesto de pensamiento en lugar de un guion paso a paso, y los modelos más recientes deciden por sí mismos qué tan a fondo pensar. En esta clase de modelos ajustas reasoning_effort o el presupuesto de pensamiento, no las palabras del prompt. Para el lado de los modelos de razonamiento abiertos, incluido DeepSeek R1, consulta nuestro análisis de Qwen vs DeepSeek vs GLM.
Cuándo el CoT Manual Todavía Ayuda vs. Cuándo Sale Mal
El CoT manual todavía ayuda en modelos sin razonamiento, modelos pequeños o locales de código abierto, o cuando necesitas una estructura de razonamiento específica o un rastro auditable. Sale mal en modelos de razonamiento nativos (redundante y más lento), en tareas simples de un solo paso, y en rutas sensibles a la latencia o al coste, donde solo quema tokens sin ninguna mejora de precisión.
| El CoT manual todavía ayuda cuando | El CoT manual sale mal cuando |
|---|---|
| Usas un modelo sin razonamiento (GPT antiguo, Llama base) | Usas un modelo de razonamiento (serie o, GPT-5 reasoning, Claude thinking) |
| Ejecutas un modelo pequeño o local de código abierto | La tarea es una búsqueda de un solo paso, una clasificación o un cambio de formato |
| Necesitas una estructura de razonamiento fija y auditable | Estás en una ruta sensible a la latencia, en tiempo real |
| La tarea es matemáticas, lógica o planificación de varios pasos | Estás en un endpoint de alto volumen y sensible al coste |
| Quieres un rastro visible que puedas inspeccionar o buscar con grep | El modelo ya razona internamente, así que los pasos solo se repiten |
Aquí va un ejemplo real de nuestra propia casa. El pipeline de 12 agentes que escribió este artículo funciona sobre modelos Claude, y deliberadamente nunca les decimos a esos agentes que "piensen paso a paso", porque los modelos ya razonan internamente y eso solo añadiría ruido. Lo que sí escribimos a mano son andamiajes de razonamiento rígidos y rastreables con grep. Nuestro agente validador ejecuta una rúbrica fija de 100 puntos (50 de calidad, 50 de SEO) más ocho comprobaciones de puerta secuenciales. El traductor sigue una lista de verificación fija: igualar el número de H2 del original, ejecutar un grep de diacríticos que tiene que devolver más de cero, y mantenerse dentro de una banda del 80 al 120 por ciento en el recuento de líneas. El publicador ejecuta comprobaciones antes y después de publicar que verifican con regex la fecha y hora de publishedAt, y luego consulta el CMS para confirmar que el cuerpo no está vacío.
Nada de eso tiene que ver con pensar más. Es una ruta fija y auditable que podemos inspeccionar y buscar con grep, que es exactamente el caso de "el CoT manual todavía ayuda". Añadimos esas puertas por un motivo: un valor de publishedAt con solo fecha (sin hora) ocultó silenciosamente todo un artículo de nuestro índice del blog, así que la secuencia de pasos rígida existe ahora para evitar que el modelo se salte una verificación. Una advertencia honesta: esto es una observación operativa, no un benchmark. No hemos hecho un A/B controlado de precisión entre "piensa paso a paso" y ninguna instrucción, así que tómalo como una lección de estructura y auditabilidad, no como un dato numérico.
¿Ejecutas modelos locales donde el CoT manual todavía compensa? Nuestro resumen de las mejores LLM de código abierto de 2026 cubre el terreno. Y si alguna vez muestras la cadena de pensamiento de un modelo a los usuarios, trátala como una salida no confiable; nuestra guía de prevención de inyección de prompts explica por qué.
El Coste Oculto: Tokens, Latencia y Tu Factura
El CoT no es gratis. Cada paso de razonamiento son tokens de salida que pagas, y las generaciones más largas aumentan la latencia. Los modelos de razonamiento facturan tokens de razonamiento ocultos, además de la respuesta visible. En endpoints de alto volumen o en tiempo real, forzar una salida paso a paso puede multiplicar el coste silenciosamente, así que presupuéstalo o límitalo con reasoning_effort.
Cada "paso 1, paso 2, paso 3" que escribe el modelo son tokens de salida, y los tokens de salida son los caros. Una cadena cinco veces más larga que la respuesta desnuda cuesta aproximadamente cinco veces más en esa llamada, y llega en streaming más lento. Los modelos de razonamiento añaden un giro: facturan tokens de razonamiento por el pensamiento interno que nunca ves, así que una respuesta final corta puede esconder una cadena larga que ya pagaste. En un endpoint de bajo volumen eso es ruido; en uno de alto tráfico se acumula rápido. Dos hábitos mantienen esto bajo control. Cachea las partes estables de tu contexto para no pagar por releerlas (nuestra guía de prompt caching muestra cómo), y mide si los tokens extra realmente compran precisión antes de desplegar el CoT en todas partes. Nuestra guía de evaluación de LLM cubre esa medición, para que no pagues por un razonamiento que no mueve el resultado.
Cómo Usar el CoT en 2026: Una Lista de Decisión
Primero, identifica la clase de tu modelo. En un modelo de razonamiento, sáltate el CoT manual y ajusta en su lugar reasoning_effort o el presupuesto de pensamiento. En un modelo sin razonamiento o local, añade el zero-shot "pensemos paso a paso", sube a few-shot para tareas específicas de dominio, y añade autoconsistencia solo cuando la precisión importe más que el coste en tokens.
Aquí está toda la decisión en cinco pasos:
- Identifica la clase de tu modelo. ¿Es un modelo de razonamiento o no? Ese único dato decide todo lo demás.
- En un modelo de razonamiento, no escribas CoT a mano. Ajusta en su lugar
reasoning_efforto el presupuesto de pensamiento, y deja que el modelo razone internamente. - En un modelo sin razonamiento o local, añade el zero-shot "pensemos paso a paso". Es una sola línea y no cuesta nada probarla.
- Para tareas específicas de dominio, sube a CoT few-shot con dos o tres ejemplos resueltos. Añade autoconsistencia solo cuando la precisión supere al coste en tokens.
- Si expones el razonamiento, mídelo con evals y trata la cadena visible como una salida no confiable.
La frase disparadora normalmente vive en tu system prompt. Nuestros ejemplos de system prompt muestran dónde va y cómo formularla.
# On a reasoning model, don't hand-write CoT. Tune the effort instead.
# Param names and levels change per provider and version, so check current docs.
resp = client.responses.create(
model="your-reasoning-model",
reasoning={"effort": "medium"}, # e.g. low | medium | high
input="Prove that the square root of 2 is irrational.",
)
# Anthropic equivalent: an extended-thinking budget.
# budget_tokens MUST be less than max_tokens.
# thinking = {"type": "enabled", "budget_tokens": 4000}Conectar esto a un stack de producción es más delicado de lo que parece en un ejemplo de blog. Si prefieres no ajustar tú mismo los presupuestos de razonamiento y los harnesses de evaluación, nuestro equipo construye estos pipelines de principio a fin. Consulta integración de IA o ponte en contacto.
Sobre el Autor
Mert Batur Gurbuz es cofundador de Techsy.io, donde el equipo construye agentes de IA, sistemas de automatización y pipelines de voz/SDR para clientes B2B. Estudia en la Universidad de Birmingham y escribe sobre el stack de herramientas LLM que el equipo de Techsy realmente usa en producción.
Cofundador, Techsy.io, Universidad de Birmingham. Conéctate en LinkedIn.
Preguntas Frecuentes
¿Sigue Siendo Relevante el Chain of Thought Prompting en 2026?
Sí, pero su función se redujo. En modelos sin razonamiento y modelos pequeños o locales de código abierto, el CoT manual todavía mejora la precisión en tareas de varios pasos. En los modelos de razonamiento es casi siempre redundante. El uso más fuerte que le queda es forzar una única ruta de razonamiento fija y auditable que puedas inspeccionar.
¿Funciona el Chain of Thought Prompting en Modelos de Razonamiento como GPT-5, o3 o Claude?
Estos modelos ya razonan internamente, así que el CoT manual suele ser redundante y a veces perjudicial. La documentación de OpenAI dice que pedirles que "piensen paso a paso" es innecesario, y que pedirles que razonen más "puede en realidad perjudicar el rendimiento". Ajusta el esfuerzo de razonamiento en lugar de escribir los pasos.
¿Qué Es el Zero-Shot Chain of Thought Prompting?
El zero-shot CoT consiste en añadir una frase disparadora, normalmente "pensemos paso a paso", sin dar antes ningún ejemplo resuelto. Kojima et al. (2022) demostraron que esto por sí solo convierte a un modelo grande en un razonador decente. Es la variante de CoT más barata: una línea, sin curar ejemplos, rápida de probar.
¿Qué Es la Autoconsistencia en el Chain of Thought Prompting?
La autoconsistencia (self-consistency), de Wang et al. (2022), muestrea varias cadenas de razonamiento independientes a una temperatura más alta, y luego elige la respuesta final por mayoría de votos. Es la variante de CoT más precisa porque las cadenas equivocadas rara vez coinciden entre sí, pero pagas por cada ruta muestreada, así que también es la más cara.
¿Cuál Es la Diferencia entre Chain of Thought y Few-Shot Prompting?
El few-shot prompting le muestra al modelo pares de ejemplo entrada-salida. El chain of thought se centra en el razonamiento entre la entrada y la salida. Combinan bien entre sí: el few-shot CoT da ejemplos resueltos que incluyen los pasos de razonamiento, así que el modelo copia tu patrón de razonamiento, no solo el formato de tu respuesta.
Chain of Thought vs. Prompt Chaining vs. Tree of Thought: ¿Cuál Es la Diferencia?
El chain of thought razona dentro de un solo prompt. El prompt chaining divide una tarea en varias llamadas separadas al modelo, pasando las salidas hacia adelante. El tree of thought explora varias ramas de razonamiento y poda las débiles. El CoT es una única ruta lineal; los otros dos añaden estructura externa alrededor del modelo.
¿Quién Inventó el Chain of Thought Prompting?
El chain of thought prompting fue introducido por Jason Wei y sus colegas en Google en el artículo de 2022 "Chain-of-Thought Prompting Elicits Reasoning in Large Language Models". Kojima et al. añadieron después el zero-shot CoT, y Wang et al. añadieron la autoconsistencia, ambos también en 2022.
¿Funciona el Chain of Thought Prompting para la Generación de Código?
Sí, en modelos sin razonamiento. Pedirle al modelo que planifique la lógica antes de escribir el código detecta casos límite y reduce errores en tareas complejas. En los modelos de razonamiento esa planificación ocurre internamente, así que una instrucción simple suele funcionar mejor que un prefijo escrito a mano tipo "razona paso a paso".