
Le chain of thought prompting a un problème en 2026 que les meilleurs guides passent sous silence : l'astuce qui rendait les modèles plus intelligents en 2022 peut aujourd'hui rendre un modèle de raisonnement plus bête. Wei et al. l'ont introduit en 2022, et la précision grimpait sur les maths et la logique complexes en forçant les modèles à montrer leurs étapes de raisonnement. Il y avait un piège : ça ne s'activait qu'à partir d'environ 100 milliards de paramètres. Aujourd'hui, les modèles de raisonnement o-series et GPT-5 font ce travail en interne, donc leur dire de « réfléchir étape par étape » ne fait souvent que brûler des tokens. Quand faut-il encore l'utiliser, et quand faut-il s'en passer ?
Points clés :
- Le chain of thought prompting révèle les étapes de raisonnement d'un modèle et améliore la précision sur les tâches de maths, de logique et de code à plusieurs étapes.
- C'est une capacité émergente : ça aide à peine les petits modèles, et les modèles de raisonnement le font déjà en interne.
- Sur les o-series, GPT-5 reasoning et l'extended thinking de Claude, le « think step by step » manuel est souvent redondant.
- Le CoT manuel reste utile sur les modèles non-raisonneurs et les modèles open source locaux, ou quand vous avez besoin d'un raisonnement traçable et auditable.
Qu'est-ce que le Chain of Thought Prompting ?
Le chain of thought (CoT) prompting est une technique qui demande à un modèle de langage de décomposer un problème en étapes intermédiaires explicites avant de donner sa réponse finale. Introduite par Wei et al. en 2022, elle améliore la précision sur les tâches de maths, de logique et de bon sens à plusieurs étapes, et rend le raisonnement du modèle visible.
Posez un problème de calcul à un modèle basique, à froid, et il balance souvent le mauvais chiffre. Demandez-lui de raisonner d'abord, et les chances grimpent. Prenez : « Une étagère a 3 boîtes de 7 livres ; j'en retire 5. Combien en reste-t-il ? » À froid, un petit modèle répondra peut-être « 21 ». Ajoutez « Réfléchissons étape par étape » et il écrit : 3 x 7 = 21, puis 21 - 5 = 16. Même modèle, meilleure réponse, et vous voyez où il a dérapé si ça arrive. Le CoT n'est qu'un outil dans la boîte à outils plus large de notre guide du prompt engineering ; cet article se concentre uniquement dessus.
Comment Ça Marche (et Pourquoi Ça Ne Fonctionne Qu'à Grande Échelle)
Le CoT fonctionne en faisant générer au modèle un raisonnement en langage naturel, token par token, de sorte que chaque conclusion intermédiaire conditionne la suivante. Wei et al. (2022) ont montré qu'il s'agit d'une capacité émergente : elle aide à peine les petits modèles et ne produit des gains de précision importants qu'au-delà d'environ 100 milliards de paramètres.
Pensez à ça comme montrer son raisonnement en cours de maths. Un modèle prédit un token à la fois, et chaque mot qu'il écrit devient une partie de l'entrée pour le mot suivant. Quand il écrit « 21 » comme résultat intermédiaire, ce « 21 » se retrouve dans le contexte et oriente l'étape finale vers « 16 ». Sautez les étapes, et le modèle doit bondir directement vers la réponse sans rien sur quoi s'appuyer. Le plus étrange, c'est que ce bénéfice n'apparaît qu'à grande échelle. Dans l'article fondateur, l'équipe de Wei a constaté que les petits modèles gagnaient à peine, voire faisaient pire. C'est pour ça que le même prompt qui échoue sur un modèle local de 7B peut transformer un modèle de pointe.
Les Trois Variantes : Zero-Shot, Few-Shot et Self-Consistency
Il existe trois variantes principales du CoT. Le zero-shot CoT se contente d'ajouter « Réfléchissons étape par étape » (Kojima et al., 2022). Le few-shot CoT montre d'abord des exemples de raisonnement travaillés. Le self-consistency (Wang et al., 2022) échantillonne plusieurs chemins de raisonnement et prend l'avis majoritaire sur la réponse, la variante la plus fiable et la plus coûteuse des trois.
Le zero-shot, c'est le tour de magie facile. Vous ajoutez une phrase et le modèle raisonne sans aucun exemple. Kojima et al. ont montré qu'un simple « Réfléchissons étape par étape » suffit à transformer un grand modèle en raisonneur zero-shot correct.
# Zero-shot CoT: append the trigger phrase. Best on non-reasoning models.
# Model names change fast, so treat the string below as a placeholder.
from openai import OpenAI
client = OpenAI()
prompt = (
"Q: A shelf holds 3 boxes. Each box has 7 books. "
"I remove 5 books. How many are left?\n"
"A: Let's think step by step."
)
resp = client.chat.completions.create(
model="your-non-reasoning-model",
messages=[{"role": "user", "content": prompt}],
)
print(resp.choices[0].message.content)Le few-shot CoT va plus loin : vous donnez au modèle deux ou trois exemples travaillés pour qu'il copie le schéma de raisonnement propre à votre domaine. Le self-consistency, c'est le curseur de précision. Au lieu de faire confiance à une seule chaîne, vous en échantillonnez cinq à une température plus élevée et vous les laissez voter. Wang et al. ont constaté que la réponse majoritaire est généralement la bonne, même quand des chaînes individuelles partent dans le décor.
# Self-consistency: sample N reasoning paths, majority-vote the answer.
# More accurate, more expensive. Wang et al., 2022.
from collections import Counter
def self_consistency(prompt, n=5, temperature=0.7):
answers = []
for _ in range(n):
resp = client.chat.completions.create(
model="your-non-reasoning-model",
messages=[{"role": "user", "content": prompt}],
temperature=temperature, # diversity across paths
)
answers.append(extract_final_answer(resp.choices[0].message.content))
return Counter(answers).most_common(1)[0][0] # majority voteVous voulez ce raisonnement en JSON propre plutôt qu'en texte libre ? Associez le CoT aux patterns de notre guide des sorties structurées pour qu'une étape en aval puisse le parser.
Le Tournant de 2026 : Les Modèles de Raisonnement Ont Changé la Donne
Les modèles de raisonnement, l'o-series et le GPT-5 reasoning d'OpenAI, l'extended thinking de Claude, et DeepSeek R1, font du chain of thought en interne avant de répondre. Les propres consignes d'OpenAI disent explicitement que demander à ces modèles de « réfléchir étape par étape » est inutile, et que demander à un modèle de raisonnement de raisonner davantage peut en réalité nuire à sa performance. L'échafaudage est déjà intégré.
C'est la partie que les anciens guides font semblant de ne pas voir. Un modèle de raisonnement produit une chaîne de pensée privée avant même de vous montrer une réponse, donc l'étape par étape que vous écriviez auparavant à la main se déroule maintenant sous le capot. Les bonnes pratiques de raisonnement d'OpenAI le disent sans détour : « Évitez les prompts de chain-of-thought : puisque ces modèles effectuent le raisonnement en interne, leur demander de "réfléchir étape par étape" ou d'"expliquer votre raisonnement" est inutile. » Leur guide de prompting o3/o4-mini va encore plus loin : « Demander à un modèle de raisonnement de raisonner davantage peut en réalité nuire à la performance. »
L'extended thinking d'Anthropic, c'est la même idée productisée. Vous donnez à Claude un budget de réflexion plutôt qu'un script étape par étape, et les modèles les plus récents décident eux-mêmes de la profondeur de leur réflexion. Sur cette classe de modèles, vous ajustez reasoning_effort ou le budget de réflexion, pas la formulation. Côté modèles de raisonnement open source, DeepSeek R1 compris, voyez notre comparatif Qwen vs DeepSeek vs GLM.
Quand le CoT Manuel Aide Encore, Quand Il Plante
Le CoT manuel aide encore sur les modèles non-raisonneurs et les petits modèles ou modèles open source locaux, ou quand vous avez besoin d'une structure de raisonnement précise ou d'une trace auditable. Il plante sur les modèles de raisonnement natifs (redondant et plus lent), sur les tâches simples à une seule étape, et sur les chemins sensibles à la latence ou au coût, où il ne fait que brûler des tokens sans gain de précision.
| Le CoT manuel aide encore quand... | Le CoT manuel plante quand... |
|---|---|
| Vous êtes sur un modèle non-raisonneur (ancien GPT, Llama de base) | Vous êtes sur un modèle de raisonnement (o-series, GPT-5 reasoning, Claude thinking) |
| Vous utilisez un petit modèle ou un modèle open source local | La tâche est une simple recherche, classification ou changement de format en une étape |
| Vous avez besoin d'une structure de raisonnement fixe et auditable | Vous êtes sur un chemin sensible à la latence, en temps réel |
| La tâche est un problème de maths, de logique ou de planification à plusieurs étapes | Vous êtes sur un endpoint à fort volume, sensible au coût |
| Vous voulez une trace visible que vous pouvez inspecter ou grepper | Le modèle raisonne déjà en interne, donc les étapes ne font que se répéter |
Voici un exemple bien réel, tiré de notre propre atelier. Le pipeline à 12 agents qui a écrit cet article tourne sur des modèles Claude, et nous ne disons jamais délibérément à ces agents de « réfléchir étape par étape », parce que les modèles raisonnent déjà en interne et que ça n'ajouterait que du bruit. Ce que nous écrivons à la main, ce sont des échafaudages de raisonnement rigides et greppables. Notre agent validateur applique une grille fixe de 100 points (50 pour la qualité, 50 pour le SEO) plus huit vérifications séquentielles. Le traducteur suit une checklist définie : faire correspondre le nombre de H2 à la source, lancer un grep de diacritiques qui doit renvoyer plus de zéro, et rester dans une fourchette de 80 à 120 % du nombre de lignes. Le publieur exécute des vérifications avant et après publication qui contrôlent par regex la date-heure de publishedAt, puis interrogent le CMS pour confirmer que le corps n'est pas vide.
Rien de tout ça ne consiste à réfléchir davantage. C'est un chemin fixe et auditable que nous pouvons inspecter et grepper, exactement le cas où « le CoT manuel aide encore ». Nous avons ajouté ces vérifications pour une raison précise : une valeur publishedAt sans heure a un jour discrètement masqué tout un article de notre index de blog, donc cette séquence d'étapes rigide existe désormais pour empêcher le modèle de sauter une vérification. Une réserve honnête : c'est une observation opérationnelle, pas un benchmark. Nous n'avons pas fait tourner d'A/B test contrôlé sur la précision entre « réfléchis étape par étape » et aucune instruction, donc prenez ça comme une leçon de structure et d'auditabilité, pas comme une donnée chiffrée.
Vous faites tourner des modèles locaux où le CoT manuel rapporte encore ? Notre comparatif des meilleurs LLM open source de 2026 couvre le terrain. Et si vous exposez un jour le chain of thought d'un modèle à vos utilisateurs, traitez-le comme une sortie non fiable ; notre guide de prévention de l'injection de prompt explique pourquoi.
Le Coût Caché : Tokens, Latence et Votre Facture
Le CoT n'est pas gratuit. Chaque étape de raisonnement, ce sont des tokens de sortie que vous payez, et des générations plus longues font grimper la latence. Les modèles de raisonnement facturent des tokens de raisonnement cachés en plus de la réponse visible. Sur des endpoints à fort volume ou en temps réel, forcer une sortie étape par étape peut discrètement multiplier le coût, donc budgétez-le ou plafonnez-le avec reasoning_effort.
Chaque « étape 1, étape 2, étape 3 » que le modèle écrit, ce sont des tokens de sortie, et les tokens de sortie sont les plus chers. Une chaîne cinq fois plus longue que la réponse brute coûte environ cinq fois plus sur cet appel, et revient plus lentement en streaming. Les modèles de raisonnement ajoutent une subtilité : ils facturent des tokens de raisonnement pour la réflexion interne que vous ne voyez jamais, donc une réponse finale courte peut cacher une longue chaîne déjà payée. Sur un endpoint à faible volume, c'est du bruit ; sur un endpoint à fort trafic, ça grimpe vite. Deux habitudes permettent de garder ça sous contrôle. Mettez en cache les parties stables de votre contexte pour ne pas payer à les relire (notre guide de mise en cache des prompts montre comment faire), et mesurez si les tokens supplémentaires achètent vraiment de la précision avant de déployer le CoT partout. Notre guide d'évaluation des LLM couvre cette mesure, pour que vous ne payiez pas pour du raisonnement qui ne bouge pas le score.
Comment Utiliser le CoT en 2026 : Une Checklist de Décision
D'abord, identifiez la classe de votre modèle. Sur un modèle de raisonnement, sautez le CoT manuel et ajustez plutôt reasoning_effort ou le budget de réflexion. Sur un modèle non-raisonneur ou local, ajoutez le zero-shot « Réfléchissons étape par étape », passez au few-shot pour les tâches spécifiques à votre domaine, et n'ajoutez le self-consistency que quand la précision compte plus que le coût en tokens.
Voici toute la décision en cinq étapes :
- Identifiez la classe de votre modèle. Modèle de raisonnement ou non ? Ce seul fait décide de tout ce qui suit.
- Sur un modèle de raisonnement, n'écrivez pas de CoT à la main. Ajustez plutôt
reasoning_effortou le budget de réflexion, et laissez le modèle raisonner en interne. - Sur un modèle non-raisonneur ou local, ajoutez le zero-shot « Réfléchissons étape par étape. » C'est une ligne, gratuite à essayer.
- Pour les tâches spécifiques à un domaine, passez au few-shot CoT avec deux ou trois exemples travaillés. N'ajoutez le self-consistency que quand la précision l'emporte sur le coût en tokens.
- Si vous exposez le raisonnement, mesurez-le avec des evals et traitez la chaîne visible comme une sortie non fiable.
La phrase déclencheuse elle-même vit généralement dans votre system prompt. Nos exemples de system prompts montrent où la placer et comment la formuler.
# On a reasoning model, don't hand-write CoT. Tune the effort instead.
# Param names and levels change per provider and version, so check current docs.
resp = client.responses.create(
model="your-reasoning-model",
reasoning={"effort": "medium"}, # e.g. low | medium | high
input="Prove that the square root of 2 is irrational.",
)
# Anthropic equivalent: an extended-thinking budget.
# budget_tokens MUST be less than max_tokens.
# thinking = {"type": "enabled", "budget_tokens": 4000}Câbler tout ça dans une stack de production est plus délicat qu'un exemple de blog ne le laisse penser. Si vous préférez ne pas ajuster vous-même les budgets de raisonnement et les harnais d'évaluation, notre équipe construit ces pipelines de bout en bout. Voir intégration IA ou nous contacter.
À Propos de l'Auteur
Mert Batur Gürbüz est cofondateur de Techsy.io, où l'équipe livre des agents IA, des systèmes d'automatisation et des pipelines voix/SDR pour des clients B2B. Il étudie à l'University of Birmingham et écrit sur la stack d'outils LLM que l'équipe Techsy utilise réellement en production.
Cofondateur, Techsy.io, University of Birmingham. Retrouvez-le sur LinkedIn.
Questions Fréquentes
Le chain of thought prompting est-il encore pertinent en 2026 ?
Oui, mais son rôle s'est réduit. Sur les modèles non-raisonneurs et les petits modèles ou modèles open source locaux, le CoT manuel améliore encore la précision sur les tâches à plusieurs étapes. Sur les modèles de raisonnement, il est surtout redondant. L'usage le plus solide qui reste, c'est de forcer un chemin de raisonnement fixe et auditable que vous pouvez inspecter.
Le chain of thought prompting fonctionne-t-il sur des modèles de raisonnement comme GPT-5, o3 ou Claude ?
Ces modèles raisonnent déjà en interne, donc le CoT manuel est généralement redondant et parfois nuisible. La documentation d'OpenAI dit que leur demander de « réfléchir étape par étape » est inutile, et que leur demander de raisonner davantage « peut en réalité nuire à la performance ». Ajustez l'effort de raisonnement plutôt que d'écrire des étapes.
Qu'est-ce que le zero-shot chain of thought prompting ?
Le zero-shot CoT consiste à ajouter une phrase déclencheuse, généralement « Réfléchissons étape par étape », sans donner d'exemples travaillés au préalable. Kojima et al. (2022) ont montré que ça suffit à transformer un grand modèle en raisonneur zero-shot correct. C'est la variante de CoT la moins chère : une ligne, aucun exemple à préparer, rapide à tester.
Qu'est-ce que le self-consistency dans le chain of thought prompting ?
Le self-consistency, introduit par Wang et al. (2022), échantillonne plusieurs chaînes de raisonnement indépendantes à une température plus élevée, puis prend l'avis majoritaire sur la réponse finale. C'est la variante de CoT la plus précise, parce que les chaînes fausses sont rarement d'accord entre elles, mais vous payez pour chaque chemin échantillonné, donc c'est aussi la plus coûteuse.
Quelle est la différence entre le chain of thought et le few-shot prompting ?
Le few-shot prompting montre au modèle des paires exemple entrée-sortie. Le chain of thought se concentre sur le raisonnement entre l'entrée et la sortie. Les deux se combinent bien : le few-shot CoT donne des exemples travaillés qui incluent les étapes de raisonnement, donc le modèle copie votre schéma de raisonnement, pas seulement le format de votre réponse.
Chain of thought vs prompt chaining vs tree of thought : quelle différence ?
Le chain of thought raisonne à l'intérieur d'un seul prompt. Le prompt chaining découpe une tâche en plusieurs appels de modèle distincts, en faisant passer les sorties d'un appel à l'autre. Le tree of thought explore plusieurs branches de raisonnement et élague les plus faibles. Le CoT est un chemin linéaire unique ; les deux autres ajoutent une structure externe autour du modèle.
Qui a inventé le chain of thought prompting ?
Le chain of thought prompting a été introduit par Jason Wei et ses collègues chez Google, dans l'article de 2022 « Chain-of-Thought Prompting Elicits Reasoning in Large Language Models ». Kojima et al. ont ensuite ajouté le zero-shot CoT, et Wang et al. ont ajouté le self-consistency, tous deux également en 2022.
Le chain of thought prompting fonctionne-t-il pour la génération de code ?
Oui, sur les modèles non-raisonneurs. Demander au modèle de planifier la logique avant d'écrire le code permet d'attraper les cas limites et de réduire les bugs sur les tâches complexes. Sur les modèles de raisonnement, la planification se fait en interne, donc une instruction simple fonctionne généralement mieux qu'un préfixe « raisonne étape par étape » écrit à la main.