
Chain of thought-prompting har et problem i 2026, som de førende guides overser: Det samme trick, der gjorde modeller smartere tilbage i 2022, kan stille og roligt gøre en resonerende model værre i dag. Wei m.fl. introducerede det i 2022, og det løftede nøjagtigheden inden for svær matematik og logik ved at få modellerne til at vise deres ræsonnementstrin. Der var dog en hage ved det. Det trådte først i kraft, når modellerne oversteg cirka 100 milliarder parametre. Nu udfører o-serien og GPT-5-resoneringsmodeller den tænkning internt, så det at bede dem om at "tænke trin for trin" brænder ofte bare tokens af uden grund. Hvornår bør du stadig bruge det, og hvornår bør du springe det over?
Vigtigste pointer:
- Chain of thought-prompting viser en models ræsonnementstrin og øger nøjagtigheden ved flerstegs matematik, logik og kode.
- Det er en emergent evne: Det hjælper næsten ikke små modeller, og resonerende modeller gør det allerede internt.
- På o-serien, GPT-5-resonering og Claudes udvidede tænkning er manuel "tænk trin for trin" ofte overflødig.
- Brug stadig manuel CoT på ikke-resonerende og lokale open source-modeller, eller når du har brug for en reviderbar ræsonnementssti.
Hvad er Chain of Thought-prompting?
Chain of thought (CoT) prompting er en teknik, der beder en sprogmodel om at arbejde sig gennem et problem i eksplicitte mellemtrin, før den giver et endeligt svar. Introduceret af Wei m.fl. i 2022 forbedrer det nøjagtigheden ved flerstegs matematik, logik og sund fornuft-opgaver, og det gør modellens ræsonnement synligt.
Stiller du et almindeligt spørgsmål til en plain model, kommer den ofte med det forkerte tal. Beder du den om at ræsonnere først, stiger oddsene markant. Tag eksempelvis: "En hylde har 3 kasser med 7 bøger; jeg fjerner 5. Hvad er der tilbage?" Uden opvarmning vil en lille model måske svare "21". Tilføjer du "Lad os tænke trin for trin", skriver den: 3 x 7 = 21, derefter 21 - 5 = 16. Samme model, bedre svar, og du kan se, hvor den gled, hvis den gør. CoT er ét værktøj inde i det bredere toolkit i vores guide til prompt engineering; dette indlæg zoomer helt ind på det.
Hvordan det virker (og hvorfor det først clicked ved skala)
CoT virker ved at lade modellen generere en ræsonnementssti på naturligt sprog token for token, så hver mellemkonklusion betinger den næste. Wei m.fl. (2022) fandt ud af, at dette er en emergent evne: Det hjælper næsten ikke små modeller og giver kun store nøjagtighedsgevinster, når modellerne overstiger cirka 100 milliarder parametre.
Tænk på det som at vise dine udregninger i matematiktimen. En model forudsiger ét token ad gangen, og hvert ord, den skriver, bliver en del af inputtet til det næste ord. Når den skriver "21" som et mellemresultat, sidder det "21" nu i konteksten og styrer det sidste trin mod "16." Springer du trinene over, skal modellen hoppe direkte til svaret uden noget at læne sig op ad. Det mærkelige er, at denne fordel kun viser sig ved skala. I grundlæggelsesartiklen fandt Weis team ud af, at tiny modeller næsten ikke fik noget løft, og nogle gange klarede sig dårligere. Derfor kan den samme prompt, der flopper på en 7B lokal model, transformere en frontier-model.
De tre smagsvarianter: Zero-Shot, Few-Shot og Self-Consistency
Der er tre hovedvarianter af CoT. Zero-shot CoT tilføjer blot "Lad os tænke trin for trin" (Kojima m.fl., 2022). Few-shot CoT viser først udregnede ræsonnementseksempler. Self-consistency (Wang m.fl., 2022) sampler flere ræsonnementsstier og tager et flertalsafstemning på svaret – den mest pålidelige og også den dyreste af de tre.
Zero-shot er det dovne magiske trick. Du tilføjer én sætning, og modellen ræsonnerer uden nogen eksempler. Kojima m.fl. viste, at "Lad os tænke trin for trin" alene omdanner en stor model til en anstændig zero-shot ræsonnør.
# Zero-shot CoT: append the trigger phrase. Best on non-reasoning models.
# Model names change fast, so treat the string below as a placeholder.
from openai import OpenAI
client = OpenAI()
prompt = (
"Q: A shelf holds 3 boxes. Each box has 7 books. "
"I remove 5 books. How many are left?\n"
"A: Let's think step by step."
)
resp = client.chat.completions.create(
model="your-non-reasoning-model",
messages=[{"role": "user", "content": prompt}],
)
print(resp.choices[0].message.content)Few-shot CoT går videre: Du giver modellen to eller tre udregnede eksempler, så den kopierer ræsonnementsmønsteret for dit domæne. Self-consistency er nøjagtighedsknappen. I stedet for at stole på én kæde, sampler du fem ved en højere temperatur og lader dem stemme. Wang m.fl. fandt ud af, at flertalssvaret normalt er rigtigt, selv når individuelle kæder vandrer væk.
# Self-consistency: sample N reasoning paths, majority-vote the answer.
# More accurate, more expensive. Wang et al., 2022.
from collections import Counter
def self_consistency(prompt, n=5, temperature=0.7):
answers = []
for _ in range(n):
resp = client.chat.completions.create(
model="your-non-reasoning-model",
messages=[{"role": "user", "content": prompt}],
temperature=temperature, # diversity across paths
)
answers.append(extract_final_answer(resp.choices[0].message.content))
return Counter(answers).most_common(1)[0][0] # majority voteVil du have det ræsonnement som ren JSON i stedet for fri tekst? Par CoT med mønstrene i vores guide til strukturerede outputs, så et downstream-trin kan parse det.
Skiftet i 2026: Resonerende modeller ændrede reglerne
Resonerende modeller, OpenAIs o-serie og GPT-5-resonering, Claudes udvidede tænkning og DeepSeek R1, udfører chain of thought internt, før de svarer. OpenAIs egen vejledning siger eksplicit, at det er unødvendigt at bede disse modeller om at "tænke trin for trin", og at bede en resonerende model om at ræsonnere mere faktisk kan skade ydeevnen. Stilladset er indbygget.
Dette er den del, som de ældre guider lader som om ikke sker. En resonerende model producerer en privat chain of thought, før den nogensinde viser dig et svar, så det trin-for-trin, du plejede at skrive i hånden, sker nu under motorhjelmen. OpenAIs bedste praksis for resonering siger det rent ud: "Undgå chain-of-thought-prompts: Da disse modeller udfører ræsonnement internt, er det unødvendigt at prompte dem til at 'tænke trin for trin' eller 'forklare din ræsonnement'." Deres o3/o4-mini prompting guide går et skridt videre: "At bede en resonerende model om at ræsonnere mere kan faktisk skade ydeevnen."
Anthropics udvidede tænkning er samme idé produktificeret. Du giver Claude et tænkingsbudget i stedet for et trin-for-trin-manuskript, og de nyeste modeller beslutter selv, hvor dybt de skal tænke. På denne klasse af model justerer du reasoning_effort eller tænkingsbudgettet, ikke formuleringen. For den åbne side af resoneringsmodeller, inklusive DeepSeek R1, se vores opdeling af Qwen vs DeepSeek vs GLM.
Hvornår manuel CoT stadig hjælper vs. hvornår det slår bagud
Manuel CoT hjælper stadig på ikke-resonerende og små eller lokale open source-modeller, eller når du har brug for en specifik ræsonnementsstruktur eller en reviderbar spor. Det slår bagud på native resoneringsmodeller (overflødigt og langsommere), på simple one-step opgaver og på latency- eller omkostningsfølsomme stier, hvor det bare brænder tokens af uden nøjagtighedsgevinst.
| Manuel CoT hjælper stadig, når | Manuel CoT slår bagud, når |
|---|---|
| Du bruger en ikke-resonerende model (ældre GPT, base Llama) | Du bruger en resoneringsmodel (o-serie, GPT-5 resonering, Claude thinking) |
| Du kører en lille eller lokal open source-model | Opgaven er et one-step opslag, klassifikation eller formatændring |
| Du har brug for en fast, reviderbar ræsonnementsstruktur | Du er på en latency-følsom, real-time sti |
| Opgaven er flerstegs matematik, logik eller planlægning | Du er på et high-volume, omkostningsfølsomt endpoint |
| Du vil have en synlig sti, du kan inspicere eller greppe | Modellen ræsonnerer allerede internt, så trinene gentager sig blot |
Her er et rigtigt eksempel fra vores egen butik. Den 12-agent pipeline, der skrev dette indlæg, kører på Claude-modeller, og vi fortæller bevidst aldrig disse agenter at "tænke trin for trin", fordi modellerne allerede ræsonnerer internt, og det ville kun tilføje støj. Det, vi håndskriver, er stive, gribbare ræsonnementsstilladser. Vores validator-agent kører en fast 100-punkts rubrik (50 kvalitet, 50 SEO) plus otte sekventielle gate-checks. Oversætteren følger en fast checkliste: match antallet af H2'er fra kilden, kør en diacritics-grep, der skal returnere mere end nul, og hold dig inden for en linjetællingsbåndbredde på 80 til 120 procent. Publisheren kører pre- og post-publish gates, der regex-tjekker publishedAt datotid, og spørger derefter CMS'en for at bekræfte, at body ikke er tom.
Intet af dette handler om mere tænkning. Det er en fast, reviderbar sti, vi kan inspicere og greppe, hvilket er præcis tilfældet "manuel CoT hjælper stadig". Vi tilføjede disse gates af en grund: En dato-only publishedAt-værdi skjulte engang stille og roligt et helt indlæg fra vores blog-indeks, så den stive trinsekvens eksisterer nu for at stoppe modellen i at springe en verifikation over. En ærlig forbehold: Dette er en operationel observation, ikke en benchmark. Vi har ikke kørt en kontrolleret nøjagtigheds-A/B på "tænk trin for trin" versus ingen instruktion, så behandl det som en lektion i struktur og reviderbarhed, ikke et tal-claim.
Kører du lokale modeller, hvor manuel CoT stadig betaler sig? Vores roundup af de bedste open source LLM'er i 2026 dækker feltet. Og hvis du nogensinde viser en models chain of thought til brugere, så behandl det som utillidsvækkende output; vores guide til forebyggelse af prompt injection forklarer hvorfor.
Den skjulte pris: Tokens, Latency og din regning
CoT er ikke gratis. Hvert ræsonnementstrin er output tokens, du betaler for, og længere generationer øger latenctiden. Resoneringsmodeller fakturerer skjulte reasoning tokens oven i det synlige svar. På high-volume eller real-time endpoints kan tvungen trin-for-trin output stille og roligt multiplicere omkostningerne, så budgettér for det eller caps det med reasoning_effort.
Hvert "trin 1, trin 2, trin 3", som modellen skriver, er output tokens, og output tokens er den dyre slags. En kæde, der er fem gange længere end det nøgne svar, koster groft sagt fem gange så meget på det kald og streamer tilbage langsommere. Resoneringsmodeller tilføjer et twist: De fakturerer reasoning tokens for den interne tænkning, du aldrig ser, så et kort endeligt svar kan skjule en lang, betalt kæde. På et low-volume endpoint er det støj; på et high-traffic one vokser det hurtigt. To vaner holder det sanity. Cache de stabile dele af din kontekst, så du ikke betaler for at genlæse dem (vores guide til prompt caching viser hvordan), og mål, om de ekstra tokens faktisk køber nøjagtighed, før du ruller CoT ud overalt. Vores LLM evals guide dækker den måling, så du ikke betaler for ræsonnement, der ikke flytter scoren.
Sådan bruger du CoT i 2026: En beslutningscheckliste
Først, identificér din modelklasse. På en resoneringsmodel, spring manuel CoT over og justér reasoning_effort eller tænkingsbudgettet i stedet. På en ikke-resonerende eller lokal model, tilføj zero-shot "Lad os tænke trin for trin", opgrader til few-shot for domæneopgaver, og tilføj self-consistency kun, når nøjagtighed betyder mere end token-omkostninger.
Her er hele beslutningen i fem trin:
- Identificér din modelklasse. Resoneringsmodel eller ej? Den ene kendsgerning afgør alt nedenfor.
- På en resoneringsmodel, håndskriv ikke CoT. Justér
reasoning_efforteller tænkingsbudgettet i stedet, og lad modellen ræsonnere internt. - På en ikke-resonerende eller lokal model, tilføj zero-shot "Lad os tænke trin for trin". Det er én linje og gratis at prøve.
- For domænespecifikke opgaver, opgrader til few-shot CoT med to eller tre udregnede eksempler. Tilføj self-consistency kun, når nøjagtighed slår token-omkostninger.
- Hvis du eksponerer ræsonnementet, mål det med evals og behandl den synlige kæde som utillidsvækkende output.
Trigger-sætningen lever normalt i din system prompt. Vores eksempler på system prompts viser, hvor den hører hjemme, og hvordan du formulerer den.
# On a reasoning model, don't hand-write CoT. Tune the effort instead.
# Param names and levels change per provider and version, so check current docs.
resp = client.responses.create(
model="your-reasoning-model",
reasoning={"effort": "medium"}, # e.g. low | medium | high
input="Prove that the square root of 2 is irrational.",
)
# Anthropic equivalent: an extended-thinking budget.
# budget_tokens MUST be less than max_tokens.
# thinking = {"type": "enabled", "budget_tokens": 4000}At wire dette ind i en produktionsstack er mere besværligt, end et blog-eksempel får det til at se ud. Hvis du hellere vil slippe for at tune reasoning budgets og eval harnesses selv, bygger vores team disse pipelines end-to-end. Se AI-integration eller kontakt os.
Om forfatteren
Mert Batur Gurbuz er medstifter af Techsy.io, hvor teamet leverer AI-agenter, automatiseringssystemer og voice/SDR-pipelines til B2B-klienter. Han studerer ved University of Birmingham og skriver om den LLM-tooling-stack, som Techsy-teamet faktisk bruger i produktion.
Medstifter, Techsy.io, University of Birmingham. Connect på LinkedIn.
Ofte stillede spørgsmål
Er chain of thought-prompting stadig relevant i 2026?
Ja, men dets job er blevet mindre. På ikke-resonerende og små eller lokale open source-modeller løfter manuel CoT stadig nøjagtigheden ved flerstegsopgaver. På resoneringsmodeller er det mest overflødigt. Den stærkeste tilbageværende brug er at tvinge én fast, reviderbar ræsonnementssti, du kan inspicere.
Virker chain of thought-prompting på resoneringsmodeller som GPT-5, o3 eller Claude?
Disse modeller ræsonnerer allerede internt, så manuel CoT er normalt overflødig og nogle gange skadelig. OpenAIs docs siger, at det er unødvendigt at prompte dem til at "tænke trin for trin", og at bede dem om at ræsonnere mere "kan faktisk skade ydeevnen." Justér reasoning effort i stedet for at skrive trin.
Hvad er zero-shot chain of thought-prompting?
Zero-shot CoT betyder at tilføje en trigger-sætning, normalt "Lad os tænke trin for trin", uden at give nogen udregnede eksempler først. Kojima m.fl. (2022) viste, at dette alene omdanner en stor model til en anstændig ræsonnør. Det er den billigste CoT-variant: én linje, ingen eksempelkuratering, hurtig at teste.
Hvad er self-consistency i chain of thought-prompting?
Self-consistency, fra Wang m.fl. (2022), sampler flere uafhængige ræsonnementkæder ved en højere temperatur og tager derefter en flertalsafstemning på det endelige svar. Det er den mest nøjagtige CoT-variant, fordi forkerte kæder sjældent er enige, men du betaler for hver sampled sti, så det er også den dyreste.
Hvad er forskellen mellem chain of thought og few-shot prompting?
Few-shot prompting viser modellen eksempel input-output par. Chain of thought fokuserer på ræsonnementet mellem input og output. De kombineres godt: few-shot CoT giver udregnede eksempler, der inkluderer ræsonnementstrinene, så modellen kopierer dit ræsonnementsmønster, ikke bare dit svarformat.
Chain of thought vs prompt chaining vs tree of thought: hvad er forskellen?
Chain of thought ræsonnerer inde i én prompt. Prompt chaining splitter en opgave over flere separate modelkald og sender outputs fremad. Tree of thought udforsker flere ræsonnementgrene og beskærer svage. CoT er en enkelt lineær sti; de andre to tilføjer ekstern struktur omkring modellen.
Hvem opfandt chain of thought-prompting?
Chain of thought-prompting blev introduceret af Jason Wei og kolleger hos Google i 2022-artiklen "Chain-of-Thought Prompting Elicits Reasoning in Large Language Models." Kojima m.fl. tilføjede senere zero-shot CoT, og Wang m.fl. tilføjede self-consistency, begge også i 2022.
Virker chain of thought-prompting til kodegenerering?
Ja, på ikke-resonerende modeller. At bede modellen om at planlægge logikken, før den skriver kode, fanger edge cases og reducerer bugs på komplekse opgaver. På resoneringsmodeller sker planlægningen internt, så en almindelig instruktion fungerer normalt bedre end et håndskrevet "ræsonnér trin for trin"-præfiks.