Techsy
Kontakt
Kom i gang
Tilbage til blog
ai-machine-learning

Chain of Thought-prompting i 2026: Hvornår det virker, og hvornår det slår bagud

Skrevet af Mert Batur Gürbüz
Jul 19, 2026
11 minutters læsning
Indholdsfortegnelse
Chain of Thought-prompting i 2026: Hvornår det virker, og hvornår det slår bagud

Chain of thought-prompting har et problem i 2026, som de førende guides overser: Det samme trick, der gjorde modeller smartere tilbage i 2022, kan stille og roligt gøre en resonerende model værre i dag. Wei m.fl. introducerede det i 2022, og det løftede nøjagtigheden inden for svær matematik og logik ved at få modellerne til at vise deres ræsonnementstrin. Der var dog en hage ved det. Det trådte først i kraft, når modellerne oversteg cirka 100 milliarder parametre. Nu udfører o-serien og GPT-5-resoneringsmodeller den tænkning internt, så det at bede dem om at "tænke trin for trin" brænder ofte bare tokens af uden grund. Hvornår bør du stadig bruge det, og hvornår bør du springe det over?

Vigtigste pointer:

  • Chain of thought-prompting viser en models ræsonnementstrin og øger nøjagtigheden ved flerstegs matematik, logik og kode.
  • Det er en emergent evne: Det hjælper næsten ikke små modeller, og resonerende modeller gør det allerede internt.
  • På o-serien, GPT-5-resonering og Claudes udvidede tænkning er manuel "tænk trin for trin" ofte overflødig.
  • Brug stadig manuel CoT på ikke-resonerende og lokale open source-modeller, eller når du har brug for en reviderbar ræsonnementssti.

Hvad er Chain of Thought-prompting?

Chain of thought (CoT) prompting er en teknik, der beder en sprogmodel om at arbejde sig gennem et problem i eksplicitte mellemtrin, før den giver et endeligt svar. Introduceret af Wei m.fl. i 2022 forbedrer det nøjagtigheden ved flerstegs matematik, logik og sund fornuft-opgaver, og det gør modellens ræsonnement synligt.

Stiller du et almindeligt spørgsmål til en plain model, kommer den ofte med det forkerte tal. Beder du den om at ræsonnere først, stiger oddsene markant. Tag eksempelvis: "En hylde har 3 kasser med 7 bøger; jeg fjerner 5. Hvad er der tilbage?" Uden opvarmning vil en lille model måske svare "21". Tilføjer du "Lad os tænke trin for trin", skriver den: 3 x 7 = 21, derefter 21 - 5 = 16. Samme model, bedre svar, og du kan se, hvor den gled, hvis den gør. CoT er ét værktøj inde i det bredere toolkit i vores guide til prompt engineering; dette indlæg zoomer helt ind på det.

Hvordan det virker (og hvorfor det først clicked ved skala)

CoT virker ved at lade modellen generere en ræsonnementssti på naturligt sprog token for token, så hver mellemkonklusion betinger den næste. Wei m.fl. (2022) fandt ud af, at dette er en emergent evne: Det hjælper næsten ikke små modeller og giver kun store nøjagtighedsgevinster, når modellerne overstiger cirka 100 milliarder parametre.

Tænk på det som at vise dine udregninger i matematiktimen. En model forudsiger ét token ad gangen, og hvert ord, den skriver, bliver en del af inputtet til det næste ord. Når den skriver "21" som et mellemresultat, sidder det "21" nu i konteksten og styrer det sidste trin mod "16." Springer du trinene over, skal modellen hoppe direkte til svaret uden noget at læne sig op ad. Det mærkelige er, at denne fordel kun viser sig ved skala. I grundlæggelsesartiklen fandt Weis team ud af, at tiny modeller næsten ikke fik noget løft, og nogle gange klarede sig dårligere. Derfor kan den samme prompt, der flopper på en 7B lokal model, transformere en frontier-model.

De tre smagsvarianter: Zero-Shot, Few-Shot og Self-Consistency

Der er tre hovedvarianter af CoT. Zero-shot CoT tilføjer blot "Lad os tænke trin for trin" (Kojima m.fl., 2022). Few-shot CoT viser først udregnede ræsonnementseksempler. Self-consistency (Wang m.fl., 2022) sampler flere ræsonnementsstier og tager et flertalsafstemning på svaret – den mest pålidelige og også den dyreste af de tre.

Zero-shot er det dovne magiske trick. Du tilføjer én sætning, og modellen ræsonnerer uden nogen eksempler. Kojima m.fl. viste, at "Lad os tænke trin for trin" alene omdanner en stor model til en anstændig zero-shot ræsonnør.

python
# Zero-shot CoT: append the trigger phrase. Best on non-reasoning models.
# Model names change fast, so treat the string below as a placeholder.
from openai import OpenAI
client = OpenAI()

prompt = (
    "Q: A shelf holds 3 boxes. Each box has 7 books. "
    "I remove 5 books. How many are left?\n"
    "A: Let's think step by step."
)

resp = client.chat.completions.create(
    model="your-non-reasoning-model",
    messages=[{"role": "user", "content": prompt}],
)
print(resp.choices[0].message.content)

Few-shot CoT går videre: Du giver modellen to eller tre udregnede eksempler, så den kopierer ræsonnementsmønsteret for dit domæne. Self-consistency er nøjagtighedsknappen. I stedet for at stole på én kæde, sampler du fem ved en højere temperatur og lader dem stemme. Wang m.fl. fandt ud af, at flertalssvaret normalt er rigtigt, selv når individuelle kæder vandrer væk.

python
# Self-consistency: sample N reasoning paths, majority-vote the answer.
# More accurate, more expensive. Wang et al., 2022.
from collections import Counter

def self_consistency(prompt, n=5, temperature=0.7):
    answers = []
    for _ in range(n):
        resp = client.chat.completions.create(
            model="your-non-reasoning-model",
            messages=[{"role": "user", "content": prompt}],
            temperature=temperature,  # diversity across paths
        )
        answers.append(extract_final_answer(resp.choices[0].message.content))
    return Counter(answers).most_common(1)[0][0]  # majority vote

Vil du have det ræsonnement som ren JSON i stedet for fri tekst? Par CoT med mønstrene i vores guide til strukturerede outputs, så et downstream-trin kan parse det.

Skiftet i 2026: Resonerende modeller ændrede reglerne

Resonerende modeller, OpenAIs o-serie og GPT-5-resonering, Claudes udvidede tænkning og DeepSeek R1, udfører chain of thought internt, før de svarer. OpenAIs egen vejledning siger eksplicit, at det er unødvendigt at bede disse modeller om at "tænke trin for trin", og at bede en resonerende model om at ræsonnere mere faktisk kan skade ydeevnen. Stilladset er indbygget.

Dette er den del, som de ældre guider lader som om ikke sker. En resonerende model producerer en privat chain of thought, før den nogensinde viser dig et svar, så det trin-for-trin, du plejede at skrive i hånden, sker nu under motorhjelmen. OpenAIs bedste praksis for resonering siger det rent ud: "Undgå chain-of-thought-prompts: Da disse modeller udfører ræsonnement internt, er det unødvendigt at prompte dem til at 'tænke trin for trin' eller 'forklare din ræsonnement'." Deres o3/o4-mini prompting guide går et skridt videre: "At bede en resonerende model om at ræsonnere mere kan faktisk skade ydeevnen."

Anthropics udvidede tænkning er samme idé produktificeret. Du giver Claude et tænkingsbudget i stedet for et trin-for-trin-manuskript, og de nyeste modeller beslutter selv, hvor dybt de skal tænke. På denne klasse af model justerer du reasoning_effort eller tænkingsbudgettet, ikke formuleringen. For den åbne side af resoneringsmodeller, inklusive DeepSeek R1, se vores opdeling af Qwen vs DeepSeek vs GLM.

Hvornår manuel CoT stadig hjælper vs. hvornår det slår bagud

Manuel CoT hjælper stadig på ikke-resonerende og små eller lokale open source-modeller, eller når du har brug for en specifik ræsonnementsstruktur eller en reviderbar spor. Det slår bagud på native resoneringsmodeller (overflødigt og langsommere), på simple one-step opgaver og på latency- eller omkostningsfølsomme stier, hvor det bare brænder tokens af uden nøjagtighedsgevinst.

Manuel CoT hjælper stadig, nårManuel CoT slår bagud, når
Du bruger en ikke-resonerende model (ældre GPT, base Llama)Du bruger en resoneringsmodel (o-serie, GPT-5 resonering, Claude thinking)
Du kører en lille eller lokal open source-modelOpgaven er et one-step opslag, klassifikation eller formatændring
Du har brug for en fast, reviderbar ræsonnementsstrukturDu er på en latency-følsom, real-time sti
Opgaven er flerstegs matematik, logik eller planlægningDu er på et high-volume, omkostningsfølsomt endpoint
Du vil have en synlig sti, du kan inspicere eller greppeModellen ræsonnerer allerede internt, så trinene gentager sig blot

Her er et rigtigt eksempel fra vores egen butik. Den 12-agent pipeline, der skrev dette indlæg, kører på Claude-modeller, og vi fortæller bevidst aldrig disse agenter at "tænke trin for trin", fordi modellerne allerede ræsonnerer internt, og det ville kun tilføje støj. Det, vi håndskriver, er stive, gribbare ræsonnementsstilladser. Vores validator-agent kører en fast 100-punkts rubrik (50 kvalitet, 50 SEO) plus otte sekventielle gate-checks. Oversætteren følger en fast checkliste: match antallet af H2'er fra kilden, kør en diacritics-grep, der skal returnere mere end nul, og hold dig inden for en linjetællingsbåndbredde på 80 til 120 procent. Publisheren kører pre- og post-publish gates, der regex-tjekker publishedAt datotid, og spørger derefter CMS'en for at bekræfte, at body ikke er tom.

Intet af dette handler om mere tænkning. Det er en fast, reviderbar sti, vi kan inspicere og greppe, hvilket er præcis tilfældet "manuel CoT hjælper stadig". Vi tilføjede disse gates af en grund: En dato-only publishedAt-værdi skjulte engang stille og roligt et helt indlæg fra vores blog-indeks, så den stive trinsekvens eksisterer nu for at stoppe modellen i at springe en verifikation over. En ærlig forbehold: Dette er en operationel observation, ikke en benchmark. Vi har ikke kørt en kontrolleret nøjagtigheds-A/B på "tænk trin for trin" versus ingen instruktion, så behandl det som en lektion i struktur og reviderbarhed, ikke et tal-claim.

Kører du lokale modeller, hvor manuel CoT stadig betaler sig? Vores roundup af de bedste open source LLM'er i 2026 dækker feltet. Og hvis du nogensinde viser en models chain of thought til brugere, så behandl det som utillidsvækkende output; vores guide til forebyggelse af prompt injection forklarer hvorfor.

Den skjulte pris: Tokens, Latency og din regning

CoT er ikke gratis. Hvert ræsonnementstrin er output tokens, du betaler for, og længere generationer øger latenctiden. Resoneringsmodeller fakturerer skjulte reasoning tokens oven i det synlige svar. På high-volume eller real-time endpoints kan tvungen trin-for-trin output stille og roligt multiplicere omkostningerne, så budgettér for det eller caps det med reasoning_effort.

Hvert "trin 1, trin 2, trin 3", som modellen skriver, er output tokens, og output tokens er den dyre slags. En kæde, der er fem gange længere end det nøgne svar, koster groft sagt fem gange så meget på det kald og streamer tilbage langsommere. Resoneringsmodeller tilføjer et twist: De fakturerer reasoning tokens for den interne tænkning, du aldrig ser, så et kort endeligt svar kan skjule en lang, betalt kæde. På et low-volume endpoint er det støj; på et high-traffic one vokser det hurtigt. To vaner holder det sanity. Cache de stabile dele af din kontekst, så du ikke betaler for at genlæse dem (vores guide til prompt caching viser hvordan), og mål, om de ekstra tokens faktisk køber nøjagtighed, før du ruller CoT ud overalt. Vores LLM evals guide dækker den måling, så du ikke betaler for ræsonnement, der ikke flytter scoren.

Sådan bruger du CoT i 2026: En beslutningscheckliste

Først, identificér din modelklasse. På en resoneringsmodel, spring manuel CoT over og justér reasoning_effort eller tænkingsbudgettet i stedet. På en ikke-resonerende eller lokal model, tilføj zero-shot "Lad os tænke trin for trin", opgrader til few-shot for domæneopgaver, og tilføj self-consistency kun, når nøjagtighed betyder mere end token-omkostninger.

Her er hele beslutningen i fem trin:

  1. Identificér din modelklasse. Resoneringsmodel eller ej? Den ene kendsgerning afgør alt nedenfor.
  2. På en resoneringsmodel, håndskriv ikke CoT. Justér reasoning_effort eller tænkingsbudgettet i stedet, og lad modellen ræsonnere internt.
  3. På en ikke-resonerende eller lokal model, tilføj zero-shot "Lad os tænke trin for trin". Det er én linje og gratis at prøve.
  4. For domænespecifikke opgaver, opgrader til few-shot CoT med to eller tre udregnede eksempler. Tilføj self-consistency kun, når nøjagtighed slår token-omkostninger.
  5. Hvis du eksponerer ræsonnementet, mål det med evals og behandl den synlige kæde som utillidsvækkende output.

Trigger-sætningen lever normalt i din system prompt. Vores eksempler på system prompts viser, hvor den hører hjemme, og hvordan du formulerer den.

python
# On a reasoning model, don't hand-write CoT. Tune the effort instead.
# Param names and levels change per provider and version, so check current docs.
resp = client.responses.create(
    model="your-reasoning-model",
    reasoning={"effort": "medium"},   # e.g. low | medium | high
    input="Prove that the square root of 2 is irrational.",
)

# Anthropic equivalent: an extended-thinking budget.
# budget_tokens MUST be less than max_tokens.
# thinking = {"type": "enabled", "budget_tokens": 4000}

At wire dette ind i en produktionsstack er mere besværligt, end et blog-eksempel får det til at se ud. Hvis du hellere vil slippe for at tune reasoning budgets og eval harnesses selv, bygger vores team disse pipelines end-to-end. Se AI-integration eller kontakt os.

Om forfatteren

Mert Batur Gurbuz er medstifter af Techsy.io, hvor teamet leverer AI-agenter, automatiseringssystemer og voice/SDR-pipelines til B2B-klienter. Han studerer ved University of Birmingham og skriver om den LLM-tooling-stack, som Techsy-teamet faktisk bruger i produktion.

Medstifter, Techsy.io, University of Birmingham. Connect på LinkedIn.

Ofte stillede spørgsmål

Er chain of thought-prompting stadig relevant i 2026?

Ja, men dets job er blevet mindre. På ikke-resonerende og små eller lokale open source-modeller løfter manuel CoT stadig nøjagtigheden ved flerstegsopgaver. På resoneringsmodeller er det mest overflødigt. Den stærkeste tilbageværende brug er at tvinge én fast, reviderbar ræsonnementssti, du kan inspicere.

Virker chain of thought-prompting på resoneringsmodeller som GPT-5, o3 eller Claude?

Disse modeller ræsonnerer allerede internt, så manuel CoT er normalt overflødig og nogle gange skadelig. OpenAIs docs siger, at det er unødvendigt at prompte dem til at "tænke trin for trin", og at bede dem om at ræsonnere mere "kan faktisk skade ydeevnen." Justér reasoning effort i stedet for at skrive trin.

Hvad er zero-shot chain of thought-prompting?

Zero-shot CoT betyder at tilføje en trigger-sætning, normalt "Lad os tænke trin for trin", uden at give nogen udregnede eksempler først. Kojima m.fl. (2022) viste, at dette alene omdanner en stor model til en anstændig ræsonnør. Det er den billigste CoT-variant: én linje, ingen eksempelkuratering, hurtig at teste.

Hvad er self-consistency i chain of thought-prompting?

Self-consistency, fra Wang m.fl. (2022), sampler flere uafhængige ræsonnementkæder ved en højere temperatur og tager derefter en flertalsafstemning på det endelige svar. Det er den mest nøjagtige CoT-variant, fordi forkerte kæder sjældent er enige, men du betaler for hver sampled sti, så det er også den dyreste.

Hvad er forskellen mellem chain of thought og few-shot prompting?

Few-shot prompting viser modellen eksempel input-output par. Chain of thought fokuserer på ræsonnementet mellem input og output. De kombineres godt: few-shot CoT giver udregnede eksempler, der inkluderer ræsonnementstrinene, så modellen kopierer dit ræsonnementsmønster, ikke bare dit svarformat.

Chain of thought vs prompt chaining vs tree of thought: hvad er forskellen?

Chain of thought ræsonnerer inde i én prompt. Prompt chaining splitter en opgave over flere separate modelkald og sender outputs fremad. Tree of thought udforsker flere ræsonnementgrene og beskærer svage. CoT er en enkelt lineær sti; de andre to tilføjer ekstern struktur omkring modellen.

Hvem opfandt chain of thought-prompting?

Chain of thought-prompting blev introduceret af Jason Wei og kolleger hos Google i 2022-artiklen "Chain-of-Thought Prompting Elicits Reasoning in Large Language Models." Kojima m.fl. tilføjede senere zero-shot CoT, og Wang m.fl. tilføjede self-consistency, begge også i 2022.

Virker chain of thought-prompting til kodegenerering?

Ja, på ikke-resonerende modeller. At bede modellen om at planlægge logikken, før den skriver kode, fanger edge cases og reducerer bugs på komplekse opgaver. På resoneringsmodeller sker planlægningen internt, så en almindelig instruktion fungerer normalt bedre end et håndskrevet "ræsonnér trin for trin"-præfiks.

Tags

chain of thought promptingcot promptingzero-shot cotself-consistencyresonerende modellerprompt engineering

Del denne artikel

Relaterede artikler

Mere fra ai-machine-learning

ai-machine-learning
Jul 20, 2026

8 bedste AI web scraping-API'er i 2026 (testet på vores egen agent-stack)

Vi testede 8 AI web scraping-API'er med reelle 2026-priser hentet gennem vores egen agent-stack. Firecrawl, Bright Data, ScrapingBee og 5 flere, rangeret efter LLM-klar output, anti-bot og MCP-understøttelse.

9 min read minutters læsning
Læs
ai-machine-learning
Jul 20, 2026

Prompt Engineering til kodning: 7 mønstre, vi bruger dagligt i Claude Code og Cursor (2026)

De fleste artikler om 'AI-kodningsprompts' giver dig 50 skabeloner at kopiere. Denne artikel lærer dig de 7 mønstre, vi bruger hver dag til at drive en 16-agent Claude Code-pipeline, med ægte før-og-efter eksempler for hvert enkelt, samt hvor hvert mønster hører hjemme i Claude Code, Cursor og Copilot i 2026.

11 min read minutters læsning
Læs
ai-machine-learning
Jul 19, 2026

Fra AI-PoC til produktion: 12-punkts tjeklisten før lancering

En fungerende AI-demo er ikke et produktionssystem. Denne 12-punkts tjekliste gennemgår de tre faser, enhver AI-funktion kræver før lancering: hærd, stabiliser og udrul – med konkrete grænseværdier for omkostningslofter, hastighedsbegrænsninger, fallbacks og rollback-udløsere.

10 min read minutters læsning
Læs
Se alle indlæg
Start dit projekt

Klar til at bygge noget ekstraoordinær?

Lad os gøre din vision til virkelighed. Vores team står klar til at hjælpe dig med at skabe software, der gør en forskel.

Book et 30 min. scopemødeSe vores arbejde

Fra biblioteket

Claude Skills

Se alle
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI-automatiseringer

Se alle
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Fra biblioteket

Claude Skills

Se alle
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI-automatiseringer

Se alle
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Tjenester

  • Entertainmentløsninger
  • Mobilapps
  • Webapplikationer

Løsninger

  • CRM-systemer
  • AI-integration
  • ERP-løsninger
  • Stemmeargenter
  • Processautomatisering
  • Cybersikkerhed

Bibliotek

  • Blog
  • Portfolio

Fællesskab

  • AI-automatiseringer
  • Claude Skills

Værktøjer

  • Pris på mobil-app
  • OpenAI / LLM API-prisreknemaskine
  • Pris på MVP
  • Pris på stemme-AI-agent

Virksomhed

  • Om
  • Partnere
  • Kontakt

Juridisk

  • Privatlivspolitik
  • Salgsbetingelser
  • Cookiepolitik

Tjenester

  • Entertainmentløsninger
  • Mobilapps
  • Webapplikationer

Løsninger

  • CRM-systemer
  • AI-integration
  • ERP-løsninger
  • Stemmeargenter
  • Processautomatisering
  • Cybersikkerhed

Bibliotek

  • Blog
  • Portfolio

Fællesskab

  • AI-automatiseringer
  • Claude Skills

Værktøjer

  • Pris på mobil-app
  • OpenAI / LLM API-prisreknemaskine
  • Pris på MVP
  • Pris på stemme-AI-agent

Virksomhed

  • Om
  • Partnere
  • Kontakt
JuridiskPrivatlivspolitikSalgsbetingelserCookiepolitik
TECHSY
© 2026 Techsy. Alle rettigheder forbeholdes.