Techsy
Kontakt
Kom igång
Tillbaka till bloggen
ai-machine-learning

Chain of Thought Prompting 2026: När Det Fungerar, När Det Ger Bakslag

Skriven av Mert Batur Gürbüz
Uppdaterad Jul 19, 2026
11 läsning
Innehållsförteckning
Chain of Thought Prompting 2026: När Det Fungerar, När Det Ger Bakslag

Chain of thought prompting har ett problem 2026 som de stora guiderna hoppar över: samma knep som gjorde modeller smartare 2022 kan i dag tyst göra en resonemangsmodell sämre. Wei et al. introducerade tekniken 2022, och den höjde träffsäkerheten på svår matematik och logik genom att få modeller att visa sina resonemangssteg. Det fanns en hake. Effekten uppstod först när modeller passerade ungefär 100 miljarder parametrar. Nu gör o-serien och GPT-5:s resonemangsmodeller det tänkandet internt, så att be dem "tänka steg för steg" ofta bara bränner tokens. När ska du fortfarande använda det, och när ska du hoppa över det?

Viktiga slutsatser:

  • Chain of thought prompting visar en modells resonemangssteg och höjer träffsäkerheten på flerstegsmatematik, logik och kod.
  • Det är en emergent förmåga: den hjälper knappt små modeller alls, och resonemangsmodeller gör det redan internt.
  • På o-serien, GPT-5-resonemang och Claudes extended thinking är manuellt "tänk steg för steg" ofta överflödigt.
  • Använd fortfarande manuell CoT på icke-resonerande och lokala open source-modeller, eller när du behöver en granskningsbar resonemangskedja.

Vad Är Chain of Thought Prompting?

Chain of thought (CoT) prompting är en teknik som ber en språkmodell arbeta sig igenom ett problem i explicita mellansteg innan den ger ett slutgiltigt svar. Tekniken introducerades av Wei et al. 2022 och förbättrar träffsäkerheten på flerstegsmatematik, logik och sunt förnuft-uppgifter, samtidigt som den gör modellens resonemang synligt.

Fråga en vanlig modell en textuppgift utan förberedelse och den svarar ofta fel. Be den resonera först, och chansen ökar rejält. Ta "En hylla har 3 lådor med 7 böcker; jag tar bort 5. Hur många är kvar?" Utan förberedelse kan en liten modell svara "21". Lägg till "Let's think step by step" och den skriver: 3 x 7 = 21, sedan 21 - 5 = 16. Samma modell, bättre svar, och du kan se var den snubblade om den gör det. CoT är ett verktyg bland flera i den bredare verktygslådan i vår guide till prompt engineering; det här inlägget zoomar in helt på just den tekniken.

Så Fungerar Det (och Varför Det Bara Klickade Till vid Skala)

CoT fungerar genom att modellen genererar en resonemangskedja på naturligt språk, token för token, så att varje mellanliggande slutsats påverkar nästa. Wei et al. (2022) visade att detta är en emergent förmåga: den hjälper knappt små modeller alls och ger stora förbättringar först när modeller passerar ungefär 100 miljarder parametrar.

Tänk på det som att visa uträkningen på mattelektionen. En modell förutspår ett token i taget, och varje ord den skriver blir en del av inmatningen för nästa ord. När den skriver "21" som ett mellanresultat ligger den siffran nu kvar i kontexten och styr slutsteget mot "16". Hoppar man över stegen måste modellen kasta sig rakt på svaret utan något att luta sig mot. Det märkliga är att den här fördelen bara dyker upp vid skala. I ursprungsartikeln fann Weis team att små modeller knappt fick någon effekt alls, ibland till och med sämre resultat. Det är därför samma prompt som floppar på en lokal 7B-modell kan förvandla en toppmodell.

De Tre Varianterna: Zero-Shot, Few-Shot och Self-Consistency

Det finns tre huvudvarianter av CoT. Zero-shot CoT lägger bara till "Let's think step by step" (Kojima et al., 2022). Few-shot CoT visar färdiga resonemangsexempel först. Self-consistency (Wang et al., 2022) samplar flera resonemangskedjor och låter majoriteten avgöra svaret, den mest pålitliga och samtidigt dyraste av de tre.

Zero-shot är det lata trolleritricket. Du lägger till en enda mening och modellen resonerar utan några exempel alls. Kojima et al. visade att "Let's think step by step" ensamt förvandlar en stor modell till en godkänd zero-shot-resonerare.

python
# Zero-shot CoT: append the trigger phrase. Best on non-reasoning models.
# Model names change fast, so treat the string below as a placeholder.
from openai import OpenAI
client = OpenAI()

prompt = (
    "Q: A shelf holds 3 boxes. Each box has 7 books. "
    "I remove 5 books. How many are left?\n"
    "A: Let's think step by step."
)

resp = client.chat.completions.create(
    model="your-non-reasoning-model",
    messages=[{"role": "user", "content": prompt}],
)
print(resp.choices[0].message.content)

Few-shot CoT går ett steg längre: du ger modellen två eller tre färdiga exempel så att den kopierar resonemangsmönstret för din domän. Self-consistency är precisionsratten. Istället för att lita på en enda kedja samplar du fem vid högre temperatur och låter dem rösta. Wang et al. fann att majoritetssvaret oftast stämmer även när enskilda kedjor går vilse.

python
# Self-consistency: sample N reasoning paths, majority-vote the answer.
# More accurate, more expensive. Wang et al., 2022.
from collections import Counter

def self_consistency(prompt, n=5, temperature=0.7):
    answers = []
    for _ in range(n):
        resp = client.chat.completions.create(
            model="your-non-reasoning-model",
            messages=[{"role": "user", "content": prompt}],
            temperature=temperature,  # diversity across paths
        )
        answers.append(extract_final_answer(resp.choices[0].message.content))
    return Counter(answers).most_common(1)[0][0]  # majority vote

Vill du ha resonemanget som ren JSON istället för fri text? Kombinera CoT med mönstren i vår guide till strukturerade utdata så att ett senare steg kan tolka det.

Skiftet 2026: Resonemangsmodeller Ändrade Reglerna

Resonemangsmodeller, OpenAIs o-serie och GPT-5-resonemang, Claudes extended thinking och DeepSeek R1, gör chain of thought internt innan de svarar. OpenAIs egna riktlinjer säger uttryckligen att det är onödigt att be dessa modeller "tänka steg för steg", och att be en resonemangsmodell resonera mer faktiskt kan försämra resultatet. Stödstrukturen finns redan inbyggd.

Det här är delen de äldre guiderna later som inte händer. En resonemangsmodell producerar en privat resonemangskedja innan den någonsin visar dig ett svar, så steg-för-steg-arbetet du brukade skriva för hand sker nu under huven. OpenAIs riktlinjer för resonemang säger det rakt ut: "Undvik chain-of-thought-prompter: Eftersom dessa modeller resonerar internt är det onödigt att be dem 'tänka steg för steg' eller 'förklara sitt resonemang'." Deras prompt-guide för o3/o4-mini går ett steg längre: "Att be en resonemangsmodell resonera mer kan faktiskt försämra resultatet."

Anthropics extended thinking är samma idé, fast paketerad som produkt. Du ger Claude en tankebudget istället för ett steg-för-steg-manus, och de senaste modellerna avgör själva hur djupt de ska resonera. På den här modellklassen justerar du reasoning_effort eller tankebudgeten, inte ordvalet. För den öppna resonemangsmodell-sidan, inklusive DeepSeek R1, se vår genomgång av Qwen vs DeepSeek vs GLM.

När Manuell CoT Fortfarande Hjälper vs När Det Ger Bakslag

Manuell CoT hjälper fortfarande på icke-resonerande och små eller lokala open source-modeller, eller när du behöver en specifik resonemangsstruktur eller en granskningsbar spårbarhet. Det ger bakslag på inbyggda resonemangsmodeller (överflödigt och långsammare), på enkla ett-stegsuppgifter, och på latens- eller kostnadskänsliga flöden, där det bara bränner tokens utan att ge någon precisionsvinst.

Manuell CoT hjälper fortfarande närManuell CoT ger bakslag när
Du kör en icke-resonerande modell (äldre GPT, bas-Llama)Du kör en resonemangsmodell (o-serien, GPT-5-resonemang, Claude thinking)
Du kör en liten eller lokal open source-modellUppgiften är en enstegs-sökning, klassificering eller formatändring
Du behöver en fast, granskningsbar resonemangsstrukturDu kör ett latenskänsligt realtidsflöde
Uppgiften är flerstegsmatematik, logik eller planeringDu kör en högvolym-, kostnadskänslig endpoint
Du vill ha ett synligt spår du kan granska eller grep:aModellen resonerar redan internt, så stegen bara upprepas

Här är ett konkret exempel från vår egen verksamhet. Den 12-agentspipeline som skrev det här inlägget körs på Claude-modeller, och vi säger medvetet aldrig till de agenterna att "tänka steg för steg", eftersom modellerna redan resonerar internt och det bara skulle lägga till brus. Det vi däremot skriver för hand är stela, greppbara resonemangsstrukturer. Vår valideringsagent kör en fast 100-poängsrubrik (50 kvalitet, 50 SEO) plus åtta sekventiella grindkontroller. Översättaragenten följer en fast checklista: matcha källans H2-antal, kör en diakritik-grep som måste ge fler än noll träffar, och håll sig inom ett radantal på 80 till 120 procent. Publiceringsagenten kör kontroller före och efter publicering som regex-kontrollerar publishedAt-datumet och sedan frågar CMS:et för att bekräfta att innehållet inte är tomt.

Inget av det handlar om mer tänkande. Det är en fast, granskningsbar väg vi kan inspektera och grep:a, vilket är precis fallet där "manuell CoT fortfarande hjälper". Vi lade till de här kontrollerna av en anledning: ett publishedAt-värde utan tid dolde en gång tyst ett helt inlägg från vårt blogg-index, så den stela stegsekvensen finns nu för att stoppa modellen från att hoppa över en verifiering. En ärlig brasklapp: det här är en operativ observation, inte ett benchmark. Vi har inte kört ett kontrollerat noggrannhets-A/B-test på "tänk steg för steg" mot ingen instruktion alls, så se det som en lärdom om struktur och granskningsbarhet, inte ett sifferpåstående.

Kör du lokala modeller där manuell CoT fortfarande lönar sig? Vår genomgång av de bästa open source-LLM:erna 2026 täcker fältet. Och om du någonsin visar en modells chain of thought för användare, behandla det som opålitlig utdata; vår guide om prompt injection-skydd förklarar varför.

Den Dolda Kostnaden: Tokens, Latens och Din Räkning

CoT är inte gratis. Varje resonemangssteg är output-tokens du betalar för, och längre genereringar höjer latensen. Resonemangsmodeller fakturerar dolda resonemangstokens ovanpå det synliga svaret. På högvolym- eller realtidsendpoints kan forcerat steg-för-steg-utdata i det tysta mångdubbla kostnaden, så budgetera för det eller begränsa det med reasoning_effort.

Varje "steg 1, steg 2, steg 3" modellen skriver är output-tokens, och output-tokens är den dyra sorten. En kedja som är fem gånger längre än det nakna svaret kostar ungefär fem gånger så mycket på det anropet, och strömmas tillbaka långsammare. Resonemangsmodeller lägger till en twist: de fakturerar resonemangstokens för det interna tänkandet du aldrig ser, så ett kort slutsvar kan dölja en lång, betald kedja. På en lågvolymendpoint är det brus; på en högtrafikerad kryper det upp snabbt. Två vanor håller det i schack. Cacha de stabila delarna av din kontext så du inte betalar för att läsa om dem (vår guide till prompt caching visar hur), och mät om de extra tokens faktiskt köper precision innan du rullar ut CoT överallt. Vår guide till LLM-utvärderingar täcker den mätningen, så du inte betalar för resonemang som inte flyttar poängen.

Så Använder Du CoT 2026: En Beslutschecklista

Först, identifiera din modellklass. På en resonemangsmodell hoppar du över manuell CoT och justerar istället reasoning_effort eller tankebudgeten. På en icke-resonerande eller lokal modell lägger du till zero-shot "Let's think step by step", uppgraderar till few-shot för domänspecifika uppgifter, och lägger till self-consistency bara när precisionen väger tyngre än tokenkostnaden.

Här är hela beslutet i fem steg:

  1. Identifiera din modellklass. Resonemangsmodell eller inte? Det enda faktumet avgör allt nedan.
  2. På en resonemangsmodell, skriv inte CoT för hand. Justera istället reasoning_effort eller tankebudgeten, och låt modellen resonera internt.
  3. På en icke-resonerande eller lokal modell, lägg till zero-shot "Let's think step by step." Det är en rad och kostnadsfritt att testa.
  4. För domänspecifika uppgifter, uppgradera till few-shot CoT med två eller tre färdiga exempel. Lägg till self-consistency bara när precisionen slår tokenkostnaden.
  5. Om du exponerar resonemanget, mät det med utvärderingar och behandla den synliga kedjan som opålitlig utdata.

Själva triggerfrasen ligger oftast i din systemprompt. Våra exempel på systemprompter visar var den ska placeras och hur den bör formuleras.

python
# On a reasoning model, don't hand-write CoT. Tune the effort instead.
# Param names and levels change per provider and version, so check current docs.
resp = client.responses.create(
    model="your-reasoning-model",
    reasoning={"effort": "medium"},   # e.g. low | medium | high
    input="Prove that the square root of 2 is irrational.",
)

# Anthropic equivalent: an extended-thinking budget.
# budget_tokens MUST be less than max_tokens.
# thinking = {"type": "enabled", "budget_tokens": 4000}

Att koppla in det här i en produktionsstack är krångligare än ett blogginlägg får det att se ut. Om du hellre slipper justera resonemangsbudgetar och utvärderingsverktyg själv bygger vårt team de här pipelinerna från början till slut. Se AI-integration eller kontakta oss.

Om Skribenten

Mert Batur Gurbuz är medgrundare av Techsy.io, där teamet bygger AI-agenter, automationssystem och röst-/SDR-pipelines för B2B-kunder. Han studerar vid University of Birmingham och skriver om den LLM-verktygsstack som Techsy-teamet faktiskt använder i produktion.

Medgrundare, Techsy.io, University of Birmingham. Anslut på LinkedIn.

Vanliga Frågor

Är chain of thought prompting fortfarande relevant 2026?

Ja, men dess roll har krympt. På icke-resonerande och små eller lokala open source-modeller höjer manuell CoT fortfarande träffsäkerheten på flerstegsuppgifter. På resonemangsmodeller är den mestadels överflödig. Den starkaste kvarvarande användningen är att tvinga fram en fast, granskningsbar resonemangsväg du kan inspektera.

Fungerar chain of thought prompting på resonemangsmodeller som GPT-5, o3 eller Claude?

De här modellerna resonerar redan internt, så manuell CoT är oftast överflödig och ibland skadlig. OpenAIs dokumentation säger att det är onödigt att be dem "tänka steg för steg", och att be dem resonera mer "kan faktiskt försämra resultatet". Justera resonemangsnivån istället för att skriva ut stegen.

Vad är zero-shot chain of thought prompting?

Zero-shot CoT innebär att man lägger till en triggerfras, oftast "Let's think step by step", utan att först ge några färdiga exempel. Kojima et al. (2022) visade att detta ensamt förvandlar en stor modell till en godkänd resonerare. Det är den billigaste CoT-varianten: en rad, inget exempelurval, snabb att testa.

Vad är self-consistency inom chain of thought prompting?

Self-consistency, från Wang et al. (2022), samplar flera oberoende resonemangskedjor vid högre temperatur och låter sedan majoriteten avgöra det slutgiltiga svaret. Det är den mest träffsäkra CoT-varianten eftersom felaktiga kedjor sällan är överens med varandra, men du betalar för varje samplad väg, så det är också den dyraste.

Vad är skillnaden mellan chain of thought och few-shot prompting?

Few-shot prompting visar modellen exempel på input-output-par. Chain of thought fokuserar på resonemanget mellan input och output. De kombineras väl: few-shot CoT ger färdiga exempel som inkluderar resonemangsstegen, så att modellen kopierar ditt resonemangsmönster och inte bara ditt svarsformat.

Chain of thought vs prompt chaining vs tree of thought: vad är skillnaden?

Chain of thought resonerar inuti en enda prompt. Prompt chaining delar upp en uppgift över flera separata modellanrop och för utdata vidare mellan dem. Tree of thought utforskar flera resonemangsgrenar och beskär de svaga. CoT är en enda linjär väg; de andra två lägger till extern struktur runt modellen.

Vem uppfann chain of thought prompting?

Chain of thought prompting introducerades av Jason Wei och kollegor på Google i 2022 års artikel "Chain-of-Thought Prompting Elicits Reasoning in Large Language Models". Kojima et al. lade senare till zero-shot CoT, och Wang et al. lade till self-consistency, båda också 2022.

Fungerar chain of thought prompting för kodgenerering?

Ja, på icke-resonerande modeller. Att be modellen planera logiken innan den skriver kod fångar upp specialfall och minskar buggar i komplexa uppgifter. På resonemangsmodeller sker planeringen internt, så en enkel instruktion fungerar oftast bättre än ett handskrivet "resonera steg för steg"-prefix.

Taggar

chain of thought promptingcot promptingzero-shot cotself-consistencyresonemangsmodellerprompt engineering

Dela denna artikel

Relaterade artiklar

Mer inom ai-machine-learning

ai-machine-learning
Jul 20, 2026

8 Bästa AI-Webbskrapnings-API:er 2026 (Testade i Vår Egen Agentstack)

Vi testade 8 AI-webbskrapnings-API:er med verkliga 2026-priser hämtade via vår egen agentstack. Firecrawl, Bright Data, ScrapingBee och 5 till, rankade efter LLM-redo utdata, anti-bot-skydd och MCP-stöd.

9 min läsning läsning
Läs
ai-machine-learning
Jul 19, 2026

Qwen3.8: Alibabas satsning på 2,4 biljoner öppna vikter – och vad vi faktiskt vet

Alibabas Qwen3.8 har 2,4 biljoner parametrar, ett löfte om öppna vikter och en live Max-Preview – men inte ett enda publicerat benchmark. Här är vad som är bekräftat, vad som inte är det, och varför de öppna vikterna är den verkliga nyheten.

9 min read läsning
Läs
ai-machine-learning
Jul 19, 2026

Från AI-PoC till produktion: 12-punktschecklistan innan lansering

En fungerande AI-demo är inget produktionssystem. Den här 12-punktschecklistan går igenom de tre faser varje AI-funktion behöver innan lansering: härda, stabilisera och driftsätta, med konkreta gränsvärden för kostnadstak, hastighetsbegränsningar, reservlösningar och återställningstriggers.

10 min läsning läsning
Läs
Visa alla inlägg
Starta ditt projekt

Redo att bygga något utöver det vanliga?

Låt oss göra verklighet av din idé. Vårt team hjälper dig gärna att bygga mjukvara som gör skillnad.

Boka ett scoping-möte på 30 minSe vårt arbete

Senaste från biblioteket

Resurser

Visa alla
  • Playbook för mjukvaruinköp

    Ett upprepningsbart ramverk för att köpa mjukvara utan att bränna ett halvår och en miljon på fel plattform.

  • Playbook för arkitekturbeslut

    Ett praktiskt ramverk för att välja din stack: när du bör bygga själv eller köpa, monolit eller mikrotjänster, och hur du undviker design som bara ska pryda ett CV.

  • Playbook för leverantörsval

    Så väljer du rätt utvecklingspartner, byrå, frilansare eller eget team, utan att betala för mycket eller få en halvfärdig produkt.

Claude Skills

Visa alla
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI-automationer

Visa alla
  • Säkerhetsgranskare

    Veckovis SCA- och IaC-skanning med prioriterade åtgärds-PR:er.

  • Cold Email-skribent

    Skapar förstakontaktsmejl förankrade i en specifik offentlig detalj.

  • Agent för lead-research

    Berikar ett mejl till en profil, poängsätter passform och larmar i Slack.

Senaste från biblioteket

Resurser

Visa alla
  • Playbook för mjukvaruinköp

    Ett upprepningsbart ramverk för att köpa mjukvara utan att bränna ett halvår och en miljon på fel plattform.

  • Playbook för arkitekturbeslut

    Ett praktiskt ramverk för att välja din stack: när du bör bygga själv eller köpa, monolit eller mikrotjänster, och hur du undviker design som bara ska pryda ett CV.

  • Playbook för leverantörsval

    Så väljer du rätt utvecklingspartner, byrå, frilansare eller eget team, utan att betala för mycket eller få en halvfärdig produkt.

Claude Skills

Visa alla
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI-automationer

Visa alla
  • Säkerhetsgranskare

    Veckovis SCA- och IaC-skanning med prioriterade åtgärds-PR:er.

  • Cold Email-skribent

    Skapar förstakontaktsmejl förankrade i en specifik offentlig detalj.

  • Agent för lead-research

    Berikar ett mejl till en profil, poängsätter passform och larmar i Slack.

Tjänster

  • Enterprise-lösningar
  • Mobilappar
  • Webbapplikationer

Lösningar

  • CRM-system
  • AI-integration
  • ERP-lösningar
  • Röstassistenter
  • Processautomation
  • Cybersäkerhet

Bibliotek

  • Resurser
  • Blogg
  • Portfolio

Community

  • AI-automationer
  • Claude Skills

Verktyg

  • Kostnadskalkylator för mobilappar
  • OpenAI / LLM API-kostnadskalkylator
  • Kostnadskalkylator för MVP
  • Kostnadskalkylator för röst-AI-agenter

Företag

  • Om oss
  • Partners
  • Kontakt

Juridiskt

  • Integritetspolicy
  • Användarvillkor
  • Cookiepolicy

Tjänster

  • Enterprise-lösningar
  • Mobilappar
  • Webbapplikationer

Lösningar

  • CRM-system
  • AI-integration
  • ERP-lösningar
  • Röstassistenter
  • Processautomation
  • Cybersäkerhet

Bibliotek

  • Resurser
  • Blogg
  • Portfolio

Community

  • AI-automationer
  • Claude Skills

Verktyg

  • Kostnadskalkylator för mobilappar
  • OpenAI / LLM API-kostnadskalkylator
  • Kostnadskalkylator för MVP
  • Kostnadskalkylator för röst-AI-agenter

Företag

  • Om oss
  • Partners
  • Kontakt
JuridisktIntegritetspolicyAnvändarvillkorCookiepolicy
TECHSY
© 2026 Techsy. Med ensamrätt.