Techsy
Contact
Începe
Înapoi la Blog
ai-machine-learning

Chain of Thought Prompting în 2026: Când funcționează, când dă greș

Scris de Mert Batur Gürbüz
Jul 19, 2026
13 min citire
Cuprins
Chain of Thought Prompting în 2026: Când funcționează, când dă greș

Promptarea de tip „chain of thought" are o problemă în 2026 pe care ghidurile de top o omit: același truc care a făcut modelele mai inteligente în 2022 poate, în prezent, să înrăutățească în mod silențios un model de raționament. Wei et al. l-au introdus în 2022 și a îmbunătățit acuratețea la probleme dificile de matematică și logică, determinând modelele să-și arate pașii de raționament. Exista însă un neajuns. Funcționa doar după ce modelele depășeau aproximativ 100 de miliarde de parametri. Acum, modelele de raționament din seriile o-series și GPT-5 efectuează acest raționament la nivel intern, așa că a le spune să „gândească pas cu pas" adesea doar consumă tokeni. Când ar trebui să-l mai folosești și când ar trebui să renunți la el?

Concluzii principale:

  • Promptarea de tip „chain of thought" afișează pașii de raționament ai unui model și îmbunătățește acuratețea în cazul matematicii, logicii și codului cu mai mulți pași.
  • Este o abilitate emergentă: abia dacă ajută modelele mici, iar modelele de raționament o aplică deja la nivel intern.
  • În cazul o-series, al raționamentului GPT-5 și al gândirii extinse Claude, instrucțiunea manuală „gândește pas cu pas" este adesea redundantă.
  • Folosește în continuare CoT manual pentru modelele fără raționament și pentru modelele open-source locale sau atunci când ai nevoie de un traseu de raționament auditabil.

Ce este Chain of Thought Prompting?

Chain of thought (CoT) prompting este o tehnică prin care i se cere unui model de limbaj să rezolve o problemă în pași intermediari expliciți înainte de a oferi un răspuns final. Introdusă de Wei et al. în 2022, aceasta îmbunătățește acuratețea în sarcinile de matematică, logică și bun simț cu mai mulți pași și face vizibil raționamentul modelului.

Întreabă un model simplu o problemă cu cuvinte fără nicio pregătire și adesea va arunca un număr greșit. Cere-i să raționeze mai întâi și șansele cresc semnificativ. Ia exemplul „Pe un raft sunt 3 cutii cu câte 7 cărți; scot 5. Câte rămân?" Fără îndrumare, un model mic ar putea răspunde „21." Adaugă „Hai să gândim pas cu pas" și va scrie: 3 x 7 = 21, apoi 21 - 5 = 16. Același model, răspuns mai bun, și poți vedea unde a greșit dacă se întâmplă asta. CoT este doar un instrument din trusa mai largă prezentată în ghidul nostru de prompt engineering; această postare se concentrează exclusiv pe el.

Cum funcționează (și de ce a devenit clar abia la scară mare)

CoT funcționează prin generarea de către model a unui lanț de raționament în limbaj natural, token cu token, astfel încât fiecare concluzie intermediară condiționează următoarea. Wei et al. (2022) au descoperit că aceasta este o abilitate emergentă: ajută aproape deloc modelele mici și produce creșteri mari de acuratețe doar după ce modelele depășesc aproximativ 100 de miliarde de parametri.

Gândește-te ca la momentul în care îți arăți calculele la ora de matematică. Un model prezice câte un token pe rând, iar fiecare cuvânt pe care îl scrie devine parte din inputul pentru următorul cuvânt. Când scrie „21" ca rezultat intermediar, acel „21" se află acum în context, orientând pasul final către „16". Sari peste pași și modelul trebuie să ajungă direct la răspuns fără nimic pe care să se sprijine. Ciudat este că acest beneficiu apare doar la scară mare. În lucrarea fondatoare, echipa lui Wei a constatat că modelele mici nu au obținut aproape nicio îmbunătățire, iar uneori au performat mai prost. De aceea același prompt care eșuează pe un model local de 7B poate transforma unul de frontieră.

Cele trei variante: Zero-Shot, Few-Shot și Self-Consistency

Există trei variante principale de CoT. Zero-shot CoT doar adaugă „Let's think step by step” (Kojima et al., 2022). Few-shot CoT prezintă mai întâi exemple de raționament rezolvate. Self-consistency (Wang et al., 2022) eșantionează mai multe căi de raționament și alege răspunsul prin vot majoritar, fiind cea mai fiabilă și cea mai costisitoare dintre cele trei.

Zero-shot este trucul magic leneș. Adaugi o singură propoziție și modelul raționează fără niciun exemplu. Kojima et al. au arătat că doar „Let's think step by step” transformă un model mare într-un agent de raționament zero-shot decent.

python
# Zero-shot CoT: adaugă fraza de declanșare. Funcționează cel mai bine pe modelele fără raționament.
# Numele modelelor se schimbă rapid, așa că tratează șirul de mai jos ca pe un substituent.
from openai import OpenAI
client = OpenAI()

prompt = (
    "Q: A shelf holds 3 boxes. Each box has 7 books. "
    "I remove 5 books. How many are left?\n"
    "A: Let's think step by step."
)

resp = client.chat.completions.create(
    model="your-non-reasoning-model",
    messages=[{"role": "user", "content": prompt}],
)
print(resp.choices[0].message.content)

Few-shot CoT goes further: you hand the model two or three worked examples so it copies the reasoning pattern for your domain. Self-consistency is the accuracy dial. Instead of trusting one chain, you sample five at a higher temperature and let them vote. Wang et al. found the majority answer is usually right even when individual chains wander off.

python
# Auto-coerență: eșantionează N căi de raționament și alege răspunsul prin votul majorității.
# Mai precis, mai costisitor. Wang et al., 2022.
from collections import Counter

def self_consistency(prompt, n=5, temperature=0.7):
    answers = []
    for _ in range(n):
        resp = client.chat.completions.create(
            model="your-non-reasoning-model",
            messages=[{"role": "user", "content": prompt}],
            temperature=temperature,  # diversity across paths
        )
        answers.append(extract_final_answer(resp.choices[0].message.content))
    return Counter(answers).most_common(1)[0][0]  # majority vote

Vrei acel raționament ca JSON curat în loc de text liber? Combină CoT cu tiparele din ghidul nostru de ieșiri structurate pentru ca un pas ulterior să îl poată analiza.

Schimbarea din 2026: Modelele de raționament au schimbat regulile

Modelele de raționament, seria o și raționamentul GPT-5 de la OpenAI, gândirea extinsă a lui Claude și DeepSeek R1, realizează un lanț de gândire în mod intern înainte de a răspunde. Ghidul propriu al OpenAI afirmă că a le spune în mod explicit acestor modele să „gândească pas cu pas" este inutil și că a cere unui model de raționament să raționeze mai mult poate chiar dăuna performanței. Structura de sprijin este deja încorporată.

Aceasta este partea despre care ghidurile mai vechi pretind că nu se întâmplă. Un model de raționament produce un lanț de gândire privat înainte de a-ți arăta vreodată un răspuns, astfel încât acel „pas cu pas" pe care obișnuiai să-l scrii manual se întâmplă acum sub capotă. Cele mai bune practici de raționament ale OpenAI o spun fără ocolișuri: „Evitați prompturile de tip lanț de gândire: deoarece aceste modele realizează raționamentul în mod intern, a le cere să «gândească pas cu pas» sau să «își explice raționamentul» este inutil." Ghidul lor de promptare pentru o3/o4-mini merge un pas mai departe: „A cere unui model de raționament să raționeze mai mult poate chiar dăuna performanței."

Gândirea extinsă a lui Anthropic este aceeași idee transpusă în produs. Îi oferi lui Claude un buget de gândire în loc de un script pas cu pas, iar cele mai noi modele decid singure cât de profund să gândească. Pentru această clasă de modele, ajustezi reasoning_effort sau bugetul de gândire, nu formularea. Pentru zona modelelor de raționament open-source, inclusiv DeepSeek R1, vezi analiza noastră Qwen vs DeepSeek vs GLM.

Când CoT-ul manual încă ajută și când este contraproductiv

CoT-ul manual încă ajută în cazul modelelor fără raționament și al modelelor open-source mici sau locale, sau atunci când ai nevoie de o anumită structură de raționament ori de o urmă auditabilă. Este contraproductiv în cazul modelelor native de raționament (redundant și mai lent), în cazul sarcinilor simple într-un singur pas și în cazul căilor sensibile la latență sau cost, unde pur și simplu arde tokeni fără niciun câștig de acuratețe.

CoT-ul manual încă ajută cândCoT-ul manual este contraproductiv când
Folosești un model fără raționament (GPT mai vechi, Llama de bază)Folosești un model de raționament (seria o, GPT-5 reasoning, Claude thinking)
Rulezi un model open-source mic sau localSarcina este o căutare, o clasificare sau o schimbare de format într-un singur pas
Ai nevoie de o structură de raționament fixă, auditabilăTe afli pe o cale în timp real, sensibilă la latență
Sarcina implică matematică, logică sau planificare în mai mulți pașiTe afli pe un endpoint cu volum mare, sensibil la cost
Vrei o urmă vizibilă pe care o poți inspecta sau căuta cu grepModelul raționează deja intern, deci pașii doar se repetă

Iată un exemplu real din propria noastră echipă. Pipeline-ul de 12 agenți care a scris acest articol rulează pe modele Claude, iar noi nu le spunem niciodată în mod deliberat acestor agenți să „gândească pas cu pas", deoarece modelele raționează deja intern și asta nu ar face decât să adauge zgomot. Ceea ce scriem de mână sunt schele de raționament rigide, care pot fi căutate cu grep. Agentul nostru validator rulează un rubric fix de 100 de puncte (50 pentru calitate, 50 pentru SEO) plus opt verificări de poartă secvențiale. Traducătorul urmează o listă de verificare prestabilită: să se potrivească cu numărul de H2 din sursă, să ruleze un grep pentru diacritice care trebuie să returneze mai mult de zero și să rămână într-un interval de 80 până la 120 la sută din numărul de linii. Publicatorul rulează porți pre- și post-publicare care verifică prin regex data și ora publishedAt, apoi interoghează CMS-ul pentru a confirma că corpul articolului nu este gol.

Nimic din toate acestea nu este despre mai multă gândire. Este o cale fixă, auditabilă, pe care o putem inspecta și căuta cu grep, ceea ce este exact cazul în care „CoT-ul manual încă ajută". Am adăugat aceste porți dintr-un motiv: o valoare publishedAt care conținea doar data a ascuns odată, în mod silențios, un articol întreg din indexul blogului nostru, așa că secvența rigidă de pași există acum pentru a împiedica modelul să sară peste o verificare. O mențiune sinceră: aceasta este o observație operațională, nu un benchmark. Nu am rulat un test A/B controlat de acuratețe între „gândește pas cu pas" și nicio instrucțiune, așa că trateaz-o ca pe o lecție despre structură și auditabilitate, nu ca pe o afirmație despre cifre. Rulezi modele locale acolo unde CoT-ul manual încă merită efortul? Clasamentul nostru cu cele mai bune LLM-uri open-source din 2026 acoperă întreaga zonă. Iar dacă vreodată expui utilizatorilor lanțul de gândire al unui model, tratează-l ca output nesigur; ghidul nostru despre prevenirea injecției de prompturi explică de ce.

Costul ascuns: tokeni, latență și factura ta

CoT nu este gratuit. Fiecare pas de raționament reprezintă tokeni de ieșire pentru care plătești, iar generările mai lungi cresc latența. Modelele de raționament facturează tokeni de raționament ascunși, pe lângă răspunsul vizibil. Pe endpoint-urile cu volum mare sau în timp real, forțarea unei ieșiri pas cu pas poate multiplica pe tăcute costul, așa că prevede un buget pentru asta sau limiteaz-o cu reasoning_effort.

Fiecare „pas 1, pas 2, pas 3" pe care îl scrie modelul înseamnă tokeni de ieșire, iar tokenii de ieșire sunt categoria scumpă. Un lanț de cinci ori mai lung decât răspunsul simplu costă aproximativ de cinci ori mai mult pentru acel apel și se transmite înapoi mai lent. Modelele de raționament adaugă un element surprinzător: ele facturează tokeni de raționament pentru gândirea internă pe care nu o vezi niciodată, așa că un răspuns final scurt poate ascunde un lanț lung, deja plătit. Pe un endpoint cu volum redus, asta e doar zgomot; pe unul cu trafic intens, costul se adună rapid. Două obiceiuri mențin situația sub control. Stochează în cache părțile stabile ale contextului, ca să nu plătești pentru a le reciti (ghidul nostru despre prompt caching îți arată cum) și măsoară dacă tokenii suplimentari chiar aduc acuratețe înainte de a implementa CoT peste tot. Ghidul nostru despre evaluări LLM acoperă această măsurare, ca să nu plătești pentru un raționament care nu ridică scorul.

Cum să folosești CoT în 2026: o listă de verificare pentru decizii

Mai întâi, identifică clasa modelului tău. Pe un model de raționament, sari peste CoT-ul manual și ajustează în schimb reasoning_effort sau bugetul de gândire. Pe un model fără raționament sau un model local, adaugă „Let's think step by step" zero-shot, treci la few-shot pentru sarcini de domeniu și adaugă self-consistency doar când acuratețea contează mai mult decât costul în tokeni.

Iată întreaga decizie în cinci pași:

  1. Identifică clasa modelului tău. Model de raționament sau nu? Acel singur fapt decide tot ce urmează.
  2. Pe un model de raționament, nu scrie CoT manual. Ajustează în schimb reasoning_effort sau bugetul de gândire și lasă modelul să raționeze intern.
  3. Pe un model fără raționament sau un model local, adaugă „Let's think step by step" zero-shot. E o singură linie și nu costă nimic să încerci.
  4. Pentru sarcini specifice unui domeniu, treci la CoT few-shot cu două sau trei exemple rezolvate. Adaugă self-consistency doar când acuratețea primează în fața costului în tokeni.
  5. Dacă expui raționamentul, măsoară-l cu evaluri și tratează lanțul vizibil ca output nesigur.

Fraza de declanșare în sine se află de obicei în promptul de sistem. Exemplele noastre de system prompt arată unde se plasează și cum să o formulezi.

python
# Pe un model de raționament, nu scrie CoT manual. Reglează în schimb nivelul de efort.
# Numele parametrilor și nivelurile diferă de la un furnizor și o versiune la alta, așa că verifică documentația actuală.
resp = client.responses.create(
    model="your-reasoning-model",
    reasoning={"effort": "medium"},   # de ex. low | medium | high
    input="Demonstrează că rădăcina pătrată a lui 2 este irațională.",
)
# Echivalentul Anthropic: un buget de gândire extinsă.
# budget_tokens TREBUIE să fie mai mic decât max_tokens.
# thinking = {\"type\": \"enabled\", \"budget_tokens\": 4000}

Integrarea acestui lucru într-un stack de producție este mai migăloasă decât lasă să pară un exemplu de blog. Dacă preferi să nu ajustezi singur bugetele de raționament și harness-urile de evaluare, echipa noastră construiește aceste pipeline-uri de la un capăt la celălalt. Vezi Integrare AI sau ia legătura cu noi.

Despre autor

Mert Batur Gurbuz este co-fondator al Techsy.io, unde echipa livrează agenți AI, sisteme de automatizare și pipeline-uri voice/SDR pentru clienți B2B. Studiază la University of Birmingham și scrie despre stack-ul de instrumente LLM pe care echipa Techsy îl folosește efectiv în producție.

Co-fondator, Techsy.io, University of Birmingham. Conectați-vă pe LinkedIn.

Întrebări frecvente

Mai este relevant prompting-ul cu lanț de gândire (chain of thought) în 2026?

Da, dar rolul său s-a redus. Pe modelele fără raționament și pe cele open-source mici sau locale, CoT manual încă îmbunătățește acuratețea în sarcinile cu mai mulți pași. Pe modelele cu raționament, este în mare parte redundant. Cea mai puternică utilizare rămasă este forțarea unui singur traseu de raționament fix, auditabil, pe care îl poți inspecta.

Funcționează promptarea de tip „chain of thought” pe modele de raționament precum GPT-5, o3 sau Claude?

Aceste modele raționează deja intern, așa că un CoT manual este de obicei redundant și uneori dăunător. Documentația OpenAI afirmă că îndemnul de a „gândi pas cu pas” este inutil și că a le cere să raționeze mai mult „poate chiar dăuna performanței”. Ajustează mai degrabă efortul de raționament în loc să scrii pași.

Ce este prompting-ul zero-shot chain of thought?

Zero-shot CoT înseamnă adăugarea unei fraze declanșatoare, de obicei „Let's think step by step", fără a oferi mai întâi exemple rezolvate. Kojima et al. (2022) au demonstrat că doar acest lucru transformă un model mare într-un raționator decent. Este cea mai ieftină variantă de CoT: o singură linie, fără selectarea exemplelor, rapid de testat.

Ce este self-consistency în promptarea chain of thought?

Self-consistency, din Wang et al. (2022), eșantionează mai multe lanțuri de raționament independente la o temperatură mai ridicată, apoi aplică votul majoritar asupra răspunsului final. Este cea mai precisă variantă CoT, deoarece lanțurile greșite rareori ajung la același rezultat, dar plătești pentru fiecare cale eșantionată, deci este și cea mai costisitoare.

Care este diferența dintre chain of thought și few-shot prompting?

Few-shot prompting arată modelului perechi exemplu de intrare-ieșire. Chain of thought se concentrează pe raționamentul dintre intrare și ieșire. Cele două se combină bine: few-shot CoT oferă exemple rezolvate care includ pașii de raționament, astfel încât modelul copiază tiparul tău de raționament, nu doar formatul răspunsului.

Lanțul gândirii vs. înlănțuirea prompturilor vs. arborele gândirii: care e diferența?

Lanțul gândirii raționează în interiorul unui singur prompt. Înlănțuirea prompturilor împarte o sarcină în mai multe apeluri separate ale modelului, transmițând rezultatele mai departe. Arborele gândirii explorează mai multe ramuri de raționament și le elimină pe cele slabe. CoT este o singură cale liniară; celelalte două adaugă o structură externă în jurul modelului.

Cine a inventat promptarea de tip chain of thought?

Promptarea de tip chain of thought a fost introdusă de Jason Wei și colegii săi de la Google, în lucrarea din 2022 „Chain-of-Thought Prompting Elicits Reasoning in Large Language Models". Ulterior, Kojima și colab. au adăugat varianta zero-shot CoT, iar Wang și colab. au adăugat auto-consistența, ambele tot în 2022.

Funcționează promptarea cu lanț de gândire (chain of thought) pentru generarea de cod?

Da, în cazul modelelor fără raționament. A cere modelului să planifice logica înainte de a scrie cod ajută la identificarea cazurilor limită și reduce erorile în sarcinile complexe. În cazul modelelor cu raționament, planificarea are loc intern, așa că o instrucțiune simplă funcționează de obicei mai bine decât un prefix „raționează pas cu pas” scris manual.

Etichete

chain of thought promptingcot promptingzero-shot cotself-consistencymodele de raționamentprompt engineering

Distribuie acest articol

Articole similare

Mai multe din ai-machine-learning

ai-machine-learning
Jul 20, 2026

Cele mai bune 8 API-uri de web scraping AI în 2026 (testate pe stack-ul nostru de agenți)

Am testat 8 API-uri de web scraping AI cu prețuri reale din 2026, obținute prin stack-ul nostru de agenți. Firecrawl, Bright Data, ScrapingBee și alte 5, clasificate pentru output gata pentru LLM, anti-bot și suport MCP.

9 min read min citire
Citește
ai-machine-learning
Jul 20, 2026

Ingineria prompturilor pentru programare: 7 modele pe care le folosim zilnic în Claude Code și Cursor (2026)

Majoritatea articolelor despre „prompturi AI pentru codare” îți oferă 50 de șabloane de copiat. Acest articol te învață cele 7 modele pe care le folosim în fiecare zi pentru a rula o pipeline Claude Code cu 16 agenți, cu exemple reale de „înainte și după” pentru fiecare, plus unde se aplică fiecare model în Claude Code, Cursor și Copilot în 2026.

11 min read min citire
Citește
ai-machine-learning
Jul 19, 2026

De la PoC AI la producție: checklist-ul în 12 puncte înainte de lansare

Un demo AI funcțional nu este un sistem de producție. Acest checklist în 12 puncte parcurge cele trei faze de care orice funcționalitate AI are nevoie înainte de lansare: consolidare, stabilizare și implementare, cu praguri concrete pentru plafoane de cost, limite de rată, soluții de rezervă și declanșatoare de rollback.

10 min read min citire
Citește
Vezi toate articolele
Începe Proiectul Tău

Gata să construim ceva extraordinară?

Hai să-ți transformăm viziunea în realitate. Echipa noastră e pregătită să te ajute să creezi software care face diferența.

Programează un apel de 30 minVezi proiectele noastre

Cele mai populare din bibliotecă

Skill-uri Claude

Vezi toate
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automatizări AI

Vezi toate
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Cele mai populare din bibliotecă

Skill-uri Claude

Vezi toate
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automatizări AI

Vezi toate
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Servicii

  • Soluții Enterprise
  • Aplicații Mobile
  • Aplicații Web

Soluții

  • Sisteme CRM
  • Integrare AI
  • Soluții ERP
  • Agenți Vocali
  • Automatizarea Proceselor
  • Cibersécurité

Bibliotecă

  • Blog
  • Portofoliu

Comunitate

  • Automatizări AI
  • Skill-uri Claude

Tool-uri

  • Calculator cost aplicație mobilă
  • Calculator cost API OpenAI / LLM
  • Calculator cost MVP
  • Calculator cost agent AI vocal

Companie

  • Despre
  • Parteneri
  • Contact

Mențiuni legale

  • Politica de confidențialitate
  • Termeni și condiții
  • Politica cookie

Servicii

  • Soluții Enterprise
  • Aplicații Mobile
  • Aplicații Web

Soluții

  • Sisteme CRM
  • Integrare AI
  • Soluții ERP
  • Agenți Vocali
  • Automatizarea Proceselor
  • Cibersécurité

Bibliotecă

  • Blog
  • Portofoliu

Comunitate

  • Automatizări AI
  • Skill-uri Claude

Tool-uri

  • Calculator cost aplicație mobilă
  • Calculator cost API OpenAI / LLM
  • Calculator cost MVP
  • Calculator cost agent AI vocal

Companie

  • Despre
  • Parteneri
  • Contact
Mențiuni legalePolitica de confidențialitateTermeni și condițiiPolitica cookie
TECHSY
© 2026 Techsy. Toate drepturile rezervate.