
Chain of thought prompting ma w 2026 roku problem, który pomijają najlepsze przewodniki: ta sama sztuczka, która sprawiła, że modele stały się mądrzejsze w 2022 roku, dziś może po cichu pogorszyć działanie modelu rozumującego. Wei i inni wprowadzili ją w 2022 roku, a ona zwiększyła dokładność w trudnych zadaniach matematycznych i logicznych, zmuszając modele do pokazywania kroków rozumowania. Był jednak haczyk. Działało to dopiero wtedy, gdy modele przekraczały około 100 miliardów parametrów. Obecnie modele z serii o oraz GPT-5 wykonują to myślenie wewnętrznie, więc mówienie im „myśl krok po kroku” często tylko marnuje tokeny. Kiedy nadal warto tego używać, a kiedy należy to pominąć?
Kluczowe wnioski:
- Chain of thought prompting pokazuje kroki rozumowania modelu i zwiększa dokładność w wieloetapowej matematyce, logice i kodowaniu.
- Jest to zdolność emergentna: barely pomaga małym modelom, a modele rozumujące robią to już wewnętrznie.
- W przypadku serii o, rozumowania GPT-5 i rozszerzonego myślenia Claude, ręczne „myśl krok po kroku” jest często zbędne.
- Nadal stosuj ręczne CoT w modelach nierozumujących i lokalnych modelach open-source lub gdy potrzebujesz audytowalnej ścieżki rozumowania.
Czym jest Chain of Thought Prompting?
Chain of thought (CoT) prompting to technika, która prosi model językowy o przepracowanie problemu w wyraźnych krokach pośrednich przed udzieleniem ostatecznej odpowiedzi. Wprowadzona przez Wei i innych w 2022 roku, poprawia dokładność w wieloetapowych zadaniach matematycznych, logicznych i związanych ze zdrowym rozsądkiem, a także sprawia, że rozumowanie modelu staje się widoczne.
Zadaj zwykłemu modelowi zagadkę słowną na zimno, a często wypali błędną liczbę. Poproś go najpierw o rozumowanie, a szanse na sukces skoczą. Weźmy przykład: „Na półce są 3 pudełka po 7 książek; usuwam 5. Ile zostaje?”. Na zimno mały model może odpowiedzieć „21”. Dodaj „Przemyślmy to krok po kroku”, a napisze: 3 x 7 = 21, następnie 21 - 5 = 16. Ten sam model, lepsza odpowiedź, a Ty widzisz, gdzie się pomylił, jeśli tak się stanie. CoT to jedno z narzędzi w szerszym zestawie naszym przewodniku po inżynierii promptów; ten post skupia się wyłącznie na nim.
Jak to działa (i dlaczego zadziałało dopiero na skalę)
CoT działa poprzez generowanie przez model ścieżki rozumowania w języku naturalnym, token po tokenie, dzięki czemu każde pośrednie wnioski warunkują kolejny krok. Wei i inni (2022) odkryli, że jest to zdolność emergentna: barely pomaga małym modelom i przynosi duże wzrosty dokładności dopiero po przekroczeniu przez modele roughly 100 miliardów parametrów.
Pomyśl o tym jak o pokazaniu toku rozumowania na lekcji matematyki. Model przewiduje jeden token na raz, a każde słowo, które zapisuje, staje się częścią danych wejściowych dla następnego słowa. Gdy zapisze „21” jako wynik pośredni, to „21” znajduje się teraz w kontekście, kierując ostatni krok ku „16”. Pomiń kroki, a model musi skoczyć prosto do odpowiedzi, nie mając się na czym oprzeć. Dziwną częścią jest to, że ta korzyść pojawia się tylko przy dużej skali. W pracach założycielskich zespół Wei odkrył, że maleńkie modele prawie nie zyskiwały, a czasami radziły sobie gorzej. Dlatego ten sam prompt, który zawodzi na lokalnym modelu 7B, może transformować model czołówki.
Trzy odmiany: Zero-Shot, Few-Shot i Self-Consistency
Istnieją trzy główne warianty CoT. Zero-shot CoT po prostu dodaje „Przemyślmy to krok po kroku” (Kojima i inni, 2022). Few-shot CoT najpierw pokazuje przykłady rozwiązanego rozumowania. Self-consistency (Wang i inni, 2022) próbkuję kilka ścieżek rozumowania i bierze większość głosów dla odpowiedzi, będąc najbardziej niezawodną, ale i najdroższą z trzech metod.
Zero-shot to leniwa magiczna sztuczka. Dodajesz jedno zdanie, a model rozumuje bez żadnych przykładów. Kojima i inni pokazali, że samo „Przemyślmy to krok po kroku” zamienia duży model w przyzwoitego reasonera zero-shot.
# Zero-shot CoT: append the trigger phrase. Best on non-reasoning models.
# Model names change fast, so treat the string below as a placeholder.
from openai import OpenAI
client = OpenAI()
prompt = (
"Q: A shelf holds 3 boxes. Each box has 7 books. "
"I remove 5 books. How many are left?\n"
"A: Let's think step by step."
)
resp = client.chat.completions.create(
model="your-non-reasoning-model",
messages=[{"role": "user", "content": prompt}],
)
print(resp.choices[0].message.content)Few-shot CoT idzie dalej: podajesz modelowi dwa lub trzy przykłady z rozwiązaniem, aby skopiował wzorzec rozumowania dla Twojej domeny. Self-consistency to pokrętło dokładności. Zamiast ufać jednemu łańcuchowi, próbkujesz pięć w wyższej temperaturze i pozwalasz im głosować. Wang i inni odkryli, że odpowiedź większościowa jest zwykle poprawna, nawet gdy poszczególne łańcuchy błądzą.
# Self-consistency: sample N reasoning paths, majority-vote the answer.
# More accurate, more expensive. Wang et al., 2022.
from collections import Counter
def self_consistency(prompt, n=5, temperature=0.7):
answers = []
for _ in range(n):
resp = client.chat.completions.create(
model="your-non-reasoning-model",
messages=[{"role": "user", "content": prompt}],
temperature=temperature, # diversity across paths
)
answers.append(extract_final_answer(resp.choices[0].message.content))
return Counter(answers).most_common(1)[0][0] # majority voteChcesz, aby to rozumowanie było w czystym JSON-ie zamiast wolnego tekstu? Połącz CoT ze wzorcami z naszego przewodnika po strukturyzowanych wyjściach, aby kolejny krok mógł je sparsować.
Zmiana w 2026 roku: Modele rozumujące zmieniły zasady gry
Modele rozumujące, takie jak seria o i GPT-5 reasoning od OpenAI, rozszerzone myślenie Claude oraz DeepSeek R1, wykonują chain of thought wewnętrznie przed udzieleniem odpowiedzi. Własne wytyczne OpenAI mówią wprost, że wyraźne nakazywanie tym modelom „myślenia krok po kroku” jest niepotrzebne, a proszenie modelu rozumującego o większe wysiłki w rozumowaniu może wręcz zaszkodzić wydajności. Rusztowanie jest wbudowane.
To jest ta część, którą starsze przewodniki udają, że nie istnieje. Model rozumujący produkuje prywatny łańcuch myśli, zanim w ogóle pokaże Ci odpowiedź, więc krok po kroku, który kiedyś pisałeś ręcznie, dzieje się teraz pod maską. Najlepsze praktyki rozumowania OpenAI stawiają sprawę jasno: „Unikaj promptów chain-of-thought: Ponieważ modele te przeprowadzają rozumowanie wewnętrznie, nakłanianie ich do 'myślenia krok po kroku' lub 'wyjaśniania swojego rozumowania' jest niepotrzebne”. Ich przewodnik po promptach o3/o4-mini idzie o krok dalej: „Proszenie modelu rozumującego o większe wysiłki w rozumowaniu może faktycznie zaszkodzić wydajności”.
Rozszerzone myślenie Anthropic to ta sama idea zapakowana w produkt. Dajesz Claude budżet myślenia zamiast skryptu krok po kroku, a najnowsze modele same decydują, jak głęboko myśleć. W tej klasie modeli dostosowujesz reasoning_effort lub budżet myślenia, a nie sformułowania. Jeśli chodzi o stronę open-source modeli rozumujących, w tym DeepSeek R1, zobacz nasze zestawienie Qwen vs DeepSeek vs GLM.
Kiedy ręczne CoT nadal pomaga, a kiedy szkodzi
Ręczne CoT nadal pomaga w modelach nierozumujących oraz małych lub lokalnych modelach open-source, albo gdy potrzebujesz jednej konkretnej struktury rozumowania lub audytowalnego śladu. Szkodzi w natywnych modelach rozumujących (jest zbędne i wolniejsze), w prostych zadaniach jednoetapowych oraz w ścieżkach wrażliwych na opóźnienia lub koszty, gdzie tylko marnuje tokeny bez zysku na dokładności.
| Ręczne CoT nadal pomaga, gdy | Ręczne CoT szkodzi, gdy |
|---|---|
| Pracujesz na modelu nierozumującym (starszy GPT, bazowy Llama) | Pracujesz na modelu rozumującym (seria o, GPT-5 reasoning, Claude thinking) |
| Uruchamiasz mały lub lokalny model open-source | Zadanie to jednoetapowe wyszukiwanie, klasyfikacja lub zmiana formatu |
| Potrzebujesz jednej ustalonej, audytowalnej struktury rozumowania | Jesteś na ścieżce wrażliwej na opóźnienia, w czasie rzeczywistym |
| Zadanie to wieloetapowa matematyka, logika lub planowanie | Jesteś na endpointie o wysokim wolumenie, wrażliwym na koszty |
| Chcesz widoczny ślad, który możesz inspekcjonować lub przeszukiwać grepem | Model już rozumuje wewnętrznie, więc kroki tylko się powtarzają |
Oto prawdziwy przykład z naszej firmy. Pipeline 12 agentów, który napisał ten post, działa na modelach Claude i celowo nigdy nie każemy tym agentom „myśleć krok po kroku”, ponieważ modele już rozumują wewnętrznie, a to tylko dodałoby szum. To, co piszemy ręcznie, to sztywne, przeszukiwalne grepem rusztowania rozumowania. Nasz agent walidator uruchamia stały system 100 punktów (50 za jakość, 50 za SEO) plus osiem sekwencyjnych kontrolek bramkowych. Tłumacz podąża za ustaloną listą kontrolną: dopasuj liczbę nagłówków H2 źródła, uruchom grep diakrytyków, który musi zwrócić więcej niż zero, i mieszcz się w paśmie liczby linii 80–120 procent. Wydawca uruchamia bramki przed i po publikacji, które sprawdzają regexem datetime publishedAt, a następnie odpytują CMS, aby potwierdzić, że treść nie jest pusta.
Nie chodzi tu o więcej myślenia. To ustalona, audytowalna ścieżka, którą możemy inspekcjonować i przeszukiwać grepem, co jest dokładnie przypadkiem „ręczne CoT nadal pomaga”. Dodaliśmy te bramki z powodu: wartość publishedAt zawierająca tylko datę kiedyś po cichu ukryła cały post z naszego indeksu bloga, więc sztywna sekwencja kroków istnieje teraz, aby uniemożliwić modelowi pominięcie weryfikacji. Jedna uczciwa uwaga: to obserwacja operacyjna, a nie benchmark. Nie przeprowadziliśmy kontrolowanego testu A/B dokładności dla „myśl krok po kroku” versus brak instrukcji, więc traktuj to jako lekcję dotyczącą struktury i audytowalności, a nie twierdzenie oparte na liczbach.
Uruchamiasz lokalne modele, gdzie ręczne CoT nadal się opłaca? Nasze zestawienie najlepszych open-source'owych LLM-ów 2026 obejmuje cały rynek. A jeśli kiedykolwiek ujawnisz użytkownikom chain of thought modelu, traktuj to jako niezaufane wyjście; nasz przewodnik zapobiegania wstrzykiwaniu promptów wyjaśnia dlaczego.
Ukryty koszt: Tokeny, opóźnienia i Twój rachunek
CoT nie jest darmowe. Każdy krok rozumowania to tokeny wyjściowe, za które płacisz, a dłuższe generacje zwiększają opóźnienia. Modele rozumujące naliczają ukryte tokeny rozumowania ponad widoczną odpowiedź. Na endpointach o wysokim wolumenie lub w czasie rzeczywistym wymuszanie wyjścia krok po kroku może po cichu pomnożyć koszt, więc zaplanuj budżet lub ogranicz go za pomocą reasoning_effort.
Każde „krok 1, krok 2, krok 3”, które model zapisuje, to tokeny wyjściowe, a tokeny wyjściowe są tym drogim rodzajem. Łańcuch pięciokrotnie dłuższy niż sama odpowiedź kosztuje mniej więcej pięć razy więcej w tym wywołaniu i streamuje się wolniej. Modele rozumujące dodają zwrot akcji: naliczają tokeny rozumowania za wewnętrzne myślenie, którego nigdy nie widzisz, więc krótka ostateczna odpowiedź może ukrywać długi, opłacony łańcuch. Na endpointie o niskim wolumenie to szum; na takim z dużym ruchem rośnie szybko. Dwa nawyki utrzymują to w ryzach. Buforuj stabilne części swojego kontekstu, aby nie płacić za ich ponowne odczytywanie (nasz przewodnik po buforowaniu promptów pokazuje jak) i mierz, czy dodatkowe tokeny faktycznie kupują dokładność, zanim wdrożysz CoT wszędzie. Nasz przewodnik po ewaluacjach LLM obejmuje ten pomiar, więc nie płacisz za rozumowanie, które nie rusza wyniku.
Jak używać CoT w 2026 roku: Lista kontrolna decyzyjna
Po pierwsze, zidentyfikuj klasę swojego modelu. W modelu rozumującym pomiń ręczne CoT i zamiast tego dostroj reasoning_effort lub budżet myślenia. W modelu nierozumującym lub lokalnym dodaj zero-shot „Przemyślmy to krok po kroku”, przejdź na few-shot dla zadań domenowych i dodaj self-consistency tylko wtedy, gdy dokładność jest ważniejsza niż koszt tokenów.
Oto cała decyzja w pięciu krokach:
- Zidentyfikuj klasę swojego modelu. Model rozumujący czy nie? Ten pojedynczy fakt decyduje o wszystkim poniżej.
- W modelu rozumującym nie pisz ręcznie CoT. Zamiast tego dostroj
reasoning_effortlub budżet myślenia i pozwól modelowi rozumować wewnętrznie. - W modelu nierozumującym lub lokalnym dodaj zero-shot „Przemyślmy to krok po kroku”. To jedna linijka i darmowa do wypróbowania.
- Dla zada specyficznych dla domeny, przejdź na few-shot CoT z dwoma lub trzema przykładami z rozwiązaniem. Dodaj self-consistency tylko wtedy, gdy dokładność bije koszt tokenów.
- Jeśli ujawniasz rozumowanie, zmierz je ewaluacjami i traktuj widoczny łańcuch jako niezaufane wyjście.
Fraza wyzwalająca zwykle żyje w Twoim system prompt. Nasze przykłady system prompt pokazują, gdzie ją umieścić i jak ją sformułować.
# On a reasoning model, don't hand-write CoT. Tune the effort instead.
# Param names and levels change per provider and version, so check current docs.
resp = client.responses.create(
model="your-reasoning-model",
reasoning={"effort": "medium"}, # e.g. low | medium | high
input="Prove that the square root of 2 is irrational.",
)
# Anthropic equivalent: an extended-thinking budget.
# budget_tokens MUST be less than max_tokens.
# thinking = {"type": "enabled", "budget_tokens": 4000}Wpięcie tego do stacku produkcyjnego jest bardziej skomplikowane, niż sugeruje przykład z bloga. Jeśli wolisz nie dostajać samodzielnie budżetów rozumowania i harnessów ewaluacyjnych, nasz zespół buduje te pipeline'y end-to-end. Zobacz integrację AI lub skontaktuj się z nami.
O autorze
Mert Batur Gurbuz jest współzałożycielem Techsy.io, gdzie zespół dostarcza agentów AI, systemy automatyzacji oraz pipeline'y voice/SDR dla klientów B2B. Studiuje na University of Birmingham i pisze o stacku narzędziowym LLM, z którego zespół Techsy faktycznie korzysta w produkcji.
Współzałożyciel, Techsy.io, University of Birmingham. Połącz się na LinkedIn.
Często zadawane pytania
Czy chain of thought prompting jest nadal istotny w 2026 roku?
Tak, ale jego rola się zmniejszyła. W modelach nierozumujących oraz małych lub lokalnych modelach open-source, ręczne CoT nadal zwiększa dokładność w zadaniach wieloetapowych. W modelach rozumujących jest mostly redundantne. Najsilniejszym pozostałym zastosowaniem jest wymuszenie jednej ustalonej, audytowalnej ścieżki rozumowania, którą można inspekcjonować.
Czy chain of thought prompting działa na modelach rozumujących takich jak GPT-5, o3 lub Claude?
Modele te już rozumują wewnętrznie, więc ręczne CoT jest zwykle zbędne, a czasem szkodliwe. Dokumentacja OpenAI mówi, że nakłanianie ich do „myślenia krok po kroku” jest niepotrzebne, a proszenie ich o większe wysiłki w rozumowaniu „może faktycznie zaszkodzić wydajności”. Dostroj wysiłek rozumowania zamiast pisać kroki.
Czym jest zero-shot chain of thought prompting?
Zero-shot CoT oznacza dodanie frazy wyzwalającej, zwykle „Przemyślmy to krok po kroku”, bez wcześniejszego podawania jakichkolwiek przykładów z rozwiązaniem. Kojima i inni (2022) pokazali, że samo to zamienia duży model w przyzwoitego reasonera. To najtańszy wariant CoT: jedna linijka, brak kuracji przykładów, szybki do testowania.
Czym jest self-consistency w chain of thought prompting?
Self-consistency, od Wang i innych (2022), próbkuję kilka niezależnych łańcuchów rozumowania w wyższej temperaturze, a następnie bierze większość głosów dla ostatecznej odpowiedzi. Jest to najbardziej dokładny wariant CoT, ponieważ błędne łańcuchy rzadko się zgadzają, ale płacisz za każdą próbkowaną ścieżkę, więc jest też najdroższy.
Jaka jest różnica między chain of thought a few-shot prompting?
Few-shot prompting pokazuje modelowi pary przykładów wejście-wyjście. Chain of thought skupia się na rozumowaniu między wejściem a wyjściem. Dobrze się łączą: few-shot CoT daje przykłady z rozwiązaniem, które zawierają kroki rozumowania, dzięki czemu model kopiuje Twój wzorzec rozumowania, a nie tylko format odpowiedzi.
Chain of thought vs prompt chaining vs tree of thought: jaka jest różnica?
Chain of thought rozumuje wewnątrz jednego promptu. Prompt chaining dzieli zadanie na kilka oddzielnych wywołań modelu, przekazując wyjścia dalej. Tree of thought eksploruje wiele gałęzi rozumowania i odrzuca słabe. CoT to pojedyncza liniowa ścieżka; pozostałe dwie dodają zewnętrzną strukturę wokół modelu.
Kto wynalazł chain of thought prompting?
Chain of thought prompting został wprowadzony przez Jasona Wei i współpracowników z Google w pracy z 2022 roku „Chain-of-Thought Prompting Elicits Reasoning in Large Language Models”. Kojima i inni później dodali zero-shot CoT, a Wang i inni dodali self-consistency, oba również w 2022 roku.
Czy chain of thought prompting działa do generowania kodu?
Tak, w modelach nierozumujących. Poproszenie modelu o zaplanowanie logiki przed napisaniem kodu wychwytuje przypadki brzegowe i redukuje błędy w złożonych zadaniach. W modelach rozumujących planowanie dzieje się wewnętrznie, więc zwykła instrukcja zwykle działa lepiej niż ręcznie napisany prefiks „rozumuj krok po kroku”.