
Chain of thought prompting'in üst sıradaki rehberlerin atladığı bir 2026 sorunu var: 2022'de modelleri daha akıllı yapan aynı numara, bugün bir reasoning modeli sessizce daha kötü hale getirebiliyor. Wei ve ekibi bunu 2022'de tanıttı ve modellere akıl yürütme adımlarını göstererek zor matematik ve mantık sorularında doğruluğu artırdı. Bir de püf noktası vardı: bu etki ancak modeller yaklaşık 100 milyar parametreyi geçtiğinde ortaya çıkıyordu. Şimdiyse o-serisi ve GPT-5 reasoning modelleri bu düşünmeyi kendi içlerinde yapıyor, yani onlara "adım adım düşün" demek çoğu zaman sadece token harcamaktan başka bir işe yaramıyor. Peki bunu ne zaman hâlâ kullanmalısınız, ne zaman atlamalısınız?
Öne çıkan noktalar:
- Chain of thought prompting, bir modelin akıl yürütme adımlarını gösterir ve çok adımlı matematik, mantık ve kod görevlerinde doğruluğu artırır.
- Bu, ortaya çıkan (emergent) bir yetenektir: küçük modellere neredeyse hiç yardımı olmaz, reasoning modeller ise bunu zaten kendi içlerinde yapar.
- o-serisi, GPT-5 reasoning ve Claude'un extended thinking özelliğinde, elle "adım adım düşün" demek çoğu zaman gereksizdir.
- Reasoning olmayan modellerde, yerel açık kaynaklı modellerde veya denetlenebilir bir akıl yürütme izine ihtiyacınız olduğunda manuel CoT kullanmaya devam edin.
Chain of Thought Prompting Nedir?
Chain of thought (CoT) prompting, bir dil modelinden nihai cevabı vermeden önce bir problemi açık ara adımlarla çözmesini isteyen bir tekniktir. 2022'de Wei ve ekibi tarafından tanıtılan bu yöntem, çok adımlı matematik, mantık ve sağduyu gerektiren görevlerde doğruluğu artırır ve modelin akıl yürütmesini görünür kılar.
Sade bir modele hazırlıksız bir problem sorun, çoğu zaman yanlış sayıyı söyleyiverir. Önce akıl yürütmesini isteyin, doğru cevap ihtimali fırlar. Şu örneği alalım: "Bir rafta 7'şer kitaplık 3 kutu var; 5 kitap çıkarıyorum. Geriye kaç kitap kalır?" Hazırlıksız sorulduğunda küçük bir model "21" diyebilir. "Adım adım düşünelim" eklediğinizde ise şunu yazar: 3 x 7 = 21, sonra 21 - 5 = 16. Aynı model, daha iyi cevap, üstelik hata yaparsa nerede kaydığını da görebilirsiniz. CoT, prompt engineering rehberimizdeki daha geniş araç kutusunun bir parçası; bu yazı doğrudan ona odaklanıyor.
Nasıl Çalışır (ve Neden Sadece Büyük Ölçekte İşe Yaradı)
CoT, modelin doğal dilde bir akıl yürütme yolunu token token üretmesiyle çalışır; böylece her ara sonuç bir sonrakini şekillendirir. Wei ve ekibi (2022), bunun bir ortaya çıkan yetenek olduğunu buldu: küçük modellere neredeyse hiç yardımı olmuyor, büyük doğruluk kazanımları ancak modeller yaklaşık 100 milyar parametreyi geçtiğinde ortaya çıkıyor.
Matematik dersinde işlem adımlarını göstermek gibi düşünün. Model her seferinde tek bir token tahmin eder ve yazdığı her kelime bir sonraki kelimenin girdisinin parçası haline gelir. Ara sonuç olarak "21" yazdığında, bu "21" artık bağlamda oturur ve son adımı "16"ya doğru yönlendirir. Adımları atlarsanız model hiçbir dayanağı olmadan doğrudan cevaba sıçramak zorunda kalır. İşin garip yanı, bu faydanın sadece büyük ölçekte ortaya çıkmasıdır. Kurucu makalede, Wei'nin ekibi küçük modellerin neredeyse hiç fayda görmediğini, hatta bazen daha kötü sonuç verdiğini buldu. Bu yüzden 7B'lik yerel bir modelde tutmayan aynı prompt, bir öncü (frontier) modeli dönüştürebiliyor.
Üç Çeşit: Zero-Shot, Few-Shot ve Self-Consistency
Üç ana CoT varyantı vardır. Zero-shot CoT, sadece "Adım adım düşünelim" ifadesini ekler (Kojima ve ekibi, 2022). Few-shot CoT, önce çözülmüş akıl yürütme örnekleri gösterir. Self-consistency (Wang ve ekibi, 2022) ise birden fazla akıl yürütme yolunu örnekler ve cevap üzerinde çoğunluk oylaması yapar; üçü arasında en güvenilir ama en pahalı olanıdır.
Zero-shot, tembelin sihirli numarasıdır. Tek bir cümle eklersiniz ve model hiçbir örnek olmadan akıl yürütür. Kojima ve ekibi, tek başına "Adım adım düşünelim" ifadesinin büyük bir modeli gayet iyi bir zero-shot akıl yürütücüye dönüştürdüğünü gösterdi.
# Zero-shot CoT: append the trigger phrase. Best on non-reasoning models.
# Model names change fast, so treat the string below as a placeholder.
from openai import OpenAI
client = OpenAI()
prompt = (
"Q: A shelf holds 3 boxes. Each box has 7 books. "
"I remove 5 books. How many are left?\n"
"A: Let's think step by step."
)
resp = client.chat.completions.create(
model="your-non-reasoning-model",
messages=[{"role": "user", "content": prompt}],
)
print(resp.choices[0].message.content)Few-shot CoT bir adım daha ileri gider: modele iki veya üç çözülmüş örnek verirsiniz, o da kendi alanınız için akıl yürütme kalıbını kopyalar. Self-consistency ise doğruluk kadranıdır. Tek bir zincire güvenmek yerine, daha yüksek bir temperature'da beş örnek alır ve onları oylatırsınız. Wang ve ekibi, tek tek zincirler yoldan çıksa bile çoğunluk cevabının genelde doğru olduğunu buldu.
# Self-consistency: sample N reasoning paths, majority-vote the answer.
# More accurate, more expensive. Wang et al., 2022.
from collections import Counter
def self_consistency(prompt, n=5, temperature=0.7):
answers = []
for _ in range(n):
resp = client.chat.completions.create(
model="your-non-reasoning-model",
messages=[{"role": "user", "content": prompt}],
temperature=temperature, # diversity across paths
)
answers.append(extract_final_answer(resp.choices[0].message.content))
return Counter(answers).most_common(1)[0][0] # majority voteBu akıl yürütmeyi serbest metin yerine temiz bir JSON olarak mı istiyorsunuz? CoT'yi yapılandırılmış çıktılar rehberimizdeki kalıplarla birleştirin, böylece sonraki adım onu parse edebilsin.
2026 Dönüşümü: Reasoning Modeller Kuralları Değiştirdi
Reasoning modeller (OpenAI'ın o-serisi ve GPT-5 reasoning'i, Claude'un extended thinking'i ve DeepSeek R1), cevap vermeden önce chain of thought'u kendi içlerinde yapar. OpenAI'ın kendi kılavuzu, bu modellere açıkça "adım adım düşün" demenin gereksiz olduğunu ve bir reasoning modelden daha fazla düşünmesini istemenin aslında performansı düşürebileceğini söylüyor. İskele zaten yerleşik.
Eski rehberlerin yok sayma eğiliminde olduğu kısım burası. Bir reasoning model, size bir cevap göstermeden önce özel bir chain of thought üretir; yani eskiden elle yazdığınız adım adım süreç artık kaputun altında gerçekleşiyor. OpenAI'ın reasoning en iyi uygulamalar rehberi bunu açıkça söylüyor: "Chain-of-thought promptlarından kaçının: Bu modeller akıl yürütmeyi kendi içlerinde yaptığından, onlara 'adım adım düşün' ya da 'akıl yürütmeni açıkla' demek gereksizdir." o3/o4-mini prompt rehberleri ise bir adım daha ileri gidiyor: "Bir reasoning modelden daha fazla akıl yürütmesini istemek performansı aslında düşürebilir."
Anthropic'in extended thinking özelliği de aynı fikrin ürünleşmiş hâli. Claude'a adım adım bir senaryo yerine bir düşünme bütçesi verirsiniz, en yeni modeller de ne kadar derin düşüneceğine kendisi karar verir. Bu model sınıfında ayarladığınız şey kelimeler değil, reasoning_effort ya da düşünme bütçesidir. DeepSeek R1 dahil açık kaynak reasoning model tarafı için Qwen vs DeepSeek vs GLM karşılaştırmamıza bakın.
Manuel CoT Ne Zaman Hâlâ İşe Yarar, Ne Zaman Ters Teper
Manuel CoT, reasoning olmayan modellerde, küçük veya yerel açık kaynak modellerde ya da belirli bir akıl yürütme yapısına veya denetlenebilir bir ize ihtiyacınız olduğunda hâlâ işe yarar. Doğal reasoning modellerde (gereksiz ve daha yavaş), tek adımlık basit görevlerde ve gecikme veya maliyete duyarlı yollarda ise ters teper; burada hiçbir doğruluk kazancı olmadan sadece token harcar.
| Manuel CoT ne zaman hâlâ işe yarar | Manuel CoT ne zaman ters teper |
|---|---|
| Reasoning olmayan bir modeldeyseniz (eski GPT, temel Llama) | Bir reasoning modeldeyseniz (o-serisi, GPT-5 reasoning, Claude thinking) |
| Küçük veya yerel açık kaynak bir model çalıştırıyorsanız | Görev tek adımlık bir arama, sınıflandırma veya format değişikliğiyse |
| Sabit, denetlenebilir tek bir akıl yürütme yapısına ihtiyacınız varsa | Gecikmeye duyarlı, gerçek zamanlı bir yoldaysanız |
| Görev çok adımlı matematik, mantık veya planlamaysa | Yüksek hacimli, maliyete duyarlı bir uç noktadaysanız |
| İnceleyebileceğiniz veya grepleyebileceğiniz görünür bir iz istiyorsanız | Model zaten kendi içinde akıl yürütüyorsa, adımlar sadece tekrar eder |
Kendi mutfağımızdan gerçek bir örnek verelim. Bu yazıyı yazan 12 ajanlı pipeline Claude modelleri üzerinde çalışıyor ve bu ajanlara bilerek hiçbir zaman "adım adım düşün" demiyoruz, çünkü modeller zaten kendi içlerinde akıl yürütüyor ve bu sadece gürültü eklerdi. Elle yazdığımız şey, katı ve greplenebilir akıl yürütme iskeleleridir. Validator ajanımız sabit bir 100 puanlık rubrik (50 kalite, 50 SEO) artı sekiz sıralı geçit kontrolü çalıştırıyor. Çevirmen ajan belirli bir kontrol listesini takip ediyor: kaynak H2 sayısını eşleştirmek, sıfırdan büyük dönmesi gereken bir diyakritik grep'i çalıştırmak ve satır sayısını kaynağın yüzde 80 ile 120'si arasında tutmak. Yayıncı ajan ise publishedAt tarih-saatini regex ile kontrol eden yayın öncesi ve sonrası geçitler çalıştırıyor, ardından gövdenin boş olmadığını doğrulamak için CMS'i sorguluyor.
Bunların hiçbiri daha fazla düşünmekle ilgili değil. İnceleyebileceğimiz ve grepleyebileceğimiz sabit, denetlenebilir bir yol; tam olarak "manuel CoT hâlâ işe yarar" durumu. Bu geçitleri boşuna eklemedik: bir keresinde sadece tarih içeren bir publishedAt değeri, bir yazının tamamını blog dizinimizden sessizce gizlemişti, bu yüzden katı adım sırası artık modelin bir doğrulamayı atlamasını önlemek için var. Dürüst bir uyarı: bu operasyonel bir gözlem, bir benchmark değil. "Adım adım düşün" ile hiçbir talimat vermemeyi karşılaştıran kontrollü bir doğruluk A/B testi yapmadık, bu yüzden bunu bir sayı iddiası değil, yapı ve denetlenebilirlik dersi olarak görün.
Manuel CoT'nin hâlâ karşılığını verdiği yerel modeller mi çalıştırıyorsunuz? En iyi açık kaynaklı LLM'ler 2026 derlememiz bu alanı kapsıyor. Bir modelin chain of thought'unu kullanıcılara gösterirseniz, bunu güvenilmeyen bir çıktı olarak ele alın; nedenini prompt injection prevention rehberimiz anlatıyor.
Gizli Maliyet: Tokenlar, Gecikme ve Faturanız
CoT bedava değildir. Her akıl yürütme adımı, ödediğiniz output token'lardır ve daha uzun üretimler gecikmeyi artırır. Reasoning modeller, görünen cevabın üzerine gizli reasoning token'ları da faturalandırır. Yüksek hacimli veya gerçek zamanlı uç noktalarda, adım adım çıktıyı zorlamak maliyeti sessizce katlayabilir; bu yüzden ya buna bütçe ayırın ya da reasoning_effort ile sınırlayın.
Modelin yazdığı her "adım 1, adım 2, adım 3", output token'dır ve output token'lar pahalı olanıdır. Sade cevaptan beş kat daha uzun bir zincir, o çağrıda kabaca beş kat daha fazlaya mal olur ve daha yavaş akar. Reasoning modeller işin içine bir de şu farkı katıyor: hiç görmediğiniz iç düşünme için reasoning token'ları faturalandırıyorlar, yani kısa bir nihai cevap, uzun ve para ödediğiniz bir zinciri gizleyebiliyor. Düşük hacimli bir uç noktada bu gürültüden ibarettir; yoğun trafikli birinde ise hızla büyür. İki alışkanlık bunu makul tutar. Bağlamınızın sabit kısımlarını önbelleğe alın, böylece onları tekrar okumak için ödeme yapmazsınız (prompt caching rehberimiz nasıl olduğunu gösteriyor) ve CoT'yi her yere yaymadan önce ekstra token'ların gerçekten doğruluk kazandırıp kazandırmadığını ölçün. LLM evals rehberimiz bu ölçümü kapsıyor, böylece skoru kıpırdatmayan bir akıl yürütme için ödeme yapmazsınız.
2026'da CoT Nasıl Kullanılır: Bir Karar Kontrol Listesi
Önce model sınıfınızı belirleyin. Bir reasoning modeldeyseniz manuel CoT'yi atlayın, bunun yerine reasoning_effort ya da düşünme bütçesini ayarlayın. Reasoning olmayan veya yerel bir modeldeyseniz zero-shot "Adım adım düşünelim" ekleyin, alana özel görevler için few-shot'a yükseltin ve doğruluk token maliyetinden daha önemliyse self-consistency ekleyin.
İşte kararın tamamı beş adımda:
- Model sınıfınızı belirleyin. Reasoning model mi, değil mi? Aşağıdaki her şeye bu tek gerçek karar veriyor.
- Bir reasoning modeldeyseniz CoT'yi elle yazmayın. Bunun yerine
reasoning_effortya da düşünme bütçesini ayarlayın ve modelin kendi içinde akıl yürütmesine izin verin. - Reasoning olmayan veya yerel bir modeldeyseniz zero-shot "Adım adım düşünelim" ekleyin. Tek satır ve denemesi bedava.
- Alana özel görevler için, iki veya üç çözülmüş örnekle few-shot CoT'ye yükseltin. Self-consistency'yi yalnızca doğruluk token maliyetini geçtiğinde ekleyin.
- Akıl yürütmeyi dışarı açıyorsanız, bunu evals ile ölçün ve görünür zinciri güvenilmeyen bir çıktı olarak ele alın.
Tetikleyici ifadenin kendisi genelde sistem promptunuzda yaşar. System prompt örneklerimiz nereye gideceğini ve nasıl ifade edileceğini gösteriyor.
# On a reasoning model, don't hand-write CoT. Tune the effort instead.
# Param names and levels change per provider and version, so check current docs.
resp = client.responses.create(
model="your-reasoning-model",
reasoning={"effort": "medium"}, # e.g. low | medium | high
input="Prove that the square root of 2 is irrational.",
)
# Anthropic equivalent: an extended-thinking budget.
# budget_tokens MUST be less than max_tokens.
# thinking = {"type": "enabled", "budget_tokens": 4000}Bunu bir prodüksiyon yığınına bağlamak, bir blog örneğinin gösterdiğinden çok daha çetrefilli. Reasoning bütçelerini ve eval altyapısını kendiniz ayarlamak istemiyorsanız, ekibimiz bu pipeline'ları uçtan uca kuruyor. Yapay zeka entegrasyonuna bakın veya bize ulaşın.
Yazar Hakkında
Mert Batur Gurbuz, Techsy.io'nun Kurucu Ortağı; ekip burada B2B müşteriler için yapay zeka ajanları, otomasyon sistemleri ve sesli/SDR pipeline'ları geliştiriyor. Birmingham Üniversitesi'nde okuyor ve Techsy ekibinin üretimde gerçekten kullandığı LLM araç yığını hakkında yazıyor.
Kurucu Ortak, Techsy.io, Birmingham Üniversitesi. LinkedIn'de bağlantı kurun.
Sıkça Sorulan Sorular
Chain of thought prompting 2026'da hâlâ geçerli mi?
Evet, ama işi küçüldü. Reasoning olmayan ve küçük veya yerel açık kaynak modellerde, manuel CoT çok adımlı görevlerde doğruluğu hâlâ artırıyor. Reasoning modellerde ise çoğunlukla gereksiz. Kalan en güçlü kullanım alanı, inceleyebileceğiniz sabit ve denetlenebilir tek bir akıl yürütme yolunu zorlamak.
Chain of thought prompting, GPT-5, o3 veya Claude gibi reasoning modellerde işe yarıyor mu?
Bu modeller zaten kendi içlerinde akıl yürütüyor, bu yüzden manuel CoT genelde gereksiz ve bazen de zararlı. OpenAI'ın belgeleri, onlara "adım adım düşün" demenin gereksiz olduğunu ve daha fazla akıl yürütmelerini istemenin "performansı aslında düşürebileceğini" söylüyor. Adımlar yazmak yerine reasoning effort'u ayarlayın.
Zero-shot chain of thought prompting nedir?
Zero-shot CoT, önce hiçbir çözülmüş örnek vermeden genelde "Adım adım düşünelim" olan bir tetikleyici ifade eklemek anlamına gelir. Kojima ve ekibi (2022), tek başına bunun büyük bir modeli gayet iyi bir akıl yürütücüye dönüştürdüğünü gösterdi. En ucuz CoT varyantıdır: tek satır, örnek seçmeye gerek yok, hızlıca test edilir.
Chain of thought prompting'de self-consistency nedir?
Wang ve ekibinden (2022) gelen self-consistency, daha yüksek bir temperature'da birkaç bağımsız akıl yürütme zinciri örnekler, sonra nihai cevap üzerinde çoğunluk oylaması yapar. Yanlış zincirler nadiren birbirine benzediği için en doğru CoT varyantıdır, ama örneklediğiniz her yol için ödeme yaparsınız, bu yüzden aynı zamanda en pahalısıdır.
Chain of thought ile few-shot prompting arasındaki fark nedir?
Few-shot prompting, modele örnek girdi-çıktı çiftleri gösterir. Chain of thought ise girdi ile çıktı arasındaki akıl yürütmeye odaklanır. İkisi iyi birleşir: few-shot CoT, akıl yürütme adımlarını içeren çözülmüş örnekler verir, böylece model sadece cevap formatınızı değil, akıl yürütme kalıbınızı da kopyalar.
Chain of thought, prompt chaining ve tree of thought: aradaki fark nedir?
Chain of thought, tek bir prompt içinde akıl yürütür. Prompt chaining, bir görevi birkaç ayrı model çağrısına böler ve çıktıları ileri taşır. Tree of thought ise birden fazla akıl yürütme dalını keşfeder ve zayıf olanları budar. CoT tek, doğrusal bir yoldur; diğer ikisi modelin etrafına dışarıdan bir yapı ekler.
Chain of thought prompting'i kim icat etti?
Chain of thought prompting, Jason Wei ve Google'daki meslektaşları tarafından 2022'de yayımlanan "Chain-of-Thought Prompting Elicits Reasoning in Large Language Models" makalesiyle tanıtıldı. Daha sonra Kojima ve ekibi zero-shot CoT'yi, Wang ve ekibi de self-consistency'yi ekledi; ikisi de yine 2022'de.
Chain of thought prompting, kod üretiminde işe yarıyor mu?
Evet, reasoning olmayan modellerde. Modelden kodu yazmadan önce mantığı planlamasını istemek, uç durumları yakalar ve karmaşık görevlerde hataları azaltır. Reasoning modellerde ise planlama kendi içinde gerçekleşir, bu yüzden elle yazılmış bir "adım adım akıl yürüt" ön eki yerine genelde sade bir talimat daha iyi çalışır.