
思維鏈提示有一個 2026 年的問題,是那些熱門指南所略過的:同樣一個在 2022 年讓模型變聰明的技巧,如今卻可能悄悄讓推理模型表現變差。Wei 等人於 2022 年提出這個方法,透過讓模型展示其推理步驟,提升了在高難度數學與邏輯任務上的準確率。但這裡有個陷阱。它只有在模型參數量超過大約 1,000 億時才會發揮作用。如今 o 系列與 GPT-5 推理模型會在內部進行這些思考,因此告訴它們「逐步思考」往往只是在消耗 token。那麼,你究竟該在什麼時候繼續使用它,又該在什麼時候捨棄它呢?
重點整理:
- 思維鏈提示會展示模型的推理步驟,並提升多步驟數學、邏輯與程式碼任務的準確率。
- 這是一種湧現能力:它對小型模型幾乎沒有幫助,而推理模型早已在內部做到這一點。
- 在 o 系列、GPT-5 推理以及 Claude 延伸思考上,手動加上「逐步思考」往往是多餘的。
- 在非推理模型與本地開源模型上,或當你需要可稽核的推理路徑時,仍應使用手動思維鏈。
什麼是思維鏈提示?
思維鏈(CoT)提示是一種要求語言模型在給出最終答案之前,以明確的中間步驟逐步處理問題的技巧。該方法由 Wei 等人於 2022 年提出,能提升多步驟數學、邏輯與常識任務的準確率,並讓模型的推理過程清晰可見。
如果直接讓一個普通模型回答文字應用題,它往往會脫口給出錯誤的數字;讓它先進行推理,正確率便會大幅提升。以「一個書架上有 3 盒、每盒 7 本書;我拿走 5 本,還剩多少?」為例:直接提問時,小型模型可能會回答「21」;但加上「讓我們一步一步思考」後,它就會寫出:3 x 7 = 21,然後 21 - 5 = 16。同樣的模型,卻能得到更好的答案,而且萬一出錯,你也能看出它在哪裡出了差錯。CoT 只是我們提示工程指南這個更大工具箱中的一項工具;而這篇文章將對它進行深入探討。
運作原理(以及為什麼要到規模夠大才真正見效)
CoT 的運作方式是讓模型逐 token 生成自然語言推理路徑,使每一個中間結論都成為下一步的條件。Wei 等人(2022)發現這是一種湧現能力:對小型模型幾乎沒有幫助,只有當模型規模超過大約 1000 億參數時,才會帶來顯著的準確率提升。
可以把它想像成數學課上要把解題過程寫出來。模型一次預測一個 token,而它寫下的每個字都會成為下一個字的輸入的一部分。當它寫下「21」作為中間結果時,這個「21」就已經存在於上下文中,引導最後一步走向「16」。如果跳過這些步驟,模型就只能毫無依據地直接跳到答案。奇怪的是,這種好處只有在規模夠大時才會出現。在奠基論文中,Wei 的團隊發現小型模型幾乎沒有獲得提升,有時表現反而更差。這就是為什麼同一個提示詞在 7B 的本地模型上可能完全無效,卻能讓前沿模型煥然一新。
三種變體:零樣本、少樣本與自我一致性
鏈式思考主要有三種變體。零樣本 CoT 只需附加「Let's think step by step」(Kojima et al., 2022)。少樣本 CoT 會先展示推理範例。自我一致性(Wang et al., 2022)則取樣多條推理路徑,並對答案進行多數決投票,是三者中最可靠、也最昂貴的方法。
零樣本就像一個偷懶的魔術。你只加一句話,模型就能在沒有任何範例的情況下進行推理。Kojima et al. 證明,僅僅一句「Let's think step by step」就能讓大型模型變成還算不錯的零樣本推理者。
# 零樣本 CoT:附加觸發短語。在非推理模型上效果最佳。
# Model names change fast, so treat the string below as a placeholder.
from openai import OpenAI
client = OpenAI()
prompt = (
"Q: A shelf holds 3 boxes. Each box has 7 books. "
"I remove 5 books. How many are left?\n"
"A: Let's think step by step."
)
resp = client.chat.completions.create(
model="your-non-reasoning-model",
messages=[{"role": "user", "content": prompt}],
)
print(resp.choices[0].message.content)Few-shot CoT goes further: you hand the model two or three worked examples so it copies the reasoning pattern for your domain. Self-consistency is the accuracy dial. Instead of trusting one chain, you sample five at a higher temperature and let them vote. Wang et al. found the majority answer is usually right even when individual chains wander off.
# 自我一致性:取樣 N 條推理路徑,以多數決決定答案。
# 更準確,但也更昂貴。Wang 等人,2022 年。
from collections import Counter
def self_consistency(prompt, n=5, temperature=0.7):
answers = []
for _ in range(n):
resp = client.chat.completions.create(
model="your-non-reasoning-model",
messages=[{"role": "user", "content": prompt}],
temperature=temperature, # diversity across paths
)
answers.append(extract_final_answer(resp.choices[0].message.content))
return Counter(answers).most_common(1)[0][0] # majority vote想讓推理結果以乾淨的 JSON 呈現,而非自由文字嗎?將 CoT 搭配我們結構化輸出指南中的模式,讓下游步驟能直接解析。
2026 年的轉變:推理模型改寫了規則
推理模型——OpenAI 的 o 系列與 GPT-5 推理、Claude 的延伸思考(extended thinking),以及 DeepSeek R1——都會在給出答案之前,先在內部進行思考鏈(chain of thought)。OpenAI 自家的指南明確指出,要求這些模型「一步一步思考」是沒有必要的,而且要求推理模型進行更多推理,反而可能損害效能。這套鷹架(scaffolding)已經內建在模型之中了。
這正是那些舊指南假裝沒有發生的事。推理模型在向你顯示答案之前,會先產生一段私有的思考鏈,因此你過去親手撰寫的那套「一步一步」流程,如今已在底層自動完成。OpenAI 的推理最佳實務說得直白:「避免使用思考鏈提示:由於這些模型會在內部進行推理,提示它們『一步一步思考』或『解釋你的推理過程』是沒有必要的。」他們的 o3/o4-mini 提示指南更進一步指出:「要求推理模型進行更多推理,反而可能損害效能。」
Anthropic 的延伸思考是將同樣的概念產品化。你給 Claude 一個思考預算,而不是一套一步一步的腳本,最新的模型會自行決定要思考到多深。在這類模型上,你調整的是 reasoning_effort 或思考預算,而不是措辭。關於開放的推理模型這一塊(包含 DeepSeek R1),請參閱我們的 Qwen vs DeepSeek vs GLM 深入比較。
手動 CoT 何時仍然有用,何時又會弄巧成拙
在「非推理型」以及小型或本地端開源模型上,手動 CoT 仍然有幫助;或者當你需要某種特定的推理結構、或一條可供稽核的軌跡時也是如此。但在原生推理模型上(會變得冗餘且更慢)、在簡單的單一步驟任務上,以及在對延遲或成本敏感的路徑上,它反而會弄巧成拙——在這些情境中,它只是白白燒掉 token,卻換不來任何準確度的提升。
| 手動 CoT 仍然有用的情境 | 手動 CoT 會弄巧成拙的情境 |
|---|---|
| 你使用的是非推理型模型(較舊的 GPT、基礎版 Llama) | 你使用的是推理模型(o 系列、GPT-5 reasoning、Claude thinking) |
| 你執行的是小型或本地端開源模型 | 任務屬於單一步驟的查詢、分類或格式轉換 |
| 你需要一套固定、可供稽核的推理結構 | 你處於對延遲敏感的即時處理路徑上 |
| 任務涉及多步驟的數學、邏輯或規劃 | 你處於高流量、對成本敏感的端點上 |
| 你希望有一條可以檢視或 grep 的可見軌跡 | 模型本身已會在內部推理,這些步驟只是在重複 |
這裡舉一個我們自己團隊的真實例子。撰寫這篇文章、由 12 個代理組成的管線是運行在 Claude 模型上的,而我們刻意從不告訴那些代理要「一步一步思考」,因為這些模型本來就會在內部推理,這麼做只會增加雜訊。我們確實會親手撰寫的,是那些僵固、可 grep 的推理鷹架。我們的驗證代理會執行一套固定的 100 分制評分量表(50 分品質、50 分 SEO),外加八項依序進行的關卡檢查。翻譯代理則遵循一份固定的檢查清單:與來源的 H2 數量相符、執行一個必須回傳大於零筆結果的變音符號 grep,並將行數維持在來源行數的 80% 至 120% 區間內。發布代理則會執行發布前與發布後的關卡,用 regex 檢查 publishedAt 的日期時間,接著查詢 CMS 以確認內文並非空白。
這些都與「更多的思考」無關。它是一條固定、可供稽核的路徑,讓我們能夠檢視與 grep——這恰好就是「手動 CoT 仍然有用」的那種情境。我們之所以加上那些關卡,是有原因的:曾經有一個只有日期的 publishedAt 值,悄無聲息地讓一整篇文章從我們的部落格索引中消失,因此現在這套僵固的步驟序列,正是為了防止模型跳過某個驗證步驟。一個誠實的提醒:這是實務操作上的觀察,而非基準測試。我們並沒有針對「一步一步思考」與「不給指示」兩者,做過受控的準確度 A/B 測試,所以請把它當作一堂關於結構與可稽核性的經驗,而非一個數字上的主張。
還在本地端執行那些手動 CoT 仍有效果的模型嗎?我們的2026 年最佳開源 LLM彙整涵蓋了整個領域。此外,如果你曾將模型的思維鏈呈現給使用者,請將其視為不受信任的輸出;我們的提示注入防範指南說明了原因。
隱藏的成本:Token、延遲與你的帳單
CoT 並非免費。每一個推理步驟都是你需要付費的輸出 token,而更長的生成內容會拉高延遲。推理模型除了可見的回答之外,還會額外計費隱藏的推理 token。在高流量或即時性的端點上,強制逐步輸出可能會悄悄地讓成本翻倍,因此請為此編列預算,或用 reasoning_effort 來加以限制。
模型寫下的每一段「步驟一、步驟二、步驟三」都是輸出 token,而輸出 token 正是比較貴的那一種。一條比簡潔回答長上五倍的推理鏈,在該次呼叫上的成本大約就是五倍,而且回傳串流的速度也更慢。推理模型又多了個花樣:它們會針對你永遠看不到的內部思考計費推理 token,因此一段簡短的最終回答,背後可能藏著一條漫長且需要付費的推理鏈。在低流量端點上,這點成本不過是雜訊;但在高流量端點上,它會迅速累積。有兩個習慣能讓成本維持在合理範圍。快取情境中穩定的部分,這樣你就不必為了重複讀取它們而付費(我們的提示詞快取指南有說明做法),並且在全面導入 CoT 之前,先衡量這些額外的 token 是否真的換來了準確度。我們的 LLM 評估指南涵蓋了這項衡量工作,讓你不致於為那些無法提升分數的推理買單。
如何在 2026 年使用 CoT:決策檢查清單
首先,確認你的模型類別。如果使用的是推理模型,就跳過手動 CoT,改為調整 reasoning_effort 或思考預算。如果使用的是非推理模型或本地模型,則加上零樣本的「Let's think step by step」,針對領域任務升級為少量樣本提示,並且只在準確度比 token 成本更重要時才加入自我一致性。
以下是完整的五步決策流程:
- 確認你的模型類別。是推理模型嗎?單單這個事實就決定了以下所有步驟。
- 如果是推理模型,不要手寫 CoT。改為調整
reasoning_effort或思考預算,讓模型在內部進行推理。 - 如果是非推理模型或本地模型,加上零樣本的「Let's think step by step」。這只需要一行,而且可以免費嘗試。
- 針對特定領域的任務,升級為帶有兩到三個示範範例的少量樣本 CoT。只有在準確度比 token 成本更重要時,才加入自我一致性。
- 如果你要公開推理過程,請用評估來衡量它,並將可見的推理鏈視為不可信的輸出。
觸發短語本身通常位於你的系統提示中。我們的系統提示範例說明了它的位置以及如何措辭。
# 在推理模型上,別手寫 CoT,改調整推理強度
# 參數名稱與等級會因供應商和版本而異,請查閱最新文件。
resp = client.responses.create(
model="your-reasoning-model",
reasoning={"effort": "medium"}, # 例如 low | medium | high
input="Prove that the square root of 2 is irrational.",
)
# Anthropic 的對應功能:延伸思考預算。
# budget_tokens 必須小於 max_tokens。
# thinking = {"type": "enabled", "budget_tokens": 4000}將這套整合進正式環境的技術架構,比部落格範例所呈現的還要繁瑣。如果你不想自己調校推理預算與評估框架,我們的團隊能為你打造端到端的流程。參閱 AI 整合 或 與我們聯繫。
關於作者
Mert Batur Gurbuz 是 Techsy.io 的共同創辦人,團隊為 B2B 客戶打造 AI 代理、自動化系統,以及語音/SDR 流程。他目前就讀於伯明罕大學,並撰寫 Techsy 團隊在實際生產環境中使用的 LLM 工具鏈相關文章。
Techsy.io 共同創辦人,就讀於伯明罕大學。歡迎在 LinkedIn 上與他聯繫。
常見問題
2026 年,思維鏈提示還有意義嗎?
有,但它的用途已經縮小了。對於非推理模型,以及小型或本地端的開源模型,手動思維鏈(CoT)仍然能提升多步驟任務的準確率。對推理模型而言,它則多半是多餘的。它目前最有力的用途,是強制產生一條固定、可供檢視與稽核的推理路徑。
思維鏈提示對 GPT-5、o3 或 Claude 等推理模型有效嗎?
這些模型本身已具備內部推理能力,因此手動思維鏈通常是多餘的,有時甚至有害。OpenAI 的文件指出,提示它們「逐步思考」並無必要,而要求它們進行更多推理「實際上可能會損害效能」。請調整推理力度,而非撰寫步驟。
什麼是零樣本思維鏈提示?
零樣本思維鏈(Zero-shot CoT)是指加入一句觸發語——通常是「Let's think step by step」——而不事先提供任何解題範例。Kojima 等人(2022)證明,僅憑這一句話就能讓大型模型具備不錯的推理能力。這是成本最低的思維鏈變體:只需一行文字、無需整理範例,即可快速測試。
思維鏈提示中的自洽性是什麼?
自洽性(Self-consistency)出自 Wang et al.(2022),以較高的溫度取樣數條獨立的推理鏈,再對最終答案進行多數決投票。它是最準確的 CoT 變體,因為錯誤的推理鏈很少會彼此一致,但你必須為每條取樣路徑付出成本,所以它也是最昂貴的。
鏈式思考(Chain of Thought)與少樣本提示(Few-shot Prompting)有什麼不同?
少樣本提示會向模型展示輸入與輸出的範例配對。鏈式思考則著重於輸入與輸出之間的推理過程。兩者能很好地結合:少樣本鏈式思考(few-shot CoT)提供的範例會包含推理步驟,讓模型學習你的推理模式,而不只是模仿答案的格式。
思維鏈 vs. 提示鏈 vs. 思維樹:三者有何不同?
思維鏈在單一提示詞內進行推理。提示鏈將任務拆分到多次獨立的模型呼叫中,並將輸出逐步傳遞下去。思維樹則探索多條推理分支,並剪除較弱的分支。思維鏈是一條單線性路徑;另外兩者則在模型外部增加了結構。
誰發明了思維鏈提示法?
思維鏈提示法由 Google 的 Jason Wei 及其同事於 2022 年的論文《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》中提出。Kojima 等人隨後加入了零樣本 CoT,Wang 等人則加入了自我一致性,兩者同樣發表於 2022 年。
思維鏈提示對程式碼生成有效嗎?
是的,對非推理模型而言確實有效。要求模型在撰寫程式碼前先規劃邏輯,能夠捕捉邊界情況並減少複雜任務中的錯誤。而在推理模型上,規劃過程已在內部完成,因此單純的指令通常比手寫的「逐步推理」前綴效果更好。