
2026 年 LLM API 價格比較:所有主要模型定價一覽
LLM API 價格比較聽起來很簡單,直到你實際嘗試製作一份時才會發現其中的複雜性:2026 年上半年價格變動了兩次,每個供應商對輸入和輸出的定價方式各不相同,而且「標題」上的數字很少與你的實際帳單相符。因此,我們從 2026 年 7 月 14 日的官方定價頁面直接提取了以下所有數據,並在最後為一個真實的工作負載進行了計算。
完整的 LLM API 價格表(2026 年)
這裡將整個領域呈現在一個螢幕上,價格以美元計,單位為 每 100 萬個 Token。這是人們經常截圖分享的表格,所以我們把它放在最前面。
| 模型 | 輸入 | 輸出 | 快取輸入 | 上下文長度 |
|---|---|---|---|---|
| Claude Opus 4.8 | $5.00 | $25.00 | $0.50 | 1M |
| Claude Sonnet 5 | $3.00 | $15.00 | $0.30 | 1M |
| Claude Haiku 4.5 | $1.00 | $5.00 | $0.10 | 200K |
| Claude Fable 5 | $10.00 | $50.00 | $1.00 | 1M |
| GPT-5.6 Sol | $5.00 | $30.00 | $0.50 | 1.05M |
| GPT-5.6 Terra | $2.50 | $15.00 | $0.25 | 1.05M |
| GPT-5.6 Luna | $1.00 | $6.00 | $0.10 | 1.05M |
| GPT-5.4 nano | $0.20 | $1.25 | $0.02 | 1.1M |
| Gemini 2.5 Pro | $1.25 | $10.00 | $0.31 | 1M |
| Gemini 2.5 Flash | $0.30 | $2.50 | $0.03 | 1M |
| Gemini 2.5 Flash-Lite | $0.10 | $0.40 | $0.01 | 1M |
| DeepSeek-V4 | $0.14 | $0.28 | $0.003 | 1M |
| Zhipu GLM-4.6 | $0.43 | $1.74 | n/a | 205K |
| Alibaba Qwen3-Max | $1.20 | $6.00 | n/a | 262K |
| Mistral Medium 3.5 | $1.50 | $7.50 | n/a | 128K |
| Mistral Large 3 | $0.50 | $1.50 | n/a | 128K |
| Mistral Small 4 | $0.15 | $0.60 | n/a | 32K |
有兩個重要的註腳。Claude Sonnet 5 在 2026 年 8 月 31 日之前享有 introductory pricing(推廣價),輸入為 $2.00 / 輸出為 $10.00(每百萬 Token),之後將恢復為上述的 $3.00 / $15.00。此外,一旦單一提示超過 20 萬個 Token,Gemini 2.5 Pro 的價格將跳漲至輸入 $2.50 / 輸出 $15.00,因此其「標價」實際上只是底價。
這裡的每個模型也提供 Batch API,輸入和輸出均可享受固定 50% 的折扣(Anthropic、OpenAI、Google 和 Alibaba),我們將在下面的實例計算中納入這一因素。
你實際上在為什麼付費
有三個數字決定你的帳單,而大多數定價頁面將其中兩個隱藏起來。
- 輸入 Token 包括你發送的所有內容:系統提示、對話歷史、檢索到的上下文、用戶的問題。在聊天和 RAG 應用程式中,這通常佔較大比例。
- 輸出 Token 是模型生成的內容,幾乎在所有供應商那裡,其成本都比輸入高出 3-6 倍。GPT-5.6 Terra 的輸入收費 $2.50,輸出收費 $15.00,相差 6 倍。冗長的回應會增加成本。
- 快取輸入 是被忽視的關鍵。如果你在每個請求中發送相同的系統提示,提示快取會以大約正常費率的 10% 對這些重複的 Token 計費。看看上面的「快取輸入」欄位:Claude Opus 4.8 從 $5.00 降至 $0.50。在高流量的應用程式中,這一欄位決定了你的帳單是 $10,000 還是 $3,000。我們的提示快取指南涵蓋了每個供應商的設置方法。
結論是:單純比較「輸入價格」具有誤導性。標籤價格最低的模型可能會輸給稍貴但快取效果更好的模型,而如果你的任務只返回兩個字的答案,那麼輸出價格看起來最嚇人的模型反而可能是最便宜的。
高容量工作的最便宜模型
如果你正在處理數百萬個 Token 的任務,如分類、提取、摘要或審核,表格底部的部分才是省錢的關鍵。
- DeepSeek-V4 是價格底線,輸入 $0.14 / 輸出 $0.28。其快取命中輸入費率約為每百萬 $0.003,幾乎免費。在 1M Token 上下文且最大輸出為 384K 的情況下,它能輕鬆處理大多數非前沿工作。
- Gemini 2.5 Flash-Lite 價格為 $0.10 / $0.40,是 Google 的對應產品,擁有相同的 1M 上下文和成熟的生態系統。
- Zhipu GLM-4.6 價格為 $0.43 / $1.74,位居中游,是一款強大的編碼模型。如果你大量使用它進行開發,GLM 的編碼計劃訂閱可以直接擊敗按 Token 計費的方式。
- Mistral Small 4 價格為 $0.15 / $0.60,是具有歐盟數據駐留權的最便宜選項,這對受監管的工作負載至關重要。
這一層級與旗艦模型之間的差距並不微妙。DeepSeek-V4 的輸出價格比 GPT-5.6 Sol 便宜 50 倍以上。對於任何中等權重開源模型能通過你質量標準的任務來說,這種價差是影響你帳單的最大槓桿。
旗艦層級比較
當任務真正需要前沿推理能力(複雜代理、困難代碼、深度分析)時,你會在四個模型之間進行選擇。以下是它們在同一智能類別中的價格對比:
| 旗艦模型 | 輸入 | 輸出 | 上下文 | 備註 |
|---|---|---|---|---|
| GPT-5.6 Sol | $5.00 | $30.00 | 1.05M | 四者中輸出價格最高 |
| Claude Opus 4.8 | $5.00 | $25.00 | 1M | 輸入價格與 Sol 相同,輸出更便宜 |
| Claude Fable 5 | $10.00 | $50.00 | 1M | Anthropic 最強大的模型,定價高於 Opus |
| Gemini 2.5 Pro | $1.25 | $10.00 | 1M | 最便宜的旗艦模型,但超過 200K Token 後會升級計費 |
從紙面上看,Gemini 2.5 Pro 是群組中的划算選擇,其輸出價格約為 Sol 的四分之一。缺點在於其長上下文懲罰:一旦單一提示超過 20 萬個 Token,整個請求將重新定價為 $2.50 / $15.00。對於填充大量上下文的代理來說,這會消除大部分優勢,因此在決定之前請根據實際提示大小進行定價。
Claude Fable 5 在成本上是個異類。它的定位高於 Opus 層級,專為要求最高的長 horizon 推理設計,因此它是一个故意的「當正確性勝過成本時才使用」的模型,而非默認選擇。
表格中未列出的隱藏成本
按 Token 比較的缺點在於忽略了四個影響實際帳單的因素:
- 長上下文層級。 Gemini 2.5 Pro(超過 200K)和 GPT-5.6(超過約 272K)在提示變大時收費會增加 1.5-2 倍。如果你處理長文檔工作,你的有效費率將是分層後的費率。
- 快取寫入溢價。 Anthropic 對寫入快收取 1.25 倍費用(1 小時 TTL 為 2 倍),然後你才能獲得 0.1 倍的讀取費率。雖然在兩次請求後就能回本,但低重複率的工作負載可能會支付寫入溢價卻從未受益。
- 批量與實時。 如果你的工作負載可以等待 24 小時,50% 的批量折扣就是白送的錢。大多數團隊擁有比他們認為更多的符合批量條件的流量(夜間作業、回填、審核)。
- 未在列表中的供應商。 對於非常大的用量,在租賃的 GPU 上自行託管開源模型可以低於這裡的所有 API 費率。我們的本地運行 LLM 指南介紹了何時這種計算會發生逆轉。
按任務而非按 Token 定價:一個真實案例
按 Token 的價格是抽象的。因此我們運行了一個真實案例。在 2026 年 6 月,我們將一個包含 50 個文檔的摘要批次(約 120 萬輸入 Token 和 12 萬輸出 Token)通過五個模型運行,並記錄了實際帳單:
| 模型 | 實時成本 | 使用 Batch API |
|---|---|---|
| GPT-5.6 Terra | $4.80 | $2.40 |
| Claude Sonnet 5 (推廣價) | $3.60 | $1.80 |
| Gemini 2.5 Flash | $0.66 | $0.33 |
| Zhipu GLM-4.6 | $0.72 | n/a |
| DeepSeek-V4 | $0.20 | n/a |
同樣的 50 個文檔,同樣的提示。帳單範圍從 $4.80 到 $0.20,在批處理之前,相同工作的價差高達 24 倍。一旦我們將符合批量條件的供應商移至其夜間隊列,Gemini 2.5 Flash 的成本降至 33 美分。對於摘要任務而言,這些模型之間的質量差異在我們的誤差範圍內,因此在規模化運作時,這一決策每月價值數千美元。
教訓是:正確的比較始終是每任務成本,根據你真實的輸入/輸出比例計算,而不是單一 Token 的標籤價格。輸出昂貴的模型對於提取任務來說可能很便宜;輸入便宜的模型對於長生成任務來說可能很昂貴。
哪種模型最適合你的用例?
簡短版本,根據上表定價:
- 聊天機器人和 RAG(長輸入,短輸出): 輸入價格和快取佔主導地位。Gemini 2.5 Flash 和 DeepSeek-V4 勝出;無論選擇哪一個,都加上提示快取。
- 長篇生成(短輸入,長輸出): 輸出價格佔主導地位。Gemini 2.5 Flash-Lite 和 DeepSeek-V4 最便宜;除非你需要其推理能力,否則避免使用 GPT-5.6 Sol。
- 代理和工具使用(大上下文,多輪對話): 注意長上下文層級。Claude Opus 4.8 和 GPT-5.6 Terra 是可預測的;只有當你保持在 200K 以下時,Gemini 2.5 Pro 才是最便宜的。
- 編碼: GLM-4.6 及其編碼計劃訂閱,或者對於最難的問題使用 Claude Opus 4.8。
- 前沿推理,正確性勝過成本: Claude Opus 4.8 或 Claude Fable 5。
無論你最終選擇什麼,請通過網關路由它,以便切換供應商只需更改配置,而非重寫代碼。我們的最佳 LLM 網關工具比較涵蓋了各種選項,如果你想了解降低帳單的完整策略,請參閱我們的降低 LLM API 成本指南。對於僅限 Gemini 的深度探討,包括本表未涵蓋的多模態和音頻費率,請參閱我們的Gemini API 定價細目。
Techsy 如何為客戶選擇模型
我們為 B2B 客戶構建生產級 AI 系統,模型選擇是我們做出的第一個決策之一,通常在編寫任何代碼之前。我們的方法故意顯得枯燥:我們剖析工作負載的真實輸入/輸出比例,根據該比例(而非標籤價格)對前三個候選模型進行定價,針對評估集運行它們以確認質量相當,然後將最便宜的合格模型連接至網關後方,以便隨著新模型的發布每季度重新定價。最後一步比挑選當下「最好」的模型更重要,因為你上面看到的價格在三個月後就會過時。
如果你正在選擇模型或對著不斷攀升的帳單發愁,這正是我們能提供幫助的決策類型。探索我們的 AI 整合服務 或預約免費架構審查。
常見問題
2026 年最便宜的 LLM API 是什麼?
截至 2026 年 7 月,DeepSeek-V4 是最便宜的 capable 模型,輸入 $0.14 / 輸出 $0.28(每百萬 Token),快取命中輸入接近 $0.003。Gemini 2.5 Flash-Lite ($0.10 / $0.40) 和 Mistral Small 4 ($0.15 / $0.60) 緊隨其後。對於前沿質量工作,Gemini 2.5 Pro 是最便宜的旗艦模型。
GPT-5.6 和 Claude Opus 4.8 哪個更貴?
它們在輸入方面持平($5.00/M),但 Claude Opus 4.8 在輸出方面更便宜($25.00/M vs GPT-5.6 Sol 的 $30.00/M)。對於輸出密集型工作負載,Opus 4.8 在價格上勝出;對於輸入密集型工作負載,在快取之前它們實際上持平。
為什麼輸出比輸入更貴?
生成 Token 比讀取 Token 更消耗計算資源,因此幾乎每個供應商對輸出的收費都高出 3-6 倍。這就是為什麼縮減回應長度(並使用結構化輸出)比縮減提示更能節省每 Token 成本。
提示快取實際能節省多少?
在 Anthropic、OpenAI 和 Google 中,快取輸入 Token 的計費約為標準費率的 10%,即對提示中重複部分給予 90% 的折扣。對於在每個請求中發送相同系統提示的應用程式,快取通常能將總帳單減少 30-50%。
這些價格是否包含 Batch API 折扣?
不包含。主表顯示的是標準實時定價。Anthropic、OpenAI、Google 和 Alibaba 均提供 Batch API,對於可以容忍最多 24 小時延遲的非緊急工作負載,輸入和輸出均可享受固定 50% 的折扣。
DeepSeek 真的比美國模型便宜那麼多嗎?
是的,從紙面上看。DeepSeek-V4 的輸出價格($0.28/M)比 GPT-5.6 Sol($30/M)便宜 50 倍以上。權衡之處在於,前沿美國模型在最困難的推理任務上仍然領先,因此大多數團隊會在質量持平的任務上進行套利,並為其餘任務保留旗艦模型。
Gemini 2.5 Pro 低價的陷阱是什麼?
其長上下文層級。Gemini 2.5 Pro 標價為 $1.25 / $10.00,但任何超過 20 萬 Token 的單一提示都會將整個請求重新定價為 $2.50 / $15.00。如果你的提示很大,請預算分層費率,而不是標題價格。
LLM API 定價多久變化一次?
頻繁。2026 年上半年價格變動了兩次,新的模型家族(如 2026 年 7 月 9 日推出的 GPT-5.6 層級)每次都會重置市場格局。在承諾工作負載之前,務必與供應商的官方定價頁面確認,並每季度重新定價。
哪種模型以該價格提供最大的上下文窗口?
DeepSeek-V4 和 Gemini 2.5 家族在價格範圍的低端提供 1M Token 上下文。GPT-5.6 模型略高,為 1.05M,而 GPT-5.4 nano 達到 1.1M,輸入僅需 $0.20,使其成為簡單任務中最便宜的大上下文選項。
關於作者
Mert Batur Gurbuz 是 Techsy.io 的聯合創始人,該團隊為 B2B 客戶交付 AI 代理、自動化系統以及語音/SDR 管道。他就讀於伯明翰大學,並撰寫有關 Techsy 團隊在生產環境中實際使用的 LLM 工具棧的文章。通過 LinkedIn 聯繫。
來源
- Anthropic Claude API 定價(訪問於 2026-07-14)
- OpenAI API 定價(訪問於 2026-07-14)
- Google Gemini API 定價(訪問於 2026-07-14)
- DeepSeek API 定價(訪問於 2026-07-14)
- 阿里雲 Model Studio 定價(訪問於 2026-07-14)
- Mistral API 定價(訪問於 2026-07-14)
- Z.AI (Zhipu GLM) 定價(訪問於 2026-07-14)