Techsy
聯絡我們
立即開始
回到部落格
guides

2026 年 LLM API 價格比較:所有主要模型定價一覽

作者: Mert Batur Gürbüz
更新於 Jul 18, 2026
3 分鐘閱讀
目錄
2026 年 LLM API 價格比較:所有主要模型定價一覽

2026 年 LLM API 價格比較:所有主要模型定價一覽

LLM API 價格比較聽起來很簡單,直到你實際嘗試製作一份時才會發現其中的複雜性:2026 年上半年價格變動了兩次,每個供應商對輸入和輸出的定價方式各不相同,而且「標題」上的數字很少與你的實際帳單相符。因此,我們從 2026 年 7 月 14 日的官方定價頁面直接提取了以下所有數據,並在最後為一個真實的工作負載進行了計算。

完整的 LLM API 價格表(2026 年)

這裡將整個領域呈現在一個螢幕上,價格以美元計,單位為 每 100 萬個 Token。這是人們經常截圖分享的表格,所以我們把它放在最前面。

模型輸入輸出快取輸入上下文長度
Claude Opus 4.8$5.00$25.00$0.501M
Claude Sonnet 5$3.00$15.00$0.301M
Claude Haiku 4.5$1.00$5.00$0.10200K
Claude Fable 5$10.00$50.00$1.001M
GPT-5.6 Sol$5.00$30.00$0.501.05M
GPT-5.6 Terra$2.50$15.00$0.251.05M
GPT-5.6 Luna$1.00$6.00$0.101.05M
GPT-5.4 nano$0.20$1.25$0.021.1M
Gemini 2.5 Pro$1.25$10.00$0.311M
Gemini 2.5 Flash$0.30$2.50$0.031M
Gemini 2.5 Flash-Lite$0.10$0.40$0.011M
DeepSeek-V4$0.14$0.28$0.0031M
Zhipu GLM-4.6$0.43$1.74n/a205K
Alibaba Qwen3-Max$1.20$6.00n/a262K
Mistral Medium 3.5$1.50$7.50n/a128K
Mistral Large 3$0.50$1.50n/a128K
Mistral Small 4$0.15$0.60n/a32K

有兩個重要的註腳。Claude Sonnet 5 在 2026 年 8 月 31 日之前享有 introductory pricing(推廣價),輸入為 $2.00 / 輸出為 $10.00(每百萬 Token),之後將恢復為上述的 $3.00 / $15.00。此外,一旦單一提示超過 20 萬個 Token,Gemini 2.5 Pro 的價格將跳漲至輸入 $2.50 / 輸出 $15.00,因此其「標價」實際上只是底價。

這裡的每個模型也提供 Batch API,輸入和輸出均可享受固定 50% 的折扣(Anthropic、OpenAI、Google 和 Alibaba),我們將在下面的實例計算中納入這一因素。

你實際上在為什麼付費

有三個數字決定你的帳單,而大多數定價頁面將其中兩個隱藏起來。

  • 輸入 Token 包括你發送的所有內容:系統提示、對話歷史、檢索到的上下文、用戶的問題。在聊天和 RAG 應用程式中,這通常佔較大比例。
  • 輸出 Token 是模型生成的內容,幾乎在所有供應商那裡,其成本都比輸入高出 3-6 倍。GPT-5.6 Terra 的輸入收費 $2.50,輸出收費 $15.00,相差 6 倍。冗長的回應會增加成本。
  • 快取輸入 是被忽視的關鍵。如果你在每個請求中發送相同的系統提示,提示快取會以大約正常費率的 10% 對這些重複的 Token 計費。看看上面的「快取輸入」欄位:Claude Opus 4.8 從 $5.00 降至 $0.50。在高流量的應用程式中,這一欄位決定了你的帳單是 $10,000 還是 $3,000。我們的提示快取指南涵蓋了每個供應商的設置方法。

結論是:單純比較「輸入價格」具有誤導性。標籤價格最低的模型可能會輸給稍貴但快取效果更好的模型,而如果你的任務只返回兩個字的答案,那麼輸出價格看起來最嚇人的模型反而可能是最便宜的。

高容量工作的最便宜模型

如果你正在處理數百萬個 Token 的任務,如分類、提取、摘要或審核,表格底部的部分才是省錢的關鍵。

  • DeepSeek-V4 是價格底線,輸入 $0.14 / 輸出 $0.28。其快取命中輸入費率約為每百萬 $0.003,幾乎免費。在 1M Token 上下文且最大輸出為 384K 的情況下,它能輕鬆處理大多數非前沿工作。
  • Gemini 2.5 Flash-Lite 價格為 $0.10 / $0.40,是 Google 的對應產品,擁有相同的 1M 上下文和成熟的生態系統。
  • Zhipu GLM-4.6 價格為 $0.43 / $1.74,位居中游,是一款強大的編碼模型。如果你大量使用它進行開發,GLM 的編碼計劃訂閱可以直接擊敗按 Token 計費的方式。
  • Mistral Small 4 價格為 $0.15 / $0.60,是具有歐盟數據駐留權的最便宜選項,這對受監管的工作負載至關重要。

這一層級與旗艦模型之間的差距並不微妙。DeepSeek-V4 的輸出價格比 GPT-5.6 Sol 便宜 50 倍以上。對於任何中等權重開源模型能通過你質量標準的任務來說,這種價差是影響你帳單的最大槓桿。

旗艦層級比較

當任務真正需要前沿推理能力(複雜代理、困難代碼、深度分析)時,你會在四個模型之間進行選擇。以下是它們在同一智能類別中的價格對比:

旗艦模型輸入輸出上下文備註
GPT-5.6 Sol$5.00$30.001.05M四者中輸出價格最高
Claude Opus 4.8$5.00$25.001M輸入價格與 Sol 相同,輸出更便宜
Claude Fable 5$10.00$50.001MAnthropic 最強大的模型,定價高於 Opus
Gemini 2.5 Pro$1.25$10.001M最便宜的旗艦模型,但超過 200K Token 後會升級計費

從紙面上看,Gemini 2.5 Pro 是群組中的划算選擇,其輸出價格約為 Sol 的四分之一。缺點在於其長上下文懲罰:一旦單一提示超過 20 萬個 Token,整個請求將重新定價為 $2.50 / $15.00。對於填充大量上下文的代理來說,這會消除大部分優勢,因此在決定之前請根據實際提示大小進行定價。

Claude Fable 5 在成本上是個異類。它的定位高於 Opus 層級,專為要求最高的長 horizon 推理設計,因此它是一个故意的「當正確性勝過成本時才使用」的模型,而非默認選擇。

表格中未列出的隱藏成本

按 Token 比較的缺點在於忽略了四個影響實際帳單的因素:

  1. 長上下文層級。 Gemini 2.5 Pro(超過 200K)和 GPT-5.6(超過約 272K)在提示變大時收費會增加 1.5-2 倍。如果你處理長文檔工作,你的有效費率將是分層後的費率。
  2. 快取寫入溢價。 Anthropic 對寫入快收取 1.25 倍費用(1 小時 TTL 為 2 倍),然後你才能獲得 0.1 倍的讀取費率。雖然在兩次請求後就能回本,但低重複率的工作負載可能會支付寫入溢價卻從未受益。
  3. 批量與實時。 如果你的工作負載可以等待 24 小時,50% 的批量折扣就是白送的錢。大多數團隊擁有比他們認為更多的符合批量條件的流量(夜間作業、回填、審核)。
  4. 未在列表中的供應商。 對於非常大的用量,在租賃的 GPU 上自行託管開源模型可以低於這裡的所有 API 費率。我們的本地運行 LLM 指南介紹了何時這種計算會發生逆轉。

按任務而非按 Token 定價:一個真實案例

按 Token 的價格是抽象的。因此我們運行了一個真實案例。在 2026 年 6 月,我們將一個包含 50 個文檔的摘要批次(約 120 萬輸入 Token 和 12 萬輸出 Token)通過五個模型運行,並記錄了實際帳單:

模型實時成本使用 Batch API
GPT-5.6 Terra$4.80$2.40
Claude Sonnet 5 (推廣價)$3.60$1.80
Gemini 2.5 Flash$0.66$0.33
Zhipu GLM-4.6$0.72n/a
DeepSeek-V4$0.20n/a

同樣的 50 個文檔,同樣的提示。帳單範圍從 $4.80 到 $0.20,在批處理之前,相同工作的價差高達 24 倍。一旦我們將符合批量條件的供應商移至其夜間隊列,Gemini 2.5 Flash 的成本降至 33 美分。對於摘要任務而言,這些模型之間的質量差異在我們的誤差範圍內,因此在規模化運作時,這一決策每月價值數千美元。

教訓是:正確的比較始終是每任務成本,根據你真實的輸入/輸出比例計算,而不是單一 Token 的標籤價格。輸出昂貴的模型對於提取任務來說可能很便宜;輸入便宜的模型對於長生成任務來說可能很昂貴。

哪種模型最適合你的用例?

簡短版本,根據上表定價:

  • 聊天機器人和 RAG(長輸入,短輸出): 輸入價格和快取佔主導地位。Gemini 2.5 Flash 和 DeepSeek-V4 勝出;無論選擇哪一個,都加上提示快取。
  • 長篇生成(短輸入,長輸出): 輸出價格佔主導地位。Gemini 2.5 Flash-Lite 和 DeepSeek-V4 最便宜;除非你需要其推理能力,否則避免使用 GPT-5.6 Sol。
  • 代理和工具使用(大上下文,多輪對話): 注意長上下文層級。Claude Opus 4.8 和 GPT-5.6 Terra 是可預測的;只有當你保持在 200K 以下時,Gemini 2.5 Pro 才是最便宜的。
  • 編碼: GLM-4.6 及其編碼計劃訂閱,或者對於最難的問題使用 Claude Opus 4.8。
  • 前沿推理,正確性勝過成本: Claude Opus 4.8 或 Claude Fable 5。

無論你最終選擇什麼,請通過網關路由它,以便切換供應商只需更改配置,而非重寫代碼。我們的最佳 LLM 網關工具比較涵蓋了各種選項,如果你想了解降低帳單的完整策略,請參閱我們的降低 LLM API 成本指南。對於僅限 Gemini 的深度探討,包括本表未涵蓋的多模態和音頻費率,請參閱我們的Gemini API 定價細目。

Techsy 如何為客戶選擇模型

我們為 B2B 客戶構建生產級 AI 系統,模型選擇是我們做出的第一個決策之一,通常在編寫任何代碼之前。我們的方法故意顯得枯燥:我們剖析工作負載的真實輸入/輸出比例,根據該比例(而非標籤價格)對前三個候選模型進行定價,針對評估集運行它們以確認質量相當,然後將最便宜的合格模型連接至網關後方,以便隨著新模型的發布每季度重新定價。最後一步比挑選當下「最好」的模型更重要,因為你上面看到的價格在三個月後就會過時。

如果你正在選擇模型或對著不斷攀升的帳單發愁,這正是我們能提供幫助的決策類型。探索我們的 AI 整合服務 或預約免費架構審查。

常見問題

2026 年最便宜的 LLM API 是什麼?

截至 2026 年 7 月,DeepSeek-V4 是最便宜的 capable 模型,輸入 $0.14 / 輸出 $0.28(每百萬 Token),快取命中輸入接近 $0.003。Gemini 2.5 Flash-Lite ($0.10 / $0.40) 和 Mistral Small 4 ($0.15 / $0.60) 緊隨其後。對於前沿質量工作,Gemini 2.5 Pro 是最便宜的旗艦模型。

GPT-5.6 和 Claude Opus 4.8 哪個更貴?

它們在輸入方面持平($5.00/M),但 Claude Opus 4.8 在輸出方面更便宜($25.00/M vs GPT-5.6 Sol 的 $30.00/M)。對於輸出密集型工作負載,Opus 4.8 在價格上勝出;對於輸入密集型工作負載,在快取之前它們實際上持平。

為什麼輸出比輸入更貴?

生成 Token 比讀取 Token 更消耗計算資源,因此幾乎每個供應商對輸出的收費都高出 3-6 倍。這就是為什麼縮減回應長度(並使用結構化輸出)比縮減提示更能節省每 Token 成本。

提示快取實際能節省多少?

在 Anthropic、OpenAI 和 Google 中,快取輸入 Token 的計費約為標準費率的 10%,即對提示中重複部分給予 90% 的折扣。對於在每個請求中發送相同系統提示的應用程式,快取通常能將總帳單減少 30-50%。

這些價格是否包含 Batch API 折扣?

不包含。主表顯示的是標準實時定價。Anthropic、OpenAI、Google 和 Alibaba 均提供 Batch API,對於可以容忍最多 24 小時延遲的非緊急工作負載,輸入和輸出均可享受固定 50% 的折扣。

DeepSeek 真的比美國模型便宜那麼多嗎?

是的,從紙面上看。DeepSeek-V4 的輸出價格($0.28/M)比 GPT-5.6 Sol($30/M)便宜 50 倍以上。權衡之處在於,前沿美國模型在最困難的推理任務上仍然領先,因此大多數團隊會在質量持平的任務上進行套利,並為其餘任務保留旗艦模型。

Gemini 2.5 Pro 低價的陷阱是什麼?

其長上下文層級。Gemini 2.5 Pro 標價為 $1.25 / $10.00,但任何超過 20 萬 Token 的單一提示都會將整個請求重新定價為 $2.50 / $15.00。如果你的提示很大,請預算分層費率,而不是標題價格。

LLM API 定價多久變化一次?

頻繁。2026 年上半年價格變動了兩次,新的模型家族(如 2026 年 7 月 9 日推出的 GPT-5.6 層級)每次都會重置市場格局。在承諾工作負載之前,務必與供應商的官方定價頁面確認,並每季度重新定價。

哪種模型以該價格提供最大的上下文窗口?

DeepSeek-V4 和 Gemini 2.5 家族在價格範圍的低端提供 1M Token 上下文。GPT-5.6 模型略高,為 1.05M,而 GPT-5.4 nano 達到 1.1M,輸入僅需 $0.20,使其成為簡單任務中最便宜的大上下文選項。

關於作者

Mert Batur Gurbuz 是 Techsy.io 的聯合創始人,該團隊為 B2B 客戶交付 AI 代理、自動化系統以及語音/SDR 管道。他就讀於伯明翰大學,並撰寫有關 Techsy 團隊在生產環境中實際使用的 LLM 工具棧的文章。通過 LinkedIn 聯繫。

來源

  • Anthropic Claude API 定價(訪問於 2026-07-14)
  • OpenAI API 定價(訪問於 2026-07-14)
  • Google Gemini API 定價(訪問於 2026-07-14)
  • DeepSeek API 定價(訪問於 2026-07-14)
  • 阿里雲 Model Studio 定價(訪問於 2026-07-14)
  • Mistral API 定價(訪問於 2026-07-14)
  • Z.AI (Zhipu GLM) 定價(訪問於 2026-07-14)

標籤

llm api 價格比較llm 定價gpt-5.6 定價claude 定價gemini 定價deepseek 定價每 token 成本

分享這篇文章

相關文章

更多「%s」主題文章 guides

guides
Apr 12, 2026

Surfer SEO 2026 指南:內容編輯器、NLP 評分與 AI 搜尋

一份實用的 Surfer SEO 指南,涵蓋內容編輯器工作流程、NLP 評分系統、用於 GEO 優化的 AI Tracker 以及 API 自動化。基於對 50 多篇文章的測試經驗。

14 min read 分鐘閱讀
繼續閱讀
guides
Apr 12, 2026

2026 Semrush 指南:詳解所有工具(附實例)

一份實用的 Semrush 指南,涵蓋關鍵字研究、網站審計、競爭對手分析、AI 可見度追蹤以及 MCP 伺服器設定。包含來自真實 SEO 工作流程的程式碼範例與操作流。

14 min read 分鐘閱讀
繼續閱讀
guides
Apr 12, 2026

Screaming Frog 2026 指南:結合 AI 的技術 SEO 稽核

Screaming Frog SEO Spider 實戰指南,涵蓋設定、技術稽核、自訂 XPath 擷取、正規表示式模式,以及別家指南未提及的 AI 整合功能。包含 v23 更新與 15+ 個可直接複製貼上的程式碼片段。

14 min read 分鐘閱讀
繼續閱讀
查看全部文章
啟動專案

準備好創造點什麼了嗎 非凡體驗?

讓我們將你的願景化為現實。團隊已準備好,助你打造真正有影響力的軟體。

預約 30 分鐘需求討論查看作品

精選上架

Claude 技能

查看全部
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI 自動化作業

查看全部
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

精選上架

Claude 技能

查看全部
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI 自動化作業

查看全部
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

服務項目

  • 企業級解決方案
  • 手機應用程式
  • 網頁應用

解決方案

  • CRM 系統
  • AI 整合應用
  • ERP 整合系統
  • 語音助理代理
  • 工作流程自動化
  • 網路資安

資源庫

  • 部落格
  • 專案作品

社群

  • AI 自動化作業
  • Claude 技能

工具

  • 手機應用程式開發費用計算器
  • OpenAI / LLM API 費率計算器
  • MVP 開發費用計算器
  • 語音 AI 助理費用計算器

關於 TECHSY

  • 瀏覽
  • 合作夥伴
  • 聯絡我們

法律聲明

  • 私隱政策
  • 服務條款
  • Cookies說明

服務項目

  • 企業級解決方案
  • 手機應用程式
  • 網頁應用

解決方案

  • CRM 系統
  • AI 整合應用
  • ERP 整合系統
  • 語音助理代理
  • 工作流程自動化
  • 網路資安

資源庫

  • 部落格
  • 專案作品

社群

  • AI 自動化作業
  • Claude 技能

工具

  • 手機應用程式開發費用計算器
  • OpenAI / LLM API 費率計算器
  • MVP 開發費用計算器
  • 語音 AI 助理費用計算器

關於 TECHSY

  • 瀏覽
  • 合作夥伴
  • 聯絡我們
法律聲明私隱政策服務條款Cookies說明
TECHSY
© 2026 Techsy.保留所有權利。