OpenAI、Claude 與 Gemini API 成本計算器
比較各供應商的每月成本,並納入快取與批次處理的節省效益。
GPT、Claude 和 Gemini 的 API 價格,每百萬輸入 token 介於 0.15 到 75 美元之間,輸出 token 通常貴上 3 到 5 倍。以每月 1,000 萬 token 用量計算,GPT-4o 約 775 美元、Claude Sonnet 4 約 1,140 美元、Gemini 2.5 Pro 約 825 美元。啟用提示快取可讓快取 token 的成本降低 10 倍;批次 API 則能為非即時作業省下 50% 費用。透過這款計算機,你可以針對三家供應商精確模擬實際用量。
您的輸入資料
05 fields誰應該使用此工具
在與供應商接洽前,先評估 openai api 專案規模的創辦人。 為新產品開發編列年度預算的 CTO 及工程主管。 將單一想法轉化為財務部門可接受的合理範圍的產品經理。 用於核實外包廠商與承包商報價合理性的採購團隊。
我們的計算邏輯
價格依據 OpenAI、Anthropic 與 Google 於 2026 年公開的費率。提示快取僅適用於已快取的輸入 token(通常為系統提示加上穩定上下文)。Batch API 則同時適用於輸入與輸出 token,針對非即時工作,提供 24 小時 SLA。
資料來源
影響成本的關鍵因素
模型等級選擇
GPT-4.5、Claude Opus 4、Gemini 2.5 Pro 這類前沿模型,每 token 單價比中階機型貴上 5 到 10 倍。前沿模型只該用在中階模型真的力有未逮的硬核推理任務:複雜的多步驟邏輯、數學、模糊的程式碼生成,或需要深厚世界知識的任務。其餘一律路由給 Claude Sonnet 4、GPT-4o 或 Gemini Flash。兩者價差大到只要路由做得聰明,混合工作負載的開銷通常能砍掉 60% 到 80%。
提示詞快取
Anthropic 提供 5 分鐘免費快取,或加價 25% 延長至 1 小時,快取 token 的成本大約能省 90%。OpenAI 則在特定端點自動快取 5 到 10 分鐘,完全不用設定。當系統提示超過 2K token 且各請求間保持穩定時,快取效果最好——這正是多數生產環境聊天機器人與 RAG 系統的寫照。上下文又長又穩定、每分鐘請求量又高的工作負載,省下的錢最可觀。
批次 API
OpenAI 和 Anthropic 都提供 Batch 端點,以 24 小時 SLA 換取標準價格直接打五折。Batch 非常適合分類、產生嵌入向量、摘要、評估跑批,以及任何背景處理作業。整合起來輕而易舉:同一個模型、同一組提示,只是換個端點,再加個佇列等結果就行。多數團隊忽略了 Batch,把沒有即時需求的負載照原價在跑——這是最容易避免、卻最常被忽略的 AI 成本之一。
輸出 token 數量
各家供應商的輸出 token 單價都是輸入的 3 到 5 倍,但多數回應根本用不到 API 預設允許的 4K token 輸出空間。如果你只要一個是或否的答案,把輸出上限設成 10 token;如果只要一段簡短摘要,設成 200 就好。模型往往會主動解釋它的推理過程,哪怕你沒問——而這些解釋你都得買單。把 max_tokens 收緊,通常能在不影響品質的情況下,砍掉 30% 到 50% 的輸出成本。
上下文視窗大小不等於價格
所有主要供應商都是依實際消耗的 token 數計費,而非依上下文視窗的大小計費。用 200K 的上下文視窗處理一段 5K token 的提示,費用與用 5K 上下文視窗處理同樣 5K token 的提示完全相同。也就是說,除非你真的把上下文塞滿,否則長上下文模型並不會「比較貴」。挑選模型時,應該看能力和每 token 的價格,而不是看誰的上下文視窗最大。
如何降低支出
第一項最佳化,請先開啟提示快取,其他都往後排。以 Anthropic 來說,只要用 cache_control 標頭標記固定的系統提示,快取 token 的價格大約只剩標準輸入價格的 10%。以 OpenAI 來說,當各請求的提示前綴相同時,部分端點會自動啟用快取。在上下文長且固定、請求量又大的工作負載上,效益最為明顯:例如帶有詳細角色設定的聊天機器人、反覆帶入相同檢索內容的 RAG 系統,以及任何會反覆傳送長指令集的代理迴圈。多數團隊都忘了開啟快取,結果多付了 5 到 10 倍的費用。
把所有非即時的工作負載都移到 Batch API。Anthropic 和 OpenAI 都提供批次端點,價格正好是標準價格的 50%,代價是 24 小時的回應 SLA。分類作業、內容審核、嵌入向量生成、摘要流程與評估執行,都很適合改用批次處理。整合工作非常簡單,因為提示和模型都不用變。我們常看到團隊用標準價格跑整套內容標記流程,其實改用批次處理就能在品質完全不變的情況下,把帳單直接砍半。
依難度分流請求。簡單的查詢(問候、格式化、基本查找)交給 GPT-4o mini、Claude Haiku 或 Gemini Flash 就好,每百萬輸入 token 只要 $0.15 到 $0.80。需要深度推理的難題,則交給 Claude Opus、GPT-4.5 或 Gemini Pro,每百萬 token 為 $1.25 到 $75。只要在模型路由器前面加一個小型分類器,通常就能在混合型工作負載上省下 60 到 80% 的成本。把所有請求都丟給前沿模型,是我們在實際生產環境中最常看到的 AI 成本錯誤。
大膽調降 max_tokens 的上限。輸出 token 的價格是輸入 token 的 3 到 5 倍,而預設的 4K 輸出緩衝區,遠超過多數回應實際所需。是或否的答案上限設 10 個 token,簡短摘要設 200 個,結構化 JSON 則依你的 schema 所需再加一點緩衝即可。即使你沒要求,模型有時還是想多發揮幾句,而這些多出來的內容你都得買單。在多數情況下,收緊 max_tokens 就能減少 30 到 50% 的輸出成本。
把檢索到的內容精簡到每則查詢真正需要的部分就好。RAG 系統常常一次檢索 10 到 20 個片段,為了保險起見全數塞進提示裡,結果就是每則請求都得為數千個無關的 token 買單。只要加上一個重新排序器,篩選出最相關的前 3 到 5 個片段,通常就能在品質不受影響的情況下,減少 50 到 70% 的輸入 token 用量,甚至常常因為模型不再被無關內容干擾,品質反而更好。
記錄每一則請求的 token 數量、模型,以及是否命中快取。看不見就無從最佳化,而一旦新功能上線或提示被微調,AI 成本可能一夜之間大變樣。請設定每日花費警示,並建立一個儀表板,依功能、模型與端點拆分支出。我們遇到的多數生產環境成本超支,都是因為使用模式早在兩週前就變了,卻沒人去看帳單。
每百萬 token 成本(2026 年定價)
| 模型 | 輸入 | 輸出 | 快取輸入 |
|---|---|---|---|
| GPT-4.5 | $75.00 | $150.00 | $37.50 |
| GPT-4o | $2.50 | $10.00 | $1.25 |
| GPT-4o mini | $0.15 | $0.60 | $0.075 |
| Claude Opus 4 | $15.00 | $75.00 | $1.50 |
| Claude Sonnet 4 | $3.00 | $15.00 | $0.30 |
| Claude Haiku 4 | $0.80 | $4.00 | $0.08 |
| Gemini 2.5 Pro | $1.25 | $10.00 | 不適用 |
| Gemini 2.5 Flash | $0.075 | $0.30 | 不適用 |
常見問題
每週都會被問到的問題
這裡有簡潔明瞭的解答。如果沒找到您的疑問,
GPT-4o:每百萬輸入 token 2.50 美元,輸出 10 美元。GPT-4o mini:輸入每百萬 0.15 美元,輸出 0.60 美元。GPT-4.5:輸入每百萬 75 美元,輸出 150 美元。若每月用量 1,000 萬 token、輸入輸出比例為 30/70,費用大約落在 25 到 13,000 美元之間,視模型而定。
對多數應用情境來說:GPT-4o mini、Gemini 2.5 Flash 或 Claude Haiku 4 都是好選擇,每百萬輸入 token 全部不到 1 美元。若要兼顧品質與價格:Claude Sonnet 4 或 Gemini 2.5 Pro。
Anthropic 和 OpenAI 會在多次請求之間快取大型輸入提示。快取 token 的成本比未快取的低約 90%。最適合搭配系統提示固定的聊天機器人,或上下文穩定的 RAG 應用。
輸入與輸出 token 都恰好減半。前提是接受 24 小時的 SLA。適合分類、摘要、嵌入與評估等任務,但不適合即時聊天或互動式使用者體驗。
在相近的品質等級下,成本也差不多。Claude Sonnet 4 和 GPT-4o 的費用大致相當。若搭配提示快取,在提示固定的應用情境中,Claude Opus 4 比 GPT-4o 便宜約 30%。
(1) 啟用提示快取。(2) 盡可能使用批次 API。(3) 將簡單查詢導向 mini 模型。(4) 嚴格限制 max_tokens 上限。(5) 精簡檢索上下文,只保留必要資訊。
損益兩平點大約落在每月 5,000 美元的 API 支出。低於這個數字:繼續使用 API 即可。高於這個數字:只要具備基礎架構方面的專業,自建 Llama 3.1 或 Mistral 可省下 50% 到 70% 的成本。
取一個具代表性的 100 筆請求樣本,算出平均輸入與輸出 token 數,再乘以每月請求量,接著乘以每百萬 token 的單價,最後加上 30% 的安全餘額。
只有在中階模型真的搞不定的高難度推理任務時才需要。實際上 80% 的生產環境工作負載,用 Sonnet 4、GPT-4o 或 Gemini 2.5 Pro 就綽綽有餘,成本還能低上 10 倍。
對典型工作負載而言,誤差通常在 ±15% 以內。實際落差主要來自提示長度波動、輸出長度波動、錯誤重試迴圈,以及路由邏輯的差異。請把這個計算機當作規劃工具,而非最終帳單。