
LLM 推論成本到底多少?4 種情境的真實試算
2023 年 3 月,GPT-4 的每百萬輸入 token 要價 30 美元。三年後,GPT-5.6 處理同樣一百萬 token 只要 10 美元,Claude Opus 4.5 是 15 美元。最便宜的方案?只要 2 美分。同樣一份工作,最貴與最便宜之間相差了 1,500 倍。LLM 推論成本指的是每當訓練好的模型讀取你的輸入並產出輸出時,你都得支付的那筆經常性帳單;所有主要供應商都以每百萬 token 計價。預算型模型每百萬輸入 token 收費 0.02 到 0.30 美元,前沿模型對同樣的用量則收取 15 到 75 美元。這個差距之所以重要,是因為決定你需要哪個等級的,是你的工作負載,而不是你的企圖心。
重點整理:
- 預算型模型每百萬輸入 token 收費 0.02–0.30 美元;前沿模型則是 15–75 美元(2026 年 7 月)。
- 輸出 token 比輸入 token 貴 3 到 5 倍,因為生成是逐步進行,而非平行處理。
- 一個 5 萬次對話的客服聊天機器人,每月成本約 9 到 420 美元,視模型等級而定。
- 推論價格每年約下降 10 倍;Gartner 預估到 2030 年還會再降 90%。
每百萬 token 的 LLM 推論成本是多少?
截至 2026 年 7 月,LLM 推論定價遵循三級結構。Google(Gemini 2.5 Flash)等供應商的預算型模型,以及開源選項(Llama 4、Qwen 3),每百萬輸入 token 收費 0.02 到 0.30 美元。中階模型(GPT-4.1、Claude Sonnet 4)落在 0.55 到 15 美元之間。前沿推理模型(o3、Claude Opus 4.5)則要 15 到 75 美元。每家供應商都在官方定價頁公布這些費率(OpenAI、Anthropic),而 PricePerToken.com 用即時表格追蹤 300 多個模型。
截至 2026 年 7 月,你可以只用 2 美分就跑完一百萬個輸入 token,也可以為同樣的一百萬 token 在前沿模型上付 75 美元。
| 等級 | 代表模型 | 輸入 $/百萬 token | 輸出 $/百萬 token | 快取輸入 $/百萬 | 最適合 |
|---|---|---|---|---|---|
| 預算型 | Gemini 2.5 Flash、Llama 4 Scout、Qwen 3 32B | $0.02-$0.30 | $0.06-$1.20 | $0.01-$0.15 | 大量分類、路由 |
| 中階 | GPT-4.1、Claude Sonnet 4、Gemini 2.5 Pro、GPT-5.6 | $0.55-$15 | $2.20-$60 | $0.28-$7.50 | RAG、程式碼生成、分析 |
| 前沿 | o3、Claude Opus 4.5 | $15-$75 | $60-$300 | $7.50-$37.50 | 複雜推理、研究 |
快取輸入折扣能在重複的 prompt 上削減 50–90% 的帳單(prompt 快取如何削減輸入成本說明了背後機制)。若要查看包含所有供應商目前費率的即時 300 模型表格,請見我們的完整每 token 定價比較表。
是什麼驅動了 LLM 推論成本?四大構成要素
你的推論帳單可拆成四個成本驅動因素:每 token 的 GPU 運算時間、儲存模型權重與 KV cache 的記憶體、讓生成比讀取更貴的輸入/輸出不對稱,以及基礎設施開銷(電力、散熱、網路)。搞清楚哪個要素主導你的工作負載,你就知道最佳化在哪裡最有回報。
| 要素 | 它是什麼 | 占帳單比例 | 什麼會變動它 |
|---|---|---|---|
| 運算(GPU 時間) | 將每個 token 通過模型各層所需的 FLOPs | 40-60% | 模型大小、批次大小、量化程度 |
| 記憶體(權重 + KV cache) | 容納模型參數與注意力狀態的 VRAM | 20-35% | 上下文長度、並行請求數 |
| 輸入/輸出不對稱 | 解碼階段逐步執行,一次一個 token | 已含在輸出定價中 | 輸出長度、取樣策略 |
| 基礎設施開銷 | 電力、散熱、網路、GPU 閒置時間 | 10-20% | 資料中心位置、使用率 |
運算:每 token 的 GPU 時間
每個 token 都會通過模型的每一層。一個 70B 參數的模型在 FP16 下,每個 token 大約需要 140 GFLOPs。量化到 INT4 可降到約 35 GFLOPs。NVIDIA 的推論基準測試指南拆解了完整的 TCO 公式:硬體攤提加上電費,再加上營運開銷,除以服務過的 token 數。
記憶體:模型權重 + KV cache
一個 70B 模型在 FP16 下,光是權重就占約 140 GB 的 VRAM。KV cache 會隨上下文長度與並行批次大小成長。在 128K 上下文、32 個並行請求下,可能再燒掉 80 GB。這就是為什麼各模型 VRAM 需求對自架決策如此重要。
輸入與輸出的不對稱
輸出 token 比輸入 token 貴 3 到 5 倍,因為模型是一個一個、依序生成 token 的。它無法像讀取你的 prompt 那樣平行處理。
白話版本是這樣:讀取你 2,000 token 的 prompt(「prefill」階段)時,所有 token 會在 GPU 核心上同時處理。生成 500 個輸出 token(「decode」階段)時,每一步只產出一個 token,每個都依賴前一個。GPU 在步驟之間大多處於閒置,等待記憶體頻寬。你以輸入費率 3 到 5 倍的價格付費的,正是那段閒置時間。
基礎設施開銷
電力、散熱、網路,以及在請求之間閒置的 GPU。Hugging Face 的最佳化文件說明了連續批次處理(continuous batching)與推測解碼(speculative decoding)如何從同樣的硬體擠出更多每 GPU 小時的 token,直接削減這個開銷占比。
4 種真實工作負載的 LLM 推論成本是多少?
一個典型的客服聊天機器人每月成本 9–420 美元,RAG 管線每月 168–3,360 美元,200 位開發者的程式碼助理每月 123–2,078 美元,批次文件處理則落在每月 240 到 6,400 美元之間。這個價差幾乎完全取決於模型等級的選擇。我們從客戶部署的 token 用量建了這四個情境,並對照 2026 年 7 月的官方定價頁計價。下面每個美元數字都可重算:假設的 token 用量乘以公布的費率。這是我們的分析,而非供應商說法。
客服聊天機器人:每月 5 萬次對話
平均每次對話:800 個輸入 token(系統 prompt + 使用者訊息 + 檢索到的上下文),400 個輸出 token。月用量:50,000 次對話 = 4,000 萬輸入 token、2,000 萬輸出 token。
- 預算型選擇(Gemini 2.5 Flash): 40M × $0.075/M + 20M × $0.30/M = 每月 $9。便宜到幾乎可疑。
- 中階選擇(Claude Sonnet 4): 40M × $3/M + 20M × $15/M = 每月 $420。
對於處理第一線工單的客服機器人,預算型模型足以應付 90% 的查詢。用分類器把較難的 10% 路由給中階模型。
RAG 管線:每天 1 萬次查詢
平均每次查詢:3,200 個輸入 token(檢索到的片段 + 系統 prompt + 使用者問題),600 個輸出 token。每月:30 萬次查詢 = 9.6 億輸入 token、1.8 億輸出 token。
- 預算型選擇(透過 API 使用 Llama 4 Scout): 960M × $0.10/M + 180M × $0.40/M = 每月 $168。
- 中階選擇(GPT-4.1): 960M × $2/M + 180M × $8/M = 每月 $3,360。
RAG 工作負載偏重輸入,因此快取輸入折扣在這裡效果顯著。在 70% 的 prompt 快取命中率下,中階方案降到約每月 $2,100。
程式碼助理:200 位開發者
平均每次工作階段:4,500 個輸入 token(檔案上下文 + 對話),1,200 個輸出 token。假設每位開發者每天 15 次請求、每月 22 個工作天 = 每月 66,000 次請求 = 2.97 億輸入、7,900 萬輸出。
- 預算型選擇(Qwen 3 32B): 297M × $0.20/M + 79M × $0.80/M = 每月 $123。
- 中階選擇(Claude Sonnet 4): 297M × $3/M + 79M × $15/M = 每月 $2,078。
開發者很快就會察覺品質差距。寫程式時,中階通常是底線。預算型模型適用於自動完成式的建議,但在跨多檔案的重構上會吃力。
批次文件處理:每月 100 萬份文件
平均每份文件:2,000 個輸入 token、300 個輸出 token(擷取、分類、摘要)。每月:20 億輸入、3 億輸出。
- 預算型選擇(Gemini 2.5 Flash): 2B × $0.075/M + 300M × $0.30/M = 每月 $240。
- 中階選擇(GPT-4.1): 2B × $2/M + 300M × $8/M = 每月 $6,400。
在這個用量下,等級之間 27 倍的價差就是每月 6,160 美元的帳單項目。預算型模型很擅長結構化擷取。如果你在考慮自架這個規模的用量,硬體規格試算請看各模型 VRAM 需求。
| 工作負載 | 模型 | 每次請求 token 數(輸/出) | 每月請求數 | 每月費用 |
|---|---|---|---|---|
| 客服聊天機器人 | Gemini 2.5 Flash | 800 / 400 | 50K | $9 |
| 客服聊天機器人 | Claude Sonnet 4 | 800 / 400 | 50K | $420 |
| RAG 管線 | Llama 4 Scout | 3,200 / 600 | 300K | $168 |
| RAG 管線 | GPT-4.1 | 3,200 / 600 | 300K | $3,360 |
| 程式碼助理 | Qwen 3 32B | 4,500 / 1,200 | 66K | $123 |
| 程式碼助理 | Claude Sonnet 4 | 4,500 / 1,200 | 66K | $2,078 |
| 批次文件 | Gemini 2.5 Flash | 2,000 / 300 | 1M | $240 |
| 批次文件 | GPT-4.1 | 2,000 / 300 | 1M | $6,400 |
def monthly_cost(input_tokens, output_tokens, requests, price_in, price_out):
"""Estimate monthly LLM inference cost.
Args:
input_tokens: avg input tokens per request
output_tokens: avg output tokens per request
requests: monthly request volume
price_in: $/M input tokens
price_out: $/M output tokens
"""
total_in = input_tokens * requests / 1_000_000
total_out = output_tokens * requests / 1_000_000
return (total_in * price_in) + (total_out * price_out)
# Example: support chatbot on Claude Sonnet 4
cost = monthly_cost(
input_tokens=800,
output_tokens=400,
requests=50_000,
price_in=3.00,
price_out=15.00
)
print(f"${cost:,.2f}/month") # $420.00/monthAPI 還是自架:各自何時勝出?
API 勝出的時機:每天請求量低於約 2 萬次,或你的團隊缺乏 ML 基礎設施經驗。自架勝出的時機:每天超過 20 萬次請求,且 GPU 使用率持續維持在 50% 以上。根據 Introl 的分析,70B 級模型在單一 H100 節點上的損益平衡點,約落在每天 5 萬到 8 萬次請求。低於這個門檻,API 供應商的多租戶效率會贏過你單租戶硬體的試算。
| 用量等級 | API 每月費用 | 自架每月費用(GPU + 維運) | 贏家 | 原因 |
|---|---|---|---|---|
| 低:每天 2K 請求 | $150-$400 | $2,800-$4,500 | API | GPU 有 85% 的時間閒置 |
| 中:每天 20K 請求 | $1,500-$4,000 | $3,200-$5,000 | API(險勝) | 使用率約 40%,仍未達損益平衡 |
| 高:每天 200K 請求 | $15,000-$40,000 | $5,500-$8,000 | 自架 | 70% 以上使用率能快速攤提硬體 |
API 何時勝出
你可以在幾天內上線,而不是幾週。不用付 ML 工程師薪水(每年 18 萬到 25 萬美元)、不用為 GPU 故障排待命輪值、不用做容量規劃。對大多數 50 人以下工程師的團隊來說,API 就是正確的預設。沒有但是。
自架何時勝出
你已經跨越每天 20 萬次請求、工作負載可預測,而且已經雇用了 ML 基礎設施人才。開源模型(Llama 4、Qwen 3、Mistral)在你的硬體上運行,成本是電費加攤提。vLLM 與 SGLang 效能實測顯示,吞吐量會依工作負載型態而有 15–30% 的差異,這在這個規模下舉足輕重。
損益平衡數字
自架只有在 GPU 使用率持續超過約 50% 時才划算。低於這個水準,你是在為閒置的矽晶片付費。隱藏的人事成本(ML 工程師時間、待命輪值、模型更新、安全修補),才是多數團隊即使 GPU 原始試算看起來有利、仍留在 API 上的真正原因。如果你真的要自架,在 Modal 上部署模型能移除基礎設施管理這一層,同時讓每 token 成本低於 API 費率。
沒人編進預算的隱藏成本
原始 token 支出只占你真實帳單的 60–80%。其餘藏在六個從不出現在定價計算機裡的帳單項目裡。在你的 token 估算之上,再多編列 20–40% 來涵蓋它們。
- **監控與可觀測性工具:**每月 200–1,500 美元。Token 用量儀表板、延遲追蹤、依功能歸屬成本。一套 LLM 可觀測性架構,只要在你燒穿預算前攔下一次 prompt 回歸,就回本了。
- **重試與失敗重跑:**3–8% 的請求會失敗或需要重試(逾時、速率限制、格式錯誤的輸出)。這就是你 token 帳單的 3–8%,什麼都沒產出就花掉了。
- **Prompt 工程的迭代工時:**每季 20–60 小時,以含攤的工程成本每小時 100–200 美元計。每次調整 prompt 都要重跑測試批次。
- **評估與回歸測試:**自動化評估套件每月 100–800 美元的 token 支出。你是在付費讓模型批改自己的作業。
- **多區域備援:**如果你需要跨區域容錯轉移來滿足延遲或合規要求,基礎設施成本會變 1.5–2 倍。
- **冷啟動延遲代價:**Serverless GPU 部署(Modal、AWS Lambda)會對閒置時間計費。冷啟動會增加 2–8 秒,並為暖機付費。
經驗法則:把原始 token 估算乘以 1.3,就是務實的預算。如果你身處有合規開銷的受監管產業,乘以 1.4。
為什麼 LLM 推論越來越便宜?
**LLM 推論價格自 2023 年以來,每年大約下降 10 倍。**2024 年每月要花 1,000 美元的工作負載,今天接近 100 美元。三股力量驅動了這件事:硬體改進(NVIDIA Blackwell FP4、Google TPU v6)、競爭壓力(DeepSeek、開源模型引爆價格戰),以及軟體最佳化(推測解碼、連續批次處理、量化)。Gartner 預估推論成本到 2030 年還會再降 90%,不過那是預估,不是保證。
Epoch AI 的價格追蹤用實測數據記錄了這波下降。a16z 的「LLMflation」分析發明了這個詞,並勾勒出經濟意涵:推論的通縮速度比先前任何一個運算類別都快。
訓練成本 vs. 推論成本
訓練一個前沿模型要花 5,000 萬到 2 億美元(一次性)。同一個模型在所有使用者上的推論,每年要花 500 萬到 5,000 萬美元,視規模而定。對多數團隊來說,這個比例是 10–100 倍:訓練成本是一年推論成本的 10 到 100 倍。但訓練是一次性的資本支出。推論則是隨使用者成長而複利累積的經常性營運帳單。除非你在打造基礎模型,否則你不需要為訓練付費。但你每一天都在為推論付費。
電費這個帳單項目
一張 NVIDIA H100 在滿載下功耗約 700W。以每度電 0.10 美元(美國平均)計算,就是每 GPU 小時 0.07 美元。單一 H100 上的一個 70B 模型,批次處理時大約產生每秒 2,000 個輸出 token。一小時:720 萬個 token。每百萬輸出 token 的電費成本:約 0.01 美元。這是我們的計算,並已標明。電費占 API 帳單的 1–3%,但占自架 TCO 的 8–15%。如果你在高電價地區(德國每度 0.30 美元會讓這個數字變三倍)跑自己的 GPU,它就更重要。
實務上的重點:價格降得夠快,以至於對特定模型等級做出 12 個月的承諾是有風險的。每季重新評估。降低 LLM 帳單的 12 個方法涵蓋了你現在就能做的戰術性動作,讓大趨勢替你扛下重活。
如何估算你自己的推論成本?
用四個步驟估算你的每月 LLM 推論成本:計算每次請求的 token 數、乘以月用量、套用等級定價,再加上 20–40% 的開銷。根據我們為客戶規劃推論預算的經驗,多數團隊會跳過第四步,然後納悶為什麼實際帳單比估算高出三分之一。以下是我們使用的流程。
- **計算每次請求的 token 數。**在 100 次以上的真實請求中,記錄平均輸入 token(系統 prompt + 上下文 + 使用者訊息)與輸出 token(模型回應)。不要猜。去量。
- **乘以月用量。**每天請求數 × 30 = 每月請求數。再乘以你每次請求的 token 數。
- **套用等級定價。**輸入 token 總數乘以模型的每百萬輸入費率。輸出一樣。兩者相加。
- **加上 20–40% 開銷。**重試、評估、prompt 迭代、監控。放進你預算的,是這個數字,而不是第三步。
def estimate_monthly_budget(avg_input_tokens, avg_output_tokens,
requests_per_day, price_in, price_out,
overhead_pct=0.30):
"""Full monthly budget estimate with overhead."""
monthly_requests = requests_per_day * 30
raw_cost = monthly_cost(
avg_input_tokens, avg_output_tokens,
monthly_requests, price_in, price_out
)
return raw_cost * (1 + overhead_pct)
# RAG pipeline: 10K queries/day on GPT-4.1
budget = estimate_monthly_budget(
avg_input_tokens=3200,
avg_output_tokens=600,
requests_per_day=10_000,
price_in=2.00,
price_out=8.00,
overhead_pct=0.30
)
print(f"${budget:,.0f}/month") # $4,368/month一旦你知道自己的數字,LLM 閘道工具會把流量路由到能通過你品質門檻的最便宜模型。一個能逐請求選模型的閘道,可以在不動你 prompt 的情況下,把混合成本削減 30–50%。
關於作者
Mert Batur 是 Techsy.io 的共同創辦人,團隊為 B2B 客戶打造 AI 代理、自動化系統與語音/SDR 管線。他撰寫 Techsy 團隊實際在生產環境使用的 LLM 工具棧。LinkedIn 連結。
常見問題
LLM 推論昂貴嗎?
取決於規模與模型選擇。一百萬輸入 token 在 Gemini 2.5 Flash 上要 0.02 美元,在前沿推理模型上則是 75 美元。對一個每天處理 1 萬次請求的小型應用,預期每月 50–400 美元。對每天 100 萬次以上請求的企業工作負載,預算落在每月 5,000–40,000 美元。單位成本很低;是量讓它累積起來。
LLM 中的 100 萬 token 是多少?
一百萬 token 大約等於 75 萬字,或約 10 本完整長度的小說。2026 年 7 月,處理 100 萬輸入 token 的成本是 0.02 美元(預算級)到 75 美元(前沿級)。同樣用量的輸出 token 則是 0.06 到 300 美元。多數生產工作負載落在中階:每百萬輸入 token 2–15 美元。
為什麼 AI 推論這麼貴?
推論需要把每個 token 通過 GPU 上數十億個模型參數,而每張 GPU 要價 25,000–40,000 美元。解碼階段逐步生成 token,讓 GPU 核心在步驟之間閒置。你付錢買的是專用硬體、電力、散熱,以及讓服務棧 24 小時不間斷運轉的供應商工程團隊。
AI 推論成本在下降嗎?
是的,自 2023 年以來每年約 10 倍。GPT-4 推出時每百萬 token 收費 30/60 美元(輸入/輸出)。同等能力現在只要 2–10 美元。Epoch AI 的數據在所有供應商之間確認了這條軌跡。Gartner 預估到 2030 年還會再降 90%,由硬體改進與開源模型的競爭壓力驅動。
2026 年的 LLM 推論成本是多少?
預算型模型:每百萬輸入 token 0.02–0.30 美元。中階:0.55–15 美元。前沿:15–75 美元。一個典型的生產工作負載(客服聊天機器人、RAG 管線或程式碼助理),在中階模型上每月成本 150–4,000 美元。預算型模型以 10–30 倍的低價處理大量、低複雜度的任務。
訓練成本與推論成本有何不同?
訓練是從零開始教會模型的一次性支出:前沿模型要 5,000 萬到 2 億美元,需要數千張 GPU 跑數月。推論是使用那個已訓練模型的經常性成本:把輸入丟進去得到輸出,按 token 計費。對多數團隊來說,推論是他們唯一會付的帳單。訓練是給打造基礎模型的公司做的事。
如何為我的應用計算 LLM 推論成本?
把每次請求的平均輸入 token 乘以每月請求量,再乘以模型的每百萬輸入費率。輸出 token 照做。兩者相加。再加 30% 作為重試、評估與監控開銷。本文的 Python 程式碼片段把這套數學自動化了。與其猜測,不如量測真實的 token 數;100 次以上請求的紀錄能給出可靠的平均值。
輸出 token 比輸入 token 貴嗎?
是的,通常貴 3–5 倍。輸入處理(prefill)會對所有 token 同時平行處理,充分利用 GPU 核心。輸出生成(decode)一次產出一個 token,每個都依賴前一個。GPU 在步驟之間等待記憶體頻寬。供應商把輸出定得更高,以反映這個較低的硬體效率。
自架推論比用 API 便宜嗎?
只有在每天超過約 20 萬次請求、且 GPU 使用率持續超過 50% 時才是。低於這個水準,API 供應商的多租戶效率會贏過你單租戶的硬體。自架還會增加隱藏成本:ML 工程師薪水(每年 18 萬到 25 萬美元)、待命輪值、模型更新與安全修補。多數 50 人以下工程師的團隊應該留在 API 上。
LLM 推論很耗電嗎?
一張 H100 GPU 在滿載下功耗約 700W。以每度 0.10 美元計算,就是每 GPU 小時 0.07 美元,換算成 70B 模型大約每百萬輸出 token 0.01 美元。電費占 API 帳單的 1–3%,但占自架 TCO 的 8–15%。在高電價地區(德國,每度 0.30 美元),電費占比變三倍,實質影響自架的經濟性。
總結
四個要記住的數字:0.02 美元(每百萬輸入 token 的預算底價)、3–5 倍(輸出相對輸入的溢價)、20–40%(在原始 token 試算之上要加的開銷),以及 10 倍(自 2023 年起的年降幅)。你的實際帳單取決於用量、模型等級,以及你多積極地做快取、批次與流量路由。
在 Techsy,我們的團隊為運行生產 LLM 工作負載的 B2B 客戶規劃推論預算、挑選模型等級。如果你想讓人替你的成本模型把關第二道,預約免費諮詢。