ai-machine-learning

LLM 推論成本到底多少?4 種情境的真實試算

作者: Mert Batur
Aug 1, 2026
5 分鐘閱讀
LLM 推論成本到底多少?4 種情境的真實試算

LLM 推論成本到底多少?4 種情境的真實試算

2023 年 3 月,GPT-4 的每百萬輸入 token 要價 30 美元。三年後,GPT-5.6 處理同樣一百萬 token 只要 10 美元,Claude Opus 4.5 是 15 美元。最便宜的方案?只要 2 美分。同樣一份工作,最貴與最便宜之間相差了 1,500 倍。LLM 推論成本指的是每當訓練好的模型讀取你的輸入並產出輸出時,你都得支付的那筆經常性帳單;所有主要供應商都以每百萬 token 計價。預算型模型每百萬輸入 token 收費 0.02 到 0.30 美元,前沿模型對同樣的用量則收取 15 到 75 美元。這個差距之所以重要,是因為決定你需要哪個等級的,是你的工作負載,而不是你的企圖心。

重點整理:

  • 預算型模型每百萬輸入 token 收費 0.02–0.30 美元;前沿模型則是 15–75 美元(2026 年 7 月)。
  • 輸出 token 比輸入 token 貴 3 到 5 倍,因為生成是逐步進行,而非平行處理。
  • 一個 5 萬次對話的客服聊天機器人,每月成本約 9 到 420 美元,視模型等級而定。
  • 推論價格每年約下降 10 倍;Gartner 預估到 2030 年還會再降 90%。

每百萬 token 的 LLM 推論成本是多少?

截至 2026 年 7 月,LLM 推論定價遵循三級結構。Google(Gemini 2.5 Flash)等供應商的預算型模型,以及開源選項(Llama 4、Qwen 3),每百萬輸入 token 收費 0.02 到 0.30 美元。中階模型(GPT-4.1、Claude Sonnet 4)落在 0.55 到 15 美元之間。前沿推理模型(o3、Claude Opus 4.5)則要 15 到 75 美元。每家供應商都在官方定價頁公布這些費率(OpenAIAnthropic),而 PricePerToken.com 用即時表格追蹤 300 多個模型。

截至 2026 年 7 月,你可以只用 2 美分就跑完一百萬個輸入 token,也可以為同樣的一百萬 token 在前沿模型上付 75 美元。

等級代表模型輸入 $/百萬 token輸出 $/百萬 token快取輸入 $/百萬最適合
預算型Gemini 2.5 Flash、Llama 4 Scout、Qwen 3 32B$0.02-$0.30$0.06-$1.20$0.01-$0.15大量分類、路由
中階GPT-4.1、Claude Sonnet 4、Gemini 2.5 Pro、GPT-5.6$0.55-$15$2.20-$60$0.28-$7.50RAG、程式碼生成、分析
前沿o3、Claude Opus 4.5$15-$75$60-$300$7.50-$37.50複雜推理、研究

快取輸入折扣能在重複的 prompt 上削減 50–90% 的帳單(prompt 快取如何削減輸入成本說明了背後機制)。若要查看包含所有供應商目前費率的即時 300 模型表格,請見我們的完整每 token 定價比較表

是什麼驅動了 LLM 推論成本?四大構成要素

你的推論帳單可拆成四個成本驅動因素:每 token 的 GPU 運算時間、儲存模型權重與 KV cache 的記憶體、讓生成比讀取更貴的輸入/輸出不對稱,以及基礎設施開銷(電力、散熱、網路)。搞清楚哪個要素主導你的工作負載,你就知道最佳化在哪裡最有回報。

要素它是什麼占帳單比例什麼會變動它
運算(GPU 時間)將每個 token 通過模型各層所需的 FLOPs40-60%模型大小、批次大小、量化程度
記憶體(權重 + KV cache)容納模型參數與注意力狀態的 VRAM20-35%上下文長度、並行請求數
輸入/輸出不對稱解碼階段逐步執行,一次一個 token已含在輸出定價中輸出長度、取樣策略
基礎設施開銷電力、散熱、網路、GPU 閒置時間10-20%資料中心位置、使用率

運算:每 token 的 GPU 時間

每個 token 都會通過模型的每一層。一個 70B 參數的模型在 FP16 下,每個 token 大約需要 140 GFLOPs。量化到 INT4 可降到約 35 GFLOPs。NVIDIA 的推論基準測試指南拆解了完整的 TCO 公式:硬體攤提加上電費,再加上營運開銷,除以服務過的 token 數。

記憶體:模型權重 + KV cache

一個 70B 模型在 FP16 下,光是權重就占約 140 GB 的 VRAM。KV cache 會隨上下文長度與並行批次大小成長。在 128K 上下文、32 個並行請求下,可能再燒掉 80 GB。這就是為什麼各模型 VRAM 需求對自架決策如此重要。

輸入與輸出的不對稱

輸出 token 比輸入 token 貴 3 到 5 倍,因為模型是一個一個、依序生成 token 的。它無法像讀取你的 prompt 那樣平行處理。

白話版本是這樣:讀取你 2,000 token 的 prompt(「prefill」階段)時,所有 token 會在 GPU 核心上同時處理。生成 500 個輸出 token(「decode」階段)時,每一步只產出一個 token,每個都依賴前一個。GPU 在步驟之間大多處於閒置,等待記憶體頻寬。你以輸入費率 3 到 5 倍的價格付費的,正是那段閒置時間。

基礎設施開銷

電力、散熱、網路,以及在請求之間閒置的 GPU。Hugging Face 的最佳化文件說明了連續批次處理(continuous batching)與推測解碼(speculative decoding)如何從同樣的硬體擠出更多每 GPU 小時的 token,直接削減這個開銷占比。

4 種真實工作負載的 LLM 推論成本是多少?

一個典型的客服聊天機器人每月成本 9–420 美元,RAG 管線每月 168–3,360 美元,200 位開發者的程式碼助理每月 123–2,078 美元,批次文件處理則落在每月 240 到 6,400 美元之間。這個價差幾乎完全取決於模型等級的選擇。我們從客戶部署的 token 用量建了這四個情境,並對照 2026 年 7 月的官方定價頁計價。下面每個美元數字都可重算:假設的 token 用量乘以公布的費率。這是我們的分析,而非供應商說法。

客服聊天機器人:每月 5 萬次對話

平均每次對話:800 個輸入 token(系統 prompt + 使用者訊息 + 檢索到的上下文),400 個輸出 token。月用量:50,000 次對話 = 4,000 萬輸入 token、2,000 萬輸出 token。

  • 預算型選擇(Gemini 2.5 Flash): 40M × $0.075/M + 20M × $0.30/M = 每月 $9。便宜到幾乎可疑。
  • 中階選擇(Claude Sonnet 4): 40M × $3/M + 20M × $15/M = 每月 $420

對於處理第一線工單的客服機器人,預算型模型足以應付 90% 的查詢。用分類器把較難的 10% 路由給中階模型。

RAG 管線:每天 1 萬次查詢

平均每次查詢:3,200 個輸入 token(檢索到的片段 + 系統 prompt + 使用者問題),600 個輸出 token。每月:30 萬次查詢 = 9.6 億輸入 token、1.8 億輸出 token。

  • 預算型選擇(透過 API 使用 Llama 4 Scout): 960M × $0.10/M + 180M × $0.40/M = 每月 $168
  • 中階選擇(GPT-4.1): 960M × $2/M + 180M × $8/M = 每月 $3,360

RAG 工作負載偏重輸入,因此快取輸入折扣在這裡效果顯著。在 70% 的 prompt 快取命中率下,中階方案降到約每月 $2,100。

程式碼助理:200 位開發者

平均每次工作階段:4,500 個輸入 token(檔案上下文 + 對話),1,200 個輸出 token。假設每位開發者每天 15 次請求、每月 22 個工作天 = 每月 66,000 次請求 = 2.97 億輸入、7,900 萬輸出。

  • 預算型選擇(Qwen 3 32B): 297M × $0.20/M + 79M × $0.80/M = 每月 $123
  • 中階選擇(Claude Sonnet 4): 297M × $3/M + 79M × $15/M = 每月 $2,078

開發者很快就會察覺品質差距。寫程式時,中階通常是底線。預算型模型適用於自動完成式的建議,但在跨多檔案的重構上會吃力。

批次文件處理:每月 100 萬份文件

平均每份文件:2,000 個輸入 token、300 個輸出 token(擷取、分類、摘要)。每月:20 億輸入、3 億輸出。

  • 預算型選擇(Gemini 2.5 Flash): 2B × $0.075/M + 300M × $0.30/M = 每月 $240
  • 中階選擇(GPT-4.1): 2B × $2/M + 300M × $8/M = 每月 $6,400

在這個用量下,等級之間 27 倍的價差就是每月 6,160 美元的帳單項目。預算型模型很擅長結構化擷取。如果你在考慮自架這個規模的用量,硬體規格試算請看各模型 VRAM 需求

工作負載模型每次請求 token 數(輸/出)每月請求數每月費用
客服聊天機器人Gemini 2.5 Flash800 / 40050K$9
客服聊天機器人Claude Sonnet 4800 / 40050K$420
RAG 管線Llama 4 Scout3,200 / 600300K$168
RAG 管線GPT-4.13,200 / 600300K$3,360
程式碼助理Qwen 3 32B4,500 / 1,20066K$123
程式碼助理Claude Sonnet 44,500 / 1,20066K$2,078
批次文件Gemini 2.5 Flash2,000 / 3001M$240
批次文件GPT-4.12,000 / 3001M$6,400
python
def monthly_cost(input_tokens, output_tokens, requests, price_in, price_out):
    """Estimate monthly LLM inference cost.
    
    Args:
        input_tokens: avg input tokens per request
        output_tokens: avg output tokens per request
        requests: monthly request volume
        price_in: $/M input tokens
        price_out: $/M output tokens
    """
    total_in = input_tokens * requests / 1_000_000
    total_out = output_tokens * requests / 1_000_000
    return (total_in * price_in) + (total_out * price_out)

# Example: support chatbot on Claude Sonnet 4
cost = monthly_cost(
    input_tokens=800,
    output_tokens=400,
    requests=50_000,
    price_in=3.00,
    price_out=15.00
)
print(f"${cost:,.2f}/month")  # $420.00/month

API 還是自架:各自何時勝出?

API 勝出的時機:每天請求量低於約 2 萬次,或你的團隊缺乏 ML 基礎設施經驗。自架勝出的時機:每天超過 20 萬次請求,且 GPU 使用率持續維持在 50% 以上。根據 Introl 的分析,70B 級模型在單一 H100 節點上的損益平衡點,約落在每天 5 萬到 8 萬次請求。低於這個門檻,API 供應商的多租戶效率會贏過你單租戶硬體的試算。

用量等級API 每月費用自架每月費用(GPU + 維運)贏家原因
低:每天 2K 請求$150-$400$2,800-$4,500APIGPU 有 85% 的時間閒置
中:每天 20K 請求$1,500-$4,000$3,200-$5,000API(險勝)使用率約 40%,仍未達損益平衡
高:每天 200K 請求$15,000-$40,000$5,500-$8,000自架70% 以上使用率能快速攤提硬體

API 何時勝出

你可以在幾天內上線,而不是幾週。不用付 ML 工程師薪水(每年 18 萬到 25 萬美元)、不用為 GPU 故障排待命輪值、不用做容量規劃。對大多數 50 人以下工程師的團隊來說,API 就是正確的預設。沒有但是。

自架何時勝出

你已經跨越每天 20 萬次請求、工作負載可預測,而且已經雇用了 ML 基礎設施人才。開源模型(Llama 4、Qwen 3、Mistral)在你的硬體上運行,成本是電費加攤提。vLLM 與 SGLang 效能實測顯示,吞吐量會依工作負載型態而有 15–30% 的差異,這在這個規模下舉足輕重。

損益平衡數字

自架只有在 GPU 使用率持續超過約 50% 時才划算。低於這個水準,你是在為閒置的矽晶片付費。隱藏的人事成本(ML 工程師時間、待命輪值、模型更新、安全修補),才是多數團隊即使 GPU 原始試算看起來有利、仍留在 API 上的真正原因。如果你真的要自架,在 Modal 上部署模型能移除基礎設施管理這一層,同時讓每 token 成本低於 API 費率。

沒人編進預算的隱藏成本

原始 token 支出只占你真實帳單的 60–80%。其餘藏在六個從不出現在定價計算機裡的帳單項目裡。在你的 token 估算之上,再多編列 20–40% 來涵蓋它們。

  • **監控與可觀測性工具:**每月 200–1,500 美元。Token 用量儀表板、延遲追蹤、依功能歸屬成本。一套 LLM 可觀測性架構,只要在你燒穿預算前攔下一次 prompt 回歸,就回本了。
  • **重試與失敗重跑:**3–8% 的請求會失敗或需要重試(逾時、速率限制、格式錯誤的輸出)。這就是你 token 帳單的 3–8%,什麼都沒產出就花掉了。
  • **Prompt 工程的迭代工時:**每季 20–60 小時,以含攤的工程成本每小時 100–200 美元計。每次調整 prompt 都要重跑測試批次。
  • **評估與回歸測試:**自動化評估套件每月 100–800 美元的 token 支出。你是在付費讓模型批改自己的作業。
  • **多區域備援:**如果你需要跨區域容錯轉移來滿足延遲或合規要求,基礎設施成本會變 1.5–2 倍。
  • **冷啟動延遲代價:**Serverless GPU 部署(Modal、AWS Lambda)會對閒置時間計費。冷啟動會增加 2–8 秒,並為暖機付費。

經驗法則:把原始 token 估算乘以 1.3,就是務實的預算。如果你身處有合規開銷的受監管產業,乘以 1.4。

為什麼 LLM 推論越來越便宜?

**LLM 推論價格自 2023 年以來,每年大約下降 10 倍。**2024 年每月要花 1,000 美元的工作負載,今天接近 100 美元。三股力量驅動了這件事:硬體改進(NVIDIA Blackwell FP4、Google TPU v6)、競爭壓力(DeepSeek、開源模型引爆價格戰),以及軟體最佳化(推測解碼、連續批次處理、量化)。Gartner 預估推論成本到 2030 年還會再降 90%,不過那是預估,不是保證。

Epoch AI 的價格追蹤用實測數據記錄了這波下降。a16z 的「LLMflation」分析發明了這個詞,並勾勒出經濟意涵:推論的通縮速度比先前任何一個運算類別都快。

訓練成本 vs. 推論成本

訓練一個前沿模型要花 5,000 萬到 2 億美元(一次性)。同一個模型在所有使用者上的推論,每年要花 500 萬到 5,000 萬美元,視規模而定。對多數團隊來說,這個比例是 10–100 倍:訓練成本是一年推論成本的 10 到 100 倍。但訓練是一次性的資本支出。推論則是隨使用者成長而複利累積的經常性營運帳單。除非你在打造基礎模型,否則你不需要為訓練付費。但你每一天都在為推論付費。

電費這個帳單項目

一張 NVIDIA H100 在滿載下功耗約 700W。以每度電 0.10 美元(美國平均)計算,就是每 GPU 小時 0.07 美元。單一 H100 上的一個 70B 模型,批次處理時大約產生每秒 2,000 個輸出 token。一小時:720 萬個 token。每百萬輸出 token 的電費成本:約 0.01 美元。這是我們的計算,並已標明。電費占 API 帳單的 1–3%,但占自架 TCO 的 8–15%。如果你在高電價地區(德國每度 0.30 美元會讓這個數字變三倍)跑自己的 GPU,它就更重要。

實務上的重點:價格降得夠快,以至於對特定模型等級做出 12 個月的承諾是有風險的。每季重新評估。降低 LLM 帳單的 12 個方法涵蓋了你現在就能做的戰術性動作,讓大趨勢替你扛下重活。

如何估算你自己的推論成本?

用四個步驟估算你的每月 LLM 推論成本:計算每次請求的 token 數、乘以月用量、套用等級定價,再加上 20–40% 的開銷。根據我們為客戶規劃推論預算的經驗,多數團隊會跳過第四步,然後納悶為什麼實際帳單比估算高出三分之一。以下是我們使用的流程。

  1. **計算每次請求的 token 數。**在 100 次以上的真實請求中,記錄平均輸入 token(系統 prompt + 上下文 + 使用者訊息)與輸出 token(模型回應)。不要猜。去量。
  2. **乘以月用量。**每天請求數 × 30 = 每月請求數。再乘以你每次請求的 token 數。
  3. **套用等級定價。**輸入 token 總數乘以模型的每百萬輸入費率。輸出一樣。兩者相加。
  4. **加上 20–40% 開銷。**重試、評估、prompt 迭代、監控。放進你預算的,是這個數字,而不是第三步。
python
def estimate_monthly_budget(avg_input_tokens, avg_output_tokens,
                            requests_per_day, price_in, price_out,
                            overhead_pct=0.30):
    """Full monthly budget estimate with overhead."""
    monthly_requests = requests_per_day * 30
    raw_cost = monthly_cost(
        avg_input_tokens, avg_output_tokens,
        monthly_requests, price_in, price_out
    )
    return raw_cost * (1 + overhead_pct)

# RAG pipeline: 10K queries/day on GPT-4.1
budget = estimate_monthly_budget(
    avg_input_tokens=3200,
    avg_output_tokens=600,
    requests_per_day=10_000,
    price_in=2.00,
    price_out=8.00,
    overhead_pct=0.30
)
print(f"${budget:,.0f}/month")  # $4,368/month

一旦你知道自己的數字,LLM 閘道工具會把流量路由到能通過你品質門檻的最便宜模型。一個能逐請求選模型的閘道,可以在不動你 prompt 的情況下,把混合成本削減 30–50%。

關於作者

Mert Batur 是 Techsy.io 的共同創辦人,團隊為 B2B 客戶打造 AI 代理、自動化系統與語音/SDR 管線。他撰寫 Techsy 團隊實際在生產環境使用的 LLM 工具棧。LinkedIn 連結

常見問題

LLM 推論昂貴嗎?

取決於規模與模型選擇。一百萬輸入 token 在 Gemini 2.5 Flash 上要 0.02 美元,在前沿推理模型上則是 75 美元。對一個每天處理 1 萬次請求的小型應用,預期每月 50–400 美元。對每天 100 萬次以上請求的企業工作負載,預算落在每月 5,000–40,000 美元。單位成本很低;是量讓它累積起來。

LLM 中的 100 萬 token 是多少?

一百萬 token 大約等於 75 萬字,或約 10 本完整長度的小說。2026 年 7 月,處理 100 萬輸入 token 的成本是 0.02 美元(預算級)到 75 美元(前沿級)。同樣用量的輸出 token 則是 0.06 到 300 美元。多數生產工作負載落在中階:每百萬輸入 token 2–15 美元。

為什麼 AI 推論這麼貴?

推論需要把每個 token 通過 GPU 上數十億個模型參數,而每張 GPU 要價 25,000–40,000 美元。解碼階段逐步生成 token,讓 GPU 核心在步驟之間閒置。你付錢買的是專用硬體、電力、散熱,以及讓服務棧 24 小時不間斷運轉的供應商工程團隊。

AI 推論成本在下降嗎?

是的,自 2023 年以來每年約 10 倍。GPT-4 推出時每百萬 token 收費 30/60 美元(輸入/輸出)。同等能力現在只要 2–10 美元。Epoch AI 的數據在所有供應商之間確認了這條軌跡。Gartner 預估到 2030 年還會再降 90%,由硬體改進與開源模型的競爭壓力驅動。

2026 年的 LLM 推論成本是多少?

預算型模型:每百萬輸入 token 0.02–0.30 美元。中階:0.55–15 美元。前沿:15–75 美元。一個典型的生產工作負載(客服聊天機器人、RAG 管線或程式碼助理),在中階模型上每月成本 150–4,000 美元。預算型模型以 10–30 倍的低價處理大量、低複雜度的任務。

訓練成本與推論成本有何不同?

訓練是從零開始教會模型的一次性支出:前沿模型要 5,000 萬到 2 億美元,需要數千張 GPU 跑數月。推論是使用那個已訓練模型的經常性成本:把輸入丟進去得到輸出,按 token 計費。對多數團隊來說,推論是他們唯一會付的帳單。訓練是給打造基礎模型的公司做的事。

如何為我的應用計算 LLM 推論成本?

把每次請求的平均輸入 token 乘以每月請求量,再乘以模型的每百萬輸入費率。輸出 token 照做。兩者相加。再加 30% 作為重試、評估與監控開銷。本文的 Python 程式碼片段把這套數學自動化了。與其猜測,不如量測真實的 token 數;100 次以上請求的紀錄能給出可靠的平均值。

輸出 token 比輸入 token 貴嗎?

是的,通常貴 3–5 倍。輸入處理(prefill)會對所有 token 同時平行處理,充分利用 GPU 核心。輸出生成(decode)一次產出一個 token,每個都依賴前一個。GPU 在步驟之間等待記憶體頻寬。供應商把輸出定得更高,以反映這個較低的硬體效率。

自架推論比用 API 便宜嗎?

只有在每天超過約 20 萬次請求、且 GPU 使用率持續超過 50% 時才是。低於這個水準,API 供應商的多租戶效率會贏過你單租戶的硬體。自架還會增加隱藏成本:ML 工程師薪水(每年 18 萬到 25 萬美元)、待命輪值、模型更新與安全修補。多數 50 人以下工程師的團隊應該留在 API 上。

LLM 推論很耗電嗎?

一張 H100 GPU 在滿載下功耗約 700W。以每度 0.10 美元計算,就是每 GPU 小時 0.07 美元,換算成 70B 模型大約每百萬輸出 token 0.01 美元。電費占 API 帳單的 1–3%,但占自架 TCO 的 8–15%。在高電價地區(德國,每度 0.30 美元),電費占比變三倍,實質影響自架的經濟性。

總結

四個要記住的數字:0.02 美元(每百萬輸入 token 的預算底價)、3–5 倍(輸出相對輸入的溢價)、20–40%(在原始 token 試算之上要加的開銷),以及 10 倍(自 2023 年起的年降幅)。你的實際帳單取決於用量、模型等級,以及你多積極地做快取、批次與流量路由。

在 Techsy,我們的團隊為運行生產 LLM 工作負載的 B2B 客戶規劃推論預算、挑選模型等級。如果你想讓人替你的成本模型把關第二道,預約免費諮詢

標籤

LLM 推論成本LLM 推論定價每百萬 token 成本GPU 使用率自架推論

分享這篇文章

啟動專案

準備好創造點什麼了嗎 非凡體驗?

讓我們將你的願景化為現實。團隊已準備好,助你打造真正有影響力的軟體。