
Chi Phí Inference LLM Bao Nhiêu? Phân Tích 4 Kịch Bản Với Con Số Thật
GPT-4 có giá $30 mỗi triệu token đầu vào hồi tháng 3 năm 2023. Ba năm sau, GPT-5.6 xử lý đúng một triệu token đó với $10. Claude Opus 4.5 ở mức $15. Còn sàn thấp nhất? Hai xu. Tức là khoảng cách 1.500 lần giữa lựa chọn rẻ nhất và đắt nhất cho cùng một đơn vị công việc. Chi phí inference LLM là hóa đơn định kỳ bạn trả mỗi khi một mô hình đã huấn luyện đọc đầu vào của bạn và sinh ra đầu ra, được mọi nhà cung cấp lớn định giá theo triệu token. Các mô hình giá rẻ chạy ở mức $0,02-$0,30 mỗi triệu token đầu vào. Các mô hình frontier tính $15-$75 cho cùng khối lượng đó. Khoảng cách này quan trọng, vì workload của bạn chứ không phải tham vọng của bạn mới quyết định bạn thực sự cần phân khúc nào.
Điểm chính:
- Mô hình giá rẻ có giá $0,02-$0,30 mỗi triệu token đầu vào; mô hình frontier chạy $15-$75 (tháng 7/2026).
- Token đầu ra đắt hơn token đầu vào 3-5 lần, vì quá trình sinh token chạy tuần tự chứ không song song.
- Một chatbot hỗ trợ 50.000 cuộc hội thoại tốn khoảng $9-$420/tháng tùy phân khúc mô hình.
- Giá inference đã giảm khoảng 10 lần mỗi năm; Gartner dự báo giảm thêm 90% vào năm 2030.
Chi Phí Inference LLM Mỗi Triệu Token Là Bao Nhiêu?
Giá inference LLM tuân theo cấu trúc ba phân khúc tính đến tháng 7 năm 2026. Các mô hình giá rẻ từ những nhà cung cấp như Google (Gemini 2.5 Flash) và các lựa chọn mã nguồn mở (Llama 4, Qwen 3) tính $0,02-$0,30 mỗi triệu token đầu vào. Các mô hình tầm trung (GPT-4.1, Claude Sonnet 4) nằm trong khoảng $0,55 đến $15. Các mô hình suy luận frontier (o3, Claude Opus 4.5) giữ mức $15-$75. Mọi nhà cung cấp đều công bố các mức giá này trên trang giá chính thức của họ (OpenAI, Anthropic), và PricePerToken.com theo dõi hơn 300 mô hình trong một bảng cập nhật trực tiếp.
Tính đến tháng 7 năm 2026, bạn có thể chạy một triệu token đầu vào với giá chỉ hai xu, hoặc trả bảy mươi lăm đô la cho đúng một triệu token đó trên một mô hình frontier.
| Phân khúc | Mô hình ví dụ | Input $/triệu token | Output $/triệu token | Input cache $/triệu | Phù hợp nhất cho |
|---|---|---|---|---|---|
| Giá rẻ | Gemini 2.5 Flash, Llama 4 Scout, Qwen 3 32B | $0,02-$0,30 | $0,06-$1,20 | $0,01-$0,15 | Phân loại khối lượng lớn, định tuyến |
| Tầm trung | GPT-4.1, Claude Sonnet 4, Gemini 2.5 Pro, GPT-5.6 | $0,55-$15 | $2,20-$60 | $0,28-$7,50 | RAG, sinh code, phân tích |
| Frontier | o3, Claude Opus 4.5 | $15-$75 | $60-$300 | $7,50-$37,50 | Suy luận phức tạp, nghiên cứu |
Giảm giá cho input cache cắt hóa đơn của bạn 50-90% với các prompt lặp lại (prompt caching cắt giảm chi phí đầu vào giải thích cơ chế). Để xem bảng 300 mô hình cập nhật trực tiếp với mức giá hiện tại của mọi nhà cung cấp, hãy xem bảng giá đầy đủ theo token của chúng tôi.
Điều Gì Thúc Đẩy Chi Phí Inference LLM? 4 Thành Phần
Hóa đơn inference của bạn chia thành bốn yếu tố chi phí: thời gian tính toán GPU cho mỗi token, bộ nhớ cho trọng số mô hình và KV cache, sự bất đối xứng input/output khiến việc sinh token đắt hơn việc đọc, và chi phí hạ tầng (điện, làm mát, mạng). Hiểu được thành phần nào chiếm ưu thế trong workload của bạn sẽ cho bạn biết tối ưu hóa ở đâu mới đáng tiền.
| Thành phần | Nó là gì | Tỷ trọng trong hóa đơn | Yếu tố làm thay đổi |
|---|---|---|---|
| Tính toán (thời gian GPU) | Số FLOP để xử lý mỗi token qua các lớp mô hình | 40-60% | Kích thước mô hình, kích thước batch, mức lượng tử hóa |
| Bộ nhớ (trọng số + KV cache) | VRAM chứa tham số mô hình và trạng thái attention | 20-35% | Độ dài context, số request đồng thời |
| Bất đối xứng input/output | Pha decode chạy tuần tự, mỗi lần một token | Tính sẵn vào giá output | Độ dài output, chiến lược sampling |
| Chi phí hạ tầng | Điện, làm mát, mạng, thời gian GPU nhàn rỗi | 10-20% | Vị trí trung tâm dữ liệu, tỷ lệ sử dụng |
Tính Toán: Thời Gian GPU Mỗi Token
Mọi token đều đi qua mọi lớp của mô hình. Một mô hình 70B tham số ở FP16 cần khoảng 140 GFLOP cho mỗi token. Lượng tử hóa xuống INT4 cắt con số đó còn ~35 GFLOP. Hướng dẫn benchmark inference của NVIDIA phân tích đầy đủ công thức TCO: khấu hao phần cứng cộng tiền điện cộng chi phí vận hành, chia cho số token phục vụ được.
Bộ Nhớ: Trọng Số Mô Hình + KV Cache
Một mô hình 70B ở FP16 chiếm ~140 GB VRAM chỉ riêng cho trọng số. KV cache tăng theo độ dài context và kích thước batch đồng thời. Ở context 128K với 32 request đồng thời, bạn có thể đốt thêm 80 GB nữa. Đây là lý do yêu cầu VRAM theo mô hình lại quan trọng đến vậy cho các quyết định tự host.
Bất Đối Xứng Input Và Output
Token đầu ra đắt hơn token đầu vào 3-5 lần vì mô hình sinh ra chúng lần lượt từng token một, theo thứ tự. Nó không thể song song hóa như cách nó đọc prompt của bạn.
Đây là phiên bản dễ hiểu: việc đọc prompt 2.000 token của bạn (pha "prefill") xử lý tất cả token đồng thời trên các nhân GPU. Việc sinh 500 token đầu ra (pha "decode") chạy mỗi bước một token, mỗi token phụ thuộc vào token trước đó. GPU phần lớn ngồi không chờ băng thông bộ nhớ giữa các bước. Chính thời gian nhàn rỗi đó là thứ bạn trả tiền với mức giá gấp 3-5 lần giá input.
Chi Phí Hạ Tầng
Điện, làm mát, mạng, và những chiếc GPU nằm không giữa các request. Tài liệu tối ưu hóa của Hugging Face trình bày cách continuous batching và speculative decoding vắt ra nhiều token hơn trên mỗi GPU-giờ từ cùng một phần cứng, qua đó cắt trực tiếp tỷ trọng chi phí hạ tầng này.
Chi Phí Inference LLM Cho 4 Workload Thực Tế Là Bao Nhiêu?
Một chatbot hỗ trợ điển hình tốn $9-$420/tháng, một pipeline RAG chạy $168-$3.360/tháng, một trợ lý code cho 200 lập trình viên tính $123-$2.078/tháng, và xử lý tài liệu hàng loạt nằm trong khoảng $240 đến $6.400/tháng. Mức chênh lệch gần như hoàn toàn phụ thuộc vào lựa chọn phân khúc mô hình. Chúng tôi dựng bốn kịch bản này từ khối lượng token trong các đợt triển khai cho khách hàng của mình, đối chiếu với các trang giá chính thức tháng 7 năm 2026. Mọi con số đô la bên dưới đều có thể tái tạo: giả định token đã nêu nhân với mức giá đã công bố. Đây là phân tích của chúng tôi, không phải tuyên bố của nhà cung cấp.
Chatbot Hỗ Trợ Khách Hàng: 50.000 Cuộc Hội Thoại/Tháng
Trung bình mỗi cuộc hội thoại: 800 token đầu vào (system prompt + tin nhắn người dùng + context truy xuất được), 400 token đầu ra. Khối lượng hàng tháng: 50.000 cuộc hội thoại = 40 triệu token đầu vào, 20 triệu token đầu ra.
- Lựa chọn giá rẻ (Gemini 2.5 Flash): 40 triệu × $0,075/triệu + 20 triệu × $0,30/triệu = $9/tháng. Rẻ đến mức gần như đáng ngờ.
- Lựa chọn tầm trung (Claude Sonnet 4): 40 triệu × $3/triệu + 20 triệu × $15/triệu = $420/tháng.
Với một bot hỗ trợ xử lý vé bậc 1, mô hình giá rẻ xử lý ổn 90% truy vấn. Hãy định tuyến 10% ca khó sang phân khúc tầm trung bằng một bộ phân loại.
Pipeline RAG: 10.000 Truy Vấn/Ngày
Trung bình mỗi truy vấn: 3.200 token đầu vào (các đoạn truy xuất + system prompt + câu hỏi người dùng), 600 token đầu ra. Hàng tháng: 300.000 truy vấn = 960 triệu token đầu vào, 180 triệu token đầu ra.
- Lựa chọn giá rẻ (Llama 4 Scout qua API): 960 triệu × $0,10/triệu + 180 triệu × $0,40/triệu = $168/tháng.
- Lựa chọn tầm trung (GPT-4.1): 960 triệu × $2/triệu + 180 triệu × $8/triệu = $3.360/tháng.
Workload RAG nặng về input, nên giảm giá input cache phát huy tác dụng rất mạnh ở đây. Với 70% prompt caching, phân khúc tầm trung giảm còn ~$2.100/tháng.
Trợ Lý Code: 200 Lập Trình Viên
Trung bình mỗi phiên: 4.500 token đầu vào (context tệp + cuộc hội thoại), 1.200 token đầu ra. Giả sử 15 request mỗi lập trình viên mỗi ngày, 22 ngày làm việc = 66.000 request/tháng = 297 triệu input, 79 triệu output.
- Lựa chọn giá rẻ (Qwen 3 32B): 297 triệu × $0,20/triệu + 79 triệu × $0,80/triệu = $123/tháng.
- Lựa chọn tầm trung (Claude Sonnet 4): 297 triệu × $3/triệu + 79 triệu × $15/triệu = $2.078/tháng.
Lập trình viên nhận ra khoảng cách chất lượng rất nhanh. Với code, phân khúc tầm trung thường là sàn. Mô hình giá rẻ dùng được cho gợi ý kiểu autocomplete nhưng chật vật với refactor đa tệp.
Xử Lý Tài Liệu Hàng Loạt: 1 Triệu Tài Liệu/Tháng
Trung bình mỗi tài liệu: 2.000 token đầu vào, 300 token đầu ra (trích xuất, phân loại, tóm tắt). Hàng tháng: 2 tỷ input, 300 triệu output.
- Lựa chọn giá rẻ (Gemini 2.5 Flash): 2 tỷ × $0,075/triệu + 300 triệu × $0,30/triệu = $240/tháng.
- Lựa chọn tầm trung (GPT-4.1): 2 tỷ × $2/triệu + 300 triệu × $8/triệu = $6.400/tháng.
Ở khối lượng này, khoảng cách giá 27 lần giữa các phân khúc là một khoản mục $6.160/tháng. Mô hình giá rẻ xử lý tốt việc trích xuất có cấu trúc. Để tính toán kích thước phần cứng nếu bạn cân nhắc tự host khối lượng này, hãy xem yêu cầu VRAM theo mô hình.
| Workload | Mô hình | Token/Request (Vào/Ra) | Request/Tháng | $/Tháng |
|---|---|---|---|---|
| Chatbot hỗ trợ | Gemini 2.5 Flash | 800 / 400 | 50K | $9 |
| Chatbot hỗ trợ | Claude Sonnet 4 | 800 / 400 | 50K | $420 |
| Pipeline RAG | Llama 4 Scout | 3.200 / 600 | 300K | $168 |
| Pipeline RAG | GPT-4.1 | 3.200 / 600 | 300K | $3.360 |
| Trợ lý code | Qwen 3 32B | 4.500 / 1.200 | 66K | $123 |
| Trợ lý code | Claude Sonnet 4 | 4.500 / 1.200 | 66K | $2.078 |
| Xử lý tài liệu hàng loạt | Gemini 2.5 Flash | 2.000 / 300 | 1M | $240 |
| Xử lý tài liệu hàng loạt | GPT-4.1 | 2.000 / 300 | 1M | $6.400 |
def monthly_cost(input_tokens, output_tokens, requests, price_in, price_out):
"""Estimate monthly LLM inference cost.
Args:
input_tokens: avg input tokens per request
output_tokens: avg output tokens per request
requests: monthly request volume
price_in: $/M input tokens
price_out: $/M output tokens
"""
total_in = input_tokens * requests / 1_000_000
total_out = output_tokens * requests / 1_000_000
return (total_in * price_in) + (total_out * price_out)
# Example: support chatbot on Claude Sonnet 4
cost = monthly_cost(
input_tokens=800,
output_tokens=400,
requests=50_000,
price_in=3.00,
price_out=15.00
)
print(f"${cost:,.2f}/month") # $420.00/monthAPI Hay Tự Host: Khi Nào Mỗi Bên Thắng?
API thắng khi ở dưới ~20.000 request/ngày hoặc khi đội ngũ của bạn thiếu kinh nghiệm về hạ tầng ML. Tự host thắng khi vượt 200.000 request/ngày với hiệu suất sử dụng GPU duy trì trên 50%. Điểm hòa vốn, theo phân tích của Introl, nằm quanh mức 50.000-80.000 request/ngày cho một mô hình hạng 70B trên một node H100 duy nhất. Dưới ngưỡng đó, hiệu quả đa thuê bao của nhà cung cấp API đánh bại bài toán phần cứng đơn thuê bao của bạn.
| Mức khối lượng | API $/Tháng | Tự Host $/Tháng (GPU + Vận hành) | Bên thắng | Lý do |
|---|---|---|---|---|
| Thấp: 2K req/ngày | $150-$400 | $2.800-$4.500 | API | GPU nhàn rỗi 85% thời gian |
| Trung bình: 20K req/ngày | $1.500-$4.000 | $3.200-$5.000 | API (vừa đủ) | Hiệu suất đạt ~40%, vẫn dưới điểm hòa vốn |
| Cao: 200K req/ngày | $15.000-$40.000 | $5.500-$8.000 | Tự host | Hiệu suất 70%+ hoàn vốn phần cứng nhanh |
Khi Nào API Thắng
Bạn ra mắt trong vài ngày chứ không phải vài tuần. Không phải trả lương kỹ sư ML ($180.000-$250.000/năm), không phải trực on-call cho sự cố GPU, không phải lập kế hoạch công suất. Với hầu hết các đội dưới 50 kỹ sư, API là mặc định đúng. Chấm hết.
Khi Nào Tự Host Thắng
Bạn đã vượt 200.000 request/ngày, workload của bạn có thể dự đoán được, và bạn đã có sẵn nhân sự hạ tầng ML. Các mô hình mã nguồn mở (Llama 4, Qwen 3, Mistral) chạy trên phần cứng của bạn với chi phí tiền điện cộng khấu hao. Benchmark vLLM và SGLang cho thấy chênh lệch throughput 15-30% tùy hình dạng workload, điều rất quan trọng ở quy mô này.
Con Số Hòa Vốn
Tự host chỉ thắng khi hiệu suất GPU duy trì trên ~50%. Dưới mức đó, bạn đang trả tiền cho silicon nằm không. Chi phí con người ẩn (thời gian kỹ sư ML, on-call, cập nhật mô hình, vá bảo mật) mới là lý do thực sự khiến hầu hết các đội ở lại với API ngay cả khi bài toán GPU thô trông có vẻ có lợi. Nếu bạn vẫn tự host, triển khai mô hình trên Modal loại bỏ lớp quản lý hạ tầng trong khi vẫn giữ chi phí mỗi token dưới mức giá API.
Những Chi Phí Ẩn Mà Không Ai Dự Toán
Chi tiêu token thô chỉ chiếm 60-80% hóa đơn thực của bạn. Phần còn lại trốn trong sáu khoản mục không bao giờ xuất hiện trong máy tính báo giá. Hãy dự trù thêm 20-40% trên ước tính token của bạn để trang trải chúng.
- Công cụ giám sát và observability: $200-$1.500/tháng. Bảng điều khiển mức dùng token, theo dõi độ trễ, phân bổ chi phí theo từng tính năng. Một stack observability LLM tự hoàn vốn ngay lần đầu bạn phát hiện một regression của prompt trước khi nó đốt cháy ngân sách của bạn.
- Retry và chạy lại khi lỗi: 3-8% số request thất bại hoặc cần thử lại (timeout, giới hạn rate, output sai định dạng). Tức là 3-8% hóa đơn token của bạn bị tiêu mà không tạo ra thứ gì.
- Giờ lặp lại prompt-engineering: 20-60 giờ mỗi quý với chi phí kỹ sư đầy đủ $100-$200/giờ. Mỗi lần chỉnh prompt lại chạy lại các batch kiểm thử.
- Eval và kiểm thử regression: $100-$800/tháng tiền token cho các bộ eval tự động. Bạn đang trả tiền để mô hình tự chấm điểm chính nó.
- Dự phòng đa khu vực: chi phí hạ tầng gấp 1,5-2 lần nếu bạn cần failover giữa các khu vực vì độ trễ hoặc tuân thủ.
- Phạt độ trễ cold-start: Các triển khai GPU serverless (Modal, AWS Lambda) tính phí thời gian nhàn rỗi. Cold start cộng thêm 2-8 giây và tính tiền cả phần khởi động.
Quy tắc kinh nghiệm: nhân ước tính token thô của bạn với 1,3 để có ngân sách thực tế. Nhân với 1,4 nếu bạn ở ngành bị quản lý với chi phí tuân thủ.
Vì Sao Chi Phí Inference LLM Ngày Càng Rẻ Hơn?
Giá inference LLM đã giảm khoảng 10 lần mỗi năm kể từ 2023. Một workload từng tốn $1.000/tháng vào năm 2024 nay chỉ còn gần $100. Ba động lực thúc đẩy điều này: cải tiến phần cứng (NVIDIA Blackwell FP4, Google TPU v6), áp lực cạnh tranh (DeepSeek, các mô hình mã nguồn mở buộc các bên lao vào chiến tranh giá), và tối ưu phần mềm (speculative decoding, continuous batching, lượng tử hóa). Gartner dự báo chi phí inference sẽ giảm thêm 90% vào năm 2030, dù đó là dự báo chứ không phải cam kết.
Theo dõi giá của Epoch AI ghi nhận đà giảm này bằng các điểm dữ liệu cứng. Phân tích "LLMflation" của a16z đã đặt ra thuật ngữ này và định khung các hàm ý kinh tế: inference đang giảm phát nhanh hơn bất kỳ hạng mục tính toán nào trước đây.
Chi Phí Huấn Luyện Và Chi Phí Inference
Huấn luyện một mô hình frontier tốn $50 triệu-$200 triệu (một lần). Inference cho chính mô hình đó, trên toàn bộ người dùng, tốn $5 triệu-$50 triệu mỗi năm tùy quy mô. Với hầu hết các đội, tỷ lệ là 10-100 lần: huấn luyện đắt gấp 10-100 lần chi phí inference của một năm. Nhưng huấn luyện là chi phí vốn một lần. Inference là hóa đơn vận hành định kỳ, tăng dồn theo tốc độ tăng người dùng. Bạn không trả tiền huấn luyện trừ khi bạn đang xây một mô hình nền tảng. Bạn trả tiền inference mỗi ngày.
Khoản Mục Năng Lượng
Một chiếc NVIDIA H100 tiêu thụ ~700W khi tải nặng. Ở mức $0,10/kWh (trung bình tại Mỹ), tức là $0,07 mỗi GPU-giờ. Một mô hình 70B trên một chiếc H100 duy nhất sinh ra khoảng 2.000 token đầu ra mỗi giây khi chạy batch. Trong một giờ: 7,2 triệu token. Chi phí điện mỗi triệu token đầu ra: ~$0,01. Đây là tính toán của chúng tôi, được ghi rõ như vậy. Năng lượng chiếm 1-3% hóa đơn API nhưng chiếm 8-15% TCO tự host. Nó đáng kể hơn nếu bạn tự chạy GPU của mình ở khu vực giá điện cao (Đức ở mức $0,30/kWh khiến con số này tăng gấp ba).
Kết luận thực tế: giá đang giảm đủ nhanh để một cam kết 12 tháng với một phân khúc mô hình cụ thể trở nên rủi ro. Hãy đánh giá lại hàng quý. Bài 12 cách cắt giảm hóa đơn LLM trình bày các bước chiến thuật bạn có thể làm ngay bây giờ trong khi xu hướng vĩ mô gánh phần việc nặng.
Bạn Ước Tính Chi Phí Inference Của Chính Mình Thế Nào?
Hãy ước tính chi phí inference LLM hàng tháng của bạn theo bốn bước: đếm số token mỗi request, nhân với khối lượng hàng tháng, áp giá phân khúc, rồi cộng thêm 20-40% chi phí phụ. Theo kinh nghiệm lập ngân sách inference cho khách hàng của chúng tôi, hầu hết các đội bỏ qua bước bốn và tự hỏi vì sao hóa đơn thực tế vượt ước tính đến một phần ba. Đây là quy trình chúng tôi dùng.
- Đếm số token mỗi request. Ghi log số token đầu vào trung bình (system prompt + context + tin nhắn người dùng) và token đầu ra (phản hồi của mô hình) trên 100+ request thực. Đừng đoán. Hãy đo.
- Nhân với khối lượng hàng tháng. Số request/ngày × 30 = request hàng tháng. Nhân với số token mỗi request của bạn.
- Áp giá phân khúc. Nhân tổng token đầu vào với mức giá $/triệu input của mô hình. Làm tương tự với output. Cộng chúng lại.
- Cộng thêm 20-40% chi phí phụ. Retry, eval, lặp prompt, giám sát. Đây mới là con số đưa vào ngân sách của bạn, không phải bước 3.
def estimate_monthly_budget(avg_input_tokens, avg_output_tokens,
requests_per_day, price_in, price_out,
overhead_pct=0.30):
"""Full monthly budget estimate with overhead."""
monthly_requests = requests_per_day * 30
raw_cost = monthly_cost(
avg_input_tokens, avg_output_tokens,
monthly_requests, price_in, price_out
)
return raw_cost * (1 + overhead_pct)
# RAG pipeline: 10K queries/day on GPT-4.1
budget = estimate_monthly_budget(
avg_input_tokens=3200,
avg_output_tokens=600,
requests_per_day=10_000,
price_in=2.00,
price_out=8.00,
overhead_pct=0.30
)
print(f"${budget:,.0f}/month") # $4,368/monthKhi đã biết con số của mình, các công cụ LLM gateway sẽ định tuyến lưu lượng sang mô hình rẻ nhất đạt chuẩn chất lượng của bạn. Một gateway có khả năng chọn mô hình theo từng request có thể cắt chi phí hỗn hợp của bạn 30-50% mà không cần động vào prompt.
Về Tác Giả
Mert Batur là Đồng sáng lập Techsy.io, nơi đội ngũ triển khai các AI agent, hệ thống tự động hóa và pipeline voice/SDR cho khách hàng B2B. Anh viết về stack công cụ LLM mà đội Techsy thực sự dùng trong production. Kết nối trên LinkedIn.
Câu Hỏi Thường Gặp
Inference LLM có đắt không?
Tùy vào quy mô và lựa chọn mô hình. Một triệu token đầu vào có giá $0,02 trên Gemini 2.5 Flash hoặc $75 trên một mô hình suy luận frontier. Với một ứng dụng nhỏ xử lý 10.000 request/ngày, hãy tính $50-$400/tháng. Với workload doanh nghiệp ở mức hơn 1 triệu request/ngày, ngân sách chạy $5.000-$40.000/tháng. Chi phí mỗi đơn vị thì thấp; chính khối lượng mới làm nó đội lên.
1 triệu token trong LLM là bao nhiêu?
Một triệu token tương đương khoảng 750.000 từ, tức khoảng 10 cuốn tiểu thuyết trọn vẹn. Vào tháng 7 năm 2026, xử lý 1 triệu token đầu vào tốn $0,02 (phân khúc giá rẻ) đến $75 (phân khúc frontier). Token đầu ra cho cùng khối lượng đó chạy $0,06 đến $300. Hầu hết workload production nằm ở phân khúc tầm trung: $2-$15 mỗi triệu token đầu vào.
Vì sao inference AI lại đắt đến vậy?
Inference đòi hỏi chạy mọi token qua hàng tỷ tham số mô hình trên những chiếc GPU có giá $25.000-$40.000 mỗi chiếc. Pha decode sinh token tuần tự, khiến các nhân GPU nằm không giữa các bước. Bạn đang trả tiền cho phần cứng chuyên dụng, tiền điện, làm mát, và đội kỹ sư của nhà cung cấp giữ cho stack phục vụ chạy 24/7.
Chi phí inference AI có đang giảm không?
Có, khoảng 10 lần mỗi năm kể từ 2023. GPT-4 ra mắt ở mức $30/$60 mỗi triệu token (input/output). Năng lực tương đương giờ có giá $2-$10. Dữ liệu của Epoch AI xác nhận quỹ đạo này trên mọi nhà cung cấp. Gartner dự báo giảm thêm 90% vào năm 2030, được thúc đẩy bởi cải tiến phần cứng và áp lực cạnh tranh từ các mô hình mã nguồn mở.
Chi phí inference LLM năm 2026 là bao nhiêu?
Mô hình giá rẻ: $0,02-$0,30 mỗi triệu token đầu vào. Tầm trung: $0,55-$15. Frontier: $15-$75. Một workload production điển hình (chatbot hỗ trợ, pipeline RAG, hoặc trợ lý code) tốn $150-$4.000/tháng trên các mô hình tầm trung. Mô hình giá rẻ xử lý các tác vụ khối lượng lớn, độ phức tạp thấp với chi phí thấp hơn 10-30 lần.
Khác biệt giữa chi phí huấn luyện và chi phí inference là gì?
Huấn luyện là chi phí một lần để dạy một mô hình từ đầu: $50 triệu-$200 triệu cho một mô hình frontier, cần hàng nghìn GPU trong nhiều tháng. Inference là chi phí định kỳ của việc dùng mô hình đã huấn luyện đó: chạy đầu vào qua nó để lấy đầu ra, tính phí theo token. Với hầu hết các đội, inference là hóa đơn duy nhất họ trả. Huấn luyện dành cho các công ty xây mô hình nền tảng.
Tôi tính chi phí inference LLM cho ứng dụng của mình thế nào?
Nhân số token đầu vào trung bình mỗi request với khối lượng request hàng tháng của bạn, rồi với mức giá $/triệu input của mô hình. Làm tương tự với token đầu ra. Cộng cả hai. Cộng thêm 30% cho retry, eval và chi phí giám sát. Các đoạn Python trong bài này tự động hóa phép toán. Hãy đo số token thực thay vì đoán; log từ 100+ request cho ra mức trung bình đáng tin cậy.
Token đầu ra có đắt hơn token đầu vào không?
Có, thường đắt hơn 3-5 lần. Xử lý input (prefill) song song hóa trên tất cả token cùng lúc, tận dụng tối đa các nhân GPU. Sinh output (decode) tạo ra mỗi lần một token, mỗi token phụ thuộc vào token trước. GPU chờ băng thông bộ nhớ giữa các bước. Nhà cung cấp định giá output cao hơn để phản ánh hiệu quả phần cứng thấp hơn này.
Inference tự host có rẻ hơn dùng API không?
Chỉ khi vượt ~200.000 request/ngày với hiệu suất GPU duy trì trên 50%. Dưới mức đó, hiệu quả đa thuê bao của nhà cung cấp API đánh bại phần cứng đơn thuê bao của bạn. Tự host cũng cộng thêm chi phí ẩn: lương kỹ sư ML ($180.000-$250.000/năm), ca trực on-call, cập nhật mô hình và vá bảo mật. Hầu hết các đội dưới 50 kỹ sư nên ở lại với API.
Inference LLM có tốn nhiều năng lượng không?
Một chiếc GPU H100 tiêu thụ ~700W khi tải nặng. Ở mức $0,10/kWh, tức là $0,07/GPU-giờ, quy ra khoảng $0,01 mỗi triệu token đầu ra cho một mô hình 70B. Năng lượng chiếm 1-3% hóa đơn API nhưng chiếm 8-15% TCO tự host. Ở các khu vực giá điện cao (Đức, $0,30/kWh), tỷ trọng năng lượng tăng gấp ba và ảnh hưởng rõ rệt đến bài toán kinh tế tự host.
Kết Luận
Bốn con số cần nhớ: $0,02 (sàn giá rẻ mỗi triệu token đầu vào), 3-5 lần (mức chênh của output so với input), 20-40% (chi phí phụ cộng thêm trên phép toán token thô), và 10 lần (mức giảm giá hàng năm kể từ 2023). Hóa đơn thực của bạn phụ thuộc vào khối lượng, phân khúc mô hình, và mức độ bạn cache, batch và định tuyến lưu lượng quyết liệt đến đâu.
Tại Techsy, đội ngũ của chúng tôi lập ngân sách inference và chọn phân khúc mô hình cho các khách hàng B2B đang chạy workload LLM trong production. Nếu bạn muốn có thêm một góc nhìn thứ hai về mô hình chi phí của mình, hãy nhận tư vấn miễn phí.