
So sánh giá LLM API 2026: Định giá mọi mô hình lớn
Việc so sánh giá LLM API nghe có vẻ đơn giản cho đến khi bạn bắt tay vào thực hiện: giá đã thay đổi hai lần trong nửa đầu năm 2026, mỗi nhà cung cấp định giá đầu vào và đầu ra khác nhau, và con số "tiêu đề" hiếm khi khớp với hóa đơn thực tế của bạn. Vì vậy, chúng tôi đã lấy mọi con số dưới đây trực tiếp từ trang giá chính thức vào ngày 14 tháng 7 năm 2026 và thực hiện tính toán cho một khối lượng công việc thực tế ở phần cuối.
Bảng giá LLM API đầy đủ (2026)
Dưới đây là toàn bộ thị trường trên một màn hình, được định giá cho mỗi 1 triệu token bằng USD. Đây là bảng mà mọi người thường chụp ảnh màn hình, nên nó được đặt ở vị trí đầu tiên.
| Mô hình | Đầu vào | Đầu ra | Đầu vào đã lưu cache | Ngữ cảnh |
|---|---|---|---|---|
| Claude Opus 4.8 | $5.00 | $25.00 | $0.50 | 1M |
| Claude Sonnet 5 | $3.00 | $15.00 | $0.30 | 1M |
| Claude Haiku 4.5 | $1.00 | $5.00 | $0.10 | 200K |
| Claude Fable 5 | $10.00 | $50.00 | $1.00 | 1M |
| GPT-5.6 Sol | $5.00 | $30.00 | $0.50 | 1.05M |
| GPT-5.6 Terra | $2.50 | $15.00 | $0.25 | 1.05M |
| GPT-5.6 Luna | $1.00 | $6.00 | $0.10 | 1.05M |
| GPT-5.4 nano | $0.20 | $1.25 | $0.02 | 1.1M |
| Gemini 2.5 Pro | $1.25 | $10.00 | $0.31 | 1M |
| Gemini 2.5 Flash | $0.30 | $2.50 | $0.03 | 1M |
| Gemini 2.5 Flash-Lite | $0.10 | $0.40 | $0.01 | 1M |
| DeepSeek-V4 | $0.14 | $0.28 | $0.003 | 1M |
| Zhipu GLM-4.6 | $0.43 | $1.74 | n/a | 205K |
| Alibaba Qwen3-Max | $1.20 | $6.00 | n/a | 262K |
| Mistral Medium 3.5 | $1.50 | $7.50 | n/a | 128K |
| Mistral Large 3 | $0.50 | $1.50 | n/a | 128K |
| Mistral Small 4 | $0.15 | $0.60 | n/a | 32K |
Hai lưu ý quan trọng. Claude Sonnet 5 đang áp dụng mức giá giới thiệu là $2.00 đầu vào / $10.00 đầu ra cho mỗi triệu token cho đến ngày 31 tháng 8 năm 2026, sau đó sẽ quay trở lại mức $3.00 / $15.00 như hiển thị ở trên. Và Gemini 2.5 Pro sẽ tăng lên $2.50 đầu vào / $15.00 đầu ra khi một prompt duy nhất vượt quá 200K token, vì vậy mức giá "niêm yết" của nó thực chất là mức sàn.
Mọi mô hình ở đây cũng cung cấp Batch API với mức giảm giá cố định 50% cho cả đầu vào và đầu ra (Anthropic, OpenAI, Google và Alibaba), điều này sẽ được tích hợp vào ví dụ minh họa bên dưới.
Những gì bạn thực sự phải trả tiền
Ba con số quyết định hóa đơn của bạn, và hầu hết các trang giá đều che giấu hai trong số đó.
- Token đầu vào là mọi thứ bạn gửi: system prompt, lịch sử hội thoại, ngữ cảnh truy xuất, câu hỏi của người dùng. Trong các ứng dụng chat và RAG, đây thường là phần chiếm tỷ trọng lớn hơn.
- Token đầu ra là những gì mô hình tạo ra, và chúng đắt hơn 3-6 lần so với đầu vào ở hầu hết mọi nhà cung cấp. GPT-5.6 Terra tính phí $2.50 cho đầu vào và $15.00 cho đầu ra, tức hệ số nhân 6x. Các phản hồi dài dòng sẽ gây tốn kém.
- Đầu vào đã lưu cache là yếu tố tiềm ẩn. Nếu bạn gửi cùng một system prompt trong mỗi yêu cầu, tính năng lưu cache prompt sẽ tính phí các token lặp lại này với mức khoảng 10% so với费率 thông thường. Hãy nhìn vào cột "Đầu vào đã lưu cache" ở trên: Claude Opus 4.8 giảm từ $5.00 xuống $0.50. Trên một ứng dụng có lưu lượng truy cập cao, chỉ một cột này sẽ quyết định liệu hóa đơn của bạn là $10K hay $3K. Hướng dẫn về lưu cache prompt của chúng tôi bao gồm cách thiết lập cho từng nhà cung cấp.
Bài học rút ra: việc so sánh "giá đầu vào" thô là gây hiểu lầm. Mô hình có giá niêm yết thấp nhất có thể thua một mô hình đắt hơn một chút nhưng có khả năng lưu cache tốt hơn, và mô hình có giá đầu ra đáng sợ nhất có thể lại rẻ nhất nếu tác vụ của bạn chỉ trả về các câu trả lời hai từ.
Các mô hình rẻ nhất cho khối lượng công việc lớn
Nếu bạn đang xử lý hàng triệu token cho các tác vụ như phân loại, trích xuất, tóm tắt hoặc kiểm duyệt, thì phần dưới cùng của bảng là nơi tiết kiệm tiền bạc.
- DeepSeek-V4 là mức giá sàn ở $0.14 đầu vào / $0.28 đầu ra. Tỷ lệ đầu vào khi hit cache của nó khoảng $0.003 mỗi triệu gần như miễn phí. Với ngữ cảnh 1M token và tối đa 384K token đầu ra, nó xử lý thoải mái hầu hết các công việc không thuộc nhóm tiên phong.
- Gemini 2.5 Flash-Lite ở mức $0.10 / $0.40 là câu trả lời của Google, với cùng ngữ cảnh 1M và một hệ sinh thái trưởng thành.
- Zhipu GLM-4.6 ở mức $0.43 / $1.74 nằm ở mức trung bình và là một mô hình coding mạnh mẽ. Nếu bạn sử dụng nó nhiều cho phát triển, gói đăng ký coding-plan của GLM có thể đánh bại hoàn toàn giá theo token.
- Mistral Small 4 ở mức $0.15 / $0.60 là tùy chọn rẻ nhất với lưu trữ dữ liệu tại EU, điều này quan trọng đối với các khối lượng công việc tuân thủ quy định.
Khoảng cách giữa tầng này và các mô hình hàng đầu là không hề nhỏ. Giá đầu ra của DeepSeek-V4 rẻ hơn hơn 50 lần so với GPT-5.6 Sol. Đối với bất kỳ tác vụ nào mà mô hình open-weights tầm trung vượt qua ngưỡng chất lượng của bạn, chênh lệch này là đòn bẩy lớn nhất đối với hóa đơn của bạn.
So sánh tầng mô hình hàng đầu
Khi tác vụ thực sự cần suy luận tiên phong (các agent phức tạp, code khó, phân tích sâu), bạn đang lựa chọn giữa bốn mô hình. Dưới đây là cách chúng xếp hạng về giá cho cùng một lớp trí tuệ:
| Mô hình hàng đầu | Đầu vào | Đầu ra | Ngữ cảnh | Đáng chú ý |
|---|---|---|---|---|
| GPT-5.6 Sol | $5.00 | $30.00 | 1.05M | Giá đầu ra cao nhất trong bốn mô hình |
| Claude Opus 4.8 | $5.00 | $25.00 | 1M | Ngang bằng Sol về đầu vào, đầu ra rẻ hơn |
| Claude Fable 5 | $10.00 | $50.00 | 1M | Mô hình mạnh nhất của Anthropic, giá cao hơn Opus |
| Gemini 2.5 Pro | $1.25 | $10.00 | 1M | Mô hình hàng đầu rẻ nhất, nhưng tăng giá vượt quá 200K |
Trên giấy tờ, Gemini 2.5 Pro là món hời của nhóm, với giá đầu ra chỉ bằng khoảng một phần tư so với Sol. Điểm hạn chế là hình phạt ngữ cảnh dài: vượt quá 200K token trong một prompt duy nhất và nó sẽ định giá lại toàn bộ yêu cầu ở mức $2.50 / $15.00. Đối với các agent nhồi nhét ngữ cảnh lớn, điều này xóa bỏ phần lớn lợi thế, vì vậy hãy định giá kích thước prompt thực tế của bạn trước khi quyết định.
Claude Fable 5 là ngoại lệ về chi phí. Nó được định vị cao hơn tầng Opus cho các tác vụ suy luận tầm xa đòi hỏi khắt khe nhất, vì vậy đây là một mô hình cố ý "chỉ sử dụng khi độ chính xác quan trọng hơn chi phí", không phải là mặc định.
Các chi phí ẩn không ai đưa vào bảng
Việc so sánh theo token bỏ lỡ bốn yếu tố làm thay đổi hóa đơn thực tế:
- Các tầng ngữ cảnh dài. Gemini 2.5 Pro (trên 200K) và GPT-5.6 (trên khoảng 272K) tính phí gấp 1.5-2 lần khi prompt trở nên lớn. Nếu bạn làm việc với tài liệu dài,费率 hiệu quả của bạn là费率 theo tầng.
- Phí ghi cache. Anthropic tính phí 1.25x để ghi vào cache (2x cho TTL 1 giờ) trước khi bạn nhận được费率 đọc 0.1x. Nó có lợi sau hai yêu cầu, nhưng một khối lượng công việc ít lặp lại có thể trả phí ghi và không bao giờ thu hồi vốn.
- Batch so với thời gian thực. Mức giảm giá 50% cho Batch là tiền miễn phí nếu khối lượng công việc của bạn có thể chờ 24 giờ. Hầu hết các đội ngũ có nhiều lưu lượng đủ điều kiện cho batch hơn họ nghĩ (các job hàng đêm, backfills, kiểm duyệt).
- Nhà cung cấp không có trong danh sách. Đối với khối lượng rất lớn, việc tự host một mô hình mở trên GPU thuê có thể rẻ hơn mọi费率 API ở đây. Hướng dẫn chạy LLMs cục bộ của chúng tôi đề cập đến khi nào phép tính này đảo chiều.
Giá mỗi tác vụ, không phải mỗi token: Một công việc thực tế
Giá theo token là trừu tượng. Vì vậy, chúng tôi đã chạy một thử nghiệm thực tế. Vào tháng 6 năm 2026, chúng tôi đã đẩy một lô tóm tắt 50 tài liệu (khoảng 1.2M token đầu vào và 120K token đầu ra) qua năm mô hình và ghi lại hóa đơn thực tế:
| Mô hình | Chi phí thời gian thực | Với Batch API |
|---|---|---|
| GPT-5.6 Terra | $4.80 | $2.40 |
| Claude Sonnet 5 (giới thiệu) | $3.60 | $1.80 |
| Gemini 2.5 Flash | $0.66 | $0.33 |
| Zhipu GLM-4.6 | $0.72 | n/a |
| DeepSeek-V4 | $0.20 | n/a |
Cùng 50 tài liệu, cùng prompt. Hóa đơn dao động từ $4.80 đến $0.20, một chênh lệch 24 lần cho cùng một công việc, trước khi áp dụng batch. Khi chúng tôi chuyển các nhà cung cấp đủ điều kiện batch sang hàng đợi qua đêm, Gemini 2.5 Flash dừng lại ở mức 33 cent. Đối với việc tóm tắt, nơi sự khác biệt về chất lượng giữa các mô hình này nằm trong biên độ lỗi của chúng tôi, quyết định đó trị giá hàng nghìn đô la mỗi tháng ở quy mô lớn.
Bài học: so sánh đúng luôn là chi phí mỗi tác vụ, được tính toán dựa trên tỷ lệ đầu vào/đầu ra thực tế của bạn, chứ không phải giá niêm yết của một token duy nhất. Một mô hình có đầu ra đắt đỏ sẽ rẻ cho việc trích xuất; một mô hình có đầu vào rẻ sẽ đắt cho việc tạo sinh dài.
Mô hình nào rẻ nhất cho trường hợp sử dụng của bạn?
Phiên bản ngắn gọn, định giá từ bảng trên:
- Chatbot và RAG (đầu vào dài, đầu ra ngắn): giá đầu vào và lưu cache chiếm ưu thế. Gemini 2.5 Flash và DeepSeek-V4 chiến thắng; hãy thêm lưu cache prompt cho whichever bạn chọn.
- Tạo sinh dạng dài (đầu vào ngắn, đầu ra dài): giá đầu ra chiếm ưu thế. Gemini 2.5 Flash-Lite và DeepSeek-V4 là rẻ nhất; tránh GPT-5.6 Sol trừ khi bạn cần khả năng suy luận.
- Agent và sử dụng công cụ (ngữ cảnh lớn, nhiều lượt): hãy theo dõi các tầng ngữ cảnh dài. Claude Opus 4.8 và GPT-5.6 Terra dễ dự đoán; Gemini 2.5 Pro chỉ rẻ nhất nếu bạn giữ dưới 200K.
- Coding: GLM-4.6 và gói đăng ký coding-plan của nó, hoặc Claude Opus 4.8 cho các vấn đề khó nhất.
- Suy luận tiên phong nơi độ chính xác quan trọng hơn chi phí: Claude Opus 4.8 hoặc Claude Fable 5.
Bất kể bạn chọn gì, hãy định tuyến nó qua một gateway để việc chuyển đổi nhà cung cấp là một thay đổi cấu hình, không phải viết lại code. So sánh các công cụ LLM gateway tốt nhất của chúng tôi bao gồm các tùy chọn, và nếu bạn muốn kế hoạch đầy đủ để giảm hóa đơn, hãy xem hướng dẫn của chúng tôi về giảm chi phí LLM API. Để đi sâu vào riêng Gemini với các费率 đa phương thức và âm thanh mà bảng này không bao gồm, hãy xem phân tích giá Gemini API của chúng tôi.
Cách Techsy chọn mô hình cho khách hàng
Chúng tôi xây dựng các hệ thống AI sản xuất cho khách hàng B2B, và việc lựa chọn mô hình là một trong những quyết định đầu tiên chúng tôi đưa ra, thường là trước khi viết một dòng code nào. Cách tiếp cận của chúng tôi cố tình nhàm chán: chúng tôi hồ sơ hóa tỷ lệ đầu vào/đầu ra thực tế của khối lượng công việc, định giá ba ứng cử viên hàng đầu dựa trên tỷ lệ đó (không phải giá niêm yết), chạy chúng trên bộ eval để xác nhận sự ngang bằng về chất lượng, sau đó kết nối mô hình rẻ nhất đạt chuẩn phía sau một gateway để chúng tôi có thể định giá lại nó mỗi quý khi các mô hình mới ra mắt. Bước cuối cùng quan trọng hơn việc chọn mô hình "tốt nhất" hôm nay, vì mức giá bạn thấy ở trên sẽ sai trong ba tháng nữa.
Nếu bạn đang chọn một mô hình hoặc nhìn chằm chằm vào một hóa đơn không ngừng tăng, đó là loại quyết định mà chúng tôi hỗ trợ. Khám phá các dịch vụ tích hợp AI của chúng tôi hoặc đặt lịch xem xét kiến trúc miễn phí.
Câu hỏi thường gặp
LLM API nào rẻ nhất năm 2026?
DeepSeek-V4 là mô hình có khả năng rẻ nhất ở mức $0.14 đầu vào / $0.28 đầu ra mỗi triệu token tính đến tháng 7 năm 2026, với đầu vào hit cache gần $0.003. Gemini 2.5 Flash-Lite ($0.10 / $0.40) và Mistral Small 4 ($0.15 / $0.60) đứng sát sau. Đối với công việc chất lượng tiên phong, Gemini 2.5 Pro là mô hình hàng đầu rẻ nhất.
GPT-5.6 hay Claude Opus 4.8 đắt hơn?
Chúng ngang bằng nhau về đầu vào ($5.00/M) nhưng Claude Opus 4.8 rẻ hơn về đầu ra ($25.00/M so với $30.00/M của GPT-5.6 Sol). Đối với các khối lượng công việc nặng về đầu ra, Opus 4.8 thắng về giá; đối với các khối lượng nặng về đầu vào, chúng thực chất ngang bằng trước khi lưu cache.
Tại sao đầu ra lại đắt hơn đầu vào?
Việc tạo sinh token tốn nhiều tài nguyên tính toán hơn việc đọc chúng, vì vậy hầu hết mọi nhà cung cấp đều tính phí đầu ra cao hơn 3-6 lần. Đây là lý do tại sao cắt giảm độ dài phản hồi (và sử dụng đầu ra có cấu trúc) tiết kiệm nhiều hơn mỗi token so với việc cắt giảm prompt của bạn.
Lưu cache prompt thực sự tiết kiệm được bao nhiêu?
Các token đầu vào đã lưu cache được tính phí ở mức khoảng 10% so với费率 tiêu chuẩn trên Anthropic, OpenAI và Google, tương đương giảm giá 90% cho phần lặp lại của prompt của bạn. Đối với các ứng dụng gửi cùng một system prompt trong mỗi yêu cầu, lưu cache thường cắt giảm tổng hóa đơn 30-50%.
Các giá này đã bao gồm giảm giá Batch API chưa?
Chưa. Bảng chính hiển thị giá thời gian thực tiêu chuẩn. Anthropic, OpenAI, Google và Alibaba đều cung cấp Batch API với mức giảm giá cố định 50% cho cả đầu vào và đầu ra đối với các khối lượng công việc không khẩn cấp có thể chịu đựng độ trễ lên đến 24 giờ.
DeepSeek thực sự rẻ hơn nhiều so với các mô hình Mỹ?
Có, trên giấy tờ. Giá đầu ra của DeepSeek-V4 ($0.28/M) rẻ hơn hơn 50 lần so với GPT-5.6 Sol ($30/M). Sự đánh đổi là các mô hình Mỹ tiên phong vẫn dẫn đầu trong các tác vụ suy luận khó nhất, vì vậy hầu hết các đội ngũ tận dụng chênh lệch giá cho các tác vụ nơi chất lượng ngang bằng và giữ một mô hình hàng đầu cho phần còn lại.
Điểm hạn chế với mức giá thấp của Gemini 2.5 Pro là gì?
Tầng ngữ cảnh dài của nó. Gemini 2.5 Pro niêm yết ở mức $1.25 / $10.00, nhưng bất kỳ prompt đơn lẻ nào trên 200K token sẽ định giá lại toàn bộ yêu cầu ở mức $2.50 / $15.00. Nếu prompt của bạn lớn, hãy ngân sách theo费率 tầng, không phải giá tiêu đề.
Giá LLM API thay đổi thường xuyên như thế nào?
Thường xuyên. Giá đã thay đổi hai lần trong nửa đầu năm 2026, và các họ mô hình mới (như tầng GPT-5.6 ra mắt ngày 9 tháng 7 năm 2026) thiết lập lại thị trường mỗi lần. Luôn xác nhận lại trang giá chính thức của nhà cung cấp trước khi cam kết khối lượng công việc, và định giá lại hàng quý.
Mô hình nào có cửa sổ ngữ cảnh lớn nhất so với giá?
DeepSeek-V4 và họ Gemini 2.5 cung cấp ngữ cảnh 1M token ở mức thấp của dải giá. Các mô hình GPT-5.6 nhích cao hơn một chút ở 1.05M, và GPT-5.4 nano đạt 1.1M với chỉ $0.20 đầu vào, khiến nó trở thành tùy chọn ngữ cảnh lớn rẻ nhất cho các tác vụ đơn giản.
Về tác giả
Mert Batur Gurbuz là Đồng sáng lập của Techsy.io, nơi đội ngũ phát hành các AI agent, hệ thống tự động hóa và pipeline voice/SDR cho khách hàng B2B. Anh ấy đang học tại Đại học Birmingham và viết về ngăn xếp công cụ LLM mà đội ngũ Techsy thực sự sử dụng trong sản xuất. Kết nối trên LinkedIn.
Nguồn
- Giá Anthropic Claude API (truy cập ngày 2026-07-14)
- Giá OpenAI API (truy cập ngày 2026-07-14)
- Giá Google Gemini API (truy cập ngày 2026-07-14)
- Giá DeepSeek API (truy cập ngày 2026-07-14)
- Giá Alibaba Cloud Model Studio (truy cập ngày 2026-07-14)
- Giá Mistral API (truy cập ngày 2026-07-14)
- Giá Z.AI (Zhipu GLM) (truy cập ngày 2026-07-14)