Công cụ tính chi phí API OpenAI, Claude & Gemini
So sánh chi phí hàng tháng giữa các nhà cung cấp với ưu đãi từ caching và batch processing.
Chi phí API cho GPT, Claude và Gemini dao động từ $0,15 đến $75 cho mỗi triệu token đầu vào, trong đó token đầu ra thường đắt hơn 3–5 lần. Với 10 triệu token mỗi tháng, GPT-4o tốn khoảng $775, Claude Sonnet 4 khoảng $1.140 và Gemini 2.5 Pro khoảng $825. Prompt caching giúp giảm 10 lần chi phí cho các token được cache; Batch API giảm 50% chi phí cho các tác vụ không cần thời gian thực. Công cụ tính này giúp bạn mô phỏng chính xác mức sử dụng trên cả ba nhà cung cấp.
Thông tin của bạn
05 fieldsAi nên sử dụng công cụ này
Người sáng lập đang lên kế hoạch cho dự án openai api trước khi thảo luận với nhà cung cấp. CTO và lãnh đạo kỹ thuật xây dựng ngân sách hàng năm cho các công việc sản phẩm mới. Quản lý sản phẩm chuyển hóa một ý tưởng đơn giản thành một khoảng giá trị hợp lý để trình bày với bộ phận tài chính. Nhóm mua sắm kiểm tra lại tính hợp lý của báo giá từ các agency và nhà thầu tự do.
Cách chúng tôi tính toán
Giá dựa trên bảng giá công khai từ OpenAI, Anthropic và Google tính đến năm 2026. Prompt caching chỉ áp dụng cho token input được cache (thường là system prompt + context ổn định). Batch API áp dụng cho cả token input và output với các công việc không cần thời gian thực, SLA 24 giờ.
Nguồn dữ liệu
Các yếu tố ảnh hưởng đến con số
Lựa chọn phân khúc mô hình
Các model tiên phong như GPT-4.5, Claude Opus 4 và Gemini 2.5 Pro đắt hơn 5 đến 10 lần mỗi token so với các model tầm trung cùng dòng. Chỉ dùng model tiên phong cho các tác vụ suy luận phức tạp mà model tầm trung thực sự không làm được: logic đa bước phức tạp, toán học, sinh code mơ hồ, hoặc các tác vụ cần kiến thức thế giới sâu rộng. Định tuyến mọi thứ khác sang Claude Sonnet 4, GPT-4o hoặc Gemini Flash. Khoảng cách chi phí đủ lớn để định tuyến thông minh thường cắt giảm 60 đến 80% chi tiêu cho các workload hỗn hợp.
Lưu trữ ngữ cảnh (Prompt caching)
Anthropic cache token input miễn phí trong 5 phút hoặc 1 giờ với phụ phí 25%, giảm chi phí token được cache khoảng 90%. OpenAI tự động cache trong 5 đến 10 phút trên một số endpoint nhất định mà không cần cấu hình. Caching hoạt động tốt nhất khi system prompt của bạn dài hơn 2K token và ổn định qua các request, điều này mô tả hầu hết chatbot production và hệ thống RAG. Tiết kiệm lớn nhất ở các workload có context dài ổn định và nhiều request mỗi phút.
Batch API
Cả OpenAI và Anthropic đều cung cấp endpoint batch với giá giảm chính xác 50% so với giá tiêu chuẩn để đổi lấy SLA 24 giờ. Batch lý tưởng cho phân loại, sinh embedding, tóm tắt, chạy evaluation và mọi xử lý nền. Tích hợp rất đơn giản: cùng model, cùng prompt, endpoint khác, cộng thêm hàng đợi để chờ kết quả. Hầu hết các nhóm bỏ qua batch và trả đủ giá cho các workload không có yêu cầu thời gian thực, đây là một trong những chi phí AI dễ phòng tránh nhất.
Số lượng token đầu ra
Token output đắt hơn 3 đến 5 lần so với token input trên tất cả các nhà cung cấp, và hầu hết phản hồi không cần bộ đệm output 4K token mà API cho phép mặc định. Nếu bạn đang trích xuất câu trả lời có hoặc không, giới hạn output ở 10 token. Nếu bạn đang sinh tóm tắt ngắn, giới hạn ở 200. Model thường muốn giải thích lý luận của nó ngay cả khi bạn không yêu cầu, và bạn đang trả tiền cho những giải thích đó. Siết chặt max_tokens thường cắt giảm 30 đến 50% chi phí output mà không ảnh hưởng chất lượng.
Kích thước cửa sổ ngữ cảnh không đồng nghĩa với giá thành
Tất cả các nhà cung cấp lớn đều tính phí theo số token tiêu thụ, chứ không theo kích thước cửa sổ ngữ cảnh. Dùng cửa sổ ngữ cảnh 200K cho một prompt 5K token tốn đúng bằng dùng cửa sổ 5K cho prompt 5K token. Nghĩa là các mô hình ngữ cảnh dài không hề "đắt hơn để dùng" trừ khi bạn thực sự lấp đầy cửa sổ ngữ cảnh. Hãy chọn mô hình dựa trên năng lực và giá mỗi token, chứ không phải cửa sổ ngữ cảnh nào lớn nhất.
Cách giảm thiểu chi phí
Hãy bật bộ nhớ đệm prompt làm bước tối ưu đầu tiên, trước mọi thứ khác. Với Anthropic, hãy đánh dấu system prompt ổn định bằng header cache_control và token được lưu đệm sẽ giảm xuống còn khoảng 10% giá input tiêu chuẩn. Với OpenAI, việc lưu đệm diễn ra tự động trên một số endpoint nhất định khi tiền tố prompt của bạn giống hệt nhau giữa các request. Lợi ích lớn nhất ở các workload có ngữ cảnh dài ổn định và nhiều request: chatbot có persona chi tiết, hệ thống RAG có ngữ cảnh truy xuất lặp đi lặp lại, và bất kỳ vòng lặp agent nào gửi lại một bộ hướng dẫn dài. Hầu hết các đội đều quên bật caching và phải trả phí cao gấp 5 đến 10 lần.
Chuyển mọi workload không yêu cầu thời gian thực sang Batch API. Cả Anthropic và OpenAI đều cung cấp endpoint batch với giá đúng bằng 50% giá tiêu chuẩn, đổi lại là SLA phản hồi trong 24 giờ. Các tác vụ phân loại, kiểm duyệt nội dung, tạo embedding, pipeline tóm tắt và các lần chạy đánh giá đều là ứng viên phù hợp. Công sức tích hợp rất nhỏ vì prompt và mô hình không đổi. Nhiều đội vẫn chạy toàn bộ pipeline gắn nhãn nội dung ở mức giá tiêu chuẩn trong khi batch có thể giảm một nửa hóa đơn mà chất lượng không hề khác biệt.
Định tuyến request theo độ khó. Các truy vấn đơn giản (lời chào, định dạng, tra cứu cơ bản) nên chạy trên GPT-4o mini, Claude Haiku hoặc Gemini Flash với giá $0,15 đến $0,80 mỗi triệu token input. Suy luận phức tạp dành cho Claude Opus, GPT-4.5 hoặc Gemini Pro với giá $1,25 đến $75 mỗi triệu. Một bộ phân loại nhỏ đặt trước bộ định tuyến mô hình thường cắt giảm 60 đến 80% chi phí trên các workload hỗn hợp. Gửi mọi thứ đến mô hình tiên tiến nhất là sai lầm về chi phí AI phổ biến nhất mà chúng tôi thấy trong môi trường production.
Giới hạn max_tokens thật chặt. Token output đắt gấp 3 đến 5 lần token input, và bộ đệm output mặc định 4K lớn hơn nhiều so với mức hầu hết phản hồi cần. Giới hạn câu trả lời có/không ở 10 token, tóm tắt ngắn ở 200, JSON có cấu trúc ở mức schema yêu cầu cộng thêm một bộ đệm nhỏ. Mô hình đôi khi muốn diễn giải thêm ngay cả khi bạn không yêu cầu, và bạn phải trả tiền cho những phần diễn giải đó. Siết chặt max_tokens giúp giảm 30 đến 50% chi phí output trong hầu hết trường hợp.
Chỉ giữ lại phần ngữ cảnh truy xuất thực sự cần cho mỗi truy vấn. Hệ thống RAG thường truy xuất 10 đến 20 đoạn và nhét tất cả vào prompt cho chắc. Kết quả là phải trả tiền cho hàng nghìn token không liên quan mỗi request. Thêm một reranker lọc xuống còn 3 đến 5 đoạn liên quan nhất thường cắt giảm 50 đến 70% lượng token input mà không mất chất lượng, thậm chí thường cải thiện chất lượng vì mô hình không bị phân tán bởi ngữ cảnh không liên quan.
Ghi log mọi request kèm số token, mô hình và trạng thái có lưu đệm hay không. Bạn không thể tối ưu thứ mình không nhìn thấy, và chi phí AI có thể thay đổi chỉ sau một đêm khi một tính năng mới ra mắt hoặc một prompt được chỉnh sửa. Hãy đặt cảnh báo chi tiêu hàng ngày. Xây một dashboard phân tách chi tiêu theo tính năng, mô hình và endpoint. Hầu hết các lần vượt chi phí production mà chúng tôi gặp phải xảy ra vì một mẫu sử dụng đã thay đổi từ hai tuần trước khi có ai đó nhìn vào hóa đơn.
Chi phí cho mỗi triệu token (Giá năm 2026)
| Mô hình | Đầu vào | Đầu ra | Đầu vào đã lưu trữ |
|---|---|---|---|
| GPT-4.5 | $75.00 | $150.00 | $37.50 |
| GPT-4o | $2.50 | $10.00 | $1.25 |
| GPT-4o mini | $0.15 | $0.60 | $0.075 |
| Claude Opus 4 | $15.00 | $75.00 | $1.50 |
| Claude Sonnet 4 | $3.00 | $15.00 | $0.30 |
| Claude Haiku 4 | $0.80 | $4.00 | $0.08 |
| Gemini 2.5 Pro | $1.25 | $10.00 | N/A |
| Gemini 2.5 Flash | $0.075 | $0.30 | N/A |
Câu hỏi thường gặp
Những câu hỏi chúng tôi nhận được mỗi tuần
Câu trả lời ngắn gọn, viết bằng ngôn ngữ dễ hiểu. Nếu câu hỏi của bạn không có ở đây,
GPT-4o: $2,50 cho mỗi triệu token đầu vào, $10 đầu ra. GPT-4o mini: $0,15/triệu đầu vào, $0,60 đầu ra. GPT-4.5: $75/triệu đầu vào, $150 đầu ra. Với 10 triệu token mỗi tháng, tỷ lệ đầu vào/đầu ra 30/70, chi phí dự kiến từ $25 đến $13K tùy model.
Với hầu hết các workload: GPT-4o mini, Gemini 2.5 Flash hoặc Claude Haiku 4; tất cả đều dưới $1 cho mỗi triệu token đầu vào. Nếu cần cân bằng giữa chất lượng và chi phí: Claude Sonnet 4 hoặc Gemini 2.5 Pro.
Anthropic và OpenAI cache các prompt đầu vào lớn giữa các request. Token được cache rẻ hơn khoảng 90% so với token không cache. Phù hợp nhất cho chatbot có system prompt ổn định hoặc RAG với context ổn định.
Giảm đúng 50% cho cả token đầu vào lẫn đầu ra. Yêu cầu chấp nhận SLA 24 giờ. Phù hợp cho phân loại, tóm tắt, embedding và đánh giá. Không phù hợp cho chat thời gian thực hoặc UX tương tác.
Ở cùng phân khúc chất lượng, chi phí tương đương nhau. Claude Sonnet 4 so với GPT-4o gần như ngang bằng. Claude Opus 4 với prompt caching rẻ hơn khoảng 30% so với GPT-4o trên các workload có prompt ổn định.
(1) Bật prompt caching. (2) Dùng Batch API khi có thể. (3) Định tuyến các truy vấn đơn giản sang mini model. (4) Giới hạn max_tokens thật chặt. (5) Tinh gọn retrieval context, chỉ giữ phần thiết yếu.
Điểm hòa vốn nằm ở khoảng $5K chi phí API mỗi tháng. Dưới mức đó: tiếp tục dùng API. Trên mức đó: tự host Llama 3.1 hoặc Mistral giúp giảm 50–70% chi phí nếu bạn có đủ năng lực hạ tầng.
Lấy mẫu đại diện 100 request. Đo số token input và output trung bình. Nhân với số lượng request hàng tháng. Nhân với chi phí mỗi triệu token. Cộng thêm 30% dự phòng.
Chỉ dùng cho các bài toán suy luận phức tạp mà các model tầm trung không xử lý được. Với 80% workload production, Sonnet 4, GPT-4o hoặc Gemini 2.5 Pro hoạt động tốt với chi phí thấp hơn 10 lần.
Sai số trong khoảng ±15% với các workload thông thường. Biến động thực tế đến từ sự thay đổi độ dài prompt, độ dài output, vòng lặp lỗi và retry, cùng logic định tuyến. Hãy dùng công cụ tính toán như công cụ lập kế hoạch, không phải hóa đơn cuối cùng.
Các công cụ tương tự
Những công cụ tính toán khác mà hầu hết mọi người mở ngay sau trang này; hãy chọn công cụ phù hợp với quyết định tiếp theo của bạn.
Chi phí xây dựng cộng với chi phí vận hành hàng tháng; bức tranh toàn cảnh.
Nhận báo giá chính xác từ đội ngũ của chúng tôi
Công cụ tính toán chỉ đưa ra một khoảng giá. Một cuộc gọi 30 phút sẽ giúp bạn xác định rõ phạm vi công việc, tiến độ và ngân sách. Tư vấn miễn phí, không ràng buộc.
Bắt đầu thảo luận