
Theo dõi chi phí LLM: Kiểm soát chi tiêu trước khi tăng vọt (2026)
Theo dõi chi phí LLM chính là ranh giới giữa một hóa đơn bất ngờ 412 USD và một tin nhắn Slack khi ngân sách chạm mốc 80%. Claude Sonnet 5 tháng này tính giá 3,00 USD cho mỗi triệu token đầu vào, và chỉ một vòng lặp agent mất kiểm soát cũng có thể đốt sạch số đó trong một buổi chiều. Hầu hết các team thiết lập phần theo dõi trong một ngày; phần cảnh báo mới là thứ họ bỏ qua.
Điểm chính:
- Theo dõi chi phí LLM gắn số token và ước tính chi phí cho từng request, sau đó tổng hợp theo model và team.
- Theo dõi năm chỉ số: số token mỗi request, chi phí theo tính năng/team/model, tỷ lệ trúng cache, chi phí mỗi cuộc hội thoại, tốc độ tăng vọt.
- Ngân sách LiteLLM, trace Langfuse hoặc Datadog LLM Observability, mỗi cách đều dựng được khả năng nhìn thấy chi tiêu trong chưa đầy một ngày.
- Bảng điều khiển hiển thị ước tính; giá input có cache và chiết khấu batch thường khiến hóa đơn thực tế hạ xuống thấp hơn.
Theo dõi chi phí LLM thực sự đo những gì?
Theo dõi chi phí LLM là việc gắn số token và ước tính chi phí cho mọi request LLM, rồi tổng hợp các ước tính đó theo model, tính năng và team để có thể cảnh báo trước khi hóa đơn gửi tới. Ước tính được tính cho từng request từ giá token công khai, gộp lại theo bất kỳ tag nào bạn gắn vào lời gọi, và so sánh với ngân sách đã đặt trước.
Phần toán học bên dưới thì trung lập về nhà cung cấp. Phản hồi mức sử dụng của mọi nhà cung cấp đều chia token thành các trường, và tài liệu chi phí của Datadog ghi rõ mối quan hệ giữa chúng. Quy ước ngữ nghĩa GenAI của OpenTelemetry chuẩn hóa chính các trường đó xuyên suốt các nhà cung cấp, nên bảng điều khiển xây trên chúng sẽ không bị khóa chặt vào một nhà cung cấp duy nhất.
| Trường | Đếm những gì | Tính giá theo |
|---|---|---|
| input_tokens | Mọi thứ bạn gửi: system prompt, lịch sử, ngữ cảnh truy xuất, câu hỏi | Giá input cơ bản |
| output_tokens | Mọi thứ model tạo ra | Giá output cơ bản (gấp 3-6 lần input) |
| cache_read_tokens | Input được dùng lại từ cache trước đó | 0,1x-0,25x giá input cơ bản |
| cache_write_tokens | Input được ghi vào cache lần đầu | ~1,25x giá input cơ bản (TTL 5 phút của Anthropic) |
| reasoning_tokens | Chuỗi suy luận nội bộ, một tập con của output | Giá output |
Ba mối quan hệ gánh phần lớn công việc: tổng token = input + output; input = không cache + cache_read + cache_write; và token suy luận nằm trong output, tính giá output. Nắm đúng những điều đó thì ước tính mỗi request sẽ sát; bỏ qua chúng thì bảng điều khiển sẽ lệch khỏi hóa đơn mỗi tháng. Theo dõi chi phí là một trụ cột của observability AI; tracing và eval là hai trụ còn lại, và chúng chia sẻ cùng vốn từ vựng về trường này.
Bảng điều khiển của bạn hiển thị một ước tính; hóa đơn mới là chỉ số chi phí duy nhất không bao giờ bị cache.
1 triệu token trong LLM đáng giá bao nhiêu?
Tùy thuộc vào model và chiều: 1 triệu token có giá 0,14 USD ở chiều input của DeepSeek-V4 và 15,00 USD ở chiều output của GPT-5.6 Terra, chênh lệch 100 lần trên cùng một đơn vị. Dưới đây là bốn model từ nghiên cứu giá ngày 14 tháng 7 năm 2026 của chúng tôi, đã đối chiếu với các trang chính thức:
| Model | Input / 1 triệu token | Output / 1 triệu token | Input có cache / 1 triệu token |
|---|---|---|---|
| Claude Sonnet 5 | $3.00 | $15.00 | $0.30 |
| GPT-5.6 Terra | $2.50 | $15.00 | $0.25 |
| Gemini 2.5 Pro | $1.25 | $10.00 | $0.31 |
| DeepSeek-V4 | $0.14 | $0.28 | $0.003 |
Nguồn: giá OpenAI và giá Anthropic. Một chú thích: Claude Sonnet 5 đang chạy mức giá giới thiệu 2,00 USD input / 10,00 USD output đến hết ngày 31 tháng 8 năm 2026, sau đó quay về các con số ở trên.
5 chỉ số thực sự quan trọng
Năm chỉ số bao quát việc theo dõi chi phí LLM, và hầu hết các team chỉ cảnh báo trên hai trong số đó. Hãy bắt đầu với hai dòng đầu: số token mỗi request phát hiện prompt phình to ngay trong ngày nó xuất hiện, còn chi phí mỗi team là con số mà bộ phận tài chính sớm muộn gì cũng hỏi. Ba chỉ số còn lại sẽ làm rõ bức tranh hơn khi hai chỉ số kia đã chạy.
| Chỉ số | Cách tính | Vì sao quan trọng | Ngưỡng cảnh báo |
|---|---|---|---|
| Số token mỗi request | Cộng input + output mỗi lời gọi, nhóm theo tính năng | Prompt phình to và nhồi ngữ cảnh lộ ra ở đây đầu tiên | +30% so với trung vị 7 ngày |
| Chi phí theo tính năng / team / model | Cộng chi phí ước tính, nhóm theo tag hoặc khóa ảo | Đơn vị để chargeback và ngân sách thực sự vận hành | 80% ngân sách tháng |
| Tỷ lệ trúng cache | cache_read / tổng token input | Tỷ lệ thấp nghĩa là bạn trả đủ giá cho các prompt lặp lại | Dưới 50% khi traffic ổn định |
| Chi phí mỗi cuộc hội thoại / phiên | Cộng chi phí qua mọi lượt của một phiên | Lộ ra các agent đa lượt mất kiểm soát mà góc nhìn từng request bỏ sót | Gấp 2 lần phiên ở phân vị 90 |
| Tốc độ tăng vọt / bất thường | Thay đổi tổng chi tiêu theo ngày | Chỉ số duy nhất bắt được vòng lặp hỏng trước khi hóa đơn về | +50% so với ngày hôm trước |
Một lưu ý về độ hạt: Datadog lưu chi phí cấp request theo nanodollar (phần tỷ của đô la) theo tài liệu chi phí của họ. Với mức 0,14 USD mỗi triệu token, một request DeepSeek-V4 đơn lẻ có thể tốn chưa đến một phần nghìn cent, nên hãy tổng hợp trước khi làm tròn, nếu không traffic của model nhỏ sẽ biến mất khỏi báo cáo.
Nếu bạn không theo dõi gì khác, hãy theo dõi dòng một và dòng hai. Số token mỗi request là lời cảnh báo sớm nhất bạn có; chi phí mỗi team là con số sống sót được khi chạm trán phòng kế toán.
Ba cách thiết lập theo dõi chi phí LLM
Không một trang nào trong nhóm dẫn đầu cho truy vấn này đăng nổi một dòng code chạy được, nên đây là ba cách thiết lập hoạt động thực tế. Mỗi cách đều lên sóng trong chưa đầy một ngày, và chúng kết hợp được với nhau: chúng tôi chạy hai cách đầu cùng nhau.
Những gì chúng tôi thực sự chạy trong production: trong thiết lập của chúng tôi, mọi agent client đều nói chuyện với proxy LiteLLM qua khóa ảo riêng, với ngân sách tháng trên từng khóa và Langfuse trace mọi request phía sau proxy. Khi chúng tôi triển khai cả hai cùng nhau, chính sự phân công lao động mới là điểm mấu chốt: proxy thực thi mức trần, còn các trace giải thích thứ gì đã tiêu chúng. Mỗi khóa client của chúng tôi cũng mang tpm_limit 100.000 token mỗi phút như một cầu chì thứ hai; dựa trên tài liệu của LiteLLM, proxy sẽ từ chối request khi chạm giới hạn, và hành vi được ghi trong tài liệu đó là thứ chúng tôi dựa vào, chứ không phải một benchmark chúng tôi tự đo. Cấu hình của chúng tôi bỏ qua hoàn toàn LiteLLM 1.82.7 và 1.82.8, hai phiên bản dính sự cố chuỗi cung ứng tháng 3 năm 2026, và ghim tag image thay vì trôi theo latest.
Proxy LiteLLM: khóa ảo + ngân sách
Techsy chạy thiết lập proxy LiteLLM trong production với một khóa ảo cho mỗi client và ngân sách tháng trên từng khóa. Request dưới đây là hình dạng được ghi trong tài liệu từ tài liệu virtual_keys của LiteLLM: dựa trên tài liệu đó, một khi chi tiêu tích lũy trên khóa này vượt 50 USD trong một tháng, proxy sẽ từ chối các request tiếp theo bằng lỗi vượt ngân sách thay vì chỉ ghi một cảnh báo sau sự việc.
curl -X POST http://localhost:4000/key/generate \
-H "Authorization: Bearer $LITELLM_MASTER_KEY" \
-H "Content-Type: application/json" \
-d '{
"key_alias": "client-acme-search",
"max_budget": 50.0,
"budget_duration": "monthly",
"tpm_limit": 100000,
"models": ["anthropic/claude-sonnet-4-5"]
}'Làm phép tính với giá công khai: ở mức 3,00 USD / 15,00 USD mỗi triệu token của Claude Sonnet 5, 50 USD mua được khoảng 16,7 triệu token input hoặc 3,3 triệu token output, chừng một tuần traffic cho một trong những agent client nhẹ hơn của chúng tôi. Đó chính xác là phạm vi ảnh hưởng mà chúng tôi muốn. tpm_limit là cầu chì thứ hai: một vòng lặp mất kiểm soát sẽ vấp mức 100K token mỗi phút rất lâu trước khi vấp ngân sách tháng. Quy kết theo từng người dùng cũng hoạt động theo cách tương tự qua endpoint users, và hướng dẫn của chúng tôi về công cụ LLM gateway tốt nhất nói rõ khi nào proxy đáng chỗ đứng so với khi nó chỉ là một chặng trung gian khác.
Langfuse: tracing chi phí với @observe
Gợi ý tự động của Google ghép "langfuse monitoring" với truy vấn này, và có lý do chính đáng: Langfuse là lựa chọn mặc định mã nguồn mở cho tracing. SDK Python của nó bọc client nhà cung cấp của bạn để mọi lời gọi trở thành một trace mang theo số token và chi phí tính sẵn, theo tài liệu tracing của Langfuse:
# pip install langfuse openai
from langfuse import observe
from langfuse.openai import openai # drop-in wrapper, auto-traces
@observe()
def answer(question: str):
return openai.chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": question}],
)
answer("what is llm cost monitoring")
# the trace now carries usage.total_tokens and total_cost,
# priced from Langfuse's model price cardsChi phí đáp xuống trace mà bạn không phải tính toán token nào; nhóm trace theo session hoặc user id để gộp theo tính năng, và tự host nếu dữ liệu không được phép rời khỏi mạng của bạn.
Datadog LLM Observability: nếu bạn đã ở sẵn trong đó
Nếu team của bạn đã chạy agent Datadog, tài liệu chi phí LLM của họ là tài liệu tham khảo đơn lẻ sâu nhất trên trang này: chi phí cấp request theo nanodollar, cost_tags tùy chỉnh để phân tách theo team và tính năng, và một mục xử lý sự cố thực sự cho các khoảng trống chi phí cục bộ. Giới hạn thật thà: nó chỉ dành cho Datadog. Các chỉ số không rời khỏi nền tảng, và không có phương án mã nguồn mở dự phòng nếu giá không còn phù hợp. Chọn nó vì sự gom hợp, đừng chọn vì sự linh hoạt.
Bạn thiết lập ngân sách, cảnh báo và chargeback thế nào?
Bạn thiết lập theo ba lớp: một mức trần ngân sách từ chối request tại giới hạn, một cảnh báo webhook kích hoạt ở ngưỡng phần trăm trước khi chạm trần, và các khóa ảo theo team biến showback và chargeback thành một câu truy vấn thay vì một cuộc cãi vã. LiteLLM có sẵn cả ba; các mẫu này chuyển được sang bất kỳ gateway nào có ngân sách cấp khóa.
Ngân sách chỉ biết đếm thì chỉ là báo cáo; ngân sách biết từ chối request khi chạm trần mới là công cụ kiểm soát.
Cảnh báo kích hoạt trước khi tăng vọt
Đặt cảnh báo ở 80% mức trần, không phải 100%. LiteLLM có sẵn cảnh báo Slack: đặt alerting: ["slack"] và alerting_threshold: 80 trong general_settings, trỏ biến môi trường SLACK_WEBHOOK_URL vào một kênh, và một tin nhắn như thế này sẽ đáp xuống khi một khóa vượt ngưỡng:
{
"text": "LLM budget alert: client-acme-search spent $40.18 of its $50.00 monthly cap (80.4%). Top model: anthropic/claude-sonnet-4-5."
}Ở mức 80%, con người vẫn còn vài ngày để hành động: hạ cấp model, siết prompt, hoặc nâng trần kèm tên người duyệt. Cảnh báo ở mức 100% chẳng khác nào một cuộc khám nghiệm tử thi.
Từ showback sang chargeback
Showback nghĩa là mỗi team thấy chi tiêu của chính mình; chargeback nghĩa là nó bị trừ vào ngân sách của họ. Cả hai chạy trên một nguyên liệu: một khóa ảo cho mỗi team, được gắn tag lúc tạo. Báo cáo tháng khi đó chỉ là một phép group-by trên bảng chi tiêu:
| Team | Ngân sách tháng | Chi tiêu đến nay | Trạng thái |
|---|---|---|---|
| search | $50 | $40.18 | cảnh báo kích hoạt ở 80% |
| support-chat | $200 | $112.40 | đúng tiến độ |
| evals-batch | $30 | $29.97 | chạm trần, đang từ chối |
| sandbox | $10 | $1.06 | đúng tiến độ |
Định dạng ví dụ, không phải dữ liệu client. Dòng evals-batch là mẫu hoạt động đúng như dự định: việc batch chạy đến trần và dừng lại, thay vì âm thầm rỉ máu vào hóa đơn. Hành vi thực thi được ghi trong tài liệu virtual_keys của LiteLLM, bao gồm cả cách khoảng thời gian ngân sách đặt lại.
Vì sao bảng điều khiển lệch với hóa đơn?
Bởi vì bảng điều khiển tính theo giá niêm yết, còn hóa đơn áp dụng các chiết khấu mà hệ thống giám sát của bạn không bao giờ nhìn thấy. Input có cache đáp xuống ở mức 0,1x đến 0,25x giá cơ bản, chạy batch tính nửa giá, và token suy luận tính giá output từ bên trong số đếm output. Khi hai con số lệch nhau, hóa đơn thường là con số thấp hơn, và khoảng cách gần như luôn luôn là một trong bốn yếu tố điều chỉnh.
| Yếu tố điều chỉnh giá | Hệ số điển hình | Tác động lên ước tính của bạn |
|---|---|---|
| Input có cache (đọc cache) | 0,1x-0,25x giá input cơ bản | Bảng điều khiển chạy cao nếu tính cache hit đủ giá |
| Batch API | 0,5x cho input và output | Việc bất đồng bộ tốn nửa con số đã theo dõi |
| Token suy luận | 1x giá output, đếm bên trong output | Chuỗi suy luận dài âm thầm đốt ngân sách output |
| Ghi cache | ~1,25x giá input cơ bản | Request đầu tiên trong cửa sổ cache tốn nhỉnh hơn |
Catalog mở pydantic/genai-prices cho thấy vì sao các hệ số này khác nhau theo từng model: mỗi nhà cung cấp đặt hệ số cache và batch riêng, nên một bảng giá hardcode duy nhất sẽ lệch ngay ngày nhà cung cấp sửa bảng giá của họ. Tài liệu chi phí của Datadog ghi nửa kia của vấn đề, các khoảng trống chi phí cục bộ nơi một trường token bị thiếu trả về COST UNAVAILABLE cho một request. Kiểm tra ở đó khi bảng điều khiển đọc thấp hơn hóa đơn; kiểm tra bảng chiết khấu khi nó đọc cao hơn. Cơ chế đằng sau hệ số lớn nhất là cache prompt LLM, và tỷ lệ trúng cache cao là lý do phổ biến nhất khiến ước tính đã theo dõi vượt quá hóa đơn thật.
Một ước tính chi phí mà thiếu chiết khấu cache hit và batch chỉ là mức trần, không phải dự báo.
Những công cụ nào thực sự làm theo dõi chi phí LLM?
Sáu công cụ bao quát hầu hết các thiết lập production: Langfuse, LiteLLM, Helicone và Portkey ở phía mã nguồn mở và gateway, Datadog và Braintrust ở phía thương mại. Sự phân chia thật thà là thực thi và observability: proxy có thể từ chối request tại mức ngân sách, còn công cụ tracing đo chi tiêu sau sự việc. Hầu hết các stack trưởng thành rốt cuộc đều có một công cụ mỗi loại.
| Công cụ | Loại | Cách theo dõi chi phí | Gói miễn phí | Chọn khi... |
|---|---|---|---|---|
| Langfuse | Mã nguồn mở | Chi phí theo trace từ bảng giá model, tự host được | Tự host miễn phí; gói hobby miễn phí trên cloud | Bạn muốn mã nguồn mở và sở hữu dữ liệu |
| LiteLLM | Proxy mã nguồn mở | Ngân sách khóa và team được thực thi tại gateway | Miễn phí (OSS); enterprise trả phí | Bạn cần ngân sách biết từ chối request, không chỉ biết đếm |
| Helicone | Gateway mã nguồn mở | Nhật ký chi phí cấp proxy theo khóa và model | Gói miễn phí có giới hạn tốc độ | Bạn muốn đổi proxy bằng một dòng mà không sửa SDK |
| Portkey | Gateway thương mại | Ngân sách khóa ảo kèm phân tích chi phí | Gói developer miễn phí | Bạn muốn gateway, prompt và eval trong một bảng |
| Datadog LLM Observability | Thương mại | Chỉ số request theo nanodollar kèm cost_tags | Dùng thử 14 ngày | Bạn đã chạy Datadog cho mọi thứ khác |
| Braintrust | Thương mại | Chi tiêu gắn với eval theo từng dự án | Gói miễn phí | Việc chi phí của bạn bắt đầu từ eval, không phải từ hóa đơn |
Một lưu ý về nội dung từ nhà cung cấp trong mảng này: chính bài so sánh công cụ theo dõi chi phí năm 2026 của Braintrust tự xếp họ hạng nhất và bỏ qua mọi lựa chọn mã nguồn mở trong bảng trên. Đọc listicle của nhà cung cấp để lấy dữ liệu, đừng lấy bảng xếp hạng.
Với một team bắt đầu từ số không, chúng tôi sẽ chạy LiteLLM ở trước và Langfuse ở sau: proxy thực thi ngân sách, các trace giải thích chúng, và cặp đôi này không tốn gì cho đến khi bạn bước sang các gói host. Nếu bạn đang cân nhắc hai lựa chọn mặc định cho tracing, bài phân tích Langfuse và Langsmith của chúng tôi mổ xẻ lựa chọn đó, và bài tổng hợp nền tảng observability AI tốt nhất bao quát cả lĩnh vực.
Từ theo dõi đến cắt giảm chi phí
Theo dõi cho thấy tiền đi đâu; bước tiếp theo là quyết định bao nhiêu tiền sẽ đi đến đó. Ba đòn bẩy, theo thứ tự hiệu quả: cache input lặp lại, định tuyến request dễ sang model rẻ hơn, và hạ cỡ model ở những nơi chất lượng vẫn giữ được. Hướng dẫn giảm chi phí API LLM của chúng tôi bao quát từng đòn bẩy, và bài so sánh giá API LLM là đầu vào cho mọi phép tính ở trên.
Góc nhìn của chúng tôi: khi chi tiêu LLM của một client làm họ bất ngờ, chúng tôi theo dõi trước và cắt giảm sau, không bao giờ làm ngược. Các team cache trước khi đo thường rốt cuộc lại cache nhầm prompt. Theo dõi cho bạn biết tiền đi đâu; cache và định tuyến quyết định bao nhiêu tiền đi đến đó. Nếu hóa đơn của bạn đã bắt đầu đau, nhận tư vấn miễn phí và chúng tôi sẽ cùng bạn xem xét các con số.
Về tác giả
Mert Batur là Đồng sáng lập của Techsy.io, nơi team triển khai các agent AI, hệ thống tự động hóa và pipeline voice/SDR cho các client B2B. Anh viết về stack công cụ LLM mà team Techsy thực sự dùng trong production. Kết nối trên LinkedIn.
Câu hỏi thường gặp
1 triệu token trong LLM đáng giá bao nhiêu?
Ở giá niêm yết, bất kỳ đâu từ 0,14 USD đến 15 USD mỗi triệu tùy thuộc vào model và chiều: input của DeepSeek-V4 có giá 0,14 USD mỗi triệu, trong khi output của GPT-5.6 Terra có giá 15 USD. Token output chạy gấp 3 đến 6 lần giá input ở mọi nhà cung cấp lớn. Bảng trong phần đầu có bốn model, và bài so sánh giá API LLM của chúng tôi định giá toàn bộ mười bảy model, đã đối chiếu với các trang của OpenAI và Anthropic vào tháng 7 năm 2026.
Tối ưu chi phí LLM là gì?
Là việc hạ chi phí mỗi request mà không làm tụt chất lượng: cache prompt cho input lặp lại, định tuyến việc dễ sang model rẻ hơn, batch API cho việc bất đồng bộ, và chọn đúng cỡ model cho từng tính năng. Theo dõi chi phí LLM là điều kiện tiên quyết, vì bạn không thể tối ưu thứ mình chưa quy kết. Tỷ lệ trúng cache và chi phí mỗi tính năng là hai chỉ số chỉ vào những đòn bẩy lớn nhất trước tiên.
Vì sao LLM đắt đến vậy?
Suy luận bị giới hạn bởi tính toán: mỗi token được tạo ra chạy trọn một lần forward pass của model trên GPU, và các model suy luận tốn thêm token để nghĩ trước khi trả lời, tính giá output. System prompt dài nhân chi phí đó lên trên mọi request đơn lẻ. Hóa đơn tăng theo độ dài ở cả hai phía của lời gọi, đó là lý do số token mỗi request là chỉ số đầu tiên đáng để mắt.
Chi phí LLM ở Mỹ là bao nhiêu?
Giá API được định giá bằng USD và áp dụng toàn cầu: OpenAI, Anthropic và Google tính cùng một giá niêm yết cho mỗi triệu token bất kể request xuất phát từ Ohio hay Osaka. Khác biệt vùng miền xuất hiện ở việc tự host, nơi giờ GPU thay đổi theo vùng cloud, và ở các nền tảng host có thêm phần gia giá. Với việc API, vị trí thay đổi độ trễ, không thay đổi giá.
Tôi theo dõi chi phí LLM theo từng team thế nào?
Cấp một khóa ảo cho mỗi team qua một proxy như LiteLLM, gắn tag tên team cho từng khóa lúc tạo, và tổng hợp chi tiêu theo tag đó. Khi ấy mọi request mang theo quy kết ngay từ khoảnh khắc nó được tạo ra, không cần parse log. Bảng showback trong phần ngân sách ở trên chính là thành phẩm: team, ngân sách tháng, chi tiêu đến nay, trạng thái.
Langfuse và Datadog cho theo dõi chi phí LLM: tôi nên chọn cái nào?
Chọn Langfuse nếu bạn muốn mã nguồn mở, tự host và dữ liệu bạn kiểm soát; nó chạy miễn phí và trace chi phí mỗi request ngay từ đầu. Chỉ chọn Datadog nếu team của bạn đã chạy nó cho hạ tầng, vì các tính năng chi phí LLM của nó không rời khỏi nền tảng. Với hầu hết các team bắt đầu mới, Langfuse cộng proxy LiteLLM đánh bại bất kỳ lựa chọn đơn lẻ nào.
Chi phí LLM ước tính có khớp với hóa đơn thực tế không?
Không, và thường thì hóa đơn thấp hơn. Bảng điều khiển tính theo giá niêm yết trong khi input có cache đáp xuống 0,1x đến 0,25x và việc batch ở 0,5x, nên một workload nhiều cache sẽ thấy hóa đơn thật thấp hơn đáng kể so với ước tính đã theo dõi. Các trường token bị thiếu đẩy sai số theo chiều ngược lại. Bảng độ lệch ở trên liệt kê từng hệ số và nơi cần tìm.
Tôi cảnh báo khi chi tiêu LLM tăng vọt thế nào?
Đặt một cảnh báo ngưỡng ở 80% ngân sách tháng của mỗi team, gửi đến Slack qua webhook, cộng một cảnh báo bất thường theo ngày ở mức +50% cho các vòng lặp đốt nhanh. LiteLLM có sẵn mẫu ngưỡng qua thiết lập alerting_threshold. Cảnh báo ở mức 80% để lại vài ngày để phản ứng; cảnh báo ở mức 100% chỉ xác nhận rằng mức trần đã làm đúng việc của nó.
Có trình theo dõi chi phí LLM miễn phí nào không?
Có, ba cái đáng tin. Langfuse tự host thì miễn phí và mã nguồn mở, với gói hobby miễn phí trên cloud theo trang giá Langfuse. Ngân sách khóa tích hợp của LiteLLM không tốn gì trên proxy mã nguồn mở. Gói miễn phí của Helicone bao quát nhật ký chi phí cấp proxy với giới hạn tốc độ. Gói miễn phí bao quát việc giám sát; thực thi và cảnh báo ở quy mô lớn là nơi các gói trả phí bắt đầu.
Kết luận
Hãy chọn một con đường thiết lập ngay hôm nay, vì cảnh báo mà bạn sẽ cần sau sáu tuần nữa chỉ mất một buổi chiều để thiết lập lúc này. Phiên bản ngắn gọn:
- Theo dõi số token mỗi request và chi phí mỗi team trước; thêm ba chỉ số còn lại khi hai chỉ số đó đã chạy.
- Ngân sách biết từ chối request là công cụ kiểm soát; ngân sách chỉ biết đếm là báo cáo.
- Đặt cảnh báo ở mức 80%, trong Slack, trước khi hóa đơn có thể làm ai đó bất ngờ.
- Bảng điều khiển của bạn là một ước tính; giá input có cache và giá batch nghĩa là hóa đơn thường đáp xuống thấp hơn nó.
Nếu bạn muốn có ai đó cùng xem xét các con số với mình, nhận tư vấn miễn phí.