
LLM 비용 모니터링: 청구서 급등 전에 지출을 추적하세요 (2026)
LLM 비용 모니터링은 412달러 깜짝 청구서와 예산 80% 시점의 Slack 알림을 가르는 차이입니다. Claude Sonnet 5는 이번 달 입력 토큰 백만 개당 3.00달러를 과금하며, 폭주하는 에이전트 루프 하나면 오후 한나절에 그 금액을 태울 수 있어요. 대부분의 팀이 하루 만에 추적을 구축하지만, 알림은 건너뛰는 부분입니다.
핵심 요약:
- LLM 비용 모니터링은 모든 요청에 토큰 수와 달러 추정치를 부여한 뒤 모델과 팀별로 집계합니다.
- 5가지 지표를 추적하세요: 요청당 토큰, 기능/팀/모델당 비용, 캐시 적중률, 대화당 비용, 급등률.
- LiteLLM 예산, Langfuse 트레이스, Datadog LLM Observability 각각 하루 안에 지출 가시성을 구축할 수 있어요.
- 대시보드는 추정치를 표시합니다. 캐시 입력 가격과 배치 할인을 적용하면 실제 청구서는 보통 그 아래로 떨어져요.
LLM 비용 모니터링은 실제로 무엇을 추적하나요?
LLM 비용 모니터링은 모든 LLM 요청에 토큰 수와 달러 추정치를 부여하고, 그 추정치를 모델, 기능, 팀별로 집계하여 청구서가 도착하기 전에 지출에 알림을 설정할 수 있게 하는 실무입니다. 추정치는 공개된 토큰 가격으로 요청마다 계산되고, 호출에 부여한 태그 기준으로 롤업되며, 사전에 설정한 예산과 비교됩니다.
내부 계산은 벤더 중립적이에요. 모든 프로바이더의 사용량 응답은 토큰을 필드로 분리하며, Datadog 비용 문서가 이 관계를 명시적으로 문서화하고 있습니다. OpenTelemetry GenAI 시맨틱 컨벤션은 동일한 필드를 벤더 간에 표준화하므로, 이를 기반으로 구축한 대시보드는 특정 프로바이더에 종속되지 않아요.
| 필드 | 집계 대상 | 과금 기준 |
|---|---|---|
| input_tokens | 전송하는 모든 것: 시스템 프롬프트, 이력, 검색 컨텍스트, 질문 | 기본 입력 요율 |
| output_tokens | 모델이 생성하는 모든 것 | 기본 출력 요율 (입력의 3-6배) |
| cache_read_tokens | 이전 캐시에서 재사용된 입력 | 기본 입력의 0.1배-0.25배 |
| cache_write_tokens | 캐시에 처음 기록된 입력 | 기본 입력의 약 1.25배 (Anthropic 5분 TTL) |
| reasoning_tokens | 내부 사고 체인, 출력의 하위 집합 | 출력 요율 |
세 가지 관계가 대부분의 작업을 수행합니다: 총 토큰 = 입력 + 출력; 입력 = 비캐시 + cache_read + cache_write; 그리고 추론 토큰은 출력 안에 있으며 출력 요율로 과금돼요. 이 관계를 정확히 반영하면 요청당 추정치가 실제와 가깝게 유지되고, 무시하면 대시보드가 매달 청구서에서 멀어집니다. 비용 모니터링은 AI 옵저버빌리티의 한 축입니다. 트레이싱과 평가가 나머지 두 축이며, 동일한 필드 어휘를 공유해요.
대시보드는 추정치를 보여줍니다. 청구서는 캐시되지 않는 유일한 비용 지표입니다.
LLM에서 토큰 100만 개는 얼마인가요?
모델과 방향에 따라 다릅니다: 토큰 100만 개는 DeepSeek-V4 입력으로 0.14달러, GPT-5.6 Terra 출력으로 15.00달러이며, 동일 단위에 100배 격차가 나요. 2026년 7월 14일 가격 조사에서 확인한 4개 모델을 공식 페이지와 대조한 결과입니다:
| 모델 | 입력 / 토큰 100만 개 | 출력 / 토큰 100만 개 | 캐시 입력 / 토큰 100만 개 |
|---|---|---|---|
| Claude Sonnet 5 | $3.00 | $15.00 | $0.30 |
| GPT-5.6 Terra | $2.50 | $15.00 | $0.25 |
| Gemini 2.5 Pro | $1.25 | $10.00 | $0.31 |
| DeepSeek-V4 | $0.14 | $0.28 | $0.003 |
출처: OpenAI 가격 및 Anthropic 가격. 참고: Claude Sonnet 5는 2026년 8월 31일까지 입력 $2.00 / 출력 $10.00의 소개 가격을 적용하며, 이후 위 숫자로 복귀합니다.
실제로 중요한 5가지 지표
5가지 지표가 LLM 비용 추적을 담당하며, 대부분의 팀은 그중 2가지만 알림합니다. 처음 두 행부터 시작하세요: 요청당 토큰은 프롬프트 비대가 나타난 당일 잡아주고, 팀당 비용은 결국 재무팀이 요구하는 숫자입니다. 나머지 세 가지는 이 둘이 구축된 후 그림을 정교하게 만들어줘요.
| 지표 | 계산 방법 | 중요한 이유 | 알림 임계값 |
|---|---|---|---|
| 요청당 토큰 | 호출별 입력 + 출력 합산, 기능별 그룹화 | 프롬프트 비대와 컨텍스트 과적이 여기서 먼저 나타남 | 7일 중앙값 대비 +30% |
| 기능 / 팀 / 모델당 비용 | 추정 비용 합산, 태그 또는 가상 키별 그룹화 | 유닛 차징과 예산 운영의 실제 기준 | 월 예산의 80% |
| 캐시 적중률 | cache_read / 총 입력 토큰 | 낮은 비율은 반복 프롬프트에 정가를 지불한다는 뜻 | 안정 트래픽에서 50% 미만 |
| 대화 / 세션당 비용 | 한 세션의 모든 턴 비용 합산 | 요청 단위 뷰가 놓치는 폭주 멀티턴 에이전트를 노출 | 90백분위 세션의 2배 |
| 급등 / 이상률 | 총 지출의 전일 대비 변동 | 청구서 전에 고장 루프를 잡는 유일한 지표 | 전일 대비 +50% |
입도 관련 참고: Datadog은 비용 문서에 따라 요청 단위 비용을 나노달러(달러의 10억 분의 1)로 저장합니다. 토큰 백만 개당 0.14달러인 DeepSeek-V4 요청 하나는 1센트의 1000분의 1 미만일 수 있으므로, 반올림 전에 집계하세요. 그렇지 않으면 소형 모델 트래픽이 보고서에서 사라져요.
아무것도 추적하지 않는다면, 1행과 2행만 추적하세요. 요청당 토큰은 가장 빠른 조기 경보이고, 팀당 비용은 회계 부서와 마주해도 살아남는 지표입니다.
LLM 비용 모니터링을 구축하는 3가지 방법
이 검색어 상위 랭킹 페이지 중 실행 가능한 코드 한 줄을 제공하는 곳은 없으므로, 여기 작동하는 3가지 설정을 소개합니다. 각각 하루 안에 라이브에 올릴 수 있고, 조합이 가능합니다: 우리는 처음 두 가지를 함께 운영해요.
프로덕션에서 실제로 운영하는 것: 우리 설정에서는 모든 클라이언트 에이전트가 자체 가상 키로 LiteLLM 프록시에 연결하고, 각 키에 월 예산을 설정하며, 프록시 뒤에서 Langfuse가 모든 요청을 트레이싱합니다. 두 가지를 함께 배포했을 때 역할 분담이 핵심이었어요: 프록시가 상한을 강제하고, 트레이스가 무엇을 소비했는지 설명합니다. 각 클라이언트 키에는 분당 100,000 토큰의 tpm_limit도 두 번째 퓨즈로 설정되어 있어요. LiteLLM 문서에 따르면, 프록시는 한도에 도달하면 요청을 거부하며, 이 문서화된 동작이 우리가 의존하는 것이지 자체 측정한 벤치마크가 아닙니다. 우리 설정은 2026년 3월 공급망 사고에 연루된 LiteLLM 1.82.7과 1.82.8을 완전히 건너뛰고, latest에 떠다니지 않고 이미지 태그를 고정합니다.
LiteLLM 프록시: 가상 키 + 예산
Techsy는 클라이언트당 하나의 가상 키와 각 키에 월 예산을 설정한 LiteLLM 프록시 구성을 프로덕션에서 운영합니다. 아래 요청은 LiteLLM virtual_keys 문서의 문서화된 형식입니다: 해당 문서에 따르면, 이 키의 누적 지출이 한 달에 50달러를 초과하면 프록시는 사후 경고 로그 대신 예산 초과 오류로 추가 요청을 거부해요.
curl -X POST http://localhost:4000/key/generate \
-H "Authorization: Bearer $LITELLM_MASTER_KEY" \
-H "Content-Type: application/json" \
-d '{
"key_alias": "client-acme-search",
"max_budget": 50.0,
"budget_duration": "monthly",
"tpm_limit": 100000,
"models": ["anthropic/claude-sonnet-4-5"]
}'공개 가격으로 계산해 보세요: Claude Sonnet 5의 토큰 백만 개당 $3.00 / $15.00 기준, 50달러는 약 16.7M 입력 토큰 또는 3.3M 출력 토큰을 구매하며, 우리 경량 클라이언트 에이전트 중 하나의 약 일주일 트래픽입니다. 정확히 우리가 원하는 폭발 반경이에요. tpm_limit은 두 번째 퓨즈입니다: 폭주 루프가 월 예산에 도달하기 훨씬 전에 분당 10만 토큰 한도를 먼저 트리거해요. 사용자 단위 귀속도 users 엔드포인트로 동일하게 작동하며, 최고 LLM 게이트웨이 도구 가이드에서 프록시가 제자리를 찾는 시점과 단순한 추가 홉에 불과한 시점을 다룹니다.
Langfuse: @observe 비용 트레이싱
Google 자동완성이 "langfuse monitoring"을 이 검색어와 짝짓는 데는 이유가 있어요: Langfuse는 오픈소스 트레이싱의 기본값입니다. Python SDK가 프로바이더 클라이언트를 래핑하여 모든 호출이 토큰 수와 계산된 비용을 담은 트레이스가 되며, Langfuse 트레이싱 문서에 설명되어 있습니다:
# pip install langfuse openai
from langfuse import observe
from langfuse.openai import openai # drop-in wrapper, auto-traces
@observe()
def answer(question: str):
return openai.chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": question}],
)
answer("what is llm cost monitoring")
# the trace now carries usage.total_tokens and total_cost,
# priced from Langfuse's model price cards비용이 토큰 계산 없이 트레이스에 기록돼요. 세션 또는 사용자 ID로 트레이스를 그룹화하여 기능별 롤업을 만들고, 데이터가 네트워크를 떠날 수 없으면 셀프 호스팅하세요.
Datadog LLM Observability: 이미 사용 중이라면
팀이 이미 Datadog 에이전트를 운영 중이라면, 그 LLM 비용 문서가 이 페이지에서 가장 깊은 단일 참고 자료입니다: 나노달러 단위 요청 레벨 비용, 팀 및 기능 분류용 커스텀 cost_tags, 부분 비용 공백에 대한 실제 문제 해결 섹션까지 있어요. 솔직한 한계: Datadog 전용입니다. 지표가 플랫폼을 떠나지 않으며, 가격이 맞지 않을 때 오픈소스 대안이 없어요. 통합을 위해 선택하지, 유연성을 위해 선택하지 마세요.
예산, 알림, 차징백은 어떻게 구축하나요?
세 가지 레이어로 구축합니다: 한도에서 요청을 거부하는 예산 상한, 상한 전 백분율 임계값에서 발생하는 웹훅 알림, 그리고 쇼백과 차징백을 논쟁 대신 쿼리로 바꾸는 팀별 가상 키. LiteLLM은 세 가지 모두 네이티브로 제공하며, 이 패턴은 키 레벨 예산이 있는 모든 게이트웨이에 적용됩니다.
세기만 하는 예산은 보고서이고, 상한에서 요청을 거부하는 예산은 통제입니다.
급등 전에 발생하는 알림
알림을 100%가 아닌 상한의 80%에 설정하세요. LiteLLM은 Slack 알림을 내장하고 있어요: general_settings에 alerting: ["slack"]과 alerting_threshold: 80을 설정하고, SLACK_WEBHOOK_URL 환경 변수를 채널에 지정하면, 키가 임계값을 넘을 때 이런 메시지가 도착합니다:
{
"text": "LLM budget alert: client-acme-search spent $40.18 of its $50.00 monthly cap (80.4%). Top model: anthropic/claude-sonnet-4-5."
}80%에서는 사람이 아직 대응할 며칠이 있어요: 모델을 다운그레이드하거나, 프롬프트를 줄이거나, 승인자 이름을 붙여 상한을 올리세요. 100% 알림은 부검입니다.
쇼백에서 차징백으로
쇼백은 각 팀이 자체 지출을 보는 것이고, 차징백은 팀 예산에서 차감하는 것입니다. 둘 다 하나의 재료로 작동해요: 팀별 가상 키, 생성 시 태그 부여. 월 보고서가 지출 테이블의 group-by가 됩니다:
| 팀 | 월 예산 | 현재까지 지출 | 상태 |
|---|---|---|---|
| search | $50 | $40.18 | 80%에서 알림 발생 |
| support-chat | $200 | $112.40 | 정상 궤도 |
| evals-batch | $30 | $29.97 | 상한 도달, 거부 중 |
| sandbox | $10 | $1.06 | 정상 궤도 |
예시 형식이며 클라이언트 데이터가 아닙니다. evals-batch 행은 패턴이 의도대로 작동하는 사례예요: 배치 작업이 상한까지 실행되고 조용히 청구서로 새어나가지 않고 멈췄습니다. 강제 동작은 LiteLLM virtual_keys 문서에 문서화되어 있으며, 예산 기간 초기화 방법도 포함됩니다.
대시보드가 청구서와 일치하지 않는 이유는?
대시보드는 정가로 과금하지만 청구서는 모니터링이 보지 못하는 할인을 적용하기 때문이에요. 캐시 입력은 기본 가격의 0.1배에서 0.25배로, 배치는 절반으로, 추론 토큰은 출력 수 안에서 출력 요율로 과금됩니다. 두 숫자가 갈라지면 청구서가 보통 더 낮고, 그 차이는 거의 항상 네 가지 조정자 중 하나입니다.
| 가격 조정자 | 일반적 배수 | 추정치에 미치는 영향 |
|---|---|---|
| 캐시 입력 (캐시 읽기) | 기본 입력의 0.1배-0.25배 | 캐시 적중을 정가로 과금하면 대시보드가 높게 나옴 |
| 배치 API | 입력과 출력에 0.5배 | 비동기 작업이 추적된 숫자의 절반 비용 |
| 추론 토큰 | 1배 출력 요율, 출력 내에 집계 | 긴 사고 체인이 출력 예산을 조용히 소모 |
| 캐시 쓰기 | 기본 입력의 약 1.25배 | 캐시 창 내 첫 요청이 약간 더 비쌈 |
오픈소스 pydantic/genai-prices 카탈로그는 이 배수가 모델마다 다른 이유를 보여줘요: 각 프로바이더가 자체 캐시 및 배치 계수를 설정하므로, 하드코딩된 단일 가격 테이블은 프로바이더가 가격표를 수정하는 날 바로 어긋납니다. Datadog 비용 문서는 문제의 다른 절반을 문서화하는데, 누락된 토큰 필드가 요청에 COST UNAVAILABLE을 반환하는 부분 비용 공백이에요. 대시보드가 청구서보다 낮게 읽히면 거기를 확인하고, 높게 읽히면 할인 테이블을 확인하세요. 가장 큰 배수 뒤의 메커니즘은 LLM 프롬프트 캐싱이며, 높은 캐시 적중률이 추적 추정치가 실제 청구서를 초과하는 가장 흔한 이유입니다.
캐시 적중과 배치 할인을 반영하지 않은 비용 추정치는 예측이 아니라 상한선입니다.
실제로 LLM 비용 추적을 하는 도구는?
6개 도구가 대부분의 프로덕션 설정을 커버합니다: Langfuse, LiteLLM, Helicone, Portkey가 오픈소스 및 게이트웨이 쪽이고, Datadog과 Braintrust가 상용 쪽이에요. 솔직한 구분은 강제 대 관측입니다: 프록시는 예산에서 요청을 거부할 수 있고, 트레이싱 도구는 사후에 지출을 측정해요. 성숙한 스택은 대부분 각각 하나씩 갖추게 됩니다.
| 도구 | 유형 | 비용 추적 방식 | 무료 티어 | 이런 경우 선택 |
|---|---|---|---|---|
| Langfuse | 오픈소스 | 모델 가격 카드 기반 트레이스당 비용, 셀프 호스팅 가능 | 셀프 호스팅 무료; 클라우드 무료 취미 티어 | 오픈소스를 원하고 데이터를 소유하고 싶을 때 |
| LiteLLM | 오픈소스 프록시 | 게이트웨이에서 강제되는 키 및 팀 예산 | 무료 (OSS); 유료 엔터프라이즈 | 세는 것뿐 아니라 요청을 거부하는 예산이 필요할 때 |
| Helicone | 오픈소스 게이트웨이 | 키 및 모델별 프록시 레벨 비용 로그 | 속도 제한이 있는 무료 티어 | SDK 변경 없이 한 줄 프록시 교체를 원할 때 |
| Portkey | 상용 게이트웨이 | 가상 키 예산 + 비용 분석 | 무료 개발자 티어 | 게이트웨이, 프롬프트, 평가를 한 패널에서 원할 때 |
| Datadog LLM Observability | 상용 | 나노달러 요청 지표 + cost_tags | 14일 체험판 | 이미 다른 모든 것에 Datadog을 운영할 때 |
| Braintrust | 상용 | 프로젝트당 평가 연결 지출 | 무료 티어 | 비용 작업이 청구서가 아니라 평가에서 시작할 때 |
이 분야 벤더 콘텐츠에 대한 주의점: Braintrust 자체 2026년 비용 추적 도구 비교는 자신을 1위로 올리고 위 테이블의 모든 오픈소스 옵션을 생략합니다. 벤더 리스트클은 데이터만 참고하고 순위는 참고하지 마세요.
제로에서 시작하는 팀이라면, 우리는 LiteLLM을 앞에, Langfuse를 뒤에 운영할 거예요: 프록시가 예산을 강제하고, 트레이스가 설명하며, 호스팅 플랜에 진입하기 전까지 비용이 들지 않아요. 두 트레이싱 기본값을 저울 중이라면, Langfuse vs Langsmith 분석에서 그 선택을 깊이 다루고, 최고 AI 옵저버빌리티 플랫폼 라운드업이 전체 분야를 커버합니다.
모니터링에서 비용 절감으로
모니터링은 돈이 어디로 가는지 보여줍니다. 다음 단계는 얼마나 거기로 갈지 결정하는 것이에요. 세 가지 레버를 수익 순서로: 반복 입력 캐싱, 쉬운 요청을 저렴한 모델로 라우팅, 품질이 유지되는 선에서 모델 다운사이징. LLM API 비용 절감 가이드가 각 레버를 다루고, LLM API 가격 비교가 위 모든 계산의 입력값입니다.
우리 관점: 클라이언트의 LLM 지출이 그들을 놀라게 할 때, 우리는 먼저 모니터링하고 나중에 절감하며, 절대 그 반대로 하지 않아요. 측정 전에 캐싱하는 팀은 보통 잘못된 프롬프트를 캐싱하게 됩니다. 모니터링은 돈이 어디로 가는지 말해주고, 캐싱과 라우팅이 얼마나 거기로 갈지 결정해요. 이미 청구서가 아프다면, 무료 상담을 받으세요. 숫자를 함께 살펴보겠습니다.
저자 소개
Mert Batur는 Techsy.io의 공동 창업자로, 팀은 B2B 클라이언트를 위한 AI 에이전트, 자동화 시스템, 음성/SDR 파이프라인을 구축합니다. Techsy 팀이 실제로 프로덕션에서 사용하는 LLM 도구 스택에 대해 쓰고 있어요. LinkedIn에서 연결하세요.
자주 묻는 질문
LLM에서 토큰 100만 개는 얼마인가요?
정가 기준, 모델과 방향에 따라 토큰 백만 개당 0.14달러에서 15달러까지입니다: DeepSeek-V4 입력은 백만 개당 0.14달러, GPT-5.6 Terra 출력은 15달러예요. 출력 토큰은 모든 주요 프로바이더에서 입력 요율의 3배에서 6배입니다. 첫 섹션 테이블에 4개 모델이 있고, LLM API 가격 비교에서 17개 전체 모델의 가격을 확인할 수 있으며, 2026년 7월에 OpenAI 및 Anthropic 페이지와 대조했어요.
LLM 비용 최적화란 무엇인가요?
품질을 떨어뜨리지 않고 요청당 비용을 낮추는 실무입니다: 반복 입력에 프롬프트 캐싱, 쉬운 작업을 저렴한 모델로 라우팅, 비동기 작업에 배치 API, 기능별 모델 적정화. LLM 비용 모니터링은 전제 조건이에요. 귀속하지 않은 것은 최적화할 수 없으니까요. 캐시 적중률과 기능당 비용이 가장 큰 레버를 먼저 가리키는 두 지표입니다.
LLM은 왜 그렇게 비싼가요?
추론은 컴퓨트 집약적입니다: 생성되는 모든 토큰이 GPU에서 모델의 완전한 포워드 패스를 실행하며, 추론 모델은 답변 전에 추가 토큰을 생각에 쓰고 출력 요율로 과금돼요. 긴 시스템 프롬프트는 모든 단일 요청에서 그 비용을 곱합니다. 청구서는 호출 양쪽의 장황함에 비례해 자라므로, 요청당 토큰이 가장 먼저 지켜볼 가치가 있는 지표예요.
미국에서 LLM 비용은 얼마인가요?
API 가격은 USD 기준이며 글로벌합니다: OpenAI, Anthropic, Google은 요청이 오하이오에서 오든 오사카에서 오든 토큰 백만 개당 동일한 정가를 과금해요. 지역 차이는 셀프 호스팅에서 나타나며, GPU 시간은 클라우드 리전에 따라 다르고, 마크업을 추가하는 호스팅 플랫폼에서도 나타납니다. API 작업에서 위치는 지연 시간을 바꾸지 가격을 바꾸지 않아요.
팀별 LLM 비용은 어떻게 추적하나요?
LiteLLM 같은 프록시를 통해 팀당 하나의 가상 키를 발급하고, 생성 시 각 키에 팀 이름을 태그한 뒤, 해당 태그로 지출을 집계하세요. 그러면 모든 요청이 생성 순간부터 귀속 정보를 가지며, 로그 파싱이 필요 없어요. 위 예산 섹션의 쇼백 테이블이 최종 산출물입니다: 팀, 월 예산, 현재까지 지출, 상태.
LLM 비용 추적에 Langfuse vs Datadog: 무엇을 선택하나요?
오픈소스, 셀프 호스팅, 직접 통제하는 데이터를 원하면 Langfuse를 선택하세요. 실행 비용이 무료이고 곧바로 요청당 비용을 트레이싱해요. 팀이 이미 인프라에 Datadog을 운영할 때만 Datadog을 선택하세요. LLM 비용 기능이 플랫폼을 떠나지 않으니까요. 새로 시작하는 대부분의 팀에게는 Langfuse + LiteLLM 프록시가 어느 하나 단독보다 나아요.
추정 LLM 비용이 실제 청구서와 일치하나요?
아니요, 보통 청구서가 더 낮습니다. 대시보드는 정가로 과금하지만 캐시 입력은 0.1배에서 0.25배, 배치 작업은 0.5배로 적용되므로, 캐시가 많은 워크로드는 실제 청구서가 추적 추정치보다 훨씬 낮게 나와요. 누락된 토큰 필드는 오차를 반대 방향으로 밀어냅니다. 위 드리프트 테이블에 각 배수와 확인할 위치가 나열되어 있어요.
LLM 지출 급등에 어떻게 알림하나요?
각 팀 월 예산의 80%에 임계값 알림을 설정하여 Slack으로 웹훅 전송하고, 빠르게 소모하는 루프를 위해 전일 대비 +50% 이상률 알림을 추가하세요. LiteLLM은 alerting_threshold 설정으로 임계값 패턴을 네이티브로 제공해요. 80% 알림은 대응할 며칠을 남겨주고, 100% 알림은 상한이 제 역할을 했다는 확인만 해줍니다.
무료 LLM 비용 추적기가 있나요?
네, 신뢰할 만한 것이 세 가지입니다. Langfuse 셀프 호스팅은 무료 오픈소스이며, Langfuse 가격 페이지에 따라 클라우드 무료 취미 티어도 있어요. LiteLLM 내장 키 예산은 오픈소스 프록시에서 비용이 들지 않습니다. Helicone 무료 티어는 속도 제한이 있는 프록시 레벨 비용 로그를 커버해요. 무료 티어는 모니터링을 커버하고, 대규모 강제와 알림이 유료 플랜이 시작되는 지점입니다.
결론
오늘 설정 경로를 선택하세요. 6주 후에 원할 알림을 지금 구축하는 데 오후 한나절이면 됩니다. 짧은 버전:
- 먼저 요청당 토큰과 팀당 비용을 추적하고, 작동하면 나머지 세 지표를 추가하세요.
- 요청을 거부하는 예산은 통제이고, 세기만 하는 예산은 보고서입니다.
- 청구서가 누구도 놀라게 하기 전에, Slack에서 80%에 알림을 설정하세요.
- 대시보드는 추정치입니다. 캐시 입력과 배치 가격 덕분에 청구서는 보통 그 아래로 떨어져요.
숫자를 함께 살펴보고 싶으시다면, 무료 상담을 받으세요.