
LLM 추론 비용은 얼마일까? 4가지 시나리오별 실제 계산
2023년 3월, GPT-4는 입력 토큰 100만 개당 $30을 받았습니다. 3년이 지난 지금, GPT-5.6은 같은 100만 토큰을 $10에 처리합니다. Claude Opus 4.5는 $15이고요. 바닥은? 2센트입니다. 똑같은 작업 단위인데 가장 싼 옵션과 가장 비싼 옵션 사이에 1,500배 격차가 벌어지는 셈이죠. LLM 추론 비용은 학습된 모델이 입력을 읽고 출력을 만들어 낼 때마다 내는 반복 청구 항목으로, 모든 주요 provider가 토큰 100만 개 단위로 가격을 매깁니다. 저가 모델은 입력 토큰 100만 개당 $0.02~$0.30, 프론티어 모델은 같은 양에 $15~$75를 받습니다. 이 격차가 중요한 이유는, 실제로 필요한 등급을 결정하는 건 여러분의 야심이 아니라 워크로드이기 때문입니다.
핵심 요약:
- 저가 모델은 입력 토큰 100만 개당 $0.02~$0.30, 프론티어 모델은 $15~$75입니다(2026년 7월 기준).
- 출력 토큰은 입력 토큰보다 3~5배 비쌉니다. 생성은 병렬이 아니라 순차 처리이기 때문입니다.
- 대화 5만 건 규모의 고객지원 챗봇은 모델 등급에 따라 월 약 $9~$420이 듭니다.
- 추론 가격은 연 약 10배씩 내려갔고, Gartner는 2030년까지 90% 추가 하락을 전망합니다.
LLM 추론 비용, 토큰 100만 개당 얼마일까?
LLM 추론 가격은 2026년 7월 기준으로 3단계 구조입니다. Google(Gemini 2.5 Flash) 같은 provider의 저가 모델과 오픈소스 옵션(Llama 4, Qwen 3)은 입력 토큰 100만 개당 $0.02~$0.30을 받습니다. 중간 등급 모델(GPT-4.1, Claude Sonnet 4)은 $0.55~$15 사이에 자리하고, 프론티어 추론 모델(o3, Claude Opus 4.5)은 $15~$75를 부릅니다. 모든 provider는 공식 가격 페이지에 이 요율을 공개합니다(OpenAI, Anthropic). PricePerToken.com은 300개 이상 모델을 실시간 표로 추적합니다.
2026년 7월 현재, 입력 토큰 100만 개를 최저 2센트에 돌릴 수도 있고, 프론티어 모델에서는 같은 100만 토큰에 75달러를 낼 수도 있습니다.
| 등급 | 대표 모델 | 입력 $/토큰 100만 | 출력 $/토큰 100만 | 캐시 입력 $/100만 | 적합한 용도 |
|---|---|---|---|---|---|
| 저가 | Gemini 2.5 Flash, Llama 4 Scout, Qwen 3 32B | $0.02-$0.30 | $0.06-$1.20 | $0.01-$0.15 | 대량 분류, 라우팅 |
| 중간 | GPT-4.1, Claude Sonnet 4, Gemini 2.5 Pro, GPT-5.6 | $0.55-$15 | $2.20-$60 | $0.28-$7.50 | RAG, 코드 생성, 분석 |
| 프론티어 | o3, Claude Opus 4.5 | $15-$75 | $60-$300 | $7.50-$37.50 | 복잡한 추론, 리서치 |
캐시 입력 할인을 쓰면 반복 프롬프트에서 청구액을 50~90% 줄일 수 있습니다(메커니즘은 프롬프트 캐싱으로 입력 비용 절감에서 설명합니다). 모든 provider의 현재 요율이 담긴 300개 모델 실시간 표는 전체 토큰당 가격 비교표를 참고하세요.
LLM 추론 비용을 좌우하는 4가지 구성 요소
추론 청구액은 네 가지 비용 드라이버로 나뉩니다. 토큰당 GPU 연산 시간, 모델 가중치와 KV 캐시를 위한 메모리, 생성을 읽기보다 비싸게 만드는 입력/출력 비대칭, 그리고 인프라 오버헤드(전력, 냉각, 네트워킹)입니다. 어떤 구성 요소가 내 워크로드에서 지배적인지 알면 어디서 최적화 효과가 나는지 보입니다.
| 구성 요소 | 무엇인가 | 청구액 비중 | 움직이는 변수 |
|---|---|---|---|
| 연산(GPU 시간) | 각 토큰이 모델 레이어를 지나며 소모하는 FLOPs | 40-60% | 모델 크기, 배치 크기, 양자화 수준 |
| 메모리(가중치 + KV 캐시) | 모델 파라미터와 어텐션 상태를 담는 VRAM | 20-35% | 컨텍스트 길이, 동시 요청 수 |
| 입력/출력 비대칭 | 디코드 단계는 한 번에 토큰 하나씩 순차 실행 | 출력 가격에 내장 | 출력 길이, 샘플링 전략 |
| 인프라 오버헤드 | 전력, 냉각, 네트워킹, GPU 유휴 시간 | 10-20% | 데이터센터 위치, 사용률 |
연산: 토큰당 GPU 시간
모든 토큰은 모델의 모든 레이어를 통과합니다. FP16 기준 70B 파라미터 모델은 토큰당 약 140 GFLOPs가 필요합니다. INT4로 양자화하면 약 35 GFLOPs까지 줄어듭니다. NVIDIA 추론 벤치마킹 가이드는 전체 TCO 공식을 분해해 보여줍니다. 하드웨어 상각비에 전기료와 운영 오버헤드를 더한 뒤 제공한 토큰 수로 나누는 구조입니다.
메모리: 모델 가중치 + KV 캐시
FP16 기준 70B 모델은 가중치만으로 VRAM 약 140GB를 차지합니다. KV 캐시는 컨텍스트 길이와 동시 배치 크기에 따라 커집니다. 컨텍스트 128K에 동시 요청 32개라면 80GB가 추가로 소모될 수 있습니다. 셀프 호스팅 결정에서 모델별 VRAM 요구량이 그렇게 중요한 이유가 바로 이것입니다.
입력 vs 출력 비대칭
출력 토큰이 입력 토큰보다 3~5배 비싼 이유는, 모델이 출력을 순서대로 하나씩 생성하기 때문입니다. 프롬프트를 읽을 때처럼 병렬화할 수 없습니다.
쉽게 말하면 이렇습니다. 2,000토큰짜리 프롬프트를 읽는 단계('프리필' 단계)에서는 모든 토큰을 GPU 코어 전반에서 동시에 처리합니다. 반면 출력 500토큰을 생성하는 단계('디코드' 단계)는 한 스텝에 토큰 하나씩, 각 토큰이 이전 토큰에 의존하며 진행됩니다. GPU는 스텝 사이마다 메모리 대역폭을 기다리며 대부분 놀고 있습니다. 그 유휴 시간이 바로 입력 단가의 3~5배를 내는 이유입니다.
인프라 오버헤드
전력, 냉각, 네트워킹, 그리고 요청 사이사이에 놀고 있는 GPU입니다. Hugging Face 최적화 문서는 continuous batching과 speculative decoding이 같은 하드웨어에서 GPU 시간당 토큰을 얼마나 더 짜내는지 다루며, 이 오버헤드 비중을 직접 줄여줍니다.
실제 워크로드 4가지의 LLM 추론 비용
전형적인 고객지원 챗봇은 월 $9~$420, RAG 파이프라인은 월 $168~$3,360, 개발자 200명 규모 코드 어시스턴트는 월 $123~$2,078, 문서 배치 처리는 월 $240~$6,400입니다. 이 격차는 거의 전적으로 모델 등급 선택에 달려 있습니다. 아래 4가지 시나리오는 저희 고객 배포 현장에서 나온 토큰 볼륨을 2026년 7월 공식 가격 페이지에 대입해 만들었습니다. 아래 모든 금액은 재현 가능합니다. 가정한 토큰 수에 공개 요율을 곱한 값이니까요. 벤더 주장이 아니라 저희 분석입니다.
고객지원 챗봇: 월 대화 5만 건
평균 대화: 입력 800토큰(시스템 프롬프트 + 사용자 메시지 + 검색된 컨텍스트), 출력 400토큰. 월 볼륨: 대화 50,000건 = 입력 4,000만 토큰, 출력 2,000만 토큰.
- 저가 추천 (Gemini 2.5 Flash): 4,000만 × $0.075/100만 + 2,000만 × $0.30/100만 = 월 $9. 의심스러울 정도로 쌉니다.
- 중간 추천 (Claude Sonnet 4): 4,000만 × $3/100만 + 2,000만 × $15/100만 = 월 $420.
1단계 티켓을 처리하는 지원 봇이라면 저가 모델로 문의의 90%를 무리 없이 처리합니다. 어려운 10%는 분류기로 중간 등급에 라우팅하면 됩니다.
RAG 파이프라인: 일 쿼리 1만 건
평균 쿼리: 입력 3,200토큰(검색된 청크 + 시스템 프롬프트 + 사용자 질문), 출력 600토큰. 월간: 쿼리 30만 건 = 입력 9.6억 토큰, 출력 1.8억 토큰.
- 저가 추천 (API 경유 Llama 4 Scout): 9.6억 × $0.10/100만 + 1.8억 × $0.40/100만 = 월 $168.
- 중간 추천 (GPT-4.1): 9.6억 × $2/100만 + 1.8억 × $8/100만 = 월 $3,360.
RAG 워크로드는 입력 비중이 커서 캐시 입력 할인 효과가 크게 먹힙니다. 프롬프트 캐싱 70%를 적용하면 중간 등급은 월 약 $2,100으로 내려갑니다.
코드 어시스턴트: 개발자 200명
평균 세션: 입력 4,500토큰(파일 컨텍스트 + 대화), 출력 1,200토큰. 개발자당 일 15회 요청, 근무일 22일 가정 = 월 요청 66,000건 = 입력 2.97억, 출력 7,900만.
- 저가 추천 (Qwen 3 32B): 2.97억 × $0.20/100만 + 7,900만 × $0.80/100만 = 월 $123.
- 중간 추천 (Claude Sonnet 4): 2.97억 × $3/100만 + 7,900만 × $15/100만 = 월 $2,078.
개발자는 품질 차이를 금방 알아챕니다. 코드에는 보통 중간 등급이 바닥선입니다. 저가 모델은 자동완성 스타일 제안에는 쓸만하지만 멀티 파일 리팩터링에서는 버거워합니다.
문서 배치 처리: 월 문서 100만 건
평균 문서: 입력 2,000토큰, 출력 300토큰(추출, 분류, 요약). 월간: 입력 20억, 출력 3억.
- 저가 추천 (Gemini 2.5 Flash): 20억 × $0.075/100만 + 3억 × $0.30/100만 = 월 $240.
- 중간 추천 (GPT-4.1): 20억 × $2/100만 + 3억 × $8/100만 = 월 $6,400.
이 볼륨에서는 등급 간 27배 가격 격차가 월 $6,160짜리 라인 아이템이 됩니다. 저가 모델도 구조화된 추출은 잘 처리합니다. 이 정도 볼륨을 셀프 호스팅으로 고려한다면 하드웨어 사이징은 모델별 VRAM 요구량에서 확인하세요.
| 워크로드 | 모델 | 요청당 토큰(입/출) | 월 요청 수 | 월 비용 |
|---|---|---|---|---|
| 고객지원 챗봇 | Gemini 2.5 Flash | 800 / 400 | 5만 | $9 |
| 고객지원 챗봇 | Claude Sonnet 4 | 800 / 400 | 5만 | $420 |
| RAG 파이프라인 | Llama 4 Scout | 3,200 / 600 | 30만 | $168 |
| RAG 파이프라인 | GPT-4.1 | 3,200 / 600 | 30만 | $3,360 |
| 코드 어시스턴트 | Qwen 3 32B | 4,500 / 1,200 | 6.6만 | $123 |
| 코드 어시스턴트 | Claude Sonnet 4 | 4,500 / 1,200 | 6.6만 | $2,078 |
| 문서 배치 | Gemini 2.5 Flash | 2,000 / 300 | 100만 | $240 |
| 문서 배치 | GPT-4.1 | 2,000 / 300 | 100만 | $6,400 |
def monthly_cost(input_tokens, output_tokens, requests, price_in, price_out):
"""Estimate monthly LLM inference cost.
Args:
input_tokens: avg input tokens per request
output_tokens: avg output tokens per request
requests: monthly request volume
price_in: $/M input tokens
price_out: $/M output tokens
"""
total_in = input_tokens * requests / 1_000_000
total_out = output_tokens * requests / 1_000_000
return (total_in * price_in) + (total_out * price_out)
# Example: support chatbot on Claude Sonnet 4
cost = monthly_cost(
input_tokens=800,
output_tokens=400,
requests=50_000,
price_in=3.00,
price_out=15.00
)
print(f"${cost:,.2f}/month") # $420.00/monthAPI vs 셀프 호스팅: 언제 어느 쪽이 이길까?
API가 이기는 구간은 일 요청 약 2만 건 미만이거나 팀에 ML 인프라 경험이 없을 때입니다. 셀프 호스팅이 이기는 구간은 일 20만 건 이상이면서 GPU 사용률이 50%를 꾸준히 넘을 때입니다. Introl의 분석에 따르면 손익분기점은 단일 H100 노드에서 70B급 모델 기준 일 5만~8만 건 부근입니다. 그 아래에서는 API provider의 멀티테넌트 효율이 여러분의 싱글테넌트 하드웨어 계산을 이깁니다.
| 볼륨 수준 | API 월 비용 | 셀프 호스팅 월 비용(GPU + 운영) | 승자 | 이유 |
|---|---|---|---|---|
| 저: 일 2K 요청 | $150-$400 | $2,800-$4,500 | API | GPU가 시간의 85%를 놀고 있음 |
| 중: 일 20K 요청 | $1,500-$4,000 | $3,200-$5,000 | API(간신히) | 사용률 약 40%, 아직 손익분기 미만 |
| 고: 일 200K 요청 | $15,000-$40,000 | $5,500-$8,000 | 셀프 호스팅 | 70% 이상 사용률이 하드웨어를 빠르게 상각 |
API가 이기는 경우
몇 주가 아니라 며칠 만에 출시합니다. ML 엔지니어 연봉($18만~$25만/년)도, GPU 장애 대응 온콜도, 캐파 계획도 없습니다. 엔지니어 50명 미만 팀 대부분에는 API가 정답입니다. 끝.
셀프 호스팅이 이기는 경우
일 20만 건을 넘겼고, 워크로드가 예측 가능하며, ML 인프라 인력을 이미 고용한 상태라면요. 오픈소스 모델(Llama 4, Qwen 3, Mistral)을 여러분 하드웨어에서 전기료와 상각비만으로 돌립니다. vLLM vs SGLang 벤치마크를 보면 워크로드 형태에 따라 처리량이 15~30% 차이 나는데, 이 규모에서는 그게 중요합니다.
손익분기 숫자
셀프 호스팅은 GPU 사용률이 50%를 꾸준히 넘어야만 이깁니다. 그 아래에서는 놀고 있는 실리콘에 돈을 내는 셈입니다. 숨은 인건비(ML 엔지니어 시간, 온콜, 모델 업데이트, 보안 패치)가 바로 대부분의 팀이 GPU 계산상 유리해 보여도 API에 머무는 진짜 이유입니다. 그래도 셀프 호스팅을 한다면 Modal에 모델 배포하기가 인프라 관리 레이어를 없애 주면서도 토큰당 비용을 API 요율 아래로 유지해 줍니다.
아무도 예산에 안 넣는 숨은 비용
순수 토큰 지출은 실제 청구액의 6080%입니다. 나머지는 가격 계산기에 절대 나타나지 않는 여섯 가지 라인 아이템에 숨어 있습니다. 토큰 추정치 위에 **2040%**를 추가 예산으로 잡으세요.
- 모니터링 및 관측성 도구: 월 $200~$1,500. 토큰 사용량 대시보드, 지연 시간 추적, 기능별 비용 귀속. LLM 관측성 스택은 프롬프트 회귀가 예산을 태우기 전에 잡아내는 순간 본전을 뽑습니다.
- 재시도와 실패 재실행: 요청의 3
8%는 실패하거나 재시도가 필요합니다(타임아웃, 속도 제한, 잘못된 형식의 출력). 토큰 청구액의 38%를 아무 산출물 없이 쓰는 셈입니다. - 프롬프트 엔지니어링 반복 시간: 분기당 20
60시간, 엔지니어링 풀코스트는 시간당 $100$200. 프롬프트를 한 번 건드릴 때마다 테스트 배치를 다시 돌립니다. - 평가 및 회귀 테스트: 자동 평가 스위트의 토큰 지출이 월 $100~$800. 모델이 자기 자신을 채점하는 데 돈을 내는 겁니다.
- 멀리전 중복 구성: 지연 시간이나 컴플라이언스 때문에 리전 간 페일오버가 필요하면 인프라 비용이 1.5~2배입니다.
- 콜드스타트 지연 페널티: 서버리스 GPU 배포(Modal, AWS Lambda)는 유휴 시간에도 과금합니다. 콜드스타트는 2~8초를 더하고 웜업 시간까지 청구합니다.
경험칙 하나: 순수 토큰 추정치에 1.3을 곱하면 현실적인 예산입니다. 규제 산업이라 컴플라이언스 오버헤드가 있다면 1.4를 곱하세요.
LLM 추론은 왜 계속 저렴해질까?
LLM 추론 가격은 2023년 이후 연 약 10배씩 내려갔습니다. 2024년에 월 $1,000이던 워크로드가 지금은 $100 부근입니다. 세 가지 힘이 이를 이끕니다. 하드웨어 개선(NVIDIA Blackwell FP4, Google TPU v6), 경쟁 압력(DeepSeek와 오픈소스 모델이 촉발한 가격 경쟁), 그리고 소프트웨어 최적화(speculative decoding, continuous batching, 양자화)입니다. Gartner는 추론 비용이 2030년까지 90% 더 떨어진다고 전망하지만, 이건 전망이지 보장은 아닙니다.
Epoch AI의 가격 추적은 이 하락을 실제 데이터 포인트로 기록합니다. a16z의 'LLMflation' 분석은 이 용어를 만들었고 경제적 함의를 정리했습니다. 추론은 이전의 어떤 연산 카테고리보다 빠르게 디플레이션되고 있다는 것입니다.
학습 비용 vs 추론 비용
프론티어 모델 학습에는 $5,000만~$2억이 듭니다(일회성). 같은 모델의 추론은 전체 사용자 기준으로 규모에 따라 연 $500만~$5,000만입니다. 대부분의 팀에서 비율은 10100배입니다. 학습 비용이 1년 치 추론 비용의 10100배라는 뜻이죠. 하지만 학습은 일회성 자본 지출입니다. 추론은 사용자 성장과 함께 불어나는 반복 운영 비용입니다. 파운데이션 모델을 직접 만들지 않는 한 학습 비용은 낼 일이 없습니다. 추론 비용은 매일 냅니다.
전기료 라인 아이템
NVIDIA H100은 부하 시 약 700W를 소모합니다. $0.10/kWh(미국 평균) 기준 GPU 시간당 $0.07입니다. 단일 H100에서 70B 모델은 배치 시 초당 출력 토큰 약 2,000개를 생성합니다. 1시간이면 720만 토큰입니다. 출력 토큰 100만 개당 전기료는 약 $0.01. 저희 계산이며, 그렇게 표기합니다. 전기는 API 청구액의 13%지만 셀프 호스팅 TCO에서는 815%입니다. 전기료가 비싼 지역(독일은 $0.30/kWh)에서 자체 GPU를 돌린다면 이 숫자가 3배가 되며 훨씬 중요해집니다.
실무적 시사점: 가격이 충분히 빠르게 떨어지고 있어서 특정 모델 등급에 12개월 약정을 거는 것은 리스크입니다. 분기마다 재평가하세요. LLM 비용 절감 12가지 방법은 거시 추세가 큰 일을 해 주는 동안 지금 당장 쓸 수 있는 전술적 수를 다룹니다.
내 추론 비용은 어떻게 추정할까?
월 LLM 추론 비용은 네 단계로 추정합니다. 요청당 토큰 수를 세고, 월 볼륨을 곱하고, 등급 가격을 적용한 뒤, 오버헤드 20~40%를 더합니다. 고객사 추론 예산을 산정해 본 경험상, 대부분의 팀이 4단계를 건너뛰고 실제 청구액이 추정치보다 3분의 1이나 많다고 의아해합니다. 저희가 쓰는 절차는 이렇습니다.
- 요청당 토큰 수를 측정합니다. 실제 요청 100건 이상에서 평균 입력 토큰(시스템 프롬프트 + 컨텍스트 + 사용자 메시지)과 출력 토큰(모델 응답)을 기록하세요. 찍지 말고 재세요.
- 월 볼륨을 곱합니다. 일 요청 수 × 30 = 월 요청 수. 여기에 요청당 토큰 수를 곱합니다.
- 등급 가격을 적용합니다. 총 입력 토큰에 모델의 입력 $/100만 요율을 곱합니다. 출력도 마찬가지. 둘을 더합니다.
- 오버헤드 20~40%를 더합니다. 재시도, 평가, 프롬프트 반복, 모니터링. 예산에 들어가는 숫자는 3단계가 아니라 이것입니다.
def estimate_monthly_budget(avg_input_tokens, avg_output_tokens,
requests_per_day, price_in, price_out,
overhead_pct=0.30):
"""Full monthly budget estimate with overhead."""
monthly_requests = requests_per_day * 30
raw_cost = monthly_cost(
avg_input_tokens, avg_output_tokens,
monthly_requests, price_in, price_out
)
return raw_cost * (1 + overhead_pct)
# RAG pipeline: 10K queries/day on GPT-4.1
budget = estimate_monthly_budget(
avg_input_tokens=3200,
avg_output_tokens=600,
requests_per_day=10_000,
price_in=2.00,
price_out=8.00,
overhead_pct=0.30
)
print(f"${budget:,.0f}/month") # $4,368/month자기 숫자를 알았다면, LLM 게이트웨이 도구로 트래픽을 품질 기준을 통과하는 가장 싼 모델로 라우팅하세요. 요청별 모델 선택이 되는 게이트웨이는 프롬프트를 건드리지 않고도 블렌디드 비용을 30~50% 줄일 수 있습니다.
저자 소개
Mert Batur는 Techsy.io의 공동 창업자로, 팀에서 B2B 고객사를 위한 AI 에이전트, 자동화 시스템, 음성/SDR 파이프라인을 구축하고 있습니다. Techsy 팀이 실제 프로덕션에서 쓰는 LLM 도구 스택에 대해 씁니다. LinkedIn에서 연결하기.
자주 묻는 질문
LLM 추론은 비싼가요?
규모와 모델 선택에 달려 있습니다. 입력 토큰 100만 개는 Gemini 2.5 Flash에서 $0.02, 프론티어 추론 모델에서 $75입니다. 일 1만 건을 처리하는 작은 앱이라면 월 $50~$400을 예상하세요. 일 100만 건 이상 엔터프라이즈 워크로드는 월 $5,000~$40,000입니다. 단위당 비용은 낮지만, 볼륨이 쌓이게 만듭니다.
LLM에서 토큰 100만 개는 얼마나 되나요?
토큰 100만 개는 약 75만 단어, 장편 소설 약 10권 분량입니다. 2026년 7월 기준 입력 토큰 100만 개 처리 비용은 $0.02(저가 등급)에서 $75(프론티어 등급)입니다. 같은 양의 출력 토큰은 $0.06~$300입니다. 대부분의 프로덕션 워크로드는 중간 등급에 걸립니다. 입력 토큰 100만 개당 $2~$15입니다.
AI 추론은 왜 그렇게 비싼가요?
추론은 개당 $25,000~$40,000짜리 GPU에서 모든 토큰을 수십억 개의 모델 파라미터에 통과시켜야 합니다. 디코드 단계는 토큰을 순차 생성하므로 스텝 사이마다 GPU 코어가 놀게 됩니다. 전용 하드웨어, 전기, 냉각, 그리고 서빙 스택을 24시간 돌리는 provider의 엔지니어링 팀에 돈을 내는 것입니다.
AI 추론 비용은 내려가고 있나요?
네, 2023년 이후 연 약 10배씩입니다. GPT-4는 토큰 100만 개당 $30/$60(입력/출력)으로 출시됐습니다. 같은 수준의 성능이 지금은 $2~$10입니다. Epoch AI 데이터는 모든 provider에서 이 추세를 확인해 줍니다. Gartner는 하드웨어 개선과 오픈소스 모델의 경쟁 압력으로 2030년까지 90% 추가 하락을 전망합니다.
2026년 LLM 추론 비용은 얼마인가요?
저가 모델: 입력 토큰 100만 개당 $0.02~$0.30. 중간: $0.55~$15. 프론티어: $15~$75. 전형적인 프로덕션 워크로드(고객지원 챗봇, RAG 파이프라인, 코드 어시스턴트)는 중간 등급 모델에서 월 $150~$4,000입니다. 저가 모델은 대량이면서 복잡도가 낮은 작업을 10~30배 저렴하게 처리합니다.
학습 비용과 추론 비용의 차이는 무엇인가요?
학습은 모델을 처음부터 가르치는 일회성 비용입니다. 프론티어 모델은 $5,000만~$2억이 들고 수천 개 GPU를 몇 달간 돌려야 합니다. 추론은 그 학습된 모델을 사용하는 반복 비용입니다. 입력을 넣어 출력을 받고 토큰 단위로 과금됩니다. 대부분의 팀에게 청구서는 추론뿐입니다. 학습은 파운데이션 모델을 만드는 회사의 일입니다.
제 앱의 LLM 추론 비용은 어떻게 계산하나요?
요청당 평균 입력 토큰에 월 요청 볼륨을 곱하고, 다시 모델의 입력 $/100만 요율을 곱하세요. 출력 토큰도 같은 방식으로 합니다. 둘을 더하고 재시도, 평가, 모니터링 오버헤드 30%를 추가하세요. 이 글의 Python 스니펫이 이 계산을 자동화합니다. 찍지 말고 실제 토큰 수를 재세요. 요청 100건 이상의 로그면 신뢰할 만한 평균이 나옵니다.
출력 토큰이 입력 토큰보다 비싼가요?
네, 보통 3~5배 비쌉니다. 입력 처리(프리필)는 모든 토큰을 동시에 병렬화해 GPU 코어를 가득 씁니다. 출력 생성(디코드)은 한 번에 토큰 하나씩, 각 토큰이 이전 토큰에 의존합니다. GPU는 스텝 사이마다 메모리 대역폭을 기다립니다. provider는 이 낮은 하드웨어 효율을 반영해 출력에 더 높은 가격을 매깁니다.
셀프 호스팅 추론이 API보다 싼가요?
일 20만 건 이상이면서 GPU 사용률이 50%를 꾸준히 넘을 때만 쌉니다. 그 아래에서는 API provider의 멀티테넌트 효율이 싱글테넌트 하드웨어를 이깁니다. 셀프 호스팅에는 숨은 비용도 따라붙습니다. ML 엔지니어 연봉($18만~$25만/년), 온콜 로테이션, 모델 업데이트, 보안 패치입니다. 엔지니어 50명 미만 팀 대부분은 API에 머무는 편이 낫습니다.
LLM 추론은 전기를 많이 쓰나요?
H100 GPU는 부하 시 약 700W를 소모합니다. $0.10/kWh 기준 GPU 시간당 $0.07이고, 70B 모델 기준 출력 토큰 100만 개당 약 $0.01로 환산됩니다. 전기는 API 청구액의 13%지만 셀프 호스팅 TCO의 815%입니다. 전기료가 비싼 지역(독일 $0.30/kWh)에서는 전기 비중이 3배가 되어 셀프 호스팅 경제성을 실질적으로 좌우합니다.
핵심 정리
기억할 숫자 네 가지: $0.02(입력 토큰 100만 개당 저가 바닥), 35배(출력의 입력 대비 프리미엄), 2040%(순수 토큰 계산 위에 더할 오버헤드), 10배(2023년 이후 연 가격 하락). 실제 청구액은 볼륨, 모델 등급, 그리고 캐싱·배칭·트래픽 라우팅을 얼마나 공격적으로 하느냐에 달려 있습니다.
Techsy에서는 저희 팀이 프로덕션 LLM 워크로드를 운영하는 B2B 고객사의 추론 예산을 산정하고 모델 등급을 고릅니다. 비용 모델에 제3의 눈이 필요하다면 무료 상담 받기로 오세요.