Techsy
문의하기
시작하기
블로그로 돌아가기
guides

2026년 LLM API 가격 비교: 주요 모델별 요금 총정리

작성자 Mert Batur Gürbüz
수정일 Jul 18, 2026
9 분 읽기
목차
2026년 LLM API 가격 비교: 주요 모델별 요금 총정리

2026년 LLM API 가격 비교: 주요 모델별 요금 총정리

LLM API 가격 비교는 간단해 보이지만, 직접 만들어보려 하면 생각보다 복잡합니다. 2026년 상반기에만 가격이 두 번 변동되었고, 각 제공업체마다 입력과 출력 토큰에 서로 다른 요금을 적용하며, 홍보용 '대표' 숫자는 실제 청구 금액과 거의 일치하지 않기 때문입니다. 그래서 아래 모든 수치는 2026년 7월 14일 기준 공식 가격 페이지에서 직접 가져왔으며, 마지막에는 실제 워크로드를 가정하여 계산한 예시를 포함했습니다.

전체 LLM API 가격표 (2026년)

다음은 100만 토큰당 미화(USD) 기준으로 정리한 전체 모델 목록입니다. 많은 분들이 스크린샷으로 저장하는 표이니 가장 먼저 소개합니다.

모델입력출력캐시된 입력컨텍스트
Claude Opus 4.8$5.00$25.00$0.501M
Claude Sonnet 5$3.00$15.00$0.301M
Claude Haiku 4.5$1.00$5.00$0.10200K
Claude Fable 5$10.00$50.00$1.001M
GPT-5.6 Sol$5.00$30.00$0.501.05M
GPT-5.6 Terra$2.50$15.00$0.251.05M
GPT-5.6 Luna$1.00$6.00$0.101.05M
GPT-5.4 nano$0.20$1.25$0.021.1M
Gemini 2.5 Pro$1.25$10.00$0.311M
Gemini 2.5 Flash$0.30$2.50$0.031M
Gemini 2.5 Flash-Lite$0.10$0.40$0.011M
DeepSeek-V4$0.14$0.28$0.0031M
Zhipu GLM-4.6$0.43$1.74해당 없음205K
Alibaba Qwen3-Max$1.20$6.00해당 없음262K
Mistral Medium 3.5$1.50$7.50해당 없음128K
Mistral Large 3$0.50$1.50해당 없음128K
Mistral Small 4$0.15$0.60해당 없음32K

주의해야 할 두 가지 사항이 있습니다. 첫째, Claude Sonnet 5는 2026년 8월 31일까지 백만 토큰당 입력 $2.00 / 출력 $10.00의 introductory pricing(초기 할인 가격)을 적용받으며, 이후에는 위 표의 $3.00 / $15.00로 정상 가격으로 전환됩니다. 둘째, Gemini 2.5 Pro는 단일 프롬프트가 20만 토큰을 초과하면 입력 $2.50 / 출력 $15.00로 요금이 상승하므로, 표면적인 '목록' 가격은 사실상 최저가일 뿐입니다.

또한 여기에 나열된 모든 모델은 입력과 출력 모두에 대해 Batch API 사용 시 정액 50% 할인을 제공합니다(Anthropic, OpenAI, Google, Alibaba). 이 내용은 아래 실전 예제에서 반영할 예정입니다.

실제로 지불하는 비용의 구성 요소

청구서에 영향을 미치는 세 가지 핵심 숫자가 있지만, 대부분의 가격 페이지에서는 그중 두 가지를 숨기고 있습니다.

  • 입력 토큰(Input tokens): 시스템 프롬프트, 대화 기록, 검색된 컨텍스트, 사용자의 질문 등 사용자가 전송하는 모든 데이터를 포함합니다. 채팅 및 RAG 애플리케이션에서는 일반적으로 이 부분이 비용의 절반 이상을 차지합니다.
  • 출력 토큰(Output tokens): 모델이 생성하는 텍스트로, 거의 모든 제공업체에서 입력 토큰보다 3~6배 더 비쌉니다. 예를 들어 GPT-5.6 Terra는 입력 $2.50, 출력 $15.00로 6배의 차이가 납니다. 따라서 응답이 길어질수록 비용 부담이 커집니다.
  • 캐시된 입력(Cached input): 간과하기 쉬운 부분입니다. 매 요청마다 동일한 시스템 프롬프트를 전송한다면, 프롬프트 캐싱을 통해 반복되는 토큰을 정상 요금의 약 10% 수준으로 청구받을 수 있습니다. 위 표의 '캐시된 입력' 열을 보면 Claude Opus 4.8이 $5.00에서 $0.50으로 크게 낮아지는 것을 확인할 수 있습니다. 트래픽이 많은 앱에서는 이 항목 하나만으로 청구서가 $10,000에서 $3,000으로 줄어들 수도 있습니다. 각 제공업체별 설정 방법은 프롬프트 캐싱 가이드를 참조하세요.

요약하자면, 단순 '입력 가격' 비교는 오해의 소지가 있습니다. 표시된 가격이 가장 낮은 모델이라도 캐싱 효율이 떨어지면 약간 더 비싼 모델보다 비용이 더 들 수 있으며, 출력 가격이 가장 비싸 보이는 모델도 작업 결과가 두 단어 정도의 짧은 답변이라면 가장 저렴할 수 있습니다.

대량 처리 작업에 가장 저렴한 모델

분류, 추출, 요약, 콘텐츠 Moderation 등 수백만 토큰을 처리해야 하는 작업이라면 표의 하단에 위치한 모델들이 비용 절감의 핵심입니다.

  • DeepSeek-V4: 입력 $0.14 / 출력 $0.28로 가격 경쟁력의 바닥을 찍습니다. 캐시 히트 시 입력 토큰 당 약 $0.003(백만 토큰 기준)으로 거의 무료에 가깝습니다. 100만 토큰 컨텍스트와 최대 38.4만 토큰 출력을 지원하므로, 최첨단 성능이 필요하지 않은 대부분의 작업에 무리 없이 대응합니다.
  • Gemini 2.5 Flash-Lite: 입력 $0.10 / 출력 $0.40으로 Google의 대응 모델이며, 역시 100만 토큰 컨텍스트와 성숙한 생태계를 갖추고 있습니다.
  • Zhipu GLM-4.6: 입력 $0.43 / 출력 $1.74로 중위권에 위치하며 강력한 코딩 모델입니다. 개발 목적으로 많이 사용한다면, GLM의 코딩 플랜 구독이 토큰 단위 과금보다 훨씬 경제적일 수 있습니다.
  • Mistral Small 4: 입력 $0.15 / 출력 $0.60으로 EU 데이터 거주 요건을 충족하는 가장 저렴한 옵션이며, 규제가 필요한 워크로드에 적합합니다.

이 등급의 모델들과 플래그십 모델 간의 격차는 상당합니다. DeepSeek-V4의 출력 가격은 GPT-5.6 Sol보다 50배 이상 저렴합니다. 중간급 오픈 웨이트 모델이 품질 기준을 통과하는 작업이라면, 이 가격 차이가 청구서를 줄이는 가장 큰 레버리지입니다.

플래그십 티어 비교

복잡한 에이전트, 난이도 높은 코딩, 심층 분석 등 진짜 최첨단 추론 능력이 필요한 작업이라면 다음 네 가지 모델 중에서 선택하게 됩니다. 동일한 지능 수준 클래스에서의 가격 비교는 다음과 같습니다.

플래그십 모델입력출력컨텍스트비고
GPT-5.6 Sol$5.00$30.001.05M네 모델 중 출력 가격이 가장 높음
Claude Opus 4.8$5.00$25.001M입력 가격은 Sol과 동일하지만 출력이 더 저렴
Claude Fable 5$10.00$50.001MAnthropic의 최고 성능 모델로 Opus보다 고가
Gemini 2.5 Pro$1.25$10.001M가장 저렴한 플래그십이지만 20만 토큰 초과 시 등급 상향

표면적으로 Gemini 2.5 Pro는 그룹 내 알짜배기로, Sol 출력 가격의 약 1/4 수준입니다. 하지만 장문 컨텍스트 패널티가 존재합니다. 단일 프롬프트가 20만 토큰을 넘으면 전체 요청이 $2.50 / $15.00로 재책정됩니다. 대규모 컨텍스트를 사용하는 에이전트의 경우 이 조건이 장점을 상쇄시킬 수 있으므로, 결정 전에 실제 프롬프트 크기를 기준으로 가격을 산정해야 합니다.

Claude Fable 5는 비용 측면에서 이례적입니다. 가장 까다로운 장기 추론 작업을 위해 Opus 티어 위에 포지셔닝되어 있어, 비용보다 정확성이 우선될 때만 선택하는 '고급 옵션'이지 기본 모델은 아닙니다.

가격표에 표시되지 않는 숨겨진 비용

토큰 단위 비교로는 실제 청구서에 영향을 미치는 네 가지 요소를 놓치게 됩니다.

  1. 장문 컨텍스트 등급. Gemini 2.5 Pro(20만 토큰 초과)와 GPT-5.6(약 27.2만 토큰 초과)는 프롬프트가 커지면 요금이 1.5~2배 상승합니다. 긴 문서 작업을 한다면 유효 단가는 등급별 적용 가격을 고려해야 합니다.
  2. 캐시 쓰기 프리미엄. Anthropic은 캐시 읽기 요금(0.1배)을 적용받기 전에 캐시 작성 시 1.25배(1시간 TTL 기준 2배)의 프리미엄을 부과합니다. 두 번째 요청부터 이익이 발생하지만, 반복률이 낮은 워크로드에서는 쓰기 프리미엄만 지불하고 혜택을 보지 못할 수 있습니다.
  3. 배치 vs 실시간. 50% 배치 할인은 워크로드가 24시간 대기 가능하면 그냥 받는 돈입니다. 대부분의 팀은 야간 작업, 데이터 백필, 콘텐츠 Moderation 등 배치 처리 가능한 트래픽이 생각보다 많습니다.
  4. 목록에 없는 제공업체. 매우 높은 볼륨의 작업에서는 렌탈 GPU에 오픈 모델을 자체 호스팅하는 것이 여기 나온 모든 API 요금보다 저렴할 수 있습니다. 이러한 계산이 뒤집히는 시점에 대해서는 LLM 로컬 실행 가이드를 참조하세요.

토큰당이 아닌 작업(Task) 단위 가격: 실전 예제

토큰 단가는 추상적입니다. 그래서 실제 사례를 돌려봤습니다. 2026년 6월, 50개 문서 요약 배치 작업(입력 토큰 약 120만 개, 출력 토큰 12만 개)을 다섯 가지 모델로 실행하고 실제 청구액을 기록했습니다.

모델실시간 비용Batch API 적용 시
GPT-5.6 Terra$4.80$2.40
Claude Sonnet 5 (초기 할인)$3.60$1.80
Gemini 2.5 Flash$0.66$0.33
Zhipu GLM-4.6$0.72해당 없음
DeepSeek-V4$0.20해당 없음

동일한 50개 문서, 동일한 프롬프트였지만 청구액은 $4.80에서 $0.20까지, 배치 적용 전에도 24배의 차이가 발생했습니다. 배치 처리 가능 업체를 야간 큐로 이동시키자 Gemini 2.5 Flash는 33센트에 마무리되었습니다. 이러한 모델 간 품질 차이가 오차 범위 내에 있던 요약 작업에서는, 이 결정 하나가 규모 확장 시 월 수천 달러의 차이를 만듭니다.

교훈은 명확합니다. 올바른 비교는 항상 실제 입출력 비율로 계산한 작업(Task) 당 비용이어야 하며, 단일 토큰의 표시 가격에 의존해서는 안 됩니다. 출력이 비싼 모델은 추출 작업에서는 저렴할 수 있고, 입력이 저렴한 모델은 긴 생성 작업에서는 비쌀 수 있습니다.

사용 사례별 가장 저렴한 모델은?

위 표를 기반으로 한 요약 버전입니다.

  • 챗봇 및 RAG (긴 입력, 짧은 출력): 입력 가격과 캐싱이 지배적입니다. Gemini 2.5 Flash와 DeepSeek-V4가 우세하며, 선택한 모델에 프롬프트 캐싱을 추가하세요.
  • 장문 생성 (짧은 입력, 긴 출력): 출력 가격이 지배적입니다. Gemini 2.5 Flash-Lite와 DeepSeek-V4가 가장 저렴하며, 추론 능력이 반드시 필요하지 않다면 GPT-5.6 Sol은 피하세요.
  • 에이전트 및 도구 사용 (대규모 컨텍스트, 많은 턴): 장문 컨텍스트 등급을 주의하세요. Claude Opus 4.8과 GPT-5.6 Terra는 예측 가능하나, Gemini 2.5 Pro는 20만 토큰 미만일 때만 가장 저렴합니다.
  • 코딩: GLM-4.6과 그 코딩 플랜 구독, 또는 가장 어려운 문제에는 Claude Opus 4.8.
  • 비용보다 정확성이 중요한 최첨단 추론: Claude Opus 4.8 또는 Claude Fable 5.

어떤 모델을 선택하든, 제공업체 변경이 코드 재작성이 아닌 설정 변경으로 이루어지도록 게이트웨이를 통해 라우팅하세요. 옵션 비교는 최고의 LLM 게이트웨이 도구 비교를, 비용 절감을 위한 전체 플레이북은 LLM API 비용 절감 가이드를 참조하세요. 또한 이 표에 포함되지 않은 멀티모달 및 오디오 요금이 궁금하다면 Gemini API 가격 분석을 확인하세요.

Techsy가 클라이언트를 위해 모델을 선택하는 방법

저희는 B2B 클라이언트를 위한 프로덕션 AI 시스템을 구축하며, 모델 선택은 코드 한 줄 작성 전에 내려지는 첫 번째 결정 중 하나입니다. 저희 접근법은 의도적으로 평범합니다. 워크로드의 실제 입출력 비율을 프로파일링하고, '표시 가격'이 아닌 그 비율을 기준으로 상위 세 후보의 가격을 산정한 후, 평가 세트(eval set)로 품질 동등성을 확인합니다. 그리고 가장 저렴한 통과 모델을 게이트웨이 뒤에 연결하여 새 모델이 출시될 때마다 분기별로 재가격 책정이 가능하도록 합니다. 마지막 단계는 오늘 '최고'의 모델을 선택하는 것보다 중요합니다. 위에 보이는 가격은 석 달 후에는 틀릴 것이기 때문입니다.

모델을 선택하거나 계속 증가하는 청구서를 보고 계신다면, 이런 결정을 내리는 데 도움을 드릴 수 있습니다. AI 통합 서비스 살펴보기 또는 무료 아키텍처 리뷰를 예약하세요.

자주 묻는 질문

2026년 가장 저렴한 LLM API는 무엇인가요?

2026년 7월 기준 DeepSeek-V4가 입력 $0.14 / 출력 $0.28(백만 토큰당)로 가장 저렴한 성능 모델이며, 캐시 히트 시 입력 토큰은 약 $0.003입니다. Gemini 2.5 Flash-Lite($0.10 / $0.40)와 Mistral Small 4($0.15 / $0.60)도紧随其后. 최첨단 품질 작업에서는 Gemini 2.5 Pro가 가장 저렴한 플래그십 모델입니다.

GPT-5.6과 Claude Opus 4.8 중 어느 것이 더 비싼가요?

입력 가격은 동일($5.00/M)하지만, Claude Opus 4.8이 출력 가격($25.00/M)에서 GPT-5.6 Sol($30.00/M)보다 저렴합니다. 출력 비중이 높은 워크로드에서는 Opus 4.8이 가격 면에서 우세하며, 입력 비중이 높은 경우에는 캐싱 적용 전까지 사실상 유사합니다.

왜 출력이 입력보다 더 비싼가요?

토큰을 생성하는 과정이 읽는 과정보다 컴퓨팅 집약적이기 때문에, 거의 모든 제공업체가 출력에 대해 3~6배 더 높은 요금을 부과합니다. 이것이 프롬프트를 줄이는 것보다 응답 길이를 줄이고(구조화된 출력 사용 등) 것이 토큰당 더 많은 비용을 절약하는 이유입니다.

프롬프트 캐싱은 실제로 얼마나 절약되나요?

Anthropic, OpenAI, Google에서 캐시된 입력 토큰은 표준 요금의 약 10%로 청구되며, 이는 프롬프트의 반복 부분에 대해 90% 할인을 받는 것과 같습니다. 매 요청마다 동일한 시스템 프롬프트를 보내는 앱의 경우, 캐싱은 종종 총 청구액을 30~50% 절감합니다.

이 가격에 Batch API 할인이 포함되어 있나요?

아니요. 메인 표는 표준 실시간 가격을 보여줍니다. Anthropic, OpenAI, Google, Alibaba는 모두 최대 24시간의 지연을 감수할 수 있는 긴급하지 않은 워크로드에 대해 입력과 출력 모두 정액 50% 할인을 제공하는 Batch API를 운영합니다.

DeepSeek이 미국 모델보다 정말 그렇게 훨씬 저렴한가요?

표면적으로는 그렇습니다. DeepSeek-V4의 출력 가격($0.28/M)은 GPT-5.6 Sol($30/M)보다 50배 이상 저렴합니다. 다만 최첨단 미국 모델들이 여전히 가장 어려운 추론 작업에서 우위를 점하고 있기 때문에, 대부분의 팀은 품질이 동등한 작업에서는 DeepSeek 등을 활용하고 나머지는 플래그십 모델을 유지하는 식으로 아비트라지합니다.

Gemini 2.5 Pro의 낮은 가격에는 어떤 함정이 있나요?

장문 컨텍스트 등급입니다. Gemini 2.5 Pro의 목록 가격은 $1.25 / $10.00이지만, 20만 토큰을 초과하는 단일 프롬프트는 전체 요청을 $2.50 / $15.00로 재책정합니다. 프롬프트가 크다면 헤드라인 가격이 아닌 등급별 가격을 예산에 반영해야 합니다.

LLM API 가격은 얼마나 자주 변경되나요?

빈번합니다. 2026년 상반기에만 가격이 두 번 변동되었으며, 새로운 모델 패밀리(예: 2026년 7월 9일 출시된 GPT-5.6 티어)가 등장할 때마다 판도가 바뀝니다. 워크로드를 확정하기 전에는 항상 제공업체의 공식 가격 페이지에서 확인하고, 분기별로 재가격 책정을 수행하세요.

가격 대비 가장 큰 컨텍스트 윈도우를 가진 모델은 무엇인가요?

DeepSeek-V4와 Gemini 2.5 패밀리는 가격대의 하단에서 100만 토큰 컨텍스트를 제공합니다. GPT-5.6 모델들은 1.05M으로 약간 더 높으며, GPT-5.4 nano는 입력 $0.20만으로 1.1M에 도달하여 간단한 작업에서 가장 저렴한 대형 컨텍스트 옵션입니다.

저자 소개

Mert Batur Gurbuz는 Techsy.io의 공동 창립자로, 팀은 B2B 클라이언트를 위한 AI 에이전트, 자동화 시스템, 음성/SDR 파이프라인을 구축합니다. 그는 버밍엄 대학교에서 공부하며, Techsy 팀이 프로덕션에서 실제로 사용하는 LLM 툴링 스택에 대해 글을 씁니다. LinkedIn에서 연결하세요.

출처

  • Anthropic Claude API Pricing (접속일: 2026-07-14)
  • OpenAI API Pricing (접속일: 2026-07-14)
  • Google Gemini API Pricing (접속일: 2026-07-14)
  • DeepSeek API Pricing (접속일: 2026-07-14)
  • Alibaba Cloud Model Studio Pricing (접속일: 2026-07-14)
  • Mistral API Pricing (접속일: 2026-07-14)
  • Z.AI (Zhipu GLM) Pricing (접속일: 2026-07-14)

태그

llm api 가격 비교llm 요금gpt-5.6 가격claude 가격gemini 가격deepseek 가격토큰당 비용

이 기사 공유하기

관련 글

더 많은 글 보기 guides

guides
Apr 12, 2026

2026년 서퍼 SEO 가이드: 콘텐츠 에디터, NLP 점수 및 AI 검색

콘텐츠 에디터 워크플로우, NLP 점수 시스템, GEO 최적화를 위한 AI 트래커, API 자동화까지 다루는 실전 서퍼 SEO 가이드입니다. 50개 이상의 기사 테스트 결과를 바탕으로 작성되었습니다.

14 min read 분 읽기
읽어보기
guides
Apr 12, 2026

Semrush 가이드 2026: 모든 도구 설명 (예시 포함)

키워드 연구, 사이트 감사, 경쟁사 분석, AI 가시성 추적 및 MCP 서버 설정을 다루는 실용적인 Semrush 가이드입니다. 실제 SEO 파이프라인에서 추출한 코드 예제와 워크플로우를 포함합니다.

14 min read 분 읽기
읽어보기
guides
Apr 12, 2026

스크리밍 프로그 가이드 2026: AI 통합 기술적 SEO 감사

설정, 기술적 감사, 맞춤형 XPath 추출, 정규식 패턴 및 다른 가이드에서는 다루지 않는 AI 통합 기능까지 다루는 스크리밍 프로그 SEO 스파이더 실전 가이드. v23 업데이트와 복사해서 바로 쓸 수 있는 15개 이상의 코드 스니펫 포함.

14 min read 분 읽기
읽어보기
모든 글 보기
프로젝트 시작하기

새로운 것을 만들 준비가 되었다면 특별함은?

여러분의 비전을 현실로 만들어 보세요. 차이를 만드는 소프트웨어, 우리 팀이 함께 만들겠습니다.

30분 스코핑 미팅 예약프로젝트 보기

라이브러리에서 인기 있는 도구

Claude 스킬

전체 보기
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI 자동화

전체 보기
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

라이브러리에서 인기 있는 도구

Claude 스킬

전체 보기
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI 자동화

전체 보기
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

서비스

  • 엔터프라이즈 솔루션
  • 모바일 앱
  • 웹 애플리케이션

솔루션

  • CRM 시스템
  • AI 통합
  • ERP 솔루션
  • 음성 에이전트
  • 프로세스 자동화
  • 사이버 보안

라이브러리

  • 블로그
  • 포트폴리오

커뮤니티

  • AI 자동화
  • Claude 스킬

도구

  • 모바일 앱 비용 계산기
  • OpenAI / LLM API 비용 계산기
  • MVP 비용 계산기
  • 음성 AI 에이전트 비용 계산기

회사 소개

  • 소개
  • 파트너
  • 문의하기

법적 고지사항

  • 개인정보 처리방침
  • 서비스 약관
  • 쿠키 정책

서비스

  • 엔터프라이즈 솔루션
  • 모바일 앱
  • 웹 애플리케이션

솔루션

  • CRM 시스템
  • AI 통합
  • ERP 솔루션
  • 음성 에이전트
  • 프로세스 자동화
  • 사이버 보안

라이브러리

  • 블로그
  • 포트폴리오

커뮤니티

  • AI 자동화
  • Claude 스킬

도구

  • 모바일 앱 비용 계산기
  • OpenAI / LLM API 비용 계산기
  • MVP 비용 계산기
  • 음성 AI 에이전트 비용 계산기

회사 소개

  • 소개
  • 파트너
  • 문의하기
법적 고지사항개인정보 처리방침서비스 약관쿠키 정책
TECHSY
© 2026 Techsy. 무단전재 및 재배포 금지.