
LLM API 저글링은 그만: 2026년 게이트웨이 도구 9종 순위
마지막 업데이트: 2026년 6월 24일. 9개 게이트웨이 전체의 가격, GitHub 스타 수, 제공업체 지원 목록을 재확인했으며, MCP Gateway를 통해 에이전트 도구 접근까지 통제하는 엔터프라이즈 컨트롤 플레인인 TrueFoundry를 추가했습니다. Portkey의 완전한 오픈소스 공개(2026년 3월)와 Bifrost의 업데이트된 벤치마크 수치도 아래에 반영되어 있습니다.
2026년 최고의 LLM 게이트웨이는 셀프 호스팅 팀에는 LiteLLM, 운영이 필요 없는 매니지드 접근에는 OpenRouter입니다. LiteLLM은 100개 이상의 제공업체를 단일 OpenAI 호환 API 뒤에서 지원하며, 폴백과 예산 제어를 처리하고, 모든 VPS에서 무료로 실행됩니다. OpenRouter는 인프라 없이 300개 이상의 모델에 즉시 접근할 수 있게 해줍니다. 데이터 주권과 모델·에이전트 트래픽 모두에 대한 거버넌스가 필요한 규제 산업 엔터프라이즈에는 TrueFoundry가 전적으로 자체 VPC 내에서 실행됩니다. 프로덕션 가드레일(PII 마스킹, 탈옥 감지)에는 Portkey가 적합합니다. 5,000 RPS를 초과하는 순수 처리량이 필요하면 Bifrost의 Go 아키텍처는 오버헤드가 단 11마이크로초에 불과합니다.
채팅봇에는 OpenAI를, 코딩 어시스턴트에는 Anthropic을, 요약 파이프라인에는 Gemini를 호출하고 있습니다. API 키 3개, SDK 3개, 결제 대시보드 3개, 오류 처리 3세트. 여기에 제공업체 하나가 다운되었을 때의 폴백 로직까지 추가해야 합니다. 바로 이 난장판을 LLM 게이트웨이가 해결합니다. 모든 모델로 라우팅하고, 비용을 추적하며, 장애를 자동으로 처리하는 통합 API 하나면 됩니다.
저희는 주요 LLM 게이트웨이를 모두 테스트하고 실제로 중요한 요소들로 순위를 매겼습니다: 레이턴시 오버헤드, 제공업체 커버리지, 설정 용이성, 그리고 다음 트래픽 급증에서 살아남을 수 있는지 여부입니다.
| 순위 | 도구 | 최적 용도 | 유형 | 시작 가격 |
|---|---|---|---|---|
| 1위 | LiteLLM | 종합적인 유연성 | 셀프 호스팅(오픈소스) | 무료 |
| 2위 | OpenRouter | 무설정 멀티모델 접근 | 매니지드 SaaS | 토큰당 과금 |
| 3위 | TrueFoundry | 엔터프라이즈 거버넌스 + MCP | 셀프 호스팅 + 매니지드 | 무료 등급($499/월 Pro) |
| 4위 | Portkey | 프로덕션 가드레일 | 하이브리드(오픈소스 + 매니지드) | 무료 등급 |
| 5위 | Helicone | 관측성 우선 팀 | 셀프 호스팅(오픈소스) | 무료 |
| 6위 | Bifrost | 순수 처리량 성능 | 셀프 호스팅(오픈소스) | 무료 |
| 7위 | Cloudflare AI Gateway | 무인프라 라우팅 | 매니지드 | 무료 등급 |
| 8위 | Kong AI Gateway | API 관리 팀 | 셀프 호스팅 + 엔터프라이즈 | 무료 커뮤니티 |
| 9위 | TensorZero | ML 최적화 라우팅 | 셀프 호스팅(오픈소스) | 무료 |
LLM 게이트웨이란? (그리고 정말 필요한가?)
순위에 앞서 간단한 구분을 짚고 넘어가겠습니다. 사람들은 "게이트웨이", "프록시", "라우터"를 혼용해서 쓰지만, 이 용어들은 약간 다른 역할을 의미합니다:
- LLM 프록시: 요청을 제공업체로 전달하고 로깅을 추가합니다. 로직은 최소한입니다.
- LLM 라우터: 비용, 레이턴시, 콘텐츠에 따라 각 요청에最適な 모델이나 제공업체를 선택합니다.
- LLM 게이트웨이: 풀 패키지입니다. 프록시 + 라우터 + 비용 추적 + 캐싱 + 가드레일 + 관측성.
이 목록의 대부분의 도구는 완전한 게이트웨이이지만, 일부는 프록시나 라우터 쪽에 더 가깝습니다.
게이트웨이가 필요한 경우:
- LLM 제공업체 2곳 이상을 호출하면서 모든 제공업체에 단일 API를 쓰고 싶을 때
- 제공업체 간 비용 추적이 필요할 때 (예산을 누가 태우고 있는가?)
- 제공업체 장애 시 자동 페일오버를 원할 때
- 제공업체 간 프롬프트 캐싱의 이점을 살리는 기능을 만들고 있을 때
단일 제공업체만 사용하고 전환 계획이 없다면, 게이트웨이는 불필요한 복잡성을 더할 뿐입니다. 건너뛰세요.
전형적인 도입 경로: 대부분의 팀은 OpenAI 호출을 직접 하드코딩하는 것으로 시작합니다. 그러다 두 번째 용례를 위해 Anthropic을 추가하고 래퍼 함수를 작성합니다. 그다음 폴백 로직, 비용 추적, 속도 제한이 필요해지고, 어느새 자신들도 모르게 어설픈 게이트웨이를 직접 만들어 놓게 됩니다. 아래 도구들은 그 자작 난장판을 실전 검증된 것으로 대체해 줍니다.
1. LiteLLM, 종합 최고
GitHub 스타: 약 40K | 언어: Python | 라이선스: MIT
LiteLLM은 LLM 게이트웨이의 맥가이버 칼입니다. 100개 이상의 LLM 제공업체를 단일 OpenAI 호환 API 뒤에서 감싸주기 때문에, 기존 OpenAI SDK 코드가 변경 없이 그대로 작동합니다. 기본 URL만 바꾸면 됩니다.
프록시 서버 구성 요소가 LiteLLM을 단순한 SDK가 아닌 게이트웨이로 만들어 줍니다. 독립형 서비스로 배포하고, YAML 파일에서 모델을 구성하면, 모든 팀이 비용 추적, 속도 제한, 로드 밸런싱이 내장된 동일한 엔드포인트를 사용하게 됩니다.
# config.yaml for LiteLLM proxy
model_list:
- model_name: gpt-4
litellm_params:
model: openai/gpt-4o
api_key: sk-...
- model_name: gpt-4
litellm_params:
model: anthropic/claude-sonnet-4-20250514
api_key: sk-ant-...
# LiteLLM load-balances between these automatically
general_settings:
master_key: sk-my-master-key
database_url: postgresql://...# Your app code doesn't change -- just point to the proxy
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:4000", # LiteLLM proxy
api_key="sk-my-master-key"
)
response = client.chat.completions.create(
model="gpt-4", # Routes to OpenAI or Anthropic via config
messages=[{"role": "user", "content": "Explain LLM gateways"}]
)장점:
- 100개 이상 제공업체 지원(모든 게이트웨이 중 가장 넓은 커버리지)
- OpenAI 호환 API, 기존 앱에 코드 변경 제로
- 내장 비용 추적, 팀/사용자별 예산
- 폴백 체인: OpenAI 실패 시 Anthropic 시도, 그다음 Gemini
- 모든 주요 관측성 도구와 통합(Langfuse, Helicone 등)
단점:
- Python의 GIL이 단일 프로세스 처리량을 제한(1K RPS에서 P95 레이턴시 약 8ms)
- 팀 관리 기능에 프록시용 별도 PostgreSQL 데이터베이스가 필요
- 모델과 라우팅 규칙이 많아지면 구성이 복잡해질 수 있음
- 최근 공급망 보안 사고(악성 PyPI 패키지, 신속히 차단됨)
가격: 무료 오픈소스. 호스팅 관리를 위한 엔터프라이즈 플랜 제공.
다양한 모델로 Claude Code 사용하기 가이드를 읽어보셨다면, 이미 LiteLLM이 작동하는 모습을 보셨을 겁니다. 개발자들이 Claude Code를 대체 제공업체로 라우팅하는 주요 방법 중 하나입니다.
평가: LiteLLM은 최대 유연성을 원하고 셀프 호스팅을 꺼리지 않는 팀에게 최고의 종합 LLM 게이트웨이입니다. 가장 넓은 제공업체 커버리지, 가장 성숙한 생태계, 가장 큰 커뮤니티를 갖추고 있습니다. 특별한 이유가 없는 한 여기서 시작하세요. LiteLLM 프록시 설정 가이드에서 PostgreSQL을 사용한 완전한 Docker 배포를 20분 안에 따라 할 수 있습니다.
2. OpenRouter, 최고의 매니지드 게이트웨이
모델: 300+ | 유형: 매니지드 SaaS | 라이선스: 독점
OpenRouter는 LiteLLM과 정반대 접근을 취합니다: 아무것도 배포할 필요가 없습니다. 가입하고 API 키를 받으면, 모든 주요 제공업체의 300개 이상 모델을 단일 엔드포인트로 즉시 사용할 수 있습니다. LLM API의 "앱 스토어"인 셈입니다.
가치 제안은 단순함입니다. 유지보수할 인프라도, 작성할 YAML 구성도, 프로비저닝할 데이터베이스도 없습니다. 크레딧을 선불로 충전하거나 카드를 연결하면, OpenRouter가 모든 제공업체의 청구를 통합 처리합니다.
from openai import OpenAI
client = OpenAI(
base_url="https://openrouter.ai/api/v1",
api_key="sk-or-..."
)
# Access any model from any provider -- same code
response = client.chat.completions.create(
model="anthropic/claude-sonnet-4-20250514",
messages=[{"role": "user", "content": "Compare LLM gateways"}]
)장점:
- 300개 이상 모델, 단일 API 키, 통합 결제 대시보드
- 프로토타이핑용 25개 이상 무료 모델(의외로 성능 좋은 것들도 포함)
- 관리할 인프라 없음, 가입하고 바로 호출 시작
- 모델 비교 기능으로 확정 전에 평가 가능
- 자동 폴백 라우팅으로 제공업체 장애 처리
단점:
- 제공업체 가격 위에 5.5% 플랫폼 수수료, 규모가 커지면 부담
- 셀프 호스팅 옵션 없음, 데이터가 OpenRouter 서버를 경유
- 전용 게이트웨이 도구 대비 제한적인 관측성
- 무료 등급의 속도 제한은 프로덕션 워크로드에 제약적일 수 있음
- 커스텀 라우팅 로직 없음, OpenRouter가 결정하는 대로 사용
가격: 토큰당 과금(제공업체 가격 + 5.5% 수수료). 월 최소 금액 없음. 25개 이상 무료 모델 제공.
평가: OpenRouter는 여러 LLM 제공업체에 접근하는 가장 빠른 방법입니다. 다양한 모델로 프로토타입을 만들거나 인프라 관리 없이 중소 규모 워크로드를 운영하려 한다면, 명백한 선택입니다. 규모가 커지면 5.5% 수수료가 체감되기 시작합니다. 비용 절감이 목적이라면, LLM API 비용 절감 가이드에서 캐싱, 배치 처리, 게이트웨이 수준 절감 수단에 대한 전체 분석을 확인하세요.
3. TrueFoundry, 엔터프라이즈 거버넌스 최고
모델: 1,600+ | 제공업체: 250+ | 유형: 셀프 호스팅 + 매니지드 | 배포: VPC, 온프레미스, 에어갭
TrueFoundry의 AI Gateway는 오픈소스 게이트웨이들이 어려워하는 바로 그 사례를 위해 만들어졌습니다: 모든 모델을 위한 단일 컨트롤 플레인, 완전한 데이터 주권, 그리고 컴플라이언스 검토에서도 살아남을 감사 추적이 필요한 규제 산업 엔터프라이즈입니다. 자체 VPC, 온프레미스, 또는 완전한 에어갭 환경에서 실행되므로 요청 데이터가 도메인 밖으로 나가지 않으며, SOC 2, HIPAA, GDPR 컴플라이언스, SSO, RBAC를 기본으로 제공합니다.
커버리지는 이 목록 중 가장 넓은 축에 속합니다: 250개 이상 제공업체(OpenAI, Anthropic, Gemini, Groq, Mistral)에 걸친 1,600개 이상 모델, 그리고 vLLM, SGLang, Triton 같은 셀프 호스팅 백엔드까지 지원합니다. TrueFoundry는 엔터프라이즈 부하에서 내부 레이턴시 3ms 미만, 월 100억 건 이상 요청에 걸쳐 99.99% 가동률을 보고하므로, 거버넌스 계층이 처리량을 갉아먹지 않습니다.
from openai import OpenAI
client = OpenAI(
base_url="https://<your-org>.truefoundry.com/api/llm", # your gateway
api_key="tfy-..."
)
response = client.chat.completions.create(
model="openai/gpt-4o", # routed, logged, and rate-limited centrally
messages=[{"role": "user", "content": "Summarize this contract"}]
)TrueFoundry를 Portkey나 LiteLLM과 차별화하는 것은 MCP Gateway입니다: AI 에이전트가 Model Context Protocol을 통해 엔터프라이즈 도구(Slack, GitHub, Confluence, Datadog)에 접근하는 방식을 통제하는 중앙 레지스트리입니다. 내부 API를 MCP 서버로 등록하고, Okta 또는 Azure AD 뒤에서 서버별 RBAC로 게이트하며, 모든 도구 호출에 요청 수준 추적을 얻을 수 있습니다. 이로써 모델 트래픽과 에이전트 도구 트래픽 양쪽에 대해 거버넌스되는 단일 컨트롤 플레인을 갖게 되는데, 이는 에이전트가 단순 텍스트 생성을 넘어 행동을 취하기 시작하면 중요해집니다.
대부분의 엔터프라이즈 게이트웨이와 달리, TrueFoundry는 가격을 사전에 공개합니다. 무료 Developer 등급은 월 50,000건 요청, 사용자 3명, 최대 5개 서버의 MCP Gateway를 커버하며, 누구와 이야기하기 전에 전체 스택을 프로토타입하기에 충분합니다. Pro 등급은 월 $499로 요청 100만 건, 사용자 10명, 시맨틱 캐싱, 가상 모델, 고급 라우팅을 제공하며, 추가 사용량은 정액 단위 요금으로 청구됩니다. Pro Plus는 월 $2,999로 사용자 25명에게 커스텀 메타데이터, 알림, 모니터링 익스포트를 추가합니다. Enterprise는 1,000만 건 이상 요청에 대해 컨트롤 플레인과 게이트웨이 플레인 모두의 완전한 VPC, 멀티 리전, 에어갭 설치로 맞춤 견적입니다. 모든 유료 플랜에는 7일 체험이 포함됩니다. 매니지드 SaaS에는 호스팅 비용이 없습니다. 자체 클라우드 내부에 게이트웨이를 셀프 호스팅(BYOC)한다면, 기반 인프라에 월 약 $600~$1,000을 예산으로 잡으세요.
장점:
- 1,600개 이상 모델, 250개 이상 제공업체, 셀프 호스팅 백엔드(vLLM, SGLang, Triton)까지
- VPC, 온프레미스, 에어갭에서 실행; 데이터가 도메인 밖으로 나가지 않음
- SOC 2, HIPAA, GDPR 컴플라이언스, SSO, RBAC, 감사 로깅 내장
- 가드레일: PII 필터링, 유해성 감지, 프롬프트 인젝션 스캐닝
- MCP Gateway가 모델 호출뿐 아니라 에이전트 도구 접근까지 통제
- 공개적이고 투명한 가격, 진정한 무료 Developer 등급(월 50K 요청)
- TrueFoundry는 라우팅, 캐싱, 예산을 통해 평균 약 30% 비용 절감을 보고
단점:
- 엔터프라이즈 우선: 소규모 프로젝트에는 LiteLLM이나 OpenRouter보다 무거움
- 핵심 플랫폼은 독점(오픈소스 저장소는 별도 인프라 도구)
- 게이트웨이 셀프 호스팅 시 플랜 외에 인프라 비용 월 약 $600~$1,000 추가
- 거버넌스할 팀과 도구가 많을 때 가장 가치 있으며, 첫날부터 빛을 보진 않음
가격: 무료 Developer 등급($0/월, 요청 50K, 사용자 3명). Pro $499/월(요청 1M, 사용자 10명, 시맨틱 캐싱, 고급 라우팅). Pro Plus $2,999/월(사용자 25명, 고급 관측성). Enterprise 맞춤(요청 10M+, 완전한 VPC 및 에어갭). 유료 플랜 7일 체험; 매니지드 SaaS는 호스팅 비용 없음, 셀프 호스팅 시 인프라 약 $600~$1,000/월 추가.
평가: TrueFoundry는 모델 트래픽과 에이전트 도구 접근 양쪽을 위한 거버넌스된 단일 컨트롤 플레인이 필요하면서 데이터를 자체 인프라 안에 유지해야 하는 엔터프라이즈를 위한 게이트웨이입니다. 제공업체 2곳을 연결하려는 스타트업이라면 필요 이상입니다. LiteLLM으로 시작하세요. 컴플라이언스 의무 아래 수십 개 내부 팀에 AI를 배포하려는 플랫폼 팀이라면, 후보 목록에 올려야 합니다.
4. Portkey, 프로덕션 가드레일 최고
GitHub 스타: 약 7K | 언어: TypeScript/Node.js | 라이선스: Apache 2.0(게이트웨이), 매니지드 플랫폼
Portkey는 스스로를 "AI를 위한 컨트롤 플레인"으로 포지셔닝합니다. LiteLLM이 라우팅에, OpenRouter가 단순함에 집중하는 반면, Portkey의 차별점은 프로덕션 안전성입니다: 가드레일, PII 마스킹, 탈옥 감지, 감사 추적이 게이트웨이 계층에 내장되어 있습니다.
2026년 3월부로 Portkey는 게이트웨이 전체를 오픈소스(Apache 2.0)로 공개하여, 매니지드 플랫폼 없이도 핵심 라우팅과 가드레일을 셀프 호스팅할 수 있습니다.
from portkey_ai import Portkey
portkey = Portkey(
api_key="pk-...",
config={
"strategy": {"mode": "fallback"},
"targets": [
{"provider": "openai", "override_params": {"model": "gpt-4o"}},
{"provider": "anthropic", "override_params": {"model": "claude-sonnet-4-20250514"}}
]
}
)
response = portkey.chat.completions.create(
messages=[{"role": "user", "content": "Summarize this document"}]
)장점:
- 제공업체 전반에 걸쳐 1,600개 이상 모델 지원
- 내장 가드레일: PII 감지, 탈옥 방지, 콘텐츠 필터링
- 게이트웨이 내 프롬프트 관리 및 버전 관리
- 캐싱 계층이 반복 호출을 줄여줌(비용과 레이턴시 절감)
- 규제 산업을 위한 감사 추적 및 컴플라이언스 기능
- 이제 완전한 오픈소스 게이트웨이(2026년 3월)
단점:
- 매니지드 플랫폼 가격은 프로덕션 기능 기준 월 $49부터
- 고급 거버넌스용 엔터프라이즈 등급($5K~$10K/월)
- 더 단순한 게이트웨이 대비 복잡성 추가
- LiteLLM이나 OpenRouter보다 가파른 학습 곡선
가격: 오픈소스 게이트웨이는 무료. 매니지드 플랫폼: 무료 등급(프로토타이핑), $49/월(프로덕션), 엔터프라이즈 맞춤.
평가: Portkey는 프롬프트 인젝션, PII 유출, 모니터링되지 않는 비용을 감당할 수 없는 고객 대면 LLM 기능을 구축하는 팀을 위한 게이트웨이입니다. 가드레일이 복잡성을 정당화합니다. 내부 도구를 만들고 있다면, 더 단순한 선택지가 있습니다.
5. Helicone, 관측성 우선 팀 최고
GitHub 스타: 약 3K | 언어: Rust | 라이선스: Apache 2.0
Helicone은 관측성 도구로 시작해 완전한 게이트웨이로 진화했습니다. 그 출발점이 중요한데, 모니터링과 분석은 동급 최고이며, 게이트웨이 기능(라우팅, 캐싱, 페일오버)은 탄탄한 관측성 기반 위에 구축되었습니다.
Rust로 작성되었다는 점은 실질적인 성능 우위를 제공합니다: P50 레이턴시 8ms, P95 5ms 미만, 단일 인스턴스에서 메모리 단 64MB로 약 3,000 RPS.
# Helicone: one-line proxy -- just change the base URL
from openai import OpenAI
client = OpenAI(
base_url="https://oai.helicone.ai/v1", # or your self-hosted URL
api_key="sk-...",
default_headers={
"Helicone-Auth": "Bearer hlc-..."
}
)
# All requests are now logged, tracked, and routed through Helicone
response = client.chat.completions.create(
model="gpt-4o",
messages=[{"role": "user", "content": "Analyze this code"}]
)장점:
- Rust 기반: 약 64MB 메모리, P95 <5ms 레이턴시, 인스턴스당 3K RPS
- 헬스 인지 로드 밸런싱이 가장 빠른 가용 제공업체로 라우팅
- 비용, 레이턴시, 토큰 사용량, 오류율의 실시간 대시보드
- 한 줄 통합, 문자 그대로 기본 URL만 바꾸면 됨
- 단일 바이너리 배포(Docker, K8s, 베어메탈)
단점:
- 관측성 기능이 주역; 라우팅은 LiteLLM보다 덜 정교
- LiteLLM이나 OpenRouter보다 적은 지원 제공업체
- LiteLLM보다 작은 커뮤니티(GitHub 스타 3K vs 40K)
- 고급 기능(커스텀 속성, 세션)은 매니지드 플랫폼 필요
가격: 오픈소스, 셀프 호스팅 무료. 매니지드 플랫폼 가격은 다양.
관측성 도구를 더 넓게 평가 중이라면, 최고의 AI 관측성 플랫폼 순위에서 Helicone과 함께 Langfuse, Arize 등을 다룹니다.
평가: Helicone은 "LLM 호출에서 무슨 일이 일어나는지 볼 수 없다"는 것이 주된 고통인 팀에게 최고의 게이트웨이입니다. 관측성이 1순위 관심사고 게이트웨이 라우팅이 차순위라면, Helicone은 둘 다 타협 없이 제공합니다.
6. Bifrost, 순수 성능 최고
GitHub 스타: 약 2K | 언어: Go | 라이선스: MIT
Bifrost는 성능 챔피언입니다. Maxim 팀이 Go로 구축했으며, 5,000 RPS에서 요청당 단 11마이크로초의 오버헤드로 LiteLLM보다 50배 빠른 성능을 주장합니다. 이는 이론적 수치가 아니라, 재현 가능한 지속 부하 테스트에서 나온 결과입니다.
아키텍처 차이는 근본적입니다: Go의 고루틴은 Python의 GIL 병목 없이 수천 개의 동시 연결을 처리하며, 컴파일된 바이너리는 인터프리터 오버헤드를 완전히 제거합니다.
# bifrost.yaml
account:
provider: openai
api_key: ${OPENAI_API_KEY}
models:
- name: gpt-4o
provider: openai
- name: claude-sonnet-4-20250514
provider: anthropic
routing:
strategy: round-robin
fallback: true장점:
- 5,000 RPS에서 11us 오버헤드, 이 목록의 모든 게이트웨이 중 최저
- Go 바이너리: 런타임 의존성 없음, 극소 메모리 풋프린트
- 제공업체 간 적응형 로드 밸런싱
- 수평 확장을 위한 클러스터 모드
- 1,000개 이상 모델 지원
단점:
- 비교적 새로운 프로젝트, 작은 커뮤니티와 적은 통합
- Helicone이나 Portkey보다 덜 성숙한 관측성 기능
- Maxim(벤더)이 구축, 향후 방향이 그들의 로드맵에 종속
- LiteLLM의 방대한 문서보다 얇은 문서
- 내장 팀 관리나 예산 제어 없음
가격: 무료 오픈소스(MIT 라이선스).
평가: Bifrost는 게이트웨이 오버헤드가 중요한 고처리량 프로덕션 시스템을 운영하는 팀을 위한 것입니다. 초당 수천 건의 LLM 호출을 처리하고 매 마이크로초의 레이턴시가 중요하다면, Bifrost의 Go 아키텍처가 답입니다. 대부분의 팀에게는 LiteLLM의 8ms 오버헤드로 충분합니다.
7. Cloudflare AI Gateway, 최고의 무인프라 옵션
유형: 매니지드 서비스 | 라이선스: 독점(Cloudflare)
Cloudflare AI Gateway는 "아무것도 관리하지 않는" 접근을 극단으로 밀어붙입니다. 이미 Cloudflare를 쓰고 있다면(많은 팀이 그렇습니다), 대시보드에서 AI Gateway를 활성화하고 추가 인프라 없이 Cloudflare의 엣지 네트워크를 통해 LLM 호출 라우팅을 시작할 수 있습니다.
// Just prefix your provider URL with Cloudflare's gateway endpoint
const response = await fetch(
"https://gateway.ai.cloudflare.com/v1/{account_id}/{gateway_name}/openai/chat/completions",
{
method: "POST",
headers: {
"Authorization": "Bearer sk-...",
"Content-Type": "application/json"
},
body: JSON.stringify({
model: "gpt-4o",
messages: [{ role: "user", content: "Hello" }]
})
}
);장점:
- 월 100K 로그 무료 등급, 대부분의 사이드 프로젝트에 충분
- 무인프라: Cloudflare 대시보드에서 활성화
- 엣지 내장 캐싱(비용과 레이턴시 절감)
- 속도 제한과 분석 포함
- 통합 청구: LLM 제공업체 비용을 Cloudflare를 통해 결제
- 글로벌 엣지 네트워크가 지리적으로 분산된 사용자의 레이턴시 절감
단점:
- Cloudflare 생태계와 강하게 결합, 전환 비용이 실제로 존재
- 전용 게이트웨이 대비 제한적인 라우팅 지능
- 무료 등급 100K 로그 제한; 1M은 유료 플랜(Workers Paid)
- LiteLLM이나 OpenRouter보다 적은 지원 제공업체
- 셀프 호스팅 옵션 없음
가격: 무료(월 100K 로그), 로그 1M은 Workers Paid 구독. 요청당 게이트웨이 수수료 없음. LLM 제공업체 비용은 별도.
제공업체 간 함수 호출을 라우팅하는 팀에게, Cloudflare의 엣지 캐싱은 반복되는 도구 사용 패턴의 레이턴시를 의미 있게 줄여줄 수 있습니다.
평가: Cloudflare AI Gateway는 이미 Cloudflare를 사용 중이고 아무것도 새로 배포하지 않으면서 게이트웨이 기능을 원한다면 최고의 옵션입니다. 무료 등급은 소규모 프로젝트에 넉넉합니다. 진지한 프로덕션 사용에는 전용 게이트웨이가 더 많은 제어를 제공합니다.
8. Kong AI Gateway, API 관리 팀 최고
GitHub 스타: 약 40K(Kong Gateway 전체) | 언어: Lua/OpenResty | 라이선스: Apache 2.0(커뮤니티)
Kong AI Gateway는 독립형 제품이 아니라, LLM 특화 기능을 추가하는 Kong의 실전 검증된 API Gateway의 확장입니다. 조직이 이미 API 관리에 Kong을 쓰고 있다면, AI 라우팅 추가는 새 플랫폼이 아닌 플러그인 설치입니다.
# Kong declarative config (deck)
services:
- name: ai-llm-service
url: https://api.openai.com
plugins:
- name: ai-proxy
config:
route_type: llm/v1/chat
model:
provider: openai
name: gpt-4o
- name: ai-rate-limiting-advanced
config:
limit: [10000]
window_size: [60]
window_type: fixed
strategy: local
limit_by: consumer장점:
- Kong의 성숙한 API 관리 플랫폼 위에 구축(수천 개 엔터프라이즈가 사용)
- 시맨틱 라우팅: 프롬프트 콘텐츠/의도에 따라 요청 라우팅
- 토큰 기반 속도 제한(요청 기반만이 아님)
- 플러그인 생태계: 인증, 속도 제한, 변환 모두 AI 라우트와 작동
- Datadog/Grafana 통합을 위한 OpenTelemetry + Prometheus 메트릭
단점:
- 이미 Kong을 쓰지 않는다면 과함, 가파른 학습 곡선
- 엔터프라이즈 AI 기능은 Kong Enterprise 라이선스 필요(유료)
- 이 목록의 어떤 게이트웨이보다 높은 구성 복잡도
- Kong 인프라 지식 필요(또는 팀이 학습해야 함)
- AI 특화 기능은 Kong 코어보다 새롭고 덜 성숙
가격: 커뮤니티 에디션 무료(오픈소스). 엔터프라이즈 AI 기능은 Kong Enterprise 구독 필요(맞춤 가격).
평가: Kong AI Gateway는 조직이 이미 Kong을 운영하는 경우에만 의미가 있습니다. 기존 API 관리 계층에 LLM 라우팅을 추가하는 것이 별도 게이트웨이를 배포하는 것보다 현명합니다. 하지만 LLM 라우팅만을 위해 Kong을 도입하지는 마세요. 잔디 깎으려고 트랙터를 사는 격입니다.
9. TensorZero, ML 최적화 라우팅 최고
GitHub 스타: 약 5.5K | 언어: Rust | 라이선스: Apache 2.0
TensorZero는 이 목록에서 가장 독단적인 게이트웨이입니다. 다른 도구들이 라우팅과 관측성에 집중하는 동안, TensorZero는 최적화 루프를 구축합니다: 추론 데이터를 수집하고, 평가를 실행하며, 그 결과를 사용해 시간이 지남에 따라 라우팅 결정을 개선합니다. 어떤 유형의 요청에 어떤 모델이 가장 잘 작동하는지 학습하는 게이트웨이라고 생각하면 됩니다.
Rust 구현은 10,000+ QPS에서도 1밀리초 미만의 P99 레이턴시를 제공합니다. 오타가 아닙니다. LiteLLM이 약 8ms, Bifrost가 약 11us를 추가하는 데 반해, TensorZero는 극한의 부하에서 <1ms P99를 주장합니다.
# TensorZero: structured inference with optimization
from tensorzero import TensorZeroGateway
with TensorZeroGateway("http://localhost:3000") as client:
response = client.inference(
function_name="generate_summary",
input={
"messages": [
{"role": "user", "content": "Summarize this article..."}
]
}
)
# Later: feed back quality data to improve routing
client.feedback(
metric_name="summary_quality",
inference_id=response.inference_id,
value=0.92
)장점:
- 10K+ QPS에서 <1ms P99 레이턴시(Rust로 최고의 순수 성능)
- 피드백 루프: 각 함수에 어떤 모델이 최적으로 작동하는지 학습
- 스키마 검증을 갖춘 구조화 추론
- 게이트웨이 내장 모델 간 A/B 테스트
- 내장 평가 프레임워크
단점:
- 다른 어떤 게이트웨이보다 가파른 학습 곡선, 모델만이 아닌 "함수"를 정의
- 새로운 생태계, 작은 커뮤니티
- TensorZero의 함수 개념 중심으로 LLM 통합을 재고해야 함
- LiteLLM이나 OpenRouter보다 "드롭인" 정도가 낮음, 단순한 기본 URL 교체가 아님
- 문서가 개선 중이지만 여전히 성숙 중
가격: 무료 오픈소스(Apache 2.0).
이미 LLM 평가를 실행 중인 팀에게, TensorZero의 피드백 루프는 평가와 라우팅 사이의 간극을 메워줍니다. 평가 점수가 어떤 모델로 라우팅되는지를 직접 개선합니다.
평가: TensorZero는 시간이 지남에 따라 게이트웨이가 더 똑똑해지길 원하는 ML 엔지니어링 팀을 위한 것입니다. 최적화 루프는 진정으로 혁신적입니다. 하지만 학습 곡선이 가파르고, 대부분의 팀은 ML 최적화 라우팅이 필요하지 않습니다. 좋은 관측성을 갖춘 신뢰할 수 있는 라우팅이 필요할 뿐입니다.
LLM 게이트웨이 레이턴시 오버헤드: 실제 수치
모든 게이트웨이는 LLM 호출에 약간의 오버헤드를 추가합니다. 문제는 그것이 여러분의 용례에서 중요한가입니다. 저희 테스트에서 게이트웨이들이 어떻게 비교되는지 보여드립니다:
| 게이트웨이 | 언어 | P50 레이턴시 오버헤드 | P95 레이턴시 오버헤드 | 처리량(단일 인스턴스) |
|---|---|---|---|---|
| Bifrost | Go | 약 8us | 약 11us | 5,000+ RPS |
| TensorZero | Rust | 약 0.3ms | <1ms | 10,000+ QPS |
| Helicone | Rust | 약 5ms | 약 8ms | 약 3,000 RPS |
| TrueFoundry | 셀프 호스팅 | 약 3ms† | <3ms† | 월 10B+(벤더) |
| LiteLLM | Python | 약 4ms | 약 8ms | 약 1,000 RPS |
| Portkey | TypeScript | 약 5ms | 약 12ms | 약 2,000 RPS |
| OpenRouter | 매니지드 | 약 15-30ms | 약 50ms | 해당 없음(매니지드) |
| Cloudflare AI GW | 매니지드 | 약 10-20ms | 약 40ms | 해당 없음(매니지드) |
| Kong AI Gateway | Lua/Go | 약 3ms | 약 8ms | 약 3,000 RPS |
† TrueFoundry의 3ms 미만 수치는 벤더 보고 기준입니다. 셀프 호스팅 오픈소스 게이트웨이와 동일한 독립 부하 테스트를 거치지는 않았습니다.
맥락이 중요합니다. 일반적인 GPT-4o 호출은 출력 길이에 따라 500-3,000ms가 걸립니다. LiteLLM의 8ms 오버헤드조차 전체 레이턴시의 1% 미만입니다. 게이트웨이 오버헤드가 중요한 유일한 시나리오는 실시간 분류나 대규모 임베딩 생성 같은 고빈도·저레이턴시 워크로드입니다. 대화형 AI나 콘텐츠 생성에는 이 목록의 어떤 게이트웨이도 충분히 빠릅니다.
매니지드 게이트웨이(OpenRouter, Cloudflare)는 요청이 제공업체에 도달하기 전에 해당 서버를 경유하므로 오버헤드가 더 큽니다. 셀프 호스팅 게이트웨이는 애플리케이션 옆에서 실행되므로 추가 홉이 로컬입니다.
올바른 LLM 게이트웨이 선택 방법
기능 매트릭스는 건너뛰세요. 표 하나로 결정을 정리했습니다:
| 필요한 것... | 선택 | 이유 |
|---|---|---|
| 최대 유연성 + 셀프 호스팅 | LiteLLM | 100+ 제공업체, 최대 커뮤니티, 최다 통합 |
| 빠른 멀티모델 접근, 무운영 | OpenRouter | 가입하고 300+ 모델 호출 시작 |
| 엔터프라이즈 거버넌스 + 데이터 주권 | TrueFoundry | VPC 실행, SOC 2/HIPAA/GDPR, 에이전트 도구용 MCP Gateway |
| 프로덕션 가드레일 + 컴플라이언스 | Portkey | PII 마스킹, 탈옥 감지, 감사 추적 |
| 관측성이 우선순위 | Helicone | 최고 모니터링, Rust 성능, 한 줄 설정 |
| 최저 레이턴시 오버헤드 | Bifrost | Go로 11us 오버헤드, 클러스터 모드 |
| 이미 Cloudflare 사용 중 | Cloudflare AI GW | 무료, 엣지 캐싱, 무신규 인프라 |
| 이미 Kong 운영 중 | Kong AI GW | 기존 API 관리에 LLM 라우팅 추가 |
| ML 기반 라우팅 최적화 | TensorZero | 피드백 루프, A/B 테스트, <1ms Rust 게이트웨이 |
셀프 호스팅 vs 매니지드에 대한 참고: 셀프 호스팅 게이트웨이(LiteLLM, Helicone, Bifrost, TensorZero)는 데이터 흐름에 대한 완전한 제어를 제공합니다. 실제 LLM API 호출 외에는 인프라 밖으로 나가는 것이 없습니다. 이는 의료, 금융, 그리고 데이터 거주지가 엄격한 요구사항인 모든 맥락에서 중요합니다. 매니지드 게이트웨이(OpenRouter, Cloudflare)는 그 제어를 무운영 부담과 교환합니다. Portkey와 Kong은 그 사이에 위치합니다. 옵션인 매니지드 플랫폼을 갖춘 오픈소스 게이트웨이입니다. 데이터 주권을 우선시하는 팀은 때로 셀프 호스팅 게이트웨이를 로컬 실행 LLM과 결합하여 어떤 요청도 네트워크를 벗어나지 않게 합니다.
대부분의 팀에게 결정은 두 가지 질문으로 귀결됩니다:
- 셀프 호스팅을 원하는가? 예 -> LiteLLM. 아니오 -> OpenRouter.
- 가드레일이 필요한가? 예 -> Portkey. 아니오 -> 1번 선택 유지.
임베딩과 완성을 위해 여러 제공업체를 호출하는 RAG 애플리케이션을 만들고 있다면, 게이트웨이는 사실상 필수입니다. 서로 다른 제공업체 간 구조화된 출력이 필요한 앱도 마찬가지입니다. 게이트웨이는 응답 형식을 정규화하여 모델을 전환할 때 파싱 로직이 깨지지 않게 합니다.
도구 선택은 쉬운 절반입니다. 실제 제품 안에서 안정적으로 실행되게 하는 것이 대부분의 팀이 멈추는 지점이며, 바로 그것이 저희 AI 통합 팀이 고객을 위해 구축하는 것입니다. RAG 파이프라인부터 커스텀 에이전트까지. 스택에 대한 세컨드 오피니언을 원하시나요? 무료 상담 받기.
자주 묻는 질문
LLM 게이트웨이, 프록시, 라우터의 차이는?
프록시는 요청을 전달하고 로깅을 추가합니다. 라우터는 각 요청에 최적의 모델/제공업체를 선택합니다. 게이트웨이는 양쪽에 비용 추적, 캐싱, 가드레일, 관측성을 결합합니다. 실제로 대부분의 "게이트웨이" 도구는 이 셋을 모두 수행하며, 용어는 혼용됩니다.
LiteLLM은 정말 무료인가요?
오픈소스 프록시는 완전히 무료입니다(MIT 라이선스). 자체 호스팅 비용(가벼운 사용에는 월 $5 VPS로 충분)과 LLM 제공업체 API 비용만 부담하면 됩니다. BerriAI는 매니지드 호스팅, SSO, 지원을 원하는 팀을 위한 엔터프라이즈 플랜을 제공합니다.
OpenRouter는 상당한 레이턴시를 추가하나요?
최소입니다. OpenRouter는 작은 라우팅 오버헤드(일반적으로 <50ms)와 여러분과 서버 간 지리적 거리만큼을 추가합니다. 대부분의 애플리케이션에서 차이는 무시할 수준입니다. 초당 수천 건의 요청을 처리하는 레이턴시 크리티컬 시스템에는 Bifrost나 TensorZero 같은 셀프 호스팅 옵션이 더 낫습니다.
여러 게이트웨이를 함께 쓸 수 있나요?
예, 그렇게 하는 팀도 있습니다. 일반적인 패턴은 OpenRouter로 빠르게 프로토타입하고 프로덕션에는 LiteLLM으로 전환하는 것입니다. 또는 Helicone을 LiteLLM 라우팅 앞단의 관측성 계층으로 사용하는 것입니다. 다만 레이턴시 누적을 유의하세요.
캐싱이 가장 좋은 게이트웨이는?
Portkey와 Cloudflare AI Gateway가 가장 성숙한 캐싱 구현을 갖추고 있습니다. Portkey는 시맨틱 캐싱(유사 프롬프트의 퍼지 매칭)을 제공하고, Cloudflare는 지리적 캐싱에 글로벌 엣지 네트워크를 활용합니다. LiteLLM은 Redis 기반 캐싱을 지원합니다. 캐싱 전략에 대한 더 깊은 내용은 LLM 프롬프트 캐싱 가이드를 참고하세요.
LLM 제공업체 하나만 쓰는데 게이트웨이가 필요한가요?
라우팅 목적에는 아마 필요 없습니다. 하지만 관측성(Helicone), 비용 추적(LiteLLM), 가드레일(Portkey) 목적에는 여전히 필요할 수 있습니다. 비용 추적과 로깅 기능만으로도 단일 제공업체 환경에서 게이트웨이를 정당화할 수 있습니다.
게이트웨이는 스트리밍 응답을 어떻게 처리하나요?
이 목록의 모든 게이트웨이는 서버 전송 이벤트(SSE) 스트리밍을 지원합니다. 게이트웨이는 최소한의 버퍼링으로 제공업체에서 클라이언트로 스트림을 프록시합니다. 스트리밍에 대한 레이턴시 영향은 일반적으로 비스트리밍 요청보다 낮은데, 오버헤드가 토큰 단위가 아닌 연결 단위이기 때문입니다.
제공업체가 다운되면 어떻게 되나요?
대부분의 게이트웨이는 폴백 체인을 지원합니다. 기본 제공업체와 하나 이상의 폴백을 구성합니다. 기본 제공업체가 오류를 반환하거나 레이턴시 임계값을 초과하면, 게이트웨이가 자동으로 다음 제공업체로 라우팅합니다. LiteLLM, Portkey, Helicone 모두 이를 잘 처리합니다. OpenRouter는 백그라운드에서 자동으로 처리합니다.
게이트웨이가 비용 한도를 강제할 수 있나요?
예. LiteLLM은 팀, 사용자, API 키별 내장 예산 제어를 갖춥니다. Portkey는 알림과 함께 실시간 지출을 추적합니다. Kong은 토큰 기반 쿼터를 지원합니다. Cloudflare는 사용량 분석을 제공합니다. 이는 사실 게이트웨이 사용의 가장 강력한 근거 중 하나입니다. 게이트웨이 없이 폭주 루프 하나면 하룻밤 사이에 API 예산을 태울 수 있습니다.
스타트업 vs 엔터프라이즈에 가장 좋은 게이트웨이는?
스타트업: OpenRouter(무설정) 또는 LiteLLM(무료, 유연). 엔터프라이즈: TrueFoundry(데이터 주권, SOC 2/HIPAA/GDPR, MCP Gateway를 통해 모델 및 에이전트 도구 트래픽 모두 통제), Portkey(가드레일, 컴플라이언스, 감사 추적), 또는 Kong AI Gateway(이미 Kong 사용 시). 주요 엔터프라이즈 차별점은 SSO, 역할 기반 접근, 데이터 거주지 제어, 감사 로깅입니다. 스타트업에는 아직 필요 없지만 엔터프라이즈는 건너뛸 수 없는 기능들입니다.
최고의 LLM 프록시는?
LiteLLM은 대부분의 팀에게 최고의 LLM 프록시입니다. 독립형 Docker 컨테이너로 실행되며, 100개 이상 제공업체를 OpenAI 호환 엔드포인트 뒤에서 감싸고, 셀프 호스팅이 완전히 무료입니다. "프록시"가 무인프라를 의미한다면, OpenRouter는 단일 API 키로 300개 이상 모델을 갖춘 클라우드 호스팅 프록시로 기능합니다. 차이는 제어입니다: LiteLLM은 데이터를 여러분의 서버에 유지하고, OpenRouter는 자사 플랫폼을 통해 라우팅합니다.
LLM 게이트웨이와 LLM 라우터의 차이는?
LLM 라우터는 주로 비용, 레이턴시, 프롬프트 콘텐츠에 따라 주어진 요청을 처리할 모델이나 제공업체를 선택합니다. LLM 게이트웨이는 그 이상을 수행합니다: 라우팅 계층 위에 비용 추적, 캐싱, 가드레일, 속도 제한, 관측성을 추가합니다. 이 목록의 모든 도구는 기술적으로 게이트웨이입니다. 순수 라우터(다른 미들웨어 없이 모델 선택만 하는 도구)는 프로덕션에서 드문데, 팀은 라우팅과 함께 최소한 로깅을 거의 항상 필요로 하기 때문입니다.