
Pare de Malabarismar com APIs de LLM: 9 Ferramentas de Gateway Classificadas para 2026
Última atualização: 24 de junho de 2026. Revalidámos os preços, as contagens de estrelas no GitHub e as listas de suporte dos fornecedores para todos os 9 gateways, e adicionámos a TrueFoundry, um plano de controlo empresarial que também gere o acesso às ferramentas dos agentes através do seu MCP Gateway. O lançamento completo em código aberto da Portkey (março de 2026) e os números atualizados de benchmark da Bifrost estão refletidos abaixo.
O melhor gateway LLM em 2026 é o LiteLLM para equipas autoalojadas e o OpenRouter para acesso gerido e sem operações. O LiteLLM suporta mais de 100 fornecedores através de uma única API compatível com a OpenAI, lida com fallbacks e controlos de orçamento, e funciona gratuitamente em qualquer VPS. O OpenRouter oferece acesso instantâneo a mais de 300 modelos sem necessidade de infraestrutura. Para empresas regulamentadas que necessitam de soberania de dados e governação tanto do tráfego de modelos como de agentes, a TrueFoundry funciona inteiramente na sua própria VPC. Para salvaguardas de produção (redação de PII, deteção de jailbreak), a Portkey é a escolha certa. Para throughput bruto acima de 5.000 RPS, a arquitetura Go da Bifrost adiciona apenas 11 microssegundos de sobrecarga.
Está a chamar a OpenAI para o seu chatbot, a Anthropic para o seu assistente de programação e a Gemini para a sua pipeline de sumarização. Três chaves de API, três SDKs, três painéis de faturação, três conjuntos de tratamento de erros. Agora adicione lógica de fallback quando um fornecedor cai. É essa confusão que os gateways LLM resolvem, com uma API unificada que encaminha para qualquer modelo, rastreia custos e lida com falhas automaticamente.
Testámos todos os principais gateways LLM e classificámos-nos pelo que realmente importa: sobrecarga de latência, cobertura de fornecedores, facilidade de configuração e se sobreviverão ao seu próximo pico de tráfego.
| Classificação | Ferramenta | Melhor Para | Tipo | Preço Inicial |
|---|---|---|---|---|
| n.º 1 | LiteLLM | Flexibilidade geral | Autoalojado (código aberto) | Gratuito |
| n.º 2 | OpenRouter | Acesso multimodelo sem configuração | SaaS Gerido | Pagamento por token |
| n.º 3 | TrueFoundry | Governação empresarial + MCP | Autoalojado + gerido | Nível gratuito ($499/mês Pro) |
| n.º 4 | Portkey | Salvaguardas de produção | Híbrido (código aberto + gerido) | Nível gratuito |
| n.º 5 | Helicone | Equipas focadas em observabilidade | Autoalojado (código aberto) | Gratuito |
| n.º 6 | Bifrost | Desempenho de throughput bruto | Autoalojado (código aberto) | Gratuito |
| n.º 7 | Cloudflare AI Gateway | Encaminhamento sem infraestrutura | Gerido | Nível gratuito |
| n.º 8 | Kong AI Gateway | Equipas de gestão de API | Autoalojado + empresarial | Comunidade gratuita |
| n.º 9 | TensorZero | Encaminhamento otimizado para ML | Autoalojado (código aberto) | Gratuito |
O Que é um Gateway LLM? (E Precisa Realmente de Um?)
Antes das classificações, uma distinção rápida. As pessoas usam "gateway", "proxy" e "router" de forma intercambiável, mas eles servem papéis ligeiramente diferentes:
- Proxy LLM: Encaminha pedidos para os fornecedores, adiciona registo. Lógica mínima.
- Router LLM: Escolhe o melhor modelo ou fornecedor para cada pedido com base no custo, latência ou conteúdo.
- Gateway LLM: O pacote completo, proxy + router + rastreio de custos + cache + salvaguardas + observabilidade.
A maioria das ferramentas nesta lista são gateways completos, mas algumas inclinam-se mais para o território de proxy ou router.
Precisa de um gateway se:
- Chama 2+ fornecedores de LLM e quer uma API para todos eles
- Precisa de rastreio de custos entre fornecedores (quem está a queimar o seu orçamento?)
- Quer failover automático quando um fornecedor tem uma interrupção
- Está a construir funcionalidades que beneficiam de cache de prompts entre fornecedores
Se utiliza apenas um único fornecedor e não tem planos de mudar, um gateway adiciona complexidade desnecessária. Ignore-o.
O caminho típico de adoção: A maioria das equipas começa por codificar diretamente as chamadas à OpenAI. Depois adicionam a Anthropic para um segundo caso de uso e escrevem uma função wrapper. Depois precisam de lógica de fallback, rastreio de custos e limitação de taxa, e de repente construíram eles próprios um gateway mal acabado. As ferramentas abaixo substituem essa confusão caseira por algo testado em batalha.
1. LiteLLM, Melhor no Geral
Estrelas no GitHub: ~40K | Linguagem: Python | Licença: MIT
O LiteLLM é o canivete suiço dos gateways LLM. Envolve mais de 100 fornecedores de LLM atrás de uma única API compatível com a OpenAI, o que significa que o seu código existente do SDK da OpenAI funciona sem alterações. Basta trocar o URL base.
O componente do servidor proxy é o que torna o LiteLLM um gateway e não apenas um SDK. Implementa-o como um serviço autónomo, configura os seus modelos num ficheiro YAML, e toda a equipa acede ao mesmo endpoint com rastreio de custos, limitação de taxa e balanceamento de carga integrados.
# config.yaml for LiteLLM proxy
model_list:
- model_name: gpt-4
litellm_params:
model: openai/gpt-4o
api_key: sk-...
- model_name: gpt-4
litellm_params:
model: anthropic/claude-sonnet-4-20250514
api_key: sk-ant-...
# LiteLLM load-balances between these automatically
general_settings:
master_key: sk-my-master-key
database_url: postgresql://...# Your app code doesn't change -- just point to the proxy
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:4000", # LiteLLM proxy
api_key="sk-my-master-key"
)
response = client.chat.completions.create(
model="gpt-4", # Routes to OpenAI or Anthropic via config
messages=[{"role": "user", "content": "Explain LLM gateways"}]
)O que é bom:
- Mais de 100 fornecedores suportados (maior cobertura de qualquer gateway)
- API compatível com a OpenAI, zero alterações de código para aplicações existentes
- Rastreio de custos integrado, orçamentos por equipa/utilizador
- Cadeias de fallback: se a OpenAI falhar, tente a Anthropic, depois a Gemini
- Integra-se com todas as principais ferramentas de observabilidade (Langfuse, Helicone, etc.)
O que não é tão bom:
- O GIL do Python limita o throughput de processo único (latência P95 ~8ms a 1K RPS)
- O proxy precisa da sua própria base de dados PostgreSQL para funcionalidades de gestão de equipas
- A configuração pode tornar-se complexa com muitos modelos e regras de encaminhamento
- Incidente recente de segurança da cadeia de abastecimento (pacote PyPI malicioso, rapidamente detetado)
Preços: Gratuito e de código aberto. Planos empresariais disponíveis para gestão alojada.
Se leu o nosso guia sobre usar o Claude Code com diferentes modelos, já viu o LiteLLM em ação; é uma das principais formas como os programadores encaminham o Claude Code através de fornecedores alternativos.
Veredicto: O LiteLLM é o melhor gateway LLM global para equipas que querem máxima flexibilidade e não se importam de alojar por conta própria. Tem a maior cobertura de fornecedores, o ecossistema mais maduro e a maior comunidade. Comece aqui, a menos que tenha uma razão específica para não o fazer. O nosso guia de configuração do proxy LiteLLM explica a implementação completa do Docker com PostgreSQL em menos de 20 minutos.
2. OpenRouter, Melhor Gateway Gerido
Modelos: 300+ | Tipo: SaaS Gerido | Licença: Proprietária
O OpenRouter adota a abordagem oposta ao LiteLLM: não implementa nada. Inscreva-se, obtenha uma chave de API e terá acesso instantâneo a mais de 300 modelos de todos os principais fornecedores através de um único endpoint. É a "app store" das APIs LLM.
A proposta de valor é a simplicidade. Sem infraestrutura para manter, sem configurações YAML para escrever, sem bases de dados para provisionar. Pré-paga créditos ou associa um cartão, e o OpenRouter trata da consolidação da faturação entre todos os fornecedores.
from openai import OpenAI
client = OpenAI(
base_url="https://openrouter.ai/api/v1",
api_key="sk-or-..."
)
# Access any model from any provider -- same code
response = client.chat.completions.create(
model="anthropic/claude-sonnet-4-20250514",
messages=[{"role": "user", "content": "Compare LLM gateways"}]
)O que é bom:
- Mais de 300 modelos, uma única chave de API, um painel de faturação
- Mais de 25 modelos gratuitos para prototipagem (incluindo alguns surpreendentemente capazes)
- Sem infraestrutura para gerir, inscreva-se e comece a chamar
- Funcionalidades de comparação de modelos ajudam a avaliar antes de se comprometer
- Lida com interrupções dos fornecedores com encaminhamento automático de fallback
O que não é tão bom:
- Taxa de plataforma de 5,5% sobre os preços dos fornecedores, acumula-se à escala
- Sem opção de autoalojamento, os seus dados passam pelos servidores do OpenRouter
- Observabilidade limitada em comparação com ferramentas de gateway dedicadas
- Os limites de taxa no nível gratuito podem ser restritivos para cargas de trabalho de produção
- Sem lógica de encaminhamento personalizada, obtém o que o OpenRouter decidir
Preços: Pagamento por token (preço do fornecedor + taxa de 5,5%). Sem mínimos mensais. Mais de 25 modelos gratuitos disponíveis.
Veredicto: O OpenRouter é a forma mais rápida de aceder a múltiplos fornecedores de LLM. Se quiser prototipar com diferentes modelos ou executar uma carga de trabalho pequena a média sem gerir infraestrutura, é a escolha óbvia. À escala, a taxa de 5,5% começa a importar. Se a redução de custos for o motor, consulte o nosso guia para reduzir custos de API LLM para uma análise completa das alavancas de poupança ao nível da cache, loteamento e gateway.
3. TrueFoundry, Melhor para Governação Empresarial
Modelos: 1.600+ | Fornecedores: 250+ | Tipo: Autoalojado + gerido | Implementação: VPC, on-premise, isolado
O AI Gateway da TrueFoundry foi construído para o caso com que os gateways de código aberto lutam: uma empresa regulamentada que precisa de um plano de controlo único para cada modelo, soberania total de dados e trilhas de auditoria que sobrevivam a uma revisão de conformidade. Funciona na sua própria VPC, on-premise ou totalmente isolado, por isso nenhum dado de pedido sai do seu domínio, e vem com conformidade SOC 2, HIPAA e GDPR, SSO e RBAC prontos a usar.
A cobertura está entre as mais amplas desta lista: mais de 1.600 modelos em mais de 250 fornecedores (OpenAI, Anthropic, Gemini, Groq, Mistral), além de backends autoalojados como vLLM, SGLang e Triton. A TrueFoundry reporta latência interna inferior a 3 ms em carga empresarial e 99,99% de tempo de atividade em mais de 10 mil milhões de pedidos por mês, por isso a camada de governação não lhe custa throughput.
from openai import OpenAI
client = OpenAI(
base_url="https://<your-org>.truefoundry.com/api/llm", # your gateway
api_key="tfy-..."
)
response = client.chat.completions.create(
model="openai/gpt-4o", # routed, logged, and rate-limited centrally
messages=[{"role": "user", "content": "Summarize this contract"}]
)O que separa a TrueFoundry da Portkey ou do LiteLLM é o MCP Gateway: um registo central que gere como os agentes de IA acedem às ferramentas empresariais (Slack, GitHub, Confluence, Datadog) através do Model Context Protocol. Regista APIs internas como servidores MCP, protege-as atrás do Okta ou Azure AD com RBAC por servidor e obtém rastreio ao nível do pedido em cada chamada de ferramenta. Isso dá-lhe um plano de controlo governado único para o tráfego de modelos e o tráfego de ferramentas de agentes, o que importa quando os agentes começam a tomar ações, não apenas a gerar texto.
Ao contrário da maioria dos gateways empresariais, a TrueFoundry publica os seus preços antecipadamente. Um nível Developer gratuito cobre 50.000 pedidos por mês, 3 utilizadores e o MCP Gateway para até 5 servidores, o que é suficiente para prototipar a stack completa antes de falar com alguém. O nível Pro é de $499/mês para 1 milhão de pedidos, 10 utilizadores, cache semântica, modelos virtuais e encaminhamento avançado, com utilização extra faturada a taxas fixas por unidade. O Pro Plus custa $2.999/mês e adiciona metadados personalizados, alertas e exportações de monitorização para 25 utilizadores. O Enterprise tem preço personalizado para mais de 10 milhões de pedidos com instalações completas de VPC, multi-região e isoladas tanto do plano de controlo como do gateway. Todos os planos pagos incluem uma avaliação de 7 dias. O SaaS gerido não tem custo de alojamento; se alojar o gateway dentro da sua própria nuvem (BYOC), conte com cerca de $600 a $1.000 por mês para a infraestrutura subjacente.
O que é bom:
- Mais de 1.600 modelos, mais de 250 fornecedores, além de backends autoalojados (vLLM, SGLang, Triton)
- Funciona na sua VPC, on-premise ou isolado; nenhum dado sai do seu domínio
- Conformidade SOC 2, HIPAA, GDPR, SSO, RBAC e registo de auditoria integrados
- Salvaguardas: filtragem de PII, deteção de toxicidade, varredura de injeção de prompts
- O MCP Gateway gere o acesso às ferramentas dos agentes, não apenas as chamadas de modelo
- Preços públicos e transparentes com um nível Developer genuinamente gratuito (50K pedidos/mês)
- A TrueFoundry reporta ~30% de redução média de custos através de encaminhamento, cache e orçamentos
O que não é tão bom:
- Foco empresarial: mais pesado que o LiteLLM ou OpenRouter para um pequeno projeto
- A plataforma principal é proprietária (os seus repositórios de código aberto são ferramentas de infraestrutura separadas)
- Alojar o gateway por conta própria adiciona cerca de $600 a $1.000/mês em infraestrutura para além do seu plano
- Mais valioso quando já tem muitas equipas e ferramentas para gerir, não no primeiro dia
Preços: Nível Developer gratuito ($0/mês, 50K pedidos, 3 utilizadores). Pro $499/mês (1M pedidos, 10 utilizadores, cache semântica, encaminhamento avançado). Pro Plus $2.999/mês (25 utilizadores, observabilidade avançada). Enterprise personalizado (10M+ pedidos, VPC completa e isolado). Avaliação de 7 dias nos planos pagos; o SaaS gerido não tem custo de alojamento, o autoalojamento adiciona ~$600-$1.000/mês de infraestrutura.
Veredicto: A TrueFoundry é o gateway para empresas que precisam de um plano de controlo governado único tanto para o tráfego de modelos como para o acesso às ferramentas dos agentes, com os dados a permanecerem dentro da sua própria infraestrutura. Se é uma startup a ligar dois fornecedores, é mais do que precisa, comece com o LiteLLM. Se é uma equipa de plataforma a implementar IA em dezenas de equipas internas sob um mandato de conformidade, deve estar na sua lista curta.
4. Portkey, Melhor para Salvaguardas de Produção
Estrelas no GitHub: ~7K | Linguagem: TypeScript/Node.js | Licença: Apache 2.0 (gateway), plataforma gerida
A Portkey posiciona-se como o "plano de controlo para IA". Enquanto o LiteLLM se foca no encaminhamento e o OpenRouter na simplicidade, o diferencial da Portkey é a segurança de produção: salvaguardas, redação de PII, deteção de jailbreak e trilhas de auditoria integradas na camada do gateway.
Em março de 2026, a Portkey tornou todo o seu gateway de código aberto (Apache 2.0), por isso pode alojar por conta própria o encaminhamento central e as salvaguardas sem a plataforma gerida.
from portkey_ai import Portkey
portkey = Portkey(
api_key="pk-...",
config={
"strategy": {"mode": "fallback"},
"targets": [
{"provider": "openai", "override_params": {"model": "gpt-4o"}},
{"provider": "anthropic", "override_params": {"model": "claude-sonnet-4-20250514"}}
]
}
)
response = portkey.chat.completions.create(
messages=[{"role": "user", "content": "Summarize this document"}]
)O que é bom:
- Suporte para mais de 1.600 modelos entre fornecedores
- Salvaguardas integradas: deteção de PII, prevenção de jailbreak, filtragem de conteúdo
- Gestão e versionamento de prompts dentro do gateway
- A camada de cache reduz chamadas repetidas (poupa dinheiro e latência)
- Trilhas de auditoria e funcionalidades de conformidade para indústrias regulamentadas
- Agora gateway totalmente de código aberto (março de 2026)
O que não é tão bom:
- Os preços da plataforma gerida começam em $49/mês para funcionalidades de produção
- Nível empresarial ($5K-$10K/mês) para governação avançada
- A plataforma adiciona complexidade para além do que gateways mais simples oferecem
- Curva de aprendizagem mais acentuada que o LiteLLM ou OpenRouter
Preços: O gateway de código aberto é gratuito. Plataforma gerida: Nível gratuito (prototipagem), $49/mês (produção), enterprise personalizado.
Veredicto: A Portkey é o gateway para equipas que constroem funcionalidades LLM voltadas para o cliente e que não podem permitir injeção de prompts, fugas de PII ou custos não monitorizados. As salvaguardas justificam a complexidade. Se está a construir ferramentas internas, existem opções mais simples.
5. Helicone, Melhor para Equipas Focadas em Observabilidade
Estrelas no GitHub: ~3K | Linguagem: Rust | Licença: Apache 2.0
A Helicone começou como uma ferramenta de observabilidade e evoluiu para um gateway completo. Essa história de origem é importante; o seu monitorização e análises são os melhores da categoria, e as funcionalidades de gateway (encaminhamento, cache, failover) foram construídas sobre uma fundação de observabilidade sólida.
Ser escrito em Rust dá-lhe uma vantagem real de desempenho: latência P50 de 8 ms, P95 abaixo de 5 ms, aproximadamente 3.000 RPS numa única instância com apenas 64 MB de memória.
# Helicone: one-line proxy -- just change the base URL
from openai import OpenAI
client = OpenAI(
base_url="https://oai.helicone.ai/v1", # or your self-hosted URL
api_key="sk-...",
default_headers={
"Helicone-Auth": "Bearer hlc-..."
}
)
# All requests are now logged, tracked, and routed through Helicone
response = client.chat.completions.create(
model="gpt-4o",
messages=[{"role": "user", "content": "Analyze this code"}]
)O que é bom:
- Baseado em Rust: ~64 MB de memória, latência P95 <5 ms, 3K RPS por instância
- O balanceamento de carga consciente da saúde encaminha para o fornecedor disponível mais rápido
- Painéis em tempo real para custos, latência, uso de tokens e taxas de erro
- Integração numa linha, literalmente basta alterar o URL base
- Implementação de binário único (Docker, K8s, bare metal)
O que não é tão bom:
- As funcionalidades de observabilidade são a estrela; o encaminhamento é menos sofisticado que o LiteLLM
- Menos fornecedores suportados que o LiteLLM ou OpenRouter
- Comunidade menor que a do LiteLLM (3K vs 40K estrelas no GitHub)
- Funcionalidades avançadas (propriedades personalizadas, sessões) requerem a plataforma gerida
Preços: Código aberto e gratuito para autoalojamento. Os preços da plataforma gerida variam.
Se estiver a avaliar ferramentas de observabilidade de forma mais ampla, a nossa classificação das melhores plataformas de observabilidade de IA cobre a Helicone juntamente com a Langfuse, Arize e outras.
Veredicto: A Helicone é o melhor gateway para equipas cuja dor principal é "não conseguimos ver o que está a acontecer com as nossas chamadas LLM". Se a observabilidade é a sua preocupação n.º 1 e o encaminhamento do gateway é secundário, a Helicone dá-lhe ambos sem compromisso.
6. Bifrost, Melhor para Desempenho Bruto
Estrelas no GitHub: ~2K | Linguagem: Go | Licença: MIT
A Bifrost é a campeã de desempenho. Construída em Go pela equipa Maxim, afirma ter um desempenho 50 vezes mais rápido que o LiteLLM com apenas 11 microssegundos de sobrecarga por pedido a 5.000 RPS. Estes não são números teóricos, vêm de testes de carga sustentados reproduzíveis.
A diferença arquitetónica é fundamental: as goroutines do Go lidam com milhares de conexões simultâneas sem o gargalo do GIL do Python, e o binário compilado elimina totalmente a sobrecarga do interpretador.
# bifrost.yaml
account:
provider: openai
api_key: ${OPENAI_API_KEY}
models:
- name: gpt-4o
provider: openai
- name: claude-sonnet-4-20250514
provider: anthropic
routing:
strategy: round-robin
fallback: trueO que é bom:
- Sobrecarga de 11us a 5.000 RPS, a mais baixa de qualquer gateway nesta lista
- Binário Go: sem dependências de runtime, pegada de memória minúscula
- Balanceamento de carga adaptativo entre fornecedores
- Modo cluster para escalabilidade horizontal
- Mais de 1.000 modelos suportados
O que não é tão bom:
- Projeto mais recente, comunidade menor e menos integrações
- Funcionalidades de observabilidade menos maduras que a Helicone ou Portkey
- Construída pela Maxim (um fornecedor), direção futura ligada ao seu roteiro
- Documentação mais fina que a extensa documentação do LiteLLM
- Sem gestão de equipas ou controlos de orçamento integrados
Preços: Gratuito e de código aberto (licença MIT).
Veredicto: A Bifrost é para equipas que executam sistemas de produção de alto throughput onde a sobrecarga do gateway importa. Se está a processar milhares de chamadas LLM por segundo e cada microssegundo de latência conta, a arquitetura Go da Bifrost entrega. Para a maioria das equipas, a sobrecarga de 8 ms do LiteLLM é perfeitamente aceitável.
7. Cloudflare AI Gateway, Melhor Opção Sem Infraestrutura
Tipo: Serviço gerido | Licença: Proprietária (Cloudflare)
O Cloudflare AI Gateway leva a abordagem "não gere nada" ao extremo. Se já está na Cloudflare (e muitas equipas estão), pode ativar o AI Gateway a partir do painel e começar a encaminhar chamadas LLM através da rede edge da Cloudflare sem infraestrutura adicional.
// Just prefix your provider URL with Cloudflare's gateway endpoint
const response = await fetch(
"https://gateway.ai.cloudflare.com/v1/{account_id}/{gateway_name}/openai/chat/completions",
{
method: "POST",
headers: {
"Authorization": "Bearer sk-...",
"Content-Type": "application/json"
},
body: JSON.stringify({
model: "gpt-4o",
messages: [{ role: "user", content: "Hello" }]
})
}
);O que é bom:
- Nível gratuito com 100K registos/mês, suficiente para a maioria dos projetos laterais
- Zero infraestrutura: ative a partir do painel da Cloudflare
- Cache integrada na edge (reduz custo e latência)
- Limitação de taxa e análises incluídas
- Faturação unificada: pague pelos custos do fornecedor LLM através da Cloudflare
- A rede edge global reduz a latência para utilizadores geograficamente distribuídos
O que não é tão bom:
- Fortemente acoplado ao ecossistema Cloudflare, os custos de mudança são reais
- Inteligência de encaminhamento limitada em comparação com gateways dedicados
- Limite de 100K registos no nível gratuito; plano pago (Workers Paid) para 1M
- Menos fornecedores suportados que o LiteLLM ou OpenRouter
- Sem opção de autoalojamento
Preços: Gratuito (100K registos/mês), subscrição Workers Paid para 1M registos. Sem taxa de gateway por pedido. Ainda paga aos fornecedores LLM separadamente.
Para equipas que encaminham chamadas de função entre fornecedores, a cache edge da Cloudflare pode reduzir significativamente a latência para padrões repetidos de uso de ferramentas.
Veredicto: O Cloudflare AI Gateway é a melhor opção se já está na Cloudflare e quer funcionalidades de gateway sem implementar nada de novo. O nível gratuito é generoso para pequenos projetos. Para uso sério de produção, gateways dedicados oferecem mais controlo.
8. Kong AI Gateway, Melhor para Equipas de Gestão de API
Estrelas no GitHub: ~40K (total do Kong Gateway) | Linguagem: Lua/OpenResty | Licença: Apache 2.0 (comunidade)
O Kong AI Gateway não é um produto autónomo, é uma extensão do API Gateway testado em batalha da Kong que adiciona capacidades específicas de LLM. Se a sua organização já executa o Kong para gestão de API, adicionar encaminhamento de IA é uma instalação de plugin, não uma nova plataforma.
# Kong declarative config (deck)
services:
- name: ai-llm-service
url: https://api.openai.com
plugins:
- name: ai-proxy
config:
route_type: llm/v1/chat
model:
provider: openai
name: gpt-4o
- name: ai-rate-limiting-advanced
config:
limit: [10000]
window_size: [60]
window_type: fixed
strategy: local
limit_by: consumerO que é bom:
- Baseia-se na plataforma madura de gestão de API da Kong (usada por milhares de empresas)
- Encaminhamento semântico: encaminha pedidos com base no conteúdo/intenção do prompt
- Limitação de taxa baseada em tokens (não apenas baseada em pedidos)
- Ecossistema de plugins: autenticação, limitação de taxa, transformações funcionam com rotas de IA
- Métricas OpenTelemetry + Prometheus para integração com Datadog/Grafana
O que não é tão bom:
- Exagero se não usar já o Kong, curva de aprendizagem acentuada
- Funcionalidades empresariais de IA requerem licença Kong Enterprise (paga)
- Complexidade de configuração mais elevada que qualquer outro gateway nesta lista
- Requer conhecimento da infraestrutura Kong (ou a equipa para o aprender)
- Funcionalidades específicas de IA são mais recentes e menos maduras que o núcleo da Kong
Preços: A edição da comunidade é gratuita (código aberto). As funcionalidades empresariais de IA requerem uma subscrição Kong Enterprise (preço personalizado).
Veredicto: O Kong AI Gateway faz sentido se e só se a sua organização já executa o Kong. Adicionar encaminhamento LLM à sua camada existente de gestão de API é mais inteligente do que implementar um gateway separado. Mas não adote o Kong apenas para encaminhamento LLM, isso é como comprar um tractor para cortar a relva do seu jardim.
9. TensorZero, Melhor para Encaminhamento Otimizado para ML
Estrelas no GitHub: ~5,5K | Linguagem: Rust | Licença: Apache 2.0
O TensorZero é o gateway mais opinativo desta lista. Enquanto outros se focam no encaminhamento e observabilidade, o TensorZero constrói um ciclo de otimização: recolhe dados de inferência, executa avaliações e usa os resultados para melhorar as decisões de encaminhamento ao longo do tempo. Pense nele como um gateway que aprende qual modelo funciona melhor para cada tipo de pedido.
A implementação em Rust entrega latência P99 inferior a um milissegundo, mesmo a 10.000+ QPS. Não é um erro tipográfico. Enquanto o LiteLLM adiciona ~8 ms e a Bifrost adiciona ~11 us, o TensorZero afirma <1 ms P99 sob carga extrema.
# TensorZero: structured inference with optimization
from tensorzero import TensorZeroGateway
with TensorZeroGateway("http://localhost:3000") as client:
response = client.inference(
function_name="generate_summary",
input={
"messages": [
{"role": "user", "content": "Summarize this article..."}
]
}
)
# Later: feed back quality data to improve routing
client.feedback(
metric_name="summary_quality",
inference_id=response.inference_id,
value=0.92
)O que é bom:
- Latência P99 <1 ms a 10K+ QPS (desempenho bruto mais rápido com Rust)
- Ciclo de feedback: aprende quais modelos têm melhor desempenho para cada função
- Inferência estruturada com validação de esquema
- Testes A/B entre modelos integrados no gateway
- Framework de avaliação integrado
O que não é tão bom:
- Curva de aprendizagem mais acentuada que qualquer outro gateway, define "funções", não apenas modelos
- Ecossistema mais recente, comunidade menor
- Requer repensar a sua integração LLM em torno do conceito de função do TensorZero
- Menos "drop-in" que o LiteLLM ou OpenRouter, não é uma simples troca de URL base
- Documentação a melhorar, mas ainda em maturação
Preços: Gratuito e de código aberto (Apache 2.0).
Para equipas que já executam avaliações de LLM, o ciclo de feedback do TensorZero fecha a lacuna entre avaliação e encaminhamento; as suas pontuações de avaliação melhoram diretamente para quais modelos são encaminhados.
Veredicto: O TensorZero é para equipas de engenharia de ML que querem que o seu gateway fique mais inteligente ao longo do tempo. O ciclo de otimização é genuinamente inovador. Mas a curva de aprendizagem é acentuada, e a maioria das equipas não precisa de encaminhamento otimizado para ML, precisam de encaminhamento fiável com boa observabilidade.
Sobrecarga de Latência do Gateway LLM: Os Números Reais
Cada gateway adiciona alguma sobrecarga às suas chamadas LLM. A questão é se isso importa para o seu caso de uso. Eis como os gateways se comparam nos nossos testes:
| Gateway | Linguagem | Sobrecarga de Latência P50 | Sobrecarga de Latência P95 | Throughput (instância única) |
|---|---|---|---|---|
| Bifrost | Go | ~8us | ~11us | 5.000+ RPS |
| TensorZero | Rust | ~0,3ms | <1ms | 10.000+ QPS |
| Helicone | Rust | ~5ms | ~8ms | ~3.000 RPS |
| TrueFoundry | Autoalojado | ~3ms† | <3ms† | 10B+/mês (fornecedor) |
| LiteLLM | Python | ~4ms | ~8ms | ~1.000 RPS |
| Portkey | TypeScript | ~5ms | ~12ms | ~2.000 RPS |
| OpenRouter | Gerido | ~15-30ms | ~50ms | N/A (gerido) |
| Cloudflare AI GW | Gerido | ~10-20ms | ~40ms | N/A (gerido) |
| Kong AI Gateway | Lua/Go | ~3ms | ~8ms | ~3.000 RPS |
† O valor inferior a 3 ms da TrueFoundry é reportado pelo fornecedor; não o submetemos ao mesmo teste de carga independente que os gateways de código aberto autoalojados.
O contexto importa. Uma chamada típica ao GPT-4o demora 500-3.000 ms dependendo do comprimento da saída. Mesmo a sobrecarga de 8 ms do LiteLLM é inferior a 1% da latência total. O único cenário onde a sobrecarga do gateway importa é em cargas de trabalho de alta frequência e baixa latência, como classificação em tempo real ou geração de embeddings à escala. Para IA conversacional ou geração de conteúdo, qualquer gateway nesta lista é suficientemente rápido.
Os gateways geridos (OpenRouter, Cloudflare) adicionam mais sobrecarga porque o seu pedido viaja para os seus servidores antes de chegar ao fornecedor. Os gateways autoalojados funcionam junto à sua aplicação, por isso o salto extra é local.
Como Escolher o Gateway LLM Certo
Ignore as matrizes de funcionalidades. Eis a decisão numa tabela:
| Se Precisa de... | Escolha | Porquê |
|---|---|---|
| Máxima flexibilidade + autoalojado | LiteLLM | Mais de 100 fornecedores, maior comunidade, mais integrações |
| Acesso multimodelo rápido, sem ops | OpenRouter | Inscreva-se e comece a chamar mais de 300 modelos |
| Governação empresarial + soberania de dados | TrueFoundry | Funciona na sua VPC, SOC 2/HIPAA/GDPR, MCP Gateway para ferramentas de agentes |
| Salvaguardas de produção + conformidade | Portkey | Redação de PII, deteção de jailbreak, trilhas de auditoria |
| Observabilidade como prioridade | Helicone | Melhor monitorização, desempenho Rust, configuração numa linha |
| Menor sobrecarga de latência possível | Bifrost | Sobrecarga de 11us em Go, modo cluster |
| Já está na Cloudflare | Cloudflare AI GW | Gratuito, cache edge, zero nova infraestrutura |
| Já executa o Kong | Kong AI GW | Adicione encaminhamento LLM à gestão de API existente |
| Otimização de encaminhamento orientada por ML | TensorZero | Ciclo de feedback, testes A/B, gateway Rust <1ms |
Uma nota sobre autoalojado vs gerido: Gateways autoalojados (LiteLLM, Helicone, Bifrost, TensorZero) dão-lhe controlo total sobre o fluxo de dados, nada sai da sua infraestrutura exceto a chamada real à API LLM. Isso importa para saúde, finanças e qualquer contexto onde a residência de dados seja um requisito rígido. Gateways geridos (OpenRouter, Cloudflare) trocam esse controlo por zero carga operacional. A Portkey e a Kong situam-se no meio, gateways de código aberto com plataformas geridas opcionais. Equipas que priorizam a soberania de dados combinam às vezes um gateway autoalojado com LLMs executados localmente para que nenhum pedido saia da sua rede.
Para a maioria das equipas, a decisão resume-se a duas perguntas:
- Quer alojar por conta própria? Sim -> LiteLLM. Não -> OpenRouter.
- Precisa de salvaguardas? Sim -> Portkey. Não -> fique com o n.º 1.
Se está a construir aplicações RAG que chamam múltiplos fornecedores para embeddings e conclusões, um gateway é praticamente obrigatório. O mesmo se aplica a apps que precisam de saídas estruturadas entre diferentes fornecedores; os gateways normalizam o formato da resposta para que a sua lógica de análise não quebre quando muda de modelos.
Escolher uma ferramenta é a metade fácil. Fazê-la funcionar de forma fiável dentro de um produto real é onde a maioria das equipas estagna, e é exatamente isso que a nossa equipa de integração de IA constrói para clientes, desde pipelines RAG até agentes personalizados. Quer uma segunda opinião sobre a sua stack? Obtenha uma consulta gratuita.
Perguntas Frequentes
Qual é a diferença entre um gateway LLM, proxy e router?
Um proxy encaminha pedidos e adiciona registo. Um router escolhe o melhor modelo/fornecedor para cada pedido. Um gateway combina ambos com rastreio de custos, cache, salvaguardas e observabilidade. Na prática, a maioria das ferramentas "gateway" fazem os três, os termos são usados de forma intercambiável.
O LiteLLM é realmente gratuito?
O proxy de código aberto é completamente gratuito (licença MIT). Paga pelo seu próprio alojamento (um VPS de $5/mês funciona para uso leve) e pelos custos da API do fornecedor LLM. A BerriAI oferece planos empresariais para equipas que querem alojamento gerido, SSO e suporte.
O OpenRouter adiciona latência significativa?
Mínima. O OpenRouter adiciona uma pequena sobrecarga de encaminhamento (tipicamente <50 ms) mais qualquer distância geográfica entre si e os seus servidores. Para a maioria das aplicações, a diferença é negligenciável. Para sistemas críticos de latência que processam milhares de pedidos por segundo, opções autoalojadas como a Bifrost ou TensorZero são melhores.
Posso usar múltiplos gateways juntos?
Sim, e algumas equipas fazem-no. Um padrão comum é usar o OpenRouter para prototipagem rápida e mudar para o LiteLLM para produção. Ou usar a Helicone como camada de observabilidade à frente do encaminhamento do LiteLLM. Apenas tenha cuidado com o empilhamento de latência.
Qual gateway tem a melhor cache?
A Portkey e o Cloudflare AI Gateway têm as implementações de cache mais maduras. A Portkey oferece cache semântica (correspondência difusa de prompts semelhantes), enquanto a Cloudflare usa a sua rede edge global para cache geográfica. O LiteLLM suporta cache baseado em Redis. Para uma visão mais profunda das estratégias de cache, consulte o nosso guia de cache de prompts LLM.
Preciso de um gateway se usar apenas um fornecedor LLM?
Provavelmente não para encaminhamento. Mas pode ainda querer um para observabilidade (Helicone), rastreio de custos (LiteLLM) ou salvaguardas (Portkey). As funcionalidades de rastreio de custos e registo por si só podem justificar um gateway mesmo com um único fornecedor.
Como é que os gateways lidam com respostas em streaming?
Todos os gateways nesta lista suportam streaming de eventos enviados pelo servidor (SSE). O gateway faz proxy do stream do fornecedor para o seu cliente com buffering mínimo. O impacto de latência no streaming é geralmente menor do que em pedidos não-streaming, pois a sobrecarga é por conexão, não por token.
O que acontece quando um fornecedor cai?
A maioria dos gateways suporta cadeias de fallback. Configura um fornecedor primário e um ou mais fallbacks. Se o primário devolver erros ou exceder os limiares de latência, o gateway encaminha automaticamente para o próximo fornecedor. O LiteLLM, Portkey e Helicone lidam bem com isto. O OpenRouter faz-no automaticamente nos bastidores.
Os gateways podem impor limites de custo?
Sim. O LiteLLM tem controlos de orçamento integrados por equipa, utilizador ou chave de API. A Portkey rastreia gastos em tempo real com alertas. O Kong suporta quotas baseadas em tokens. A Cloudflare fornece análises de uso. Este é, na verdade, um dos argumentos mais fortes para usar um gateway; sem ele, um único loop descontrolado pode queimar o seu orçamento de API durante a noite.
Qual gateway é melhor para startups vs enterprise?
Startups: OpenRouter (zero configuração) ou LiteLLM (gratuito, flexível). Enterprise: TrueFoundry (soberania de dados, SOC 2/HIPAA/GDPR, gere tanto o tráfego de modelos como de ferramentas de agentes através do seu MCP Gateway), Portkey (salvaguardas, conformidade, trilhas de auditoria) ou Kong AI Gateway (se já usar o Kong). Os principais diferenciadores empresariais são SSO, acesso baseado em funções, controlos de residência de dados e registo de auditoria, funcionalidades que as startups ainda não precisam, mas que as empresas não podem ignorar.
Qual é o melhor proxy LLM?
O LiteLLM é o melhor proxy LLM para a maioria das equipas. Funciona como um contentor Docker autónomo, envolve mais de 100 fornecedores atrás de um endpoint compatível com a OpenAI e é completamente gratuito para autoalojamento. Se "proxy" significa que quer zero infraestrutura, o OpenRouter funciona como um proxy alojado na nuvem com mais de 300 modelos numa única chave de API. A distinção é o controlo: o LiteLLM mantém os seus dados nos seus servidores; o OpenRouter encaminha-os através da sua plataforma.
Qual é a diferença entre um gateway LLM e um router LLM?
Um router LLM seleciona qual modelo ou fornecedor lida com um determinado pedido, tipicamente com base no custo, latência ou conteúdo do prompt. Um gateway LLM faz isso e mais: adiciona rastreio de custos, cache, salvaguardas, limitação de taxa e observabilidade por cima da camada de encaminhamento. Todas as ferramentas nesta lista são tecnicamente gateways. Routers puros (ferramentas que fazem apenas seleção de modelo sem outro middleware) são raros em produção porque as equipas quase sempre precisam de pelo menos registo juntamente com o encaminhamento.