
Las 10 mejores herramientas LLM Gateway, clasificadas: Accede a cualquier modelo a través de una sola API [2026]
Última actualización: 19 de julio de 2026. Hemos reverificado precios y recuentos de estrellas de GitHub para los 9 gateways, y añadido dos cambios de propiedad que importan si estás eligiendo un gateway hoy: Palo Alto Networks completó la adquisición de Portkey el 29 de mayo de 2026 e integró el producto en su plataforma de seguridad Prisma AIRS, y Mintlify adquirió Helicone en marzo de 2026, dejando su producto en la nube en modo mantenimiento. También descubrimos que los mantenedores de TensorZero archivaron el proyecto en junio de 2026, así que lo señalamos más abajo en lugar de fingir que sigue siendo una opción viva. Bifrost pasó de unas 2.000 a 6.600 estrellas en GitHub desde nuestra última revisión y lanzó su propio MCP Gateway, cerrando buena parte de la distancia en gobernanza con Portkey y TrueFoundry, así que añadimos una comparación cara a cara.
El mejor LLM gateway en 2026 es LiteLLM para equipos con self-hosted y Merge Gateway para tráfico de producción gestionado. LiteLLM admite más de 100 proveedores detrás de una única API compatible con OpenAI, maneja fallbacks y controles de presupuesto, y se ejecuta gratis en cualquier VPS. Merge Gateway es la opción gestionada en cuanto el gasto en LLM se convierte en una cuestión de margen: políticas de enrutamiento por cliente o funcionalidad, límites de presupuesto, facturación unificada y atribución de costes a nivel de solicitud. Si solo quieres el catálogo de modelos más amplio sin configuración, OpenRouter sigue ofreciendo acceso directo a más de 300 modelos y es el mejor lugar para prototipar. Para empresas reguladas que necesitan soberanía de datos y gobernanza sobre el tráfico de modelos y agentes, TrueFoundry se ejecuta completamente en tu propio VPC. Para guardrails en producción (redacción de PII, detección de jailbreak), Portkey es la elección. Para throughput bruto por encima de 5.000 RPS, la arquitectura Go de Bifrost añade solo 11 microsegundos de overhead.
Estás llamando a OpenAI para tu chatbot, Anthropic para tu asistente de programación y Gemini para tu pipeline de resúmenes. Tres claves API, tres SDKs, tres paneles de facturación, tres conjuntos de manejo de errores. Ahora agrega lógica de fallback cuando un proveedor cae. Ese es el caos que los LLM gateways resuelven, una API unificada que enruta hacia cualquier modelo, realiza un seguimiento de costos y maneja fallos automáticamente.
Probamos todos los principales LLM gateways y los clasificamos según lo que realmente importa: sobrecarga de latencia, cobertura de proveedores, facilidad de configuración y si sobrevivirán tu próximo pico de tráfico.
| Posición | Herramienta | Mejor para | Tipo | Precio inicial |
|---|---|---|---|---|
| no. 1 | LiteLLM | Flexibilidad máxima | Self-hosted (código abierto) | Gratis |
| no. 2 | Merge Gateway | Enrutamiento y control de gastos a escala empresarial | SaaS gestionado | Pay-per-token (nivel gratuito) |
| no. 3 | TrueFoundry | Gobernanza empresarial + MCP | Self-hosted + gestionado | Nivel gratuito (499 $/mes Pro) |
| no. 4 | OpenRouter | Acceso multi-modelo sin configuración | SaaS gestionado | Pay-per-token |
| no. 5 | Portkey | Guardrails en producción | Híbrido (código abierto + gestionado) | Nivel gratuito |
| no. 6 | Helicone | Equipos centrados en observabilidad | Self-hosted (código abierto) | Gratis |
| no. 7 | Bifrost | Rendimiento bruto | Self-hosted (código abierto) | Gratis |
| no. 8 | Cloudflare AI Gateway | Enrutamiento sin infraestructura | Gestionado | Nivel gratuito |
| no. 9 | Kong AI Gateway | Equipos de gestión de API | Self-hosted + enterprise | Community gratuito |
| no. 10 | TensorZero | Enrutamiento optimizado por ML (archivado en junio de 2026) | Self-hosted (código abierto, sin mantenimiento) | Gratis |
¿Qué es un LLM Gateway? (¿Y realmente lo necesitas?)
Antes de los rankings, una distinción rápida. La gente usa "gateway", "proxy" y "router" indistintamente, pero cumplen roles ligeramente diferentes:
- LLM Proxy: Reenvía solicitudes a los proveedores y agrega registro. Lógica mínima.
- LLM Router: Elige el mejor modelo o proveedor para cada solicitud según costo, latencia o contenido.
- LLM Gateway: El paquete completo, proxy + router + seguimiento de costos + caché + guardrails + observabilidad.
La mayoría de las herramientas de esta lista son gateways completos, pero algunas se inclinan más hacia el territorio de proxy o router.
Necesitas un gateway si:
- Llamas a 2+ proveedores de LLM y quieres una sola API para todos
- Necesitas rastrear costos entre proveedores (¿quién está quemando tu presupuesto?)
- Quieres failover automático cuando un proveedor cae
- Estás construyendo funciones que se benefician del caché de prompts entre proveedores
Si solo usas un único proveedor y no tienes planes de cambiar, un gateway añade complejidad innecesaria. Omítelo.
El camino de adopción típico: La mayoría de los equipos comienzan codificando directamente las llamadas a OpenAI. Luego agregan Anthropic para un segundo caso de uso y escriben una función wrapper. Después necesitan lógica de fallback, seguimiento de costos y rate limiting, y de repente han construido un gateway artesanal medio cocido. Las herramientas a continuación reemplazan ese desorden casero con algo probado en batalla.
1. LiteLLM, El mejor en general
Estrellas en GitHub: ~54K | Lenguaje: Python | Licencia: MIT
LiteLLM es la navaja suiza de los LLM gateways. Envuelve 100+ proveedores de LLM detrás de una única API compatible con OpenAI, lo que significa que tu código SDK de OpenAI existente funciona sin cambios. Solo cambia la URL base.
El componente de servidor proxy es lo que convierte a LiteLLM en un gateway y no solo en un SDK. Lo implementas como un servicio independiente, configuras tus modelos en un archivo YAML, y cada equipo accede al mismo endpoint con seguimiento de costos, rate limiting y balanceo de carga incorporados.
# config.yaml para el proxy LiteLLM
model_list:
- model_name: gpt-4
litellm_params:
model: openai/gpt-4o
api_key: sk-...
- model_name: gpt-4
litellm_params:
model: anthropic/claude-sonnet-4-20250514
api_key: sk-ant-...
# LiteLLM balancea la carga entre estos automáticamente
general_settings:
master_key: sk-my-master-key
database_url: postgresql://...# Tu código de aplicación no cambia -- solo apunta al proxy
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:4000", # Proxy LiteLLM
api_key="sk-my-master-key"
)
response = client.chat.completions.create(
model="gpt-4", # Enruta a OpenAI o Anthropic según config
messages=[{"role": "user", "content": "Explica los LLM gateways"}]
)Lo que es excelente:
- 100+ proveedores soportados (la cobertura más amplia de cualquier gateway)
- API compatible con OpenAI, cero cambios de código para apps existentes
- Seguimiento de costos incorporado, presupuestos por equipo/usuario
- Cadenas de fallback: si OpenAI falla, prueba Anthropic, luego Gemini
- Se integra con todas las principales herramientas de observabilidad (Langfuse, Helicone, etc.)
Lo que no es tan bueno:
- El GIL de Python limita el rendimiento de proceso único (latencia P95 ~8ms a 1.000 RPS)
- El proxy necesita su propia base de datos PostgreSQL para las funciones de gestión de equipos
- La configuración puede volverse compleja con muchos modelos y reglas de enrutamiento
- Ataque a la cadena de suministro el 24 de marzo de 2026: dos versiones publicadas en PyPI (1.82.7 y 1.82.8) llevaban una puerta trasera después de que unos atacantes robaran las credenciales de publicación mediante una acción de CI comprometida. PyPI puso ambas en cuarentena en unos 40 minutos, pero fija tu versión y comprueba
pip show litellmsi desplegaste ese día. El análisis completo está en el informe del incidente de LiteLLM
Precios: Gratis y código abierto. Planes enterprise disponibles para gestión alojada.
Si has leído nuestra guía sobre usar Claude Code con diferentes modelos, ya has visto LiteLLM en acción, es una de las principales formas en que los desarrolladores enrutan Claude Code a través de proveedores alternativos. Nuestra guía de configuración del proxy LiteLLM te lleva paso a paso por el despliegue Docker completo con PostgreSQL en menos de 20 minutos.
Veredicto: LiteLLM es el mejor LLM gateway en general para equipos que quieren máxima flexibilidad y no les importa el self-hosting. Tiene la cobertura de proveedores más amplia, el ecosistema más maduro y la comunidad más grande. Empieza aquí a menos que tengas una razón específica para no hacerlo.
2. Merge Gateway, El mejor para el enrutamiento y el control de gastos a escala empresarial
Proveedores: OpenAI, Anthropic, Google, AWS Bedrock, Mistral, Cohere, Grok | Tipo: SaaS gestionado | Lanzamiento: 31 de marzo de 2026
Merge Gateway está construido para el momento en que el uso de LLM deja de ser una partida de gasto y se convierte en un problema de margen. Donde OpenRouter optimiza la amplitud de acceso a modelos, Merge optimiza el control sobre el tráfico que ya tienes corriendo en producción: enrutamiento por coste, latencia, calidad, cliente, funcionalidad o región, presupuestos que se disparan antes que la factura, y logs a nivel de solicitud que indican qué modelo atendió una llamada y por qué se enrutó ahí.
Ese último punto es el verdadero diferenciador. La mayoría de los gateways te dicen qué gastaste. Merge está construido para decirte en quién lo gastaste, la pregunta que surge en cuanto el uso de un solo cliente enterprise empieza a comerse el margen bruto de un producto.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_API_KEY",
base_url="https://api-gateway.merge.dev/v1/openai",
)
response = client.chat.completions.create(
model="gpt-4o",
messages=[{"role": "user", "content": "Summarize this support ticket"}],
)Lo que es excelente:
- Políticas de enrutamiento por cliente, funcionalidad, región, caso de uso, coste, latencia o calidad
- El fallback automático mantiene las funciones de IA activas durante caídas del proveedor, rate limits y degradaciones
- Observabilidad a nivel de solicitud: modelo, proveedor, coste, latencia y el motivo de enrutamiento detrás de cada llamada
- Gobernanza de costes con presupuestos, límites de gasto y alertas por proyecto, equipo, nivel de cliente o funcionalidad
- Caché semántico y compresión de contexto como palancas de coste de primera clase, no complementos
Lo que no es tan bueno:
- No es de código abierto, así que queda fuera si el self-hosting es un requisito estricto (Enterprise ofrece VPC/on-prem, pero eso es una conversación de ventas)
- Orientado a producción por diseño, lo que lo hace más pesado de lo necesario para prototipos y aplicaciones de bajo volumen
- Lanzado en marzo de 2026, así que la comunidad, las integraciones y los tutoriales de terceros son escasos frente a LiteLLM u OpenRouter
Precios: Nivel gratuito con 10 $/mes en créditos, sin tarjeta de crédito. El plan Pro cobra coste LLM + 5% sin límite de gasto y con tu propia clave API. Enterprise tiene cotización personalizada y añade despliegue VPC u on-prem, un gestor de cuenta dedicado y SLA de disponibilidad. Los créditos se emiten el día 1 y no se acumulan.
Vale la pena notar sobre la tarifa: el 5% de Merge queda justo por debajo del 5,5% de OpenRouter. A volumen de prototipo, esa diferencia es ruido. A seis cifras de gasto anual en inferencia es dinero real, y es el tipo de cosa que merece la pena modelar antes de comprometerte con una u otra opción.
Veredicto: Merge Gateway es la opción cuando tu tráfico LLM se ha convertido en un problema de fiabilidad y margen en lugar de un problema de integración. Si necesitas responder "qué cliente está impulsando el gasto" o "qué funcionalidad está en números rojos", y quieres políticas de fallback que mantengan las funciones activas durante un incidente del proveedor, es la opción gestionada más sólida aquí. Si todavía estás decidiendo qué modelos usar, el catálogo de OpenRouter te sirve mejor, y puedes cambiar más tarde.
3. TrueFoundry, El mejor para gobernanza empresarial
Modelos: 1.600+ | Proveedores: 250+ | Tipo: Self-hosted + gestionado | Despliegue: VPC, on-prem, air-gapped
El AI Gateway de TrueFoundry está diseñado para el escenario que los gateways de código abierto tienen dificultades con: una empresa regulada que necesita un único plano de control para cada modelo, plena soberanía de datos y registros de auditoría que soporten una revisión de cumplimiento. Se ejecuta en tu propio VPC, on-prem o completamente air-gapped, de modo que ningún dato de solicitud sale de tu dominio, y viene con cumplimiento de SOC 2, HIPAA y GDPR, SSO y RBAC de serie.
La cobertura es de las más amplias de esta lista: más de 1.600 modelos entre 250+ proveedores (OpenAI, Anthropic, Gemini, Groq, Mistral), además de backends auto-alojados como vLLM, SGLang y Triton. TrueFoundry informa una latencia interna inferior a 3ms con carga empresarial y un uptime del 99,99% en más de 10.000 millones de solicitudes al mes, por lo que la capa de gobernanza no te cuesta rendimiento.
from openai import OpenAI
client = OpenAI(
base_url="https://<tu-org>.truefoundry.com/api/llm", # tu gateway
api_key="tfy-..."
)
response = client.chat.completions.create(
model="openai/gpt-4o", # enrutado, registrado y con rate-limit de forma centralizada
messages=[{"role": "user", "content": "Resume este contrato"}]
)Lo que distingue a TrueFoundry de Portkey o LiteLLM es el MCP Gateway: un registro central que gobierna cómo los agentes de IA acceden a herramientas empresariales (Slack, GitHub, Confluence, Datadog) mediante el Model Context Protocol. Registras las APIs internas como servidores MCP, las proteges con Okta o Azure AD con RBAC por servidor, y obtienes trazabilidad a nivel de solicitud en cada llamada a herramienta. Eso te da un único plano de control gobernado para el tráfico de modelos y el tráfico de herramientas de agentes, algo que importa en cuanto los agentes empiezan a tomar acciones y no solo a generar texto.
A diferencia de la mayoría de los gateways empresariales, TrueFoundry publica sus precios de forma abierta. Un nivel Developer gratuito cubre 50.000 solicitudes al mes, 3 usuarios y el MCP Gateway para hasta 5 servidores, suficiente para prototipar todo el stack antes de hablar con nadie. El nivel Pro cuesta 499 $/mes por 1 millón de solicitudes, 10 usuarios, caché semántica, modelos virtuales y enrutamiento avanzado, con el uso adicional facturado a tarifas transparentes por unidad. Pro Plus cuesta 2.999 $/mes y añade metadatos personalizados, alertas y exportación de monitorización para 25 usuarios. Enterprise se cotiza a medida para más de 10 millones de solicitudes, con instalaciones completas en VPC, multirregión y air-gapped de los planos de control y de gateway. Todos los planes de pago incluyen una prueba de 7 días. El SaaS gestionado no tiene coste de hosting; si auto-alojas el gateway en tu propia nube (BYOC), presupuesta entre 600 y 1.000 $ al mes para la infraestructura subyacente.
Lo que es excelente:
- 1.600+ modelos, 250+ proveedores, más backends auto-alojados (vLLM, SGLang, Triton)
- Se ejecuta en tu VPC, on-prem o air-gapped; ningún dato sale de tu dominio
- Cumplimiento SOC 2, HIPAA, GDPR, SSO, RBAC y registro de auditorías integrados
- Guardrails: filtrado de PII, detección de toxicidad, escaneo de inyección de prompts
- MCP Gateway gobierna el acceso a herramientas de agentes, no solo las llamadas a modelos
- Precios públicos y transparentes con un nivel Developer realmente gratuito (50K solicitudes/mes)
- TrueFoundry informa una reducción de costos promedio del ~30% mediante enrutamiento, caché y presupuestos
Lo que no es tan bueno:
- Orientado a empresa: más pesado que LiteLLM u OpenRouter para un proyecto pequeño
- La plataforma central es propietaria (sus repositorios de código abierto son herramientas de infraestructura separadas)
- Auto-alojar el gateway añade entre 600 y 1.000 $/mes de infraestructura además de tu plan
- Su mayor valor se aprecia cuando hay muchos equipos y herramientas que gobernar, no desde el primer día
Precios: Nivel Developer gratuito (0 $/mes, 50K solicitudes, 3 usuarios). Pro 499 $/mes (1M solicitudes, 10 usuarios, caché semántica, enrutamiento avanzado). Pro Plus 2.999 $/mes (25 usuarios, observabilidad avanzada). Enterprise personalizado (10M+ solicitudes, VPC completo y air-gapped). Prueba de 7 días en planes de pago; el SaaS gestionado no tiene coste de hosting, el self-hosting añade ~600-1.000 $/mes de infraestructura.
Veredicto: TrueFoundry es el gateway para empresas que necesitan un único plano de control gobernado para el tráfico de modelos y el acceso a herramientas de agentes, con los datos siempre dentro de su propia infraestructura. Si eres una startup conectando dos proveedores, es más de lo que necesitas, empieza con LiteLLM. Si eres un equipo de plataforma desplegando IA para decenas de equipos internos bajo un mandato de cumplimiento, pertenece a tu lista corta.
4. OpenRouter, El mejor acceso multi-modelo sin configuración
Modelos: 300+ | Tipo: SaaS gestionado | Licencia: Propietaria
OpenRouter adopta el enfoque opuesto a LiteLLM: no implementas nada. Regístrate, obtén una clave API, y tendrás acceso instantáneo a 300+ modelos de todos los principales proveedores a través de un único endpoint. Es la "tienda de aplicaciones" de las APIs de LLM.
La propuesta de valor es la simplicidad. Sin infraestructura que mantener, sin configuraciones YAML que escribir, sin bases de datos que aprovisionar. Prepagas créditos o vinculas una tarjeta, y OpenRouter maneja la facturación consolidada entre todos los proveedores.
from openai import OpenAI
client = OpenAI(
base_url="https://openrouter.ai/api/v1",
api_key="sk-or-..."
)
# Accede a cualquier modelo de cualquier proveedor -- el mismo código
response = client.chat.completions.create(
model="anthropic/claude-sonnet-4-20250514",
messages=[{"role": "user", "content": "Compara los LLM gateways"}]
)Lo que es excelente:
- 300+ modelos, una sola clave API, un panel de facturación
- 25+ modelos gratuitos para prototipos (incluyendo algunos sorprendentemente capaces)
- Sin infraestructura que gestionar, regístrate y empieza a llamar
- Las funciones de comparación de modelos ayudan a evaluar antes de comprometerte
- Maneja las interrupciones de proveedores con enrutamiento de fallback automático
Lo que no es tan bueno:
- Tarifa de plataforma del 5,5% sobre el precio del proveedor, se acumula a escala
- Sin opción de self-hosting, tus datos pasan por los servidores de OpenRouter
- Observabilidad limitada en comparación con herramientas de gateway dedicadas
- Los límites de velocidad en el nivel gratuito pueden ser restrictivos para cargas de trabajo en producción
- Sin lógica de enrutamiento personalizada, obtienes lo que OpenRouter decide
Precios: Pay-per-token (precio del proveedor + 5,5% de tarifa). Sin mínimos mensuales. 25+ modelos gratuitos disponibles.
Veredicto: OpenRouter es la forma más rápida de acceder a múltiples proveedores de LLM. Si quieres crear prototipos con diferentes modelos o ejecutar una carga de trabajo pequeña a mediana sin gestionar infraestructura, es la elección obvia. A escala, la tarifa del 5,5% empieza a importar. Si la reducción de costos es el motor, consulta nuestra guía para reducir los costos de la API de LLM para un análisis completo de apalancadores de ahorro mediante caché, agrupación y gateway.
5. Portkey, El mejor para guardrails en producción
Estrellas en GitHub: ~12K | Lenguaje: TypeScript/Node.js | Licencia: Apache 2.0 (gateway), plataforma gestionada
Portkey se posiciona como el "plano de control de la IA." Donde LiteLLM se enfoca en el enrutamiento y OpenRouter en la simplicidad, el diferenciador de Portkey es la seguridad en producción: guardrails, redacción de PII, detección de jailbreak y registros de auditoría integrados en la capa del gateway.
Desde marzo de 2026, Portkey hizo que todo su gateway sea código abierto (Apache 2.0), por lo que puedes alojar de forma independiente el enrutamiento central y los guardrails sin la plataforma gestionada. El cambio de más peso llegó el 29 de mayo de 2026, cuando Palo Alto Networks completó la adquisición de Portkey e integró el producto en Prisma AIRS, su plataforma de seguridad para IA agéntica. El gateway de código abierto se sigue distribuyendo bajo Apache 2.0 y los planes gestionados funcionan igual que antes, pero Portkey ya no es una empresa independiente de infraestructura de IA, ahora es una pieza dentro de la línea de productos de un fabricante de ciberseguridad, algo a tener en cuenta si valoras la independencia de la hoja de ruta a largo plazo.
from portkey_ai import Portkey
portkey = Portkey(
api_key="pk-...",
config={
"strategy": {"mode": "fallback"},
"targets": [
{"provider": "openai", "override_params": {"model": "gpt-4o"}},
{"provider": "anthropic", "override_params": {"model": "claude-sonnet-4-20250514"}}
]
}
)
response = portkey.chat.completions.create(
messages=[{"role": "user", "content": "Resume este documento"}]
)Lo que es excelente:
- Soporte de 1.600+ modelos entre proveedores
- Guardrails incorporados: detección de PII, prevención de jailbreak, filtrado de contenido
- Gestión de prompts y control de versiones dentro del gateway
- La capa de caché reduce las llamadas repetidas (ahorra dinero y latencia)
- Registros de auditoría y funciones de cumplimiento para industrias reguladas
- Gateway ahora completamente de código abierto (marzo de 2026)
Lo que no es tan bueno:
- El precio de la plataforma gestionada comienza en $49/mes para funciones de producción
- Nivel enterprise ($5.000–$10.000/mes) para gobernanza avanzada
- La plataforma añade complejidad más allá de lo que ofrecen gateways más simples
- Curva de aprendizaje más pronunciada que LiteLLM u OpenRouter
- Ahora pertenece a Palo Alto Networks (adquirido en mayo de 2026), así que su hoja de ruta responde a las prioridades de un fabricante de seguridad, no solo a las de quienes usan infraestructura de IA. Los equipos que quieren mantenerse al margen de eso están mirando cada vez más a Bifrost o LiteLLM, consulta la comparación cara a cara más abajo en esta página
Precios: El gateway de código abierto es gratuito para auto-alojar. Plataforma gestionada: el nivel Developer es gratis para siempre (10K registros/mes, retención de 3 días). Production cuesta $49/mes (100K registros/mes, retención de 30 días, guardrails, RBAC, caché semántica, $9 por cada 100K registros adicionales). Enterprise se cotiza a medida (10M+ registros/mes, alojamiento en VPC, SOC 2 Tipo 2, HIPAA).
Veredicto: Portkey sigue siendo el gateway para equipos que construyen funciones de LLM orientadas al cliente que no pueden permitirse inyecciones de prompts, filtraciones de PII o costos no monitorizados, los guardrails justifican la complejidad. Lo que ha cambiado es quién está detrás: tras la adquisición por Palo Alto Networks, Portkey encaja mejor con equipos que ya están dentro del ecosistema Prisma AIRS (o que se sienten cómodos con él). Si buscas un gateway de código abierto igual de capaz pero que siga siendo independiente, Bifrost merece una mirada más de cerca.
6. Helicone, El mejor para equipos centrados en observabilidad
Estrellas en GitHub: ~6K | Lenguaje: Rust | Licencia: Apache 2.0
Helicone comenzó como una herramienta de observabilidad y evolucionó hacia un gateway completo. Ese origen importa, sus funciones de monitorización y análisis son de primera clase, y las funciones de gateway (enrutamiento, caché, failover) se construyeron sobre una sólida base de observabilidad.
Estar escrito en Rust le da una ventaja de rendimiento real: latencia P50 de 8ms, P95 inferior a 5ms, aproximadamente 3.000 RPS en una sola instancia con solo 64MB de memoria.
Algo que conviene saber antes de apostar por él: Mintlify adquirió Helicone en marzo de 2026, y el equipo se mudó a San Francisco para construir el producto de documentación y contexto para agentes de Mintlify. El propio anuncio de Helicone es claro sobre lo que eso significa: la plataforma sigue funcionando y seguirá recibiendo parches de seguridad, corrección de errores y soporte para modelos nuevos, pero no hay hoja de ruta de funciones más allá de eso. Si necesitas un gateway que siga añadiendo capacidades activamente, sopésalo antes de estandarizar sobre él.
# Helicone: proxy de una línea -- solo cambia la URL base
from openai import OpenAI
client = OpenAI(
base_url="https://oai.helicone.ai/v1", # o tu URL auto-alojada
api_key="sk-...",
default_headers={
"Helicone-Auth": "Bearer hlc-..."
}
)
# Todas las solicitudes ahora se registran, rastrean y enrutan a través de Helicone
response = client.chat.completions.create(
model="gpt-4o",
messages=[{"role": "user", "content": "Analiza este código"}]
)Lo que es excelente:
- Basado en Rust: ~64MB de memoria, latencia P95 <5ms, 3.000 RPS por instancia
- Balanceo de carga consciente del estado de salud, enruta al proveedor disponible más rápido
- Paneles en tiempo real para costos, latencia, uso de tokens y tasas de error
- Integración de una línea, solo cambia la URL base
- Implementación de binario único (Docker, K8s, bare metal)
Lo que no es tan bueno:
- En modo mantenimiento desde la adquisición por Mintlify (marzo de 2026): solo parches de seguridad y corrección de errores, sin nuevas funciones ni hoja de ruta
- Las funciones de observabilidad son la estrella; el enrutamiento es menos sofisticado que LiteLLM
- Menos proveedores soportados que LiteLLM u OpenRouter
- Comunidad más pequeña que LiteLLM (6K vs. 54K estrellas en GitHub)
- Las funciones avanzadas (propiedades personalizadas, sesiones) requieren la plataforma gestionada
Precios: De código abierto y gratuito para auto-alojamiento. Plataforma gestionada: Hobby es gratis (10K solicitudes/mes, 1GB de almacenamiento, retención de 7 días, 1 asiento). Pro cuesta $79/mes (asientos ilimitados, retención de 1 mes, alertas, informes, HQL). Team cuesta $799/mes (retención de 3 meses, SOC 2, HIPAA, canal de Slack dedicado). Enterprise se cotiza a medida (on-prem, SSO SAML, descuentos por volumen).
Si estás evaluando herramientas de observabilidad de manera más amplia, nuestro ranking de las mejores plataformas de observabilidad de IA cubre Helicone junto a Langfuse, Arize y otros.
Veredicto: Helicone sigue siendo el mejor gateway para equipos cuyo principal problema es "no podemos ver qué está pasando con nuestras llamadas de LLM", y el producto que existe hoy no va a desaparecer. Eso sí, entra sabiendo que adoptas una herramienta en modo mantenimiento: perfecta para observabilidad ahora mismo, más arriesgada si apuestas por que el año que viene lleguen nuevas funciones de gateway.
7. Bifrost, El mejor rendimiento bruto
Estrellas en GitHub: ~6,6K | Lenguaje: Go | Licencia: Apache 2.0
Bifrost es el campeón del rendimiento. Construido en Go por Maxim AI, afirma un rendimiento 50x más rápido que LiteLLM con solo 11 microsegundos de sobrecarga por solicitud a 5.000 RPS. Esos no son números teóricos, provienen de pruebas de carga sostenida reproducibles. El proyecto ha más que triplicado sus estrellas en GitHub desde nuestra última revisión, pasando de unas 2.000 a 6.600, y ese crecimiento va acompañado de un empujón real de producto: Bifrost lanzó su propio MCP Gateway con un "Code Mode" para gobernar cómo los agentes llaman a herramientas externas, justo la categoría de función que antes era territorio exclusivo de TrueFoundry y Portkey.
La diferencia arquitectónica es fundamental: las goroutines de Go manejan miles de conexiones concurrentes sin el cuello de botella GIL de Python, y el binario compilado elimina completamente la sobrecarga del intérprete.
# bifrost.yaml
account:
provider: openai
api_key: ${OPENAI_API_KEY}
models:
- name: gpt-4o
provider: openai
- name: claude-sonnet-4-20250514
provider: anthropic
routing:
strategy: round-robin
fallback: trueLo que es excelente:
- 11µs de sobrecarga a 5.000 RPS, la más baja de cualquier gateway en esta lista
- Binario Go: sin dependencias de tiempo de ejecución, huella de memoria mínima
- Balanceo de carga adaptativo entre proveedores
- Modo clúster para escalado horizontal
- 1.000+ modelos soportados
- MCP Gateway con Code Mode incluido en el nivel OSS gratuito, además de gestión de presupuestos mediante claves virtuales, caché semántica y observabilidad nativa con OpenTelemetry, todo incluido, sin quedar reservado al plan Enterprise
Lo que no es tan bueno:
- Proyecto más nuevo, comunidad más pequeña que LiteLLM (6,6K vs. 54K estrellas en GitHub) y menos integraciones de terceros
- Los guardrails de seguridad de contenido (filtrado de PII, detección de jailbreak) requieren el nivel Enterprise; Portkey ofrece guardrails comparables en su gateway OSS gratuito
- Construido por Maxim AI (un proveedor), dirección futura atada a su hoja de ruta
- Documentación más delgada que los extensos docs de LiteLLM
- El SSO (SAML/OIDC) y el RBAC son exclusivos de Enterprise, así que los equipos pequeños se llevan el rendimiento pero no los controles de acceso
Precios: El gateway OSS es gratis para siempre (Apache 2.0) e incluye enrutamiento, failover, MCP Gateway, caché semántica y gestión de presupuestos con claves virtuales. Enterprise se cotiza a medida (hay que pedir una demo) y añade guardrails, modo clúster, SSO SAML/OIDC, RBAC, registros de auditoría y soporte con SLA; existe una prueba gratuita de 14 días.
Veredicto: Bifrost es para equipos que ejecutan sistemas de producción de alto rendimiento donde la sobrecarga del gateway importa, y se ha convertido en una de las alternativas más sólidas a Portkey ahora que su nivel gratuito incluye gobernanza MCP y controles de presupuesto que en otros sitios exigían una plataforma de pago. Si procesas miles de llamadas de LLM por segundo y quieres quedarte en infraestructura de código abierto sin una adquisición pendiendo sobre la hoja de ruta, la arquitectura Go de Bifrost entrega resultados. Para la mayoría de los equipos, la sobrecarga de 8ms de LiteLLM es perfectamente aceptable, y si necesitas guardrails de seguridad de contenido integrados hoy y no en el nivel Enterprise, el gateway OSS de Portkey sigue teniendo ventaja, ese compromiso es toda la historia en la comparación de más abajo.
8. Cloudflare AI Gateway, La mejor opción de infraestructura cero
Tipo: Servicio gestionado | Licencia: Propietaria (Cloudflare)
Cloudflare AI Gateway lleva el enfoque de "no gestionas nada" al extremo. Si ya estás en Cloudflare (y muchos equipos lo están), puedes habilitar AI Gateway desde el panel y comenzar a enrutar llamadas de LLM a través de la red edge de Cloudflare sin infraestructura adicional.
// Solo antepón tu URL de proveedor con el endpoint gateway de Cloudflare
const response = await fetch(
"https://gateway.ai.cloudflare.com/v1/{account_id}/{gateway_name}/openai/chat/completions",
{
method: "POST",
headers: {
"Authorization": "Bearer sk-...",
"Content-Type": "application/json"
},
body: JSON.stringify({
model: "gpt-4o",
messages: [{ role: "user", content: "Hola" }]
})
}
);Lo que es excelente:
- Nivel gratuito con 100.000 registros/mes, suficiente para la mayoría de proyectos secundarios
- Infraestructura cero: habilitar desde el panel de Cloudflare
- Caché incorporado en el edge (reduce costos y latencia)
- Rate limiting y análisis incluidos
- Facturación unificada: paga los costos del proveedor de LLM a través de Cloudflare
- La red edge global reduce la latencia para usuarios geográficamente distribuidos
Lo que no es tan bueno:
- Estrechamente acoplado al ecosistema de Cloudflare, los costos de cambio son reales
- Inteligencia de enrutamiento limitada en comparación con gateways dedicados
- Límite de 100.000 registros en el nivel gratuito; suscripción Workers Paid para 1M
- Menos proveedores soportados que LiteLLM u OpenRouter
- Sin opción de self-hosting
Precios: Gratis (100.000 registros/mes), suscripción Workers Paid para 1M de registros. Sin tarifa de gateway por solicitud. Todavía pagas a los proveedores de LLM por separado.
Para equipos que enrutan llamadas de funciones entre proveedores, el caché edge de Cloudflare puede reducir significativamente la latencia para patrones de uso de herramientas repetidos.
Veredicto: Cloudflare AI Gateway es la mejor opción si ya estás en Cloudflare y quieres funciones de gateway sin implementar nada nuevo. El nivel gratuito es generoso para proyectos pequeños. Para uso serio en producción, los gateways dedicados ofrecen más control.
9. Kong AI Gateway, El mejor para equipos de gestión de API
Estrellas en GitHub: ~44K (Kong Gateway total) | Lenguaje: Lua/OpenResty | Licencia: Apache 2.0 (community)
Kong AI Gateway no es un producto independiente, es una extensión del API Gateway probado en batalla de Kong que agrega capacidades específicas de LLM. Si tu organización ya ejecuta Kong para la gestión de API, agregar enrutamiento de IA es una instalación de plugin, no una nueva plataforma.
# Configuración declarativa de Kong (deck)
services:
- name: ai-llm-service
url: https://api.openai.com
plugins:
- name: ai-proxy
config:
route_type: llm/v1/chat
model:
provider: openai
name: gpt-4o
- name: ai-rate-limiting-advanced
config:
limit: [10000]
window_size: [60]
window_type: fixed
strategy: local
limit_by: consumerLo que es excelente:
- Se construye sobre la madura plataforma de gestión de API de Kong (utilizada por miles de empresas)
- Enrutamiento semántico: enruta solicitudes basándose en el contenido/intención del prompt
- Rate limiting basado en tokens (no solo en solicitudes)
- Ecosistema de plugins: autenticación, rate limiting, transformaciones funcionan con rutas de IA
- Métricas OpenTelemetry + Prometheus para integración con Datadog/Grafana
Lo que no es tan bueno:
- Excesivo si no usas ya Kong, curva de aprendizaje pronunciada
- Las funciones de IA enterprise requieren licencia Kong Enterprise (de pago)
- Complejidad de configuración más alta que cualquier otro gateway en esta lista
- Requiere conocimiento de infraestructura Kong (o que el equipo lo aprenda)
- Las funciones específicas de IA son más recientes y menos maduras que el núcleo de Kong
Precios: Edición community gratuita (código abierto). Las funciones de IA enterprise requieren una suscripción Kong Enterprise (precios personalizados).
Veredicto: Kong AI Gateway tiene sentido si y solo si tu organización ya ejecuta Kong. Agregar enrutamiento de LLM a tu capa de gestión de API existente es más inteligente que implementar un gateway separado. Pero no adoptes Kong solo para el enrutamiento de LLM, eso es como comprar un tractor para cortar el césped.
10. TensorZero, El mejor para enrutamiento optimizado por ML (ahora descontinuado)
Estrellas en GitHub: ~11,7K | Lenguaje: Rust | Licencia: Apache 2.0 (archivado, sin mantenimiento)
Actualización: TensorZero cerró en junio de 2026. Los mantenedores archivaron el repositorio el 12 de junio de 2026, detuvieron el desarrollo activo y devolvieron a los inversores el capital riesgo restante tras concluir que no encontraban encaje de producto-mercado ni para un proyecto de código abierto ni para un producto comercial. Mantenemos esta entrada porque las ideas siguen mereciendo la pena y el código se puede seguir bifurcando bajo Apache 2.0, pero no lo adoptes para un sistema nuevo en producción: no habrá parches de seguridad, ni actualizaciones para las APIs de proveedores, ni soporte si algo se rompe.
TensorZero era el gateway más opinado de esta lista. Donde otros se enfocan en enrutamiento y observabilidad, TensorZero construía un bucle de optimización: recopilaba datos de inferencia, ejecutaba evaluaciones y usaba los resultados para mejorar las decisiones de enrutamiento a lo largo del tiempo. Piénsalo como un gateway que aprendía qué modelo funciona mejor para qué tipo de solicitud.
La implementación en Rust ofrece latencia P99 sub-milisegundo, incluso a más de 10.000 QPS. No es un error tipográfico. Donde LiteLLM agrega ~8ms y Bifrost ~11µs, TensorZero afirma <1ms P99 bajo carga extrema.
# TensorZero: inferencia estructurada con optimización
from tensorzero import TensorZeroGateway
with TensorZeroGateway("http://localhost:3000") as client:
response = client.inference(
function_name="generate_summary",
input={
"messages": [
{"role": "user", "content": "Resume este artículo..."}
]
}
)
# Más tarde: envía datos de calidad de vuelta para mejorar el enrutamiento
client.feedback(
metric_name="summary_quality",
inference_id=response.inference_id,
value=0.92
)Lo que es excelente:
- Latencia P99 <1ms a 10.000+ QPS (rendimiento bruto más rápido con Rust)
- Bucle de retroalimentación: aprende qué modelos funcionan mejor para cada función
- Inferencia estructurada con validación de esquemas
- Pruebas A/B entre modelos integradas en el gateway
- Marco de evaluación incorporado
Lo que no es tan bueno:
- Descontinuado desde junio de 2026: repositorio archivado y de solo lectura, sin futuras actualizaciones, parches de seguridad ni soporte
- Curva de aprendizaje más pronunciada que cualquier otro gateway, defines "funciones", no solo modelos
- Requiere repensar tu integración de LLM alrededor del concepto de función de TensorZero
- Menos "drop-in" que LiteLLM u OpenRouter, no es un simple cambio de URL base
- La documentación quedó congelada en su último estado, ya no se sigue mejorando
Precios: Gratis y código abierto (Apache 2.0), bifurcable y mantenible por tu cuenta, pero no hay ningún proveedor al que pagar por soporte aunque quisieras.
Para equipos que ya ejecutan evaluaciones de LLM, el bucle de retroalimentación de TensorZero fue una forma realmente útil de cerrar la brecha entre la evaluación y el enrutamiento, las puntuaciones de evaluación mejoraban directamente qué modelos se enrutaban. Esa idea vale la pena replicarla aunque la herramienta ya no exista.
Veredicto: TensorZero era para equipos de ingeniería de ML que querían que su gateway se volviera más inteligente con el tiempo, y el bucle de optimización fue genuinamente innovador. Con el proyecto descontinuado, no podemos recomendarlo para nada nuevo, elige LiteLLM, Bifrost o Portkey y construye la retroalimentación de evaluaciones dentro de tu propio pipeline. Si ya tienes TensorZero en producción, el código sigue funcionando, pero reserva tiempo para migrar antes de toparte con un cambio en la API de un proveedor que ya no pueda gestionar.
Sobrecarga de latencia de los LLM Gateways: Los números reales
Cada gateway agrega cierta sobrecarga a tus llamadas de LLM. La pregunta es si importa para tu caso de uso. Así es como se comparan los gateways en nuestras pruebas:
| Gateway | Lenguaje | Sobrecarga de latencia P50 | Sobrecarga de latencia P95 | Rendimiento (instancia única) |
|---|---|---|---|---|
| Bifrost | Go | ~8µs | ~11µs | 5.000+ RPS |
| TensorZero‡ | Rust | ~0,3ms | <1ms | 10.000+ QPS |
| Helicone | Rust | ~5ms | ~8ms | ~3.000 RPS |
| TrueFoundry | Self-hosted | ~3ms† | <3ms† | 10.000M+/mes (proveedor) |
| LiteLLM | Python | ~4ms | ~8ms | ~1.000 RPS |
| Portkey | TypeScript | ~5ms | ~12ms | ~2.000 RPS |
| OpenRouter | Gestionado | ~15–30ms | ~50ms | N/A (gestionado) |
| Merge Gateway | Gestionado | no probado de forma independiente§ | no probado de forma independiente§ | N/A (gestionado) |
| Cloudflare AI GW | Gestionado | ~10–20ms | ~40ms | N/A (gestionado) |
| Kong AI Gateway | Lua/Go | ~3ms | ~8ms | ~3.000 RPS |
† La cifra de latencia inferior a 3ms de TrueFoundry es reportada por el proveedor; no la ejecutamos a través del mismo test de carga independiente que los gateways de código abierto auto-alojados.
‡ El proyecto TensorZero fue archivado en junio de 2026 (consulta la entrada anterior); sus cifras de latencia son históricas y ya no se pueden verificar de forma independiente contra una versión mantenida activamente. § Merge Gateway se lanzó después de nuestra tanda de pruebas de carga, así que no lo hemos medido con el mismo banco de pruebas que los demás y no vamos a publicar una cifra que no hemos tomado. Espera una sobrecarga de gateway gestionado en el mismo rango que OpenRouter y Cloudflare (aproximadamente 10-30ms P50) hasta que lo probemos.
El contexto importa. Una llamada típica a GPT-4o toma 500–3.000ms dependiendo de la longitud de la salida. Incluso la sobrecarga de 8ms de LiteLLM es menos del 1% de la latencia total. El único escenario donde la sobrecarga del gateway importa son las cargas de trabajo de alta frecuencia y baja latencia como la clasificación en tiempo real o la generación de embeddings a escala. Para la IA conversacional o la generación de contenido, cualquier gateway en esta lista es suficientemente rápido.
Los gateways gestionados (OpenRouter, Cloudflare y Merge Gateway) añaden más sobrecarga porque tu solicitud viaja a sus servidores antes de llegar al proveedor. Los gateways auto-alojados se ejecutan junto a tu aplicación, por lo que el salto adicional es local.
Bifrost vs. Portkey: ¿qué LLM Gateway de código abierto deberías elegir?
Si lo que buscabas literalmente era "LLM gateway de código abierto", este es el estado honesto de esa categoría a mediados de 2026: cinco de las nueve herramientas de esta comparativa se distribuyen como software de código abierto que puedes auto-alojar hoy mismo. LiteLLM (MIT) y Bifrost (Apache 2.0) son totalmente abiertos, sin funciones centrales tras un muro de pago. El gateway de Portkey es Apache 2.0 desde marzo de 2026, aunque la plataforma gestionada que lo rodea es propietaria. Helicone (Apache 2.0) es de código abierto pero está en modo mantenimiento tras su adquisición por Mintlify. El Gateway base de Kong es abierto, pero los plugins específicos de IA que de verdad importan para enrutar LLM viven detrás de Kong Enterprise. TensorZero también era de código abierto, pero el proyecto está descontinuado, así que ya no lo contamos como una opción viva. TrueFoundry, del que hablamos más arriba, sigue otro camino: despliegue auto-alojado de un plano de control propietario en lugar de una base de código abierta.
Eso deja a Bifrost y Portkey como las dos opciones de código abierto más buscadas, y se han distanciado bastante desde nuestra última revisión. Así se comparan realmente:
| Dimensión | Bifrost | Portkey |
|---|---|---|
| Respaldado por | Maxim AI (independiente) | Palo Alto Networks (adquirido en mayo de 2026) |
| Licencia del gateway central | Apache 2.0, totalmente de código abierto | Apache 2.0 (solo el gateway; la plataforma es propietaria) |
| Lenguaje | Go | TypeScript/Node.js |
| Sobrecarga de latencia P95 | ~11µs | ~12ms |
| Estrellas en GitHub | ~6,6K | ~12K |
| Guardrails de seguridad de contenido (PII, detección de jailbreak) | Solo en el nivel Enterprise | Incluidos en el gateway OSS gratuito |
| Gobernanza MCP / de herramientas de agentes | MCP Gateway con Code Mode, incluido en OSS | No es una función destacada |
| SSO / RBAC | Solo en el nivel Enterprise | Desde el nivel Production ($49/mes) |
| Independencia de la hoja de ruta | Proveedor independiente | Ahora parte de Prisma AIRS |
Si estás buscando una "alternativa a Bifrost" porque quieres guardrails de producción sin pagar por Bifrost Enterprise, el gateway de código abierto gratuito de Portkey trae redacción de PII y detección de jailbreak de serie, esa es la mayor diferencia funcional entre ambos. LiteLLM es el otro destino habitual, cambiando la velocidad bruta de Bifrost por la lista de proveedores más amplia y la comunidad más grande.
Si estás buscando "alternativas a Portkey" porque la adquisición por Palo Alto Networks cambia tu cálculo de riesgo (algo perfectamente razonable de querer evitar si necesitas que la hoja de ruta de tu infraestructura sea independiente de las prioridades de un fabricante de ciberseguridad), tus mejores opciones son, por orden: Bifrost, si el throughput bruto y la gobernanza MCP te importan más que los guardrails de serie; LiteLLM, si quieres el ecosistema más grande y no te molesta el perfil de latencia de Python; y TrueFoundry (del que hablamos más arriba), si necesitas específicamente cumplimiento SOC 2/HIPAA/GDPR con un proveedor que no sea Portkey. Helicone también es de código abierto, pero su modo mantenimiento lo hace mejor candidato para observabilidad que para un gateway que esperas que siga evolucionando.
Ninguno de los dos, ni Bifrost ni Portkey, es objetivamente "mejor": depende de si quieres guardrails hoy o gobernanza y velocidad a cambio de algo más de configuración.
Cómo elegir el LLM Gateway correcto
Omite las matrices de características. Aquí está la decisión en una tabla:
| Si necesitas... | Elige | Por qué |
|---|---|---|
| Máxima flexibilidad + auto-alojado | LiteLLM | 100+ proveedores, comunidad más grande, más integraciones |
| Enrutamiento a escala empresarial + control de gastos | Merge Gateway | Políticas de enrutamiento por cliente o funcionalidad, límites de gasto, atribución de costes a nivel de solicitud |
| Gobernanza empresarial + soberanía de datos | TrueFoundry | Se ejecuta en tu VPC, SOC 2/HIPAA/GDPR, MCP Gateway para herramientas de agentes |
| Acceso multi-modelo rápido, sin ops | OpenRouter | Regístrate y llama a 300+ modelos |
| Guardrails de producción + cumplimiento | Portkey | Redacción de PII, detección de jailbreak, registros de auditoría (ahora parte de Prisma AIRS de Palo Alto Networks) |
| Observabilidad como prioridad | Helicone | Mejor monitorización, rendimiento Rust, configuración de una línea (en modo mantenimiento desde marzo de 2026) |
| Menor latencia posible + gobernanza MCP en código abierto | Bifrost | 11µs de sobrecarga en Go, modo clúster, MCP Gateway incluido en el nivel gratuito |
| Ya en Cloudflare | Cloudflare AI GW | Gratis, caché edge, sin nueva infraestructura |
| Ya usando Kong | Kong AI GW | Agregar enrutamiento LLM a la gestión de API existente |
| Optimización de enrutamiento basada en ML | Descontinuado en junio de 2026, el código es bifurcable pero ya no es una apuesta segura para proyectos nuevos |
Una nota sobre auto-alojado vs. gestionado: Los gateways auto-alojados (LiteLLM, Helicone, Bifrost) te dan control total sobre el flujo de datos, nada sale de tu infraestructura excepto la llamada API de LLM real. Eso importa para salud, finanzas y cualquier contexto donde la residencia de datos es un requisito estricto. Los gateways gestionados (OpenRouter, Cloudflare y Merge Gateway) intercambian ese control por cero carga operativa. Portkey y Kong se sitúan en el medio, gateways de código abierto con plataformas gestionadas opcionales. Los equipos que priorizan la soberanía de datos a veces combinan un gateway self-hosted con LLMs ejecutándose localmente para que ninguna solicitud salga de su red.
Para la mayoría de los equipos, la decisión se reduce a dos preguntas:
- ¿Quieres auto-alojamiento? Sí -> LiteLLM. No -> OpenRouter para prototipar, Merge Gateway una vez en producción.
- ¿Necesitas guardrails? Sí -> Portkey. No -> quédate con no. 1.
Si estás construyendo aplicaciones RAG que llaman a múltiples proveedores para embeddings y completados, un gateway es prácticamente obligatorio. Lo mismo aplica para apps que necesitan salidas estructuradas entre diferentes proveedores, los gateways normalizan el formato de respuesta para que tu lógica de análisis no se rompa cuando cambies de modelos.
Elegir una herramienta es la parte fácil. Hacer que funcione de forma fiable dentro de un producto real es donde la mayoría de los equipos se atasca, y eso es exactamente lo que nuestro equipo de integración de IA construye para sus clientes, desde pipelines RAG hasta agentes a medida. ¿Quieres una segunda opinión sobre tu stack? Solicita una consultoría gratuita.
Preguntas frecuentes
¿Cuál es la diferencia entre un LLM gateway, proxy y router?
Un proxy reenvía solicitudes y agrega registro. Un router elige el mejor modelo/proveedor para cada solicitud. Un gateway combina ambos con seguimiento de costos, caché, guardrails y observabilidad. En la práctica, la mayoría de las herramientas "gateway" hacen los tres, los términos se usan indistintamente.
¿Es LiteLLM realmente gratuito?
El proxy de código abierto es completamente gratuito (licencia MIT). Pagas por tu propio alojamiento (un VPS de $5/mes funciona para uso ligero) y los costos de API del proveedor de LLM. BerriAI ofrece planes enterprise para equipos que quieren alojamiento gestionado, SSO y soporte.
¿Agrega OpenRouter una latencia significativa?
Mínima. OpenRouter agrega una pequeña sobrecarga de enrutamiento (normalmente <50ms) más cualquier distancia geográfica entre tú y sus servidores. Para la mayoría de las aplicaciones, la diferencia es insignificante. Para sistemas críticos de latencia que procesan miles de solicitudes por segundo, es mejor una opción auto-alojada como Bifrost.
¿Puedo usar múltiples gateways juntos?
Sí, y algunos equipos lo hacen. Un patrón común es usar OpenRouter para prototipos rápidos y cambiar a LiteLLM para producción. O usar Helicone como capa de observabilidad frente al enrutamiento de LiteLLM. Solo ten cuidado con el apilamiento de latencia.
¿Qué gateway tiene el mejor caché?
Portkey y Cloudflare AI Gateway tienen las implementaciones de caché más maduras. Portkey ofrece caché semántico (coincidencia difusa de prompts similares), mientras que Cloudflare aprovecha su red edge global para caché geográfico. LiteLLM admite caché basado en Redis. Para un análisis más profundo de las estrategias de caché, consulta nuestra guía de caché de prompts de LLM.
¿Necesito un gateway si solo uso un proveedor de LLM?
Probablemente no para enrutamiento. Pero es posible que aún quieras uno para observabilidad (Helicone), seguimiento de costos (LiteLLM) o guardrails (Portkey). Las funciones de seguimiento de costos y registro por sí solas pueden justificar un gateway incluso con un único proveedor.
¿Cómo manejan los gateways las respuestas en streaming?
Todos los gateways de esta lista admiten streaming de server-sent events (SSE). El gateway hace proxy del flujo del proveedor a tu cliente con buffering mínimo. El impacto de latencia en el streaming es generalmente menor que en las solicitudes sin streaming, ya que la sobrecarga es por conexión, no por token.
¿Qué pasa cuando un proveedor cae?
La mayoría de los gateways admiten cadenas de fallback. Configuras un proveedor principal y uno o más fallbacks. Si el principal devuelve errores o supera los umbrales de latencia, el gateway enruta automáticamente al siguiente proveedor. LiteLLM, Portkey y Helicone manejan esto bien. OpenRouter lo hace automáticamente entre bastidores.
¿Pueden los gateways imponer límites de costos?
Sí. LiteLLM tiene controles de presupuesto incorporados por equipo, usuario o clave API. Portkey rastrea el gasto en tiempo real con alertas. Kong admite cuotas basadas en tokens. Cloudflare proporciona análisis de uso. Este es en realidad uno de los argumentos más sólidos para usar un gateway, sin uno, un bucle descontrolado puede quemar tu presupuesto de API en una noche.
¿Qué gateway es mejor para startups vs. empresas?
Startups: OpenRouter (sin configuración) o LiteLLM (gratis, flexible). Empresas: TrueFoundry (soberanía de datos, SOC 2/HIPAA/GDPR, gobierna el tráfico de modelos y agentes mediante su MCP Gateway), Portkey (guardrails, cumplimiento, registros de auditoría) o Kong AI Gateway (si ya se usa Kong). Los principales diferenciadores enterprise son SSO, control de acceso basado en roles, controles de residencia de datos y registro de auditorías, funciones que las startups aún no necesitan pero que las empresas no pueden omitir.
¿Cuál es el mejor proxy LLM?
LiteLLM es el mejor proxy LLM para la mayoría de los equipos. Se ejecuta como un contenedor Docker independiente, envuelve más de 100 proveedores detrás de un endpoint compatible con OpenAI y es completamente gratuito para auto-alojar. Si "proxy" significa que quieres cero infraestructura, OpenRouter actúa como un proxy alojado en la nube con más de 300 modelos en una sola clave API. La distinción está en el control: LiteLLM mantiene tus datos en tus servidores; OpenRouter los enruta a través de su plataforma.
¿Cuál es la diferencia entre un LLM gateway y un LLM router?
Un LLM router selecciona qué modelo o proveedor maneja una solicitud determinada, típicamente basándose en costo, latencia o contenido del prompt. Un LLM gateway hace eso y más: agrega seguimiento de costos, caché, guardrails, rate limiting y observabilidad sobre la capa de enrutamiento. Todas las herramientas en esta lista son técnicamente gateways. Los routers puros (herramientas que solo hacen selección de modelos sin otro middleware) son raros en producción porque los equipos casi siempre necesitan al menos registro junto con el enrutamiento.
Portkey vs. Bifrost: ¿cuál debería elegir en 2026?
Elige Bifrost si lo que más te importa es la latencia bruta y la gobernanza de herramientas de agentes vía MCP: su arquitectura Go añade 11 microsegundos de sobrecarga frente a los ~12ms de Portkey, y el nivel OSS gratuito de Bifrost ya incluye un MCP Gateway con Code Mode. Elige Portkey si necesitas guardrails de seguridad de contenido (redacción de PII, detección de jailbreak) funcionando de serie sin pagar un nivel Enterprise, ya que Bifrost los reserva a su plan de pago. El otro factor: Portkey fue adquirido por Palo Alto Networks en mayo de 2026 y ahora vive dentro de su plataforma de seguridad Prisma AIRS, mientras que Bifrost sigue siendo un proyecto de código abierto independiente de Maxim AI. Ninguno es estrictamente mejor, es velocidad e independencia frente a guardrails y respaldo corporativo.
¿Cuáles son las mejores alternativas a Portkey ahora que pertenece a Palo Alto Networks?
Las alternativas independientes más sólidas son Bifrost (el más rápido, ahora con su propio MCP Gateway, aunque los guardrails requieren Enterprise), LiteLLM (la cobertura de proveedores más amplia y la comunidad más grande, si no necesitas guardrails integrados) y TrueFoundry (gobernanza empresarial y certificaciones de cumplimiento comparables, y sigue siendo un proveedor independiente). Helicone también es de código abierto, pero lleva en modo mantenimiento desde su adquisición por Mintlify en marzo de 2026, así que funciona mejor como opción de observabilidad que como sustituto de gateway con futuro por delante.