ai-machine-learning

Fini jongler avec les APIs LLM : 10 passerelles classées pour 2026

Écrit par Mert Batur
Mis à jour Jul 25, 2026
39 lecture
Fini jongler avec les APIs LLM : 10 passerelles classées pour 2026

Les 10 meilleurs outils LLM Gateway, classés : Accédez à n'importe quel modèle via une seule API [2026]

Dernière mise à jour : 19 juillet 2026. Nous avons revérifié les tarifs et les nombres d'étoiles GitHub des 9 passerelles, et ajouté deux changements d'actionnariat qui comptent si vous choisissez un gateway aujourd'hui : Palo Alto Networks a finalisé le rachat de Portkey le 29 mai 2026, l'intégrant à sa plateforme de sécurité Prisma AIRS, et Mintlify a racheté Helicone en mars 2026, plaçant son produit cloud en mode maintenance. Nous avons également découvert que les mainteneurs de TensorZero ont archivé le projet en juin 2026, nous le signalons donc ci-dessous plutôt que de faire comme s'il restait un choix viable. Bifrost est passé d'environ 2 000 à 6 600 étoiles GitHub depuis notre dernière vérification et a livré son propre MCP Gateway, comblant une bonne partie de l'écart de gouvernance avec Portkey et TrueFoundry, nous avons donc ajouté une comparaison face à face.

La meilleure passerelle LLM en 2026 est LiteLLM pour les équipes auto-hébergées et Merge Gateway pour le trafic de production managé. LiteLLM prend en charge 100+ fournisseurs derrière une seule API compatible OpenAI, gère les fallbacks et les contrôles budgétaires, et fonctionne gratuitement sur n'importe quel VPS. Merge Gateway est le choix managé dès que les dépenses LLM deviennent une question de marge : politiques de routage par client ou fonctionnalité, plafonds budgétaires, facturation unifiée et attribution des coûts au niveau de la requête. Si vous voulez simplement le catalogue de modèles le plus large sans configuration, OpenRouter offre toujours un accès instantané à 300+ modèles et reste le meilleur endroit pour prototyper. Pour les entreprises réglementées qui ont besoin de souveraineté des données et de gouvernance sur le trafic des modèles et des agents, TrueFoundry s'exécute entièrement dans votre propre VPC. Pour les guardrails de production (rédaction PII, détection de jailbreak), Portkey est le choix. Pour un débit brut supérieur à 5 000 RPS, l'architecture Go de Bifrost n'ajoute que 11 microsecondes d'overhead.

Vous appelez OpenAI pour votre chatbot, Anthropic pour votre assistant de codage, et Gemini pour votre pipeline de résumé. Trois clés API, trois SDKs, trois tableaux de bord de facturation, trois ensembles de gestion des erreurs. Ajoutez maintenant la logique de fallback quand un fournisseur tombe en panne. C'est le désordre que les LLM gateways règlent, une API unifiée qui achemine vers n'importe quel modèle, suit les coûts et gère les pannes automatiquement.

Nous avons testé tous les principaux LLM gateways et les avons classés selon ce qui compte vraiment : la surcharge de latence, la couverture des fournisseurs, la facilité de configuration et s'ils survivront à votre prochaine pointe de trafic.

RangOutilIdéal pourTypePrix de départ
no. 1LiteLLMFlexibilité maximaleSelf-hosted (open-source)Gratuit
no. 2Merge GatewayRoutage et contrôle des dépenses à l'échelle enterpriseManaged SaaSPay-per-token (palier gratuit)
no. 3TrueFoundryGouvernance enterprise + MCPSelf-hosted + managéPalier gratuit (499 $/mois Pro)
no. 4OpenRouterAccès multi-modèle sans configurationManaged SaaSPay-per-token
no. 5PortkeyGuardrails en productionHybride (open-source + managé)Offre gratuite
no. 6HeliconeÉquipes axées sur l'observabilitéSelf-hosted (open-source)Gratuit
no. 7BifrostDébit brutSelf-hosted (open-source)Gratuit
no. 8Cloudflare AI GatewayRoutage sans infrastructureManagéOffre gratuite
no. 9Kong AI GatewayÉquipes de gestion d'APISelf-hosted + enterpriseCommunity gratuit
no. 10TensorZeroRoutage optimisé ML (archivé en juin 2026)Self-hosted (open-source, non maintenu)Gratuit

Qu'est-ce qu'un LLM Gateway ? (Et en avez-vous vraiment besoin ?)

Avant les classements, une distinction rapide. Les gens utilisent « gateway », « proxy » et « router » de façon interchangeable, mais ils remplissent des rôles légèrement différents :

  • LLM Proxy : Transmet les requêtes aux fournisseurs, ajoute la journalisation. Logique minimale.
  • LLM Router : Choisit le meilleur modèle ou fournisseur pour chaque requête en fonction du coût, de la latence ou du contenu.
  • LLM Gateway : Le package complet, proxy + router + suivi des coûts + caching + guardrails + observabilité.

La plupart des outils de cette liste sont des gateways complets, mais certains tendent davantage vers le proxy ou le router.

Vous avez besoin d'un gateway si :

  1. Vous appelez 2+ fournisseurs LLM et souhaitez une seule API pour tous
  2. Vous devez suivre les coûts entre les fournisseurs (qui dépense votre budget ?)
  3. Vous voulez un basculement automatique quand un fournisseur tombe en panne
  4. Vous développez des fonctionnalités qui bénéficient du caching de prompts entre fournisseurs

Si vous n'utilisez qu'un seul fournisseur et n'avez aucun plan de changement, un gateway ajoute une complexité inutile. Passez votre chemin.

Le parcours d'adoption typique : La plupart des équipes commencent par coder directement les appels OpenAI. Puis elles ajoutent Anthropic pour un deuxième cas d'usage et écrivent une fonction wrapper. Ensuite, elles ont besoin de logique de fallback, de suivi des coûts et de rate limiting, et soudain, elles ont elles-mêmes construit un gateway maison à moitié cuit. Les outils ci-dessous remplacent ce bric-à-brac artisanal par quelque chose d'éprouvé.

1. LiteLLM, Le meilleur dans l'ensemble

Étoiles GitHub : ~54K | Langage : Python | Licence : MIT

LiteLLM est le couteau suisse des LLM gateways. Il enveloppe 100+ fournisseurs LLM derrière une seule API compatible OpenAI, ce qui signifie que votre code SDK OpenAI existant fonctionne sans modifications. Il suffit de changer l'URL de base.

Le composant serveur proxy est ce qui fait de LiteLLM un gateway plutôt qu'un simple SDK. Vous le déployez comme un service autonome, configurez vos modèles dans un fichier YAML, et chaque équipe atteint le même endpoint avec suivi des coûts, rate limiting et load balancing intégrés.

python
# config.yaml pour le proxy LiteLLM
model_list:
  - model_name: gpt-4
    litellm_params:
      model: openai/gpt-4o
      api_key: sk-...
  - model_name: gpt-4
    litellm_params:
      model: anthropic/claude-sonnet-4-20250514
      api_key: sk-ant-...
  # LiteLLM équilibre automatiquement la charge entre ceux-ci

general_settings:
  master_key: sk-my-master-key
  database_url: postgresql://...
python
# Votre code d'application ne change pas -- pointez simplement vers le proxy
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:4000",  # Proxy LiteLLM
    api_key="sk-my-master-key"
)

response = client.chat.completions.create(
    model="gpt-4",  # Achemine vers OpenAI ou Anthropic via config
    messages=[{"role": "user", "content": "Expliquez les LLM gateways"}]
)

Ce qui est excellent :

  • 100+ fournisseurs pris en charge (la plus grande couverture de tout gateway)
  • API compatible OpenAI, aucun changement de code pour les applications existantes
  • Suivi des coûts intégré, budgets par équipe/utilisateur
  • Chaînes de fallback : si OpenAI échoue, essayez Anthropic, puis Gemini
  • S'intègre avec tous les principaux outils d'observabilité (Langfuse, Helicone, etc.)

Ce qui l'est moins :

  • Le GIL de Python limite le débit par processus (latence P95 ~8ms à 1 000 RPS)
  • Le proxy nécessite sa propre base de données PostgreSQL pour les fonctionnalités de gestion d'équipe
  • La configuration peut devenir complexe avec de nombreux modèles et règles de routage
  • Attaque sur la chaîne d'approvisionnement le 24 mars 2026 : deux versions PyPI (1.82.7, 1.82.8) ont été piégées après le vol d'identifiants de publication via une action CI compromise. PyPI a mis les deux en quarantaine en une quarantaine de minutes, mais épinglez votre version et vérifiez pip show litellm si vous avez déployé ce jour-là. Détails complets dans le rapport d'incident de LiteLLM

Tarifs : Gratuit et open-source. Plans enterprise disponibles pour la gestion hébergée.

Si vous avez lu notre guide sur l'utilisation de Claude Code avec différents modèles, vous avez déjà vu LiteLLM en action, c'est l'une des principales façons dont les développeurs acheminent Claude Code via des fournisseurs alternatifs. Notre guide d'installation du proxy LiteLLM vous accompagne dans le déploiement Docker complet avec PostgreSQL en moins de 20 minutes.

Verdict : LiteLLM est le meilleur LLM gateway dans l'ensemble pour les équipes qui veulent une flexibilité maximale et ne rechignent pas à l'auto-hébergement. Il a la couverture de fournisseurs la plus large, l'écosystème le plus mature et la plus grande communauté. Commencez par là, sauf si vous avez une raison spécifique de ne pas le faire.

2. Merge Gateway, Le meilleur pour le routage et le contrôle des dépenses à l'échelle enterprise

Fournisseurs : OpenAI, Anthropic, Google, AWS Bedrock, Mistral, Cohere, Grok | Type : Managed SaaS | Lancement : 31 mars 2026

Merge Gateway est construit pour le moment où l'usage des LLM cesse d'être une ligne budgétaire et devient un problème de marge. Là où OpenRouter optimise la largeur d'accès aux modèles, Merge optimise le contrôle sur le trafic que vous faites déjà tourner en production : routage par coût, latence, qualité, client, fonctionnalité ou région, budgets qui se déclenchent avant la facture, et logs au niveau de la requête qui indiquent quel modèle a traité un appel et pourquoi il a été routé là.

Ce dernier point est le véritable différenciateur. La plupart des gateways vous disent ce que vous avez dépensé. Merge est conçu pour vous dire pour qui vous l'avez dépensé, la question qui surgit dès que l'usage d'un seul client enterprise commence à ronger la marge brute d'un produit.

python
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_API_KEY",
    base_url="https://api-gateway.merge.dev/v1/openai",
)

response = client.chat.completions.create(
    model="gpt-4o",
    messages=[{"role": "user", "content": "Summarize this support ticket"}],
)

Ce qui est excellent :

  • Politiques de routage par client, fonctionnalité, région, cas d'usage, coût, latence ou qualité
  • Le fallback automatique maintient les fonctionnalités IA actives pendant les pannes fournisseur, les rate limits et les dégradations
  • Observabilité au niveau de la requête : modèle, fournisseur, coût, latence et raison du routage derrière chaque appel
  • Gouvernance des coûts avec budgets, plafonds de dépenses et alertes par projet, équipe, palier client ou fonctionnalité
  • Caching sémantique et compression de contexte comme leviers de coût à part entière, pas de simples options

Ce qui l'est moins :

  • Pas open-source, donc écarté si l'auto-hébergement est une exigence stricte (Enterprise propose du VPC/on-prem, mais c'est une conversation commerciale)
  • Pensé pour la production par conception, ce qui le rend plus lourd que nécessaire pour des prototypes ou des applications à faible volume
  • Lancé en mars 2026, donc la communauté, les intégrations et les tutoriels tiers restent minces face à LiteLLM ou OpenRouter

Tarifs : Palier gratuit avec 10 $/mois de crédits, sans carte bancaire. Le plan Pro facture le coût LLM + 5% sans plafond de dépenses, avec votre propre clé API. L'Enterprise est sur devis et ajoute un déploiement VPC ou on-prem, un compte dédié et des SLA de disponibilité. Les crédits sont émis le 1er du mois et ne se reportent pas.

À noter sur les frais : les 5% de Merge se situent juste sous les 5,5% d'OpenRouter. À volume de prototype, cette différence est négligeable. À six chiffres de dépenses d'inférence annuelles, c'est de l'argent réel, et c'est le genre de chose qui mérite d'être modélisée avant de trancher dans un sens ou dans l'autre.

Verdict : Merge Gateway est le bon choix quand votre trafic LLM est devenu un problème de fiabilité et de marge plutôt qu'un problème d'intégration. Si vous devez répondre à « quel client fait grimper les dépenses » ou « quelle fonctionnalité est déficitaire », et que vous voulez des politiques de fallback qui maintiennent vos fonctionnalités actives pendant un incident fournisseur, c'est l'option managée la plus solide ici. Si vous hésitez encore sur les modèles à utiliser, le catalogue d'OpenRouter vous sert mieux, et vous pourrez basculer plus tard.

3. TrueFoundry, Le meilleur pour la gouvernance enterprise

Modèles : 1 600+ | Fournisseurs : 250+ | Type : Self-hosted + managé | Déploiement : VPC, on-prem, air-gapped

La passerelle IA de TrueFoundry est conçue pour le cas que les gateways open-source peinent à gérer : une entreprise réglementée qui a besoin d'un plan de contrôle unique pour chaque modèle, d'une pleine souveraineté des données et de pistes d'audit qui survivent à un audit de conformité. Elle s'exécute dans votre propre VPC, on-prem ou en mode totalement air-gapped, aucune donnée de requête ne quitte donc votre domaine, et elle embarque la conformité SOC 2, HIPAA et RGPD, le SSO et le RBAC de série.

La couverture est parmi les plus larges de cette liste : 1 600+ modèles auprès de 250+ fournisseurs (OpenAI, Anthropic, Gemini, Groq, Mistral), ainsi que des backends auto-hébergés comme vLLM, SGLang et Triton. TrueFoundry annonce une latence interne inférieure à 3ms sous charge enterprise et 99,99 % de disponibilité sur plus de 10 milliards de requêtes par mois, la couche de gouvernance ne vous coûte donc pas en débit.

python
from openai import OpenAI

client = OpenAI(
    base_url="https://<votre-org>.truefoundry.com/api/llm",  # votre gateway
    api_key="tfy-..."
)

response = client.chat.completions.create(
    model="openai/gpt-4o",  # acheminé, journalisé et limité en débit de façon centralisée
    messages=[{"role": "user", "content": "Résumez ce contrat"}]
)

Ce qui différencie TrueFoundry de Portkey ou LiteLLM, c'est le MCP Gateway : un registre central qui gouverne la façon dont les agents IA accèdent aux outils d'entreprise (Slack, GitHub, Confluence, Datadog) via le Model Context Protocol. Vous enregistrez vos API internes comme serveurs MCP, les protégez derrière Okta ou Azure AD avec un RBAC par serveur, et obtenez un traçage au niveau des requêtes sur chaque appel d'outil. Cela vous donne un plan de contrôle gouverné unique pour le trafic des modèles et le trafic des outils d'agents, ce qui compte une fois que les agents commencent à prendre des actions, et non plus seulement à générer du texte.

Contrairement à la plupart des gateways d'entreprise, TrueFoundry affiche ses tarifs ouvertement. Un palier Developer gratuit couvre 50 000 requêtes par mois, 3 utilisateurs et le MCP Gateway jusqu'à 5 serveurs, de quoi prototyper toute la stack avant de parler à qui que ce soit. Le palier Pro coûte 499 $/mois pour 1 million de requêtes, 10 utilisateurs, le caching sémantique, les modèles virtuels et le routage avancé, l'usage supplémentaire étant facturé à des tarifs unitaires transparents. Pro Plus coûte 2 999 $/mois et ajoute les métadonnées personnalisées, les alertes et les exports de monitoring pour 25 utilisateurs. Enterprise est devisé sur mesure pour 10M+ de requêtes, avec des installations complètes en VPC, multi-région et air-gapped des plans de contrôle et de gateway. Chaque offre payante inclut un essai de 7 jours. Le SaaS managé n'a aucun coût d'hébergement ; si vous auto-hébergez le gateway dans votre propre cloud (BYOC), prévoyez environ 600 à 1 000 $ par mois pour l'infrastructure sous-jacente.

Ce qui est excellent :

  • 1 600+ modèles, 250+ fournisseurs, plus les backends auto-hébergés (vLLM, SGLang, Triton)
  • S'exécute dans votre VPC, on-prem ou air-gapped ; aucune donnée ne quitte votre domaine
  • Conformité SOC 2, HIPAA, RGPD, SSO, RBAC et journalisation d'audit intégrés
  • Guardrails : filtrage PII, détection de toxicité, analyse des injections de prompts
  • MCP Gateway gouverne l'accès aux outils des agents, pas seulement les appels de modèles
  • Tarification publique et transparente avec un palier Developer vraiment gratuit (50K requêtes/mois)
  • TrueFoundry annonce ~30% de réduction moyenne des coûts via le routage, le caching et les budgets

Ce qui l'est moins :

  • Enterprise-first : plus lourd que LiteLLM ou OpenRouter pour un petit projet
  • La plateforme centrale est propriétaire (leurs dépôts open-source sont des outils d'infra séparés)
  • L'auto-hébergement du gateway ajoute environ 600 à 1 000 $/mois d'infrastructure en plus de votre offre
  • Vraiment utile une fois que vous avez de nombreuses équipes et outils à gouverner, pas dès le premier jour

Tarifs : Palier Developer gratuit (0 $/mois, 50K requêtes, 3 utilisateurs). Pro 499 $/mois (1M requêtes, 10 utilisateurs, caching sémantique, routage avancé). Pro Plus 2 999 $/mois (25 utilisateurs, observabilité avancée). Enterprise sur mesure (10M+ requêtes, VPC complet et air-gapped). Essai de 7 jours sur les offres payantes ; le SaaS managé n'a aucun coût d'hébergement, l'auto-hébergement ajoute ~600-1 000 $/mois d'infrastructure.

Verdict : TrueFoundry est le gateway pour les entreprises qui ont besoin d'un plan de contrôle gouverné pour le trafic des modèles et l'accès aux outils des agents, avec les données qui restent dans leur propre infrastructure. Si vous êtes une startup qui connecte deux fournisseurs, c'est plus que ce qu'il vous faut — commencez par LiteLLM. Si vous êtes une équipe plateforme qui déploie l'IA auprès de dizaines d'équipes internes sous un mandat de conformité, il mérite d'être sur votre liste.

4. OpenRouter, Le meilleur accès multi-modèle sans configuration

Modèles : 300+ | Type : Managed SaaS | Licence : Propriétaire

OpenRouter adopte l'approche opposée à LiteLLM : vous ne déployez rien. Inscrivez-vous, obtenez une clé API, et vous avez un accès instantané à 300+ modèles de tous les principaux fournisseurs via un seul endpoint. C'est l'"App Store" des API LLM.

La proposition de valeur est la simplicité. Pas d'infrastructure à maintenir, pas de configurations YAML à écrire, pas de bases de données à provisionner. Vous prépayez des crédits ou liez une carte, et OpenRouter gère la consolidation de facturation entre tous les fournisseurs.

python
from openai import OpenAI

client = OpenAI(
    base_url="https://openrouter.ai/api/v1",
    api_key="sk-or-..."
)

# Accédez à n'importe quel modèle de n'importe quel fournisseur -- même code
response = client.chat.completions.create(
    model="anthropic/claude-sonnet-4-20250514",
    messages=[{"role": "user", "content": "Comparez les LLM gateways"}]
)

Ce qui est excellent :

  • 300+ modèles, une seule clé API, un tableau de bord de facturation
  • 25+ modèles gratuits pour le prototypage (dont certains étonnamment capables)
  • Pas d'infrastructure à gérer, inscrivez-vous et commencez à appeler
  • Les fonctionnalités de comparaison de modèles aident à évaluer avant de s'engager
  • Gère les pannes de fournisseurs avec un routage de fallback automatique

Ce qui l'est moins :

  • Frais de plateforme de 5,5% en plus du prix du fournisseur, s'accumule à grande échelle
  • Pas d'option d'auto-hébergement, vos données transitent par les serveurs d'OpenRouter
  • Observabilité limitée par rapport aux outils gateway dédiés
  • Les limites de débit sur l'offre gratuite peuvent être restrictives pour les charges de travail en production
  • Pas de logique de routage personnalisée, vous obtenez ce qu'OpenRouter décide

Tarifs : Pay-per-token (prix fournisseur + 5,5% de frais). Pas de minimum mensuel. 25+ modèles gratuits disponibles.

Verdict : OpenRouter est le moyen le plus rapide d'accéder à plusieurs fournisseurs LLM. Si vous voulez prototyper avec différents modèles ou exécuter une charge de travail petite à moyenne sans gérer d'infrastructure, c'est le choix évident. À grande échelle, les 5,5% de frais commencent à compter. Si la réduction des coûts est le moteur, consultez notre guide pour réduire les coûts des API LLM pour une analyse complète des leviers d'économies via le caching, le batching et le gateway.

5. Portkey, Le meilleur pour les guardrails en production

Étoiles GitHub : ~12K | Langage : TypeScript/Node.js | Licence : Apache 2.0 (gateway), plateforme managée

Portkey se positionne comme le « plan de contrôle de l'IA ». Là où LiteLLM se concentre sur le routage et OpenRouter sur la simplicité, le différenciateur de Portkey est la sécurité en production : guardrails, rédaction PII, détection de jailbreak et pistes d'audit intégrées dans la couche gateway.

Depuis mars 2026, Portkey a rendu l'intégralité de son gateway open-source (Apache 2.0), vous pouvez donc auto-héberger le routage de base et les guardrails sans la plateforme managée. Le changement le plus lourd de conséquences est arrivé le 29 mai 2026, quand Palo Alto Networks a finalisé le rachat de Portkey et l'a intégré à Prisma AIRS, sa plateforme de sécurité pour l'IA agentique. Le gateway open-source reste distribué sous Apache 2.0 et les offres managées fonctionnent toujours de la même manière, mais Portkey n'est plus une société d'infrastructure IA indépendante : c'est désormais un composant dans la gamme de produits d'un éditeur de cybersécurité, ce qui compte si vous évaluez l'indépendance de la feuille de route à long terme.

python
from portkey_ai import Portkey

portkey = Portkey(
    api_key="pk-...",
    config={
        "strategy": {"mode": "fallback"},
        "targets": [
            {"provider": "openai", "override_params": {"model": "gpt-4o"}},
            {"provider": "anthropic", "override_params": {"model": "claude-sonnet-4-20250514"}}
        ]
    }
)

response = portkey.chat.completions.create(
    messages=[{"role": "user", "content": "Résumez ce document"}]
)

Ce qui est excellent :

  • Support de 1 600+ modèles entre fournisseurs
  • Guardrails intégrés : détection PII, prévention des jailbreaks, filtrage de contenu
  • Gestion et versionnement des prompts au sein du gateway
  • La couche de caching réduit les appels répétés (économise de l'argent et de la latence)
  • Pistes d'audit et fonctionnalités de conformité pour les industries réglementées
  • Gateway désormais entièrement open-source (mars 2026)

Ce qui l'est moins :

  • La tarification de la plateforme managée commence à 49 $/mois pour les fonctionnalités de production
  • Niveau enterprise (5 000–10 000 $/mois) pour la gouvernance avancée
  • La plateforme ajoute de la complexité au-delà de ce que les gateways plus simples offrent
  • Courbe d'apprentissage plus prononcée que LiteLLM ou OpenRouter
  • Désormais propriété de Palo Alto Networks (racheté en mai 2026), sa feuille de route répond donc aux priorités d'un éditeur de sécurité, et non uniquement à celles des utilisateurs d'infrastructure IA. Les équipes qui tiennent à rester à l'écart de cette dépendance se tournent de plus en plus vers Bifrost ou LiteLLM, voyez la comparaison face à face plus bas dans cette page

Tarifs : Le gateway open-source est gratuit à auto-héberger. Plateforme managée : le palier Developer est gratuit à vie (10K logs/mois, rétention de 3 jours). Production coûte 49 $/mois (100K logs/mois, rétention de 30 jours, guardrails, RBAC, caching sémantique, 9 $ par tranche de 100K logs supplémentaires). Enterprise est devisé sur mesure (10M+ logs/mois, hébergement en VPC, SOC 2 Type 2, HIPAA).

Verdict : Portkey reste le gateway pour les équipes qui développent des fonctionnalités LLM pour les clients et qui ne peuvent pas se permettre des injections de prompts, des fuites PII ou des coûts non surveillés, les guardrails justifient la complexité. Ce qui a changé, c'est qui se trouve derrière : depuis le rachat par Palo Alto Networks, Portkey convient surtout aux équipes déjà installées dans l'écosystème Prisma AIRS (ou à l'aise avec lui). Si vous cherchez un gateway open-source tout aussi capable mais qui reste indépendant, Bifrost mérite un examen plus attentif.

6. Helicone, Le meilleur pour les équipes axées sur l'observabilité

Étoiles GitHub : ~6K | Langage : Rust | Licence : Apache 2.0

Helicone a commencé comme un outil d'observabilité et a évolué vers un gateway complet. Cette histoire d'origine est importante, ses fonctionnalités de surveillance et d'analyse sont de premier ordre, et les fonctionnalités de gateway (routage, caching, failover) ont été construites sur une solide fondation d'observabilité.

Être écrit en Rust lui confère un vrai avantage en termes de performance : latence P50 de 8ms, P95 sous 5ms, environ 3 000 RPS sur une seule instance avec seulement 64 Mo de mémoire.

Une chose à savoir avant de vous engager : Mintlify a racheté Helicone en mars 2026, et l'équipe a déménagé à San Francisco pour construire le produit de documentation et de contexte d'agents de Mintlify. L'annonce d'Helicone est claire sur ce que cela implique : la plateforme reste en ligne et continue de recevoir des correctifs de sécurité, des corrections de bugs et la prise en charge des nouveaux modèles, mais il n'y a plus de feuille de route de nouvelles fonctionnalités au-delà de ça. Si vous avez besoin d'un gateway qui ajoute encore activement des fonctionnalités, pesez ce point avant d'en faire votre standard.

python
# Helicone : proxy en une ligne -- changez simplement l'URL de base
from openai import OpenAI

client = OpenAI(
    base_url="https://oai.helicone.ai/v1",  # ou votre URL auto-hébergée
    api_key="sk-...",
    default_headers={
        "Helicone-Auth": "Bearer hlc-..."
    }
)

# Toutes les requêtes sont maintenant journalisées, suivies et acheminées via Helicone
response = client.chat.completions.create(
    model="gpt-4o",
    messages=[{"role": "user", "content": "Analysez ce code"}]
)

Ce qui est excellent :

  • Basé sur Rust : ~64 Mo de mémoire, latence P95 <5ms, 3 000 RPS par instance
  • Load balancing conscient de l'état de santé, achemine vers le fournisseur le plus rapide disponible
  • Tableaux de bord en temps réel pour les coûts, la latence, l'utilisation des tokens et les taux d'erreur
  • Intégration en une ligne, changez simplement l'URL de base
  • Déploiement en binaire unique (Docker, K8s, bare metal)

Ce qui l'est moins :

  • En mode maintenance depuis le rachat par Mintlify (mars 2026) : correctifs de sécurité et de bugs uniquement, pas de nouvelles fonctionnalités ni de feuille de route
  • Les fonctionnalités d'observabilité sont la vedette ; le routage est moins sophistiqué que LiteLLM
  • Moins de fournisseurs pris en charge que LiteLLM ou OpenRouter
  • Communauté plus petite que LiteLLM (6K vs 54K étoiles GitHub)
  • Les fonctionnalités avancées (propriétés personnalisées, sessions) nécessitent la plateforme managée

Tarifs : Open-source et gratuit à auto-héberger. Plateforme managée : Hobby est gratuit (10K requêtes/mois, 1 Go de stockage, rétention de 7 jours, 1 siège). Pro coûte 79 $/mois (sièges illimités, rétention d'un mois, alertes, rapports, HQL). Team coûte 799 $/mois (rétention de 3 mois, SOC 2, HIPAA, canal Slack dédié). Enterprise est sur mesure (on-premise, SSO SAML, remises sur volume).

Si vous évaluez les outils d'observabilité plus largement, notre classement des meilleures plateformes d'observabilité IA couvre Helicone aux côtés de Langfuse, Arize et d'autres.

Verdict : Helicone reste le meilleur gateway pour les équipes dont la principale douleur est « nous ne pouvons pas voir ce qui se passe avec nos appels LLM », et le produit existant ne va nulle part. Sachez simplement que vous adoptez un outil en mode maintenance : très bien pour l'observabilité aujourd'hui, plus risqué si vous pariez sur l'arrivée de nouvelles fonctionnalités gateway l'an prochain.

7. Bifrost, Le meilleur pour les performances brutes

Étoiles GitHub : ~6,6K | Langage : Go | Licence : Apache 2.0

Bifrost est le champion des performances. Construit en Go par Maxim AI, il revendique des performances 50x plus rapides que LiteLLM avec seulement 11 microsecondes de surcharge par requête à 5 000 RPS. Ce ne sont pas des chiffres théoriques, ils proviennent de tests de charge soutenue reproductibles. Le projet a plus que triplé son nombre d'étoiles GitHub depuis notre dernière vérification, passant d'environ 2 000 à 6 600, et cette croissance suit un vrai effort produit : Bifrost a livré son propre MCP Gateway avec un « Code Mode » pour gouverner la façon dont les agents appellent des outils externes, exactement la catégorie de fonctionnalité qui était jusqu'ici le terrain réservé de TrueFoundry et Portkey.

La différence architecturale est fondamentale : les goroutines de Go gèrent des milliers de connexions simultanées sans le goulot d'étranglement GIL de Python, et le binaire compilé élimine entièrement la surcharge de l'interpréteur.

yaml
# bifrost.yaml
account:
  provider: openai
  api_key: ${OPENAI_API_KEY}

models:
  - name: gpt-4o
    provider: openai
  - name: claude-sonnet-4-20250514
    provider: anthropic

routing:
  strategy: round-robin
  fallback: true

Ce qui est excellent :

  • 11µs de surcharge à 5 000 RPS, le plus bas de tout gateway de cette liste
  • Binaire Go : pas de dépendances d'exécution, empreinte mémoire minuscule
  • Load balancing adaptatif entre fournisseurs
  • Mode cluster pour la mise à l'échelle horizontale
  • 1 000+ modèles pris en charge
  • MCP Gateway avec Code Mode intégré à l'offre OSS gratuite, plus la gestion des budgets via des clés virtuelles, le caching sémantique et une observabilité native OpenTelemetry, le tout inclus et non réservé à l'offre Enterprise

Ce qui l'est moins :

  • Projet plus récent, communauté plus petite que celle de LiteLLM (6,6K vs 54K étoiles GitHub) et moins d'intégrations tierces
  • Les guardrails de sécurité du contenu (filtrage PII, détection de jailbreak) nécessitent l'offre Enterprise ; Portkey livre des guardrails comparables dans son gateway OSS gratuit
  • Construit par Maxim AI (un vendeur), direction future liée à leur feuille de route
  • Documentation plus mince que les docs extensives de LiteLLM
  • Le SSO (SAML/OIDC) et le RBAC sont réservés à l'offre Enterprise, les petites équipes obtiennent donc les performances mais pas les contrôles d'accès

Tarifs : Le gateway OSS est gratuit à vie (Apache 2.0) et couvre le routage, le failover, le MCP Gateway, le caching sémantique et la gestion des budgets par clés virtuelles. Enterprise est devisé sur mesure (sur demande de démo) et ajoute les guardrails, le mode cluster, le SSO SAML/OIDC, le RBAC, les journaux d'audit et un support avec SLA ; un essai gratuit de 14 jours est disponible.

Verdict : Bifrost est pour les équipes qui gèrent des systèmes de production à haut débit où la surcharge du gateway compte, et il s'est imposé comme l'une des alternatives les plus sérieuses à Portkey maintenant que son offre gratuite inclut la gouvernance MCP et les contrôles de budget qui exigeaient ailleurs une plateforme payante. Si vous traitez des milliers d'appels LLM par seconde et voulez rester sur une infrastructure open-source sans qu'un rachat plane sur la feuille de route, l'architecture Go de Bifrost livre. Pour la plupart des équipes, la surcharge de 8ms de LiteLLM est parfaitement acceptable, et si vous avez besoin de guardrails de sécurité du contenu intégrés dès aujourd'hui plutôt que dans l'offre Enterprise, le gateway OSS de Portkey garde l'avantage, ce compromis résume à lui seul la comparaison ci-dessous.

8. Cloudflare AI Gateway, La meilleure option zéro infrastructure

Type : Service managé | Licence : Propriétaire (Cloudflare)

Cloudflare AI Gateway pousse l'approche « vous ne gérez rien » à l'extrême. Si vous êtes déjà sur Cloudflare (et beaucoup d'équipes le sont), vous pouvez activer AI Gateway depuis le tableau de bord et commencer à acheminer les appels LLM via le réseau edge de Cloudflare sans infrastructure supplémentaire.

javascript
// Préfixez simplement l'URL de votre fournisseur avec l'endpoint gateway de Cloudflare
const response = await fetch(
  "https://gateway.ai.cloudflare.com/v1/{account_id}/{gateway_name}/openai/chat/completions",
  {
    method: "POST",
    headers: {
      "Authorization": "Bearer sk-...",
      "Content-Type": "application/json"
    },
    body: JSON.stringify({
      model: "gpt-4o",
      messages: [{ role: "user", content: "Bonjour" }]
    })
  }
);

Ce qui est excellent :

  • Offre gratuite avec 100 000 logs/mois, suffisant pour la plupart des projets secondaires
  • Zéro infrastructure : activer depuis le tableau de bord Cloudflare
  • Caching intégré en bordure (réduit les coûts et la latence)
  • Rate limiting et analytics inclus
  • Facturation unifiée : payer les coûts des fournisseurs LLM via Cloudflare
  • Réseau edge mondial réduit la latence pour les utilisateurs géographiquement distribués

Ce qui l'est moins :

  • Étroitement couplé à l'écosystème Cloudflare, les coûts de changement sont réels
  • Intelligence de routage limitée par rapport aux gateways dédiés
  • Limite de 100 000 logs sur l'offre gratuite ; abonnement Workers Paid pour 1M
  • Moins de fournisseurs pris en charge que LiteLLM ou OpenRouter
  • Pas d'option d'auto-hébergement

Tarifs : Gratuit (100 000 logs/mois), abonnement Workers Paid pour 1M de logs. Pas de frais par requête. Vous payez toujours les fournisseurs LLM séparément.

Pour les équipes qui acheminent les appels de fonctions entre fournisseurs, le caching en bordure de Cloudflare peut réduire significativement la latence pour les modèles d'utilisation d'outils répétés.

Verdict : Cloudflare AI Gateway est la meilleure option si vous êtes déjà sur Cloudflare et souhaitez des fonctionnalités de gateway sans déployer quoi que ce soit de nouveau. L'offre gratuite est généreuse pour les petits projets. Pour une utilisation sérieuse en production, les gateways dédiés offrent plus de contrôle.

9. Kong AI Gateway, Le meilleur pour les équipes de gestion d'API

Étoiles GitHub : ~44K (Kong Gateway total) | Langage : Lua/OpenResty | Licence : Apache 2.0 (community)

Kong AI Gateway n'est pas un produit autonome, c'est une extension de l'API Gateway éprouvé de Kong qui ajoute des capacités spécifiques aux LLM. Si votre organisation utilise déjà Kong pour la gestion d'API, l'ajout du routage IA est une installation de plugin, pas une nouvelle plateforme.

yaml
# Config déclarative Kong (deck)
services:
  - name: ai-llm-service
    url: https://api.openai.com
    plugins:
      - name: ai-proxy
        config:
          route_type: llm/v1/chat
          model:
            provider: openai
            name: gpt-4o
      - name: ai-rate-limiting-advanced
        config:
          limit: [10000]
          window_size: [60]
          window_type: fixed
          strategy: local
          limit_by: consumer

Ce qui est excellent :

  • S'appuie sur la plateforme mature de gestion d'API de Kong (utilisée par des milliers d'entreprises)
  • Routage sémantique : achemine les requêtes en fonction du contenu/de l'intention du prompt
  • Rate limiting basé sur les tokens (pas seulement sur les requêtes)
  • Écosystème de plugins : auth, rate limiting, transformations fonctionnent tous avec les routes IA
  • Métriques OpenTelemetry + Prometheus pour l'intégration Datadog/Grafana

Ce qui l'est moins :

  • Surdimensionné si vous n'utilisez pas déjà Kong, courbe d'apprentissage prononcée
  • Les fonctionnalités IA enterprise nécessitent une licence Kong Enterprise (payante)
  • Complexité de configuration plus élevée que tout autre gateway de cette liste
  • Nécessite des connaissances en infrastructure Kong (ou que l'équipe les acquière)
  • Les fonctionnalités spécifiques à l'IA sont plus récentes et moins matures que le cœur de Kong

Tarifs : Édition community gratuite (open-source). Les fonctionnalités IA enterprise nécessitent un abonnement Kong Enterprise (tarification personnalisée).

Verdict : Kong AI Gateway a du sens si et seulement si votre organisation utilise déjà Kong. Ajouter le routage LLM à votre couche de gestion d'API existante est plus intelligent que déployer un gateway séparé. Mais n'adoptez pas Kong uniquement pour le routage LLM, c'est comme acheter un tracteur pour tondre votre pelouse.

10. TensorZero, Le meilleur pour le routage optimisé ML (désormais abandonné)

Étoiles GitHub : ~11,7K | Langage : Rust | Licence : Apache 2.0 (archivé, non maintenu)

Mise à jour : TensorZero a fermé en juin 2026. Les mainteneurs ont archivé le dépôt le 12 juin 2026, arrêté le développement actif et rendu le capital-risque restant aux investisseurs après avoir conclu qu'ils ne trouvaient pas d'adéquation produit-marché à la fois pour un projet open-source et pour un produit commercial. Nous laissons cette entrée en place parce que les idées valent encore la peine d'être comprises et que le code reste forkable sous Apache 2.0, mais ne l'adoptez pas pour un nouveau système en production : il n'y aura ni correctif de sécurité, ni mise à jour des API fournisseurs, ni support en cas de panne.

TensorZero était le gateway le plus opinioné de cette liste. Là où les autres se concentrent sur le routage et l'observabilité, TensorZero construisait une boucle d'optimisation : il collectait des données d'inférence, effectuait des évaluations et utilisait les résultats pour améliorer les décisions de routage au fil du temps. Considérez-le comme un gateway qui apprend quel modèle fonctionne le mieux pour quel type de requête.

L'implémentation Rust offre une latence P99 sub-milliseconde, même à plus de 10 000 QPS. Ce n'est pas une faute de frappe. Là où LiteLLM ajoute ~8ms et Bifrost ~11µs, TensorZero revendique <1ms P99 sous charge extrême.

python
# TensorZero : inférence structurée avec optimisation
from tensorzero import TensorZeroGateway

with TensorZeroGateway("http://localhost:3000") as client:
    response = client.inference(
        function_name="generate_summary",
        input={
            "messages": [
                {"role": "user", "content": "Résumez cet article..."}
            ]
        }
    )

    # Plus tard : renvoyez des données de qualité pour améliorer le routage
    client.feedback(
        metric_name="summary_quality",
        inference_id=response.inference_id,
        value=0.92
    )

Ce qui est excellent :

  • Latence P99 <1ms à 10 000+ QPS (performances brutes les plus rapides avec Rust)
  • Boucle de feedback : apprend quels modèles fonctionnent le mieux pour chaque fonction
  • Inférence structurée avec validation de schéma
  • Tests A/B entre modèles intégrés dans le gateway
  • Framework d'évaluation intégré

Ce qui l'est moins :

  • Abandonné depuis juin 2026 : dépôt archivé et en lecture seule, aucune mise à jour, aucun correctif de sécurité et aucun support à venir
  • Courbe d'apprentissage plus prononcée que tout autre gateway, vous définissez des « fonctions », pas seulement des modèles
  • Nécessite de repenser votre intégration LLM autour du concept de fonction de TensorZero
  • Moins « plug-and-play » que LiteLLM ou OpenRouter, pas un simple changement d'URL de base
  • Documentation figée dans son dernier état, elle n'est plus enrichie

Tarifs : Gratuit et open-source (Apache 2.0), forkable et maintenable par vos soins, mais il n'y a plus aucun éditeur à payer pour du support, même si vous le vouliez.

Pour les équipes qui effectuaient déjà des évaluations LLM, la boucle de feedback de TensorZero était une manière vraiment utile de combler le fossé entre évaluation et routage, les scores d'évaluation amélioraient directement quels modèles étaient acheminés. L'idée mérite d'être reproduite même si l'outil lui-même a disparu.

Verdict : TensorZero s'adressait aux équipes d'ingénierie ML qui voulaient que leur gateway devienne plus intelligent au fil du temps, et la boucle d'optimisation était vraiment innovante. Le projet étant abandonné, nous ne pouvons plus le recommander pour quoi que ce soit de neuf : prenez LiteLLM, Bifrost ou Portkey et intégrez le retour d'évaluation dans votre propre pipeline. Si vous faites déjà tourner TensorZero en production, le code fonctionne toujours, prévoyez simplement du temps pour migrer avant de tomber sur un changement d'API fournisseur qu'il ne saura pas encaisser.

Surcharge de latence des LLM Gateways : Les vrais chiffres

Chaque gateway ajoute une certaine surcharge à vos appels LLM. La question est de savoir si cela compte pour votre cas d'usage. Voici comment les gateways se comparent dans nos tests :

GatewayLangageSurcharge de latence P50Surcharge de latence P95Débit (instance unique)
BifrostGo~8µs~11µs5 000+ RPS
TensorZero‡Rust~0,3ms<1ms10 000+ QPS
HeliconeRust~5ms~8ms~3 000 RPS
TrueFoundrySelf-hosted~3ms†<3ms†10 milliards+/mois (fournisseur)
LiteLLMPython~4ms~8ms~1 000 RPS
PortkeyTypeScript~5ms~12ms~2 000 RPS
OpenRouterManagé~15–30ms~50msN/A (managé)
Merge GatewayManagénon testé indépendamment§non testé indépendamment§N/A (managé)
Cloudflare AI GWManagé~10–20ms~40msN/A (managé)
Kong AI GatewayLua/Go~3ms~8ms~3 000 RPS

† Le chiffre inférieur à 3ms de TrueFoundry est déclaré par le fournisseur ; nous n'avons pas effectué le même test de charge indépendant que pour les gateways open-source auto-hébergés.

‡ Le projet TensorZero a été archivé en juin 2026 (voir la fiche ci-dessus) ; ses chiffres de latence sont historiques et ne sont plus vérifiables de façon indépendante sur une version activement maintenue. § Merge Gateway a été lancé après notre campagne de tests de charge, nous ne l'avons donc pas mesuré sur le même banc d'essai que les autres et nous ne publierons pas un chiffre que nous n'avons pas relevé. Attendez-vous à une surcharge de gateway managé du même ordre qu'OpenRouter et Cloudflare (environ 10-30ms en P50) jusqu'à ce que nous le testions.

Le contexte compte. Un appel GPT-4o typique prend 500–3 000ms selon la longueur de la sortie. Même la surcharge de 8ms de LiteLLM représente moins de 1% de la latence totale. Le seul scénario où la surcharge du gateway compte est les charges de travail haute fréquence à faible latence comme la classification en temps réel ou la génération d'embeddings à grande échelle. Pour l'IA conversationnelle ou la génération de contenu, n'importe quel gateway de cette liste est suffisamment rapide.

Les gateways managés (OpenRouter, Cloudflare et Merge Gateway) ajoutent plus de surcharge parce que votre requête voyage vers leurs serveurs avant d'atteindre le fournisseur. Les gateways auto-hébergés s'exécutent à côté de votre application, donc le saut supplémentaire est local.

Bifrost vs. Portkey : quel LLM gateway open-source choisir ?

Si vous avez littéralement cherché « LLM gateway open source », voici l'état honnête de cette catégorie à la mi-2026 : cinq des neuf outils de ce classement se distribuent comme des logiciels open-source que vous pouvez auto-héberger dès aujourd'hui. LiteLLM (MIT) et Bifrost (Apache 2.0) sont entièrement open-source, sans fonctionnalité centrale derrière un paywall. Le gateway de Portkey est en Apache 2.0 depuis mars 2026, même si la plateforme managée qui l'entoure reste propriétaire. Helicone (Apache 2.0) est open-source mais en mode maintenance depuis son rachat par Mintlify. Le Gateway de base de Kong est open-source, mais les plugins spécifiques à l'IA, ceux qui comptent pour le routage LLM, sont réservés à Kong Enterprise. TensorZero était open-source lui aussi, mais le projet est abandonné, nous ne le comptons donc plus comme une option vivante. TrueFoundry, traité plus haut, suit une autre voie : le déploiement auto-hébergé d'un plan de contrôle propriétaire plutôt qu'une base de code ouverte.

Restent Bifrost et Portkey, les deux options open-source les plus recherchées, et elles se sont éloignées l'une de l'autre depuis notre dernière revue. Voici comment elles se comparent réellement :

CritèreBifrostPortkey
Adossé àMaxim AI (indépendant)Palo Alto Networks (racheté en mai 2026)
Licence du gateway centralApache 2.0, entièrement open-sourceApache 2.0 (gateway seul ; la plateforme est propriétaire)
LangageGoTypeScript/Node.js
Surcharge de latence P95~11µs~12ms
Étoiles GitHub~6,6K~12K
Guardrails de sécurité du contenu (PII, détection de jailbreak)Offre Enterprise uniquementInclus dans le gateway OSS gratuit
Gouvernance MCP / outils d'agentsMCP Gateway avec Code Mode, inclus dans l'OSSPas une fonctionnalité mise en avant
SSO / RBACOffre Enterprise uniquementÀ partir de l'offre Production (49 $/mois)
Indépendance de la feuille de routeÉditeur indépendantDésormais intégré à Prisma AIRS

Si vous cherchez une « alternative à Bifrost » parce que vous voulez des guardrails de production sans payer Bifrost Enterprise, le gateway open-source gratuit de Portkey livre la rédaction PII et la détection de jailbreak d'emblée, c'est le principal écart fonctionnel entre les deux. LiteLLM est l'autre point de chute habituel : il troque la vitesse brute de Bifrost contre la liste de fournisseurs la plus large et la plus grande communauté.

Si vous cherchez des « alternatives à Portkey » parce que le rachat par Palo Alto Networks change votre calcul du risque (une préoccupation tout à fait légitime si vous avez besoin que la feuille de route de votre infrastructure reste indépendante des priorités d'un éditeur de cybersécurité), vos meilleures options sont, dans l'ordre : Bifrost, si le débit brut et la gouvernance MCP comptent plus que des guardrails prêts à l'emploi ; LiteLLM, si vous voulez le plus grand écosystème et que le profil de latence de Python ne vous dérange pas ; et TrueFoundry (traité plus haut), si vous avez spécifiquement besoin de conformité SOC 2/HIPAA/RGPD avec un éditeur qui n'est pas Portkey. Helicone est open-source également, mais son statut de mode maintenance en fait un meilleur choix d'observabilité que de gateway que vous attendez voir évoluer.

Ni Bifrost ni Portkey n'est objectivement « meilleur », tout dépend de si vous voulez des guardrails dès aujourd'hui ou de la gouvernance et de la vitesse au prix d'un peu plus de configuration.

Comment choisir le bon LLM Gateway

Oubliez les matrices de fonctionnalités. Voici la décision en un tableau :

Si vous avez besoin de...ChoisissezPourquoi
Flexibilité maximale + auto-hébergéLiteLLM100+ fournisseurs, plus grande communauté, le plus d'intégrations
Routage à l'échelle enterprise + contrôle des dépensesMerge GatewayPolitiques de routage par client ou fonctionnalité, plafonds de dépenses, attribution des coûts au niveau de la requête
Gouvernance enterprise + souveraineté des donnéesTrueFoundryS'exécute dans votre VPC, SOC 2/HIPAA/RGPD, MCP Gateway pour les outils des agents
Accès multi-modèle rapide, sans opsOpenRouterInscrivez-vous et appelez 300+ modèles
Guardrails de production + conformitéPortkeyRédaction PII, détection de jailbreak, pistes d'audit (désormais intégré à Prisma AIRS de Palo Alto Networks)
Observabilité en prioritéHeliconeMeilleure surveillance, performance Rust, configuration en une ligne (mode maintenance depuis mars 2026)
Latence la plus faible possible + gouvernance MCP en open sourceBifrost11µs de surcharge en Go, mode cluster, MCP Gateway inclus dans l'offre gratuite
Déjà sur CloudflareCloudflare AI GWGratuit, caching en bordure, zéro nouvelle infrastructure
Déjà sur KongKong AI GWAjouter le routage LLM à la gestion d'API existante
Optimisation de routage pilotée par MLTensorZeroAbandonné en juin 2026, le code est forkable mais ce n'est plus un choix sûr pour de nouveaux projets

Une note sur l'auto-hébergé vs managé : Les gateways auto-hébergés (LiteLLM, Helicone, Bifrost) vous donnent un contrôle total sur le flux de données, rien ne quitte votre infrastructure sauf l'appel API LLM réel. Cela compte pour la santé, la finance et tout contexte où la résidence des données est une exigence stricte. Les gateways managés (OpenRouter, Cloudflare et Merge Gateway) échangent ce contrôle contre zéro charge opérationnelle. Portkey et Kong se situent entre les deux, gateways open-source avec des plateformes managées optionnelles. Les équipes qui privilégient la souveraineté des données combinent parfois un gateway auto-hébergé avec des LLM exécutés localement pour qu'aucune requête ne quitte jamais leur réseau.

Pour la plupart des équipes, la décision se résume à deux questions :

  1. Voulez-vous vous auto-héberger ? Oui -> LiteLLM. Non -> OpenRouter pour le prototypage, Merge Gateway une fois en production.
  2. Avez-vous besoin de guardrails ? Oui -> Portkey. Non -> restez avec no. 1.

Si vous développez des applications RAG qui appellent plusieurs fournisseurs pour les embeddings et les complétions, un gateway est pratiquement requis. Il en va de même pour les apps qui ont besoin de sorties structurées entre différents fournisseurs, les gateways normalisent le format de réponse pour que votre logique d'analyse ne se casse pas quand vous changez de modèles.

Choisir un outil, c'est la partie facile. Le faire tourner de manière fiable dans un vrai produit, c'est là que la plupart des équipes bloquent, et c'est exactement ce que notre équipe d'intégration IA construit pour ses clients, des pipelines RAG aux agents sur mesure. Besoin d'un second avis sur votre stack ? Demandez une consultation gratuite.

Questions fréquemment posées

Quelle est la différence entre un LLM gateway, un proxy et un router ?

Un proxy transmet les requêtes et ajoute la journalisation. Un router choisit le meilleur modèle/fournisseur pour chaque requête. Un gateway combine les deux avec le suivi des coûts, le caching, les guardrails et l'observabilité. En pratique, la plupart des outils « gateway » font les trois, les termes sont utilisés de façon interchangeable.

LiteLLM est-il vraiment gratuit ?

Le proxy open-source est complètement gratuit (licence MIT). Vous payez pour votre propre hébergement (un VPS à 5 $/mois convient pour une utilisation légère) et les coûts d'API des fournisseurs LLM. BerriAI propose des plans enterprise pour les équipes qui souhaitent un hébergement managé, SSO et du support.

OpenRouter ajoute-t-il une latence significative ?

Minimale. OpenRouter ajoute une petite surcharge de routage (généralement <50ms) plus toute distance géographique entre vous et leurs serveurs. Pour la plupart des applications, la différence est négligeable. Pour les systèmes à latence critique traitant des milliers de requêtes par seconde, une option auto-hébergée comme Bifrost est meilleure.

Puis-je utiliser plusieurs gateways ensemble ?

Oui, et certaines équipes le font. Un pattern courant est d'utiliser OpenRouter pour le prototypage rapide et de passer à LiteLLM pour la production. Ou d'utiliser Helicone comme couche d'observabilité devant le routage de LiteLLM. Soyez simplement attentif à l'empilement de latence.

Quel gateway a le meilleur caching ?

Portkey et Cloudflare AI Gateway ont les implémentations de caching les plus matures. Portkey offre un caching sémantique (correspondance floue de prompts similaires), tandis que Cloudflare exploite son réseau edge mondial pour le caching géographique. LiteLLM prend en charge le caching basé sur Redis. Pour un regard plus approfondi sur les stratégies de caching, consultez notre guide sur le caching des prompts LLM.

Ai-je besoin d'un gateway si je n'utilise qu'un seul fournisseur LLM ?

Probablement pas pour le routage. Mais vous pourriez quand même en vouloir un pour l'observabilité (Helicone), le suivi des coûts (LiteLLM) ou les guardrails (Portkey). Le suivi des coûts et les fonctionnalités de journalisation seuls peuvent justifier un gateway même avec un seul fournisseur.

Comment les gateways gèrent-ils les réponses en streaming ?

Tous les gateways de cette liste prennent en charge le streaming server-sent events (SSE). Le gateway proxifie le flux du fournisseur vers votre client avec un tampon minimal. L'impact de latence sur le streaming est généralement plus faible que sur les requêtes sans streaming puisque la surcharge est par connexion, pas par token.

Que se passe-t-il quand un fournisseur tombe en panne ?

La plupart des gateways prennent en charge les chaînes de fallback. Vous configurez un fournisseur principal et un ou plusieurs fallbacks. Si le principal renvoie des erreurs ou dépasse les seuils de latence, le gateway achemine automatiquement vers le fournisseur suivant. LiteLLM, Portkey et Helicone gèrent tous bien cela. OpenRouter le fait automatiquement en coulisses.

Les gateways peuvent-ils appliquer des limites de coût ?

Oui. LiteLLM a des contrôles de budget intégrés par équipe, utilisateur ou clé API. Portkey suit les dépenses en temps réel avec des alertes. Kong prend en charge les quotas basés sur les tokens. Cloudflare fournit des analyses d'utilisation. C'est d'ailleurs l'un des arguments les plus forts pour utiliser un gateway, sans l'un d'eux, une seule boucle incontrôlée peut brûler votre budget API en une nuit.

Quel gateway est le meilleur pour les startups vs les entreprises ?

Startups : OpenRouter (zéro configuration) ou LiteLLM (gratuit, flexible). Entreprises : TrueFoundry (souveraineté des données, SOC 2/HIPAA/RGPD, gouverne le trafic des modèles et des outils d'agents via son MCP Gateway), Portkey (guardrails, conformité, pistes d'audit) ou Kong AI Gateway (si Kong est déjà utilisé). Les principaux différenciateurs enterprise sont le SSO, le contrôle d'accès basé sur les rôles, les contrôles de résidence des données et la journalisation d'audit, des fonctionnalités dont les startups n'ont pas encore besoin mais que les entreprises ne peuvent pas ignorer.

Quel est le meilleur proxy LLM ?

LiteLLM est le meilleur proxy LLM pour la plupart des équipes. Il fonctionne comme un conteneur Docker autonome, enveloppe 100+ fournisseurs derrière un endpoint compatible OpenAI, et est entièrement gratuit à auto-héberger. Si « proxy » signifie que vous voulez zéro infrastructure, OpenRouter fonctionne comme un proxy hébergé dans le cloud avec 300+ modèles sur une seule clé API. La distinction est le contrôle : LiteLLM garde vos données sur vos serveurs ; OpenRouter les achemine via leur plateforme.

Quelle est la différence entre un LLM gateway et un LLM router ?

Un LLM router sélectionne quel modèle ou fournisseur traite une requête donnée, généralement en fonction du coût, de la latence ou du contenu du prompt. Un LLM gateway fait cela et plus encore : il ajoute le suivi des coûts, le caching, les guardrails, le rate limiting et l'observabilité par-dessus la couche de routage. Tous les outils de cette liste sont techniquement des gateways. Les purs routers (outils qui ne font que la sélection de modèle sans autre middleware) sont rares en production car les équipes ont presque toujours besoin d'au moins de la journalisation en plus du routage.

Portkey vs. Bifrost : lequel choisir en 2026 ?

Choisissez Bifrost si la latence brute et la gouvernance des outils d'agents via MCP comptent le plus : son architecture Go ajoute 11 microsecondes de surcharge contre ~12ms pour Portkey, et l'offre OSS gratuite de Bifrost livre désormais un MCP Gateway avec Code Mode. Choisissez Portkey si vous avez besoin de guardrails de sécurité du contenu (rédaction PII, détection de jailbreak) opérationnels d'emblée sans payer une offre Enterprise, puisque Bifrost les réserve à son plan payant. L'autre facteur : Portkey a été racheté par Palo Alto Networks en mai 2026 et s'inscrit maintenant dans sa plateforme de sécurité Prisma AIRS, tandis que Bifrost reste un projet open-source indépendant porté par Maxim AI. Aucun n'est strictement meilleur, c'est vitesse et indépendance contre guardrails et adossement.

Quelles sont les meilleures alternatives à Portkey maintenant que Palo Alto Networks en est propriétaire ?

Les alternatives indépendantes les plus solides sont Bifrost (le plus rapide, désormais doté de son propre MCP Gateway, même si les guardrails exigent l'offre Enterprise), LiteLLM (la couverture de fournisseurs la plus large et la plus grande communauté, si vous n'avez pas besoin de guardrails intégrés) et TrueFoundry (gouvernance enterprise et certifications de conformité comparables, éditeur toujours indépendant). Helicone est open-source lui aussi, mais il est en mode maintenance depuis son rachat par Mintlify en mars 2026, c'est donc un meilleur choix d'observabilité qu'un remplaçant de gateway tourné vers l'avenir.

Tags

llm-gatewayllm-proxyllm-routerlitellmopenroutermerge-gatewayai-infrastructure

Partager cet article

Démarrez Votre Projet

Prêt à construire quelque chose d'extraordinaire ?

Transformons votre vision en réalité. Notre équipe est prête à vous aider à créer un logiciel qui fait la différence.