
De 10 beste LLM Gateway-tools, gerangschikt: Elk model via één API [2026]
Laatst bijgewerkt: 19 juli 2026. We hebben de prijzen en GitHub-sterrenaantallen van alle 9 gateways opnieuw geverifieerd en twee eigendomswijzigingen toegevoegd die ertoe doen als u vandaag een gateway kiest: Palo Alto Networks rondde op 29 mei 2026 de overname van Portkey af en schoof het in het Prisma AIRS-beveiligingsplatform, en Mintlify nam Helicone in maart 2026 over, waarmee het cloudproduct in onderhoudsmodus belandde. We ontdekten ook dat de beheerders van TensorZero het project in juni 2026 hebben gearchiveerd, dus dat vermelden we hieronder in plaats van te doen alsof het nog een actieve keuze is. Bifrost groeide sinds onze vorige controle van ruwweg 2.000 naar 6.600 GitHub-sterren en bracht een eigen MCP Gateway uit, waarmee het governance-gat met Portkey en TrueFoundry grotendeels gedicht is, dus hebben we een directe vergelijking toegevoegd.
De beste LLM-gateway in 2026 is LiteLLM voor self-hosted teams en Merge Gateway voor beheerd productieverkeer. LiteLLM ondersteunt 100+ providers achter één OpenAI-compatibele API, verwerkt fallbacks en budgetcontroles, en draait gratis op elke VPS. Merge Gateway is de beheerde keuze zodra LLM-kosten een margevraagstuk worden: routingbeleid per klant of feature, budgetgrenzen, geconsolideerde facturering en kostentoewijzing op requestniveau. Wilt u gewoon de breedste modelcatalogus zonder configuratie, dan biedt OpenRouter nog steeds directe toegang tot 300+ modellen en is de betere plek om te prototypen. Voor gereguleerde ondernemingen die gegevenssouvereiniteit én governance over zowel model- als agent-traffic nodig hebben, draait TrueFoundry volledig in uw eigen VPC. Voor productie-guardrails (PII-redactie, jailbreak-detectie) is Portkey de keuze. Voor ruwe doorvoer boven 5.000 RPS voegt Bifrosts Go-architectuur slechts 11 microseconden overhead toe.
U roept OpenAI aan voor uw chatbot, Anthropic voor uw coderingsassistent en Gemini voor uw samenvattingspipeline. Drie API-sleutels, drie SDK's, drie factureringsdashboards, drie sets foutafhandeling. Voeg nu fallback-logica toe wanneer een aanbieder uitvalt. Dat is de chaos die LLM-gateways oplossen, één uniforme API die naar elk model doorverwijst, kosten bijhoudt en storingen automatisch afhandelt.
We hebben alle grote LLM-gateways getest en gerangschikt op wat er echt toe doet: latentieoverhead, aanbiedersdekking, installatiegemak en of ze uw volgende verkeerspiek zullen overleven.
| Rang | Tool | Beste voor | Type | Startprijs |
|---|---|---|---|---|
| no. 1 | LiteLLM | Maximale flexibiliteit | Self-hosted (open-source) | Gratis |
| no. 2 | Merge Gateway | Routing en uitgavenbeheer op enterprise-schaal | Beheerde SaaS | Pay-per-token (gratis niveau) |
| no. 3 | TrueFoundry | Enterprise governance + MCP | Self-hosted + beheerd | Gratis niveau ($499/maand Pro) |
| no. 4 | OpenRouter | Multi-modeltoegang zonder configuratie | Beheerde SaaS | Pay-per-token |
| no. 5 | Portkey | Productie-guardrails | Hybride (open-source + beheerd) | Gratis tier |
| no. 6 | Helicone | Observability-gerichte teams | Self-hosted (open-source) | Gratis |
| no. 7 | Bifrost | Ruwe doorvoer | Self-hosted (open-source) | Gratis |
| no. 8 | Cloudflare AI Gateway | Routing zonder infrastructuur | Beheerd | Gratis tier |
| no. 9 | Kong AI Gateway | API-beheerteams | Self-hosted + enterprise | Gratis community |
| no. 10 | TensorZero | ML-geoptimaliseerde routing (gearchiveerd juni 2026) | Self-hosted (open-source, niet onderhouden) | Gratis |
Wat is een LLM Gateway? (En heeft u er écht een nodig?)
Voor de ranglijsten een korte onderscheiding. Mensen gebruiken "gateway", "proxy" en "router" door elkaar, maar ze vervullen iets andere rollen:
- LLM-proxy: Stuurt verzoeken door naar aanbieders en voegt logging toe. Minimale logica.
- LLM-router: Kiest het beste model of de beste aanbieder voor elk verzoek op basis van kosten, latentie of inhoud.
- LLM-gateway: Het volledige pakket, proxy + router + kostenbeheer + caching + guardrails + observability.
De meeste tools op deze lijst zijn volledige gateways, maar sommige neigen meer naar proxy- of routerterritorium.
U heeft een gateway nodig als:
- U 2+ LLM-aanbieders aanroept en één API voor alle wilt
- U kosten over aanbieders heen moet bijhouden (wie verbrandt uw budget?)
- U automatische failover wilt wanneer een aanbieder uitvalt
- U functies bouwt die profiteren van promptcaching over aanbieders heen
Als u slechts één aanbieder gebruikt en geen plannen heeft om te wisselen, voegt een gateway onnodige complexiteit toe. Sla het over.
Het typische adoptietraject: De meeste teams beginnen met het hard coderen van OpenAI-aanroepen. Dan voegen ze Anthropic toe voor een tweede use case en schrijven een wrapperfunctie. Dan hebben ze fallback-logica, kostenbeheer en rate limiting nodig, en plotseling hebben ze zelf een half-afgewerkte gateway gebouwd. De onderstaande tools vervangen die zelfgemaakte rommel door iets beproefd.
1. LiteLLM, Beste algehele keuze
GitHub-sterren: ~54K | Taal: Python | Licentie: MIT
LiteLLM is het Zwitserse zakmes van LLM-gateways. Het omwikkelt 100+ LLM-aanbieders achter één OpenAI-compatibele API, wat betekent dat uw bestaande OpenAI SDK-code zonder wijzigingen werkt. Wissel gewoon de basis-URL uit.
De proxyservercomponent is wat LiteLLM een gateway maakt in plaats van alleen een SDK. U implementeert het als een zelfstandige service, configureert uw modellen in een YAML-bestand, en elk team raakt hetzelfde endpoint met ingebouwde kostenbeheer, rate limiting en load balancing.
# config.yaml voor LiteLLM proxy
model_list:
- model_name: gpt-4
litellm_params:
model: openai/gpt-4o
api_key: sk-...
- model_name: gpt-4
litellm_params:
model: anthropic/claude-sonnet-4-20250514
api_key: sk-ant-...
# LiteLLM balanceert automatisch de belasting tussen deze
general_settings:
master_key: sk-my-master-key
database_url: postgresql://...# Uw app-code verandert niet -- wijs gewoon naar de proxy
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:4000", # LiteLLM proxy
api_key="sk-my-master-key"
)
response = client.chat.completions.create(
model="gpt-4", # Routes naar OpenAI of Anthropic via config
messages=[{"role": "user", "content": "Leg LLM-gateways uit"}]
)Wat goed is:
- 100+ aanbieders ondersteund (breedste dekking van alle gateways)
- OpenAI-compatibele API, geen codewijzigingen voor bestaande apps
- Ingebouwde kostenbeheer, budgetten per team/gebruiker
- Fallback-ketens: als OpenAI uitvalt, probeer Anthropic, dan Gemini
- Integreert met elk groot observability-tool (Langfuse, Helicone, enz.)
Wat minder goed is:
- Python's GIL beperkt de doorvoer per proces (P95-latentie ~8ms bij 1.000 RPS)
- De proxy heeft zijn eigen PostgreSQL-database nodig voor teambeheerfuncties
- Configuratie kan complex worden met veel modellen en routingregels
- Supply-chain-aanval op 24 maart 2026: twee PyPI-releases (1.82.7, 1.82.8) kregen een achterdeur nadat aanvallers via een gecompromitteerde CI-action publicatiegegevens hadden buitgemaakt. PyPI zette beide binnen ongeveer 40 minuten in quarantaine, maar pin uw versie en controleer
pip show litellmals u die dag hebt uitgerold. Volledig verslag in het incidentrapport van LiteLLM
Prijzen: Gratis en open-source. Enterprise-plannen beschikbaar voor beheerde hosting.
Als u onze gids over Claude Code gebruiken met verschillende modellen heeft gelezen, heeft u LiteLLM al in actie gezien, het is een van de belangrijkste manieren waarop ontwikkelaars Claude Code via alternatieve aanbieders routeren. Onze LiteLLM proxy-installatiegids begeleidt u door de volledige Docker-implementatie met PostgreSQL in minder dan 20 minuten.
Oordeel: LiteLLM is de beste algehele LLM-gateway voor teams die maximale flexibiliteit willen en self-hosting niet erg vinden. Het heeft de breedste aanbiedersdekking, het meest volwassen ecosysteem en de grootste community. Begin hier tenzij u een specifieke reden heeft om dat niet te doen.
2. Merge Gateway, Beste voor routing en uitgavenbeheer op enterprise-schaal
Providers: OpenAI, Anthropic, Google, AWS Bedrock, Mistral, Cohere, Grok | Type: Beheerde SaaS | Start: 31 maart 2026
Merge Gateway is gebouwd voor het punt waarop LLM-gebruik ophoudt een kostenpost te zijn en een margeprobleem wordt. Waar OpenRouter optimaliseert voor breedte van modeltoegang, optimaliseert Merge voor controle over verkeer dat u al in productie draait: routing op kosten, latentie, kwaliteit, klant, feature of regio, budgetten die afgaan vóórdat de factuur dat doet, en logs op requestniveau die laten zien welk model een aanroep bediende en waarom die daarheen werd gerouteerd.
Dat laatste is het echte onderscheid. De meeste gateways vertellen u wat u heeft uitgegeven. Merge is gebouwd om u te vertellen aan wie u het uitgaf, en dat is de vraag die opkomt zodra het gebruik van één enkele enterprise-klant de brutomarge van een product begint op te eten.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_API_KEY",
base_url="https://api-gateway.merge.dev/v1/openai",
)
response = client.chat.completions.create(
model="gpt-4o",
messages=[{"role": "user", "content": "Summarize this support ticket"}],
)Wat goed is:
- Routingbeleid per klant, feature, regio, use case, kosten, latentie of kwaliteit
- Automatische fallback houdt AI-functies operationeel tijdens providerstoringen, rate limits en degradaties
- Observability op requestniveau: model, provider, kosten, latentie en de routingreden achter elke aanroep
- Kostenbeheer met budgetten, uitgavenlimieten en alerts per project, team, klantsegment of feature
- Semantisch caching en contextcompressie als volwaardige kostenhefbomen, niet als extra's
Wat minder goed is:
- Niet open-source, dus valt af als self-hosting een harde vereiste is (Enterprise biedt VPC/on-prem, maar dat is een verkoopgesprek)
- Bewust productiegericht, waardoor het zwaarder is dan nodig voor prototypes en apps met weinig volume
- Gelanceerd in maart 2026, dus community, integraties en tutorials van derden zijn dun vergeleken met LiteLLM of OpenRouter
Prijzen: Gratis niveau met $10/maand aan credits, geen creditcard nodig. Pro is LLM-kosten + 5% zonder uitgavenlimiet en met bring-your-own-key. Enterprise wordt op maat geoffreerd en voegt VPC- of on-prem-implementatie, een dedicated accountmanager en uptime-SLA's toe. Credits worden op de 1e uitgegeven en vervallen aan het einde van de maand.
Het is de moeite waard om te wijzen op het tarief: Merges 5% ligt net onder OpenRouters 5,5%. Bij prototype-volume is dat verschil ruis. Bij zes cijfers aan jaarlijkse inferentiekosten is het echt geld, en dat is het soort ding dat u het beste doorrekent voordat u zich aan een van beide committeert.
Oordeel: Merge Gateway is de keuze wanneer uw LLM-verkeer een betrouwbaarheids- en margeprobleem is geworden in plaats van een integratieprobleem. Als u moet kunnen beantwoorden welke klant de kosten drijft of welk feature verlieslatend is, en u fallback-beleid wilt dat features draaiende houdt tijdens een providerincident, is het hier de sterkste beheerde optie. Bent u nog aan het bepalen welke modellen u wilt gebruiken, dan bedient OpenRouters catalogus u beter, en kunt u later overstappen.
3. TrueFoundry, Beste voor enterprise governance
Modellen: 1.600+ | Providers: 250+ | Type: Self-hosted + beheerd | Implementatie: VPC, on-prem, air-gapped
TrueFoundrys AI Gateway is gebouwd voor het geval dat open-source gateways moeite mee hebben: een gereguleerde onderneming die één control plane nodig heeft voor elk model, volledige gegevenssouvereiniteit, en audittrails die een compliance-review doorstaan. Het draait in uw eigen VPC, on-prem of volledig air-gapped, zodat geen verzoekdata uw domein verlaat, en het wordt geleverd met SOC 2-, HIPAA- en GDPR-compliance, SSO en RBAC standaard ingebouwd.
De dekking behoort tot de breedste op deze lijst: 1.600+ modellen via 250+ providers (OpenAI, Anthropic, Gemini, Groq, Mistral), plus self-hosted backends zoals vLLM, SGLang en Triton. TrueFoundry rapporteert sub-3ms interne latentie bij enterprise-belasting en 99,99% uptime over 10 miljard+ verzoeken per maand, zodat de governance-laag u geen doorvoer kost.
from openai import OpenAI
client = OpenAI(
base_url="https://<uw-org>.truefoundry.com/api/llm", # uw gateway
api_key="tfy-..."
)
response = client.chat.completions.create(
model="openai/gpt-4o", # centraal gerouteerd, gelogd en beperkt
messages=[{"role": "user", "content": "Vat dit contract samen"}]
)Wat TrueFoundry onderscheidt van Portkey of LiteLLM is de MCP Gateway: een centraal register dat beheert hoe AI-agents bedrijfstools bereiken (Slack, GitHub, Confluence, Datadog) via het Model Context Protocol. U registreert interne API's als MCP-servers, beveiligt ze achter Okta of Azure AD met per-server RBAC, en krijgt tracing op verzoeksniveau voor elke tool-aanroep. Dat geeft u één beheerd control plane voor modeltraffic én agent-tooltraffic, wat van belang is zodra agents acties ondernemen in plaats van alleen tekst genereren.
Anders dan de meeste enterprise-gateways publiceert TrueFoundry zijn prijzen openlijk. Een gratis Developer-niveau dekt 50.000 verzoeken per maand, 3 gebruikers en de MCP Gateway voor maximaal 5 servers, genoeg om de volledige stack te prototypen voordat u met iemand praat. Het Pro-niveau kost $499/maand voor 1 miljoen verzoeken, 10 gebruikers, semantische caching, virtuele modellen en geavanceerde routing, waarbij extra gebruik tegen transparante tarieven per eenheid wordt gefactureerd. Pro Plus kost $2.999/maand en voegt aangepaste metadata, alerting en monitoring-exports toe voor 25 gebruikers. Enterprise wordt op maat geoffreerd voor 10M+ verzoeken, met volledige VPC-, multi-region- en air-gapped-installaties van zowel het control plane als het gateway plane. Elk betaald plan bevat een proefperiode van 7 dagen. De beheerde SaaS heeft geen hostingkosten; als u de gateway in uw eigen cloud host (BYOC), reken dan op ongeveer $600 tot $1.000 per maand voor de onderliggende infrastructuur.
Wat goed is:
- 1.600+ modellen, 250+ providers, plus self-hosted backends (vLLM, SGLang, Triton)
- Draait in uw VPC, on-prem of air-gapped; geen data verlaat uw domein
- SOC 2, HIPAA, GDPR-compliance, SSO, RBAC en auditlogging standaard ingebouwd
- Guardrails: PII-filtering, toxiciteitsdetectie, prompt-injection scanning
- MCP Gateway beheert agent-toegang tot tools, niet alleen modelaanroepen
- Publieke, transparante prijzen met een echt gratis Developer-niveau (50K verzoeken/maand)
- TrueFoundry rapporteert gemiddeld ~30% kostenverlaging via routing, caching en budgetten
Wat minder goed is:
- Enterprise-first: zwaarder dan LiteLLM of OpenRouter voor een klein project
- Kernplatform is propriëtair (hun open-source-repos zijn aparte infra-tooling)
- Het zelf hosten van de gateway voegt ongeveer $600 tot $1.000/maand aan infrastructuur toe bovenop uw plan
- Meest waardevol wanneer u veel teams en tools te beheren heeft, niet op dag één
Prijzen: Gratis Developer-niveau ($0/maand, 50K verzoeken, 3 gebruikers). Pro $499/maand (1M verzoeken, 10 gebruikers, semantische caching, geavanceerde routing). Pro Plus $2.999/maand (25 gebruikers, geavanceerde observability). Enterprise op maat (10M+ verzoeken, volledige VPC en air-gapped). Proefperiode van 7 dagen op betaalde plannen; beheerde SaaS heeft geen hostingkosten, zelf hosten voegt ~$600-$1.000/maand infrastructuur toe.
Oordeel: TrueFoundry is de gateway voor ondernemingen die één beheerd control plane nodig hebben voor zowel modeltraffic als agent-toegang tot tools, met data die binnen hun eigen infrastructuur blijft. Als u een startup bent die twee providers aansluit, is het meer dan u nodig heeft — begin dan met LiteLLM. Als u een platformteam bent dat AI uitrolt naar tientallen interne teams onder een compliancemandaat, hoort het op uw shortlist.
4. OpenRouter, Beste voor multi-modeltoegang zonder configuratie
Modellen: 300+ | Type: Beheerde SaaS | Licentie: Propriëtair
OpenRouter neemt de tegenovergestelde benadering van LiteLLM: u implementeert niets. Meld u aan, krijg een API-sleutel, en u heeft direct toegang tot 300+ modellen van alle grote aanbieders via één enkel endpoint. Het is de "app store" van LLM-API's.
De waardepropositie is eenvoud. Geen infrastructuur om te onderhouden, geen YAML-configuraties om te schrijven, geen databases om te provisioneren. U betaalt credits vooraf of koppelt een kaart, en OpenRouter regelt de geconsolideerde facturering bij alle aanbieders.
from openai import OpenAI
client = OpenAI(
base_url="https://openrouter.ai/api/v1",
api_key="sk-or-..."
)
# Toegang tot elk model van elke aanbieder -- zelfde code
response = client.chat.completions.create(
model="anthropic/claude-sonnet-4-20250514",
messages=[{"role": "user", "content": "Vergelijk LLM-gateways"}]
)Wat goed is:
- 300+ modellen, één API-sleutel, één factureringsdashboard
- 25+ gratis modellen voor prototyping (waaronder verrassend capabele)
- Geen infrastructuur te beheren, aanmelden en direct aanroepen
- Modelvergelijkingsfuncties helpen u te evalueren voordat u commit
- Regelt aanbiedersstoringen met automatische fallback-routing
Wat minder goed is:
- 5,5% platformkosten bovenop de aanbiedersprijzen, loopt op bij schaal
- Geen self-hosting optie, uw gegevens gaan door OpenRouters servers
- Beperkte observability in vergelijking met dedicated gateway-tools
- Tarieflimieten op gratis tier kunnen beperkend zijn voor productieworkloads
- Geen aangepaste routinglogica, u krijgt wat OpenRouter beslist
Prijzen: Pay-per-token (aanbiederspijs + 5,5% kosten). Geen maandelijkse minima. 25+ gratis modellen beschikbaar.
Oordeel: OpenRouter is de snelste manier om toegang te krijgen tot meerdere LLM-aanbieders. Als u wilt prototypen met verschillende modellen of een kleine tot middelgrote werklast wilt uitvoeren zonder infrastructuurbeheer, is het de voor de hand liggende keuze. Bij schaal beginnen de 5,5% kosten te tellen. Als kostenreductie de drijfveer is, bekijk onze gids voor het verlagen van LLM API-kosten voor een volledige uitsplitsing van caching-, batching- en gateway-besparingen.
5. Portkey, Beste voor productie-guardrails
GitHub-sterren: ~12K | Taal: TypeScript/Node.js | Licentie: Apache 2.0 (gateway), beheerd platform
Portkey positioneert zichzelf als het "control plane voor AI." Waar LiteLLM zich richt op routing en OpenRouter op eenvoud, is Portkeys differentiator productieveiligheid: guardrails, PII-redactie, jailbreak-detectie en auditsporen die zijn ingebouwd in de gateway-laag.
Vanaf maart 2026 heeft Portkey hun volledige gateway open-source gemaakt (Apache 2.0), zodat u de kernrouting en guardrails kunt self-hosten zonder het beheerde platform. De grotere verandering kwam op 29 mei 2026, toen Palo Alto Networks de overname van Portkey afrondde en het onderbracht in Prisma AIRS, hun beveiligingsplatform voor agentische AI. De open-source gateway verschijnt nog steeds onder Apache 2.0 en de beheerde plannen werken nog precies hetzelfde, maar Portkey is geen onafhankelijk AI-infrabedrijf meer, het is nu een onderdeel binnen de productlijn van een cybersecurityleverancier, wat telt als u de langetermijnonafhankelijkheid van de roadmap beoordeelt.
from portkey_ai import Portkey
portkey = Portkey(
api_key="pk-...",
config={
"strategy": {"mode": "fallback"},
"targets": [
{"provider": "openai", "override_params": {"model": "gpt-4o"}},
{"provider": "anthropic", "override_params": {"model": "claude-sonnet-4-20250514"}}
]
}
)
response = portkey.chat.completions.create(
messages=[{"role": "user", "content": "Vat dit document samen"}]
)Wat goed is:
- Ondersteuning voor 1.600+ modellen over aanbieders heen
- Ingebouwde guardrails: PII-detectie, jailbreak-preventie, inhoudsfiltering
- Promptbeheer en versiebeheer binnen de gateway
- Cachinglaag vermindert herhaalde aanroepen (bespaart geld en latentie)
- Auditsporen en compliance-functies voor gereguleerde sectoren
- Nu volledig open-source gateway (maart 2026)
Wat minder goed is:
- Beheerd platformprijs begint bij $49/maand voor productiefuncties
- Enterprise-tier ($5.000–$10.000/maand) voor geavanceerd bestuur
- Het platform voegt complexiteit toe die eenvoudigere gateways niet bieden
- Leercurve steiler dan LiteLLM of OpenRouter
- Nu eigendom van Palo Alto Networks (overgenomen in mei 2026), dus de roadmap volgt de prioriteiten van een beveiligingsleverancier, niet alleen die van AI-infragebruikers. Teams die daar los van willen blijven, kijken steeds vaker naar Bifrost of LiteLLM, zie de directe vergelijking verderop op deze pagina
Prijzen: De open-source gateway is gratis te self-hosten. Beheerd platform: het Developer-niveau is voor altijd gratis (10K logs/maand, 3 dagen bewaartermijn). Production kost $49/maand (100K logs/maand, 30 dagen bewaartermijn, guardrails, RBAC, semantische caching, $9 per extra 100K logs). Enterprise wordt op maat geoffreerd (10M+ logs/maand, VPC-hosting, SOC 2 Type 2, HIPAA).
Oordeel: Portkey is nog steeds de gateway voor teams die klantgerichte LLM-functies bouwen en zich geen promptinjecties, PII-lekken of ongecontroleerde kosten kunnen veroorloven, de guardrails rechtvaardigen de complexiteit. Wat wél veranderde, is wie erachter zit: sinds de overname door Palo Alto Networks past Portkey het beste bij teams die al binnen het Prisma AIRS-ecosysteem zitten (of daar geen bezwaar tegen hebben). Wilt u een even capabele open-source gateway die onafhankelijk blijft, dan is Bifrost de betere kandidaat.
6. Helicone, Beste keuze voor observability-gerichte teams
GitHub-sterren: ~6K | Taal: Rust | Licentie: Apache 2.0
Helicone begon als een observability-tool en evolueerde naar een volledige gateway. Dat oorsprongsverhaal is belangrijk, de monitoring- en analysefuncties zijn van wereldklasse, en de gateway-functies (routing, caching, failover) zijn gebouwd op een solide observability-fundament.
Geschreven in Rust geeft het een echt prestatievoordeel: P50-latentie van 8ms, P95 onder 5ms, ongeveer 3.000 RPS op een enkele instantie met slechts 64MB geheugen.
Eén ding om te weten voordat u zich eraan committeert: Mintlify nam Helicone over in maart 2026, en het team verhuisde naar San Francisco om te werken aan Mintlify's product voor documentatie en agent-context. Helicone is in zijn eigen aankondiging duidelijk over wat dat betekent: het platform blijft in de lucht en krijgt nog beveiligingspatches, bugfixes en ondersteuning voor nieuwe modellen, maar daarbovenop komt geen roadmap met nieuwe functies. Heeft u een gateway nodig die actief blijft uitbreiden, weeg dat dan mee voordat u erop standaardiseert.
# Helicone: één-regel proxy -- verander gewoon de basis-URL
from openai import OpenAI
client = OpenAI(
base_url="https://oai.helicone.ai/v1", # of uw self-hosted URL
api_key="sk-...",
default_headers={
"Helicone-Auth": "Bearer hlc-..."
}
)
# Alle verzoeken worden nu gelogd, gevolgd en gerouteerd via Helicone
response = client.chat.completions.create(
model="gpt-4o",
messages=[{"role": "user", "content": "Analyseer deze code"}]
)Wat goed is:
- Rust-gebaseerd: ~64MB geheugen, P95 <5ms latentie, 3.000 RPS per instantie
- Gezondheidsgedreven load balancing routeert naar de snelste beschikbare aanbieder
- Realtime dashboards voor kosten, latentie, tokengebruik en foutpercentages
- Één-regel integratie, verander gewoon de basis-URL
- Single binary deployment (Docker, K8s, bare metal)
Wat minder goed is:
- In onderhoudsmodus sinds de overname door Mintlify (maart 2026): alleen beveiligings- en bugfixes, geen nieuwe functies of roadmap
- Observability-functies zijn de ster; routing minder geavanceerd dan LiteLLM
- Minder ondersteunde aanbieders dan LiteLLM of OpenRouter
- Community kleiner dan LiteLLM (6K vs. 54K GitHub-sterren)
- Geavanceerde functies (aangepaste eigenschappen, sessies) vereisen het beheerde platform
Prijzen: Open-source en gratis te self-hosten. Beheerd platform: Hobby is gratis (10K verzoeken/maand, 1GB opslag, 7 dagen bewaartermijn, 1 gebruiker). Pro kost $79/maand (onbeperkt aantal gebruikers, 1 maand bewaartermijn, alerts, rapporten, HQL). Team kost $799/maand (3 maanden bewaartermijn, SOC 2, HIPAA, eigen Slack-kanaal). Enterprise is op maat (on-prem, SAML SSO, volumekortingen).
Als u observability-tools breder evalueert, behandelt onze ranglijst van beste AI-observabilityplatforms Helicone naast Langfuse, Arize en anderen.
Oordeel: Helicone is nog altijd de beste gateway voor teams waarvan het primaire probleem is "we kunnen niet zien wat er met onze LLM-aanroepen gebeurt", en het bestaande product gaat nergens heen. Begin er alleen aan met de wetenschap dat u een tool in onderhoudsmodus adopteert: prima voor observability vandaag, riskanter als u erop rekent dat er volgend jaar nieuwe gateway-functies verschijnen.
7. Bifrost, Beste ruwe prestaties
GitHub-sterren: ~6,6K | Taal: Go | Licentie: Apache 2.0
Bifrost is de prestatiekampioen. Gebouwd in Go door Maxim AI, claimt het 50x snellere prestaties dan LiteLLM met slechts 11 microseconden overhead per verzoek bij 5.000 RPS. Dat zijn geen theoretische cijfers, ze komen uit reproduceerbare aanhoudende belastingstests. Het project heeft zijn aantal GitHub-sterren sinds onze vorige controle meer dan verdrievoudigd, van ruwweg 2.000 naar 6.600, en die groei volgt een echte functie-inhaalslag: Bifrost bracht een eigen MCP Gateway uit met een "Code Mode" om te beheren hoe agents externe tools aanroepen, precies het soort functie dat voorheen alleen het terrein van TrueFoundry en Portkey was.
Het architectuurverschil is fundamenteel: Go's goroutines verwerken duizenden gelijktijdige verbindingen zonder Python's GIL-knelpunt, en de gecompileerde binaire code elimineert interpreteroverhead volledig.
# bifrost.yaml
account:
provider: openai
api_key: ${OPENAI_API_KEY}
models:
- name: gpt-4o
provider: openai
- name: claude-sonnet-4-20250514
provider: anthropic
routing:
strategy: round-robin
fallback: trueWat goed is:
- 11µs overhead bij 5.000 RPS, laagste van alle gateways op deze lijst
- Go-binaire: geen runtime-afhankelijkheden, kleine geheugenvoetafdruk
- Adaptieve load balancing over aanbieders
- Clustermodus voor horizontale schaling
- 1.000+ modellen ondersteund
- MCP Gateway met Code Mode ingebouwd in het gratis OSS-niveau, plus budgetbeheer via virtuele sleutels, semantische caching en OpenTelemetry-native observability, allemaal inbegrepen en niet achter Enterprise weggezet
Wat minder goed is:
- Nieuwer project, kleinere community dan LiteLLM (6,6K vs. 54K GitHub-sterren) en minder integraties van derden
- Guardrails voor contentveiligheid (PII-filtering, jailbreak-detectie) vereisen het Enterprise-niveau; Portkey levert vergelijkbare guardrails in zijn gratis OSS-gateway
- Gebouwd door Maxim AI (een leverancier), toekomstige richting gebonden aan hun roadmap
- Documentatie dunner dan LiteLLM's uitgebreide docs
- SSO (SAML/OIDC) en RBAC zijn alleen voor Enterprise, dus kleine teams krijgen wel de prestaties maar niet de toegangscontroles
Prijzen: De OSS-gateway is voor altijd gratis (Apache 2.0) en dekt routing, failover, MCP Gateway, semantische caching en budgetbeheer via virtuele sleutels. Enterprise wordt op maat geoffreerd (demo aanvragen) en voegt guardrails, clustermodus, SAML/OIDC SSO, RBAC, auditlogs en ondersteuning met SLA toe; er is een gratis proefperiode van 14 dagen.
Oordeel: Bifrost is voor teams die productiesystemen met hoge doorvoer draaien waarbij gateway-overhead ertoe doet, en het is uitgegroeid tot een van de sterkere Portkey-alternatieven nu het gratis niveau MCP-governance en budgetcontroles bevat die elders een betaald platform vergden. Als u duizenden LLM-aanroepen per seconde verwerkt en op open-source infrastructuur wilt blijven zonder een overname die boven de roadmap hangt, levert Bifrosts Go-architectuur. Voor de meeste teams is LiteLLM's 8ms overhead prima, en heeft u vandaag ingebouwde guardrails voor contentveiligheid nodig in plaats van op het Enterprise-niveau, dan houdt Portkeys OSS-gateway de voorsprong, precies die afweging is het hele verhaal in de vergelijking hieronder.
8. Cloudflare AI Gateway, Beste nul-infrastructuur optie
Type: Beheerde service | Licentie: Propriëtair (Cloudflare)
Cloudflare AI Gateway drijft de "u beheert niets"-aanpak tot het uiterste. Als u al op Cloudflare zit (en veel teams zijn dat), kunt u AI Gateway inschakelen vanuit het dashboard en LLM-aanroepen routeren via het edge-netwerk van Cloudflare zonder extra infrastructuur.
// Zet gewoon uw aanbieder-URL vooraf met Cloudflares gateway-endpoint
const response = await fetch(
"https://gateway.ai.cloudflare.com/v1/{account_id}/{gateway_name}/openai/chat/completions",
{
method: "POST",
headers: {
"Authorization": "Bearer sk-...",
"Content-Type": "application/json"
},
body: JSON.stringify({
model: "gpt-4o",
messages: [{ role: "user", content: "Hallo" }]
})
}
);Wat goed is:
- Gratis tier met 100.000 logs/maand, genoeg voor de meeste nevenprojecten
- Geen infrastructuur: inschakelen vanuit Cloudflare-dashboard
- Ingebouwde caching op de edge (vermindert kosten en latentie)
- Rate limiting en analytics inbegrepen
- Uniforme facturering: LLM-aanbiederskosten via Cloudflare betalen
- Globaal edge-netwerk vermindert latentie voor geografisch verspreide gebruikers
Wat minder goed is:
- Strak gekoppeld aan het Cloudflare-ecosysteem, overstapkosten zijn reëel
- Beperkte routing-intelligentie in vergelijking met dedicated gateways
- 100.000 logboeklimiet op gratis tier; Workers Paid-abonnement voor 1 miljoen
- Minder ondersteunde aanbieders dan LiteLLM of OpenRouter
- Geen self-hosting optie
Prijzen: Gratis (100.000 logs/maand), Workers Paid-abonnement voor 1 miljoen logs. Geen gateway-kosten per verzoek. U betaalt LLM-aanbieders nog steeds apart.
Voor teams die functieaanroepen over aanbieders routeren, kan Cloudflares edge-caching de latentie voor herhaalde tool-gebruikspatronen zinvol verminderen.
Oordeel: Cloudflare AI Gateway is de beste optie als u al op Cloudflare zit en gateway-functies wilt zonder iets nieuws te implementeren. De gratis tier is genereus voor kleine projecten. Voor serieus productiegebruik bieden dedicated gateways meer controle.
9. Kong AI Gateway, Beste keuze voor API-beheerteams
GitHub-sterren: ~44K (Kong Gateway totaal) | Taal: Lua/OpenResty | Licentie: Apache 2.0 (community)
Kong AI Gateway is geen zelfstandig product, het is een uitbreiding van Kong's beproefde API Gateway die LLM-specifieke mogelijkheden toevoegt. Als uw organisatie al Kong gebruikt voor API-beheer, is het toevoegen van AI-routing een plug-in installatie, geen nieuw platform.
# Kong declaratieve config (deck)
services:
- name: ai-llm-service
url: https://api.openai.com
plugins:
- name: ai-proxy
config:
route_type: llm/v1/chat
model:
provider: openai
name: gpt-4o
- name: ai-rate-limiting-advanced
config:
limit: [10000]
window_size: [60]
window_type: fixed
strategy: local
limit_by: consumerWat goed is:
- Bouwt voort op Kong's volwassen API-beheerplatform (gebruikt door duizenden ondernemingen)
- Semantische routing: routeert verzoeken op basis van promptinhoud/-intentie
- Token-gebaseerde rate limiting (niet alleen verzoekgebaseerd)
- Plug-in ecosysteem: auth, rate limiting, transformaties werken allemaal met AI-routes
- OpenTelemetry + Prometheus-metrics voor Datadog/Grafana-integratie
Wat minder goed is:
- Overkill als u Kong niet al gebruikt, steile leercurve
- Enterprise AI-functies vereisen Kong Enterprise-licentie (betaald)
- Configuratiecomplexiteit hoger dan elke andere gateway op deze lijst
- Vereist Kong-infrastructuurkennis (of het team moet dit leren)
- AI-specifieke functies zijn nieuwer en minder volwassen dan Kong's kern
Prijzen: Community-editie gratis (open-source). Enterprise AI-functies vereisen een Kong Enterprise-abonnement (aangepaste prijzen).
Oordeel: Kong AI Gateway heeft alleen zin als uw organisatie al Kong gebruikt. LLM-routing toevoegen aan uw bestaande API-beheerlaag is slimmer dan een aparte gateway implementeren. Maar adopteer Kong niet alleen voor LLM-routing, dat is als een tractor kopen om uw gazon te maaien.
10. TensorZero, Beste ML-geoptimaliseerde routing (nu stopgezet)
GitHub-sterren: ~11,7K | Taal: Rust | Licentie: Apache 2.0 (gearchiveerd, niet onderhouden)
Update: TensorZero is in juni 2026 gestopt. De beheerders hebben de repository op 12 juni 2026 gearchiveerd, de actieve ontwikkeling stopgezet en het resterende durfkapitaal aan investeerders teruggegeven, nadat ze concludeerden dat ze geen product-market fit vonden voor zowel een open-source project als een commercieel product. We laten dit onderdeel staan omdat de ideeën nog steeds de moeite van het begrijpen waard zijn en de code onder Apache 2.0 nog te forken is, maar adopteer het niet voor een nieuw productiesysteem: er komen geen beveiligingspatches, geen updates voor provider-API's en geen ondersteuning als er iets breekt.
TensorZero was de meest eigenzinnige gateway op deze lijst. Terwijl anderen zich richten op routing en observability, bouwde TensorZero een optimalisatielus: het verzamelde inferentiedata, voerde evaluaties uit en gebruikte de resultaten om routingbeslissingen in de loop van de tijd te verbeteren. Beschouw het als een gateway die leert welk model het beste werkt voor welk type verzoek.
De Rust-implementatie levert sub-milliseconde P99-latentie, zelfs bij meer dan 10.000 QPS. Dat is geen typefout. Waar LiteLLM ~8ms en Bifrost ~11µs toevoegen, claimt TensorZero <1ms P99 onder extreme belasting.
# TensorZero: gestructureerde inferentie met optimalisatie
from tensorzero import TensorZeroGateway
with TensorZeroGateway("http://localhost:3000") as client:
response = client.inference(
function_name="generate_summary",
input={
"messages": [
{"role": "user", "content": "Vat dit artikel samen..."}
]
}
)
# Later: kwaliteitsdata terugsturen om routing te verbeteren
client.feedback(
metric_name="summary_quality",
inference_id=response.inference_id,
value=0.92
)Wat goed is:
- <1ms P99-latentie bij 10.000+ QPS (snelste ruwe prestaties met Rust)
- Feedbacklus: leert welke modellen het beste presteren voor elke functie
- Gestructureerde inferentie met schemavalidatie
- A/B-testen tussen modellen ingebouwd in de gateway
- Ingebouwd evaluatieraamwerk
Wat minder goed is:
- Stopgezet sinds juni 2026: repository gearchiveerd en alleen-lezen, geen toekomstige updates, beveiligingspatches of ondersteuning
- Steilere leercurve dan elke andere gateway, u definieert "functies", niet alleen modellen
- Vereist het heroverwegen van uw LLM-integratie rond TensorZero's functieconcept
- Minder "drop-in" dan LiteLLM of OpenRouter, geen eenvoudige basis-URL-wissel
- Documentatie bevroren in haar laatste staat, wordt niet meer verbeterd
Prijzen: Gratis en open-source (Apache 2.0), te forken en zelf te onderhouden, maar er is geen leverancier meer om voor ondersteuning te betalen, ook al zou u dat willen.
Voor teams die al LLM-evaluaties uitvoerden, was TensorZero's feedbacklus een oprecht nuttige manier om de kloof tussen evaluatie en routing te dichten, evaluatiescores verbeterden direct welke modellen werden gerouteerd. Dat idee is het waard om na te bouwen, ook al is de tool zelf verdwenen.
Oordeel: TensorZero was bedoeld voor ML-engineeringteams die wilden dat hun gateway in de loop van de tijd slimmer werd, en de optimalisatielus was oprecht innovatief. Nu het project is stopgezet, kunnen we het voor niets nieuws aanbevelen, kies in plaats daarvan LiteLLM, Bifrost of Portkey en bouw evaluatiefeedback in uw eigen pipeline. Draait u TensorZero al in productie, dan werkt de code nog steeds, maar reserveer tijd om ervan te migreren voordat u tegen een wijziging in een provider-API aanloopt die het niet aankan.
LLM Gateway-latentieoverhead: De echte cijfers
Elke gateway voegt enige overhead toe aan uw LLM-aanroepen. De vraag is of dat uitmaakt voor uw use case. Hier is hoe de gateways zich verhouden in onze tests:
| Gateway | Taal | P50-latentieoverhead | P95-latentieoverhead | Doorvoer (enkele instantie) |
|---|---|---|---|---|
| Bifrost | Go | ~8µs | ~11µs | 5.000+ RPS |
| TensorZero‡ | Rust | ~0,3ms | <1ms | 10.000+ QPS |
| Helicone | Rust | ~5ms | ~8ms | ~3.000 RPS |
| TrueFoundry | Self-hosted | ~3ms† | <3ms† | 10 mrd+/maand (leverancier) |
| LiteLLM | Python | ~4ms | ~8ms | ~1.000 RPS |
| Portkey | TypeScript | ~5ms | ~12ms | ~2.000 RPS |
| OpenRouter | Beheerd | ~15–30ms | ~50ms | N.v.t. (beheerd) |
| Merge Gateway | Beheerd | niet onafhankelijk getest§ | niet onafhankelijk getest§ | N.v.t. (beheerd) |
| Cloudflare AI GW | Beheerd | ~10–20ms | ~40ms | N.v.t. (beheerd) |
| Kong AI Gateway | Lua/Go | ~3ms | ~8ms | ~3.000 RPS |
† TrueFoundrys sub-3ms-cijfer is door de leverancier gerapporteerd; we hebben het niet door dezelfde onafhankelijke belastingstests geleid als de self-hosted open-source gateways.
‡ Het project van TensorZero werd in juni 2026 gearchiveerd (zie het onderdeel hierboven); de latentiecijfers zijn historisch en niet langer onafhankelijk te verifiëren tegen een actief onderhouden build.
§ Merge Gateway werd gelanceerd na onze belastingstest, dus we hebben het niet op dezelfde testopstelling gemeten als de andere gateways, en we publiceren geen cijfer dat we niet zelf hebben gemeten. Verwacht beheerde-gateway-overhead in dezelfde orde van grootte als OpenRouter en Cloudflare (ruwweg 10-30ms P50) totdat we het testen.
Context doet ertoe. Een typische GPT-4o-aanroep duurt 500–3.000ms afhankelijk van de uitvoerlengte. Zelfs LiteLLM's 8ms overhead is minder dan 1% van de totale latentie. Het enige scenario waar gateway-overhead ertoe doet, is hoogfrequente, lage-latentie werkbelastingen zoals realtime classificatie of embedding-generatie op schaal. Voor conversationele AI of contentgeneratie is elke gateway op deze lijst snel genoeg.
De beheerde gateways (OpenRouter, Cloudflare en Merge Gateway) voegen meer overhead toe omdat uw verzoek naar hun servers reist voordat het de aanbieder bereikt. Self-hosted gateways draaien naast uw applicatie, dus de extra hop is lokaal.
Bifrost vs. Portkey: welke open-source LLM-gateway moet u kiezen?
Als "open source LLM gateway" letterlijk is waarop u zocht, dan is dit de eerlijke stand van zaken in die categorie halverwege 2026: vijf van de negen tools in dit overzicht zijn open-source software die u vandaag zelf kunt hosten. LiteLLM (MIT) en Bifrost (Apache 2.0) zijn volledig open-source, zonder kernfuncties achter een betaalmuur. Portkeys gateway is sinds maart 2026 Apache 2.0, al is het beheerde platform eromheen propriëtair. Helicone (Apache 2.0) is open-source maar zit in onderhoudsmodus na de overname door Mintlify. Kongs basis-Gateway is open-source, maar de AI-specifieke plug-ins die er voor LLM-routing toe doen, zitten achter Kong Enterprise. TensorZero was eveneens open-source, maar het project is stopgezet, dus tellen we het niet meer mee als levende optie. TrueFoundry, hierboven behandeld, kiest een andere route: self-hosted uitrol van een propriëtair control plane in plaats van een open-source codebase.
Dat laat Bifrost en Portkey over als de twee meest gezochte open-source opties, en ze zijn sinds onze vorige review uit elkaar gegroeid. Zo verhouden ze zich echt tot elkaar:
| Dimensie | Bifrost | Portkey |
|---|---|---|
| Gesteund door | Maxim AI (onafhankelijk) | Palo Alto Networks (overgenomen mei 2026) |
| Licentie kerngateway | Apache 2.0, volledig open-source | Apache 2.0 (alleen gateway; platform is propriëtair) |
| Taal | Go | TypeScript/Node.js |
| P95-latentieoverhead | ~11µs | ~12ms |
| GitHub-sterren | ~6,6K | ~12K |
| Guardrails voor contentveiligheid (PII, jailbreak-detectie) | Alleen Enterprise-niveau | Inbegrepen in de gratis OSS-gateway |
| MCP / governance van agent-tools | MCP Gateway met Code Mode, inbegrepen in OSS | Geen kernfunctie |
| SSO / RBAC | Alleen Enterprise-niveau | Vanaf Production-niveau ($49/maand) |
| Onafhankelijkheid van de roadmap | Onafhankelijke leverancier | Nu onderdeel van Prisma AIRS |
Zoekt u een "Bifrost-alternatief" omdat u productie-guardrails wilt zonder Bifrost Enterprise te betalen, dan levert Portkeys gratis open-source gateway PII-redactie en jailbreak-detectie standaard mee, en dat is het grootste functionele verschil tussen de twee. LiteLLM is de andere plek waar mensen belanden: u ruilt Bifrosts ruwe snelheid in voor de breedste aanbiederslijst en de grootste community.
Zoekt u "Portkey-alternatieven" omdat de overname door Palo Alto Networks uw risicoafweging verandert (een volstrekt redelijke wens als uw infra-roadmap los moet staan van de prioriteiten van een cybersecurityleverancier), dan zijn dit uw beste opties, op volgorde: Bifrost, als ruwe doorvoer en MCP-governance zwaarder wegen dan kant-en-klare guardrails; LiteLLM, als u het grootste ecosysteem wilt en geen bezwaar heeft tegen Pythons latentieprofiel; en TrueFoundry (hierboven behandeld), als u specifiek SOC 2-/HIPAA-/GDPR-compliance nodig heeft bij een leverancier die niet Portkey is. Helicone is ook open-source, maar door de onderhoudsmodus past het beter als observability-tool dan als gateway waarvan u verwacht dat die blijft doorontwikkelen.
Geen van beide is objectief "beter", het hangt ervan af of u vandaag guardrails wilt of governance plus snelheid met wat meer inrichtingswerk.
Hoe kiest u de juiste LLM Gateway
Sla de functiematrices over. Hier is de beslissing in één tabel:
| Als u nodig heeft... | Kies | Waarom |
|---|---|---|
| Maximale flexibiliteit + self-hosted | LiteLLM | 100+ aanbieders, grootste community, de meeste integraties |
| Routing op enterprise-schaal + uitgavenbeheer | Merge Gateway | Routingbeleid per klant of feature, uitgavenlimieten, kostenattributie op requestniveau |
| Enterprise governance + gegevenssouvereiniteit | TrueFoundry | Draait in uw VPC, SOC 2/HIPAA/GDPR, MCP Gateway voor agent-tools |
| Snelle multi-modeltoegang, geen ops | OpenRouter | Meld u aan en roep 300+ modellen aan |
| Productie-guardrails + compliance | Portkey | PII-redactie, jailbreak-detectie, auditsporen (nu onderdeel van Palo Alto Networks' Prisma AIRS) |
| Observability als prioriteit | Helicone | Beste monitoring, Rust-prestaties, één-regel setup (onderhoudsmodus sinds maart 2026) |
| Laagst mogelijke latentie + MCP-governance in open source | Bifrost | 11µs overhead in Go, clustermodus, MCP Gateway inbegrepen in het gratis niveau |
| Al op Cloudflare | Cloudflare AI GW | Gratis, edge-caching, geen nieuwe infrastructuur |
| Al Kong in gebruik | Kong AI GW | LLM-routing toevoegen aan bestaand API-beheer |
| ML-gestuurde routing-optimalisatie | Stopgezet in juni 2026, de code is te forken maar niet langer een veilige keuze voor nieuwe projecten |
Een noot over self-hosted vs. beheerd: Self-hosted gateways (LiteLLM, Helicone, Bifrost) geven u volledige controle over de gegevensstroom, niets verlaat uw infrastructuur behalve de daadwerkelijke LLM API-aanroep. Dat is belangrijk voor gezondheidszorg, financiën en elke context waar gegevensverblijf een harde vereiste is. Beheerde gateways (OpenRouter, Cloudflare en Merge Gateway) ruilen die controle in voor nul operationele last. Portkey en Kong zitten er tussenin, open-source gateways met optionele beheerde platforms. Teams die gegevenssouvereiniteit prioriteren, combineren soms een self-hosted gateway met lokaal draaiende LLM's zodat geen enkel verzoek hun netwerk verlaat.
Voor de meeste teams komt de beslissing neer op twee vragen:
- Wilt u self-hosten? Ja -> LiteLLM. Nee -> OpenRouter voor prototyping, Merge Gateway zodra het productie draait.
- Heeft u guardrails nodig? Ja -> Portkey. Nee -> blijf bij no. 1.
Als u RAG-applicaties bouwt die meerdere aanbieders aanroepen voor embeddings en aanvullingen, is een gateway praktisch vereist. Hetzelfde geldt voor apps die gestructureerde outputs over verschillende aanbieders nodig hebben, gateways normaliseren het antwoordformaat zodat uw parselogica niet breekt wanneer u van model wisselt.
Een tool kiezen is het makkelijke deel. Hem betrouwbaar in een echt product laten draaien, daar lopen de meeste teams vast, en dat is precies wat ons AI-integratieteam voor klanten bouwt, van RAG-pipelines tot maatwerkagents. Wil je een second opinion over je stack? Vraag een gratis adviesgesprek aan.
Veelgestelde vragen
Wat is het verschil tussen een LLM-gateway, proxy en router?
Een proxy stuurt verzoeken door en voegt logging toe. Een router kiest het beste model/aanbieder voor elk verzoek. Een gateway combineert beide met kostenbeheer, caching, guardrails en observability. In de praktijk doen de meeste "gateway"-tools alle drie, de termen worden door elkaar gebruikt.
Is LiteLLM echt gratis?
De open-source proxy is volledig gratis (MIT-licentie). U betaalt voor uw eigen hosting (een VPS van $5/maand werkt voor licht gebruik) en de LLM-aanbieder API-kosten. BerriAI biedt enterprise-plannen aan voor teams die beheerde hosting, SSO en ondersteuning willen.
Voegt OpenRouter significante latentie toe?
Minimaal. OpenRouter voegt een kleine routing-overhead toe (typisch <50ms) plus geografische afstand tussen u en hun servers. Voor de meeste applicaties is het verschil verwaarloosbaar. Voor latentiekritische systemen die duizenden verzoeken per seconde verwerken, is een self-hosted optie zoals Bifrost beter.
Kan ik meerdere gateways samen gebruiken?
Ja, en sommige teams doen dat. Een veelvoorkomend patroon is OpenRouter gebruiken voor snel prototypen en overschakelen naar LiteLLM voor productie. Of Helicone gebruiken als observability-laag vóór LiteLLM's routing. Wees u alleen bewust van het stapelen van latentie.
Welke gateway heeft de beste caching?
Portkey en Cloudflare AI Gateway hebben de meest volwassen caching-implementaties. Portkey biedt semantische caching (fuzzy matching van vergelijkbare prompts), terwijl Cloudflare zijn globale edge-netwerk gebruikt voor geografische caching. LiteLLM ondersteunt Redis-gebaseerde caching. Voor een diepere blik op caching-strategieën, zie onze LLM-promptcachinggids.
Heb ik een gateway nodig als ik slechts één LLM-aanbieder gebruik?
Waarschijnlijk niet voor routing. Maar u wilt er misschien toch een voor observability (Helicone), kostenbeheer (LiteLLM) of guardrails (Portkey). De kostenbeheer- en logfuncties alleen al kunnen een gateway rechtvaardigen, zelfs met één aanbieder.
Hoe gaan gateways om met streaming-reacties?
Alle gateways op deze lijst ondersteunen server-sent events (SSE) streaming. De gateway proxiet de stroom van de aanbieder naar uw client met minimale buffering. De latentie-impact op streaming is over het algemeen lager dan bij niet-streamingverzoeken, omdat de overhead per verbinding is, niet per token.
Wat gebeurt er als een aanbieder uitvalt?
De meeste gateways ondersteunen fallback-ketens. U configureert een primaire aanbieder en een of meer fallbacks. Als de primaire fouten retourneert of latentiedrempels overschrijdt, routeert de gateway automatisch naar de volgende aanbieder. LiteLLM, Portkey en Helicone handelen dit allemaal goed af. OpenRouter doet het automatisch op de achtergrond.
Kunnen gateways kostlimieten afdwingen?
Ja. LiteLLM heeft ingebouwde budgetcontroles per team, gebruiker of API-sleutel. Portkey volgt uitgaven in realtime met waarschuwingen. Kong ondersteunt tokengebaseerde quota's. Cloudflare biedt gebruiksanalytics. Dit is eigenlijk een van de sterkste argumenten voor het gebruik van een gateway, zonder een daarvan kan een enkele runaway-lus uw API-budget 's nachts verbranden.
Welke gateway is het beste voor startups vs. ondernemingen?
Startups: OpenRouter (nul setup) of LiteLLM (gratis, flexibel). Ondernemingen: TrueFoundry (gegevenssouvereiniteit, SOC 2/HIPAA/GDPR, beheert zowel model- als agent-tooltraffic via zijn MCP Gateway), Portkey (guardrails, compliance, auditsporen) of Kong AI Gateway (als Kong al wordt gebruikt). De belangrijkste enterprise-onderscheiders zijn SSO, rolgebaseerde toegang, gegevensverblijfcontroles en auditlogging, functies die startups nog niet nodig hebben maar ondernemingen niet kunnen overslaan.
Wat is de beste LLM-proxy?
LiteLLM is de beste LLM-proxy voor de meeste teams. Het draait als een zelfstandige Docker-container, omwikkelt 100+ aanbieders achter een OpenAI-compatibel endpoint, en is volledig gratis te self-hosten. Als "proxy" betekent dat u nul infrastructuur wilt, fungeert OpenRouter als een cloud-gehoste proxy met 300+ modellen op één API-sleutel. Het onderscheid zit in controle: LiteLLM houdt uw gegevens op uw servers; OpenRouter routeert ze via hun platform.
Wat is het verschil tussen een LLM-gateway en een LLM-router?
Een LLM-router selecteert welk model of welke aanbieder een bepaald verzoek verwerkt, doorgaans op basis van kosten, latentie of promptinhoud. Een LLM-gateway doet dat en meer: het voegt kostenbeheer, caching, guardrails, rate limiting en observability toe bovenop de routinglaag. Alle tools op deze lijst zijn technisch gezien gateways. Pure routers (tools die alleen modelkeuze doen zonder andere middleware) zijn zeldzaam in productie omdat teams bijna altijd minimaal logging naast routing nodig hebben.
Portkey vs. Bifrost: welke moet ik kiezen in 2026?
Kies Bifrost als ruwe latentie en governance van agent-tools via MCP het zwaarst wegen: de Go-architectuur voegt 11 microseconden overhead toe tegenover ~12ms bij Portkey, en Bifrosts gratis OSS-niveau levert nu een MCP Gateway met Code Mode. Kies Portkey als u guardrails voor contentveiligheid (PII-redactie, jailbreak-detectie) kant-en-klaar nodig heeft zonder een Enterprise-niveau te betalen, want Bifrost zet die achter zijn betaalde plan. De andere factor: Portkey werd in mei 2026 overgenomen door Palo Alto Networks en zit nu binnen hun Prisma AIRS-beveiligingsplatform, terwijl Bifrost een onafhankelijk open-source project van Maxim AI blijft. Geen van beide is strikt beter, het is snelheid plus onafhankelijkheid tegenover guardrails plus rugdekking.
Wat zijn de beste Portkey-alternatieven nu Palo Alto Networks eigenaar is?
De sterkste onafhankelijke alternatieven zijn Bifrost (het snelst, nu met een eigen MCP Gateway, al vereisen guardrails Enterprise), LiteLLM (de breedste aanbiedersdekking en grootste community, als u geen ingebouwde guardrails nodig heeft) en TrueFoundry (vergelijkbare enterprise-governance en compliance-certificeringen, nog steeds een onafhankelijke leverancier). Helicone is eveneens open-source, maar zit sinds de overname door Mintlify in maart 2026 in onderhoudsmodus, dus het is een betere keuze voor observability dan als toekomstbestendige gateway-vervanger.