Envoy AI Gateway (devenu Agent Router) : un avis honnête
.png)
Conçu pour la vitesse : latence d'environ 10 ms, même en cas de charge
Une méthode incroyablement rapide pour créer, suivre et déployer vos modèles !
- Gère plus de 350 RPS sur un seul processeur virtuel, aucun réglage n'est nécessaire
- Prêt pour la production avec un support complet pour les entreprises
Le changement de nom, en un paragraphe
Si vous avez cherché « Envoy AI Gateway » et que vous avez atterri ici : vous êtes au bon endroit, et le produit existe toujours. Il s'appelle désormais Agent Router, il est hébergé sur theagentrouter.ai et constitue un projet indépendant au sein de l'Agentic AI Foundation (une série de projets LF Projects, LLC) plutôt qu'un sous-projet Envoy sous l'égide de la CNCF. L'annonce date du 9 septembre 2026 ; le changement a pris effet le lendemain.
Rien n'a été techniquement cassé. L'espace de noms est toujours envoy-ai-gateway-system, le groupe d'API toujours aigateway.envoyproxy.io, l'interface en ligne de commande toujours aigw, et la licence toujours Apache 2.0. Les manifestes de votre dépôt continuent de fonctionner. Ce qui a changé, c'est l'entité de gouvernance, le domaine de la documentation, le chemin du dépôt et le nom. Nous utiliserons « Agent Router » à partir d'ici.
Ce qu'est réellement Agent Router
Agent Router est une couche additive à Envoy Gateway — et non un fork — qui apprend à Envoy à parler le langage des LLM. Sa propre définition est la plus claire de la catégorie : « Agent Router configure. Envoy gère le trafic. »
Les mainteneurs viennent de Tetrate, Bloomberg, Tencent, Netflix, AMD et Nutanix, selon l'annonce de la version 1.0. Tetrate est le moteur commercial, proposant à la fois un service hébergé et un produit d'entreprise autogéré basé sur cette solution. Réunion communautaire hebdomadaire, propositions de conception publiques, un Discord.
Historique des versions
Environ une version mineure par trimestre — un rythme sain. La version 1.0 contient la phrase la plus forte de la documentation du projet :
« Nous ne casserons jamais les API, sauf en cas de problème de sécurité critique, et nous fournirons toujours un chemin de migration dans les notes de version si nous devions le faire. »
C'est un engagement réel, écrit noir sur blanc, et c'est plus que ce que la plupart des passerelles commerciales acceptent de mettre par écrit.
Architecture
Agent Router se divise clairement en un plan de contrôle et un plan de données.
Plan de contrôle. L'API Server de Kubernetes sert d'interface de configuration. L'AI Gateway Controller gère les ressources spécifiques à l'IA et configure l'External Processor, en ajustant finement xDS via le mécanisme de serveur d'extension d'Envoy Gateway ; l'Envoy Gateway Controller prend en charge la configuration principale du proxy.
Plan de données. Envoy Proxy, un External Processor (ext-proc) effectuant la transformation et la validation spécifiques à l'IA, ainsi qu'un service de limitation de débit (Rate Limit Service) basé sur les jetons. La passerelle MCP est un proxy léger intégré au sidecar d'Agent Router.
Cinq CRD, tous disponibles en v1beta1 et couverts par la garantie de stabilité 1.0 : AIGatewayRoute (achemine le trafic LLM et sélectionne les backends), AIServiceBackend (déclare un fournisseur en amont ou un modèle auto-hébergé), BackendSecurityPolicy (centralise les identifiants en amont), GatewayConfig (configuration au niveau de la passerelle) et MCPRoute (multiplexage MCP, filtrage d'outils, autorisation).
La configuration se fait via YAML appliqué avec kubectl. Les noms de champs documentés donnent un aperçu de la structure : modelNameOverride sur un backend pour la virtualisation de modèle, credentialOverride pour les identifiants en amont par requête, streamIdleTimeout pour les attentes de flux limitées, et sur une MCPRoute :
# Illustrative shape only - see the API reference for the full schema
spec:
toolSelector:
includeRegex:
- "issue_.*"
backendSelector: ... # CEL, default action Deny (v1.1)
hostnames: ... # max 16 (v1.1)
Vous gérez également une matrice de versions. La base v1.1.0 comprend Go 1.26.4, Envoy Gateway v1.8.1, Envoy Proxy v1.38.1, Gateway API v1.5.1, Inference Extension v1.0.2 et MCP Go SDK v1.7.0. Les mises à niveau d'Envoy Gateway deviennent votre dépendance.
[CAPTURE D'ÉCRAN : Agent Router — diagramme de l'architecture du site de documentation montrant le plan de contrôle (AI Gateway Controller + Envoy Gateway Controller) et le plan de données (Envoy Proxy + External Processor + Rate Limit Service)]
Inventaire des fonctionnalités, tel que documenté
Fournisseurs — 16 intégrés par défaut : OpenAI, Azure OpenAI, Gemini, Vertex AI, Bedrock, Anthropic, Mistral, Cohere, Groq, Together AI, DeepInfra, DeepSeek, Hunyuan, SambaNova, Grok et Tetrate Agent Router Service. vLLM et Ollama auto-hébergés sont accessibles via l'interface en ligne de commande (CLI).
API unifiée. Compatible avec OpenAI : chat, complétions, embeddings, génération d'images, audio et l'API Responses, ainsi que le format natif d'Anthropic /anthropic/v1/messages. La traduction inter-fournisseurs gère des cas comme la conversion des messages Anthropic vers Bedrock Converse.
Gestion du trafic. Limitation de débit basée sur les jetons (tokens). QuotaPolicy pour les budgets de jetons sur des fenêtres temporelles. Repli vers un autre fournisseur et basculement automatique. Virtualisation des noms de modèles via modelNameOverride, permettant de changer de fournisseur par une simple modification de configuration plutôt que de code. Mutations d'en-têtes et de corps de requête. Dans la v1.1, streamIdleTimeout avec basculement — s'il se déclenche avant le premier jeton, une nouvelle tentative est effectuée vers le backend suivant.
Routage d'inférence et identifiants. Prise en charge d'InferencePool et d'Endpoint Picker, via HTTPRoute + InferencePool et AIGatewayRoute + InferencePool — particulièrement utile si vous gérez vos propres GPU. BackendSecurityPolicy centralise l'authentification amont : clés API, AWS SigV4, Azure et l'identité native cloud GCP, incluant Workload Identity et GKE ADC.
La prise en charge de MCP est substantielle. Multiplexage de serveurs derrière un point de terminaison unique avec préfixage automatique des outils par backend (github__issue_read), filtrage des outils, OAuth avec PKCE selon la spécification d'autorisation MCP, HTTP diffusable avec reconnexion Last-Event-ID. Le point fort est l'autorisation granulaire utilisant CEL sur les revendications JWT et le contexte MCP — request.mcp.method, request.mcp.tool, request.mcp.params, request.auth.jwt — avec tools/list ne renvoyant que ce que l'appelant est autorisé à utiliser. Peu de projets atteignent une telle profondeur.
Observabilité. Métriques Prometheus suivant les conventions sémantiques OpenTelemetry GenAI, avec comptabilisation séparée des jetons de raisonnement. Traçage OTel avec compatibilité OpenInference. Journaux d'accès incluant les métadonnées IA. La v1.1 ajoute des attributs de span gen_ai.* et un exemple de tableau de bord Grafana dans le dépôt.
Les garde-fous (guardrails) ne sont pas une fonctionnalité native. Il n'existe pas de page dédiée aux garde-fous dans la documentation ; la page sur les capacités de sécurité renvoie principalement vers la documentation de sécurité d'Envoy Gateway. Le comparatif de Tetrate liste la ligne OSS comme « hooks de garde-fous », les véritables garde-fous IA étant proposés en tant que produit entreprise.
Les véritables points forts
Un projet crédible mérite une explication crédible de ses raisons d'être.
Le plan de données est Envoy. Il ne s'agit pas d'un nouveau proxy écrit en Python ou en Node, mais du proxy qui gère déjà le trafic de production à une échelle colossale. Le risque opérationnel lié au plan de données est aussi faible que possible.
La garantie de stabilité est rare. Une API de plan de contrôle v1beta1 stable, assortie d'une promesse écrite et d'un engagement sur le parcours de migration, surpasse ce que proposent la plupart des fournisseurs.
Une maintenance intersectorielle. Tetrate, Bloomberg, Netflix, AMD, Nutanix et Tencent disposent tous de mainteneurs. Ce n'est pas un projet à fournisseur unique arborant une étiquette open source ; le facteur de risque lié à la dépendance envers une seule équipe est ici réellement maîtrisé.
Pas de version communautaire bridée. Tetrate l'affirme clairement : « Pas de plan de données propriétaire, pas de version communautaire bridée, rien n'est retenu du projet pour être revendu ultérieurement. » La valeur ajoutée pour l'entreprise réside dans la gestion de flotte, et non dans des fonctionnalités de plan de données verrouillées ; c'est une approche open-core honorable. Le projet est également nativement conforme aux standards (Gateway API, Inference Extension, conventions OTel GenAI, OpenInference, MCP), ce qui limite considérablement les risques de verrouillage propriétaire.
Il est vraiment facile à tester. Une seule commande, sans Kubernetes ni Docker, sur Linux ou macOS :
OPENAI_API_KEY=sk-... aigw run
Il s'agit d'un routeur compatible avec OpenAI sur localhost:1975. Peu de projets de passerelles IA open source atteignent un point de terminaison fonctionnel aussi rapidement.
Adopteurs publics. La page d'accueil liste Alan by Comma Soft, Bloomberg, LY Corporation, National Research Platform, Nutanix, Paper Compute Co., Simplifai, Stacklok, Tencent Cloud, Tetrate et Unwrap, et l'article sur la version 1.0 mentionne nommément les trois premiers. Nous n'avons trouvé aucune étude de cas formelle avec des indicateurs — les logos et une liste de remerciements ne constituent pas des études de cas — mais trois produits commerciaux s'appuient sur ce projet (Tetrate Agent Router Service et Enterprise, Nutanix Agent Gateway), ce qui constitue une preuve solide de la qualité du code en environnement de production.
[CAPTURE D'ÉCRAN : Agent Router — rangée des entreprises adoptantes sur la page d'accueil avec les onze logos publiés]
Où les équipes rencontrent des difficultés
Rien de tout cela ne critique le code. Il s'agit d'un inventaire de ce que le projet open source n'inclut pas, attesté par son absence dans la documentation ou sa présence dans le comparatif payant de Tetrate, vérifié le 25 septembre 2026.
1. Il n'y a pas d'interface utilisateur. La navigation dans la documentation ne contient aucune page de console d'administration. Chaque intégration de modèle, rotation de clé et modification de quota se fait via un manifeste Kubernetes dans votre pipeline GitOps ; Tetrate vend « The Management Console » en tant que composant entreprise. C'est très bien pour une équipe plateforme. Pour les douze équipes applicatives qui souhaitent tester un nouveau modèle le jeudi, cela nécessite l'ouverture d'un ticket.
2. Pas de RBAC plateforme ni de SSO pour l'administration de la passerelle. Le RBAC Kubernetes sur les CRD ne constitue pas un contrôle d'accès basé sur les rôles pour les modèles, les serveurs MCP et les équipes. L'authentification des requêtes sur le plan de données (JWT, OIDC) est assurée par Envoy Gateway, mais il s'agit d'une authentification de l'appelant, et non d'un contrôle d'accès administratif. Tetrate liste le SSO avec Okta/Entra/OIDC/SAML et les consoles segmentées comme des fonctionnalités entreprise.
3. L'attribution des coûts repose sur des métriques, pas sur une refacturation interne. Les métriques de jetons arrivent dans Prometheus. Transformer cela en dépenses par équipe avec un catalogue de prix, un suivi et une refacturation interne est à votre charge, y compris la mise à jour du catalogue. Tetrate est honnête : avec un mélange de GPU auto-hébergés et d'API facturées au jeton, « L'attribution doit normaliser les deux, sinon le chiffre que vous transmettez au service financier est fictif. »
4. Les budgets sont définis par passerelle, et non à l'échelle de la flotte. QuotaPolicy permet de définir des budgets de jetons sur des périodes données, mais le comparatif de Tetrate qualifie le comportement de l'OSS de « par passerelle ». Si vous exécutez des passerelles dans trois régions, un agent refusé dans l'une peut réussir dans une autre.
5. Pas de journalisation des prompts ou des réponses. Les journaux d'accès contiennent les noms des modèles et le nombre de jetons ; il n'y a aucune capture, conservation, recherche ou relecture documentée des prompts/complétions. La v0.6 a ajouté la redaction — la tendance est à la suppression des corps de message, pas à leur stockage.
6. Pas d'approbation humaine, et les garde-fous sont à votre charge. L'autorisation MCP repose sur une logique d'autorisation/refus au moment de la requête ; rien ne bloque un appel d'outil destructeur derrière une approbation. Tetrate vend un coupe-circuit pour agent, mais aucun flux d'approbation par appel n'existe. De même, le projet OSS ne propose ni détection de données personnelles (PII), ni filtrage d'injection de prompt, ni modération de contenu, ni analyse de secrets.
7. Kubernetes est le prérequis pour la production. aigw run est destiné aux ordinateurs portables. La production implique un cluster, ainsi qu'Envoy Gateway, le contrôleur AI Gateway et un service de limitation de débit (Rate Limit Service). Si vous n'utilisez pas Kubernetes avec la Gateway API aujourd'hui, c'est un projet conséquent à mener avant même de router votre premier jeton.
8. Qui est responsable à 3 heures du matin ? Le support communautaire passe par GitHub, Discord, Slack et une réunion hebdomadaire. Tetrate Enterprise propose un support 24/7 avec un SLA, une équipe dédiée, des builds corrigés des vulnérabilités (CVE) sur une branche de version maintenue, une distribution en environnement isolé (air-gapped) et un catalogue de modèles à jour. Leur comparatif qualifie la colonne OSS de « vous le maintenez vous-même » — tout le résumé en quatre mots.
Construire ou acheter : une analyse claire
Si votre équipe plateforme utilise Envoy Gateway et dispose des ressources nécessaires, la colonne de droite représente une feuille de route que vous pouvez suivre. Sinon, c'est un produit que vous êtes sur le point de construire par accident. Évaluez-le comme n'importe quelle décision de construire ou acheter: en mois-homme, et non en frais de licence.
Le positionnement de TrueFoundry
Nous ne prétendrons pas qu'Agent Router est une mauvaise solution. La différence réside dans le périmètre et dans qui supporte la charge opérationnelle.
L' AI Gateway de TrueFoundry repose sur la même idée architecturale — un point de contrôle unique devant le trafic des modèles et des outils — tout en incluant la plateforme environnante plutôt que de vous en laisser la charge. Elle ajoute environ 3 à 4 ms, gère plus de 350 requêtes par seconde sur 1 vCPU, et sert de façade à plus de 1 000 LLM via une API compatible OpenAI.

Une console, et un RBAC qui a du sens. L'intégration de modèles, la rotation des clés et les modifications de quotas s'effectuent via une interface utilisateur avec une piste d'audit, permettant aux équipes d'avancer sans avoir à soumettre de ticket à la plateforme. Les sujets peuvent être des utilisateurs, des équipes, des comptes virtuels ou des agents ; les ressources couvrent les comptes fournisseurs, les serveurs MCP, les agents, les clusters et les espaces de travail, chacun disposant de sa propre famille de rôles. SSO via OIDC ou SAML 2.0, avec SCIM.

Une attribution des coûts et des budgets que le département financier acceptera. Budget Limiting V2 avec des budgets définis par locataire et par équipe, filtrés par sujet, modèle, compte fournisseur ou métadonnées, avec un mode d'avertissement uniquement. Le suivi des coûts s'appuie sur un catalogue de prix open-source (github.com/truefoundry/models) avec des tarifs régionaux et par paliers ; l'attribution transite via X-TFY-METADATA. C'est le fossé le plus long à combler par soi-même — voir l'attribution des coûts et les budgets d'équipe.
Des garde-fous sous forme de catalogue, pas de simple hook. Neuf intégrés (secrets, sécurité du code, désinfectant SQL, regex, injection de prompt, PII, modération de contenu, Cedar, OPA) plus 17 fournisseurs externes, à quatre niveaux : entrée LLM, sortie LLM, pré-outil MCP et post-outil MCP.

Une mise en garde honnête : les garde-fous pour la modération de contenu, les PII et l'injection de prompt ne fonctionnent que lorsque TrueFoundry héberge la passerelle, et non sur votre propre infrastructure. Les autres fonctionnent dans les deux cas.
Gouvernance MCP avec un portail d'approbation. Activation/désactivation par outil, annotations en lecture seule et destructives, et approbation humaine avec des portées nommées/destructives/totales, expiration des droits et notifications par e-mail, Slack, PagerDuty ou Teams. Aucun équivalent dans la documentation d'Agent Router.

Observabilité et déploiement, sans ajouter deux projets supplémentaires. Traces et métriques OTEL via HTTP ou gRPC, scraping Prometheus auto-hébergé, API de métriques pour le modèle, MCP, garde-fous, cache et routage. Fonctionne en mode SaaS dans plus de 12 régions et trois clouds, ou auto-hébergé dans votre VPC, sur site ou en environnement isolé (air-gapped) — le trafic reste dans votre infrastructure, TrueFoundry est hors du chemin critique.

Comparatif direct
Une remarque : le système d'Agent Router Autorisation MCP avec CEL est excellent, et la licence Apache 2.0 sans plan de données verrouillé est une caractéristique permanente qu'aucun produit commercial ne peut offrir.
Lectures complémentaires
- Qu'est-ce qu'une passerelle LLM — définition de la catégorie
- Meilleure passerelle IA en 2026 — le domaine élargi
- Alternatives à Envoy Proxy — la couche sous-jacente
- Coût total de possession pour l'infrastructure GenAI — évaluer le coût de construction
- Qu'est-ce qu'une passerelle MCP — le volet trafic d'outils
Conclusion
Agent Router — le projet que vous connaissez peut-être encore sous le nom d'Envoy AI Gateway — est l'une des meilleures choses qui soit arrivée à l'infrastructure IA open source. Le plan de données est Envoy. L'API est stable, comme l'ont confirmé les mainteneurs par écrit. Six entreprises assurent sa pérennité. Le modèle d'autorisation MCP surpasse la plupart des équivalents commerciaux. Et la limite de l'open-core est honnête.
La raison de choisir une autre solution n'est pas la qualité, mais la répartition des responsabilités. Agent Router vous fournit la couche de routage. La console, le contrôle d'accès (RBAC) de la plateforme, l'attribution des coûts par équipe, les budgets à l'échelle de la flotte, les journaux de prompts, les flux de validation, le catalogue de garde-fous et l'astreinte à 3h du matin sont à votre charge — et cela représente la majeure partie du travail. Une équipe plateforme dotée de solides compétences Kubernetes et des effectifs nécessaires pour gérer cette pile devrait l'exploiter elle-même. C'est un choix légitime, et cet article ne vise pas à le contester.
Si ce n'est pas un projet que vous souhaitez lancer, achetez la passerelle pour laquelle le travail a déjà été effectué.
TrueFoundry AI Gateway offre une latence d'environ 3 à 4 ms, gère plus de 350 RPS sur 1 processeur virtuel, évolue horizontalement facilement et est prête pour la production, tandis que LiteLM souffre d'une latence élevée, peine à dépasser un RPS modéré, ne dispose pas d'une mise à l'échelle intégrée et convient parfaitement aux charges de travail légères ou aux prototypes.



Gouvernez, déployez et suivez l'IA dans votre propre infrastructure
Blogs récents
Questions fréquemment posées
Qu'est-ce qu'Envoy AI Gateway ?
Une passerelle d'IA open source construite comme une couche additionnelle sur Envoy Gateway et la Kubernetes Gateway API, avec Envoy comme plan de données et des CRD comme plan de contrôle. Depuis le 10 septembre 2026, elle s'appelle Agent Router et est hébergée par l'Agentic AI Foundation.
Envoy AI Gateway est-il prêt pour la production ?
Il a atteint la v1.0 GA le 23 juin 2026 avec une API v1beta1 stable et un engagement écrit à ne pas introduire de changements incompatibles. Parmi les utilisateurs publiés figurent Bloomberg, LY Corporation, Nutanix et Tencent Cloud. La question de la production porte moins sur le code que sur la surface opérationnelle que vous fournissez autour.
Envoy AI Gateway ou une passerelle d'IA commerciale : comment choisir ?
Comptez ce que vous auriez à construire. Si vous utilisez Kubernetes avec la Gateway API et que vos ingénieurs ont la capacité de prendre en charge une console, le RBAC, l'attribution des coûts, les budgets, la journalisation des prompts et les garde-fous, Agent Router est un choix légitime et peu coûteux en licences. Si cette liste ressemble à une feuille de route que vous n'aviez pas prévue, achetez la solution.
Les anciennes URL d'Envoy AI Gateway fonctionnent-elles encore ?
Oui. aigateway.envoyproxy.io redirige en 301 vers theagentrouter.ai, et github.com/envoyproxy/ai-gateway redirige vers github.com/theagentrouter/agent-router.
Puis-je exécuter TrueFoundry dans mon propre VPC ou sur site ?
Oui. TrueFoundry fonctionne dans votre VPC, sur site, en environnement isolé (air-gapped), en mode hybride ou sur plusieurs clouds, et aucune donnée ne quitte votre domaine. C'est la principale raison pour laquelle les entreprises réglementées le préfèrent aux passerelles SaaS uniquement.
TrueFoundry fonctionne-t-il avec ma stack d'observabilité ?
Oui. La passerelle exporte les traces et métriques OTEL via HTTP ou gRPC, et expose le scraping Prometheus en auto-hébergement.










.webp)



.png)
.png)
.png)
.png)
.png)






.png)







