Blank white background with no objects or features visible.

Nous vous offrons un accès gratuit à l'intégralité du Gartner Hype Cycle for AI Governance 2026. Obtenez votre exemplaire →

5 leçons sur l'exploitation d'IA agentique en production - D'après la discussion au coin du feu

Par Ashish Dubey

Published: October 10, 2026

⚡ TL;DR

An AI gateway is the central layer every request passes through, and it is where cost, tracing, and access control for agentic AI actually get enforced. We surveyed 200 enterprise AI leaders and ran a live discussion with engineering heads at Via and SurveyMonkey. The pattern was consistent: teams ship agents faster than they can govern them, and the fix is a control plane, not more dashboards. This guide covers the six lessons that matter most.

La plupart des entreprises ont désormais des agents en production avant même d'avoir un moyen de surveiller leurs activités. C'est dans cet écart que se cachent les dépassements de coûts, les défaillances impossibles à tracer et l'IA fantôme. Nous avons recueilli le même témoignage auprès de 200 leaders de l'IA issus de 18 secteurs différents, ainsi que lors d'une session en direct avec Daniel, vice-président de l'ingénierie chez Via, et Meenal, responsable des données et de l'IA en entreprise chez SurveyMonkey.

Le fil conducteur de presque toutes les réponses était la même idée, même si personne n'a utilisé le terme : vous avez besoin d'une passerelle IA. Pas un énième outil d'observabilité ajouté après coup, mais une couche de contrôle unique qui modélise, serveurs MCP, et par laquelle les agents transitent, afin que les coûts, la journalisation et les accès soient gérés en un seul endroit plutôt que dans chaque base de code. Voici ce que les leaders avec qui nous avons échangé ont appris en parvenant à ce résultat.

Regardez la discussion détaillée ici - 

Pourquoi la gouvernance de l'IA agentique est cruciale à grande échelle

La découverte la plus révélatrice de notre rapport est un paradoxe. Lorsque nous avons demandé aux leaders où iraient leurs budgets 2026 et 2027, l'extension des cas d'usage de l'IA arrivait en tête. Lorsque nous avons demandé séparément quel était, selon eux, le plus grand risque à couvrir, la sécurité et la gouvernance de cette même expansion arrivaient tout aussi haut. Les deux postes budgétaires se chevauchent presque.

Cette tension est au cœur du sujet. Si vous forcez trop sur l'expansion, les coûts et les risques vous échappent. Si vous avancez trop prudemment, vous prenez du retard. Chaque leader avec qui nous avons parlé tente de financer les deux simultanément, et ceux qui réussissent considèrent la gouvernance comme un levier pour accélérer l'expansion, et non comme un frein. Comme l'a souligné Meenal, chaque dollar investi dans une stratégie de risque et de sécurité adaptée devient un levier pour injecter davantage de fonds dans l'expansion, à un rythme plus soutenu.

Leçon 1 : La facture d'inférence n'est que la partie émergée de l'iceberg

Il y a eu beaucoup de bruit autour d'Uber, qui aurait épuisé son budget IA prématurément, et il est tentant d'y voir un problème de prix d'inférence. Ce n'est généralement pas le cas. La facture grimpe à cause du contexte que vous fournissez au modèle, et non du tarif par jeton.

Meenal a comparé cela au travail préparatoire qu'une organisation doit accomplir avant de passer à l'échelle. Le contexte provient de trois sources : les données de vos bases de données, la logique décisionnelle appliquée par vos équipes, et les connaissances institutionnelles et tacites détenues par les collaborateurs. Assemblez ces éléments correctement et l'agent obtiendra ce dont il a besoin avec un minimum de jetons. Si vous négligez cette étape, vous paierez le même modèle pour qu'il tente de résoudre le même problème par tâtonnements successifs.

Elle a également utilisé une analogie qui nous a marqués. C'est la même histoire que le passage du sur site au cloud. Les entreprises ont migré vers le cloud, ont vu leurs coûts exploser, et ont seulement appris à les gérer après coup. L'IA suit la même courbe, mais de manière compressée. Les coûts continueront d'augmenter à mesure que les outils affineront leur tarification et que la puissance de calcul sous-jacente deviendra plus onéreuse ; la discipline doit donc être instaurée plus tôt cette fois-ci.

En travaillant avec diverses entreprises, notre cofondateur Anurag a constaté que le contrôle des coûts s'articule autour de trois niveaux, et qu'une passerelle IA est l'endroit où ces trois niveaux sont appliqués :

  • Visibilité. Si vous autorisez l'utilisation de modèles via Bedrock, OpenAI et Anthropic, vous avez besoin d'une vue unifiée des dépenses par utilisateur, par équipe et par application. On ne peut pas gérer ce que l'on ne peut pas mesurer.
  • Contrôle. Une fois la visibilité acquise, vous pouvez définir des limites : budgets et plafonds de débit par utilisateur, équipe ou application, en fonction du retour sur investissement de chaque projet.
  • Routage. La couche la plus intelligente. Une requête envoyée à un grand modèle de pointe peut souvent obtenir le même résultat avec un modèle plus petit. La couche centrale voit tout le trafic, elle peut donc acheminer chaque requête vers le modèle approprié. Avec le temps, la logique de routage s'améliore car elle apprend des journaux d'observabilité.

Voici la différence entre exécuter des agents sans cette couche et les exécuter derrière une telle protection.

What breaks in production Ungoverned agent stack Behind an AI gateway
Cost visibility Per-provider bills, no per-team view Unified spend by user, team, and app
Cost control Discovered after the invoice Budgets and rate limits enforced up front
Model choice Hardcoded, often oversized Routed to the right model per request
Tracing Partial logs, per service One trace from prompt to tool and model
MCP access Wild west, per developer Central registry with tool-level control
Guardrails Copied into each codebase Applied as policy at the gateway

Leçon 2 : Vous ne pouvez pas tracer ce que vous n'avez pas conçu pour être tracé

Plus de la moitié des entreprises que nous avons interrogées ne pouvaient pas tracer entièrement les agents qu'elles avaient en production. Certains de ces agents étaient approuvés. D'autres relevaient de l'IA fantôme, déployée à l'insu du service informatique ou de la direction.

Daniel a trouvé la manière la plus percutante d'exprimer les enjeux. Imaginez que vous donniez à un employé un ordinateur portable avec la permission d'installer n'importe quoi, un accès complet au réseau et aucune surveillance. Aucune entreprise moderne ne fait cela. Les agents ont besoin des mêmes garde-fous, et ils en ont besoin dès le départ, car tracer un système non déterministe après coup est presque impossible. L'agent ne fait jamais deux fois la même chose ; si la piste d'audit n'a pas été prévue dès la conception, elle n'existe pas au moment où vous en avez besoin.

Chez Via, ils considèrent cela comme une condition sine qua non. Une bonne infrastructure pour exécuter des agents remplit deux fonctions simultanément : elle rend le déploiement plus sûr et plus facile, ce qui incite les équipes à en déployer beaucoup plus. C'est pourquoi l'observabilité des agents doit faire partie intégrante de la plateforme, et non être un projet que l'on remet à plus tard. Une technique pratique qui a fonctionné pour eux a consisté à diviser le prompt d'un agent en étapes vérifiables, afin de pouvoir inspecter chaque réponse dans la chaîne et identifier où un problème est survenu.

Leçon 3 : 76 % des entreprises manquent de journalisation unifiée, ce qui pose un problème de gouvernance

Soixante-seize pour cent des organisations de notre rapport manquaient d'une journalisation entièrement unifiée sur l'ensemble de leurs modèles et flux de travail. C'est à la fois un problème de coût et un problème de contrôle. Si vous ne pouvez pas voir quel modèle est utilisé, par qui et dans quel département, vous ne pouvez pas analyser la structure des coûts ni exercer le moindre contrôle.

SurveyMonkey a mis en place l'observabilité des LLM en priorité, avant même de passer à l'échelle, précisément parce que ces systèmes deviennent incontrôlables sans elle. Leur journalisation va désormais au-delà des coûts pour couvrir la qualité : ils surveillent les hallucinations et utilisent des évaluations ainsi que des LLM agissant en tant que juges pour vérifier les résultats. Daniel a soulevé un point délicat qui prend beaucoup d'équipes au dépourvu. Les résultats des agents peuvent contenir des données personnelles (PII) des utilisateurs, même si vos journaux habituels n'en contiennent jamais. Vous devez donc concevoir ce qui est journalisé et ce qui est masqué, plutôt que de tout journaliser par défaut.

Tous deux s'accordent sur le point le plus inconfortable : l'observabilité est rarement la première chose que l'on souhaite construire. La priorité est de livrer quelque chose pour démontrer la valeur. C'est compréhensible, mais une gouvernance ajoutée a posteriori est bien plus coûteuse qu'une gouvernance intégrée dès la conception. Une passerelle d'IA permet d'automatiser cette journalisation, évitant ainsi aux développeurs d'avoir à y penser systématiquement.

Leçon 4 : La distinction entre interne et externe détermine votre posture face au risque

Votre position sur l'équilibre entre expansion et risque dépend principalement d'une chose : si l'IA est tournée vers l'intérieur ou vers l'extérieur. C'était l'analyse d'Anurag auprès des entreprises avec lesquelles nous travaillons, et les deux praticiens l'ont confirmé.

Les outils de productivité internes peuvent évoluer rapidement, car le coût d'une erreur mineure est faible. Via a construit une infrastructure interne permettant à ses propres collaborateurs, y compris le personnel non technique, de créer un tableau de bord, un petit site ou une automatisation à partir d'un modèle prêt à l'emploi. Tout ce qui est destiné aux clients est une autre histoire. Meenal a été directe : l'IA externe fait l'objet d'un examen plus rigoureux, car les clients veulent savoir comment leurs données sont utilisées. Elle passe donc par un cycle de révision plus strict que tout ce qui est interne. Les entreprises qui parviennent à équilibrer les deux sont celles qui investissent d'abord dans la gestion des risques, puis utilisent cette marge de manœuvre pour se développer.

Leçon 5 : Commencez par 8 à 10 cas d'usage à fort retour sur investissement, pas 200

Le conseil le plus fort de la session portait sur la retenue. Ne cherchez pas à déplacer des montagnes. La règle de Meenal était de privilégier le cas d'usage plutôt que la technologie, car partir du problème est ce qui vous oriente vers les bons outils et le véritable retour sur investissement. Le conseil de Daniel était de choisir l'objectif avec sagesse : trop modeste, il est insignifiant ; trop ambitieux, il n'est pas raisonnable. Ensuite, lancez-le sous forme de POC agile, construisez les garde-fous et déployez-le une fois qu'il a fait ses preuves.

Anurag a été témoin direct de cette évolution. Il y a quelques années, les équipes arrivaient avec des listes de 200 cas d'usage à résoudre par l'IA, dont la plupart auraient coûté aussi cher à développer qu'ils ne permettaient d'économiser. Aujourd'hui, les organisations les plus performantes en présentent 8 à 10, chacun avec un retour sur investissement solide, et elles intègrent dès le premier jour les contrôles de coûts, la gouvernance et l'observabilité. Ce dernier point est crucial : les équipes qui font l'impasse sur ces aspects déploient en production, rencontrent une défaillance, et doivent alors tout défaire pour tout reconstruire. Mettez en place une couche de contrôle dès le début, et vous donnerez aux bons cas d'usage l'espace nécessaire pour se développer.

Comment TrueFoundry gère la gouvernance de l'IA agentique via un plan de contrôle unique

Nous avons conçu TrueFoundry comme un plan de contrôle d'IA d'entreprise pour l'IA agentique. Cette approche s'aligne directement sur les six leçons précédentes : réunir les modèles, les MCP et les agents au sein d'une couche unique, puis y superposer la gestion des coûts, la gouvernance et l'observabilité.

La passerelle IA constitue le point d'entrée. Elle vous offre une API compatible avec OpenAI pour accéder à plus de 1 000 LLM auprès de divers fournisseurs, ce qui permet de changer de modèle en modifiant simplement un nom dans la requête plutôt qu'en réécrivant le code. Elle ajoute environ 3 à 4 ms de latence et gère plus de 350 requêtes par seconde sur un seul vCPU, ce qui lui permet de rester sur le chemin critique sans devenir un goulot d'étranglement. Comme chaque requête transite par cette passerelle, le suivi des dépenses, les budgets, les limites de débit et le routage des modèles sont appliqués de manière centralisée, évitant ainsi de devoir les réimplémenter dans chaque service.

La passerelle MCP et le registre d'agents résolvent le problème N-par-M évoqué dans la leçon 3. Les serveurs MCP et les agents s'enregistrent à un endroit unique avec un contrôle d'accès au niveau des outils ; vous pouvez ainsi accorder à un utilisateur spécifique l'accès à un outil précis sans exposer le reste, chaque appel étant authentifié et tracé. Les garde-fous sont appliqués en tant que politiques à ce niveau, suivant le modèle décrit par SurveyMonkey avec des modèles d'agents pré-approuvés : les données, le contexte et les contrôles d'observabilité sont intégrés nativement dans le modèle, de sorte que les équipes en héritent par défaut.

Pour l'observabilité, la passerelle est compatible avec OpenTelemetry et trace chaque requête, du prompt à l'exécution de l'outil et du modèle, pour ensuite s'intégrer à Grafana, Datadog ou Prometheus. Si un CTO se présente avec 30 agents, trois fournisseurs de modèles et aucune couche de contrôle, la première étape n'est pas de tout réécrire. Il s'agit d'enregistrer tout ce que ces agents consomment en un seul point et de diriger leurs points de terminaison vers cette couche centrale, permettant ainsi de bénéficier d'une journalisation unifiée et d'un contrôle des coûts sans que les développeurs n'aient à modifier leur code.

Lectures complémentaires

Conclusion

Six leçons, un fil conducteur. Les coûts, le traçage, l'accès MCP, la journalisation, la gestion des risques et la sélection des cas d'usage convergent tous vers une question : disposez-vous d'un endroit unique pour visualiser et contrôler les actions de vos agents ? Une passerelle IA est cet endroit, et l'intégrer précocement est ce qui permet aux équipes de déployer l'IA agentique en production plutôt que de devoir tout annuler après le premier échec.

Découvrez comment la solution de TrueFoundry Passerelle IA gère les coûts, la gouvernance MCP et l'observabilité au sein d'un seul plan de contrôle, ou réservez une démonstration pour explorer son intégration avec votre propre pile technologique.

Try now.

One gateway for all your models, MCP servers, and agents.
No credit card needed.

INSCRIVEZ-VOUS
Table des matières

Gouvernez, déployez et suivez l'IA dans votre propre infrastructure

Réservez un séjour de 30 minutes avec notre Expert en IA

Réservez une démo

Le moyen le plus rapide de créer, de gérer et de faire évoluer votre IA

Démo du livre
Summarize with
ChatGPT logo by OpenAI
Perplexity AI logo
Blurry red snowflake on white background, symmetrical frosty design with soft edges and abstract shape.

Découvrez-en plus

Aucun article n'a été trouvé.
October 10, 2026
|
5 min de lecture

10 meilleurs outils LLmops en 2026

comparaison
October 10, 2026
|
5 min de lecture

5 leçons sur l'exploitation d'IA agentique en production - D'après la discussion au coin du feu

Aucun article n'a été trouvé.
October 10, 2026
|
5 min de lecture

Passer à zéro dans Kubernetes : une plongée approfondie dans Elasti

Ingénierie et produits
October 10, 2026
|
5 min de lecture

L'observabilité dans les flux de travail LLM : transformer les boîtes noires en boîtes en verre

Aucun article n'a été trouvé.
Aucun article n'a été trouvé.

Blogs récents

Black left pointing arrow symbol on white background, directional indicator.
Black left pointing arrow symbol on white background, directional indicator.

Questions fréquemment posées

Qu'est-ce que la gouvernance de l'IA agentique ?

La gouvernance de l'IA agentique est l'ensemble des contrôles qui garantissent la sécurité, la traçabilité et la maîtrise des coûts des agents autonomes en production : visibilité et limites des coûts, journalisation unifiée, contrôle d'accès aux outils et aux MCPs que les agents peuvent appeler, et garde-fous appliqués sous forme de politique. En pratique, les entreprises l'appliquent par l'intermédiaire d'un plan de contrôle centralisé, ou d'une passerelle d'IA, par lequel passe chaque requête d'agent.

Comment une passerelle IA aide-t-elle à contrôler le coût de l'IA agentique ?

Une passerelle IA voit tout le trafic, elle peut donc afficher les dépenses par utilisateur, équipe et application, appliquer des budgets et des limites de débit avant que les coûts n'augmentent, et acheminer chaque requête vers le modèle le mieux adapté. Cela couvre les trois niveaux de coût : visibilité, contrôle et routage.

Qu'est-ce qu'une passerelle MCP et pourquoi les entreprises en ont-elles besoin ?

Une passerelle MCP est une couche centrale qui enregistre vos serveurs MCP et applique un contrôle d'accès au niveau des outils, vous permettant ainsi de décider quels utilisateurs accèdent à quels outils avec quelle authentification. Elle transforme la prolifération N-par-M de clients, serveurs et outils en un système que vous pouvez gouverner et auditer depuis un seul endroit.

Comment gérez-vous l'IA de l'ombre et les agents intraçables ?

Vous acheminez les agents via une infrastructure qui enregistre et authentifie par défaut, plutôt que de les laisser déployer de manière ad hoc. Intégrez la traçabilité dès le départ, car les agents non déterministes ne peuvent pas être tracés de manière fiable après coup, et nécessitent des comptes de service plutôt que des identifiants personnels pour tout ce qui est déployé.

Puis-je exécuter TrueFoundry dans mon propre VPC ou sur site ?

Oui. TrueFoundry fonctionne dans votre VPC, sur site, en environnement isolé (air-gapped), en mode hybride ou sur plusieurs clouds, et aucune donnée ne quitte votre domaine. C'est la principale raison pour laquelle les entreprises réglementées le préfèrent aux passerelles SaaS uniquement.

S'intègre-t-elle à ma pile d'observabilité existante ?

Oui. La passerelle est compatible OpenTelemetry et s'intègre à Grafana, Datadog, Prometheus, ou à votre pile technologique préférée. Elle trace chaque requête, du prompt à l'exécution de l'outil et du modèle, vous offrant ainsi une journalisation unifiée sans avoir à remplacer ce que vous utilisez déjà.

Faites un rapide tour d'horizon des produits
Commencer la visite guidée du produit
Visite guidée du produit