TrueFoundry lance TrueFailover pour rediriger automatiquement le trafic d'IA d'entreprise en cas de panne de modèle

Built for Speed: ~10ms Latency, Even Under Load
Blazingly fast way to build, track and deploy your models!
- Handles 350+ RPS on just 1 vCPU — no tuning needed
- Production-ready with full enterprise support
Lorsque OpenAI a subi une panne en décembre, l'un des clients de TrueFoundry a été confronté à une crise qui n'avait rien à voir avec les chatbots ou la génération de contenu. L'entreprise utilise des modèles de langage étendus pour faciliter le renouvellement d'ordonnances. Chaque seconde d'interruption signifiait des milliers de dollars de pertes de revenus, et des patients incapables d'accéder à leurs médicaments à temps.
TrueFoundry, une entreprise spécialisée dans l'infrastructure d'IA pour les entreprises, a annoncé mercredi un nouveau produit baptisé TrueFailover, conçu précisément pour éviter ce scénario. Le système détecte automatiquement les pannes, les ralentissements ou la dégradation de la qualité chez les fournisseurs d'IA, puis redirige le trafic de manière transparente vers des modèles et des régions de secours avant même que les utilisateurs ne s'aperçoivent du problème.
« Le défi est que, dans le monde de l'IA, le basculement n'est plus aussi simple », a déclaré Nikunj Bajaj, cofondateur et PDG de TrueFoundry, lors d'une interview exclusive avec VentureBeat. « Lorsque vous passez d'un modèle à un autre, vous devez également prendre en compte des facteurs tels que la qualité de la réponse, la latence et la compatibilité du prompt. Dans de nombreux cas, le prompt doit être ajusté en temps réel pour éviter une dégradation des résultats. Ce n'est pas quelque chose que la plupart des équipes sont en mesure de gérer manuellement. »
Cette annonce intervient à un moment charnière pour l'adoption de l'IA en entreprise. Les sociétés ont largement dépassé le stade de l'expérimentation. L'IA alimente désormais le renouvellement des ordonnances en pharmacie, génère des propositions commerciales, assiste les développeurs de logiciels et traite les demandes du support client. Lorsque ces systèmes tombent en panne, les conséquences se répercutent sur l'ensemble de l'organisation.
Pourquoi les systèmes d'IA en entreprise restent dangereusement dépendants de fournisseurs uniques
Les modèles de langage étendus d'OpenAI, Anthropic, Google et d'autres fournisseurs sont devenus une infrastructure essentielle pour des milliers d'entreprises. Mais contrairement aux services cloud traditionnels d'Amazon Web Services ou de Microsoft Azure — qui offrent des garanties de disponibilité robustes appuyées par des décennies d'expérience opérationnelle — les fournisseurs d'IA exploitent des systèmes complexes et gourmands en ressources qui restent sujets à des défaillances imprévues.
« Les principaux fournisseurs de LLM connaissent des pannes, des ralentissements ou des pics de latence toutes les quelques semaines ou mois, et nous constatons régulièrement l'impact en aval sur les entreprises qui dépendent d'un seul fournisseur », a expliqué Bajaj à VentureBeat.
La panne d'OpenAI en décembre, qui a touché le client pharmacien de TrueFoundry, illustre les enjeux. « À leur échelle, quelques secondes d'interruption peuvent se traduire par des milliers de dollars de revenus perdus », a expliqué Bajaj. « Au-delà de l'impact économique, il y a aussi une conséquence humaine lorsque les patients ne peuvent pas accéder à leurs ordonnances à temps. Comme ce client avait mis en place notre solution de basculement, il a pu rediriger les requêtes vers un autre fournisseur de modèle quelques minutes après la détection de la panne. Sans cette configuration, le rétablissement aurait probablement pris des heures. »
Le problème dépasse le cadre des pannes totales. Les défaillances partielles — où un modèle ralentit ou produit des réponses de moindre qualité sans être totalement hors ligne — peuvent discrètement détruire l'expérience utilisateur et violer les accords de niveau de service. Ces scénarios « lents mais techniquement opérationnels » s'avèrent souvent plus dommageables que les pannes spectaculaires, car ils échappent aux systèmes de surveillance traditionnels tout en érodant progressivement les performances.
Au cœur de la technologie qui maintient les applications d'IA en ligne en cas de défaillance des fournisseurs
TrueFailover fonctionne comme une couche de résilience au-dessus de l'AI Gateway de TrueFoundry, qui traite déjà plus de 10 milliards de requêtes par mois pour des entreprises du Fortune 1000. Le système combine plusieurs capacités interconnectées pour former un filet de sécurité unifié pour l'IA en entreprise.
Le produit permet essentiellement un basculement multi-modèle en autorisant les entreprises à définir des modèles principaux et de secours chez différents fournisseurs. Si OpenAI devient indisponible, le trafic bascule automatiquement vers Anthropic, Gemini de Google, Mistral ou des alternatives auto-hébergées. Le routage s'effectue de manière transparente, sans que les équipes applicatives n'aient à réécrire de code ou à intervenir manuellement.
Le système étend cette protection au-delà des frontières géographiques grâce à une résilience multi-région et multi-cloud. En répartissant les points de terminaison d'IA entre différentes zones et fournisseurs cloud, le routage basé sur l'état de santé peut détecter des problèmes dans des régions spécifiques et détourner le trafic vers des alternatives fonctionnelles. Ce qui aurait pu devenir un incident mondial se transforme en un ajustement d'infrastructure invisible, imperceptible pour les utilisateurs.
Plus important encore, TrueFailover utilise un routage conscient de la dégradation qui surveille en permanence la latence, les taux d'erreur et les signaux de qualité. « Nous examinons une combinaison de signaux qui indiquent ensemble quand les performances d'un modèle commencent à se dégrader », a expliqué Bajaj. « Les modèles de langage étendus sont des ressources partagées. Les fournisseurs utilisent la même instance de modèle pour de nombreux clients ; ainsi, lorsqu'une demande augmente pour un utilisateur ou une charge de travail, cela peut affecter tous les autres utilisateurs de ce modèle. »
Le système surveille l'augmentation des temps de réponse, la hausse des taux d'erreur et les modèles suggérant une instabilité. « Pris individuellement, aucun de ces signaux ne raconte toute l'histoire », a déclaré Bajaj. « Mais ensemble, ils nous permettent de détecter les signes avant-coureurs indiquant qu'un modèle ralentit ou devient peu fiable. Ces signaux alimentent un système piloté par l'IA capable de décider quand et comment rediriger le trafic avant que les utilisateurs ne subissent une baisse de qualité notable. »
La mise en cache stratégique complète cette protection en isolant les fournisseurs des pics de trafic soudains et en empêchant les effets de cascade liés aux limites de débit pendant les périodes de forte demande. Cela permet aux systèmes d'absorber les pics de charge et les limitations des fournisseurs sans subir de baisses de tension ou de ralentissements imprévus.
Cette approche représente un changement fondamental dans la manière dont les entreprises doivent envisager la fiabilité de l'IA. « TrueFailover est conçu pour gérer cette complexité automatiquement », a déclaré Bajaj. « Il surveille en permanence le comportement des modèles auprès de nombreux clients et cas d'utilisation, recherche des signes avant-coureurs comme une latence croissante et prend des mesures avant que les problèmes ne surviennent. La plupart des entreprises n'ont pas ce niveau de visibilité car elles ne peuvent voir que leurs propres systèmes. »
Le défi technique du changement de modèle sans sacrifier la qualité des résultats
L'un des défis les plus complexes du basculement en IA consiste à maintenir une qualité de résultat constante lors du passage d'un modèle à un autre. Un prompt optimisé pour GPT-5 peut produire des résultats différents sur Claude ou Gemini. TrueFoundry résout ce problème grâce à plusieurs mécanismes qui équilibrent vitesse et précision.
« Certaines équipes s'appuient sur le fait que les grands modèles sont devenus suffisamment performants pour que de petites différences dans les prompts n'affectent pas matériellement le résultat », a expliqué Bajaj. « Dans ces cas-là, le passage d'un fournisseur à un autre peut se faire avec un impact visible — ce n'est pas idéal, mais certaines équipes choisissent de le faire. »
Des implémentations plus sophistiquées conservent des prompts spécifiques au fournisseur pour une même application. « Lorsque le trafic bascule d'un modèle à un autre, le prompt bascule avec lui », explique Bajaj. « Dans ce cas, le basculement ne consiste pas seulement à changer de modèle. Il s'agit de passer à une configuration qui a déjà été testée. »
TrueFailover automatise ce processus. Le système achemine dynamiquement les requêtes et ajuste les prompts en fonction du modèle qui traite la requête, maintenant ainsi la qualité dans des limites acceptables sans intervention manuelle. L'essentiel, souligne Bajaj, est que « le basculement est planifié, et non réactif. La logique, les prompts et les garde-fous sont définis à l'avance, c'est pourquoi les utilisateurs finaux ne remarquent généralement pas lorsqu'un changement se produit. »
Il est important de noter que de nombreux scénarios de basculement ne nécessitent pas du tout de changer de fournisseur. « Il peut s'agir d'acheminer le trafic du même modèle d'une région à une autre, par exemple de la côte Est à la côte Ouest, où aucun changement de prompt n'est requis », note Bajaj. Cette flexibilité géographique constitue une première ligne de défense avant que des changements plus complexes entre fournisseurs ne deviennent nécessaires.
Comment les secteurs réglementés peuvent utiliser le basculement IA sans compromettre la conformité
Pour les entreprises de la santé, des services financiers et d'autres secteurs réglementés, la perspective d'un trafic IA automatiquement acheminé vers différents fournisseurs soulève des préoccupations immédiates en matière de conformité. Les données des patients ne peuvent pas simplement être transmises au modèle disponible par hasard. Les dossiers financiers exigent des contrôles stricts sur leurs lieux de transit. TrueFoundry a intégré des garde-fous explicites pour répondre à ces contraintes.
« TrueFailover n'acheminera jamais de données vers un modèle ou un fournisseur qu'une entreprise n'a pas explicitement approuvé », déclare Bajaj. « Tout est contrôlé via une couche de configuration administrateur où les équipes définissent des garde-fous clairs dès le départ. »
Les entreprises définissent exactement quels modèles sont éligibles au basculement, quels fournisseurs peuvent recevoir du trafic, et même quelles régions ou catégories de modèles — comme les modèles propriétaires par rapport aux modèles open source — sont acceptables. Une fois ces règles en vigueur, TrueFailover opère exclusivement dans ce cadre.
« Si un modèle ne figure pas sur la liste approuvée, il n'est tout simplement pas une option pour le routage », souligne Bajaj. « Il n'existe aucun scénario où le trafic est automatiquement envoyé vers une destination imprévue. L'idée est de donner aux équipes un contrôle total sur la conformité et les frontières des données, tout en permettant au système de réagir rapidement en cas de problème. De cette façon, la fiabilité s'améliore sans compromettre la sécurité ou les exigences réglementaires. »
Cette conception reflète les leçons tirées des déploiements existants de TrueFoundry en entreprise. Une société de santé classée au Fortune 50 utilise déjà la plateforme pour gérer plus de 500 millions d'appels IVR par an via un système d'IA agentique. Ce client avait besoin de pouvoir exécuter des charges de travail à la fois sur le cloud et sur une infrastructure sur site, tout en maintenant des contrôles stricts sur la résidence des données — exactement le type d'environnement hybride où les politiques de basculement doivent être définies avec précision.
Où le basculement automatique ne peut pas aider et ce que les entreprises doivent prévoir
TrueFoundry reconnaît que TrueFailover ne peut pas résoudre tous les problèmes de fiabilité. Le système fonctionne dans le cadre des garde-fous configurés par les entreprises, et ces configurations déterminent le niveau de protection possible.
« Si une équipe autorise le basculement d'un modèle large à haute capacité vers un modèle beaucoup plus petit sans ajuster les prompts ou les attentes, TrueFailover ne peut pas garantir la même qualité de sortie », explique Bajaj. « Le système peut acheminer le trafic, mais il ne peut pas faire en sorte qu'un modèle plus petit se comporte comme un plus grand sans une configuration appropriée. »
Les contraintes d'infrastructure limitent également la protection. Si une entreprise héberge ses propres modèles et qu'ils fonctionnent tous sur le même cluster GPU, TrueFailover ne peut pas aider lorsque cette infrastructure tombe en panne. « Lorsqu'il n'y a pas d'infrastructure alternative disponible, il n'y a rien vers quoi basculer », déclare Bajaj.
La question des pannes simultanées chez plusieurs fournisseurs surgit parfois dans les discussions sur les risques en entreprise. Bajaj soutient que ce scénario, bien que théoriquement possible, correspond rarement à la réalité. « En pratique, une "panne" ne signifie généralement pas qu'un fournisseur entier est hors ligne pour tous ses modèles et régions », explique-t-il. « Ce qui arrive beaucoup plus souvent, c'est un ralentissement ou une perturbation sur un modèle ou une région spécifique en raison de pics de trafic ou de problèmes de capacité. »
Lorsque cela se produit, le basculement peut intervenir à plusieurs niveaux : du sur site vers le cloud, du cloud vers le sur site, d'une région à une autre, d'un modèle à un autre, ou même au sein du même fournisseur avant de changer complètement de prestataire. « Cela rend très improbable une panne totale simultanée », déclare Bajaj. « L'essentiel est que la fiabilité repose sur des couches de redondance. Plus il y a de fournisseurs, de régions et de modèles inclus dans les garde-fous, plus la probabilité que les utilisateurs subissent une interruption complète est faible. »
Une startup qui a construit sa plateforme au cœur des déploiements IA du Fortune 500
TrueFoundry s'est imposée comme une infrastructure pour certains des plus grands déploiements d'IA au monde, offrant un contexte crucial à ses ambitions en matière de basculement. L'entreprise a levé 19 millions de dollars lors d'un tour de table de série A en février 2025, mené par Intel Capital avec la participation d'Eniac Ventures, Peak XV Partners et Jump Capital. Des investisseurs providentiels, dont Gokul Rajaram et Mohit Aron, ont également rejoint le tour, portant le financement total à 21 millions de dollars.
L'entreprise basée à San Francisco a été fondée en 2021 par Bajaj et ses cofondateurs Abhishek Choudhary et Anuraag Gutgutia, tous anciens ingénieurs de Meta qui se sont rencontrés en tant qu'étudiants à l'IIT Kharagpur. Initialement axée sur l'accélération des déploiements de machine learning, TrueFoundry s'est réorientée pour soutenir les capacités de l'IA générative lorsque la technologie s'est démocratisée en 2023.
La liste des clients de l'entreprise démontre une adoption à l'échelle de l'entreprise que peu de startups d'infrastructure IA peuvent égaler. Nvidia utilise TrueFoundry pour construire des systèmes multi-agents qui optimisent l'utilisation des clusters GPU dans les centres de données du monde entier — un cas d'usage où même de petites améliorations de l'utilisation se traduisent par un impact commercial substantiel, compte tenu de la demande insatiable en capacité GPU. Adopt AI achemine plus de 15 millions de requêtes et 40 milliards de jetons d'entrée via l'AI Gateway de TrueFoundry pour alimenter ses flux de travail agentiques en entreprise.
La société de jeux Games 24x7 sert des modèles de machine learning à plus de 100 millions d'utilisateurs via la plateforme, à des échelles dépassant 200 requêtes par seconde. La plateforme d'adoption numérique Whatfix a migré vers une architecture de microservices sur TrueFoundry, réduisant son cycle de publication par six et diminuant le temps de test de 40 %.
TrueFoundry compte actuellement plus de 30 clients payants dans le monde et a indiqué avoir dépassé 1,5 million de dollars de revenus récurrents annuels l'an dernier, tout en quadruplant sa base de clients. L'entreprise gère plus de 1 000 clusters pour des charges de travail liées à l'apprentissage automatique pour l'ensemble de ses clients.
TrueFailover sera proposé en tant que module complémentaire à la passerelle et à la plateforme TrueFoundry AI Gateway existantes. La tarification suivra un modèle basé sur l'utilisation, lié au volume de trafic ainsi qu'au nombre d'utilisateurs, de modèles, de fournisseurs et de régions concernés. Un programme d'accès anticipé pour les partenaires de conception sera lancé dans les semaines à venir.
Pourquoi les garanties de disponibilité du cloud traditionnel pourraient ne jamais s'appliquer aux fournisseurs d'IA
Les acheteurs de technologies en entreprise exigent depuis longtemps des engagements de disponibilité de la part des fournisseurs d'infrastructure. Amazon Web Services, Microsoft Azure et Google Cloud proposent tous des accords de niveau de service assortis de pénalités financières en cas de défaillance. Les fournisseurs d'IA seront-ils un jour confrontés à des attentes similaires ?
Bajaj identifie des contraintes fondamentales qui rendent les SLA traditionnels difficiles à atteindre avec la génération actuelle d'infrastructures d'IA. « La plupart des LLM fondamentaux fonctionnent aujourd'hui comme des ressources partagées, ce qui permet la tarification standard que vous voyez annoncée publiquement », explique-t-il. « Les fournisseurs proposent des engagements de disponibilité plus élevés, mais cela implique généralement une capacité dédiée ou une infrastructure réservée, et le coût augmente considérablement. »
Même avec des budgets substantiels, les entreprises sont confrontées à des quotas d'utilisation qui créent une exposition inattendue. « Si le trafic dépasse ces limites, les requêtes peuvent toujours basculer vers l'infrastructure partagée », précise Bajaj. « Cela rend difficile l'obtention du type de garanties strictes auxquelles les entreprises sont habituées avec les fournisseurs de cloud. »
L'économie liée à l'exécution de grands modèles de langage crée des obstacles supplémentaires qui pourraient persister pendant des années. « Les LLM restent extrêmement complexes et coûteux à exploiter. Ils nécessitent une infrastructure et une énergie massives, et nous ne prévoyons pas un avenir proche où la plupart des entreprises exécuteront plusieurs instances de modèles entièrement dédiées juste pour garantir la disponibilité. »
Cette réalité stimule la demande pour des solutions comme TrueFailover, qui assurent la résilience indépendamment de ce que les fournisseurs individuels peuvent promettre. « Les entreprises réalisent que la fiabilité ne peut pas dépendre uniquement du fournisseur de modèle », déclare Bajaj. « Elle nécessite des couches de protection supplémentaires pour gérer les réalités du fonctionnement actuel de ces systèmes. »
Le nouveau calcul pour les entreprises ayant intégré l'IA dans leurs processus métier critiques
Le moment choisi par TrueFoundry pour cette annonce reflète un changement fondamental dans la manière dont les entreprises utilisent l'IA — et ce qu'elles risquent de perdre en cas de défaillance. Ce qui a commencé comme une expérimentation interne a évolué vers des applications destinées aux clients, où les perturbations affectent directement les revenus et la réputation.
« De nombreuses entreprises ont expérimenté l'IA générative et les systèmes agents par le passé, et les cas d'utilisation en production étaient largement internes », observe Bajaj. « Il n'y avait aucun impact immédiat sur leur chiffre d'affaires ou sur la perception publique de l'entreprise. »
Cette époque est révolue. « Maintenant que ces entreprises ont lancé des applications publiques, où le chiffre d'affaires et l'image de marque peuvent être impactés en cas de panne, les enjeux sont bien plus élevés qu'il y a six mois. C'est pourquoi nous constatons une attention croissante sur ce sujet. »
Pour les entreprises qui ont intégré l'IA dans leurs processus métier critiques — du renouvellement d'ordonnances au support client en passant par les opérations commerciales — le calcul a totalement changé. La question n'est plus de savoir quel modèle est le plus performant sur les benchmarks ou quel fournisseur offre les fonctionnalités les plus séduisantes. La question qui empêche désormais les responsables technologiques de dormir est bien plus simple et urgente : que se passe-t-il lorsque l'IA disparaît au pire moment possible ?
Quelque part, un pharmacien prépare une ordonnance. Un agent de support client résout une plainte. Une équipe commerciale génère une proposition pour un contrat qui doit être conclu demain. Tous dépendent de systèmes d'IA qui dépendent eux-mêmes de fournisseurs qui, malgré leur envergure et leur sophistication, peuvent toujours tomber en panne sans préavis.
TrueFoundry parie que les entreprises seront prêtes à payer le prix fort pour garantir que ces moments d'interruption n'atteignent jamais les personnes qui comptent le plus : leurs clients.
Publié initialement sur VentureBeat
À propos de TrueFoundry :
TrueFoundry fournit une passerelle IA de qualité entreprise qui englobe une passerelle LLM, une passerelle MCP et une passerelle Agent, permettant aux entreprises de connecter, d'observer et de gouverner en toute sécurité l'accès aux modèles, outils, garde-fous et agents depuis un plan de contrôle unique. L'AI Gateway permet des charges de travail agentiques sécurisées, efficaces et pérennes grâce à des connexions unifiées et composables entre les fournisseurs.
Au-delà de la couche passerelle, TrueFoundry permet aux organisations de déployer et d'entraîner des LLM personnalisés sur des GPU, d'héberger des serveurs MCP et d'exécuter des agents personnalisés, le tout via une interface native Kubernetes. Elle prend en charge les installations sur site et VPC pour l'AI Gateway et les environnements de déploiement. TrueFoundry garantit une conformité de niveau entreprise avec les normes SOC 2, HIPAA et ITAR. Grâce à ses fonctionnalités intégrées de mise à l'échelle automatique, de mise en cache et d'optimisation des ressources, TrueFoundry permet aux organisations de construire, déployer et gouverner des systèmes d'IA de manière sécurisée, efficace et sur une pile technologique pérenne. Pour en savoir plus, visitez truefoundry.com
TrueFoundry AI Gateway delivers ~3–4 ms latency, handles 350+ RPS on 1 vCPU, scales horizontally with ease, and is production-ready, while LiteLLM suffers from high latency, struggles beyond moderate RPS, lacks built-in scaling, and is best for light or prototype workloads.
The fastest way to build, govern and scale your AI












.jpeg)


.jpeg)


.jpeg)
.webp)










