Blank white background with no objects or features visible.

Nous vous offrons un accès gratuit à l'intégralité du Gartner Hype Cycle for AI Governance 2026. Obtenez votre exemplaire →

Limitation de débit d'API pour les LLM : comptez les jetons, pas les requêtes

Par Ashish Dubey

Published: October 6, 2026

Token-Based Rate Limiting and Budgeting — TrueFoundry

‍

Try now.

One gateway for all your models, MCP servers, and agents.
No credit card needed.

INSCRIVEZ-VOUS
Table des matières

Gouvernez, déployez et suivez l'IA dans votre propre infrastructure

Réservez un séjour de 30 minutes avec notre Expert en IA

Réservez une démo

Le moyen le plus rapide de créer, de gérer et de faire évoluer votre IA

Démo du livre
Summarize with
ChatGPT logo by OpenAI
Perplexity AI logo
Blurry red snowflake on white background, symmetrical frosty design with soft edges and abstract shape.

Découvrez-en plus

Aucun article n'a été trouvé.
October 10, 2026
|
5 min de lecture

10 meilleurs outils LLmops en 2026

comparaison
October 10, 2026
|
5 min de lecture

5 leçons sur l'exploitation d'IA agentique en production - D'après la discussion au coin du feu

Aucun article n'a été trouvé.
October 10, 2026
|
5 min de lecture

Passer à zéro dans Kubernetes : une plongée approfondie dans Elasti

Ingénierie et produits
October 10, 2026
|
5 min de lecture

L'observabilité dans les flux de travail LLM : transformer les boîtes noires en boîtes en verre

Aucun article n'a été trouvé.
Aucun article n'a été trouvé.

Blogs récents

Black left pointing arrow symbol on white background, directional indicator.
Black left pointing arrow symbol on white background, directional indicator.

Questions fréquemment posées

Qu'est-ce que la limitation de débit d'API pour le trafic LLM, et en quoi est-elle différente ?

La même idée — plafonner ce qu'un appelant peut consommer sur une fenêtre — mais l'unité change. La limitation de débit d'API classique compte les requêtes, ce qui fonctionne lorsque les requêtes coûtent à peu près la même chose. Les requêtes LLM varient de plusieurs ordres de grandeur en tokens, si bien qu'une limite de tokens reflète bien mieux la consommation réelle. Utilisez les deux : les tokens régissent le rythme des dépenses, les requêtes protègent la connexion contre les tempêtes de nouvelles tentatives.

Dois-je utiliser une limitation de débit basée sur les tokens ou un budget ?

Les deux. Une limite de tokens est un contrôle de débit sur une fenêtre glissante : elle empêche un appelant de monopoliser la capacité à l'instant présent. Un budget est un contrôle financier sur une période calendaire : il empêche une équipe de trop dépenser ce mois-ci. Une limite de tokens ne peut pas exprimer des dollars, puisqu'un même nombre de tokens coûte des montants différents selon les modèles — et un budget ne dit rien de la minute en cours.

Qu'advient-il de mon quota lorsqu'une requête échoue ?

Une requête en échec — rejetée par la passerelle, ou mise en échec par le fournisseur avec un code 4XX ou 5XX — compte pour une requête dans chaque règle requests_per_* à laquelle elle correspondait. La seule exception est une requête déjà rejetée avec un 429 par la limitation de débit elle-même. Les limites de tokens ne sont pas affectées : une requête en échec ne déclare aucun token.

Puis-je déployer TrueFoundry dans mon propre VPC ou on-premise ?

Oui. TrueFoundry s'exécute dans votre VPC, on-premise, en environnement air-gapped ou en hybride, de sorte que les prompts et les réponses ne quittent jamais votre domaine, même lorsque vous routez vers de nombreux fournisseurs.

Qu'ajoute la passerelle à la latence des requêtes ?

Environ 3 à 4 ms de surcoût, en traitant plus de 350 RPS sur un seul vCPU, pour plus de 1 000 LLM pris en charge. L'exception est le classifieur LLM facultatif, qui ajoute un véritable appel de modèle avant le transfert de la requête.

S'intègre-t-elle à ma stack d'observabilité ?

Oui. La passerelle est conforme à OpenTelemetry et se connecte à Grafana, Datadog ou Prometheus. Chaque appel au classifieur LLM produit son propre span, de sorte que la latence du classifieur est visible séparément de celle du modèle servi.

Faites un rapide tour d'horizon des produits
Commencer la visite guidée du produit
Visite guidée du produit