Blank white background with no objects or features visible.

Nous vous offrons un accès gratuit à l'intégralité du Gartner Hype Cycle for AI Governance 2026. Obtenez votre exemplaire →

Baseten vs Modal : Tarification, démarrages à froid et ce que cachent les grilles tarifaires

Par Ashish Dubey

Published: October 6, 2026

⚡ TL;DR
  • Choose Baseten if you need inference in your own VPC, you handle PHI, you want TensorRT-LLM-class optimisation without building it, or you run small and region-pinned GPUs.
  • Choose Modal if you need more than a model server: sandboxes for untrusted code, batch, notebooks, RL environments. Modal says Sandboxes alone drive over a third of revenue, and its Python ergonomics are the best around.
  • Choose TrueFoundry if the workload has to run inside your own cloud account and you want one control plane over self-hosted models and commercial APIs.
  • The key trade-off is where the platform runs and what the rate card counts. Modal’s headline GPU rates look 37-40% cheaper on big cards. Add the CPU and memory Baseten bundles into its SKUs and the real H100 gap is about 19%, A100 80GB is a coin flip, and on T4 and A10 Baseten is cheaper.

Il s'agit dans les deux cas de plateformes GPU serverless, qui passent par défaut à zéro et gèrent le trafic de production pour des entreprises renommées. C'est une concurrence loyale, mais leurs approches diffèrent. Baseten a conçu une plateforme dédiée au déploiement de modèles qu'elle a ensuite étendue. Modal a construit une plateforme de calcul généraliste où l'inférence n'est qu'un produit parmi six. Cela se reflète dans le SDK, dans les éléments pris en compte par la grille tarifaire et dans la possibilité d'exécuter les services sur votre propre compte.

L'élément le plus utile ci-dessous concerne la méthodologie de tarification, car les tarifs horaires GPU publiés sont incomparables entre ces deux solutions, et l'écart est suffisamment important pour influencer une décision. Chiffres vérifiés le 25 septembre 2026.

Baseten : aperçu

Baseten propose l'inférence en production pour les modèles open source, personnalisés et affinés, via des déploiements dédiés, des API de modèles au jeton et l'entraînement (tarification).

Fondée en 2019 par Tuhin Srivastava (PDG), Amir Haghighat (CTO), Phil Howes et Pankaj Gupta. Le financement a suivi les séries B, C, D et une série E de 300 millions de dollars pour une valorisation de 5 milliards, jusqu'à une série F de 1,5 milliard de dollars pour une valorisation de 13 milliards de dollars le 22 juin 2026 (annonce) ; le total levé dépasse les 2 milliards de dollars. Le chiffre d'affaires aurait été multiplié par 20 d'une année sur l'autre ; le revenu annuel récurrent (ARR) n'est pas public [À VÉRIFIER]. Parmi les clients, on compte Cursor, Notion, Harvey, HubSpot, OpenEvidence et Vercel.

Concernant un chiffre que vous avez peut-être vu : les rapports de presse de fin septembre 2026 (Axios le 22 sept., Bloomberg le 23 sept.) décrivent discussions autour d'un tour de table bien plus important, avoisinant les 26 milliards de dollars. Baseten n'a rien publié à ce sujet. 13 milliards de dollars est le dernier chiffre confirmé et celui que nous utilisons.

[CAPTURE D'ÉCRAN : Baseten — le tableau de bord Dedicated Deployments affichant les états des réplicas, la configuration de l'autoscaling et les percentiles de latence pour un modèle en production]

  • Tarification. L'offre Basic est à 0 $/mois avec paiement à l'usage incluant les certifications SOC 2 Type II et HIPAA, et aucun frais de plateforme sur aucun niveau publié; les offres Pro et Enterprise sont sur devis, l'offre Enterprise ajoutant des SLA, des déploiements auto-hébergés, la résidence des données et un contrôle d'accès basé sur les rôles (RBAC) avancé. La facturation est à la minute, sans frais pour les périodes d'inactivité. Des crédits gratuits existent, montant non publié [À VÉRIFIER]. Baseten publie également une grille tarifaire par jeton — GPT OSS 120B à 0,10 $ en entrée / 0,50 $ en sortie par million de jetons.
  • Démarrages à froid. Le Baseten Delivery Network met en cache les poids par paliers — NVMe local au nœud, cache pair au sein du cluster, puis origine miroir — permettant des démarrages 2 à 3 fois plus rapides démarrages à froid à partir de plus de 2 Go/s vers des nœuds H100 et, point important sur le plan commercial, « le transfert de poids ne consomme pas de temps GPU facturable » (article BDN, 9 avril 2026). Aucun chiffre de latence en secondes n'est présent dans la documentation actuelle [À VÉRIFIER]. Blog Baseten Les mentions « Dernière mise à jour » indiquent des dates de modification, pas des dates de publication.
  • Déploiement et SDK. Truss packaging — config.yaml accompagné d'un fichier optionnel model/model.py avec les fonctions load et predict, ou votre propre image Docker — avec baseten model push --watch pour un déploiement de développement avec rechargement en direct et baseten model push pour une version de production immuable. La concurrence est gérée sur deux niveaux — concurrency_target pour l'autoscaler, predict_concurrency à l'intérieur du conteneur — et le multi-nœud avec InfiniBand est pris en charge.
  • Auto-hébergé et multi-cloud — l'élément différenciateur le plus clair. Baseten Cloud ; Auto-hébergé, plan de charge de travail dans votre VPC, où « les requêtes d'inférence sont acheminées directement vers votre plan de charge de travail sans passer par l'infrastructure Baseten »; et Hybride, avec débordement. Au-dessus, on trouve la gestion de capacité multi-cloud, commercialisée sous le nom de « 20+ clouds réunis en un seul pool de GPU », avec basculement inter-régional.
  • Observabilité et conformité. Percentiles de latence, états des réplicas et métriques GPU, ainsi que mét riques vLLM et SGLang natives détectées automatiquement sans configuration; Prometheus, OTLP et traçage OTel. SOC 2 Type II, HIPAA, RGPD, avec aucune conservation de données par défaut pour l'inférence synchrone. ISO 27001 [À VÉRIFIER] ; tarification de la sortie de données non trouvée [À VÉRIFIER].

Baseten a également acquis Blaxel, une entreprise spécialisée dans les bacs à sable pour agents et l'infrastructure microVM, annoncé le 10 septembre 2026, conditions non divulguées (annonce) — une incursion directe sur le terrain des Sandboxes de Modal, vieux de deux semaines et sans rien de concret à évaluer pour le moment.

Vraiment meilleur pour : les acheteurs soumis à des réglementations ayant besoin d'une inférence dans leur propre VPC, là où Modal n'a aucun équivalent ; toute personne traitant des données de santé (PHI), puisque la conformité HIPAA est incluse dans l'offre gratuite ; les équipes souhaitant une optimisation de type TensorRT-LLM sans avoir à la développer ; et les charges de travail limitées à une région ou nécessitant de petits GPU.

Modal : aperçu

Modal se définit comme « un cloud conçu pour l'IA. Pas un cloud GPU à usage unique, mais une plateforme dotée des primitives adaptées » (article sur la série C). Produits : Inférence, Sandboxes, Entraînement, Notebooks, Batch, Plateforme principale. Cette liste constitue l'argument : l'inférence n'est qu'un élément parmi d'autres.

Fondée en 2021 par Erik Bernhardsson et Akshat Bubna ; l'année de création provient de TechCrunch, et non d'une page Modal [À VÉRIFIER]. L'équipe a développé son propre système de fichiers, son runtime de conteneur, son ordonnanceur et son générateur d'images, ce qui se reflète dans les temps de démarrage à froid. Le financement a suivi les étapes d'amorçage, de série A et une série B de 87 M$ pour une valorisation de 1,1 Md$, jusqu'à une série C de 355 M$ pour une valorisation de 4,65 Md$ après financement le 21 mai 2026; soit un total de « plus de 466 M$ ». Modal publie ce que Baseten ne communique pas : « dépassant les 300 millions de dollars de revenus annualisés », et ce « Les Sandboxes génèrent déjà plus d'un tiers de nos revenus ». Parmi ses clients figurent Cognition, DoorDash, Suno et Ramp.

[CAPTURE D'ÉCRAN : Modal — le tableau de bord de l'application affichant le nombre de conteneurs, l'utilisation des GPU et le temps de démarrage à froid pour une fonction déployée]

  • Tarification. Starter 0 $/mois plus calcul, 30 $/mois de crédit de calcul offert, 1 jour de rétention des logs. Équipe 250 $/mois plus de calcul, 100 $/mois de calcul gratuit, 30 jours de journaux. Offre Entreprise personnalisée, incluant journaux d'audit, SSO SAML, HIPAA et RBAC. La facturation est par seconde, et voici le point crucial : Le CPU et la mémoire sont facturés séparément du GPU — le CPU à 0,04716 $ par heure et par cœur physique, la mémoire à 0,007992 $/GiB/h. Le coût du CPU et de la mémoire pour les environnements Sandbox et Notebook est 3 fois supérieur au tarif des fonctions. Le choix de la région est 1,15x large ou 1,75x restreint ; le mode non préemptible est 3x. Pas de grille tarifaire par jeton.
  • Démarrages à froid. Les conteneurs démarrent en une seconde environ. Instantanés de mémoire les fonctionnalités nommées : snapshots CPU en disponibilité générale (GA), snapshots GPU en version Alpha. La documentation de Modal indique 3 à 10 fois plus rapide et le blog technique annonce 10 fois (passage de 20 s à 2 s pour Parakeet). L'article sur la série C de Modal mentionnait un facteur « 100x » que sa propre documentation et son blog technique ne confirment pas ; il faut donc retenir le chiffre de 3 à 10 fois. Les snapshots GPU « n'accélèrent pas le chargement des modèles depuis le stockage » et « peuvent même le ralentir en ajoutant une surcharge », sont généralement incompatibles avec le code multi-GPU et expirent après 7 jours.
  • Déploiement et SDK. Python basé sur des décorateurs — @app.function(), @app.cls(), @modal.fastapi_endpoint() — avec des images définies en Python par chaînage de méthodes plutôt que par un Dockerfile, et modal run / modal deploy / modal serve pour la boucle de développement. Les conteneurs s'exécutent sous gVisor; les SDK JS et Go sont en version bêta. Les régions sont larges (us, eu, ap) ou spécifiques (us-west, jp) et strictement définies ; les clusters multi-nœuds sont en version bêta. Si vous aimez définir votre infrastructure en Python, c'est l'expérience développeur la plus agréable de cette catégorie.
  • Aucune option auto-hébergée. Pas de déploiement BYOC, sur site ou dans un VPC client : l'offre Entreprise ne propose aucune fonctionnalité de choix de lieu de déploiement, le paramètre cloud= détermine sur quel cloud Modal planifie les tâches plutôt que sur votre propre compte, et le fichier llms.txt ne contient aucune occurrence de BYOC, auto-hébergement, sur site ou VPC. La limite de résidence des données mérite d'être citée : tous les journaux, tout le stockage durable, les charges utiles de fonctions supérieures à 2 Mio et toutes les charges utiles asynchrones sont stockés aux États-Unis, quelle que soit la région du conteneur.
  • Observabilité et conformité. Utilisation du GPU, alimentation, température et mémoire, avec la mise en garde de Modal précisant que ces données « ne peuvent pas être utilisées pour déboguer directement les problèmes de performance », ainsi qu'une exportation OTLP partout. SOC 2 Type 2 oui. La conformité HIPAA est qualifiée — BAA requis, Réservé aux entreprises, et les Volumes v1, les Images, les instantanés de mémoire et le code utilisateur sont exclus du champ d'application du BAA. Les entrées et sorties sont conservées jusqu'à 7 jours. ISO 27001 [VÉRIFIER] — non listé.

[CAPTURE D'ÉCRAN : Modal — la page de tarification montrant le tableau des GPU aux côtés des postes distincts pour le CPU et la mémoire]

Vraiment meilleur pour : tout ce qui n'est pas un serveur de modèle — environnements isolés (sandboxes), code non approuvé, environnements RL, traitement par lots, notebooks. Ergonomie Python. Charges de travail avec GPU puissants, non épinglées et irrégulières. Large éventail de GPU, car les L40S, A100 40 Go et B300 n'ont pas d'équivalent chez Baseten. Et les démarrages à froid intensifs en initialisation, dominés par le JIT et les importations plutôt que par le chargement des poids.

Comparaison de l'architecture et du déploiement

Aspect Baseten Modal
Latest confirmed round $1.5B Series F at $13B, 22 Jun 2026 $355M Series C at $4.65B, 21 May 2026
Core abstraction Model server (Truss) Python function (@app.function())
Billing Per minute, bundled instance SKUs Per second, GPU + CPU + memory separate
Platform fee $0 on all published tiers $0 / $250 per month / custom
Scale-to-zero Default, scale_down_delay 900s Default, scaledown_window 60s
Concurrency concurrency_target + predict_concurrency Opt-in @modal.concurrent, 4,000 cap
Engines vLLM, SGLang, TensorRT-LLM (4 proprietary) vLLM, SGLang. No TensorRT-LLM, no TGI
Cold-start approach Weight delivery: BDN 2-3x, off the billing clock Process state: snapshots 3-10x, GPU Alpha
Self-hosted / VPC Yes — Cloud, Self-hosted, Hybrid No — hosted only
HIPAA Yes, from the free tier Enterprise only, BAA, scope exclusions
Residency limit Your VPC if self-hosted Logs and storage always in the US

La vérité sur les démarrages à froid : ils résolvent deux aspects différents du même problème. Baseten s'attaque à la livraison des poids et exclut le transfert de la facturation. Modal s'attaque à l'état du processus avec la restauration d'instantanés, ce qui n'aide explicitement pas au chargement des poids. Si votre démarrage à froid implique 140 Go de poids, l'approche de Baseten est la plus pertinente ; s'il s'agit d'importations, de JIT et de capture de graphes CUDA, celle de Modal est préférable.

Tarification des GPU : le tarif affiché et le tarif réel

Méthodologie. Baseten publie des tarifs à la minute pour des instances tout compris — le GPU est fourni avec un nombre fixe de vCPU et de RAM. Modal publie des tarifs à la seconde pour le GPU uniquement, le CPU et la mémoire étant facturés séparément. Pour comparer ce qui est comparable, convertissez les deux en tarifs horaires (Baseten x60, Modal x3600), puis ajoutez au tarif GPU de Modal le coût du CPU et de la mémoire inclus dans les offres Baseten, aux tarifs de Modal : 0,04716 $ par heure et par cœur physique (un cœur = deux vCPU) et 0,007992 $ par heure et par Gio. Le pinning et les multiplicateurs pour les instances non préemptibles sont exclus ; les ajouter rendrait Modal encore plus onéreux. Sources : baseten.co/pricing, docs.baseten.co/deployment/resources, modal.com/pricing.

Tarifs officiels affichés

GPU Baseten $/hr Baseten bundled vCPU / RAM Modal $/hr (GPU only) Headline gap
H100 80GB SXM $6.4998 16 / 118 GiB $3.9492 Modal -39.2%
A100 80GB $4.0002 12 / 144 GiB $2.4984 Modal -37.5%
A100 40GB not listed — $2.0988 Modal only
L40S 48GB not listed — $1.9512 Modal only
A10 / A10G 24GB $1.2072 4 / 16 GiB $1.1016 Modal -8.7%
T4 16GB $0.6312 4 / 16 GiB $0.5904 Modal -6.5%

Ajusté — Modal aligné sur le CPU et la RAM inclus par Baseten

Configuration Baseten all-in Modal GPU + CPU + RAM Modal total Real gap
H100 80GB + 16 vCPU + 118 GiB $6.4998 $3.9492 $0.3773 $0.9431 $5.2696 Modal -18.9%
A100 80GB + 12 vCPU + 144 GiB $4.0002 $2.4984 $0.2830 $1.1508 $3.9322 Modal -1.7%, parity
A10 + 4 vCPU + 16 GiB $1.2072 $1.1016 $0.0943 $0.1279 $1.3238 Baseten -8.8%
T4 + 4 vCPU + 16 GiB $0.6312 $0.5904 $0.0943 $0.1279 $0.8126 Baseten -22.3%

Les modèles L40S et A100 40 Go ne disposent pas d'équivalent SKU chez Baseten pour effectuer un ajustement.

Ce qu'il faut retenir : « Modal est 40 % moins cher sur H100 » tombe à environ 19 % une fois que vous achetez un CPU et une mémoire comparables, se situe à quasi parité sur A100 80 Go, et s'inverse sur les petits GPU, où Baseten est 9 à 22 % moins cher. Ajoutez le pinning ou le multiplicateur 3x pour les instances non préemptibles, et Baseten l'emporte haut la main sur toute charge de travail garantie.

Un piège pour les benchmarks : le gpu="A100" de base de Modal peut être mis à niveau silencieusement vers 80 Go, et gpu="H100" peut atterrir sur un H200. Fixez-le avec gpu="H100!".

Où les équipes rencontrent des difficultés

1. La grille tarifaire n'est pas la facture. Les équipes définissent un budget à partir d'un coût horaire par GPU, puis doivent gérer le CPU, la mémoire, les volumes, les multiplicateurs de région et un tarif sandbox 3x. Le regroupement de Baseten est plus facile à prévoir ; la tarification détaillée de Modal est plus fidèle à la consommation réelle. Aucune des deux n'est comparable sans le calcul ci-dessus.

2. Le choix de la région n'est pas la résidence des données. Modal fixera un conteneur sur eu-west tout en stockant vos logs, votre stockage durable et toute charge utile supérieure à 2 Mio aux États-Unis. Si un régulateur pose la question, la région du conteneur n'est pas la réponse.

3. Le serveur de modèle n'est qu'une partie du système. Vous avez également besoin d'API de modèles commerciaux, d'authentification, d'attribution des coûts, de limites de débit, de garde-fous et d'une piste d'audit. Aucune des deux plateformes ne couvre cette couche, et adopter l'une ou l'autre vous laisse cette responsabilité.

Running inference across more than one platform?
Put a gateway in front of self-hosted models and commercial APIs so cost, latency and access control live in one place.

La position de TrueFoundry : une question différente

Une réponse directe plutôt qu'une course à trois fabriquée. Baseten et Modal sont des clouds d'inférence hébergés. TrueFoundry s'exécute dans votre propre compte cloud. Acheteur différent, problème différent.

Ils répondent à « comment servir ce modèle sans gérer de GPU ». TrueFoundry répond à « nous avons déjà de la capacité GPU, des engagements de dépenses ou un régulateur, et nous avons besoin d'une plateforme sur notre propre infrastructure ». Si la première question est la vôtre, achetez l'un d'eux — le mode auto-hébergé de Baseten est ce qui s'en rapproche le plus.

The control plane path for AI traffic
Le plan de contrôle pour le trafic IA

TrueFoundry se déploie en mode SaaS dans plus de 12 régions sur trois clouds, ou en auto-hébergement dans votre VPC via Helm et OpenTofu/Terraform, ou encore sur site, y compris en environnement isolé (air-gapped). En auto-hébergement, tout le trafic LLM reste au sein de votre infrastructure et TrueFoundry n'est pas sur le chemin critique. Le service couvre vLLM, SGLang, Triton, TorchServe, MLflow et LitServe, et inclut un registre de modèles, l'autoscaling sur CPU, RPS ou cron, ainsi que le partitionnement de GPU via time-slicing et MIG — ce qui est essentiel lorsque vous possédez le matériel et qu'allouer un H100 complet à un petit modèle serait un gaspillage.

Routing configuration in the AI Gateway
Configuration du routage dans l'AI Gateway

L'autre moitié est l' AI Gateway, où l'inférence auto-hébergée et l'inférence managée ne sont plus des problèmes distincts. Elle centralise plus de 1 000 LLM derrière une API compatible OpenAI, ajoute environ 3 à 4 ms de latence et gère plus de 350 RPS sur 1 vCPU, permettant ainsi à vos endpoints Baseten, Modal et à votre clé OpenAI de se retrouver derrière une interface unique avec une attribution des coûts, des limites de débit et une piste d'audit partagées. Le routage automatique est le levier de réduction des coûts : sur 550 prompts, le routage basé sur la complexité a réduit les coûts de 69 % tout en conservant 98 % de la qualité, avec une latence moyenne passant de 7,6 s à 4,0 s.

Model and traffic metrics in one place
Métriques de modèle et de trafic centralisées

Transparence : TrueFoundry n'est pas une place de marché GPU serverless ; vous devez fournir votre propre capacité. Si vous n'avez pas de GPU et ne souhaitez pas en acquérir, tournez-vous plutôt vers Baseten ou Modal.

Already have cloud commitments or your own GPUs?
Run models and route commercial APIs from one control plane inside your account.

Comparatif direct

Capability Baseten Modal TrueFoundry
Category Hosted inference cloud Hosted general AI compute Control plane in your cloud
Runs in your account Yes — Self-hosted / Hybrid No Yes — VPC, on-prem, air-gapped
Commercial LLM routing No No 1,000+ models, one API
GPU pricing shape Bundled SKUs, per minute GPU + CPU + memory, per second Your cloud’s rates
Cost attribution Within Baseten Within Modal Self-hosted and commercial
Best for Regulated, VPC, TensorRT-LLM, small GPUs Sandboxes, Python DX, large GPU Own-cloud teams

Lectures complémentaires

Conclusion

Baseten et Modal sont tous deux de bonnes solutions. La comparaison est serrée sur le critère principal — le prix — mais très différente sur les aspects qui déterminent réellement les décisions d'achat.

Si votre charge de travail doit s'exécuter dans votre propre VPC, si vous gérez des données de santé (PHI), si vous souhaitez utiliser TensorRT-LLM sans effectuer le travail d'ingénierie, ou si vous utilisez des GPU de petite taille et dédiés, Baseten est la solution. Si vous avez besoin d'environnements isolés (sandboxes), de traitement par lots et de notebooks en plus de l'inférence, ou si l'ergonomie Python est votre priorité absolue, choisissez Modal.

Ce que nous vous déconseillons, c'est de choisir uniquement sur la base du tarif GPU affiché. Il n'est pas comparable entre ces deux fournisseurs, et une analyse corrigée transforme un avantage apparent de 40 % en 19 %, en une égalité, voire en un avantage pour l'autre fournisseur.

Si votre contrainte réelle est que la charge de travail doit rester au sein d'une infrastructure que vous possédez et financez déjà, aucune de ces plateformes hébergées ne convient. Il s'agit d'un problème de plan de contrôle, et c'est précisément ce que nous avons conçu.

Commencez gratuitement avec TrueFoundry

Try now.

One gateway for all your models, MCP servers, and agents.
No credit card needed.

INSCRIVEZ-VOUS
Table des matières

Gouvernez, déployez et suivez l'IA dans votre propre infrastructure

Réservez un séjour de 30 minutes avec notre Expert en IA

Réservez une démo

Le moyen le plus rapide de créer, de gérer et de faire évoluer votre IA

Démo du livre
Summarize with
ChatGPT logo by OpenAI
Perplexity AI logo
Blurry red snowflake on white background, symmetrical frosty design with soft edges and abstract shape.

Découvrez-en plus

Aucun article n'a été trouvé.
October 10, 2026
|
5 min de lecture

10 meilleurs outils LLmops en 2026

comparaison
October 10, 2026
|
5 min de lecture

5 leçons sur l'exploitation d'IA agentique en production - D'après la discussion au coin du feu

Aucun article n'a été trouvé.
October 10, 2026
|
5 min de lecture

Passer à zéro dans Kubernetes : une plongée approfondie dans Elasti

Ingénierie et produits
October 10, 2026
|
5 min de lecture

L'observabilité dans les flux de travail LLM : transformer les boîtes noires en boîtes en verre

Aucun article n'a été trouvé.
Aucun article n'a été trouvé.

Blogs récents

Black left pointing arrow symbol on white background, directional indicator.
Black left pointing arrow symbol on white background, directional indicator.

Questions fréquemment posées

Baseten ou Modal : lequel est le moins cher ?

Cela dépend du GPU, et les tarifs publiés sont trompeurs. Sur les chiffres affichés, Modal paraît 37 à 40 % moins cher sur H100 et A100 80 Go. Ajoutez le CPU et la mémoire que Baseten inclut, et l'écart sur H100 se réduit à environ 19 %, l'A100 80 Go est à parité, et sur T4 et A10, Baseten est 9 à 22 % moins cher. Les multiplicateurs de Modal pour l'épinglage et la capacité non préemptible font encore pencher la balance vers Baseten, et ses frais Team de 250 $/mois sont un coût fixe que Baseten ne facture pas.

Quels sont exactement les tarifs de Modal ?

Starter à 0 $/mois avec 30 $/mois de calcul gratuit ; Team à 250 $/mois avec 100 $/mois de calcul gratuit ; Enterprise sur mesure. Le calcul est facturé à la seconde et détaillé : le GPU à son propre tarif, le CPU à 0,04716 $ par cœur physique-heure, la mémoire à 0,007992 $ par Gio-heure. Le calcul Sandbox et Notebook coûte 3 fois le tarif Function, et l'épinglage ainsi que la capacité non préemptible sont soumis à des multiplicateurs.

Quels sont exactement les tarifs de Baseten ?

Basic est à 0 $/mois en paiement à l'usage, sans frais de plateforme, et inclut SOC 2 Type II et HIPAA ; Pro et Enterprise sont sur devis. Le calcul GPU est facturé à la minute selon des SKU d'instance tout compris regroupant vCPU et RAM — 6,4998 $/h pour une H100 80 Go. Les tarifs par token de la Model API sont publiés ; le montant du crédit gratuit ne l'est pas.

Quelle est la rapidité des démarrages à froid de Modal ?

Les conteneurs démarrent en une seconde environ, et les Memory Snapshots offrent des restaurations 3 à 10 fois plus rapides selon la documentation de Modal. Le chiffre de « 100x » figurant dans l'article de Modal sur sa série C n'est pas étayé par sa propre documentation : tablez donc sur 3 à 10x. Les snapshots GPU sont en Alpha et n'accélèrent pas le chargement des poids depuis le stockage.

Baseten est-il valorisé à 26 milliards de dollars ?

Ce n'est pas confirmé. La dernière valorisation publiée par Baseten est de 13 milliards de dollars, à l'issue d'une série F de 1,5 milliard de dollars le 22 juin 2026. Des articles de presse de fin septembre 2026 évoquent des discussions autour d'un tour plus important, mais il s'agit d'informations au stade des pourparlers et l'entreprise n'a rien publié.

Faites un rapide tour d'horizon des produits
Commencer la visite guidée du produit
Visite guidée du produit