Skip to main content
Replicate est une plateforme permettant d’exécuter des modèles de machine learning open source dans le cloud, et l’un des exemples les plus aboutis de tarification à l’usage dans l’IA. Il n’y a ni abonnement mensuel ni tarif fixe par exécution de modèle. La plupart des modèles sont facturés en fonction du temps de calcul utilisé, mesuré à la seconde, à un tarif qui dépend du matériel. Certains modèles sont plutôt facturés en fonction des entrées et des sorties, par exemple par image ou par token (tarifs de Replicate). La facturation à la seconde convient aux workloads d’IA, car leurs durées d’exécution sont imprévisibles. Un utilisateur peut exécuter un modèle léger pendant quelques secondes, tandis qu’un autre peut exécuter un grand modèle génératif pendant plusieurs minutes. Comme le prix dépend du calcul utilisé plutôt que du modèle, il reste transparent quelle que soit l’échelle.

Comment Replicate facture

La tarification de Replicate basée sur le temps ne dépend pas du modèle. Que vous génériez une image avec SDXL ou que vous exécutiez Llama 3, la facture dépend du niveau de matériel et de la durée d’exécution. Replicate peut héberger des milliers de modèles open source sans définir un prix distinct pour chacun. L’implémentation ci-dessous utilise également des compteurs d’exemple pour les niveaux A40 et A100 (40GB), qui ne sont plus répertoriés sur la page de tarification de Replicate. Créez un compteur pour chaque niveau de matériel que vous proposez. Chaque exécution est mesurée sur le compteur correspondant au matériel utilisé :
  1. Tarifs spécifiques au matériel : le prix par seconde dépend des ressources de calcul utilisées. Chaque niveau de matériel possède son propre tarif.
  2. Modèle entièrement basé sur l’usage : il n’y a ni frais mensuels, ni quotas inclus, ni dépassements. Les utilisateurs paient le temps de calcul exact, par exemple « 12,4 secondes sur un A100 », et non par génération.
  3. Granularité à la seconde : les fournisseurs qui facturent à l’heure ou à la minute font payer du temps inutilisé pour les tâches courtes. La facturation à la seconde élimine ce gaspillage, aussi bien pour les petites expérimentations que pour les workloads de production importants.
Pour les modèles publics, Replicate facture uniquement le temps pendant lequel un modèle traite activement votre requête. La configuration (démarrage à froid) et le temps d’inactivité sont gratuits. Les modèles privés et les déploiements s’exécutent sur du matériel dédié : vous payez donc tout le temps pendant lequel leurs instances sont en ligne, notamment la configuration, l’inactivité et le traitement actif (documentation de facturation de Replicate).

Ce qui le rend unique

  • Mesure spécifique au matériel : le même modèle coûte plus cher sur un matériel plus rapide ; les utilisateurs arbitrent donc entre vitesse et coût. Un GPU T4 convient aux tâches qui ne sont pas urgentes, tandis qu’un A100 convient aux applications en temps réel.
  • Granularité à la seconde : la facturation est calculée à la seconde, afin que les utilisateurs ne paient pas le temps inutilisé lors des tâches courtes.
  • Aucun abonnement : les utilisateurs commencent sans engagement et le coût évolue avec l’utilisation. Cette approche convient aux startups et aux développeurs qui testent différents modèles.
  • Indépendant du modèle : la même logique de facturation s’applique à la génération d’images, au traitement de texte, à la transcription audio et à la synthèse vidéo. La plateforme prend en charge un vaste catalogue de modèles sans tableaux tarifaires complexes.

Créer ce modèle avec Dodo Payments

Vous pouvez créer ce modèle avec la facturation basée sur l’usage de Dodo Payments. Créez un compteur par niveau de matériel et associez-les tous à un même produit.
1

Create Usage Meters (One Per Hardware Class)

Créez un compteur distinct pour chaque niveau de matériel. Chaque niveau possède son propre prix par seconde ; des compteurs distincts permettent donc à Dodo Payments de facturer chaque niveau et de détailler la facture.L’agrégation Sum sur execution_seconds fournit le temps de calcul total par niveau de matériel pour la période de facturation.
2

Create a Usage-Based Product

Créez un produit dans le dashboard de Dodo Payments avec les paramètres suivants :
  • Type de tarification : Usage Based Billing
  • Prix de base : $0/mois (aucuns frais d’abonnement)
  • Fréquence de facturation : mensuelle
Ajoutez chaque compteur avec son prix par unité :Définissez le Seuil de gratuité sur 0 pour chaque compteur afin que chaque seconde d’exécution soit facturable.
3

Send Usage Events

Envoyez un événement d’utilisation à Dodo Payments lorsque chaque exécution de modèle se termine. Attribuez à chaque prédiction un event_id unique afin qu’un événement réessayé ne soit pas comptabilisé deux fois.
4

Measure Execution Time Precisely

Chronométrez chaque exécution de modèle avec performance.now() et arrondissez à la dixième de seconde la plus proche pour la facturation.
5

Create Checkout

Lorsqu’un utilisateur s’inscrit, créez une session de checkout pour le produit basé sur l’usage. Dodo Payments facture ensuite l’utilisation à chaque cycle et émet les factures.

Accélérer avec le Time Range Ingestion Blueprint

Le Time Range Ingestion Blueprint raccourcit le suivi du calcul à la seconde. Créez une instance d’ingestion par niveau de matériel et appelez trackTimeRange après chaque exécution.
Le blueprint crée et envoie l’événement, avec la durée comme durationMs dans les métadonnées. Définissez la Propriété Over de chaque compteur sur durationMs, ou envoyez durationSeconds pour conserver une tarification à la seconde. Avec une instance d’ingestion par niveau de matériel, cette configuration correspond directement à la mesure multi-niveaux de Replicate.
Pour les tâches de longue durée, combinez le Time Range Blueprint avec un suivi par heartbeat basé sur des intervalles, présenté dans Avancé : mesure par heartbeat. Consultez la documentation complète du blueprint pour découvrir d’autres modèles.

Estimation des coûts pour les utilisateurs

Les factures basées sur l’usage peuvent être difficiles à prévoir ; affichez donc une estimation du coût avant l’exécution d’un modèle. Les estimations évitent les factures inattendues et renforcent la confiance.

Exemples de calcul des coûts

Créer un calculateur de coûts

Cette fonction multiplie le tarif par seconde du niveau par la durée d’exécution estimée :

Entreprise : capacité réservée

Pour les clients qui ont besoin d’une capacité dédiée et de l’absence de démarrages à froid, Replicate propose des déploiements : des instances dédiées facturées pendant toute leur durée de mise en ligne. Pour modéliser une capacité réservée avec Dodo Payments, vendez-la comme un produit d’abonnement :
  • Type de produit : abonnement
  • Prix : prix mensuel fixe (par exemple, « Reserved A100 Instance - $500/mois »)
  • Cycle de facturation : mensuel
Vous pouvez toujours envoyer des événements d’utilisation à des fins de suivi et d’analytics, tandis que l’abonnement couvre le coût. À mesure que le volume d’un client augmente, une capacité réservée coûte souvent moins cher qu’un paiement à l’usage.

Avancé : mesure par heartbeat

Pour les tâches qui s’exécutent pendant plusieurs minutes ou heures, un seul événement à la fin présente un risque : si le processus plante, vous perdez les données d’utilisation. Envoyez plutôt un événement d’utilisation toutes les 30 à 60 secondes pendant l’exécution de la tâche.

Principales fonctionnalités de Dodo utilisées

Usage-Based Billing

Configurez des produits dont la facturation repose sur la consommation.

Meters

Définissez les métriques que vous souhaitez suivre et facturer.

Event Ingestion

Envoyez les données d’utilisation à Dodo Payments au fur et à mesure.

Subscriptions

Gérez la facturation récurrente pour la capacité réservée et les plans d’entreprise.

Time Range Blueprint

Suivez le calcul à la seconde avec des assistants de durée.
Dernière modification le 26 septembre 2026