Skip to main content
Replicate è una piattaforma per eseguire modelli di machine learning open source nel cloud e uno degli esempi più puri di pricing basato sull’utilizzo nell’ambito dell’AI. Non esiste un abbonamento mensile né una tariffa fissa per ogni esecuzione del modello. La maggior parte dei modelli viene fatturata in base al tempo di calcolo utilizzato, misurato al secondo, a una tariffa che dipende dall’hardware. Alcuni modelli vengono invece fatturati in base all’input e all’output, ad esempio per immagine o per token (prezzi di Replicate). La fatturazione al secondo è adatta ai carichi di lavoro di AI perché i tempi di esecuzione sono imprevedibili. Un utente potrebbe eseguire un modello leggero per pochi secondi, mentre un altro potrebbe eseguire un modello generativo di grandi dimensioni per diversi minuti. Poiché il prezzo segue il calcolo utilizzato anziché il modello, rimane trasparente a qualsiasi scala.

Come fattura Replicate

Il pricing basato sul tempo di Replicate non dipende dal modello. Che si generi un’immagine con SDXL o si esegua Llama 3, il costo dipende dal livello hardware e dal tempo di esecuzione. Replicate può ospitare migliaia di modelli open source senza un prezzo separato per ciascuno. L’implementazione seguente utilizza anche meter di esempio per i tier A40 e A100 (40GB), che la pagina dei prezzi di Replicate non elenca più. Crea un meter per ogni tier hardware che offri. Ogni esecuzione viene contabilizzata sul meter relativo all’hardware utilizzato:
  1. Tariffe specifiche per l’hardware: Il prezzo al secondo dipende dalle risorse di calcolo utilizzate. Ogni livello hardware ha la propria tariffa.
  2. Modello basato esclusivamente sull’utilizzo: Non ci sono costi mensili, quote incluse né eccedenze. Gli utenti pagano l’esatto tempo di calcolo, ad esempio “12.4 secondi su un A100”, non per generazione.
  3. Granularità al secondo: I provider che fatturano all’ora o al minuto addebitano il tempo non utilizzato per le attività brevi. La fatturazione al secondo elimina questo spreco sia per i piccoli esperimenti sia per i carichi di lavoro di produzione più grandi.
Per i modelli pubblici, Replicate addebita solo il tempo durante il quale un modello elabora attivamente la richiesta. La configurazione (cold boot) e il tempo di inattività sono gratuiti. I modelli privati e le deployment vengono eseguiti su hardware dedicato, quindi si paga tutto il tempo in cui le relative istanze sono online: configurazione, inattività ed elaborazione attiva (documentazione sulla fatturazione di Replicate).

Cosa lo rende unico

  • Contabilizzazione specifica per l’hardware: Lo stesso modello costa di più su hardware più veloce, quindi gli utenti scelgono tra velocità e costo. Una GPU T4 è adatta alle attività che non richiedono tempi rapidi, mentre una A100 è adatta alle applicazioni in tempo reale.
  • Granularità al secondo: La fatturazione viene calcolata al secondo, quindi gli utenti non pagano il tempo non utilizzato nelle attività brevi.
  • Nessun abbonamento: Gli utenti iniziano senza vincoli e il costo cresce in base all’utilizzo. Questo è adatto a startup e sviluppatori che stanno provando modelli diversi.
  • Indipendente dal modello: La stessa logica di fatturazione si applica alla generazione di immagini, all’elaborazione del testo, alla trascrizione audio e alla sintesi video. La piattaforma supporta un ampio catalogo di modelli senza tabelle dei prezzi complesse.

Crea questo modello con Dodo Payments

Puoi creare questo modello con la fatturazione basata sull’utilizzo di Dodo Payments. Crea un meter per ogni livello hardware e collegali tutti a un unico prodotto.
1

Create Usage Meters (One Per Hardware Class)

Crea un meter separato per ogni livello hardware. Ogni livello ha il proprio prezzo al secondo, quindi i meter separati consentono a Dodo Payments di applicare il prezzo di ciascun livello e dettagliare la fattura.L’aggregazione Sum su execution_seconds restituisce il tempo di calcolo totale per ogni livello hardware durante il periodo di fatturazione.
2

Create a Usage-Based Product

Crea un prodotto nella dashboard di Dodo Payments con queste impostazioni:
  • Tipo di pricing: Usage Based Billing
  • Prezzo base: $0/mese (nessun costo di abbonamento)
  • Frequenza di fatturazione: Mensile
Aggiungi ogni meter con il relativo prezzo per unità:Imposta la Free Threshold su 0 per ogni meter, in modo che ogni secondo di esecuzione sia fatturabile.
3

Send Usage Events

Invia un evento di utilizzo a Dodo Payments al completamento di ogni esecuzione del modello. Assegna a ogni prediction un event_id univoco, in modo che un evento ritentato non venga conteggiato due volte.
4

Measure Execution Time Precisely

Cronometra ogni esecuzione del modello con performance.now() e arrotonda al decimo di secondo più vicino per la fatturazione.
5

Create Checkout

Quando un utente si registra, crea una sessione di checkout per il prodotto basato sull’utilizzo. Dodo Payments fattura quindi l’utilizzo a ogni ciclo e emette le fatture.

Accelera con il blueprint Time Range Ingestion

Il blueprint Time Range Ingestion accelera il monitoraggio del calcolo al secondo. Crea un’istanza di ingestion per ogni livello hardware e chiama trackTimeRange dopo ogni esecuzione.
Il blueprint crea e invia l’evento, con la durata come durationMs nei metadata. Imposta Over Property di ogni meter su durationMs oppure invia durationSeconds per mantenere il pricing al secondo. Con un’istanza di ingestion per ogni livello hardware, questo si mappa direttamente sulla contabilizzazione multi-livello di Replicate.
Per i job di lunga durata, combina il blueprint Time Range con il monitoraggio heartbeat basato su intervalli, illustrato in Avanzato: Heartbeat Metering. Consulta la documentazione completa del blueprint per altri pattern.

Stima dei costi per gli utenti

Le fatture basate sull’utilizzo possono essere difficili da prevedere, quindi mostra agli utenti una stima dei costi prima che eseguano un modello. Le stime prevengono fatture impreviste e rafforzano la fiducia.

Esempi di calcolo dei costi

Creazione di un calcolatore dei costi

Questa funzione moltiplica la tariffa al secondo del livello per il tempo di esecuzione stimato:

Enterprise: capacità riservata

Per i clienti che necessitano di capacità dedicata e nessun cold boot, Replicate offre le deployment: istanze dedicate fatturate per tutto il tempo in cui sono online. Per modellare la capacità riservata con Dodo Payments, vendila come prodotto in abbonamento:
  • Tipo di prodotto: Subscription
  • Prezzo: Prezzo mensile fisso (ad esempio, “Reserved A100 Instance - $500/mese”)
  • Ciclo di fatturazione: Mensile
Puoi comunque inviare eventi di utilizzo per il monitoraggio e l’analisi, mentre l’abbonamento copre il costo. Quando il volume di un cliente cresce, la capacità riservata spesso costa meno del modello pay-as-you-go.

Avanzato: Heartbeat Metering

Per le attività che durano minuti o ore, un unico evento alla fine è rischioso: se il processo si arresta in modo anomalo, perdi i dati sull’utilizzo. Invia invece un evento di utilizzo ogni 30-60 secondi mentre l’attività è in esecuzione.

Funzionalità principali di Dodo utilizzate

Usage-Based Billing

Configura prodotti con fatturazione basata sul consumo.

Meters

Definisci le metriche che vuoi monitorare e fatturare.

Event Ingestion

Invia i dati sull’utilizzo a Dodo Payments man mano che si verificano.

Subscriptions

Gestisci la fatturazione ricorrente per la capacità riservata e i piani enterprise.

Time Range Blueprint

Monitoraggio del calcolo al secondo con helper per la durata.
Ultima modifica il 26 settembre 2026