Come fattura Replicate
Il pricing basato sul tempo di Replicate non dipende dal modello. Che si generi un’immagine con SDXL o si esegua Llama 3, il costo dipende dal livello hardware e dal tempo di esecuzione. Replicate può ospitare migliaia di modelli open source senza un prezzo separato per ciascuno.
L’implementazione seguente utilizza anche meter di esempio per i tier A40 e A100 (40GB), che la pagina dei prezzi di Replicate non elenca più. Crea un meter per ogni tier hardware che offri.
Ogni esecuzione viene contabilizzata sul meter relativo all’hardware utilizzato:
- Tariffe specifiche per l’hardware: Il prezzo al secondo dipende dalle risorse di calcolo utilizzate. Ogni livello hardware ha la propria tariffa.
- Modello basato esclusivamente sull’utilizzo: Non ci sono costi mensili, quote incluse né eccedenze. Gli utenti pagano l’esatto tempo di calcolo, ad esempio “12.4 secondi su un A100”, non per generazione.
- Granularità al secondo: I provider che fatturano all’ora o al minuto addebitano il tempo non utilizzato per le attività brevi. La fatturazione al secondo elimina questo spreco sia per i piccoli esperimenti sia per i carichi di lavoro di produzione più grandi.
Per i modelli pubblici, Replicate addebita solo il tempo durante il quale un modello elabora attivamente la richiesta. La configurazione (cold boot) e il tempo di inattività sono gratuiti. I modelli privati e le deployment vengono eseguiti su hardware dedicato, quindi si paga tutto il tempo in cui le relative istanze sono online: configurazione, inattività ed elaborazione attiva (documentazione sulla fatturazione di Replicate).
Cosa lo rende unico
- Contabilizzazione specifica per l’hardware: Lo stesso modello costa di più su hardware più veloce, quindi gli utenti scelgono tra velocità e costo. Una GPU T4 è adatta alle attività che non richiedono tempi rapidi, mentre una A100 è adatta alle applicazioni in tempo reale.
- Granularità al secondo: La fatturazione viene calcolata al secondo, quindi gli utenti non pagano il tempo non utilizzato nelle attività brevi.
- Nessun abbonamento: Gli utenti iniziano senza vincoli e il costo cresce in base all’utilizzo. Questo è adatto a startup e sviluppatori che stanno provando modelli diversi.
- Indipendente dal modello: La stessa logica di fatturazione si applica alla generazione di immagini, all’elaborazione del testo, alla trascrizione audio e alla sintesi video. La piattaforma supporta un ampio catalogo di modelli senza tabelle dei prezzi complesse.
Crea questo modello con Dodo Payments
Puoi creare questo modello con la fatturazione basata sull’utilizzo di Dodo Payments. Crea un meter per ogni livello hardware e collegali tutti a un unico prodotto.1
Create Usage Meters (One Per Hardware Class)
Crea un meter separato per ogni livello hardware. Ogni livello ha il proprio prezzo al secondo, quindi i meter separati consentono a Dodo Payments di applicare il prezzo di ciascun livello e dettagliare la fattura.
L’aggregazione Sum su
execution_seconds restituisce il tempo di calcolo totale per ogni livello hardware durante il periodo di fatturazione.2
Create a Usage-Based Product
Crea un prodotto nella dashboard di Dodo Payments con queste impostazioni:
- Tipo di pricing: Usage Based Billing
- Prezzo base: $0/mese (nessun costo di abbonamento)
- Frequenza di fatturazione: Mensile
Imposta la Free Threshold su 0 per ogni meter, in modo che ogni secondo di esecuzione sia fatturabile.
3
Send Usage Events
Invia un evento di utilizzo a Dodo Payments al completamento di ogni esecuzione del modello. Assegna a ogni prediction un
event_id univoco, in modo che un evento ritentato non venga conteggiato due volte.4
Measure Execution Time Precisely
Cronometra ogni esecuzione del modello con
performance.now() e arrotonda al decimo di secondo più vicino per la fatturazione.5
Create Checkout
Quando un utente si registra, crea una sessione di checkout per il prodotto basato sull’utilizzo. Dodo Payments fattura quindi l’utilizzo a ogni ciclo e emette le fatture.
Accelera con il blueprint Time Range Ingestion
Il blueprint Time Range Ingestion accelera il monitoraggio del calcolo al secondo. Crea un’istanza di ingestion per ogni livello hardware e chiamatrackTimeRange dopo ogni esecuzione.
durationMs nei metadata. Imposta Over Property di ogni meter su durationMs oppure invia durationSeconds per mantenere il pricing al secondo. Con un’istanza di ingestion per ogni livello hardware, questo si mappa direttamente sulla contabilizzazione multi-livello di Replicate.
Stima dei costi per gli utenti
Le fatture basate sull’utilizzo possono essere difficili da prevedere, quindi mostra agli utenti una stima dei costi prima che eseguano un modello. Le stime prevengono fatture impreviste e rafforzano la fiducia.Esempi di calcolo dei costi
Creazione di un calcolatore dei costi
Questa funzione moltiplica la tariffa al secondo del livello per il tempo di esecuzione stimato:Enterprise: capacità riservata
Per i clienti che necessitano di capacità dedicata e nessun cold boot, Replicate offre le deployment: istanze dedicate fatturate per tutto il tempo in cui sono online. Per modellare la capacità riservata con Dodo Payments, vendila come prodotto in abbonamento:- Tipo di prodotto: Subscription
- Prezzo: Prezzo mensile fisso (ad esempio, “Reserved A100 Instance - $500/mese”)
- Ciclo di fatturazione: Mensile
Avanzato: Heartbeat Metering
Per le attività che durano minuti o ore, un unico evento alla fine è rischioso: se il processo si arresta in modo anomalo, perdi i dati sull’utilizzo. Invia invece un evento di utilizzo ogni 30-60 secondi mentre l’attività è in esecuzione.Funzionalità principali di Dodo utilizzate
Usage-Based Billing
Configura prodotti con fatturazione basata sul consumo.
Meters
Definisci le metriche che vuoi monitorare e fatturare.
Event Ingestion
Invia i dati sull’utilizzo a Dodo Payments man mano che si verificano.
Subscriptions
Gestisci la fatturazione ricorrente per la capacità riservata e i piani enterprise.
Time Range Blueprint
Monitoraggio del calcolo al secondo con helper per la durata.