Cómo factura Replicate
Los precios basados en el tiempo de Replicate no dependen del modelo. Ya sea que generes una imagen con SDXL o ejecutes Llama 3, la factura depende del nivel de hardware y del tiempo de ejecución. Replicate puede alojar miles de modelos de código abierto sin un precio separado para cada uno.
La implementación que aparece a continuación también utiliza medidores de ejemplo para los niveles A40 y A100 (40GB), que la página de precios de Replicate ya no incluye. Crea un medidor para cada nivel de hardware que ofrezcas.
Cada ejecución se mide en el medidor correspondiente al hardware que utilizó:
- Tarifas específicas del hardware: El precio por segundo depende de los recursos de cómputo utilizados. Cada nivel de hardware tiene su propia tarifa.
- Modelo basado exclusivamente en el uso: No hay tarifas mensuales, cuotas incluidas ni cargos por exceso. Los usuarios pagan por el tiempo de cómputo exacto, por ejemplo, “12.4 segundos en un A100”, y no por generación.
- Granularidad por segundo: Los proveedores que facturan por hora o minuto cobran por el tiempo no utilizado en tareas cortas. La facturación por segundo elimina ese desperdicio tanto para pequeños experimentos como para cargas de trabajo de producción grandes.
Para los modelos públicos, Replicate cobra únicamente por el tiempo durante el cual el modelo procesa activamente tu solicitud. La configuración (arranque en frío) y el tiempo de inactividad son gratuitos. Los modelos privados y los deployments se ejecutan en hardware dedicado, por lo que pagas por todo el tiempo que sus instancias están en línea: configuración, inactividad y actividad (documentación de facturación de Replicate).
Qué lo hace único
- Medición específica del hardware: El mismo modelo cuesta más en hardware más rápido, por lo que los usuarios deben elegir entre velocidad y costo. Una T4 GPU es adecuada para tareas que no requieren rapidez, mientras que una A100 es adecuada para aplicaciones en tiempo real.
- Granularidad por segundo: La facturación se calcula por segundo, por lo que los usuarios no pagan por el tiempo no utilizado en tareas cortas.
- Sin suscripción: Los usuarios comienzan sin compromiso y el costo aumenta según el uso. Esto resulta adecuado para startups y desarrolladores que prueban distintos modelos.
- Independiente del modelo: La misma lógica de facturación se aplica a la generación de imágenes, el procesamiento de texto, la transcripción de audio y la síntesis de video. La plataforma admite un amplio catálogo de modelos sin tablas de precios complejas.
Crea esto con Dodo Payments
Puedes crear este modelo con la facturación basada en el uso de Dodo Payments. Crea un medidor por cada nivel de hardware y vincúlalos todos a un único producto.1
Create Usage Meters (One Per Hardware Class)
Crea un medidor independiente para cada nivel de hardware. Cada nivel tiene su propio precio por segundo, por lo que los medidores separados permiten que Dodo Payments establezca el precio de cada nivel y desglose la factura.
La agregación Sum sobre
execution_seconds proporciona el tiempo de cómputo total por nivel de hardware durante el periodo de facturación.2
Create a Usage-Based Product
Crea un producto en el dashboard de Dodo Payments con esta configuración:
- Tipo de precios: Usage Based Billing
- Precio base: $0/mes (sin tarifa de suscripción)
- Frecuencia de facturación: Mensual
Establece el Free Threshold en 0 para cada medidor, de modo que cada segundo de ejecución sea facturable.
3
Send Usage Events
Envía un evento de uso a Dodo Payments cuando finalice cada ejecución del modelo. Asigna a cada predicción un
event_id único para que un evento reintentado no se contabilice dos veces.4
Measure Execution Time Precisely
Cronometra cada ejecución del modelo con
performance.now() y redondea a la décima de segundo más cercana para la facturación.5
Create Checkout
Cuando un usuario se registre, crea una sesión de checkout para el producto basado en el uso. Dodo Payments facturará el uso en cada ciclo y emitirá las facturas.
Acelera con el Time Range Ingestion Blueprint
El Time Range Ingestion Blueprint acorta el seguimiento del cómputo por segundo. Crea una instancia de ingestion por cada nivel de hardware y llama atrackTimeRange después de cada ejecución.
durationMs en los metadatos. Establece Over Property de cada medidor en durationMs o envía durationSeconds para mantener los precios por segundo. Con una instancia de ingestion por cada nivel de hardware, esto se asigna directamente a la medición multinivel de Replicate.
Estimación de costos para usuarios
Las facturas basadas en el uso pueden ser difíciles de predecir, así que muestra a los usuarios una estimación del costo antes de que ejecuten un modelo. Las estimaciones evitan facturas inesperadas y generan confianza.Ejemplos de cálculos de costos
Creación de una calculadora de costos
Esta función multiplica la tarifa por segundo del nivel por el tiempo de ejecución estimado:Enterprise: capacidad reservada
Para los clientes que necesitan capacidad dedicada y no quieren arranques en frío, Replicate ofrece deployments: instancias dedicadas que se facturan durante todo el tiempo que están en línea. Para modelar la capacidad reservada con Dodo Payments, véndela como un producto de suscripción:- Tipo de producto: Subscription
- Precio: Precio mensual fijo (por ejemplo, “Reserved A100 Instance - $500/month”)
- Ciclo de facturación: Mensual
Avanzado: medición de heartbeats
Para tareas que se ejecutan durante minutos u horas, un único evento al final implica un riesgo: si el proceso falla, pierdes los datos de uso. En su lugar, envía un evento de uso cada 30 a 60 segundos mientras se ejecuta la tarea.Principales funcionalidades de Dodo utilizadas
Usage-Based Billing
Configura productos que facturen según el consumo.
Meters
Define las métricas que quieres supervisar y facturar.
Event Ingestion
Envía datos de uso a Dodo Payments a medida que se generan.
Subscriptions
Gestiona la facturación recurrente para la capacidad reservada y los planes enterprise.
Time Range Blueprint
Seguimiento del cómputo por segundo con helpers de duración.