Skip to main content
Replicate es una plataforma para ejecutar modelos de machine learning de código abierto en la nube y uno de los ejemplos más puros de precios basados en el uso en IA. No hay una suscripción mensual ni una tarifa fija por ejecución del modelo. La mayoría de los modelos se facturan según el tiempo de cómputo que utilizan, medido por segundo, a una tarifa que depende del hardware. Algunos modelos se facturan según la entrada y la salida, por ejemplo, por imagen o por token (precios de Replicate). La facturación por segundo se adapta a las cargas de trabajo de IA porque los tiempos de ejecución son impredecibles. Un usuario puede ejecutar un modelo ligero durante unos segundos y otro puede ejecutar un modelo generativo grande durante varios minutos. Como el precio sigue el cómputo utilizado y no el modelo, se mantiene transparente a cualquier escala.

Cómo factura Replicate

Los precios basados en el tiempo de Replicate no dependen del modelo. Ya sea que generes una imagen con SDXL o ejecutes Llama 3, la factura depende del nivel de hardware y del tiempo de ejecución. Replicate puede alojar miles de modelos de código abierto sin un precio separado para cada uno. La implementación que aparece a continuación también utiliza medidores de ejemplo para los niveles A40 y A100 (40GB), que la página de precios de Replicate ya no incluye. Crea un medidor para cada nivel de hardware que ofrezcas. Cada ejecución se mide en el medidor correspondiente al hardware que utilizó:
  1. Tarifas específicas del hardware: El precio por segundo depende de los recursos de cómputo utilizados. Cada nivel de hardware tiene su propia tarifa.
  2. Modelo basado exclusivamente en el uso: No hay tarifas mensuales, cuotas incluidas ni cargos por exceso. Los usuarios pagan por el tiempo de cómputo exacto, por ejemplo, “12.4 segundos en un A100”, y no por generación.
  3. Granularidad por segundo: Los proveedores que facturan por hora o minuto cobran por el tiempo no utilizado en tareas cortas. La facturación por segundo elimina ese desperdicio tanto para pequeños experimentos como para cargas de trabajo de producción grandes.
Para los modelos públicos, Replicate cobra únicamente por el tiempo durante el cual el modelo procesa activamente tu solicitud. La configuración (arranque en frío) y el tiempo de inactividad son gratuitos. Los modelos privados y los deployments se ejecutan en hardware dedicado, por lo que pagas por todo el tiempo que sus instancias están en línea: configuración, inactividad y actividad (documentación de facturación de Replicate).

Qué lo hace único

  • Medición específica del hardware: El mismo modelo cuesta más en hardware más rápido, por lo que los usuarios deben elegir entre velocidad y costo. Una T4 GPU es adecuada para tareas que no requieren rapidez, mientras que una A100 es adecuada para aplicaciones en tiempo real.
  • Granularidad por segundo: La facturación se calcula por segundo, por lo que los usuarios no pagan por el tiempo no utilizado en tareas cortas.
  • Sin suscripción: Los usuarios comienzan sin compromiso y el costo aumenta según el uso. Esto resulta adecuado para startups y desarrolladores que prueban distintos modelos.
  • Independiente del modelo: La misma lógica de facturación se aplica a la generación de imágenes, el procesamiento de texto, la transcripción de audio y la síntesis de video. La plataforma admite un amplio catálogo de modelos sin tablas de precios complejas.

Crea esto con Dodo Payments

Puedes crear este modelo con la facturación basada en el uso de Dodo Payments. Crea un medidor por cada nivel de hardware y vincúlalos todos a un único producto.
1

Create Usage Meters (One Per Hardware Class)

Crea un medidor independiente para cada nivel de hardware. Cada nivel tiene su propio precio por segundo, por lo que los medidores separados permiten que Dodo Payments establezca el precio de cada nivel y desglose la factura.La agregación Sum sobre execution_seconds proporciona el tiempo de cómputo total por nivel de hardware durante el periodo de facturación.
2

Create a Usage-Based Product

Crea un producto en el dashboard de Dodo Payments con esta configuración:
  • Tipo de precios: Usage Based Billing
  • Precio base: $0/mes (sin tarifa de suscripción)
  • Frecuencia de facturación: Mensual
Añade cada medidor con su precio por unidad:Establece el Free Threshold en 0 para cada medidor, de modo que cada segundo de ejecución sea facturable.
3

Send Usage Events

Envía un evento de uso a Dodo Payments cuando finalice cada ejecución del modelo. Asigna a cada predicción un event_id único para que un evento reintentado no se contabilice dos veces.
4

Measure Execution Time Precisely

Cronometra cada ejecución del modelo con performance.now() y redondea a la décima de segundo más cercana para la facturación.
5

Create Checkout

Cuando un usuario se registre, crea una sesión de checkout para el producto basado en el uso. Dodo Payments facturará el uso en cada ciclo y emitirá las facturas.

Acelera con el Time Range Ingestion Blueprint

El Time Range Ingestion Blueprint acorta el seguimiento del cómputo por segundo. Crea una instancia de ingestion por cada nivel de hardware y llama a trackTimeRange después de cada ejecución.
El blueprint crea y envía el evento, con la duración como durationMs en los metadatos. Establece Over Property de cada medidor en durationMs o envía durationSeconds para mantener los precios por segundo. Con una instancia de ingestion por cada nivel de hardware, esto se asigna directamente a la medición multinivel de Replicate.
Para trabajos de larga duración, combina el Time Range Blueprint con el seguimiento de heartbeats basado en intervalos, que se muestra en Avanzado: medición de heartbeats. Consulta la documentación completa del blueprint para ver más patrones.

Estimación de costos para usuarios

Las facturas basadas en el uso pueden ser difíciles de predecir, así que muestra a los usuarios una estimación del costo antes de que ejecuten un modelo. Las estimaciones evitan facturas inesperadas y generan confianza.

Ejemplos de cálculos de costos

Creación de una calculadora de costos

Esta función multiplica la tarifa por segundo del nivel por el tiempo de ejecución estimado:

Enterprise: capacidad reservada

Para los clientes que necesitan capacidad dedicada y no quieren arranques en frío, Replicate ofrece deployments: instancias dedicadas que se facturan durante todo el tiempo que están en línea. Para modelar la capacidad reservada con Dodo Payments, véndela como un producto de suscripción:
  • Tipo de producto: Subscription
  • Precio: Precio mensual fijo (por ejemplo, “Reserved A100 Instance - $500/month”)
  • Ciclo de facturación: Mensual
También puedes enviar eventos de uso para la supervisión y el análisis, mientras la suscripción cubre el costo. A medida que crece el volumen de un cliente, la capacidad reservada suele costar menos que el modelo de pago por uso.

Avanzado: medición de heartbeats

Para tareas que se ejecutan durante minutos u horas, un único evento al final implica un riesgo: si el proceso falla, pierdes los datos de uso. En su lugar, envía un evento de uso cada 30 a 60 segundos mientras se ejecuta la tarea.

Principales funcionalidades de Dodo utilizadas

Usage-Based Billing

Configura productos que facturen según el consumo.

Meters

Define las métricas que quieres supervisar y facturar.

Event Ingestion

Envía datos de uso a Dodo Payments a medida que se generan.

Subscriptions

Gestiona la facturación recurrente para la capacidad reservada y los planes enterprise.

Time Range Blueprint

Seguimiento del cómputo por segundo con helpers de duración.
Última modificación el 26 de septiembre de 2026