Skip to main content
Replicate é uma plataforma para executar modelos de machine learning de código aberto na nuvem e um dos exemplos mais puros de precificação baseada em uso em IA. Não há assinatura mensal nem tarifa fixa por execução de modelo. A maioria dos modelos é cobrada pelo tempo de computação utilizado, medido por segundo, a uma tarifa que depende do hardware. Alguns modelos são cobrados com base na entrada e na saída, como por imagem ou por token (preços da Replicate). A cobrança por segundo é adequada para cargas de trabalho de IA porque os tempos de execução são imprevisíveis. Um usuário pode executar um modelo leve por alguns segundos, enquanto outro pode executar um modelo generativo grande por vários minutos. Como o preço acompanha a computação utilizada, e não o modelo, ele permanece transparente em qualquer escala.

Como a Replicate Cobra

A precificação baseada em tempo da Replicate não depende do modelo. Seja para gerar uma imagem com SDXL ou executar o Llama 3, a cobrança depende do nível de hardware e do tempo de execução. A Replicate pode hospedar milhares de modelos de código aberto sem um preço separado para cada um. A implementação abaixo também usa medidores de exemplo para os níveis A40 e A100 (40GB), que a página de preços da Replicate não lista mais. Crie um medidor para cada nível de hardware que você oferece. Cada execução é medida no medidor correspondente ao hardware utilizado:
  1. Tarifas específicas por hardware: o preço por segundo depende dos recursos de computação utilizados. Cada nível de hardware tem sua própria tarifa.
  2. Modelo puramente baseado em uso: não há tarifas mensais, cotas incluídas nem excedentes. Os usuários pagam pelo tempo exato de computação, por exemplo, “12.4 segundos em um A100”, e não por geração.
  3. Granularidade por segundo: provedores que cobram por hora ou minuto cobram pelo tempo não utilizado em tarefas curtas. A cobrança por segundo elimina esse desperdício tanto em pequenos experimentos quanto em grandes cargas de trabalho de produção.
Para modelos públicos, a Replicate cobra apenas pelo tempo em que um modelo está processando ativamente sua solicitação. A configuração (cold boot) e o tempo ocioso são gratuitos. Modelos privados e deployments são executados em hardware dedicado, portanto você paga por todo o tempo em que as instâncias ficam online: configuração, ociosidade e atividade (documentação de cobrança da Replicate).

O que torna isso único

  • Medição específica por hardware: o mesmo modelo custa mais em um hardware mais rápido, portanto os usuários equilibram velocidade e custo. Uma GPU T4 é adequada para tarefas que não são sensíveis ao tempo, enquanto uma A100 é adequada para aplicações em tempo real.
  • Granularidade por segundo: a cobrança é calculada por segundo, para que os usuários não paguem pelo tempo não utilizado em tarefas curtas.
  • Sem assinatura: os usuários começam sem compromisso, e o custo aumenta conforme o uso. Isso é adequado para startups e desenvolvedores que estão experimentando diferentes modelos.
  • Independente do modelo: a mesma lógica de cobrança se aplica à geração de imagens, ao processamento de texto, à transcrição de áudio e à síntese de vídeo. A plataforma oferece suporte a um amplo catálogo de modelos sem tabelas de preços complexas.

Crie isso com Dodo Payments

Você pode criar esse modelo com a cobrança baseada em uso do Dodo Payments. Crie um medidor por nível de hardware e associe todos eles a um único produto.
1

Create Usage Meters (One Per Hardware Class)

Crie um medidor separado para cada nível de hardware. Cada nível tem seu próprio preço por segundo, portanto medidores separados permitem que o Dodo Payments precifique cada nível e detalhe a fatura.A agregação Soma sobre execution_seconds fornece o tempo total de computação por nível de hardware durante o período de cobrança.
2

Create a Usage-Based Product

Crie um produto no dashboard do Dodo Payments com estas configurações:
  • Tipo de preço: Cobrança baseada em uso
  • Preço base: $0/mês (sem tarifa de assinatura)
  • Frequência de cobrança: Mensal
Adicione cada medidor com seu preço por unidade:Defina o Limite gratuito como 0 em todos os medidores, para que cada segundo de execução seja cobrável.
3

Send Usage Events

Envie um evento de uso ao Dodo Payments quando cada execução de modelo for concluída. Dê a cada previsão um event_id exclusivo, para que um evento repetido não seja contabilizado duas vezes.
4

Measure Execution Time Precisely

Cronometre cada execução de modelo com performance.now() e arredonde para o décimo de segundo mais próximo para a cobrança.
5

Create Checkout

Quando um usuário se cadastrar, crie uma sessão de checkout para o produto baseado em uso. O Dodo Payments então cobra o uso a cada ciclo e emite as faturas.

Acelere com o Time Range Ingestion Blueprint

O Time Range Ingestion Blueprint torna mais rápido o acompanhamento da computação por segundo. Crie uma instância de ingestão por nível de hardware e chame trackTimeRange após cada execução.
O blueprint cria e envia o evento, com a duração como durationMs nos metadados. Defina o Over Property de cada medidor como durationMs ou envie durationSeconds para manter a precificação por segundo. Com uma instância de ingestão por nível de hardware, isso corresponde diretamente à medição em vários níveis da Replicate.
Para jobs de longa duração, combine o Time Range Blueprint com o acompanhamento de heartbeat baseado em intervalos, apresentado em Avançado: Medição por heartbeat. Consulte a documentação completa do blueprint para ver mais padrões.

Estimativa de custos para usuários

As cobranças baseadas em uso podem ser difíceis de prever, portanto mostre aos usuários uma estimativa de custo antes que executem um modelo. As estimativas evitam cobranças inesperadas e aumentam a confiança.

Exemplos de cálculos de custo

Criando uma calculadora de custos

Esta função multiplica a tarifa por segundo do nível pelo tempo de execução estimado:

Enterprise: capacidade reservada

Para clientes que precisam de capacidade dedicada e nenhum cold boot, a Replicate oferece deployments: instâncias dedicadas cobradas por todo o tempo em que permanecem online. Para representar a capacidade reservada com o Dodo Payments, venda-a como um produto de assinatura:
  • Tipo de produto: Assinatura
  • Preço: preço mensal fixo (por exemplo, “Instância A100 reservada - $500/mês”)
  • Ciclo de cobrança: Mensal
Você ainda pode enviar eventos de uso para monitoramento e analytics, enquanto a assinatura cobre o custo. À medida que o volume de um cliente aumenta, a capacidade reservada geralmente custa menos do que o modelo pay-as-you-go.

Avançado: medição por heartbeat

Para tarefas executadas por minutos ou horas, um único evento ao final é arriscado: se o processo falhar, você perderá os dados de uso. Em vez disso, envie um evento de uso a cada 30 a 60 segundos enquanto a tarefa estiver em execução.

Principais recursos do Dodo utilizados

Usage-Based Billing

Configure produtos que cobram com base no consumo.

Meters

Defina as métricas que você deseja acompanhar e pelas quais deseja cobrar.

Event Ingestion

Envie dados de uso ao Dodo Payments conforme eles ocorrerem.

Subscriptions

Gerencie a cobrança recorrente de capacidade reservada e planos Enterprise.

Time Range Blueprint

Acompanhe a computação por segundo com auxiliares de duração.
Última modificação em 26 de setembro de 2026