Como a Replicate Cobra
A precificação baseada em tempo da Replicate não depende do modelo. Seja para gerar uma imagem com SDXL ou executar o Llama 3, a cobrança depende do nível de hardware e do tempo de execução. A Replicate pode hospedar milhares de modelos de código aberto sem um preço separado para cada um.
A implementação abaixo também usa medidores de exemplo para os níveis A40 e A100 (40GB), que a página de preços da Replicate não lista mais. Crie um medidor para cada nível de hardware que você oferece.
Cada execução é medida no medidor correspondente ao hardware utilizado:
- Tarifas específicas por hardware: o preço por segundo depende dos recursos de computação utilizados. Cada nível de hardware tem sua própria tarifa.
- Modelo puramente baseado em uso: não há tarifas mensais, cotas incluídas nem excedentes. Os usuários pagam pelo tempo exato de computação, por exemplo, “12.4 segundos em um A100”, e não por geração.
- Granularidade por segundo: provedores que cobram por hora ou minuto cobram pelo tempo não utilizado em tarefas curtas. A cobrança por segundo elimina esse desperdício tanto em pequenos experimentos quanto em grandes cargas de trabalho de produção.
Para modelos públicos, a Replicate cobra apenas pelo tempo em que um modelo está processando ativamente sua solicitação. A configuração (cold boot) e o tempo ocioso são gratuitos. Modelos privados e deployments são executados em hardware dedicado, portanto você paga por todo o tempo em que as instâncias ficam online: configuração, ociosidade e atividade (documentação de cobrança da Replicate).
O que torna isso único
- Medição específica por hardware: o mesmo modelo custa mais em um hardware mais rápido, portanto os usuários equilibram velocidade e custo. Uma GPU T4 é adequada para tarefas que não são sensíveis ao tempo, enquanto uma A100 é adequada para aplicações em tempo real.
- Granularidade por segundo: a cobrança é calculada por segundo, para que os usuários não paguem pelo tempo não utilizado em tarefas curtas.
- Sem assinatura: os usuários começam sem compromisso, e o custo aumenta conforme o uso. Isso é adequado para startups e desenvolvedores que estão experimentando diferentes modelos.
- Independente do modelo: a mesma lógica de cobrança se aplica à geração de imagens, ao processamento de texto, à transcrição de áudio e à síntese de vídeo. A plataforma oferece suporte a um amplo catálogo de modelos sem tabelas de preços complexas.
Crie isso com Dodo Payments
Você pode criar esse modelo com a cobrança baseada em uso do Dodo Payments. Crie um medidor por nível de hardware e associe todos eles a um único produto.1
Create Usage Meters (One Per Hardware Class)
Crie um medidor separado para cada nível de hardware. Cada nível tem seu próprio preço por segundo, portanto medidores separados permitem que o Dodo Payments precifique cada nível e detalhe a fatura.
A agregação Soma sobre
execution_seconds fornece o tempo total de computação por nível de hardware durante o período de cobrança.2
Create a Usage-Based Product
Crie um produto no dashboard do Dodo Payments com estas configurações:
- Tipo de preço: Cobrança baseada em uso
- Preço base: $0/mês (sem tarifa de assinatura)
- Frequência de cobrança: Mensal
Defina o Limite gratuito como 0 em todos os medidores, para que cada segundo de execução seja cobrável.
3
Send Usage Events
Envie um evento de uso ao Dodo Payments quando cada execução de modelo for concluída. Dê a cada previsão um
event_id exclusivo, para que um evento repetido não seja contabilizado duas vezes.4
Measure Execution Time Precisely
Cronometre cada execução de modelo com
performance.now() e arredonde para o décimo de segundo mais próximo para a cobrança.5
Create Checkout
Quando um usuário se cadastrar, crie uma sessão de checkout para o produto baseado em uso. O Dodo Payments então cobra o uso a cada ciclo e emite as faturas.
Acelere com o Time Range Ingestion Blueprint
O Time Range Ingestion Blueprint torna mais rápido o acompanhamento da computação por segundo. Crie uma instância de ingestão por nível de hardware e chametrackTimeRange após cada execução.
durationMs nos metadados. Defina o Over Property de cada medidor como durationMs ou envie durationSeconds para manter a precificação por segundo. Com uma instância de ingestão por nível de hardware, isso corresponde diretamente à medição em vários níveis da Replicate.
Estimativa de custos para usuários
As cobranças baseadas em uso podem ser difíceis de prever, portanto mostre aos usuários uma estimativa de custo antes que executem um modelo. As estimativas evitam cobranças inesperadas e aumentam a confiança.Exemplos de cálculos de custo
Criando uma calculadora de custos
Esta função multiplica a tarifa por segundo do nível pelo tempo de execução estimado:Enterprise: capacidade reservada
Para clientes que precisam de capacidade dedicada e nenhum cold boot, a Replicate oferece deployments: instâncias dedicadas cobradas por todo o tempo em que permanecem online. Para representar a capacidade reservada com o Dodo Payments, venda-a como um produto de assinatura:- Tipo de produto: Assinatura
- Preço: preço mensal fixo (por exemplo, “Instância A100 reservada - $500/mês”)
- Ciclo de cobrança: Mensal
Avançado: medição por heartbeat
Para tarefas executadas por minutos ou horas, um único evento ao final é arriscado: se o processo falhar, você perderá os dados de uso. Em vez disso, envie um evento de uso a cada 30 a 60 segundos enquanto a tarefa estiver em execução.Principais recursos do Dodo utilizados
Usage-Based Billing
Configure produtos que cobram com base no consumo.
Meters
Defina as métricas que você deseja acompanhar e pelas quais deseja cobrar.
Event Ingestion
Envie dados de uso ao Dodo Payments conforme eles ocorrerem.
Subscriptions
Gerencie a cobrança recorrente de capacidade reservada e planos Enterprise.
Time Range Blueprint
Acompanhe a computação por segundo com auxiliares de duração.