Warum OpenAIs Modell der Standard ist
Traditionelle SaaS-Abrechnung kommt mit den variablen Kosten der AI-Nutzung nicht gut zurecht. Das Modell von OpenAI löst drei Probleme gleichzeitig:- Planbare Umsätze und geringes Risiko: Da die API-Nutzung im Voraus bezahlt wird, können Nutzer keine Rechnungen anhäufen, die sie nicht bezahlen können. OpenAI erhält das Geld sofort, und der Nutzer gibt es bei der Nutzung des Dienstes aus.
- Skalierbarkeit für Entwickler: Eine Aufladung von $5 ist eine niedrige Einstiegshürde. Wenn eine Anwendung wächst, können Entwickler Aufladungen automatisieren oder größere Pakete kaufen. Der Einstieg ist günstig, und die Nutzung kann wachsen, ohne dass ein Planwechsel erforderlich ist.
- Nutzerpsychologie: In US-Dollar denominierte Credits machen den Wert klarer als abstrakte „Tokens“ oder „Punkte“. Das Guthaben funktioniert wie ein vorausbezahltes Konto für AI-Dienste, was die Budgetplanung für Unternehmen erleichtert.
Wie OpenAI abrechnet
OpenAI verwendet für unterschiedliche Nutzer zwei Abrechnungsmodelle.- API (Pay-as-you-go): Die API verwendet im Voraus bezahlte, auf Dollar lautende Guthaben. Nutzer laden ihre Konten mit $5, $10, $50 oder mehr auf. Die Guthaben zeigen einen Dollarwert an, können aber nicht außerhalb von OpenAI verwendet werden. OpenAI rechnet pro Token ab, mit unterschiedlichen Preisen für Input- und Output-Tokens. Gekaufte Guthaben verfallen ein Jahr nach dem Kauf und sind nicht erstattungsfähig (OpenAI Help Center). Wenn ein Guthaben von $0 erreicht ist, schlagen API-Aufrufe fehl.
- ChatGPT Plus, Business und Enterprise: Dies sind Pauschalabonnements. ChatGPT Plus kostet $20 pro Monat, und der Business-Tarif (früher Team) kostet bei monatlicher Abrechnung $25 pro Nutzer und Monat. Sie haben weiche Nutzungslimits: Bei intensiver Nutzung wechseln Nutzer zu einem kleineren Modell, anstatt blockiert zu werden.
- Ausgabenbasierte Tarifstufen: Wenn die Gesamtausgaben im Laufe der Zeit steigen, schaltet das Konto höhere API-Ratenlimits frei. Der Zugriff erweitert sich mit der Abrechnungshistorie.
Was macht das Modell einzigartig?
Vier Merkmale machen die Abrechnung von OpenAI für AI-Dienste effektiv:- Auf Fiatwährung lautende Guthaben: Die Guthaben sind in US-Dollar angegeben und fühlen sich daher wie Geld an. Entwickler können den Preis einer Anfrage direkt ablesen.
- Lange Gültigkeit: Gekaufte Guthaben sind ein Jahr lang gültig, wodurch der Druck nach dem Motto „nutze es oder verliere es“ sinkt. Nutzer laden ihre Konten daher gerne mit größeren Beträgen auf.
- Mehrdimensionale Abrechnung: Input- und Output-Tokens werden separat erfasst, aber vom selben Guthaben abgezogen. OpenAI kann teurere Output-Tokens höher bepreisen als Input-Tokens.
- Vertrauensstufen: Ratenlimits, die mit den Gesamtausgaben steigen, belohnen langfristige Kunden und ermutigen sie, zu bleiben.
Strategische Vorteile
Das Modell verstärkt sich selbst. Niedrige Einstiegskosten bringen Entwickler an Bord. Vorausbezahlte Guthaben sorgen für sofortigen Cashflow. Nutzungsbasierte Preise bedeuten, dass OpenAI mehr verdient, wenn Entwickler erfolgreich sind. Abonnements sorgen für eine verlässliche Umsatzbasis durch Nutzer, die keine Entwickler sind.Mit Dodo Payments umsetzen
Du kannst das Abrechnungsmodell von OpenAI mit Dodo Payments umsetzen. Verwende Credit-Based Billing für die API-Seite und Standardabonnements für die ChatGPT-Plus-Seite.1
Create a Fiat Credit Entitlement
Gehe in deinem Dodo Payments-Dashboard zu Products → Credits und klicke auf Create Credit. Dieses Guthaben ist der zentrale Kontostand für jeden Nutzer.
- Credit Type: Fiat Credits, mit Unit Currency auf USD gesetzt
- Credit Expiry: Benutzerdefiniert, 365 Tage (entspricht der einjährigen Gültigkeit bei OpenAI) oder Nie
- Rollover: Nicht erforderlich (Guthaben werden nicht bei jedem Zyklus zurückgesetzt)
- Allow Overage: Deaktiviert
2
Create Top-Up Products
Erstelle Einmalzahlungsprodukte für verschiedene Credit-Pakete, etwa $5, $10, $50 und $100. Verknüpfe dein Fiat Credit mit jedem Produkt.Lege die Anzahl der ausgegebenen Credits auf den Dollarwert des Pakets fest. Ein Paket für $50 gibt 50 Credits aus.
3
Create Usage Meters
Erstelle zwei Meters, um die Token-Nutzung zu erfassen:
llm.input_tokens: Sum aggregation für die Eigenschafttokens.llm.output_tokens: Sum aggregation für die Eigenschafttokens.
Meter-Einheiten pro Credit berechnen
Um die GPT-4o-Preise von OpenAI abzubilden, ermittle, wie viele Tokens $1 kosten, also ein Fiat Credit:- Input-Tokens: 1.000.000 Tokens / $2.50 = 400.000 Tokens pro $1.
- Output-Tokens: 1.000.000 Tokens / $10.00 = 100.000 Tokens pro $1.
4
Send Usage Events
Sende die Nutzung nach jeder LLM-Anfrage an Dodo Payments. Eine Anfrage kann sowohl das Input- als auch das Output-Event enthalten. Dieses Snippet verwendet erneut den
client aus dem vorherigen Schritt.5
Handle Balance Depletion
Prüfe das Guthaben des Nutzers, bevor du eine API-Anfrage verarbeitest. Wenn das Guthaben null oder negativ ist, lehne die Anfrage ab, zum Beispiel mit einem
402-Status.Webhooks bei niedrigem Guthaben behandeln
Informiere Nutzer, bevor sie $0 erreichen. Lege beim Verknüpfen des Guthabens einen Low Balance Threshold fest und sende eine E-Mail oder In-App-Benachrichtigung, wenn dercredit.balance_low-Webhook eintrifft.6
Build the ChatGPT Subscription Side (Optional)
Um ein Abonnement wie ChatGPT Plus anzubieten, erstelle ein separates Abonnementprodukt in Dodo Payments. Es benötigt keine Credit-Berechtigung.Verwende für einen Team-Tarif seat-based billing: ein Add-on pro Sitzplatz, dessen Menge der Anzahl der Nutzer entspricht.
Weiche Limits implementieren
Um weiche Limits umzusetzen, erfasse die Nutzung von Abonnementnutzern mit denselben Meters, ohne sie mit einem Credit zu verknüpfen. Prüfe in deiner Anwendung die Nutzung für den aktuellen Abrechnungszeitraum.Mit dem LLM Ingestion Blueprint schneller vorankommen
Die obigen Schritte erstellen und senden Nutzungsevents manuell. Der LLM Ingestion Blueprint bindet stattdessen deinen OpenAI-Client ein und erfasst Tokens automatisch.inputTokens, outputTokens und totalTokens aus jeder API-Antwort und sendet sie zusammen mit model als Event-Metadaten. Setze Over Property deines Meters auf den Token-Schlüssel, den du abrechnen möchtest.
Ausgabenbasierte Ratenstufen implementieren
Die Ratenstufen von OpenAI verwalten die Kapazität anhand von Vertrauen. Um sie umzusetzen, erfasse die lebenslangen Ausgaben jedes Kunden.- Lebenslange Ausgaben erfassen: Höre auf
payment.succeeded-Webhooks und addiere den Zahlungsbetrag in deiner Datenbank für den jeweiligen Kunden zu einemtotal_spend-Feld. Beträge werden in der kleinsten Währungseinheit angegeben, daher entsprechen 5000 $50.00. - Stufen definieren: Ordne Ausgabenbeträge Ratenlimits zu:
- Stufe 1: $0 - $50 Ausgaben -> 3 RPM
- Stufe 2: $50 - $250 Ausgaben -> 10 RPM
- Stufe 3: $250+ Ausgaben -> 50 RPM
- Limits durchsetzen: Ermittle in deiner API-Middleware die Stufe des Kunden und wende deren Ratenlimit an.
Vollständiges Implementierungsbeispiel: Der API-Proxy
In einer Produktionsumgebung befindet sich normalerweise ein API-Proxy zwischen deinen Nutzern und dem LLM-Anbieter. Der Proxy authentifiziert die Anfrage, prüft Credits und meldet die Nutzung. Der folgende Handler implementiert den Proxy:Umgang mit Sonderfällen
Ein Abrechnungssystem wie das von OpenAI bringt mehrere Sonderfälle mit sich, die du einplanen solltest.Race Conditions
Ein Nutzer mit einem niedrigen Guthaben kann mehrere Anfragen gleichzeitig senden und das Guthaben überschreiten, bevor ein Event verarbeitet wird. Halte daher einen kleinen Puffer vor oder sperre das Guthaben des Kunden während jeder Anfrage mit einem verteilten Lock.Latenz bei der Eventaufnahme
Dodo Payments zieht Credits asynchron ab. Ein Background Worker verarbeitet neue Events ungefähr einmal pro Minute, sodass ein Abzug hinter dem API-Aufruf zurückbleiben kann. Für eine strikt echtzeitfähige Durchsetzung solltest du einen lokalen Cache des Guthabens jedes Nutzers führen und ihn bei der Verarbeitung von Anfragen aktualisieren.Umgang mit Rückerstattungen
Durch die Rückerstattung eines Credit-Paketkaufs werden die dadurch gewährten Credits nicht entfernt. Ziehe diese Credits bei einer Rückerstattung selbst per Debit ab: Verwende Apply Credit/Debit im Tab Credits des Kunden oder die API Create Ledger Entry. Aktualisiere anschließend die Guthabenanzeige in deiner Anwendung, damit Nutzer keine Credits ausgeben können, die sie nicht mehr besitzen.Unterstützung mehrerer Modelle
Um mehrere Modelle mit unterschiedlichen Preisen zu unterstützen, stehen zwei Optionen zur Verfügung:- Separate Meters: Erstelle einen Satz Meters pro Modell, zum Beispiel
gpt-4o.input_tokensundgpt-4o-mini.input_tokens, jeweils mit eigenen Meter units per credit. - Gewichtete Events: Verwende einen Meter und multipliziere
tokensvor dem Senden des Events mit einem Gewicht. Wenn GPT-4o beispielsweise zehnmal so viel kostet wie GPT-4o-mini, sende bei GPT-4o-Anfragen die zehnfache Tokenanzahl.
Architekturübersicht
Der folgende Ablauf zeigt den vorausbezahlten Prozess vom Kauf bis zur Blockierung von Aufrufen: Die Meters erfassen Tokens und ziehen deren Dollarwert zu den von dir konfigurierten Preisen vom Credit-Guthaben des Nutzers ab. Deine Anwendung blockiert Aufrufe, sobald das Guthaben null erreicht.Fazit
Mit Dodo Payments kannst du nutzungsbasierte Abrechnung mit der Planbarkeit vorausbezahlter Credits kombinieren, wie es OpenAI tut. Kunden zahlen im Voraus, geben ihr Guthaben nach Bedarf aus und laden es auf, wenn sie mehr benötigen. Dieselben Bausteine funktionieren für eine große LLM-Plattform ebenso wie für ein kleines AI-Tool: ein Fiat Credit, Produkte zum Aufladen, Token-Meters und eine Guthabenprüfung vor jeder Anfrage.Verwendete Dodo-Funktionen
Diese Dodo-Payments-Funktionen bilden die Grundlage der Implementierung:Credit-Based Billing
Verwalte vorausbezahlte Fiat Credits und Berechtigungen für deine Nutzer.
Usage-Based Billing
Erfasse detaillierte Nutzung wie Tokens und rechne sie ab.
One-Time Payments
Verkaufe Credit-Pakete und Aufladungen über den Checkout.
Event Ingestion
Sende Nutzungsdaten mit hohem Volumen an Dodo Payments.
Webhooks
Halte dich über Änderungen des Credit-Guthabens und Benachrichtigungen bei niedrigem Guthaben auf dem Laufenden.
LLM Ingestion Blueprint
Automatische Token-Erfassung für OpenAI und andere LLM-Anbieter.