—vs. On-Demand
—effektiv $/1 Mio
—genutzte Kapazität
Effektiver Preis bei steigendem Volumen
Die Reservierungskosten sind fest, sodass jeder zusätzliche Token den effektiven Preis pro Million senkt – bis Sie die Kapazitätsgrenze erreichen und die Rechnungen zum On-Demand-Tarif überlaufen.
| Monatliches Volumen | Kosten nach Bedarf | Reserviert mit einer Gültigkeit von 1 Mio. $ | Günstiger |
|---|
Reservekapazität nur oberhalb der Gewinnschwelle
Bereitgestellter Durchsatz – PTUs auf Azure OpenAI, bereitgestellter Durchsatz auf AWS Bedrock – tauscht eine Rechnung pro Token gegen eine feste monatliche Reservierung dedizierter Kapazität. Es erkauft sich eine vorhersehbare Latenz und Pauschalkosten, spart aber erst dann Geld, wenn Ihr stabiles Token-Volumen die Gewinnschwelle erreicht: die Reservierungskosten geteilt durch den On-Demand-Preis pro Token. Darunter zahlen Sie für ungenutzte Einheiten; Darüber verteilen sich die Fixkosten auf mehr Token und Ihr effektiver Preis pro Million sinkt weiter, bis hin zur Kapazitätsobergrenze von Einheiten × Token pro Minute × Minuten im Monat. Überschreiten Sie die Obergrenze und die überlaufenden Rechnungen zum vollen On-Demand-Tarif, wodurch der Rabatt stillschweigend ausgehöhlt wird. Passen Sie die Reservierung an das Volumen an, von dem Sie überzeugt sind, dass Sie es jeden Monat nutzen werden, und prognostizieren Sie ein Wachstum API-Kostenprognoserechner, und vergleichen Sie eine Ausgabenverpflichtung für die Rabattrechner für zugesagte Ausgaben.
Kostenrechner für die LLM-EvaluierungKostenrechner für die Erzeugung synthetischer DatenAI-Seat-Lizenz vs. API-KostenrechnerZeit- und Kostenrechner für die StapelverarbeitungKI-Kosten-pro-Benutzer-Rechner
So funktioniert dieser Rechner
Kostenloser Rechner für bereitgestellten Durchsatz – sollten Sie dedizierte LLM-Kapazität reservieren (Azure OpenAI PTU, bereitgestellter Durchsatz von Bedrock) oder bei der nutzungsbasierten Bezahlung bleiben …
Häufig gestellte Fragen
Was ist bereitgestellter Durchsatz und wann lohnt er sich?
Bereitgestellter Durchsatz – Azure OpenAI nennt es PTUs, AWS Bedrock nennt es bereitgestellten Durchsatz – bedeutet, dedizierte Modellkapazität für eine feste monatliche Gebühr zu mieten, anstatt pro Token zu zahlen. Sie reservieren eine Reihe von Einheiten, von denen jede eine bestimmte Anzahl an Token pro Minute verarbeiten kann, und zahlen den gleichen Betrag, unabhängig davon, ob Sie sie vollständig nutzen oder nicht. Es gewinnt nur, wenn Ihr stabiles Token-Volumen hoch genug ist, dass die entsprechende Umlagerechnung die Reservierung übersteigen würde. Unterhalb dieser Gewinnschwelle zahlen Sie für ungenutzte Kapazität; Darüber hinaus ist jeder zusätzliche Token praktisch kostenlos, bis Sie die Durchsatzobergrenze erreichen.
Wie finde ich die Gewinnschwelle für eine PTU-Reservierung?
Teilen Sie die gesamten monatlichen Reservierungskosten durch den On-Demand-Preis pro Token. Das ergibt die Anzahl an Tokens, bei der die Umlage genau so viel kosten würde wie die Reservierung. Verarbeiten Sie weniger Token und On-Demand ist günstiger; Verarbeiten Sie mehr und die Reservierung gewinnt – bis zur Kapazitätsobergrenze, die sich aus den Einheiten mal Token pro Minute mal den Minuten in einem Monat ergibt. Dieser Rechner zeigt sowohl das Break-Even-Token-Volumen als auch Ihre Kapazitätsauslastung an, sodass Sie erkennen können, ob Sie die Reservierung nicht ausreichend nutzen oder kurz davor stehen, keinen Spielraum mehr zu haben.
Was passiert, wenn ich meine bereitgestellte Kapazität überschreite?
Anfragen, die über die reservierten Token pro Minute hinausgehen, werden entweder gedrosselt oder greifen auf den meisten Plattformen auf eine nutzungsabhängige Preisgestaltung für den Überschuss über. Für kurze Zeiträume ist das in der Regel in Ordnung, aber wenn Ihre durchschnittliche Nachfrage regelmäßig die Kapazität übersteigt, zahlen Sie zusätzlich zur festen Reservierung den vollen On-Demand-Tarif für die Überschreitung, wodurch der Rabatt gelöscht wird. Der Rechner markiert, wenn Ihr monatliches Volumen über der reservierten Kapazität liegt, sodass Sie bewusst und nicht versehentlich Einheiten hinzufügen oder den Spillover bei Bedarf belassen müssen.