HomeAI APIs › AWS-Grundkosten
geschätzte monatliche Kosten
Kosten pro Anfrage
Input-Anteil / Mo
Output-Anteil / Monat

Jedes Bedrock-Modell für diese Arbeitsbelastung

Gleiche Token und gleiches Volumen, Preise im gesamten Katalog – am günstigsten an erster Stelle.

ModellEin-/Ausgänge (pro 1 Mio.)Auf AnfrageMonatlich
⚠️ Referenzschätzung. Die Grundgesteinspreise variieren je nach Region und ändern sich im Laufe der Zeit – überprüfen Sie die aktuellen Preise auf der AWS Bedrock-Preisseite. Rabatte für Batch- und Prompt-Caching sind Richtwerte und hängen vom Modell ab. Der bereitgestellte Durchsatz (stündlich festgelegt) kann On-Demand nur bei hohem, konstantem Volumen übertreffen. · Veralteten Preis melden →

Wie die Abrechnung bei Bedrock tatsächlich funktioniert

Amazon Bedrock ist ein Gateway, kein einzelnes Modell. Sie rufen Claude, Amazons eigene Nova-Familie, Metas Llama, Mistral oder Titan über eine API auf, und jedes wird auf die gleiche Weise gemessen: eine Rate pro Million Eingang Tokens (alles, was Sie senden – Systemaufforderung, Kontext, die Nachricht des Benutzers) und eine separate, normalerweise höhere Rate pro Million Ausgabe Tokens (was das Modell generiert). Es gibt keinen monatlichen Mindestbetrag für On-Demand; Ihre Rechnung besteht aus reinen Token × Tarif. Die Feinheit, die den meisten Schätzungen entgeht, ist, dass das Geld in den Output fließt – der Preis ist zwei- bis fünfmal höher als der Input auf den Ebenen Claude und Nova, sodass ein gesprächiges Modell, das lange Antworten schreibt, weitaus mehr kostet, als seine Input-Rate vermuten lässt.

Dieser Rechner macht das sichtbar. Geben Sie die Token ein, die eine typische Anfrage sendet und empfängt, sowie die Anzahl Ihrer monatlichen Anfragen. Die Rechnung wird dann in einen Input-Anteil und einen Output-Anteil aufgeteilt, sodass Sie sehen können, welcher angegriffen werden soll. Dann kostet es die Dasselbe Arbeitslast im gesamten Bedrock-Katalog und ordnet sie, da das günstigste Modell für einen Zusammenfassungsrechner, der viel liest und wenig schreibt, nicht das günstigste Modell für einen Generator ist, der lange Ausgaben schreibt. Die Schlagzeile „pro 1 Million“ verrät Ihnen selten den Gewinner – Ihr Token-Mix schon.

Die drei Hebel, die einen Grundstein-Schein schneiden

1. Modellwahl. Wenn Sie für Anfragen, die keiner tiefgehenden Begründung bedürfen, von einem Frontier-Claude auf Nova Lite oder Llama umsteigen, können Sie die Kosten um über 90 % senken – die Tabelle zeigt genau, wie viel für Ihren Mix anfällt. Leiten Sie harte Eingabeaufforderungen an das große Modell und einfache Eingabeaufforderungen an ein billiges Modell weiter. Größe der Aufteilung mit dem Modell-Routing-Rechner. 2. Batch-Inferenz. Wenn die Arbeit nicht in Echtzeit erfolgt – Anreicherung über Nacht, Massenklassifizierung, Auswertungen –, führt der Batch-Modus von Bedrock sie zum etwa halben Preis aus. Drehen Sie den Preismodus oben um, um ihn anzuzeigen. 3. Sofortiges Caching. Wenn viele Anfragen ein großes festes Präfix haben (eine lange Systemeingabeaufforderung, ein Dokument, Beispiele mit wenigen Aufnahmen), wird sie durch das Zwischenspeichern dieser Eingabe um bis zu 90 % reduziert; Legen Sie den Prozentsatz der zwischengespeicherten Eingaben fest, um die Einsparung zu modellieren, und gehen Sie tiefer mit dem Prompt-Caching-Rechner.

Bedrock im Vergleich zur direkten API

Für das gleiche Claude-Modell gelten die Listenpreise pro Token für Bedrock und die direkte Anthropic API sind typischerweise gleich oder weisen einen Rundungsfehler auf. Die Wahl ist also betrieblicher und nicht finanzieller Natur: Wählen Sie Bedrock, um Rückschlüsse in Ihrem AWS-Konto, IAM und VPC zu behalten, die Abrechnung zu konsolidieren und Nova, Llama, Mistral und Titan über eine einzige Integration zu erreichen. Wählen Sie vom ersten Tag an die direkte API für die neuesten Modelle und die einfachste Einrichtung. Wenn es um die Kosten geht, vergleichen Sie den Gewinner hier mit dem günstigste LLM-API Informieren Sie sich über alle Anbieter, bevor Sie sich verpflichten.

Wie man es benutzt

1. Wählen Sie ein Modell und geben Sie Ihr monatliches Anfragevolumen ein.
2. Geben Sie typische Eingabe- und Ausgabetokens pro Anfrage ein (ein grober Durchschnitt reicht aus).
3. Wählen Sie „On-Demand“ oder „Batch“ und legen Sie den Anteil der zwischenspeicherbaren Eingaben fest.
4. Lesen Sie die monatlichen Kosten und die Kosten pro Anfrage und überprüfen Sie dann die Tabelle, um zu sehen, ob ein günstigeres Modell die gleiche Aufgabe abdeckt.

Häufige Fehler

Schätzung nur für Eingabetokens. Die Ausgabe ist die teure Hälfte – berücksichtigen Sie immer eine realistische Ausgabelänge. Verwenden von Durchschnittswerten, die lange Antworten verbergen. Wenn einige Antworten fünfmal länger sind, liegt Ihre tatsächliche Rechnung über dem Durchschnitt; Modellieren Sie auch den schlimmsten Fall. Die freien Hebel vergessen. Batch- und Caching-Funktionen sind einmalig festgelegte Einsparungen, die viele Teams nie nutzen. Ignorieren der damit verbundenen Kosten. Datenübertragung, Speicher für RAG und Provisioned Throughput-Verpflichtungen fallen nicht in die Preisgestaltung pro Token ein – budgetieren Sie sie separat.

FAQ

Erhebt Bedrock eine Grundgebühr oder eine monatliche Gebühr?

Nein – On-Demand-Bedrock ist reines Pay-per-Token ohne Mindestbestellwert. Sie zahlen nur einen festen Betrag, wenn Sie sich für Provisioned Throughput entscheiden, der stundenweise Kapazität für hohe, stetige Arbeitslasten reserviert.

Was ist das günstigste Bedrock-Modell?

Nova Micro und Nova Lite von Amazon sind für Text am günstigsten, mit einem Bruchteil eines Cent pro tausend Token. Llama 3.3 70B ist ein starkes Mittelklasse-Modell und Claude Haiku ist der günstigste Claude. Die Tabelle ordnet sie nach Ihrem genauen Token-Mix.

Wie viel spart Batch bei Bedrock?

Ungefähr 50 % im Vergleich zu On-Demand für Jobs, die keine sofortige Antwort erfordern. Stellen Sie den Preismodus auf „Batch“ um, um den Unterschied bei Ihrer Arbeitslast zu sehen.

Kann ich Modelle kombinieren, um Geld zu sparen?

Ja – einfache Anfragen an ein günstiges Modell und schwierige an ein Grenzmodell weiterzuleiten, ist der größte Hebel nach der Auswahl der richtigen Standardeinstellung. Schätzen Sie die Gesamtkosten mit dem Modell-Routing-Einsparungsrechner.

Nur Schätzung. Die Preise für Bedrock unterscheiden sich je nach Region und ändern sich – prüfen Sie vor der Budgetierung die aktuellen Preise bei AWS.

Hosten Sie Ihr Projekt:DigitalOcean – 200 $ kostenlos ↗Hostinger VPS
AI Spend TrackerAPI-Alternativen-FinderFeinabstimmung vs. AufforderungAPI-KostenprognoseKostenrechner für die Feinabstimmung