HomeAI APIs › Costo AWS Bedrock
costo mensile stimato
costo per richiesta
condivisione ingresso/mese
quota di produzione/mese

Ogni modello Bedrock per questo carico di lavoro

Stessi gettoni e volume, prezzati in tutto il catalogo: al primo posto il più economico.

ModelloEntrata/uscita (per 1 milione)Per richiestaMensile
⚠️ Preventivo di riferimento. I prezzi del fondamento variano in base alla regione e cambiano nel tempo: conferma le tariffe attuali sul Pagina dei prezzi di AWS Bedrock. Gli sconti per batch e memorizzazione nella cache dei prompt sono approssimativi e dipendono dal modello. Il throughput assegnato (orario fisso) può battere quello su richiesta solo a volume elevato e costante. · Segnala prezzo obsoleto →

Come funziona effettivamente la fatturazione Bedrock

Amazon Bedrock è un gateway, non un singolo modello. Chiami Claude, la famiglia Nova di Amazon, Meta's Llama, Mistral o Titan tramite un'API e ciascuno viene misurato allo stesso modo: una tariffa per milione ingresso token (tutto ciò che invii: prompt di sistema, contesto, messaggio dell'utente) e una tariffa per milione separata, solitamente più alta produzione token (ciò che il modello genera). Non esiste un minimo mensile su richiesta; la tua fattura è puramente gettoni × tariffa. La sottigliezza che la maggior parte delle stime non tiene conto è che l’output è dove vanno i soldi: ha un prezzo da due a cinque volte superiore rispetto all’input sui livelli Claude e Nova, quindi un modello loquace che scrive risposte lunghe costa molto di più di quanto suggerisca il suo tasso di input.

Questa calcolatrice lo rende visibile. Inserisci i token che una richiesta tipica invia e riceve e il conteggio delle tue richieste mensili e divide il conto in una condivisione di input e una condivisione di output in modo da poter vedere quale attaccare. Quindi valuta il Stesso carico di lavoro nell'intero catalogo Bedrock e li classifica, perché il modello più economico per un riepilogo che legge molto e scrive poco non è il modello più economico per un generatore che scrive un output lungo. Il numero "per 1 milione" nel titolo raramente ti dice il vincitore: il tuo mix di token lo fa.

Le tre leve che tagliano una banconota Bedrock

1. Scelta del modello. Passare da un Claude di frontiera a Nova Lite o Llama per le richieste che non richiedono un ragionamento approfondito può ridurre i costi di oltre il 90%: la tabella mostra esattamente quanto costa per il tuo mix. Indirizzare i suggerimenti difficili al modello grande e quelli facili a quello economico; dimensionare la divisione con il calcolatore di routing del modello. 2. Inferenza batch. Se il lavoro non è in tempo reale (arricchimento notturno, classificazione in blocco, valutazioni), la modalità batch di Bedrock lo esegue a circa la metà del prezzo. Capovolgi la modalità di prezzo sopra per vederla. 3. Memorizzazione rapida nella cache. Quando molte richieste condividono un prefisso fisso di grandi dimensioni (un lungo prompt di sistema, un documento, alcuni esempi di poche riprese), la memorizzazione nella cache di quell'input lo sconta fino al 90%; imposta la percentuale di input memorizzato nella cache per modellare il risparmio e scava più a fondo con calcolatore di memorizzazione nella cache rapida.

Bedrock rispetto all'API diretta

Per lo stesso modello Claude, prezzi di listino per token su Bedrock e API antropica diretta sono in genere uguali o rientrano in un errore di arrotondamento. Quindi la scelta è operativa, non finanziaria: scegli Bedrock per mantenere l'inferenza all'interno del tuo account AWS, IAM e VPC, per consolidare la fatturazione e per raggiungere Nova, Llama, Mistral e Titan attraverso un'unica integrazione. Scegli l'API diretta per i modelli più recenti fin dal primo giorno e la configurazione più semplice. Se il costo è l'intera questione, confronta il vincitore qui con il API LLM più economica tra i fornitori prima di impegnarti.

Come usarlo

1. Scegli un modello e inserisci il volume della tua richiesta mensile.
2. Inserisci i token di input e output tipici per richiesta (una media approssimativa va bene).
3. Scegli su richiesta o batch e imposta la quota di input memorizzabile nella cache.
4. Leggi il costo mensile e il costo per richiesta, quindi scansiona la tabella per vedere se un modello più economico copre lo stesso lavoro.

Errori comuni

Stima solo sui token di input. L'output è la metà costosa: includi sempre una lunghezza di output realistica. Utilizzando medie che nascondono risposte lunghe. Se alcune risposte sono 5 volte più lunghe, il tuo conto reale è superiore alla media; modellare anche il caso peggiore. Dimenticando le leve libere. Batch e memorizzazione nella cache sono risparmi una tantum che molti team non attivano mai. Ignorando i costi circostanti. Gli impegni di trasferimento dati, archiviazione per RAG e Provisioned Throughput non rientrano nei prezzi per token: budget per essi separatamente.

Domande frequenti

Bedrock addebita una tariffa base o mensile?

No, Bedrock on-demand è puramente pay-per-token senza alcun minimo. Paghi solo un importo fisso se scegli Provisioned Throughput, che riserva capacità su base oraria per carichi di lavoro elevati e costanti.

Qual è il modello Bedrock più economico?

Nova Micro e Nova Lite di Amazon sono i più economici per i messaggi di testo, con una frazione di un centesimo per mille token. Llama 3.3 70B ha un forte valore di livello medio e Claude Haiku è il Claude più economico. La tabella li classifica in base al tuo esatto mix di gettoni.

Quanto si risparmia in batch su Bedrock?

Circa il 50% rispetto a on-demand per lavori che non necessitano di una risposta immediata. Trasforma la modalità di determinazione del prezzo in batch per vedere la differenza nel carico di lavoro.

Posso mescolare i modelli per risparmiare denaro?

Sì, instradare le richieste facili a un modello economico e quelle difficili a un modello di frontiera è la leva più grande dopo aver scelto il giusto valore predefinito. Stimare il costo combinato con il calcolatore del risparmio del routing del modello.

Solo stima. I prezzi Bedrock variano in base alla regione e cambiano: verifica le tariffe attuali con AWS prima di definire il budget.

Ospita il tuo progetto:DigitalOcean: $ 200 gratis ↗Hostinger VPS
Monitoraggio della spesa AITrova alternative APIMessa a punto vs PromptPrevisione dei costi APICalcolatore dei costi di ottimizzazione