HomeAI APIs › Custo base da AWS
custo mensal estimado
custo por solicitação
compartilhamento de entrada / mês
participação de saída / mês

Cada modelo Bedrock para esta carga de trabalho

Mesmos tokens e volume, com preços em todo o catálogo – classificados primeiro como mais baratos.

ModeloEntrada/Saída (por 1M)Por solicitaçãoMensal
⚠️ Estimativa de referência. Os preços do Bedrock variam de acordo com a região e mudam com o tempo – confirme as taxas atuais no Página de preços do AWS Bedrock. Os descontos em lote e cache imediato são aproximados e dependem do modelo. A taxa de transferência provisionada (fixa por hora) pode superar sob demanda apenas em volume alto e constante. · Informar preço desatualizado →

Como o faturamento Bedrock realmente funciona

Amazon Bedrock é um gateway, não um modelo único. Você chama Claude, a própria família Nova da Amazon, Meta's Llama, Mistral ou Titan por meio de uma API, e cada um é medido da mesma maneira: uma taxa por milhão entrada tokens (tudo o que você envia – prompt do sistema, contexto, mensagem do usuário) e uma taxa separada, geralmente mais alta, por milhão saída tokens (o que o modelo gera). Não há mínimo mensal sob demanda; sua fatura é puramente tokens × taxa. A sutileza que a maioria das estimativas ignora é que a produção é para onde vai o dinheiro – seu preço é duas a cinco vezes mais alto do que o insumo nas camadas Claude e Nova, portanto, um modelo tagarela que escreve respostas longas custa muito mais do que sua taxa de entrada sugere.

Esta calculadora torna isso visível. Insira os tokens que uma solicitação típica envia e recebe e sua contagem de solicitações mensais, e isso divide a conta em um compartilhamento de entrada e um compartilhamento de saída para que você possa ver qual deles atacar. Então ele avalia o mesmo carga de trabalho em todo o catálogo Bedrock e os classifica, porque o modelo mais barato para um resumidor que lê muito e escreve um pouco não é o modelo mais barato para um gerador que grava saídas longas. O número do título “por 1 milhão” raramente indica o vencedor – seu mix de tokens sim.

As três alavancas que cortam uma conta Bedrock

1. Escolha do modelo. Mudar de um Claude de fronteira para Nova Lite ou Llama para solicitações que não precisam de raciocínio profundo pode reduzir custos em mais de 90% - a tabela mostra exatamente quanto custa seu mix. Encaminhe solicitações difíceis para o modelo grande e as fáceis para um modelo barato; dimensione a divisão com o calculadora de roteamento de modelo. 2. Inferência em lote. Se o trabalho não for em tempo real – enriquecimento noturno, classificação em massa, avaliações – o modo em lote da Bedrock o executa por aproximadamente metade do preço. Vire o modo de preços acima para vê-lo. 3. Cache de prompt. Quando muitas solicitações compartilham um grande prefixo fixo (um longo prompt do sistema, um documento, alguns exemplos), o armazenamento em cache dessa entrada reduz em até 90%; defina a porcentagem de entrada em cache para modelar a economia e vá mais fundo com o calculadora de cache imediata.

Bedrock versus API direta

Para o mesmo modelo Claude, os preços de tabela por token na Bedrock e no API antrópica direta são normalmente iguais ou dentro de um erro de arredondamento. Portanto, a escolha é operacional, não financeira: escolha Bedrock para manter a inferência dentro de sua conta AWS, IAM e VPC, para consolidar o faturamento e alcançar Nova, Llama, Mistral e Titan por meio de uma integração. Escolha a API direta para os modelos mais recentes no primeiro dia e a configuração mais simples. Se o custo é a questão toda, compare o vencedor aqui com o API LLM mais barata entre provedores antes de você se comprometer.

Como usar

1. Escolha um modelo e insira seu volume de solicitações mensais.
2. Insira tokens típicos de entrada e saída por solicitação (uma média aproximada é adequada).
3. Escolha sob demanda ou lote e defina a parcela de entrada que pode ser armazenada em cache.
4. Leia o custo mensal e o custo por solicitação e, em seguida, examine a tabela para ver se um modelo mais barato cobre o mesmo trabalho.

Erros comuns

Estimativa apenas em tokens de entrada. A saída é a metade cara – sempre inclua um comprimento de saída realista. Usando médias que escondem respostas longas. Se algumas respostas forem 5x mais longas, sua conta real está acima da média; modele o pior caso também. Esquecendo as alavancas livres. Lote e cache são economias definidas uma vez que muitas equipes nunca ativam. Ignorando os custos circundantes. Os compromissos de transferência de dados, armazenamento para RAG e taxa de transferência provisionada ficam fora do preço por token – faça um orçamento para eles separadamente.

Perguntas frequentes

A Bedrock cobra uma taxa básica ou mensal?

Não – Bedrock sob demanda é puro pagamento por token, sem mínimo. Você só paga um valor fixo se escolher Provisioned Throughput, que reserva capacidade por hora para cargas de trabalho altas e constantes.

Qual é o modelo Bedrock mais barato?

A Nova Micro e a Nova Lite da Amazon são as mais baratas para texto, custando uma fração de um centavo por mil tokens. Llama 3.3 70B tem um valor intermediário forte e Claude Haiku é o Claude mais barato. A tabela os classifica de acordo com sua combinação exata de tokens.

Quanto o lote economiza no Bedrock?

Aproximadamente 50% versus sob demanda para trabalhos que não precisam de resposta imediata. Mude o modo de precificação para lote para ver a diferença em sua carga de trabalho.

Posso misturar modelos para economizar dinheiro?

Sim – encaminhar solicitações fáceis para um modelo barato e difíceis para um modelo de fronteira é a maior alavanca depois de escolher o padrão correto. Estime o custo combinado com a calculadora de economia de roteamento de modelo.

Estimativa apenas. Os preços básicos variam de acordo com a região e mudam. Verifique as taxas atuais com a AWS antes de fazer o orçamento.

Hospede seu projeto:DigitalOcean – $ 200 grátis ↗VPS da Hostinger
Rastreador de gastos com IALocalizador de alternativas de APIAjuste fino versus solicitaçãoPrevisão de custos de APICalculadora de custos de ajuste fino