Todos los modelos de Bedrock para esta carga de trabajo
Los mismos tokens y volumen, con precios en todo el catálogo, clasificados como los más baratos en primer lugar.
| Modelo | Entrada/Salida (por 1M) | Por solicitud | Mensual |
|---|
Cómo funciona realmente la facturación de Bedrock
Amazon Bedrock es una puerta de entrada, no un modelo único. Llamas a Claude, la propia familia Nova de Amazon, Meta's Llama, Mistral o Titan a través de una API, y cada uno se mide de la misma manera: una tarifa por millón. aporte tokens (todo lo que envía: aviso del sistema, contexto, el mensaje del usuario) y una tasa separada, generalmente más alta, por millón producción tokens (lo que genera el modelo). No hay un mínimo mensual bajo demanda; su factura es puramente tokens × tarifa. La sutileza que la mayoría de las estimaciones pasan por alto es que la producción es donde va el dinero: tiene un precio de dos a cinco veces mayor que el de los insumos en los niveles Claude y Nova, por lo que un modelo hablador que escribe respuestas largas cuesta mucho más de lo que sugiere su tasa de insumos.
Esta calculadora lo hace visible. Ingrese los tokens que envía y recibe una solicitud típica, y el recuento de solicitudes mensuales, y dividirá la factura en un porcentaje de entrada y un porcentaje de salida para que pueda ver cuál atacar. Luego valora el mismo carga de trabajo en todo el catálogo de Bedrock y los clasifica, porque el modelo más barato para un resumidor que lee mucho y escribe poco no es el modelo más barato para un generador que escribe resultados largos. El número del título "por 1 millón" rara vez indica quién es el ganador; su combinación de tokens sí.
Las tres palancas que cortan el proyecto de ley Bedrock
1. Elección del modelo. Pasar de un Claude de frontera a Nova Lite o Llama para las solicitudes que no necesitan un razonamiento profundo puede reducir el costo en más del 90 %; la tabla muestra exactamente cuánto por su combinación. Enrute las indicaciones difíciles al modelo grande y las fáciles a uno barato; dimensionar la división con el calculadora de enrutamiento de modelos. 2. Inferencia por lotes. Si el trabajo no es en tiempo real (enriquecimiento nocturno, clasificación masiva, evaluaciones), el modo por lotes de Bedrock lo ejecuta aproximadamente a mitad de precio. Cambie el modo de precios de arriba para verlo. 3. Almacenamiento en caché rápido. Cuando muchas solicitudes comparten un prefijo fijo grande (un mensaje largo del sistema, un documento, ejemplos breves), el almacenamiento en caché de esa entrada la descuenta hasta en un 90%; establezca el porcentaje de entrada en caché para modelar el ahorro y profundice con el calculadora de almacenamiento en caché rápida.
Bedrock frente a la API directa
Para el mismo modelo de Claude, los precios de lista por token en Bedrock y el API antrópica directa suelen ser iguales o están dentro de un error de redondeo. Entonces, la elección es operativa, no financiera: elija Bedrock para mantener la inferencia dentro de su cuenta de AWS, IAM y VPC, para consolidar la facturación y llegar a Nova, Llama, Mistral y Titan a través de una integración. Elija la API directa para los modelos más nuevos desde el primer día y la configuración más sencilla. Si el costo es toda la cuestión, compare aquí al ganador con el API LLM más barata entre proveedores antes de comprometerse.
como usarlo
1. Elija un modelo e ingrese su volumen de solicitud mensual.
2. Ingrese tokens de entrada y salida típicos por solicitud (un promedio aproximado está bien).
3. Elija bajo demanda o por lotes y establezca la proporción de entrada que se puede almacenar en caché.
4. Lea el costo mensual y el costo por solicitud, luego lea la tabla para ver si un modelo más económico cubre el mismo trabajo.
Errores comunes
Estimación solo sobre tokens de entrada. La producción es la mitad más cara: incluya siempre una duración de salida realista. Utilizar promedios que oculten respuestas largas. Si algunas respuestas son 5 veces más largas, su factura real está por encima del promedio; Modele también el peor de los casos. Olvidando las palancas libres. El almacenamiento en caché y por lotes son ahorros que se configuran una sola vez y que muchos equipos nunca activan. Ignorando los costos circundantes. Los compromisos de transferencia de datos, almacenamiento para RAG y rendimiento aprovisionado se encuentran fuera del precio por token; presupuestarlos por separado.
Preguntas frecuentes
¿Bedrock cobra una tarifa base o mensual?
No: Bedrock bajo demanda es puro pago por token sin mínimo. Solo paga una cantidad fija si elige Rendimiento aprovisionado, que reserva capacidad por horas para cargas de trabajo elevadas y constantes.
¿Cuál es el modelo Bedrock más barato?
Nova Micro y Nova Lite de Amazon son los más baratos para mensajes de texto, a una fracción de centavo por cada mil tokens. Llama 3.3 70B tiene un fuerte valor de nivel medio y Claude Haiku es el Claude más barato. La tabla los clasifica según su combinación exacta de tokens.
¿Cuánto ahorra el lote en Bedrock?
Aproximadamente el 50 % frente a la demanda para trabajos que no necesitan una respuesta inmediata. Cambie el modo de precios a lotes para ver la diferencia en su carga de trabajo.
¿Puedo mezclar modelos para ahorrar dinero?
Sí, dirigir las solicitudes fáciles a un modelo barato y las difíciles a un modelo de frontera es la palanca más importante después de elegir el valor predeterminado correcto. Calcule el costo combinado con la calculadora de ahorro de rutas modelo.
Estimación únicamente. Los precios de Bedrock difieren según la región y cambian: verifique las tarifas actuales con AWS antes de realizar el presupuesto.