—
costo mensual real combinado—estimación ingenua a tanto alzado
—exposición a recargos ocultos
—ahorros si se recortan las solicitudes largas
Desglose de costos según su carga de trabajo
El precio de las solicitudes cortas normalmente es la tarifa base; Las solicitudes largas fijan el precio de TODA la llamada (entrada y salida) al precio más alto. La fila ingenua muestra lo que supondría una estimación de tarifa fija, y la fila recortada muestra el escenario en el que las solicitudes largas se comprimen justo por debajo del umbral.
| Fila | Solicitudes | Costo/solicitud | Total parcial |
|---|
Costo combinado por proporción de solicitudes largas
Todo lo demás mantenido en los valores anteriores se extendió por la proporción de solicitudes que superan el umbral. La fila resaltada es la más cercana a su configuración actual.
| Cuota por encima del umbral | Costo real | Estimación ingenua | Recargo |
|---|
Cómo se conecta esto con otras herramientas
Esta calculadora fija el precio de una mecánica específica: un umbral de longitud estricto en el que al cruzarlo se cambia el precio de una solicitud completa, no solo de los tokens que superan la línea. Eso es diferente a nuestro calculadora de costos de ventana contextual, que modela un costo por token uniforme y uniforme por tamaño de contexto y no tiene ninguna lógica de límite o umbral; use esa herramienta si el modelo al que está fijando el precio cobra la misma tarifa independientemente de la duración de la solicitud. También es diferente del Calculadora de precios de nivel LLM y Calculadora de nivel de servicio LLM, que fija el precio de los niveles de servicio Batch/Flex/Priority basados en latencia: una elección que usted hace por solicitud sobre qué tan rápido necesita una respuesta, no una consecuencia de la duración de su mensaje. Si desea precios generales de Gemini en todos los tamaños de modelos sin aislar la mecánica del acantilado, consulte la Calculadora de costos de API de Géminis. Esta página existe porque una vista plana por token de la tarifa principal de $1,25 de Gemini 2.5 Pro omite por completo el costo real una vez que cualquier parte de una carga de trabajo supera los 200 000 tokens de entrada.
Cómo funciona esta calculadora
El Calculadora de precios escalonados de contexto largo ("Cliff") divide su volumen de solicitudes mensuales en dos grupos usando el porcentaje de solicitudes que superan el umbral: solicitudes breves, con un precio normal al tasa base para sus tokens de entrada y salida, y solicitudes largas, cuya entrada excede el umbral de contexto y que, por lo tanto, fijan el precio de TODA su llamada (cada token de entrada y salida) al precio más alto tasa larga. En los valores predeterminados (10.000 solicitudes/mes, 20 % por encima del umbral de 200.000 tokens, corto = 60.000 entradas/2.000 salidas, largo = 350.000 entradas/5.000 salidas, base $1,25/$10, largo $2,50/$15), son 8.000 solicitudes cortas a $0,095 cada una. ($760 subtotal) y 2000 solicitudes largas a $0,95 cada una ($1900 subtotal), para un costo mensual combinado real de $2,660.
Para mostrar lo que una calculadora normal de tarifa plana perdería, la herramienta también calcula una estimación ingenua que aplica la tarifa base a cada solicitud independientemente del tamaño; en el valor predeterminado, asciende a $ 1,735, lo que significa que el costo real conlleva un costo oculto. exposición al recargo de 925 dólares, aproximadamente un 53,3% más de lo que sugeriría la ingenua cifra. Finalmente, la herramienta modela un escenario de recorte: cuánto costarían las solicitudes largas si se comprimen justo por debajo del umbral (1000 tokens por debajo de él) manteniendo el mismo tamaño de salida, con los valores predeterminados que reducen el costo de las solicitudes largas lo suficiente como para ahorrar $1,302.50 al mes, que es la verdadera recompensa de mantener las indicaciones bajo un precio precipicio en lugar de simplemente reducirlas un poco.
Preguntas frecuentes
¿Qué es un "precipicio" de precios de contexto largo?
Un acantilado de precios es diferente de los precios marginales o escalonados ordinarios, donde solo los tokens por encima de un umbral cuestan más mientras que todo lo que está por debajo permanece en la tasa base. Con un precipicio, cruzar el umbral modifica el precio de TODA la solicitud (cada token de entrada y salida en esa llamada), no solo los tokens que se encuentran sobre la línea. Eso significa que una solicitud de 200.001 tokens de entrada puede costar significativamente más que una de exactamente 200.000 tokens, no solo una fracción de centavo más por ese token adicional. Esta calculadora modela esa mecánica específica, ya que una estimación fija normal por token la omite por completo.
¿Gemini 2.5 Pro realmente modifica el precio de toda la solicitud?
Sí. Cualquier llamada API única a Gemini 2.5 Pro cuya entrada supere los 200.000 tokens se factura a la tasa más alta de $ 2,50 por 1 millón de entrada / $ 15 por 1 millón de salida en TODA la llamada, tanto los tokens de entrada como los de salida, no una tasa combinada o marginal aplicada solo al exceso. Esto está documentado en los precios publicados de Gemini, pero es fácil pasarlo por alto cuando se estiman los costos a partir de la cifra del título "$1,25 por 1 millón de tokens de entrada", que solo se aplica a solicitudes iguales o inferiores al umbral de 200.000 tokens.
¿Por qué mi factura real es mayor que una simple estimación de token?
Esta calculadora calcula lo que llama "exposición a recargos": la brecha entre su costo combinado real y una estimación ingenua que aplica la tarifa base de manera uniforme a cada solicitud, independientemente del tamaño. Esa estimación ingenua subestima el costo real cada vez que una parte real de sus solicitudes cruza el umbral de longitud, porque no hay forma de saber que esas solicitudes largas se modifican por completo en el nivel superior en lugar de solo los tokens que se encuentran por encima de la línea. Cuanto más carga de trabajo supere el umbral, mayor será la brecha oculta.
¿Cómo puedo reducir los costos de los precios cliff?
Recorta tus indicaciones para permanecer justo por debajo del umbral. Una mejor gestión del contexto (recuperación en lugar de incluir documentos completos en el mensaje, resumir el historial de conversaciones y eliminar el contexto obsoleto) puede mantener una solicitud bajo el precipicio y evitar por completo la modificación del precio de toda la solicitud. Debido a que el acantilado cambia el precio de la solicitud completa en lugar de solo los tokens sobrantes, una reducción bastante pequeña en el tamaño del mensaje puede producir un ahorro mucho mayor de lo que sugeriría el recuento de tokens por sí solo, precisamente porque evita cruzar la línea en lugar de simplemente reducir lo que está a un lado de ella.