Calculadora de preços em camadas de longo contexto ("Cliff")
✓ Última verificação: 11/08/2026· As taxas mostradas são rotuladas como padrões ilustrativos, não cotações ao vivo· Estimativa de referência — relatar alteração → Alguns modelos não avaliam marginalmente o contexto longo - eles usam um limite rígido ou "penhasco": Gemini 2.5 Pro fatura US$ 1,25/US$ 10 por 1 milhão de tokens de entrada/saída para solicitações com 200.000 tokens de entrada ou menos, mas se a entrada de uma única solicitação exceder esse limite, a solicitação INTEIRA — todos os seus tokens de entrada E saída — será cobrada pela taxa mais alta de US$ 2,50/US$ 15, não apenas os tokens na linha. Uma carga de trabalho que mistura solicitações curtas e longas tem, portanto, um custo combinado real que é significativamente maior do que uma estimativa de taxa fixa mostraria. Isto é diferente do nosso calculadora de custos da janela de contexto, que modela o custo fixo por token de um modelo por tamanho de contexto, sem mecânica de precipício, e a partir do Preços do nível LLM e Camada de serviço LLM calculadoras, que modelam níveis Batch/Flex/Priority baseados em latência, em vez de penhascos de preços baseados em comprimento. Essa ferramenta analisa a divisão da sua carga de trabalho entre solicitações abaixo do limite e acima do limite e mostra o custo mensal combinado real, a "exposição à sobretaxa" oculta em comparação com uma estimativa ingênua de taxa fixa e as economias disponíveis ao reduzir solicitações longas para um pouco abaixo do limite. Veja também o Calculadora de custos da API Gemini para preços gerais do Gemini em todos os modelos.
—
custo mensal combinado real—estimativa ingênua de taxa fixa
—exposição de sobretaxa oculta
—economia se solicitações longas forem cortadas
Detalhamento de custos em sua carga de trabalho
As solicitações curtas custam normalmente a taxa básica; solicitações longas avaliam TODA a chamada - entrada e saída - com uma taxa de precipício mais alta. A linha ingênua mostra o que uma estimativa de taxa fixa assumiria, e a linha aparada mostra o cenário em que solicitações longas são comprimidas até um pouco abaixo do limite.
| Linha | Solicitações | Custo/solicitação | Subtotal |
|---|
Custo combinado por parcela de solicitações longas
Todo o resto mantido nos valores acima varreu a parcela de solicitações que ultrapassaram o limite. A linha destacada está mais próxima da sua configuração atual.
| Compartilhamento acima do limite | Custo real | Estimativa ingênua | Sobretaxa |
|---|
Como isso se conecta a outras ferramentas
Esta calculadora avalia uma mecânica específica: um limite de comprimento rígido onde cruzá-lo reavalia uma solicitação inteira, não apenas os tokens ao longo da linha. Isso é diferente do nosso calculadora de custos da janela de contexto, que modela um custo uniforme e fixo por token por tamanho de contexto e não tem nenhuma lógica de precipício ou limite — use essa ferramenta se o modelo que você está precificando cobrar a mesma taxa, independentemente da duração da solicitação. Também é diferente do Calculadora de preços de nível LLM e Calculadora de nível de serviço LLM, que define o preço dos níveis de serviço Batch/Flex/Priority baseados em latência — uma escolha que você faz por solicitação sobre a rapidez com que precisa de uma resposta, e não uma consequência da duração do seu prompt. Se você quiser preços gerais do Gemini em tamanhos de modelo sem a mecânica do penhasco isolada, consulte o Calculadora de custos da API Gemini. Esta página existe porque uma visualização fixa por token da taxa principal de US$ 1,25 do Gemini 2.5 Pro perde totalmente o custo real, uma vez que qualquer parcela de uma carga de trabalho ultrapassa 200 mil tokens de entrada.
Como funciona esta calculadora
O Calculadora de preços em camadas de longo contexto ("Cliff") divide seu volume de solicitações mensais em dois grupos usando o parcela de solicitações acima do limite: solicitações curtas, com preço normalmente no taxa básica para seus tokens de entrada e saída, e solicitações longas, cuja entrada excede o limite de contexto e que, portanto, precificam TODA a sua chamada - cada token de entrada e saída - no valor mais alto taxa longa. Nos padrões (10.000 solicitações/mês, 20% acima do limite de 200.000 tokens, curto = 60.000 entradas/2.000 saídas, longo = 350.000 entradas/5.000 saídas, base US$ 1,25/US$ 10, longo US$ 2,50/US$ 15), são 8.000 solicitações curtas a US$ 0,095 cada (subtotal de US$ 760) e 2.000 solicitações longas a US$ 0,95 cada (subtotal de US$ 1.900), por um custo mensal combinado real de $2,660.
Para mostrar o que uma calculadora de taxa fixa normal perderia, a ferramenta também calcula um estimativa ingênua que aplica a taxa básica a cada solicitação, independentemente do tamanho – no valor padrão de US$ 1.735, o que significa que o custo real carrega um custo oculto exposição sobretaxa de US$ 925, cerca de 53,3% a mais do que o número ingênuo sugeriria. Por fim, a ferramenta modela um cenário de corte: quanto custariam as solicitações longas se compactadas até um pouco abaixo do limite (1.000 tokens abaixo dele), mantendo o mesmo tamanho de saída - nos padrões que reduzem o custo da solicitação longa o suficiente para economizar $1,302.50 por mês, que é a verdadeira recompensa de manter os prompts sob um precipício de preços, em vez de apenas reduzi-los um pouco.
Perguntas frequentes
O que é um “precipício” de preços de longo contexto?
Um precário de preços é diferente do preço marginal comum ou escalonado, onde apenas os tokens acima de um limite custam mais, enquanto tudo abaixo permanece na taxa básica. Com um precipício, cruzar o limite reavalia a solicitação INTEIRA – cada token de entrada e saída naquela chamada – não apenas os tokens na linha. Isso significa que uma solicitação de 200.001 tokens de entrada pode custar significativamente mais do que uma solicitação de exatamente 200.000 tokens, e não apenas uma fração de centavo a mais por aquele único token extra. Esta calculadora modela essa mecânica específica, uma vez que uma estimativa fixa normal por token a ignora completamente.
O Gemini 2.5 Pro realmente reavalia todo o pedido?
Sim. Qualquer chamada de API única para Gemini 2.5 Pro cuja entrada exceda 200.000 tokens fatura a uma taxa mais alta de US$ 2,50 por 1 milhão de entrada / US$ 15 por 1 milhão de saída na chamada TODA — tanto os tokens de entrada quanto os de saída — e não uma taxa combinada ou marginal aplicada apenas ao excesso. Isso está documentado nos preços publicados do Gemini, mas é fácil perder quando você estima os custos a partir do valor do título “US$ 1,25 por 1 milhão de tokens de entrada”, que se aplica apenas a solicitações no limite de 200 mil tokens ou abaixo dele.
Por que minha fatura real é maior do que uma simples estimativa de contagem de tokens?
Esta calculadora calcula o que chama de “exposição à sobretaxa” – a diferença entre seu custo combinado real e uma estimativa ingênua que aplica a taxa básica uniformemente a cada solicitação, independentemente do tamanho. Essa estimativa ingênua subestima o custo real sempre que qualquer parcela real de suas solicitações ultrapassa o limite de comprimento, porque não há como saber se essas solicitações longas serão reavaliadas inteiramente no nível mais alto, em vez de apenas os tokens na linha. Quanto mais sua carga de trabalho ultrapassar o limite, maior será a lacuna oculta.
Como posso reduzir os custos de preços precários?
Corte suas solicitações para ficar logo abaixo do limite. Um melhor gerenciamento de contexto – recuperação em vez de colocar documentos completos no prompt, resumir o histórico de conversas, descartar contexto obsoleto – pode manter uma solicitação sob o precipício e evitar totalmente a reavaliação de toda a solicitação. Como o precipício reavalia a solicitação completa em vez de apenas os tokens em excesso, uma redução relativamente pequena no tamanho do prompt pode produzir uma economia muito maior do que a contagem de tokens por si só sugeriria, precisamente porque evita cruzar a linha em vez de apenas diminuir o que está em um lado dela.