Como funciona esta calculadora
O Calculadora de custos de solicitações simultâneas estima quanto custa um fluxo constante de tráfego de API ao longo do tempo. Você insere seu solicitações por segundo, a média tokens de entrada e tokens de saída por solicitação, e o do seu provedor preços de entrada e saída por milhão de tokens. A partir deles, ele projeta o rendimento total do token e o multiplica pelas taxas por token para mostrar os gastos por hora, diário e mensal. Os principais fatores de custo são a taxa de solicitação e o tamanho do token: duplicar suas solicitações por segundo dobra a conta, e prompts longos ou respostas detalhadas aumentam a conta de maneira igualmente direta, já que tokens de saída muitas vezes têm preços mais elevados do que os factores de produção.
Uma dica prática é testar cada entrada separadamente para ver qual delas movimenta mais o seu total. Cortar o contexto do prompt, limitar a duração da resposta ou suavizar os picos de tráfego geralmente reduz os custos mais rapidamente do que mudar de provedor. A principal compensação é rendimento versus gastos: maior simultaneidade atende mais usuários, mas dimensiona os custos linearmente, portanto, dimensione sua taxa de solicitação de acordo com a demanda real, em vez de um máximo teórico.
Perguntas frequentes
Como posso estimar o custo das solicitações por segundo?
Custo por solicitação × solicitações por segundo × segundos. Para obter um valor mensal com carga constante, multiplique por 86.400 (segundos/dia) × 30. Ele responde 'quanto custa esse rendimento para funcionar 24 horas por dia, 7 dias por semana?'
Devo fazer um orçamento para RPS de pico ou médio?
O pico de RPS é o teto do pior caso; carga média é o que você realmente paga. Dimensione a infraestrutura para pico, mas o orçamento esteja mais próximo da média, já que o tráfego raramente fica constante o dia todo.