Como funciona esta calculadora
O Calculadora de capacidade de limite de taxa descobre quantos usuários ativos simultâneos seu aplicativo pode atender antes que um provedor de API comece a limitar as solicitações. Ele não estima um custo em dólares – ele converte os dois limites máximos de taxa da sua conta em um número de headroom. Você entra no limite de token (TPM) e limite de solicitação (RPM) do seu provedor, além do formato da sua carga de trabalho: tokens por solicitação e solicitações por usuário ativo por minuto. A ferramenta divide cada teto pela demanda por usuário e informa o mais baixo dos dois resultados, já que a capacidade é definida pelo limite atingido primeiro – taxa de transferência de token ou contagem de solicitações.
A principal compensação é que TPM e RPM esgotam em taxas diferentes, e qual deles é vinculado depende do tamanho da sua solicitação. Prompts grandes ou conclusões longas empurram você contra o limite de token enquanto a contagem de solicitações fica ociosa; muitas pequenas chamadas fazem o inverso. A dica prática é verificar qual limite os sinalizadores da calculadora como gargalo antes de aumentar a escala. Se os tokens forem vinculados primeiro, cortar o contexto ou o comprimento da saída comprará mais capacidade do usuário do que uma cota de solicitação mais alta; se as solicitações forem vinculadas primeiro, agrupar várias operações em lote em uma chamada é o que mais ajuda. O dimensionamento para o limite de ligação evita solicitações limitadas e respostas com falha durante picos de tráfego.
Perguntas frequentes
Como os limites de TPM e RPM interagem?
Os provedores limitam você em tokens por minuto (TPM) e solicitações por minuto (RPM), e você acerta o que ocorrer primeiro. Chamadas pequenas e frequentes geralmente atingem RPM; chamadas de grande contexto atingem o TPM. A sua capacidade real é a menor das duas, portanto, aumentar apenas o limite não vinculativo não altera nada.
Como posso atender mais usuários sem atingir os limites de taxa?
Aumente o limite de vinculação - solicite um nível mais alto para qualquer um que o limite, agrupe ou combine pequenas solicitações para facilitar o RPM e reduza o tamanho do prompt para facilitar o TPM. O armazenamento em cache de contexto repetido e o estouro de roteamento para uma segunda chave ou modelo também espalham a carga além de um único limite.