Como funciona esta calculadora
O Calculadora de tempo e custo de processamento em lote estima duas coisas para um trabalho de LLM em massa: o hora do relógio de parede é preciso terminar e o custo total da corrida. Ele multiplica sua contagem de itens pelos tokens gerados por item para obter o volume total de tokens e, em seguida, aplica seu preço por 1 milhão de tokens para produzir o valor em dólares. O tempo de execução vem da divisão do trabalho do token entre seus trabalhadores: a velocidade por trabalhador em tokens por segundo e o número de trabalhadores paralelos juntos definem a taxa de transferência, de modo que uma simultaneidade mais alta reduz o tempo decorrido, mesmo que a conta do token permaneça a mesma.
A principal compensação é que a simultaneidade reduz o tempo, mas não o custo. Dobrar os trabalhadores reduz aproximadamente pela metade a duração do relógio, mas você ainda paga por cada token gerado. Antes de aumentar a escala, verifique se a estimativa de tokens por item é realista, uma vez que comprimento de saída é o maior impulsionador de tempo e gastos. Corte primeiro as saídas detalhadas e, em seguida, aumente a contagem de trabalhadores para cumprir o prazo.
Perguntas frequentes
Como posso estimar quanto tempo leva um trabalho LLM em massa?
Total de tokens = itens × tokens por item. Divida pela taxa de transferência combinada (velocidade por trabalhador × número de trabalhadores paralelos) para obter os segundos do relógio de parede. Dez trabalhadores a 60 tok/s entregam 600 tok/s, portanto, um trabalho de 8 milhões de tokens leva cerca de 3,7 horas – antes que os limites de taxa o limitem.
Devo usar a API em lote?
Se o trabalho não for urgente, sim. Os endpoints em lote (OpenAI, Anthropic, Gemini) executam trabalhos de forma assíncrona em uma janela de 24 horas por aproximadamente metade do preço por token. Você troca a latência imediata por um grande desconto – ideal para preenchimentos de incorporações, avaliações e enriquecimento offline.