API Batch: 50% de desconto para trabalhos não urgentes
A maioria das pessoas liga para um modelo de IA e espera por uma resposta em tempo real. Mas uma grande parte do trabalho de IA não é nada urgente, geração de relatórios durante a noite, classificação em massa, rotulagem de conjuntos de dados. Para esses trabalhos, as APIs em lote oferecem os mesmos modelos com um grande desconto, geralmente em torno de 50%, em troca da renúncia a resultados instantâneos.
O que é uma API em lote
Uma API em lote permite enviar muitas solicitações de uma vez como um único trabalho, em vez de uma de cada vez em tempo real. Você carrega um arquivo contendo todos os seus prompts, o provedor os processa de forma assíncrona durante um período de tempo e você baixa os resultados quando eles estão prontos.
A negociação que você está fazendo é simples: você desiste da velocidade e consegue um preço mais baixo. Em vez de uma resposta em segundos, você pode esperar minutos ou horas. Em troca, o custo por token normalmente é reduzido pela metade em comparação com a taxa síncrona padrão.
Por que os provedores podem oferecer o desconto
O tráfego da API em tempo real é pontiagudo e imprevisível. Os provedores devem manter a capacidade disponível pronta para picos de demanda, e esse espaço ocioso é caro. Os trabalhos em lote são flexíveis: podem ser executados sempre que houver capacidade disponível, suavizando a carga.
Como você permite que o provedor agende seu trabalho durante períodos mais silenciosos, ele pode usar o hardware com mais eficiência e repassar parte dessa economia para você. O desconto não é um modelo de qualidade inferior, é exatamente o mesmo modelo executado em um horário descontraído.
Como é o fluxo de trabalho
O fluxo em lote típico tem quatro etapas:
- Prepare um arquivo onde cada linha é uma solicitação, geralmente em um formato estruturado com um ID personalizado para que você possa combinar os resultados com as entradas.
- Envie o lote e receba um ID de trabalho.
- Pesquisa de status enquanto o provedor trabalha na fila, geralmente com uma meta de conclusão declarada, como dentro de 24 horas.
- Recuperar o arquivo de saída depois de concluído, mapeie cada resultado de volta à sua solicitação usando os IDs.
A lógica do seu aplicativo quase não muda, os mesmos prompts e os mesmos modelos são usados. O que muda é que você não bloqueia cada resposta.
Quais trabalhos se enquadram no modelo em lote
O lote é ideal sempre que um humano não está esperando pela resposta:
- Classificação ou marcação em massa de grandes conjuntos de dados.
- Geração de conteúdo para catálogos, descrições de produtos ou resumos produzidos com antecedência.
- Extração de dados de grandes coleções de documentos.
- Avaliações e backtesting onde você executa um prompt em milhares de casos de teste.
- Incorporações geração para um corpus inteiro de uma só vez.
Não é adequado para qualquer coisa interativa: chatbots, pesquisa ao vivo ou qualquer recurso em que um usuário esteja olhando para um botão giratório de carregamento.
A economia da espera
A economia é fácil de raciocinar. Se um trabalho custasse US$ 200 à taxa padrão e o desconto do lote fosse de 50%, custaria US$ 100, para produção idêntica. Em grandes cargas de trabalho recorrentes, essa diferença aumenta mês após mês.
Aqui está um exemplo prático com taxas ilustrativas, para que a matemática permaneça concreta. Classificar 1 milhão de documentos curtos com 500 tokens de entrada e 20 tokens de saída cada é 500 milhões de tokens de entrada e 20 milhões de tokens de saída no total. A uma taxa ilustrativa de US$ 0,15 por 1 milhão de tokens de entrada e US$ 0,60 por 1 milhão de tokens de saída, o preço síncrono gira em torno de US$ 75 + US$ 12 = US$ 87 para todo o trabalho. O mesmo trabalho por meio do endpoint em lote pela metade do preço reduz esse valor para cerca de US$ 43,50 – uma economia de US$ 43,50 em uma única execução, antes mesmo de você contar a execução do mês seguinte. A calculadora de custos do LLM permite que você insira suas próprias contagens e volumes de tokens e, em seguida, reduza o total pela metade para visualizar o cenário em lote em relação ao cenário em tempo real usando as taxas atuais do provedor.
Coisas para observar
Algumas advertências práticas. Os tempos de conclusão são metas, não garantias, portanto, crie seu pipeline para tolerar atrasos variáveis. Lotes muito grandes podem estar sujeitos a limites de tamanho ou taxa, portanto, pode ser necessário dividir trabalhos enormes em partes. E você ainda paga pelos tokens de entrada e saída, o desconto se aplica à taxa, não à contagem de tokens, portanto, a eficiência imediata ainda é importante.
Solicitações com falha dentro de um lote normalmente não são cobradas. Se uma linha em seu arquivo de entrada estiver malformada ou houver erro em uma única solicitação, os provedores geralmente cobram apenas pelas solicitações que realmente foram concluídas, e não pelas que falharam. Isso significa que um punhado de linhas incorretas não prejudicará o desconto no restante do trabalho, mas também significa que seu arquivo de saída precisa ser verificado em relação aos seus IDs de entrada para ver quais solicitações você precisa reenviar.
Por fim, verifique as especificações de cada provedor nas páginas /models, já que o desconto exato, a meta de retorno e os recursos suportados (como se o cache ou as ferramentas funcionam dentro do lote) diferem entre os provedores.
Continuar aprendendo
Ferramentas relacionadas
Perguntas frequentes
A API em lote é um modelo mais fraco?
Não. Você obtém o mesmo modelo e a mesma qualidade de saída que a API em tempo real. A única diferença é que os resultados chegam mais tarde, por isso o preço é mais baixo.
Quanto tempo leva um trabalho em lote?
Os provedores geralmente fornecem uma meta de conclusão, como dentro de 24 horas, e muitos trabalhos terminam muito mais rápido quando a capacidade está disponível. Não é instantâneo, então use-o apenas quando ninguém estiver esperando uma resposta.
Quanto as APIs em lote normalmente economizam?
Cerca de 50% de desconto na taxa padrão por token é comum entre os principais provedores, aplicado tanto a tokens de entrada quanto de saída. Sempre confirme o desconto atual para seu fornecedor e modelo específico.
Pago por solicitações que falham dentro de um lote?
Geralmente não. Os provedores normalmente cobram apenas pelas solicitações em um lote que foram realmente concluídas com êxito, portanto, um prompt malformado ou um erro ocasional não custa o desconto no restante do trabalho. Você ainda precisa verificar o arquivo de saída em relação aos IDs enviados para ver quais solicitações falharam e reenviá-las.
Apenas educacional – não aconselhamento financeiro.