7 de setembro de 2026 · IA e LLMs · 5 min de leitura
Eu estava avaliando um provedor de inferência rápida para uma carga de trabalho de agente executando um modelo aberto de classe 70B, e os três nomes que continuam surgindo – Groq, Together AI, Fireworks – todos com preços de cotação por token que parecem semelhantes à primeira vista. Não é. Nos modelos da classe Llama-70B, Groq trabalha para $ 0,59 de entrada / $ 0,79 de saída por 1 milhão de tokens, Juntos AI é um apartamento $0.88 / $0.88, e o Fireworks fatura um misto ~$0,90 por 1 milhão para seu nível 16–80B. Com uma divisão realista de entrada/saída de 70/30, isso é um Diferença de US$ 250 por mês entre Groq e Fireworks quando você está empurrando um bilhão de tokens – e o mais barato não é automaticamente a escolha certa.
Todos os três executam modelos de peso aberto – Llama, Qwen, Mixtral, DeepSeek – por trás de APIs compatíveis com OpenAI, portanto, a troca de provedor geralmente é uma mudança de URL base. Aqui está quanto a inferência da classe Llama-70B realmente custa em cada um, extraída de suas próprias páginas de preços:
| Provedor | Modelo | Insira $/1 milhão | Saída $/1 milhão |
|---|---|---|---|
| Groq | Lhama 3.3 70B | $0.59 | $0.79 |
| Juntos IA | Lhama 3.1 70B | $0.88 | $0.88 |
| Fogos de artifício | Camada intermediária (16–80B, por exemplo, Llama 70B) | ~$0,90 misturado | |
Groq é o mais barato no papel para uma carga de trabalho típica em formato de chat – mais tokens de entrada do que saída – porque seu preço de entrada é 33% abaixo da taxa fixa do Together. Juntas, a IA precifica a entrada e a saída de forma idêntica, o que é mais simples de prever, mas custa mais nos prompts com muitas entradas que a maioria das cargas de trabalho de RAG e de agente realmente enviam. O Fireworks não divide entrada/saída; seus ~$0,90 é uma taxa única combinada em toda a classe de modelo 16–80B, o que facilita a estimativa, mas significa que você não pode otimizar reduzindo o comprimento da saída da mesma forma que pode no Groq ou no Together.
O preço mais baixo do Groq vem do mesmo lugar que sua velocidade: hardware LPU (Unidade de Processamento de Linguagem) personalizado construído especificamente para geração de tokens, em vez de GPUs de uso geral. Esse também é o verdadeiro ponto de venda da Groq em relação aos outros dois – centenas de tokens por segundo, muito além do que o serviço baseado em H100 normalmente oferece. Para um agente de voz ou uma interface de bate-papo em que o usuário está observando o cursor, essa diferença de latência é mais importante do que a diferença de US$ 0,29/1 milhão nos tokens de entrada. O problema: o catálogo de modelos hospedados da Groq é mais restrito que o do Together ou do Fireworks e não oferece capacidade dedicada ou ajuste fino – se o modelo que você precisa não estiver na lista da Groq, o preço deixa de ser o fator decisivo.
Together AI carrega o mais amplo catálogo de modelos abertos dos três (Llama, Mixtral, Qwen, DeepSeek e mais), além de endpoints dedicados e de ajuste fino, portanto, se o trabalho for "executar minha própria variante ajustada" em vez de "chamar um modelo de estoque", os preços e ferramentas simples e fáceis de prever do Together vencem a linha mais estreita e rápida da Groq. O Fireworks está em uma situação semelhante - preço sem servidor por token para início rápido, mas também implantação dedicada por hora de GPU para equipes que desejam taxa de transferência reservada e latência previsível em escala, que nem o catálogo fixo da Groq nem a configuração sem servidor da Together cobrem da mesma maneira. Ambos são o melhor padrão, uma vez que a carga de trabalho precisa de mais do que "tokens mais baratos para um modelo compatível".
Assumindo uma divisão realista de 70% de entrada / 30% de saída, típica de chat e prompts de estilo RAG:
| Tokens/mês | Groq | Juntos IA | Fogos de artifício |
|---|---|---|---|
| 10 milhões (aplicativo pequeno) | $6.50 | $8.80 | $9.00 |
| 100 milhões (produto estável) | $65 | $88 | $90 |
| 1 bilhão (agente de alto rendimento) | $650 | $880 | $900 |
A lacuna aumenta linearmente com o volume, uma vez que todos os três são preços puros por token, sem planos mínimos ou níveis no modelo em si - com 1 bilhão de tokens por mês, os US$ 650 da Groq versus os US$ 900 do Fireworks são uma diferença real de US$ 250, não um erro de arredondamento. Mas nenhum desses números explica o que acontece quando o modelo que você deseja não está no provedor mais barato ou quando a velocidade do Groq reduz seu custo efetivo em outro lugar – menos tentativas, sessões de usuário mais curtas, menos necessidade de cache agressivo apenas para ocultar a latência.
Produto sensível à latência (voz, chat ao vivo, qualquer coisa que o usuário esteja olhando enquanto transmite): comece com Groq se o seu modelo estiver na lista - a velocidade é a decisão real do produto e também é mais barato. Precisa de um modelo aberto ajustado ou menos comum, ou deseja capacidade dedicada com rendimento previsível: Together AI ou Fireworks, e escolha se você valoriza mais o catálogo mais amplo do Together ou a opção dedicada de hora de GPU do Fireworks. Executar todos os três lado a lado também é razoável – a API compatível com OpenAI significa que o código não muda, apenas o URL base e a fatura.
Novo nos preços de IA baseados no uso? Comece com o guias gratuitos de custo de API. Para o lado do modelo fechado da mesma decisão, consulte GPT vs Claude vs Gemini: quanto custa realmente a mesma carga de trabalho.
Taxas verificadas nas páginas oficiais de preços do Groq, Together AI e Fireworks, verificadas pela última vez em 15/08/2026. Estimativas de referência — a disponibilidade do modelo, os descontos por volume e as taxas empresariais negociadas variam; confirme o preço atual antes de fazer o orçamento.