HomeBlog › Custo Groq vs Together vs Fireworks Llama 70B

Groq vs Together AI vs Fireworks: Quanto custa realmente a inferência do Llama 70B (2026)

7 de setembro de 2026 · IA e LLMs · 5 min de leitura

Eu estava avaliando um provedor de inferência rápida para uma carga de trabalho de agente executando um modelo aberto de classe 70B, e os três nomes que continuam surgindo – Groq, Together AI, Fireworks – todos com preços de cotação por token que parecem semelhantes à primeira vista. Não é. Nos modelos da classe Llama-70B, Groq trabalha para $ 0,59 de entrada / $ 0,79 de saída por 1 milhão de tokens, Juntos AI é um apartamento $0.88 / $0.88, e o Fireworks fatura um misto ~$0,90 por 1 milhão para seu nível 16–80B. Com uma divisão realista de entrada/saída de 70/30, isso é um Diferença de US$ 250 por mês entre Groq e Fireworks quando você está empurrando um bilhão de tokens – e o mais barato não é automaticamente a escolha certa.

Os números reais de 2026

Todos os três executam modelos de peso aberto – Llama, Qwen, Mixtral, DeepSeek – por trás de APIs compatíveis com OpenAI, portanto, a troca de provedor geralmente é uma mudança de URL base. Aqui está quanto a inferência da classe Llama-70B realmente custa em cada um, extraída de suas próprias páginas de preços:

ProvedorModeloInsira $/1 milhãoSaída $/1 milhão
GroqLhama 3.3 70B$0.59$0.79
Juntos IALhama 3.1 70B$0.88$0.88
Fogos de artifícioCamada intermediária (16–80B, por exemplo, Llama 70B)~$0,90 misturado

Groq é o mais barato no papel para uma carga de trabalho típica em formato de chat – mais tokens de entrada do que saída – porque seu preço de entrada é 33% abaixo da taxa fixa do Together. Juntas, a IA precifica a entrada e a saída de forma idêntica, o que é mais simples de prever, mas custa mais nos prompts com muitas entradas que a maioria das cargas de trabalho de RAG e de agente realmente enviam. O Fireworks não divide entrada/saída; seus ~$0,90 é uma taxa única combinada em toda a classe de modelo 16–80B, o que facilita a estimativa, mas significa que você não pode otimizar reduzindo o comprimento da saída da mesma forma que pode no Groq ou no Together.

Por que Groq é mais barato e nem sempre é a escolha certa

O preço mais baixo do Groq vem do mesmo lugar que sua velocidade: hardware LPU (Unidade de Processamento de Linguagem) personalizado construído especificamente para geração de tokens, em vez de GPUs de uso geral. Esse também é o verdadeiro ponto de venda da Groq em relação aos outros dois – centenas de tokens por segundo, muito além do que o serviço baseado em H100 normalmente oferece. Para um agente de voz ou uma interface de bate-papo em que o usuário está observando o cursor, essa diferença de latência é mais importante do que a diferença de US$ 0,29/1 milhão nos tokens de entrada. O problema: o catálogo de modelos hospedados da Groq é mais restrito que o do Together ou do Fireworks e não oferece capacidade dedicada ou ajuste fino – se o modelo que você precisa não estiver na lista da Groq, o preço deixa de ser o fator decisivo.

Onde juntos AI e Fireworks vencem

Together AI carrega o mais amplo catálogo de modelos abertos dos três (Llama, Mixtral, Qwen, DeepSeek e mais), além de endpoints dedicados e de ajuste fino, portanto, se o trabalho for "executar minha própria variante ajustada" em vez de "chamar um modelo de estoque", os preços e ferramentas simples e fáceis de prever do Together vencem a linha mais estreita e rápida da Groq. O Fireworks está em uma situação semelhante - preço sem servidor por token para início rápido, mas também implantação dedicada por hora de GPU para equipes que desejam taxa de transferência reservada e latência previsível em escala, que nem o catálogo fixo da Groq nem a configuração sem servidor da Together cobrem da mesma maneira. Ambos são o melhor padrão, uma vez que a carga de trabalho precisa de mais do que "tokens mais baratos para um modelo compatível".

Como isso fica em diferentes volumes

Assumindo uma divisão realista de 70% de entrada / 30% de saída, típica de chat e prompts de estilo RAG:

Tokens/mêsGroqJuntos IAFogos de artifício
10 milhões (aplicativo pequeno)$6.50$8.80$9.00
100 milhões (produto estável)$65$88$90
1 bilhão (agente de alto rendimento)$650$880$900

A lacuna aumenta linearmente com o volume, uma vez que todos os três são preços puros por token, sem planos mínimos ou níveis no modelo em si - com 1 bilhão de tokens por mês, os US$ 650 da Groq versus os US$ 900 do Fireworks são uma diferença real de US$ 250, não um erro de arredondamento. Mas nenhum desses números explica o que acontece quando o modelo que você deseja não está no provedor mais barato ou quando a velocidade do Groq reduz seu custo efetivo em outro lugar – menos tentativas, sessões de usuário mais curtas, menos necessidade de cache agressivo apenas para ocultar a latência.

O que eu realmente faria

Produto sensível à latência (voz, chat ao vivo, qualquer coisa que o usuário esteja olhando enquanto transmite): comece com Groq se o seu modelo estiver na lista - a velocidade é a decisão real do produto e também é mais barato. Precisa de um modelo aberto ajustado ou menos comum, ou deseja capacidade dedicada com rendimento previsível: Together AI ou Fireworks, e escolha se você valoriza mais o catálogo mais amplo do Together ou a opção dedicada de hora de GPU do Fireworks. Executar todos os três lado a lado também é razoável – a API compatível com OpenAI significa que o código não muda, apenas o URL base e a fatura.

Novo nos preços de IA baseados no uso? Comece com o guias gratuitos de custo de API. Para o lado do modelo fechado da mesma decisão, consulte GPT vs Claude vs Gemini: quanto custa realmente a mesma carga de trabalho.

Taxas verificadas nas páginas oficiais de preços do Groq, Together AI e Fireworks, verificadas pela última vez em 15/08/2026. Estimativas de referência — a disponibilidade do modelo, os descontos por volume e as taxas empresariais negociadas variam; confirme o preço atual antes de fazer o orçamento.