IA de fogos de artifício é uma plataforma de inferência rápida para modelos de peso aberto — Llama, DeepSeek, Qwen, Mixtral e outros — servidos através de um API compatível com OpenAI. Você paga por token (dimensionado de acordo com o tamanho do modelo) sem servidor ou por hora de GPU para capacidade dedicada. É uma opção quando você deseja modelos abertos mais baratos que os de fronteira fechada, com baixa latência.
| Classe de modelo | Preço / 1 milhão de tokens | Exemplos |
|---|---|---|
| Pequeno (≤16B) | ~$0,20 | Lhama 8B, pequeno Qwen |
| Meados (16–80B) | ~$0,90 | Lhama 70B, Qwen 72B |
| Grande MoE/100B+ | ~US$ 1,20–US$ 3,00 | DeepSeek V3, lama 405B |
| GPU dedicada (sob demanda) | por hora de GPU | taxa de transferência reservada, por ex. H100/H200 |
| Ajuste fino e hospedagem | por token/por GPU | treinar + servir sua própria variante |
O Fireworks oferece dois modelos de faturamento. Sem servidor cobranças por token sem custo ocioso — ideal para tráfego com picos ou de baixo volume, já que você não paga nada entre as solicitações. GPUs dedicadas sob demanda cobra por hora, mas oferece taxa de transferência reservada e latência mais baixa, que se torna mais barata do que por token, uma vez que seu volume é alto e estável o suficiente para manter a GPU ocupada. O cruzamento é uma questão de utilização: estime o volume do seu token e, em seguida, compare o token sem servidor com a taxa horária da GPU com o calculadora auto-hospedada vs API e o Calculadora de custos de nuvem GPU.
Novas contas do Fireworks geralmente recebem um pequeno crédito grátis para testar, juntamente com limites de taxa viáveis em modelos sem servidor, em vez de um nível gratuito permanente. Após o crédito, você saca um saldo faturado por token. Para experimentação é suficiente; para produção, avalie seu mix de tokens real com as calculadoras abaixo.
1. Inscreva-se em fogos de artifício.ai e abra o painel.
2. Reivindique qualquer crédito grátis e adicione faturamento para uso em produção.
3. Vá para Chaves de API e crie uma chave.
4. Use o endpoint compatível com OpenAI – basta alterar o URL base e o nome do modelo.
Juntos IA (veja o Guia Juntos) é o concorrente mais próximo – o mesmo modelo aberto por token com preços semelhantes; compare ambos para o seu modelo específico. Replicar (ver Replicar) é mais forte para imagens/vídeos e inicialização a frio. Groq ganha em velocidade bruta para modelos suportados. Contra modelos fechados, executar um modelo aberto no Fireworks normalmente é várias vezes mais barato por token do que OpenAI ou Cláudio — o trade está escolhendo e possuindo o modelo aberto. Classifique tudo para o seu mix de tokens com o ferramenta API LLM mais barata.
Por token por tamanho de modelo: ~$0,20/1 milhão para modelos pequenos, ~$0,90/1 milhão para modelos médios, ~$1,20–$3/1 milhão para modelos grandes de MoE (referência, junho de 2026). GPUs dedicadas são cobradas por hora.
Sim — use o OpenAI SDK, aponte o URL base para api.fireworks.ai e defina o modelo para o caminho do modelo do Fireworks.
Quando o tráfego é alto e estável o suficiente para manter uma GPU ocupada, a taxa de transferência reservada supera o custo por token acima do cruzamento de utilização. O tráfego baixo ou pontiagudo permanece mais barato sem servidor.
Sim — o Fireworks oferece suporte ao ajuste fino de modelos abertos e ao fornecimento do resultado, cobrado por token de treinamento e por token de inferência. Compare com a calculadora de ajuste fino antes de confirmar.
Não afiliado ao Fireworks AI. Os preços são estimativas de referência – verifique sempre na página oficial de preços.