HomeAI APIs › IA de fogos de artifício

Fireworks AI – preços, créditos e como obter uma chave

IA de fogos de artifício é uma plataforma de inferência rápida para modelos de peso aberto — Llama, DeepSeek, Qwen, Mixtral e outros — servidos através de um API compatível com OpenAI. Você paga por token (dimensionado de acordo com o tamanho do modelo) sem servidor ou por hora de GPU para capacidade dedicada. É uma opção quando você deseja modelos abertos mais baratos que os de fronteira fechada, com baixa latência.

Preços do Fireworks AI (referência, junho de 2026)

Classe de modeloPreço / 1 milhão de tokensExemplos
Pequeno (≤16B)~$0,20Lhama 8B, pequeno Qwen
Meados (16–80B)~$0,90Lhama 70B, Qwen 72B
Grande MoE/100B+~US$ 1,20–US$ 3,00DeepSeek V3, lama 405B
GPU dedicada (sob demanda)por hora de GPUtaxa de transferência reservada, por ex. H100/H200
Ajuste fino e hospedagempor token/por GPUtreinar + servir sua própria variante
⚠️ Números de referência, junho de 2026 — O Fireworks lista as taxas exatas por modelo que mudam conforme os modelos são adicionados. Confirmar em fireworks.ai/pricing. As taxas sem servidor geralmente diferem entre entrada e saída em alguns modelos; GPUs dedicadas são cobradas por hora, independentemente do volume de tokens. · Informar preço desatualizado →

Sem servidor vs dedicado – o que é mais barato?

O Fireworks oferece dois modelos de faturamento. Sem servidor cobranças por token sem custo ocioso — ideal para tráfego com picos ou de baixo volume, já que você não paga nada entre as solicitações. GPUs dedicadas sob demanda cobra por hora, mas oferece taxa de transferência reservada e latência mais baixa, que se torna mais barata do que por token, uma vez que seu volume é alto e estável o suficiente para manter a GPU ocupada. O cruzamento é uma questão de utilização: estime o volume do seu token e, em seguida, compare o token sem servidor com a taxa horária da GPU com o calculadora auto-hospedada vs API e o Calculadora de custos de nuvem GPU.

Os créditos gratuitos

Novas contas do Fireworks geralmente recebem um pequeno crédito grátis para testar, juntamente com limites de taxa viáveis ​​em modelos sem servidor, em vez de um nível gratuito permanente. Após o crédito, você saca um saldo faturado por token. Para experimentação é suficiente; para produção, avalie seu mix de tokens real com as calculadoras abaixo.

Como obter uma chave de API do Fireworks (passo a passo)

1. Inscreva-se em fogos de artifício.ai e abra o painel.
2. Reivindique qualquer crédito grátis e adicione faturamento para uso em produção.
3. Vá para Chaves de API e crie uma chave.
4. Use o endpoint compatível com OpenAI – basta alterar o URL base e o nome do modelo.

# replace $FIREWORKS_API_KEY
curl https://api.fireworks.ai/inference/v1/chat/completions\
-H "Autorização: Portador $FIREWORKS_API_KEY" \
-H "Tipo de conteúdo: aplicativo/json" \
-d '{"model":"contas/fireworks/models/llama-v3p1-8b-instruct","mensagens":[{"role":"usuário","content":"Olá"}]}'

Fogos de artifício versus as alternativas

Juntos IA (veja o Guia Juntos) é o concorrente mais próximo – o mesmo modelo aberto por token com preços semelhantes; compare ambos para o seu modelo específico. Replicar (ver Replicar) é mais forte para imagens/vídeos e inicialização a frio. Groq ganha em velocidade bruta para modelos suportados. Contra modelos fechados, executar um modelo aberto no Fireworks normalmente é várias vezes mais barato por token do que OpenAI ou Cláudio — o trade está escolhendo e possuindo o modelo aberto. Classifique tudo para o seu mix de tokens com o ferramenta API LLM mais barata.

Perguntas frequentes

Quanto custa o Fireworks AI?

Por token por tamanho de modelo: ~$0,20/1 milhão para modelos pequenos, ~$0,90/1 milhão para modelos médios, ~$1,20–$3/1 milhão para modelos grandes de MoE (referência, junho de 2026). GPUs dedicadas são cobradas por hora.

O Fireworks OpenAI é compatível?

Sim — use o OpenAI SDK, aponte o URL base para api.fireworks.ai e defina o modelo para o caminho do modelo do Fireworks.

Quando devo usar GPUs dedicadas em vez de sem servidor?

Quando o tráfego é alto e estável o suficiente para manter uma GPU ocupada, a taxa de transferência reservada supera o custo por token acima do cruzamento de utilização. O tráfego baixo ou pontiagudo permanece mais barato sem servidor.

Posso fazer ajustes no Fireworks?

Sim — o Fireworks oferece suporte ao ajuste fino de modelos abertos e ao fornecimento do resultado, cobrado por token de treinamento e por token de inferência. Compare com a calculadora de ajuste fino antes de confirmar.

Não afiliado ao Fireworks AI. Os preços são estimativas de referência – verifique sempre na página oficial de preços.

Hospede seu projeto:DigitalOcean – $ 200 grátis ↗VPS da Hostinger