HomeAI APIs › IA dei fuochi d'artificio

Fireworks AI: prezzi, crediti e come ottenere una chiave

IA dei fuochi d'artificio è una piattaforma di inferenza veloce per modelli a peso aperto - Llama, DeepSeek, Qwen, Mixtral e altri - serviti tramite un API compatibile con OpenAI. Paghi per token (ridimensionato in base alle dimensioni del modello) per serverless o per ora GPU per capacità dedicata. È la soluzione ideale quando desideri modelli aperti più economici di quelli a frontiera chiusa, con bassa latenza.

Prezzi dell'intelligenza artificiale di Fireworks (riferimento, giugno 2026)

Classe modelloPrezzo / 1 milione di tokenEsempi
Piccolo (≤16B)~$ 0,20Lama 8B, piccolo Qwen
Metà (16-80B)~$ 0,90Lama 70B, Qwen 72B
MoE di grandi dimensioni / 100B+~$ 1,20–$ 3,00DeepSeek V3, lama 405B
GPU dedicata (on-demand)per GPU-orathroughput riservato, ad es. H100/H200
Perfezionamento e hostingper token/per GPUallenati + servi la tua variante
⚠️ Dati di riferimento, giugno 2026: Fireworks elenca le tariffe esatte per modello che cambiano man mano che i modelli vengono aggiunti. Conferma su fireworks.ai/pricing. Le tariffe serverless spesso differiscono per input e output su alcuni modelli; le GPU dedicate vengono fatturate su base oraria indipendentemente dal volume dei token. · Segnala prezzo obsoleto →

Serverless o dedicato: quale è più economico?

Fireworks ti offre due modelli di fatturazione. Senza server addebiti per token senza costi di inattività: ideale per traffico intenso o a basso volume, poiché non paghi nulla tra una richiesta e l'altra. GPU dedicate on-demand addebitato all'ora ma ti offre un throughput riservato e la latenza più bassa, che diventa più economico del token una volta che il volume è alto e abbastanza stabile da mantenere occupata la GPU. Il crossover è una questione di utilizzo: stima il volume del token, quindi confronta il serverless per token con la tariffa oraria della GPU con il calcolatore self-hosted e API e il Calcolatore dei costi del cloud GPU.

I crediti gratuiti

I nuovi account Fireworks in genere ricevono un file piccolo credito gratuito da testare, insieme a limiti di velocità praticabili sui modelli serverless, piuttosto che un livello gratuito permanente. Dopo il credito prelevi un saldo fatturato per token. Per la sperimentazione è abbondante; per la produzione, valuta il tuo vero mix di token con i calcolatori seguenti.

Come ottenere una chiave API di Fireworks (passo dopo passo)

1. Iscriviti a fuochi d'artificio.ai e aprire la dashboard.
2. Rivendica qualsiasi credito gratuito e aggiungere la fatturazione per l'uso in produzione.
3. Vai a Chiavi API e creare una chiave.
4. Utilizza l'endpoint compatibile con OpenAI: basta modificare l'URL di base e il nome del modello.

# replace $FIREWORKS_API_KEY
arricciatura https://api.fireworks.ai/inference/v1/chat/completions \
-H "Autorizzazione: portatore $FIREWORKS_API_KEY" \
-H "Tipo di contenuto: application/json" \
-d '{"model":"accounts/fireworks/models/llama-v3p1-8b-instruct","messages":[{"role":"utente","content":"Ciao"}]}'

Fuochi d'artificio contro le alternative

Insieme AI (vedi il Guida insieme) è il concorrente più vicino: stesso modello aperto, per token con prezzi simili; benchmark sia per il tuo modello specifico. Replicare (Vedere Replicare) è più forte per immagini/video e pezzi unici con avvio a freddo. Groq vince in termini di velocità grezza per i modelli supportati. Rispetto ai modelli chiusi, l'esecuzione di un modello aperto su Fireworks è in genere molte volte più economica per token rispetto a OpenAI O Claudio — il settore sceglie e possiede il modello aperto. Classifica tutto per il tuo mix di token con Strumento API LLM più economico.

Domande frequenti

Quanto costa l'intelligenza artificiale di Fireworks?

Per token in base alla dimensione del modello: ~$ 0,20/1 milione per i modelli piccoli, ~$ 0,90/1 milione per quelli medi, ~$ 1,20–$ 3/1 milione per i modelli MoE di grandi dimensioni (riferimento, giugno 2026). Le GPU dedicate vengono fatturate all'ora.

Fireworks OpenAI è compatibile?

Sì: utilizza OpenAI SDK, punta l'URL di base su api.fireworks.ai e imposta il modello sul percorso del modello Fireworks.

Quando dovrei utilizzare GPU dedicate anziché serverless?

Quando il traffico è sufficientemente elevato e costante da tenere occupata una GPU, il throughput riservato supera il costo per token superiore al crossover di utilizzo. Il traffico basso o intenso rimane più economico su serverless.

Posso ottimizzare Fireworks?

Sì: Fireworks supporta la messa a punto di modelli aperti e la fornitura dei risultati, fatturati per token di formazione e per token di inferenza. Confronta con il calcolatore di regolazione fine prima di impegnarti.

Non affiliato con Fireworks AI. I prezzi sono stime di riferimento: verifica sempre sulla pagina dei prezzi ufficiali.

Ospita il tuo progetto:DigitalOcean: $ 200 gratis ↗Hostinger VPS