7 settembre 2026 · AI e LLM · 5 minuti di lettura
Stavo valutando un fornitore di inferenza rapida per un carico di lavoro di un agente che esegue un modello aperto di classe 70B e i tre nomi che continuano a emergere - Groq, Together AI, Fireworks - citano tutti prezzi per token che sembrano simili a prima vista. Non lo è. Sui modelli di classe Llama-70B, Groq funziona $ 0,59 in ingresso / $ 0,79 in uscita per 1 milione di token, Insieme AI è un appartamento $0.88 / $0.88, e Fireworks fattura un misto ~$0,90 per 1 milione per il suo livello 16–80B. Con una divisione input/output realistica di 70/30, è a Divario di $ 250 al mese tra Groq e Fireworks una volta che stai spingendo un miliardo di token - e quello più economico non è automaticamente la scelta giusta.
Tutti e tre eseguono modelli open-weight – Llama, Qwen, Mixtral, DeepSeek – dietro API compatibili con OpenAI, quindi cambiare fornitore è solitamente una modifica dell'URL di base. Ecco quanto costa effettivamente l'inferenza di classe Llama-70B su ciascuno, estratto dalle rispettive pagine dei prezzi:
| Fornitore | Modello | Inserisci $/1 milione | Produzione $/1 milione |
|---|---|---|---|
| Groq | Lama 3.3 70B | $0.59 | $0.79 |
| Insieme AI | Lama 3.1 70B | $0.88 | $0.88 |
| Fuochi d'artificio | Livello intermedio (16–80B, ad esempio Llama 70B) | ~$0,90 miscelati | |
Groq è sulla carta il più economico per un tipico carico di lavoro a forma di chat (più token di input che output) perché il suo prezzo di input è inferiore del 33% alla tariffa forfettaria di Together. Insieme, l'intelligenza artificiale valuta l'input e l'output in modo identico, il che è più semplice da prevedere ma costa di più per le richieste ad alto contenuto di input che la maggior parte dei carichi di lavoro RAG e degli agenti effettivamente inviano. Fireworks non suddivide affatto input/output; il suo ~ $ 0,90 è un unico tasso misto per l'intera classe del modello 16–80B, il che semplifica la stima ma significa che non è possibile ottimizzare riducendo la lunghezza dell'output come è possibile su Groq o Together.
Il prezzo più basso di Groq deriva dalla stessa velocità: hardware LPU (Language Processing Unit) personalizzato costruito appositamente per la generazione di token, invece di GPU generiche. Questo è anche il vero punto di forza di Groq rispetto agli altri due: centinaia di token al secondo, ben oltre ciò che in genere offre il servizio basato su H100. Per un agente vocale o un'interfaccia utente di chat in cui l'utente guarda il cursore, tale differenza di latenza è più importante del divario di $ 0,29/1 milione sui token di input. Il problema: il catalogo dei modelli ospitati da Groq è più ristretto di quello di Together o Fireworks e non offre capacità dedicata o messa a punto: se il modello di cui hai bisogno non è nell'elenco di Groq, il prezzo smette di essere il fattore decisivo.
Together AI offre il più ampio catalogo di modelli aperti dei tre (Llama, Mixtral, Qwen, DeepSeek e altri) oltre alla messa a punto e agli endpoint dedicati, quindi se il lavoro è "eseguire la mia variante ottimizzata" anziché "chiamare un modello di serie", i prezzi e gli strumenti piatti e facili da prevedere di Together vincono sulla formazione più ristretta e veloce di Groq. Fireworks si trova in una posizione simile: prezzi serverless per token per avvii rapidi, ma anche distribuzione dedicata per ora di GPU per i team che desiderano throughput riservato e latenza prevedibile su larga scala, che né il catalogo fisso di Groq né la prima configurazione serverless di Together coprono allo stesso modo. Entrambi rappresentano l'impostazione predefinita migliore quando il carico di lavoro richiede più di "token più economici per un modello supportato".
Supponendo una suddivisione realistica del 70% input / 30% output, tipica della chat e dei prompt in stile RAG:
| Gettoni/mese | Groq | Insieme AI | Fuochi d'artificio |
|---|---|---|---|
| 10 milioni (piccola app) | $6.50 | $8.80 | $9.00 |
| 100 milioni (prodotto stazionario) | $65 | $88 | $90 |
| 1 miliardo (agente ad alto rendimento) | $650 | $880 | $900 |
Il divario si adatta linearmente al volume poiché tutti e tre sono prezzi puramente per token senza piani o livelli di piano sul modello stesso: con 1 miliardo di token al mese, i 650 dollari di Groq contro i 900 dollari di Fireworks sono una differenza reale di 250 dollari, non un errore di arrotondamento. Ma nessuno di questi numeri tiene conto di ciò che accade quando il modello che desideri non è disponibile sul fornitore più economico o quando la velocità di Groq riduce i costi effettivi altrove: meno tentativi, sessioni utente più brevi, meno necessità di memorizzare nella cache in modo aggressivo solo per nascondere la latenza.
Prodotto sensibile alla latenza (voce, chat dal vivo, qualsiasi cosa un utente stia fissando durante lo streaming): inizia con Groq se il tuo modello è nell'elenco: la velocità è la decisione effettiva sul prodotto e sembra anche essere più economico. Hai bisogno di un modello aperto ottimizzato o meno comune oppure desideri una capacità dedicata con un throughput prevedibile: Together AI o Fireworks, e scegli in base se apprezzi di più il catalogo più ampio di Together o l'opzione dedicata alle ore GPU di Fireworks. Anche eseguirli tutti e tre fianco a fianco non è irragionevole: l'API compatibile con OpenAI significa che il codice non cambia, ma solo l'URL di base e la fattura.
Sei nuovo ai prezzi dell'intelligenza artificiale basati sull'utilizzo? Inizia con il guide gratuite sui costi API. Per la parte relativa al modello chiuso della stessa decisione, cfr GPT vs Claude vs Gemini: quanto costa effettivamente lo stesso carico di lavoro.
Tariffe verificate rispetto alle pagine dei prezzi ufficiali di Groq, Together AI e Fireworks, verificate l'ultima volta il 15-08-2026. Stime di riferimento: la disponibilità dei modelli, gli sconti sui volumi e le tariffe aziendali negoziate variano; confermare i prezzi attuali prima di stabilire il budget.