HomeBlog › Costo dell'host di inferenza a modello aperto

Stesso modello, fattura diversa: quanto costano gli LLM open-weight su 6 host di inferenza

Pubblicato il 06-08-2026 · numeri di riferimento, verificare prima della stesura del budget

DeepSeek V4 è DeepSeek V4. I pesi sono identici indipendentemente dal fatto che lo chiami Groq, Insieme, Fuochi d'artificio, DeepInfra, Novita o OpenRouter — stessa architettura, stessa qualità di output, nessuna differenza di regolazione tra gli host. Ciò che non è identico è il conto. Abbiamo applicato i nostri prezzi per token da 1 milione su tutti e sei i modelli per lo stesso identico modello, due volte, e il divario tra gli host più economici e quelli più costosi è stato costante 31% - ogni volta.

Il carico di lavoro che stiamo valutando

Un RAG di medie dimensioni o un backend di assistente di codifica in esecuzione DeepSeek V4: 50 milioni di token di input e 10 milioni di token di output al mese. Si tratta di una vera gamma di produzione: un bot di supporto o uno strumento di codifica interno con poche centinaia di utenti attivi, non un progetto giocattolo.

Passaggio 1: DeepSeek V4, sei host

OspiteIngresso/1MUscita/1MCosto mensile
Novita$0.216$0.88$19.60
DeepInfra$0.2295$0.935$20.83
Groq$0.2565$1.045$23.28
Insieme$0.27$1.10$24.50
OpenRouter$0.27$1.10$24.50
Fuochi d'artificio$0.2835$1.155$25.73

I prezzi sono stime di riferimento, agosto 2026. Segnala prezzo obsoleto →

Da $ 19,60 a $ 25,73 su pesi identici per un utilizzo identico: a $ 6,13 al mese, divario del 31%. con zero differenza di qualità per spiegarlo. A 10 volte il volume (500 milioni di ingresso / 100 milioni di uscita, un prodotto davvero impegnativo) è $ 196 contro $ 257, UN $735/anno differenza rispetto al solo menu a discesa dell'host.

Fase 2: Llama 4 Maverick, stessi sei host

Per verificare che non si trattasse di una stranezza di DeepSeek, abbiamo eseguito gli stessi sei host contro Llama 4 Maverick sullo stesso carico di lavoro 50M/10M:

OspiteIngresso/1MUscita/1MCosto mensile
Novita$0.28$0.92$23.20
DeepInfra$0.2975$0.9775$24.65
Groq$0.3325$1.0925$27.55
Insieme$0.35$1.15$29.00
OpenRouter$0.35$1.15$29.00
Fuochi d'artificio$0.3675$1.2075$30.45

Stessa classifica, stesso ordine, stesso diffusione del 31%. da Novita in basso a Fuochi d'artificio in alto. Non è una coincidenza: è un moltiplicatore fisso che ogni host applica allo stesso prezzo di riferimento e vale per tutti i modelli aperti che abbiamo controllato nel nostro set di prezzi, dal parametro 12B Gemma al parametro 400B+ Llama 4 Behemoth.

Da dove viene la fascia del 31%.

Ciò che questo non ti dice

La parità di prezzo tra i modelli non significa che gli host siano intercambiabili. Stiamo confrontando solo la tariffa per token, non la latenza, la cronologia dei tempi di attività, la copertura della regione, i limiti di velocità o il comportamento di ciascun host in caso di picco di traffico. Uno sconto del 20% su Novita non vale nulla se un bot di supporto scade durante l'ora più impegnativa. Se sei attento alle entrate e ai costi, inizia con l'host più economico e un fallback. Se hai già un volume significativo, confronta la latenza e il tempo di attività del tuo traffico prima di passare esclusivamente alla colonna del prezzo: il divario di $ 735/anno del nostro esempio è denaro reale, ma non è l'unico numero che conta.

L'asporto

Il peso aperto non significa il prezzo aperto. Il fatto che il modello possa essere scaricato gratuitamente non impedisce a sei diverse aziende di addebitare sei tariffe diverse per eseguirlo per te, e lo spread... 31% dall'alto al basso, nello stesso ordine, su ogni modello che abbiamo controllato - è abbastanza grande da avere importanza una volta superati alcuni milioni di token al mese. Prima di impegnarti in un host, esegui il tuo volume token tramite il file Strumento API LLM più economicoe confronta i fornitori direttamente sulle loro pagine: Groq, Insieme, Fuochi d'artificio, OpenRouter. È la stessa lezione di l’imposta di frontiera tra i livelli del modello: il nome del modello sulla fattura dice meno del logo del venditore accanto.

Le cifre sono stime di riferimento (agosto 2026) tratte dal nostro set di dati sui prezzi. I prezzi degli host di inferenza cambiano frequentemente e gli sconti sui volumi, le tariffe per impegno di utilizzo e i prezzi regionali possono spostare la classifica: conferma sempre le tariffe attuali sulla pagina dei prezzi ufficiali di ciascun fornitore prima di stabilire il budget.