I pesi sono la parte facile. L'adattamento del modello è un calcolo su una riga e non dice quasi nulla. Ciò che decide se puoi servire otto o ottanta utenti è la cache KV, una memoria che si adatta alla lunghezza del contesto E con ogni sequenza simultanea in volo. Questo strumento dimensiona entrambi, quindi converte la capacità risultante in un costo per milione di token che puoi trattenere a fronte di una fattura API.
Concorrenza e costo unitario in base alla lunghezza del contesto
Stesso modello, stessa GPU, stessi soldi: solo la finestra di contesto di ciascuna richiesta comporta modifiche. Questa è la tabella che trasforma "aumenteremo semplicemente max_model_len" in una decisione sulla capacità.
| Contesto | KV/richiesta | Concorrente | Token/sec stimato | Gettoni da $/1 milione |
|---|
Il dirupo dell'utilizzo
Una GPU fattura a ore, non a gettoni. Il tuo vero costo unitario è la cifra principale divisa per il tuo ciclo di lavoro: è qui che la maggior parte dei casi aziendali di self-hosting falliscono silenziosamente.
| Utilizzo medio | Gettoni effettivi/sec | Gettoni da $/1 milione | rispetto all'API |
|---|
Adattare il modello non è la stessa cosa che servirlo
Il consiglio che trovi ovunque è che un modello 70B su INT4 necessita di circa 35 GB, quindi può stare su una singola scheda da 80 GB con spazio libero. Questo è vero ed è quasi inutile, perché descrive un modello seduto inattivo. Nel momento in cui arrivano le richieste, ogni sequenza in volo alloca la propria cache KV: due tensori per strato, dimensionati in termini di teste KV per dimensione testa, mantenuti per ogni token nel contesto di quella sequenza. A 80 livelli, 8 KV head, 128 dimensioni e FP16 ovvero 327.680 byte per token - un terzo di megabyte - che in un contesto 8K sono circa 2,7 GB per richiesta simultanea. I 45 GB di spazio che sembravano così comodi corrispondono a circa una dozzina di utenti e il tredicesimo viene messo in coda. La pianificazione della capacità per l'inferenza è la pianificazione della cache KV; i pesi stabiliscono semplicemente la quota di iscrizione.
Il conteggio dei KV è il numero che si muove effettivamente
L'attenzione alle query raggruppate è il motivo per cui i moderni modelli open-weight sono utilizzabili e viene regolarmente trascurata da chiunque dimensioni l'hardware in base al conteggio dei parametri. Un modello con 64 teste di attenzione e 8 teste KV memorizza un ottavo della cache di un design multi-testa equivalente, che si converte quasi linearmente in otto volte la concorrenza sulla stessa carta. Prova il preset multi-head 13B sopra rispetto al preset 70B: il modello più piccolo è spesso quello che esaurisce per primo la memoria, il che non è intuitivo finché non vedi dove vanno i byte. Dimezzare la precisione KV a FP8 raddoppia nuovamente la concorrenza con un costo di precisione modesto. Questi due switch spostano la capacità molto di più rispetto all’acquisto di una carta più grande e non costano nulla.
L'utilizzo decide l'economia, non l'hardware
Il tavolo finale è quello che conclude onestamente la maggior parte dei progetti di self-hosting. Un H100 noleggiato costa gli stessi $ 2,50 l'ora alle 3 del mattino senza traffico come nelle ore di punta, quindi il costo reale per milione di token è il numero principale diviso per il ciclo di lavoro medio. Servi con un utilizzo del 20% e pagherai cinque volte quello che suggerisce la cifra ottimistica del calcolatore - e rispetto alle tariffe API delle materie prime per un modello piccolo, non si avvicina. Il self-hosting vince su volumi sostenuti, saturi e prevedibili, su carichi di lavoro con vincoli di residenza dei dati o di latenza che un'API non può soddisfare e su modelli che nessuno vende per token. Perde in caso di traffico intenso, e perde in silenzio, perché la fattura è piatta e la capacità sprecata non viene mai visualizzata come voce di riga. Confronta la conclusione con il Calcolatore LLM e API self-hosted, valuta l'hardware stesso con il file Calcolatore dei costi di inferenza della GPU, e se la risposta è marginale, guarda a modello più piccolo distillato O memorizzazione nella cache tempestiva prima di acquistare un rack.