I pesi sono la parte facile. L'adattamento del modello è un calcolo su una riga e non dice quasi nulla. Ciò che decide se puoi servire otto o ottanta utenti è la cache KV, una memoria che si adatta alla lunghezza del contesto E con ogni sequenza simultanea in volo. Questo strumento dimensiona entrambi, quindi converte la capacità risultante in un costo per milione di token che puoi trattenere a fronte di una fattura API.

pesi
richieste contemporanee
Cache/richiesta KV
i tuoi gettoni da $ / 1 milione

Concorrenza e costo unitario in base alla lunghezza del contesto

Stesso modello, stessa GPU, stessi soldi: solo la finestra di contesto di ciascuna richiesta comporta modifiche. Questa è la tabella che trasforma "aumenteremo semplicemente max_model_len" in una decisione sulla capacità.

ContestoKV/richiestaConcorrenteToken/sec stimatoGettoni da $/1 milione

Il dirupo dell'utilizzo

Una GPU fattura a ore, non a gettoni. Il tuo vero costo unitario è la cifra principale divisa per il tuo ciclo di lavoro: è qui che la maggior parte dei casi aziendali di self-hosting falliscono silenziosamente.

Utilizzo medioGettoni effettivi/secGettoni da $/1 milionerispetto all'API
⚠️ Stima della capacità, non un parametro di riferimento. Le cifre della VRAM utilizzano GB decimali (1 GB = 10⁹ byte) per corrispondere al modo in cui i fornitori quotano la memoria della scheda. Gli stack di servizio reali aggiungono il riempimento del blocco di attenzione alla pagina, il riutilizzo facoltativo della cache del prefisso e l'headroom dello scheduler, quindi considera il numero di concorrenza come un limite superiore e pianifica un 20-30% in meno. Il throughput è il tuo input: misuralo sul tuo hardware anziché fidarti di una scheda tecnica. Confronta le attuali tariffe API per token su confronto dei prezzi dei modelli. · Segnala prezzo obsoleto →

Adattare il modello non è la stessa cosa che servirlo

Il consiglio che trovi ovunque è che un modello 70B su INT4 necessita di circa 35 GB, quindi può stare su una singola scheda da 80 GB con spazio libero. Questo è vero ed è quasi inutile, perché descrive un modello seduto inattivo. Nel momento in cui arrivano le richieste, ogni sequenza in volo alloca la propria cache KV: due tensori per strato, dimensionati in termini di teste KV per dimensione testa, mantenuti per ogni token nel contesto di quella sequenza. A 80 livelli, 8 KV head, 128 dimensioni e FP16 ovvero 327.680 byte per token - un terzo di megabyte - che in un contesto 8K sono circa 2,7 GB per richiesta simultanea. I 45 GB di spazio che sembravano così comodi corrispondono a circa una dozzina di utenti e il tredicesimo viene messo in coda. La pianificazione della capacità per l'inferenza è la pianificazione della cache KV; i pesi stabiliscono semplicemente la quota di iscrizione.

Il conteggio dei KV è il numero che si muove effettivamente

L'attenzione alle query raggruppate è il motivo per cui i moderni modelli open-weight sono utilizzabili e viene regolarmente trascurata da chiunque dimensioni l'hardware in base al conteggio dei parametri. Un modello con 64 teste di attenzione e 8 teste KV memorizza un ottavo della cache di un design multi-testa equivalente, che si converte quasi linearmente in otto volte la concorrenza sulla stessa carta. Prova il preset multi-head 13B sopra rispetto al preset 70B: il modello più piccolo è spesso quello che esaurisce per primo la memoria, il che non è intuitivo finché non vedi dove vanno i byte. Dimezzare la precisione KV a FP8 raddoppia nuovamente la concorrenza con un costo di precisione modesto. Questi due switch spostano la capacità molto di più rispetto all’acquisto di una carta più grande e non costano nulla.

L'utilizzo decide l'economia, non l'hardware

Il tavolo finale è quello che conclude onestamente la maggior parte dei progetti di self-hosting. Un H100 noleggiato costa gli stessi $ 2,50 l'ora alle 3 del mattino senza traffico come nelle ore di punta, quindi il costo reale per milione di token è il numero principale diviso per il ciclo di lavoro medio. Servi con un utilizzo del 20% e pagherai cinque volte quello che suggerisce la cifra ottimistica del calcolatore - e rispetto alle tariffe API delle materie prime per un modello piccolo, non si avvicina. Il self-hosting vince su volumi sostenuti, saturi e prevedibili, su carichi di lavoro con vincoli di residenza dei dati o di latenza che un'API non può soddisfare e su modelli che nessuno vende per token. Perde in caso di traffico intenso, e perde in silenzio, perché la fattura è piatta e la capacità sprecata non viene mai visualizzata come voce di riga. Confronta la conclusione con il Calcolatore LLM e API self-hosted, valuta l'hardware stesso con il file Calcolatore dei costi di inferenza della GPU, e se la risposta è marginale, guarda a modello più piccolo distillato O memorizzazione nella cache tempestiva prima di acquistare un rack.

Ospita il tuo progetto:DigitalOcean: $ 200 gratis ↗Hostinger VPS
LLM self-hosted e APICosto di inferenza GPUCosto del cloud GPUROI della distillazione del modelloLatenza LLMCosto della finestra di contesto