—
risparmi utilizzando il noleggio della GPU rispetto all'API gestita—costo del fornitore gestito
—Costo del noleggio della GPU
—Ore GPU necessarie
Tariffe dei provider gestiti rispetto al noleggio della GPU, in base alle dimensioni del tuo set di dati
Stesso conteggio dei token di addestramento di cui sopra (set di dati × token medi × epoche), valutato in base alla tariffa LoRA pubblicata di ciascun provider gestito, accanto alle impostazioni di noleggio della GPU.
| Opzione | Valutare | Costo della formazione |
|---|
Costo in base alle dimensioni del set di dati
Tutto il resto si è mantenuto sui valori indicati sopra, analizzando le dimensioni del set di dati (esempi di formazione), confrontando la tariffa gestita selezionata con le impostazioni di noleggio della GPU. La riga evidenziata è quella più vicina alla dimensione del tuo set di dati corrente.
| Esempi | Gettoni di formazione | Costo gestito | Costo della GPU | Opzione più economica |
|---|
Come si collega ad altri strumenti
Questo calcolatore valuta una decisione specifica: se pagare la tariffa per token di un provider gestito per la formazione LoRA/QLoRA o noleggiare tu stesso una GPU ed eseguire direttamente il lavoro. Se il tuo lavoro è a pieno la messa a punto - l'aggiornamento di ogni parametro, non un piccolo insieme di adattatori di basso rango - è una forma di costo completamente diversa, valutata rispetto alle tariffe dei token di addestramento di OpenAI, Google e Mistral sul mercato calcolatore dei costi di regolazione fine; per i costi completi di ottimizzazione tra questi fornitori, consulta quello strumento anziché questo. Se stai valutando la messa a punto rispetto alla semplice richiesta di un modello base, il file calcolatrice rapida o ottimizzata E RAG vs messa a punto le pagine coprono quella decisione precedente. E una volta addestrato un modello ottimizzato per LoRA, servirlo a lungo termine è la sua stessa questione build-vs-buy: il Calcolatore LLM e API self-hosted valuta la decisione sull'inferenza in corso nello stesso modo in cui questa pagina valuta la decisione sulla formazione una tantum.
Come funziona questa calcolatrice
IL Ottimizzazione di LoRA/QLoRA: calcolatore di noleggio API gestite e GPU parte dal carico di lavoro totale della formazione: dimensione del set di dati (esempi di formazione) × token avg per esempio × epoche dà il totale gettoni di allenamento il lavoro deve essere elaborato: per impostazione predefinita, 50.000 × 512 × 2 corrispondono a 51.200.000 token di formazione. Sul lato gestito, il conteggio dei token diviso per 1.000.000 e moltiplicato per il valore del fornitore selezionato tariffa per 1 milione di token di formazione dà il costo del fornitore gestito - $ 24,58 al valore predefinito di Together AI. Dal punto di vista del noleggio della GPU, lo stesso conteggio dei token di addestramento diviso per (rendimento della formazione in token/sec × 3.600) fornisce il Ore GPU necessario, che moltiplicato per il Velocità della GPU all'ora fornisce il costo di calcolo grezzo; aggiungendo orari di installazione × la tua tariffa oraria (facoltativo, $0 per impostazione predefinita) fornisce il valore completo Costo del noleggio della GPU - circa $ 1,79 con l'impostazione predefinita A100 con costo di installazione di $ 0.
Sottraendo il costo della GPU dal costo gestito si ottiene risparmio dal noleggiare una GPU da soli e dividerlo per il costo gestito dà il divario di costo percentuale: circa il 92,7% in meno tramite il noleggio della GPU con le impostazioni predefinite. Questo può diventare negativo: se la stima del throughput è troppo bassa, la velocità della GPU troppo alta o imposti una tariffa oraria diversa da zero per un numero sufficiente di ore di configurazione, l'API gestita può risultare più economica e questo calcolatore mostra che onestamente, anziché dare per scontato, il fai-da-te vince sempre. IL rendimento della formazione il campo è l'input più sensibile: varia enormemente in base al conteggio dei parametri del modello, quindi il valore predefinito di 15.000 token/sec è solo una stima iniziale; sostituiscilo con un numero confrontato con le dimensioni effettive del modello e la GPU prima di affidarti all'output in dollari per una vera decisione sul budget.
Domande frequenti
La messa a punto di LoRA è più economica tramite API o noleggiando una GPU?
Con dimensioni tipiche dei set di dati, noleggiare personalmente una GPU ed eseguire direttamente il processo di formazione LoRA/QLoRA è solitamente molto più economico in termini di dollari grezzi rispetto al pagamento della tariffa di formazione per token di un fornitore gestito. Con le impostazioni predefinite di questo calcolatore (50.000 esempi, 512 token/esempio, 2 epoche), un lavoro LoRA gestito su Together AI ($ 0,48 per 1 milione di token di formazione) costa circa $ 24,58, mentre gli stessi 51,2 milioni di token di formazione su un A100 da 80 GB noleggiato a $ 1,89/ora e il throughput di 15.000 token/sec costa circa $ 1,79 — oltre il 90% in meno. Ma questo divario è un confronto grezzo dei costi di calcolo, non un costo totale di proprietà completo: non include il tempo dedicato alla configurazione della pipeline di formazione, alla gestione dei checkpoint o al debug degli errori, nessuno dei quali un'API gestita ti obbliga a fare. Se il noleggio della GPU sia effettivamente più economico per te dipende da quanto apprezzi il tempo di configurazione, motivo per cui questo calcolatore ha un campo opzionale delle ore di configurazione che puoi aumentare sopra lo zero per vedere il cambiamento dell'immagine.
Di quale GPU ho bisogno per la messa a punto di LoRA?
Per la maggior parte dei lavori LoRA/QLoRA su modelli con parametri fino a circa 13B-34B, una singola GPU da 80 GB (una A100 da 80 GB o H100 da 80 GB) è sufficiente, perché LoRA addestra solo un piccolo set di pesi dell'adattatore di basso rango aggiunti anziché il modello completo e QLoRA quantizza i pesi di base congelati a 4 bit per ridurre ulteriormente la memoria, in modo che l'intero lavoro si adatti a una scheda anziché al cluster multi-GPU completo. sarebbe necessaria una messa a punto. Modelli base più grandi o finestre di contesto più lunghe aumentano le esigenze di memoria e possono richiedere dimensioni batch più piccole, una quantizzazione più aggressiva o una GPU più grande e la velocità effettiva di addestramento (token/secondo) varia molto in base al conteggio dei parametri. Questo calcolatore ha per impostazione predefinita 15.000 token/sec come stima illustrativa, ma dovresti adattarlo a un numero confrontato con le dimensioni del tuo modello e la tua GPU prima di fidarti dell'output in dollari.
Perché esiste un divario di costo così grande tra il gestito e il fai-da-te?
Le API di formazione LoRA gestite come Together AI e Fireworks non si limitano a fatturare per secondi GPU grezzi: la tariffa per token unisce affidabilità dell'infrastruttura, orchestrazione dei lavori, checkpoint automatico, code e tentativi e un team di supporto a cui puoi rivolgerti se un'esecuzione di formazione fallisce in parte, nessuna delle quali puoi noleggiare tu stesso un'istanza GPU nuda. Questo pacchetto comporta un margine reale rispetto al costo di calcolo sottostante e poiché un A100 o H100 noleggiato e fatturato a ore non ha tale margine oltre il margine del fornitore di servizi cloud, il divario tra i due può sembrare enorme quando si confronta solo la linea del costo di calcolo. L'onesto avvertimento è che il fai da te non è gratuito come sembra dal confronto: qualcuno deve scrivere ed eseguire il debug dello script di training, gestire i checkpoint e gestire gli errori senza una linea di supporto da chiamare, il che è in tempo reale anche se non viene mai visualizzato come addebito per token.
Qual è la differenza tra LoRA e il costo completo di ottimizzazione?
L'ottimizzazione completa aggiorna ogni parametro nel modello, motivo per cui il nostro calcolatore di ottimizzazione completa modella i costi di addestramento come token di set di dati moltiplicati per epoche moltiplicati per la frequenza di addestramento del provider su un modello base che stai modificando interamente e in genere richiede memoria GPU sufficiente (o budget di addestramento gestito) per mantenere i gradienti e lo stato dell'ottimizzatore per l'intero conteggio dei parametri, il che è costoso per qualsiasi dimensione del modello reale. LoRA e QLoRA congelano invece il modello base e addestrano un piccolo numero di pesi aggiuntivi dell'adattatore di basso rango, quindi l'ingombro di calcolo e memoria - e quindi il costo, sia dal lato dell'API gestita che dal lato del noleggio della GPU - è una piccola frazione della messa a punto completa per un set di dati comparabile. Ecco perché questo calcolatore e il calcolatore dell'ottimizzazione completa utilizzano forme di costo diverse: l'ottimizzazione completa ha un prezzo principalmente in base alle tariffe di formazione del fornitore perché l'ottimizzazione completa fai-da-te è raramente pratica su una singola GPU noleggiata, mentre LoRA/QLoRA è economico e abbastanza piccolo da rendere il noleggio di una singola GPU un'alternativa realistica, spesso molto più economica, a un'API gestita.