Costo cumulativo: sollecitazione vs messa a punto
Spesa totale dopo N richieste, formazione e hosting inclusi. Il crossover è il luogo in cui la messa a punto prende il comando.
| Richieste | Richiesta totale | Ottimizzazione totale | Più economico |
|---|
Il vero compromesso: paga per chiamata o paga una volta
Far sì che un modello si comporti in un compito ristretto di solito inizia con il prompt: inserisci le istruzioni, alcuni esempi funzionanti e forse una guida di stile nel prompt e invii quel preambolo ad ogni richiesta. Funziona, ma lo affitti per sempre: quei gettoni da pochi scatti vengono fatturati alla tariffa di ingresso alla prima chiamata e alla chiamata di dieci milioni. La messa a punto offre l’altro accordo. Inserisci il comportamento nei pesi una volta, per un costo di formazione fisso, quindi invii solo l'attività effettiva: il lungo preambolo scompare da ogni chiamata futura. Il problema è che un modello personalizzato spesso fattura con un premio per token e alcuni fornitori fanno pagare per ospitarlo, quindi il prompt più breve non è puro profitto.
Ciò crea un classico pareggio. La richiesta ha un costo iniziale prossimo allo zero ma un costo per chiamata più elevato; la messa a punto ha un costo iniziale reale ma un costo per chiamata inferiore. Traccia entrambi come spesa cumulativa e si incrociano in base a un conteggio di richieste specifico: al di sotto di esso, la richiesta è più economica; sopra di esso, la sintonia va avanti e non guarda mai indietro. Questo calcolatore rileva il crossover dai tuoi numeri: i gettoni che risparmieresti per chiamata, il costo della formazione, qualsiasi premio di inferenza e hosting. Inseriscili e ti verrà detto di quante richieste hai bisogno prima che la messa a punto sia la macchina più economica e quanti mesi sono al tuo volume attuale.
Come usarlo
1. Scegli un modello base (che imposta i tassi di input, output e formazione) e il volume di richieste mensili.
2. Inserisci i token di input dell'attività inviati da entrambi gli approcci e separatamente i token pochi scatti/istruzioni che la regolazione fine ti consente di rilasciare.
3. Aggiungi token di output, eventuali premium di inferenza ottimizzati, conteggio dei token di addestramento (dimensioni del set di dati × epoche) e hosting opzionale.
4. Leggere il conteggio delle richieste di pareggio e il costo mensile di ciascun percorso, quindi eseguire la scansione della tabella per individuare il punto di crossover.
Quando il numero ti mente
Il puro costo è solo metà della decisione. La messa a punto può aumentare la qualità e la coerenza di un'attività specializzata e, abbreviando il prompt, riduce anche la latenza: un input più breve è un primo token più veloce. Questi vantaggi possono giustificare una messa a punto molto prima del pareggio dei costi, soprattutto nei prodotti sensibili alla latenza o di alta qualità. Al contrario, se il tuo compito continua a cambiare, il costo della formazione si ripresenta ogni volta che ti riqualifichi, il che spinge il pareggio più lontano di quanto suggerisca un singolo numero iniziale. Utilizza questo strumento per la questione dei soldi, quindi valuta la qualità, la latenza e la frequenza con cui ti riqualificherai. Se stai solo cercando di ridurre i prompt, il file calcolatore di memorizzazione nella cache rapida è il primo esperimento più economico: la memorizzazione nella cache di un prefisso fisso consente di ottenere gran parte del risparmio senza alcun costo di formazione.
Errori comuni
Ignorando il premio di inferenza. Se il modello messo a punto costa di più per token, il prompt più breve consente di risparmiare meno di quanto sembri: il pareggio si sposta. Dimenticando la riqualificazione. Ogni volta che l'attività cambia e ti riqualifichi, paghi nuovamente il costo iniziale; un modello che non si stabilizza mai potrebbe non raggiungere mai il pareggio. Esagerare i gettoni risparmiati. Sii onesto su quanto la messa a punto del preambolo effettivamente rimuove: se hai ancora bisogno della maggior parte del contesto, il risparmio è piccolo. Saltare prima la vincita gratuita. La memorizzazione nella cache tempestiva spesso consente di ottenere gran parte dello stesso risparmio con costi di formazione pari a zero; provatelo prima di impegnarvi nella messa a punto.
Domande frequenti
Cosa conta come "gettoni allenamento"?
Approssimativamente la dimensione del tuo set di dati in token moltiplicata per il numero di epoche. Un set di dati di 500.000 token addestrato per 4 epoche equivale a circa 2 milioni di token di addestramento, fatturati alla tariffa di addestramento del fornitore.
Perché la messa a punto consente di risparmiare denaro se l'inferenza costa di più?
Perché rimuove il lungo messaggio di pochi scatti da ogni chiamata. Anche con un premio per token, l'eliminazione di oltre 1.000 token di input per richiesta si aggiunge rapidamente su larga scala, abbastanza da superare i costi di formazione oltre il pareggio.
Come faccio a stimare i token a pochi colpi che risparmierei?
Conta il blocco di istruzioni e gli esempi che attualmente anteponi a ciascun prompt di cui un modello ottimizzato non avrebbe più bisogno. Questo è il numero da inserire nel campo "token salvati": l'input dell'attività rimane in entrambi i percorsi.
Dovrei ottimizzare solo per i costi?
Solo al di sopra del volume di pareggio. Al di sotto di esso, un buon prompt o un prompt caching sono più economici. Ottimizza la qualità, la coerenza o la latenza e lascia che il pareggio dei costi ti dica se si tratta anche di un risparmio.
Solo stima. I prezzi di regolazione, i premi e le tariffe di hosting variano in base al fornitore e cambiano: verifica prima di definire il budget.