Il tasso di fallback è l'intero gioco. Un modello distillato che gestisce il 90% del traffico e instrada il resto all'insegnante non fornisce il multiplo del titolo: il decimo aumentato viene fatturato a tariffe di frontiera complete e in genere rappresenta la maggior parte della fattura rimasta. Inserisci un numero onesto di seguito e osserva lo spostamento del periodo di rimborso.
Effetti del tasso di riserva sul ROI
Stesso modello di studente, stessa spesa iniziale: cambia solo la quota di traffico che deve tornare all'insegnante. Questa è la variabile che decide se un progetto di distillazione è una vittoria trimestrale o un errore di arrotondamento.
| Tasso di ripiego | Efficace/mese | Risparmio/mese | Risparmio vs insegnante | Rimborso |
|---|
Perché il numero "20 volte più economico" del titolo non è il tuo risparmio
La distillazione funziona e i multipli pubblicati sono reali: addestra un piccolo studente a imitare un grande insegnante in un compito ristretto e il costo di servizio per token diminuisce in genere tra le cinque e le venti volte. Ciò che queste cifre descrivono è il costo di un gettone che passa attraverso lo studente invece che attraverso l'insegnante. Ciò che non descrivono è il costo di gestione di un sistema di produzione, che è una quantità diversa, perché i sistemi di produzione non instradano il 100% del traffico verso un modello che sia semplicemente altrettanto buono. Inoltrano i casi sicuri allo studente e si occupano del resto, e il resto viene addebitato alla tariffa intera dell'insegnante. Con una percentuale di riserva del 10%, l'insegnante gestisce ancora un decimo del tuo volume a 30 volte il prezzo dello studente, il che significa che è ancora responsabile della maggior parte della fattura rimanente. Modellare la distillazione come uno scambio pulito è l’errore più comune in questi casi aziendali.
I costi iniziali riguardano principalmente le persone, non le GPU
La linea di calcolo è quasi sempre la parte più economica. Etichettare 50.000 esempi tramite l'insegnante costa qualche centinaio di dollari a tariffe normali. Una messa a punto su un piccolo studente richiede decine di ore di GPU: chiamalo altri cento dollari ai prezzi di noleggio delle materie prime. Poi arriva la parte che non appare nel calcolatore dei costi di nessun fornitore: qualcuno deve curare il set di formazione, costruire un cablaggio di valutazione che possa effettivamente dirti se lo studente è abbastanza bravo, definire la soglia di confidenza per il router di fallback e convalidarlo rispetto al traffico di produzione prima di osare spostare utenti reali su di esso. Quaranta ore di ingegneria sono una stima ottimistica per quel lavoro e, a qualsiasi tasso misto realistico, dominano tutto il resto nella colonna iniziale. Questo è il motivo per cui la calcolatrice lo richiede esplicitamente invece di lasciarlo tranquillamente a zero.
L'orologio con cui stai correndo
L'ultima considerazione è che nessun foglio di calcolo ti impone: i prezzi di frontiera continuano a scendere. Un progetto con un rimborso di due mesi è al sicuro da ciò; un progetto con un rimborso di diciotto mesi scommette che il prezzo dell'insegnante e il panorama dei piccoli modelli rimarranno fermi per un anno e mezzo, cosa che la storia recente dice che non sarà così. Se il valore del rimborso riportato sopra supera un paio di trimestri, la lettura onesta è di solito che dovresti cercare un modello standard più economico, richiedere prima la compressione o la memorizzazione nella cache: vedi la sezione calcolatore rapido del risparmio di memorizzazione nella cache e il calcolatore del risparmio di routing del modello, entrambi i quali garantiscono una frazione del risparmio per una frazione dell'impegno. La distillazione si guadagna da vivere con compiti ad alto volume, ristretti e stabili, e viene punita ovunque. Confronta con una messa a punto diretta con il calcolatore di messa a punto e di suggerimento, o contro l'esecuzione del modello da soli con il file Calcolatore LLM e API self-hosted.