Come funziona questa calcolatrice
IL Calcolatore dei costi di valutazione LLM stima la spesa in token di una singola esecuzione di valutazione, in cui una serie di casi di test viene passata attraverso uno o più modelli e valutata da un modello Judge. Moltiplica il numero di casi di prova dal modelli a confronto, quindi dal gettoni per caso - coprendo sia i token di generazione prodotti dai modelli testati sia i token del giudice spesi per valutare ciascuna risposta - e applica il tuo $ per 1 milione di token tasso per convertire il totale in una cifra in dollari. I fattori principali sono quindi la dimensione del set di test, il numero di modelli valutati in parallelo e il numero di token consumati da ciascun ciclo di generazione più giudice.
Il compromesso chiave da tenere d’occhio è che i costi aumentano moltiplicativamente: l'aggiunta di modelli o l'espansione del set di test non si limita ad aggiungere token, li unisce e il passaggio del giudice può tranquillamente raddoppiare l'utilizzo per caso. Prima di eseguire un'analisi ampia, utilizzare il calcolatore per dimensionare un campione rappresentativo più piccolo e verificare che il costo per esecuzione sia accettabile, poiché un'intensa richiesta di valutazione o una lunga suite di test possono rendere le analisi ripetute molto più costose di quanto suggerirebbe una singola generazione. Controllare prima il preventivo aiuta a decidere se tagliare i casi, ridurre i modelli confrontati o utilizzare un giudice più economico.
Domande frequenti
Quanto costa la valutazione LLM?
Il costo è rappresentato dai casi di test moltiplicati per i modelli moltiplicati per i token per caso, incluso il modello del giudice che legge ciascuna risposta. Un LLM come giudice raddoppia all'incirca i gettoni perché viene assegnato un punteggio anche a ogni risposta generata. L'esecuzione della suite su ogni commit lo moltiplica nel corso del mese.
Come posso mantenere bassi i costi di valutazione?
Utilizza un modello più piccolo ed economico come giudice, mantieni un set dorato concentrato anziché migliaia di casi ed esegui l'intera suite ogni notte con una rapida serie di fumo su ogni commit. Non è necessario valutare ogni modello a ogni spinta.