Come funziona questa calcolatrice
IL Calcolatore dei costi di valutazione LLM stima la spesa in token di una singola esecuzione di valutazione, in cui una serie di casi di test viene passata attraverso uno o più modelli e valutata da un modello Judge. Moltiplica il numero di casi di prova dal modelli a confronto, quindi dal gettoni per caso - coprendo sia i token di generazione prodotti dai modelli testati sia i token del giudice spesi per valutare ciascuna risposta - e applica il tuo $ per 1 million tokens rate to convert that total into a dollar figure. The main drivers are therefore the size of your test set, how many models you evaluate in parallel, and how many tokens each generation-plus-judge cycle consumes.
The key trade-off to watch is that cost scales moltiplicativamente: l'aggiunta di modelli o l'espansione del set di test non si limita ad aggiungere token, li unisce e il passaggio del giudice può tranquillamente raddoppiare l'utilizzo per caso. Prima di eseguire un'analisi ampia, utilizzare il calcolatore per dimensionare un campione rappresentativo più piccolo e verificare che il costo per esecuzione sia accettabile, poiché un'intensa richiesta di valutazione o una lunga suite di test possono rendere le analisi ripetute molto più costose di quanto suggerirebbe una singola generazione. Controllare prima il preventivo aiuta a decidere se tagliare i casi, ridurre i modelli confrontati o utilizzare un giudice più economico.
Domande frequenti
How much does LLM evaluation cost?
Il costo è rappresentato dai casi di test moltiplicati per i modelli moltiplicati per i gettoni per caso, incluso il modello del giudice che legge ciascuna risposta. Un LLM come giudice raddoppia all'incirca i gettoni perché viene assegnato un punteggio anche a ogni risposta generata. L'esecuzione della suite su ogni commit lo moltiplica nel corso del mese.
Come posso mantenere bassi i costi di valutazione?
Usa un modello più piccolo ed economico come giudice, mantieni un set dorato concentrato anziché migliaia di casi ed esegui l'intera suite ogni notte con una rapida serie di fumo su ogni commit. Non è necessario valutare ogni modello a ogni spinta.