Como funciona esta calculadora
O Calculadora de custos de avaliação LLM estima o gasto simbólico de uma única execução de avaliação, onde um conjunto de casos de teste é passado por um ou mais modelos e pontuado por um modelo juiz. Multiplica o número de casos de teste pelo modelos comparados, então pelo tokens por caso - cobrindo tanto os tokens de geração que os modelos testados produzem quanto os tokens de juiz gastos na classificação de cada resposta - e aplica seu $ por 1 milhão de tokens taxa para converter esse total em um valor em dólares. Os principais motivadores são, portanto, o tamanho do seu conjunto de testes, quantos modelos você avalia em paralelo e quantos tokens cada ciclo de geração mais juiz consome.
A principal compensação a observar é que as escalas de custos multiplicativamente: adicionar modelos ou expandir o conjunto de testes não apenas adiciona tokens, mas os compõe, e a aprovação do juiz pode duplicar silenciosamente o uso por caso. Antes de executar uma varredura grande, use a calculadora para dimensionar uma amostra representativa menor e confirmar se o custo por execução é aceitável, uma vez que uma solicitação pesada do juiz ou um longo conjunto de testes podem tornar as execuções de avaliação repetidas muito mais caras do que uma única geração sugeriria. Verificar primeiro a estimativa ajuda você a decidir se deve reduzir os casos, reduzir os modelos comparados ou usar um juiz mais barato.
Perguntas frequentes
Quanto custa a avaliação do LLM?
O custo é composto pelos casos de teste vezes os modelos vezes os tokens por caso, incluindo o modelo do juiz que lê cada resposta. Um LLM como juiz quase dobra os tokens porque cada resposta gerada também é pontuada. Executar o pacote em cada commit multiplica isso ao longo do mês.
Como faço para manter o custo de avaliação baixo?
Use um modelo menor e mais barato como juiz, mantenha um conjunto dourado focado em vez de milhares de casos e execute o conjunto completo todas as noites com um rápido conjunto de fumaça em cada commit. Você não precisa avaliar todos os modelos a cada push.