Cómo funciona esta calculadora
El Calculadora de costos de evaluación de LLM estima el gasto simbólico de una única ejecución de evaluación, donde un conjunto de casos de prueba pasa a través de uno o más modelos y es calificado por un modelo de juez. Se multiplica el número de casos de prueba por el modelos comparados, luego por el fichas por caja - cubre tanto los tokens de generación que producen los modelos probados como los tokens de juez utilizados para calificar cada respuesta, y aplica su $ por 1 millón de tokens tasa para convertir ese total en una cifra en dólares. Por lo tanto, los principales factores son el tamaño de su conjunto de pruebas, cuántos modelos evalúa en paralelo y cuántos tokens consume cada ciclo de generación más evaluación.
La contrapartida clave a tener en cuenta es que los costos aumentan multiplicativamente: agregar modelos o expandir el conjunto de pruebas no solo agrega tokens, sino que los agrava, y el pase del juez puede duplicar silenciosamente el uso por caso. Antes de ejecutar un barrido grande, use la calculadora para dimensionar una muestra representativa más pequeña y confirme que el costo por ejecución sea aceptable, ya que una gran cantidad de indicaciones del juez o un conjunto de pruebas largo pueden hacer que las ejecuciones de evaluación repetidas sean mucho más costosas de lo que sugeriría una sola generación. Verificar primero la estimación le ayuda a decidir si recortar los casos, reducir los modelos comparados o utilizar un juez más económico.
Preguntas frecuentes
¿Cuánto cuesta la evaluación de LLM?
El costo es casos de prueba multiplicados por modelos multiplicados por tokens por caso, incluido el modelo de juez que lee cada respuesta. Un juez de LLM aproximadamente duplica los tokens porque cada respuesta generada también se califica. Ejecutar la suite en cada confirmación lo multiplica a lo largo del mes.
¿Cómo mantengo bajo el costo de evaluación?
Utilice un modelo más pequeño y económico como juez, mantenga un conjunto dorado enfocado en lugar de miles de casos y ejecute el conjunto completo todas las noches con un rápido conjunto de humo en cada confirmación. No es necesario evaluar todos los modelos en cada impulso.