La tasa de retroceso es todo el juego. Un modelo destilado que maneja el 90% de su tráfico y dirige el resto de regreso al maestro no genera el título múltiple: el décimo escalado se factura a tarifas de frontera completa y generalmente representa la mayor parte de la factura restante. Ingrese un número honesto a continuación y observe cómo avanza el período de recuperación.
¿Qué efecto tiene la tasa de reserva en su retorno de la inversión?
El mismo modelo de estudiante, el mismo gasto inicial: solo cambia la proporción del tráfico que tiene que regresar al maestro. Esta es la variable que decide si un proyecto de destilación es un éxito de un trimestre o un error de redondeo.
| Tasa de retroceso | Efectivo / mes | Ahorro / mes | Ahorro vs maestro | venganza |
|---|
Por qué el número del titular "20 veces más barato" no es su ahorro
La destilación funciona, y los múltiplos publicados son reales: entrene a un estudiante pequeño para que imite a un maestro grande en una tarea limitada y el costo por porción de token generalmente se reduce entre cinco y veinte veces. Lo que esas cifras describen es el costo de una ficha que pasa por el estudiante en lugar del maestro. Lo que no describen es el costo de ejecutar un sistema de producción, que es una cantidad diferente, porque los sistemas de producción no dirigen el 100% del tráfico a un modelo que sea casi tan bueno. Dirigen los casos seguros al estudiante y escalan el resto, y el resto se cobra a la tarifa completa del profesor. Con una tasa de reserva del 10%, el profesor sigue manejando una décima parte de su volumen a 30 veces el precio del estudiante, lo que significa que sigue siendo responsable de la mayor parte de su factura restante. Modelar la destilación como un intercambio limpio es el error más común en estos casos de negocios.
El costo inicial es principalmente de personas, no de GPU
La línea de cálculo es casi siempre la parte más barata. Etiquetar 50.000 ejemplos a través del profesor cuesta unos cientos de dólares al precio habitual. Un ajuste fino para un estudiante pequeño equivale a decenas de horas de GPU; llámelo otros cien dólares a precios de alquiler de productos básicos. Luego viene la parte que no aparece en la calculadora de costos de ningún proveedor: alguien tiene que seleccionar el conjunto de capacitación, crear un arnés de evaluación que realmente pueda indicarle si el estudiante es lo suficientemente bueno, definir el umbral de confianza para el enrutador alternativo y validarlo frente al tráfico de producción antes de atreverse a transferir usuarios reales a él. Cuarenta horas de ingeniería es una estimación optimista para ese trabajo y, a cualquier ritmo combinado realista, domina todo lo demás en la columna inicial. Por eso la calculadora lo pide explícitamente en lugar de dejarlo silenciosamente en cero.
El reloj que estas corriendo
La última consideración es algo que ninguna hoja de cálculo le impone: los precios de frontera siguen cayendo. Un proyecto con una recuperación de la inversión en dos meses está a salvo de eso; un proyecto con una recuperación de dieciocho meses apuesta a que el precio del profesor y el panorama de los modelos pequeños se mantengan quietos durante un año y medio, lo que la historia reciente dice que no será así. Si la cifra de recuperación anterior supera un par de trimestres, la lectura honesta suele ser que debería buscar un modelo disponible más económico y solicitar primero la compresión o el almacenamiento en caché; consulte la calculadora de ahorro de almacenamiento en caché rápida y el calculadora de ahorro de enrutamiento modelo, los cuales ofrecen una fracción del ahorro por una fracción del compromiso. La destilación se gana la vida en tareas estables, estrechas y de gran volumen, y es castigada en todos los demás. Comparar con un ajuste fino directo con el calculadora de ajuste versus indicaciones, o en contra de ejecutar el modelo usted mismo con el Calculadora LLM vs API autohospedada.