Cómo funciona esta calculadora
El Calculadora de costos de generación de datos sintéticos estima lo que cuesta producir un conjunto de datos artificiales con un modelo de lenguaje. Entras en el número de filas para generar, el fichas por fila (mensaje más salida), y el precio por 1 millón de tokensy los multiplica para proyectar el gasto total. También influye en un porcentaje de rechazo/reintento, ya que las filas generadas que no superan la validación o los controles de calidad deben regenerarse, agregando los tokens por los que realmente paga. Por lo tanto, los principales factores de costo son el número de filas, el peso del token por fila, el precio del modelo y la frecuencia con la que se reintenta la salida.
La compensación clave es calidad versus costo. Los modelos más baratos reducen la tasa por token pero a menudo aumentan la tasa de rechazo, por lo que los reintentos pueden borrar los ahorros. Antes de generar a escala completa, ejecute una pequeña muestra para medir su porcentaje de rechazo real, luego recorte la longitud del mensaje y ajuste los esquemas de salida para reducir los tokens por fila. Los pequeños cambios se acumulan en gran medida en miles de filas.
Preguntas frecuentes
¿Cuánto cuesta generar datos sintéticos?
Filas multiplicadas por tokens por fila multiplicadas por la tasa del modelo, más los tokens quemados en las generaciones rechazadas que filtra. Un modelo barato a un dólar por millón de tokens genera decenas de miles de filas por unos pocos dólares; la tasa de rechazo/reintento es lo que mueve el número.
¿Cómo genero datos sintéticos de forma económica?
Utilice un modelo pequeño y económico para la generación masiva y reserve un modelo más potente para la validación, ajuste el mensaje para que se rechacen menos filas y elimine los duplicados. El desperdicio está en reintentos y filas casi duplicadas, no en la generación base.