Cómo funciona esta calculadora
El Calculadora de costos y tiempo de procesamiento por lotes estima dos cosas para un trabajo de LLM a granel: el hora del reloj de pared se necesita para terminar y el costo total de la carrera. Multiplica su recuento de artículos por los tokens generados por artículo para obtener el volumen total de tokens, luego aplica su precio por 1 millón de tokens para producir la cifra en dólares. El tiempo de ejecución proviene de dividir ese trabajo simbólico entre sus trabajadores: la velocidad por trabajador en tokens por segundo y el número de trabajadores paralelos juntos establecen el rendimiento, por lo que una mayor concurrencia acorta el tiempo transcurrido aunque la factura del token siga siendo la misma.
La compensación clave es que La concurrencia reduce el tiempo pero no el coste.. Duplicar los trabajadores reduce aproximadamente a la mitad la duración del reloj de pared, pero aún así se paga por cada token generado. Antes de ampliar, verifique si la estimación de tokens por artículo es realista, ya que longitud de salida es el mayor impulsor tanto del tiempo como del gasto. Primero recorte los resultados detallados y luego aumente el número de trabajadores para cumplir con la fecha límite.
Preguntas frecuentes
¿Cómo calculo cuánto tiempo lleva un trabajo de LLM masivo?
Total de tokens = artículos × tokens por artículo. Divida por el rendimiento combinado (velocidad por trabajador × número de trabajadores paralelos) para obtener segundos de reloj de pared. Diez trabajadores a 60 tok/s entregan 600 tok/s, por lo que un trabajo de 8 millones de tokens tarda aproximadamente 3,7 horas, antes de que los límites de velocidad lo limiten.
¿Debería utilizar la API por lotes en su lugar?
Si el trabajo no es urgente, sí. Los puntos finales por lotes (OpenAI, Anthropic, Gemini) ejecutan trabajos de forma asincrónica dentro de un período de 24 horas a aproximadamente la mitad del precio por token. Cambia la latencia inmediata por un gran descuento, ideal para rellenos de incrustaciones, evaluaciones y enriquecimiento fuera de línea.