Batch API: 50% de descuento para trabajos no urgentes
La mayoría de la gente llama a un modelo de IA y espera una respuesta en tiempo real. Pero una gran parte del trabajo de IA no es urgente en absoluto: la generación de informes de la noche a la mañana, la clasificación masiva y el etiquetado de conjuntos de datos. Para esos trabajos, las API por lotes ofrecen los mismos modelos con un gran descuento, normalmente alrededor del 50%, a cambio de renunciar a resultados instantáneos.
Qué es una API por lotes
Una API por lotes le permite enviar muchas solicitudes a la vez como un solo trabajo, en lugar de una a la vez en tiempo real. Usted carga un archivo que contiene todas sus indicaciones, el proveedor las procesa de forma asincrónica durante un período de tiempo y usted descarga los resultados cuando estén listos.
El comercio que estás realizando es simple: Renuncias a la velocidad y obtienes un precio más bajo.. En lugar de recibir una respuesta en segundos, puede esperar minutos u horas. A cambio, el costo por token generalmente se reduce aproximadamente a la mitad en comparación con la tasa síncrona estándar.
Por qué los proveedores pueden ofrecer el descuento
El tráfico de API en tiempo real es irregular e impredecible. Los proveedores deben mantener capacidad excedente lista para los picos de demanda, y ese espacio libre es costoso. Los trabajos por lotes son flexibles: se pueden ejecutar siempre que exista capacidad adicional, lo que suaviza la carga.
Debido a que permite que el proveedor programe su trabajo durante períodos más tranquilos, puede usar el hardware de manera más eficiente y devolverle parte de ese ahorro. El descuento no es un modelo de menor calidad, es exactamente el mismo modelo ejecutado en un horario relajado.
Cómo se ve el flujo de trabajo
El flujo por lotes típico tiene cuatro pasos:
- preparar un archivo donde cada línea es una solicitud, generalmente en un formato estructurado con una identificación personalizada para que pueda hacer coincidir los resultados con las entradas.
- Enviar el lote y recibir una identificación de trabajo.
- Encuesta de estado mientras el proveedor trabaja en la cola, a menudo con un objetivo de finalización establecido, como dentro de las 24 horas.
- Recuperar el archivo de salida una vez completado, luego asigne cada resultado a su solicitud utilizando las ID.
La lógica de su aplicación apenas cambia, se utilizan las mismas indicaciones y los mismos modelos. Lo que cambia es que no estás bloqueando cada respuesta.
¿Qué trabajos se ajustan al modelo por lotes?
Batch es ideal siempre que un humano no esté esperando la respuesta:
- Clasificación o etiquetado masivo de grandes conjuntos de datos.
- Generación de contenido para catálogos, descripciones de productos o resúmenes elaborados con antelación.
- Extracción de datos de grandes colecciones de documentos.
- Evaluaciones y backtesting donde ejecuta un mensaje en miles de casos de prueba.
- Incrustaciones generación para todo un corpus a la vez.
No encaja bien con nada interactivo: chatbots, búsqueda en vivo o cualquier función en la que un usuario esté mirando un control giratorio de carga.
La economía de la espera
Es fácil razonar sobre el ahorro. Si un trabajo costaría $200 a la tarifa estándar y el descuento por lote es del 50%, en su lugar costaría $100, para una producción idéntica. En grandes cargas de trabajo recurrentes, esa diferencia se agrava mes tras mes.
Aquí hay un ejemplo resuelto con tasas ilustrativas, para que las matemáticas sigan siendo concretas. Clasificar 1 millón de documentos cortos con 500 tokens de entrada y 20 tokens de salida cada uno son 500 millones de tokens de entrada y 20 millones de tokens de salida en total. A una tasa ilustrativa de $0,15 por 1 millón de tokens de entrada y $0,60 por 1 millón de tokens de salida, el precio sincrónico es de aproximadamente $75 + $12 = $87 para todo el trabajo. El mismo trabajo a través del punto final por lotes a mitad de precio lo reduce a aproximadamente $43,50: un ahorro de $43,50 en una sola ejecución, incluso antes de contar la ejecución del siguiente mes. La calculadora de costos de LLM le permite ingresar su propio volumen y recuento de tokens, luego reducir a la mitad el total para obtener una vista previa del escenario por lotes frente al escenario en tiempo real utilizando las tarifas actuales del proveedor.
Cosas a tener en cuenta
Algunas advertencias prácticas. Los tiempos de finalización son objetivos, no garantías, así que cree su canalización para tolerar retrasos variables. Los lotes muy grandes pueden estar sujetos a límites de tamaño o velocidad, por lo que es posible que deba dividir trabajos enormes en partes. Y aún paga por los tokens de entrada y salida, el descuento se aplica a la tarifa, no al recuento de tokens, por lo que la eficiencia inmediata sigue siendo importante.
Las solicitudes fallidas dentro de un lote normalmente no se facturan. Si una línea de su archivo de entrada tiene un formato incorrecto o una sola solicitud genera errores, los proveedores generalmente cobran solo por las solicitudes que realmente se completaron, no por las que fallaron. Eso significa que un puñado de filas incorrectas no arruinarán el descuento en el resto del trabajo, pero también significa que su archivo de salida debe compararse con sus ID de entrada para ver qué solicitudes debe volver a enviar.
Finalmente, verifique los detalles de cada proveedor en las páginas /models, ya que el descuento exacto, el objetivo de respuesta y las características admitidas (como si el almacenamiento en caché o las herramientas funcionan dentro del lote) difieren entre proveedores.
Continuar aprendiendo
Herramientas relacionadas
Preguntas frecuentes
¿Es la API por lotes un modelo más débil?
No. Obtienes el mismo modelo y la misma calidad de resultado que la API en tiempo real. La única diferencia es que los resultados llegan más tarde, por eso el precio es más bajo.
¿Cuánto tiempo lleva un trabajo por lotes?
Los proveedores suelen dar un objetivo de finalización, por ejemplo, en 24 horas, y muchos trabajos finalizan mucho más rápido cuando hay capacidad disponible. No es instantáneo, así que úselo sólo cuando nadie esté esperando la respuesta.
¿Cuánto ahorran normalmente las API por lotes?
Alrededor del 50% de descuento sobre la tarifa estándar por token es común entre los principales proveedores, y se aplica tanto a los tokens de entrada como a los de salida. Confirme siempre el descuento actual para su proveedor y modelo específicos.
¿Pago por las solicitudes que fallan dentro de un lote?
Generalmente no. Por lo general, los proveedores solo facturan por las solicitudes de un lote que realmente se completó con éxito, por lo que un mensaje con formato incorrecto o un error ocasional no le costará el descuento en el resto del trabajo. Aún debe comparar el archivo de salida con los ID enviados para ver qué solicitudes fallaron y volver a enviarlas.
Sólo educación, no asesoramiento financiero.