La API Batch es el 50% más fácil que la mayoría de los equipos dejan sobre la mesa. Envías un archivo de solicitudes, los resultados aparecen dentro de una ventana (hasta 24 horas) y pagas aproximadamente la mitad del precio por token. Nada cambia en el modelo (la misma calidad, las mismas fichas, la mitad de la factura) mientras el trabajo pueda esperar.
Costo del lote por modelo
Misma carga de trabajo, precio del lote, clasificado como el más barato en primer lugar.
| Modelo | Estándar / mes | Lote/mes |
|---|
¿Qué lote es y qué no es?
La API por lotes se comercializa latencia por precio. Le entrega al proveedor un archivo de solicitudes; los procesa dentro de una ventana (a menudo hasta 24 horas) y devuelve un archivo de resultados, aproximadamente medio la tasa estándar por token tanto en entrada como en salida. El modelo, el mensaje y el resultado son idénticos: sólo te estás dando por vencido "ahora mismo". Por lo tanto, es perfecto para el trabajo por el que nadie mira fijamente una ruleta e inútil para cualquier cosa interactiva.
Qué mover al lote
Buenos candidatos: todas las noches resumen, a granel clasificación o etiquetado, incrustaciones rellenos, conjunto de datos etiquetado, fuera de línea evaluacionesy cualquier informe generado según una programación. Manténgase en la API en tiempo real: chat en vivo, cualquier cosa que un usuario espere y llamadas a herramientas sensibles a la latencia. Un patrón común es ejecutar el mismo proceso en ambos sentidos (en tiempo real para la ruta interactiva, por lotes para el reprocesamiento nocturno) y el lote silenciosamente reduce a la mitad esa parte de la factura. Apilarlo con almacenamiento en caché rápido sobre el contexto repetido y el compuesto de ahorro.
¿Estimar un producto completo en su lugar? Utilice el Estimador de costos de aplicaciones de IA o el calculadora de ahorro de almacenamiento en caché rápida. ¿Agentes de construcción? El Calculadora de costos de agentes de IA.