HomeBlog › Compensación de descuento de API por lotes

API por lotes: 50 % de descuento, mismo modelo, pero las 24 horas son un objetivo, no una garantía

Publicado 2026-08-07 · números de referencia, verificar antes de presupuestar

OpenAI, Anthropic y Gemini realizan el mismo oficio: enviar un trabajo en lugar de una solicitud, esperar hasta 24 horas y pagar aproximadamente la mitad. Mismo modelo, mismos pesos, misma calidad de salida: lo único que cambia es cuando aparece la respuesta. Los equipos tratan esto como una decisión de volumen, algo que se activa una vez que la carga de trabajo es lo suficientemente grande como para preocuparse. No lo es. Es una decisión de interacción y no tiene nada que ver con el tamaño.

El descuento es real y no es complicado.

Los tres proveedores principales realizan lotes de la misma manera: cargan un archivo de indicaciones, el trabajo se ejecuta de forma asincrónica dentro de un período de 24 horas y el precio por token es aproximadamente el 50% de la tasa sincrónica estándar. No es un modelo más pequeño o más tonto el que hace el trabajo: es el modelo idéntico, que genera el mismo resultado que habría generado en tiempo real. El ahorro proviene de la programación, no de tomar atajos: los proveedores mantienen la capacidad en tiempo real lista para los picos de tráfico, y ese margen de inactividad es costoso. Se puede ejecutar un trabajo por lotes siempre que exista capacidad adicional, por lo que el proveedor devuelve parte de esa eficiencia.

Las matemáticas no necesitan una calculadora para percibir su forma: un trabajo que cuesta $200 a la tarifa estándar cuesta $100 a través del punto final por lotes, para el mismo resultado. En una carga de trabajo que ejecuta una vez, es una buena línea de pedido. En una carga de trabajo que ejecuta todas las noches durante un año, es la diferencia entre una partida presupuestaria real y un error de redondeo.

Un ejemplo trabajado

Clasificar 1 millón de documentos cortos (500 tokens de entrada y 20 tokens de salida cada uno) frente a una tasa de referencia de $2,50/$10,00 por 1 millón de tokens (entrada/salida; precios de referencia ilustrativos, confirme la tasa real de su modelo antes de presupuestar):

CaminoCosto de insumosCosto de producciónTotal
Síncrono (tasa estándar)$1,250.00$200.00$1,450.00
Lote (~50 % de descuento)$625.00$100.00$725.00
Guardado$725.00 (50%)
1 millón de documentos × 500 tokens de entrada/20 de salida. Precios de referencia: ejecute su propia tarifa en el calculadora de ahorro de API por lotes.

$725 ahorrados en un pase de clasificación. Ejecute ese mismo trabajo todas las noches para una canalización de reindexación y el punto final del lote se amortizará solo en la primera semana, sin cambios en la calidad de la salida, porque nada de lo que produce el modelo es diferente.

El problema no es el precio, es el reloj.

La documentación por lotes de cada proveedor utiliza la misma palabra cuidadosa: objetivo. La ventana de 24 horas no es un SLA. Con frecuencia, los trabajos terminan más rápido (a veces en minutos), pero nada obliga a eso, y un oleoducto construido suponiendo una entrega rápida eventualmente permanecerá esperando durante horas sin ningún recurso. Los lotes muy grandes también pueden alcanzar límites de tamaño o velocidad, lo que significa que es posible que un trabajo realmente enorme deba dividirse en varios envíos en lugar de uno, agregando orquestación a una llamada sincrónica que nunca fue necesaria en primer lugar.

Nada de eso importa para un trabajo, nada está esperando. Es completamente importante para un trabajo por el cual una persona está mirando una ruleta. Esa es la línea divisoria real: no "¿esta carga de trabajo es lo suficientemente grande?", sino "¿hay algo bloqueado en esta respuesta en este momento?".

La regla de decisión que realmente funciona

Salta el umbral de volumen. Haga una pregunta: ¿hay un ser humano o un sistema descendente esperando sincrónicamente esta respuesta específica? Si no (un relleno de incrustaciones nocturno, una reclasificación masiva, una acumulación de documentos que nadie está viendo en tiempo real), el lote está cerca de un recorte gratuito del 50%, punto, tómelo. En caso afirmativo (una respuesta de un chatbot, un resultado de búsqueda en vivo, cualquier cosa que se muestre detrás de una rueda giratoria de carga), el lote no es un descuento al que pueda acceder, independientemente de cuánto volumen lo justificaría en papel. El tamaño del trabajo nunca entra en la decisión. Sólo si algo está esperando, lo hará.

Eso también significa que la misma aplicación puede usar ambas rutas a la vez: sincrónica para el chat en vivo que un usuario está mirando, por lotes para el trabajo nocturno que vuelve a incorporar todo lo que el chat tocó ese día. Ponle precio al lado sincrónico con el calculadora de ahorro de almacenamiento en caché rápida si se trata de una carga de trabajo de contexto repetido y el lado del lote con el calculadora de ahorro de API por lotes - están resolviendo diferentes mitades del mismo proyecto de ley. Para conocer la mecánica de lo que se considera un trabajo por lotes y qué proveedores admiten qué, consulte API por lotes explicada; para ver si su canalización realmente puede tolerar la espera, el calculadora de tiempo de procesamiento por lotes fija el precio directamente en el lado del cambio.

Metodología: el descuento por lotes de ~50 % y la ventana objetivo de 24 horas reflejan los términos de API por lotes publicados de OpenAI, Anthropic y Gemini a partir de agosto de 2026. El ejemplo trabajado utiliza una tasa de referencia redonda y claramente etiquetada ($2,50/$10,00 por 1 millón de tokens) en lugar del precio actual exacto de cualquier proveedor único; confirme las tasas sincrónicas y por lotes reales de su modelo antes de realizar el presupuesto. El ejemplo es un escenario construido destinado a mostrar cómo aumenta el descuento, no la telemetría de un sistema de producción.