Una solicitud y un token no son lo mismo
Un Solicitud de API es una llamada al punto final. Fichas son las unidades de texto dentro de esa llamada. Una solicitud puede contener un puñado de tokens o cientos de miles. Los proveedores de LLM facturan por tokens; muchas otras API (pagos, mapas, SMS) facturan por solicitud o por acción. Mezclar ambos es el error presupuestario más común.
Dónde se aplica cada modelo
| tipo de API | Facturado por |
|---|---|
| LLM / AI (OpenAI, Antrópico, etc.) | Fichas (entrada + salida) |
| Incrustaciones | Fichas (solo entrada) |
| Generación de imágenes | Por imagen / por paso |
| Mapas, búsqueda, SMS, pagos | Por solicitud / por acción |
Cómo estimar antes de construir
Para una función LLM, calcule: tokens por llamada × llamadas por usuario × usuarios. Una respuesta de chat puede ser ~500 tokens de entrada + ~300 tokens de salida; multiplique por las conversaciones mensuales para obtener el volumen de tokens y luego póngale precio. Esto es mucho más preciso que adivinar "por solicitud", porque el recuento de tokens por solicitud varía enormemente. Mantenga la entrada y la salida separadas en todo momento: los proveedores les ponen precios diferentes, a menudo con una diferencia de 3 a 5 veces, por lo que una estimación combinada del "token promedio" puede estar equivocada por un amplio margen.
Costo del token →Costo de la ventana de contexto →La misma división vuelve a aparecer en los límites de tarifas
La mayoría de los proveedores de LLM limitan el uso en ambos ejes a la vez: un límite de solicitudes por minuto (RPM) y un límite de tokens por minuto (TPM). Cuál aciertes primero depende completamente de cuántos tokens lleve tu llamada promedio: el número exacto del que trata esta página.
- Llamadas cortas, alta frecuencia. (por ejemplo, un clasificador que se activa con cada pulsación de tecla) tienden a dar en el blanco RPM límite primero: cada llamada es barata en tokens, pero hay muchas.
- Llamadas largas, menor frecuencia (por ejemplo, un punto final de resumen de documentos con un contexto de 20k token) tienden a alcanzar el TPM límite primero: un puñado de llamadas ya pueden saturar el presupuesto simbólico.
Saber qué límite alcanzará cambia la solución: una carga de trabajo vinculada a RPM se beneficia de batching varias llamadas pequeñas en una solicitud más grande (menos solicitudes, el mismo total de tokens), mientras que una carga de trabajo vinculada a TPM se beneficia de guarnición contexto o longitud de salida en lugar de reducir la frecuencia de las llamadas. Ver Límites de tasa API explicados para los niveles concretos de RPM/TPM por proveedor.
Ejemplo resuelto: dimensionar una función de chatbot
Supongamos que está planeando un chatbot de soporte para 5.000 usuarios activos mensuales, cada uno promediando 2 sesiones/mes de 3 vueltas una pieza. Cada giro lleva aproximadamente 900 fichas de entrada (mensaje del sistema + historial de conversaciones recientes + mensaje del usuario) y 250 fichas de salida.
- Fichas por turno: 900 + 250 = 1,150
- Turnos por usuario/mes: 3 × 2 = 6
- Tokens por usuario/mes: 1,150 × 6 = 6,900 (≈4.900 entradas / 1.500 salidas)
- Total de tokens mensuales: 6,900 × 5,000 = 34,5 millones (≈24,5 M de entrada/~10 M de salida)
Ejecute los totales de entrada y salida a través de una calculadora de costo de tokens por separado para su modelo elegido; debido a que la producción tiene un precio más alto, los 10 millones de tokens de salida pueden costar tanto como los 24,5 millones de tokens de entrada, aunque sea un tercio del volumen.
Calculadora de costos de chatbot →Errores comunes que arruinan una estimación
- Combinar insumos y productos en un solo precio. Los tokens de salida suelen costar entre 3 y 5 veces la tasa de entrada; estimar ambos al precio de entrada subestima la factura.
- Olvidar la historia resentida. El chat de varios turnos que reenvía mensajes anteriores en cada llamada significa que el recuento de tokens por turno crece a lo largo de una sesión, no solo por mensaje.
- Estimación por caracteres, no por tokens. El recuento de tokens por carácter varía según el idioma y el contenido: el código, JSON y el texto que no está en inglés suelen utilizar más tokens por carácter que el inglés simple.
- Ignorando los reintentos. Una llamada fallida que se vuelve a intentar consume cuota de solicitudes y, a menudo, también tokens, por lo que las integraciones propensas a errores cuestan más de lo que sugieren las matemáticas del camino feliz.
- Saltándose el resto del oleoducto. Una característica RAG o de agente generalmente agrega solicitudes de incorporación, llamadas de búsqueda vectorial y, a veces, un modelo de enrutamiento más pequeño, cada uno de los cuales se factura por separado, por separado de los tokens del modelo principal.
Continuar aprendiendo
Cómo funcionan los precios de LLM API →Límites de tasa API →Glosario de costos de IA y API →Preguntas frecuentes
¿Cuál es la diferencia entre un token y una solicitud de API?
Una solicitud de API es una única llamada al punto final; los tokens son las unidades de texto que contiene. Una solicitud puede contener muy pocos o cientos de miles de tokens. Los LLM facturan por token, mientras que muchas otras API facturan por solicitud.
¿Cuántos tokens tiene un mensaje típico de chatbot?
Un mensaje breve de usuario más un mensaje del sistema suele consistir en unos pocos cientos de tokens de entrada y una respuesta, en unos pocos cientos de tokens de salida: aproximadamente entre 500 y 1000 tokens por intercambio, aunque varía según la longitud del mensaje y la verbosidad de la respuesta.
¿Cómo calculo mi uso mensual de tokens?
Multiplique tokens por llamada por llamadas por usuario por número de usuarios. Calcule los tokens de entrada y salida por separado, ya que tienen precios diferentes, luego ejecute el total a través de una calculadora de costo de tokens para el modelo elegido.
¿Un token cuesta lo mismo ya sea de entrada o de salida?
No: los tokens de salida suelen tener un precio más alto que los tokens de entrada para el mismo modelo, a menudo entre 3 y 5 veces más. Mantener separados los totales de insumos y productos, en lugar de combinarlos en un solo promedio, proporciona una estimación de costos mucho más precisa.
¿Qué más debería presupuestar además de los tokens del modelo principal?
En una canalización de agentes o RAG, el presupuesto para solicitudes de incorporación, consultas de bases de datos vectoriales y cualquier llamada de modelo de enrutamiento o clasificación más pequeña se factura por separado de los tokens del modelo principal y se puede sumar en una función de gran volumen.
¿Los límites de tarifas cuentan las solicitudes o los tokens?
Por lo general, ambos a la vez: los proveedores establecen un límite de solicitudes por minuto (RPM) y un límite de tokens por minuto (TPM) separados, y usted alcanza el que su patrón de tráfico sature primero. Las llamadas cortas de alta frecuencia tienden a alcanzar primero las RPM; Las llamadas de baja frecuencia y de contexto largo tienden a llegar primero al TPM.
Sólo referencia educativa: los precios son estimaciones; Confirme las tarifas actuales en la página de precios de cada proveedor.