Tokens vs solicitudes explicados

Qué es realmente un token, en qué se diferencia de una solicitud de API y cómo estimar ambos antes de compilar.

HogarAprender › Explicación de tokens y solicitudes

Una solicitud y un token no son lo mismo

Un Solicitud de API es una llamada al punto final. Fichas son las unidades de texto dentro de esa llamada. Una solicitud puede contener un puñado de tokens o cientos de miles. Los proveedores de LLM facturan por tokens; muchas otras API (pagos, mapas, SMS) facturan por solicitud o por acción. Mezclar ambos es el error presupuestario más común.

Dónde se aplica cada modelo

tipo de APIFacturado por
LLM / AI (OpenAI, Antrópico, etc.)Fichas (entrada + salida)
IncrustacionesFichas (solo entrada)
Generación de imágenesPor imagen / por paso
Mapas, búsqueda, SMS, pagosPor solicitud / por acción
Cuesta toda tu pila de API →

Cómo estimar antes de construir

Para una función LLM, calcule: tokens por llamada × llamadas por usuario × usuarios. Una respuesta de chat puede ser ~500 tokens de entrada + ~300 tokens de salida; multiplique por las conversaciones mensuales para obtener el volumen de tokens y luego póngale precio. Esto es mucho más preciso que adivinar "por solicitud", porque el recuento de tokens por solicitud varía enormemente. Mantenga la entrada y la salida separadas en todo momento: los proveedores les ponen precios diferentes, a menudo con una diferencia de 3 a 5 veces, por lo que una estimación combinada del "token promedio" puede estar equivocada por un amplio margen.

Costo del token →Costo de la ventana de contexto →

La misma división vuelve a aparecer en los límites de tarifas

La mayoría de los proveedores de LLM limitan el uso en ambos ejes a la vez: un límite de solicitudes por minuto (RPM) y un límite de tokens por minuto (TPM). Cuál aciertes primero depende completamente de cuántos tokens lleve tu llamada promedio: el número exacto del que trata esta página.

Saber qué límite alcanzará cambia la solución: una carga de trabajo vinculada a RPM se beneficia de batching varias llamadas pequeñas en una solicitud más grande (menos solicitudes, el mismo total de tokens), mientras que una carga de trabajo vinculada a TPM se beneficia de guarnición contexto o longitud de salida en lugar de reducir la frecuencia de las llamadas. Ver Límites de tasa API explicados para los niveles concretos de RPM/TPM por proveedor.

Ejemplo resuelto: dimensionar una función de chatbot

Supongamos que está planeando un chatbot de soporte para 5.000 usuarios activos mensuales, cada uno promediando 2 sesiones/mes de 3 vueltas una pieza. Cada giro lleva aproximadamente 900 fichas de entrada (mensaje del sistema + historial de conversaciones recientes + mensaje del usuario) y 250 fichas de salida.

Ejecute los totales de entrada y salida a través de una calculadora de costo de tokens por separado para su modelo elegido; debido a que la producción tiene un precio más alto, los 10 millones de tokens de salida pueden costar tanto como los 24,5 millones de tokens de entrada, aunque sea un tercio del volumen.

Calculadora de costos de chatbot →

Errores comunes que arruinan una estimación

Continuar aprendiendo

Cómo funcionan los precios de LLM API →Límites de tasa API →Glosario de costos de IA y API →

Preguntas frecuentes

¿Cuál es la diferencia entre un token y una solicitud de API?

Una solicitud de API es una única llamada al punto final; los tokens son las unidades de texto que contiene. Una solicitud puede contener muy pocos o cientos de miles de tokens. Los LLM facturan por token, mientras que muchas otras API facturan por solicitud.

¿Cuántos tokens tiene un mensaje típico de chatbot?

Un mensaje breve de usuario más un mensaje del sistema suele consistir en unos pocos cientos de tokens de entrada y una respuesta, en unos pocos cientos de tokens de salida: aproximadamente entre 500 y 1000 tokens por intercambio, aunque varía según la longitud del mensaje y la verbosidad de la respuesta.

¿Cómo calculo mi uso mensual de tokens?

Multiplique tokens por llamada por llamadas por usuario por número de usuarios. Calcule los tokens de entrada y salida por separado, ya que tienen precios diferentes, luego ejecute el total a través de una calculadora de costo de tokens para el modelo elegido.

¿Un token cuesta lo mismo ya sea de entrada o de salida?

No: los tokens de salida suelen tener un precio más alto que los tokens de entrada para el mismo modelo, a menudo entre 3 y 5 veces más. Mantener separados los totales de insumos y productos, en lugar de combinarlos en un solo promedio, proporciona una estimación de costos mucho más precisa.

¿Qué más debería presupuestar además de los tokens del modelo principal?

En una canalización de agentes o RAG, el presupuesto para solicitudes de incorporación, consultas de bases de datos vectoriales y cualquier llamada de modelo de enrutamiento o clasificación más pequeña se factura por separado de los tokens del modelo principal y se puede sumar en una función de gran volumen.

¿Los límites de tarifas cuentan las solicitudes o los tokens?

Por lo general, ambos a la vez: los proveedores establecen un límite de solicitudes por minuto (RPM) y un límite de tokens por minuto (TPM) separados, y usted alcanza el que su patrón de tráfico sature primero. Las llamadas cortas de alta frecuencia tienden a alcanzar primero las RPM; Las llamadas de baja frecuencia y de contexto largo tienden a llegar primero al TPM.

Sólo referencia educativa: los precios son estimaciones; Confirme las tarifas actuales en la página de precios de cada proveedor.

Tools & Hosting

📈 TradingView🔒 NordVPN💳 RevolutDigitalOcean $200Hostinger