Todo tiene un precio por token.
Los proveedores de LLM no cobran por solicitud ni por palabra: cobran por simbólico. Un token es un fragmento de texto, aproximadamente ¾ de una palabra en inglés (aproximadamente 4 caracteres). "APICostCalc es útil" es ~5 tokens. Tanto el texto que envías (aporte) y el texto que genera el modelo (producción) se cuentan y generalmente se les asigna un precio diferentemente.
Calculadora de costo de token →Entrada versus salida: la salida es la más cara
En casi todos los modelos, los tokens de salida cuestan más que los tokens de entrada (a menudo entre 3 y 5 veces más) porque generar texto requiere más procesamiento que leerlo. Es por eso que un chatbot que escribe respuestas largas cuesta mucho más que uno que clasifica el texto en una sola palabra, incluso con el mismo volumen de solicitudes.
| Impulsor de costos | Efecto en la factura |
|---|---|
| Un aviso largo del sistema envió cada llamada | Los tokens de entrada se multiplican por el recuento de solicitudes |
| Respuestas detalladas del modelo | Tokens de salida: el tipo más caro |
| Contexto amplio (fragmentos de RAG, historia) | Los tokens de entrada aumentan rápidamente |
| Modelos de razonamiento / "pensamiento" | Tokens de razonamiento ocultos facturados como resultado |
La ventana de contexto es un límite de costos, no un espacio libre
un modelo ventana contextual (por ejemplo, 128 000 o 1 millón de tokens) es el máximo que puede leer a la vez, pero cada token que ingresa se factura en cada llamar. Poner un documento completo en contexto para cada solicitud es conveniente y costoso; ese es el problema que resuelven RAG y el almacenamiento en caché.
Costo de la ventana de contexto →Costo del token de razonamiento →Por qué la misma tarea varía 50 veces entre modelos
Los modelos Frontier pueden costar decenas de dólares por millón de tokens; Los modelos pequeños o abiertos cuestan unos céntimos. Si un modelo económico realiza la tarea con una calidad aceptable, puede reducir el costo en un orden de magnitud con una línea de configuración. La habilidad consiste en hacer coincidir la fuerza del modelo con la dificultad de la tarea; consulte la guía de reducción de costos.
Comparar precios de modelos →Ejemplo resuelto: nano vs buque insignia en la misma tarea
Di que estás clasificando 100.000 tickets de soporte al mes. Cada llamada envía ~2000 tokens de entrada (texto del ticket + un mensaje de algunas tomas) y devuelve ~500 tokens de salida (etiqueta + breve explicación): 200 millones de tokens de entrada y 50 millones de tokens de salida en total.
| Modelo | Costo de insumos | Costo de producción | Total/mes |
|---|---|---|---|
| GPT-5 nano ($0,10 / $0,40 por 1 millón) | 200 millones × $0,10 = $20 | 50 millones × $0,40 = $20 | $40 |
| GPT-5.5 ($5.00 / $30.00 por 1M) | 200 millones × $5,00 = $1000 | 50 millones × $30,00 = $1500 | $2,500 |
Misma tarea, mismo volumen: el modelo estrella cuesta 62 veces más que el modelo nano, puramente a partir del precio por token. Para una tarea limitada como la clasificación, probar si la precisión de un modelo barato supera su listón suele valer más que cualquier otra optimización de costos.
Calculadora de costos GPT-5 →Errores comunes al estimar los costos de LLM
- Promediar la entrada y la salida en un recuento de tokens. Dado que la producción tiene un precio entre 3 y 5 veces mayor, combinarlos oculta cuánto cuesta realmente un estilo de respuesta detallado.
- Olvidar el aviso del sistema se factura en cada llamada. Un mensaje del sistema largo o un historial de conversación cuentan como tokens de entrada en cada solicitud, no una vez por sesión.
- Evaluación comparativa contra la publicación de puntos incorrectos. Los precios de "GPT-5" y "GPT-5.5" pueden variar varias veces; siempre verifique la identificación exacta del modelo al que realmente llamará, no el apellido.
- Ignorar fichas de razonamiento ocultas. Los modelos "pensantes" consideran el razonamiento interno como tokens de salida aunque nunca aparezca en la respuesta visible; consulte el calculadora de tokens de razonamiento.
Preguntas frecuentes
¿Qué es un token en una API LLM?
Un token es una pequeña porción de texto que procesa el modelo; en inglés, aproximadamente ¾ de una palabra o aproximadamente 4 caracteres. Los proveedores facturan por token tanto por el texto que envía (entrada) como por el texto que genera el modelo (salida).
¿Por qué los tokens de salida cuestan más que los tokens de entrada?
Generar texto requiere más cálculo que leerlo, por lo que los proveedores valoran los tokens de salida más alto, comúnmente entre 3 y 5 veces la tasa de entrada. Esto hace que las respuestas detalladas del modelo sean un importante generador de costos.
¿Cuesta más una ventana de contexto más grande?
Sólo para los tokens que realmente utilices. La ventana tiene una capacidad máxima, pero cada token que coloca en contexto se factura en cada llamada, por lo que enviar mensajes grandes repetidamente se vuelve costoso rápidamente.
¿Cómo puede la misma tarea costar 50 veces más en un modelo?
Los precios de los modelos por millón de tokens varían enormemente entre los modelos fronterizos y pequeños/abiertos. Si un modelo más económico cumple con su estándar de calidad para una tarea determinada, cambiarlo puede reducir los costos en un orden de magnitud.
Sólo referencia educativa: los precios son estimaciones; Confirme las tarifas actuales en la página de precios de cada proveedor.