Todo tiene un precio por token.
Los proveedores de LLM no cobran por solicitud ni por palabra: cobran por simbólico. Un token es un fragmento de texto, aproximadamente ¾ de una palabra en inglés (aproximadamente 4 caracteres). "APICostCalc es útil" es ~5 tokens. Tanto el texto que envías (aporte) y el texto que genera el modelo (producción) se cuentan y generalmente se les asigna un precio diferentemente.
Calculadora de costo de token →Entrada versus salida: la salida es la más cara
En casi todos los modelos, los tokens de salida cuestan más que los tokens de entrada (a menudo entre 3 y 5 veces más) porque generar texto requiere más procesamiento que leerlo. Es por eso que un chatbot que escribe respuestas largas cuesta mucho más que uno que clasifica el texto en una sola palabra, incluso con el mismo volumen de solicitudes.
| Impulsor de costos | Efecto en la factura |
|---|---|
| Un aviso largo del sistema envió cada llamada | Los tokens de entrada se multiplican por el recuento de solicitudes |
| Respuestas detalladas del modelo | Tokens de salida: el tipo más caro |
| Contexto amplio (fragmentos de RAG, historia) | Los tokens de entrada aumentan rápidamente |
| Modelos de razonamiento / "pensamiento" | Tokens de razonamiento ocultos facturados como resultado |
La ventana de contexto es un límite de costos, no un espacio libre
un modelo ventana contextual (por ejemplo, 128 000 o 1 millón de tokens) es el máximo que puede leer a la vez, pero cada token que ingresa se factura en cada llamar. Poner un documento completo en contexto para cada solicitud es conveniente y costoso; ese es el problema que resuelven RAG y el almacenamiento en caché.
Costo de la ventana de contexto →Costo del token de razonamiento →Por qué la misma tarea varía 50 veces entre modelos
Los modelos Frontier pueden costar decenas de dólares por millón de tokens; Los modelos pequeños o abiertos cuestan unos céntimos. Si un modelo económico realiza la tarea con una calidad aceptable, puede reducir el costo en un orden de magnitud con una línea de configuración. La habilidad consiste en hacer coincidir la fuerza del modelo con la dificultad de la tarea; consulte la guía de reducción de costos.
Comparar precios de modelos →Preguntas frecuentes
¿Qué es un token en una API LLM?
Un token es una pequeña porción de texto que procesa el modelo; en inglés, aproximadamente ¾ de una palabra o aproximadamente 4 caracteres. Los proveedores facturan por token tanto por el texto que envía (entrada) como por el texto que genera el modelo (salida).
¿Por qué los tokens de salida cuestan más que los tokens de entrada?
Generar texto requiere más cálculo que leerlo, por lo que los proveedores valoran los tokens de salida más alto, comúnmente entre 3 y 5 veces la tasa de entrada. Esto hace que las respuestas detalladas del modelo sean un importante generador de costos.
¿Cuesta más una ventana de contexto más grande?
Sólo para los tokens que realmente utilices. La ventana tiene una capacidad máxima, pero cada token que coloca en contexto se factura en cada llamada, por lo que enviar mensajes grandes repetidamente se vuelve costoso rápidamente.
¿Cómo puede la misma tarea costar 50 veces más en un modelo?
Los precios de los modelos por millón de tokens varían enormemente entre los modelos fronterizos y pequeños/abiertos. Si un modelo más económico cumple con su estándar de calidad para una tarea determinada, cambiarlo puede reducir los costos en un orden de magnitud.
Sólo referencia educativa: los precios son estimaciones; Confirme las tarifas actuales en la página de precios de cada proveedor.