Cómo funcionan los precios de la API de LLM

Tokens, entrada versus salida, ventanas de contexto: por qué la misma tarea puede costar 50 veces más en un modelo que en otro, explicado de forma sencilla.

HogarAprender › Cómo funcionan los precios de LLM API

Todo tiene un precio por token.

Los proveedores de LLM no cobran por solicitud ni por palabra: cobran por simbólico. Un token es un fragmento de texto, aproximadamente ¾ de una palabra en inglés (aproximadamente 4 caracteres). "APICostCalc es útil" es ~5 tokens. Tanto el texto que envías (aporte) y el texto que genera el modelo (producción) se cuentan y generalmente se les asigna un precio diferentemente.

Calculadora de costo de token →

Entrada versus salida: la salida es la más cara

En casi todos los modelos, los tokens de salida cuestan más que los tokens de entrada (a menudo entre 3 y 5 veces más) porque generar texto requiere más procesamiento que leerlo. Es por eso que un chatbot que escribe respuestas largas cuesta mucho más que uno que clasifica el texto en una sola palabra, incluso con el mismo volumen de solicitudes.

Impulsor de costosEfecto en la factura
Un aviso largo del sistema envió cada llamadaLos tokens de entrada se multiplican por el recuento de solicitudes
Respuestas detalladas del modeloTokens de salida: el tipo más caro
Contexto amplio (fragmentos de RAG, historia)Los tokens de entrada aumentan rápidamente
Modelos de razonamiento / "pensamiento"Tokens de razonamiento ocultos facturados como resultado

La ventana de contexto es un límite de costos, no un espacio libre

un modelo ventana contextual (por ejemplo, 128 000 o 1 millón de tokens) es el máximo que puede leer a la vez, pero cada token que ingresa se factura en cada llamar. Poner un documento completo en contexto para cada solicitud es conveniente y costoso; ese es el problema que resuelven RAG y el almacenamiento en caché.

Costo de la ventana de contexto →Costo del token de razonamiento →

Por qué la misma tarea varía 50 veces entre modelos

Los modelos Frontier pueden costar decenas de dólares por millón de tokens; Los modelos pequeños o abiertos cuestan unos céntimos. Si un modelo económico realiza la tarea con una calidad aceptable, puede reducir el costo en un orden de magnitud con una línea de configuración. La habilidad consiste en hacer coincidir la fuerza del modelo con la dificultad de la tarea; consulte la guía de reducción de costos.

Comparar precios de modelos →

Preguntas frecuentes

¿Qué es un token en una API LLM?

Un token es una pequeña porción de texto que procesa el modelo; en inglés, aproximadamente ¾ de una palabra o aproximadamente 4 caracteres. Los proveedores facturan por token tanto por el texto que envía (entrada) como por el texto que genera el modelo (salida).

¿Por qué los tokens de salida cuestan más que los tokens de entrada?

Generar texto requiere más cálculo que leerlo, por lo que los proveedores valoran los tokens de salida más alto, comúnmente entre 3 y 5 veces la tasa de entrada. Esto hace que las respuestas detalladas del modelo sean un importante generador de costos.

¿Cuesta más una ventana de contexto más grande?

Sólo para los tokens que realmente utilices. La ventana tiene una capacidad máxima, pero cada token que coloca en contexto se factura en cada llamada, por lo que enviar mensajes grandes repetidamente se vuelve costoso rápidamente.

¿Cómo puede la misma tarea costar 50 veces más en un modelo?

Los precios de los modelos por millón de tokens varían enormemente entre los modelos fronterizos y pequeños/abiertos. Si un modelo más económico cumple con su estándar de calidad para una tarea determinada, cambiarlo puede reducir los costos en un orden de magnitud.

Sólo referencia educativa: los precios son estimaciones; Confirme las tarifas actuales en la página de precios de cada proveedor.