Cómo funcionan los precios de la API de LLM

Tokens, entrada versus salida, ventanas de contexto: por qué la misma tarea puede costar 50 veces más en un modelo que en otro, explicado de forma sencilla.

HogarAprender › ¿Qué es una ficha? (Y por qué le facturan)

¿Qué es una ficha? (Y por qué le facturan)

Cada vez que llama a un modelo de IA, no se le factura por palabra, carácter o solicitud. Se le factura por token. Comprender qué es realmente un token es lo más útil que puede aprender antes de intentar controlar los costos de su API.

Un token es un fragmento de texto, no una palabra.

Un token es la unidad que lee y escribe un modelo de lenguaje. Suele ser un fragmento de una palabra más que una palabra completa. Palabras cortas comunes como the o and son una sola ficha, pero las palabras más largas o más raras se dividen en varias partes. Por ejemplo, la palabra tokenization podría ser forzado token + ization, dos fichas.

Una regla aproximada ampliamente utilizada para el inglés es que 1 token tiene aproximadamente 4 caracteres, o aproximadamente 0,75 palabras. Eso significa que 1000 tokens equivalen a alrededor de 750 palabras, y una sola página de texto (alrededor de 500 palabras) equivale aproximadamente a 650-700 tokens. Estas son aproximaciones, no garantías, porque la división exacta depende del tokenizador del modelo.

Los espacios, la puntuación y los saltos de línea también cuentan. Incluso la estructura invisible de su mensaje consume tokens.

Por qué los modelos usan tokens en lugar de palabras

Los modelos de lenguaje no entienden letras ni palabras directamente. Convierten texto en números y el token es el puente. Cada ficha se asigna a una entrada en el vocabulario del modelo, y el modelo hace todos sus cálculos en esas piezas numeradas.

Este diseño permite que un modelo maneje cualquier idioma, código, emoji o palabra inventada sin un diccionario fijo de palabras completas. Un término técnico poco común que el modelo nunca ha visto en su conjunto aún puede representarse como una secuencia de subpartes familiares. La desventaja es que los textos, códigos o idiomas inusuales que no son el inglés a menudo utilizan más tokens por palabra que la prosa en inglés simple.

Los tokens de entrada y los tokens de salida tienen precios diferentes

Casi todos los proveedores cobran dos tarifas distintas: una por fichas de entrada (todo lo que envía, incluido el aviso, las instrucciones del sistema y cualquier historial de conversación) y uno para fichas de salida (todo lo que el modelo genera). Los tokens de salida suelen ser varias veces más caros que los tokens de entrada.

Aquí hay un ejemplo ilustrativo para mostrar la mecánica (números inventados para mayor claridad, no precios reales): si la entrada cuesta $1 por millón de tokens y la salida cuesta $5 por millón de tokens, entonces una llamada que envía 2000 tokens de entrada y recibe 500 tokens de salida costaría (2000 / 1000000 x $1) + (500 / 1000000 x $5) = $0,002 + $0,0025 = $0,0045. Pequeño por llamada, pero multiplicado por cientos de miles de llamadas y es importante.

Para ver las tarifas reales por modelo una al lado de la otra, la comparación de modelos y las páginas /modelos enumeran los precios actuales de entrada y salida para cada proveedor, para que no tenga que adivinar.

El historial de conversaciones se factura en cada turno

La sorpresa de facturación más común es que los modelos de chat no tienen estado. El modelo no recuerda tus mensajes anteriores entre llamadas. Para mantener el contexto, su aplicación reenvía todo el historial de conversaciones con cada nuevo turno.

Eso significa que una conversación larga se vuelve más costosa con cada mensaje, porque la transcripción en crecimiento se reenvía como tokens de entrada cada vez. Una conversación de 20 mensajes puede enviar silenciosamente decenas de miles de tokens de entrada en su último turno. Si sus costos aumentan durante las sesiones largas, este suele ser el motivo. El almacenamiento en caché rápido (tratado en su propia guía) es una forma de mitigar esto.

Cómo estimar su factura antes de construir

Puede obtener una estimación viable con tres números: tokens de entrada promedio por llamada, tokens de salida promedio por llamada y cuántas llamadas espera por día o mes. Multiplique el recuento de cada token por su tasa por token y súmelos.

  • Estimar el recuento de tokens tomando una muestra realista de indicación y respuesta, luego dividiendo el recuento de caracteres por 4, o use una herramienta tokenizadora para mayor precisión.
  • Multiplicar por volumen para obtener una cifra diaria o mensual.
  • Agregar un búfer del 20-30% para reintentos, resultados más largos de lo esperado y un historial de chat en crecimiento.

La calculadora de costos de LLM hace estos cálculos por usted: ingrese el recuento de tokens y el volumen de llamadas, elija un modelo y le devolverá un costo mensual estimado para que pueda comparar opciones antes de escribir cualquier código.

Formas prácticas de utilizar menos tokens

Una vez que piensas en tokens, los ahorros se vuelven obvios. Recorte las indicaciones del sistema que repiten las mismas instrucciones palabra por palabra en cada llamada. Resuma los viejos giros de conversación en lugar de reenviarlos completos. Solicite resultados concisos cuando no necesite respuestas largas, ya que los tokens de resultados son los que más cuestan.

Elegir un modelo más pequeño para tareas simples es a menudo la mayor palanca de todas, porque la diferencia de precio por token entre un modelo insignia y un modelo liviano puede ser 10 veces o más. Haga coincidir el modelo con la dificultad del trabajo en lugar de optar por el más potente.

Preguntas frecuentes

¿Cuántas fichas tiene una oración típica?

Una frase corta en inglés de 15 a 20 palabras suele costar entre 20 y 30 fichas. Como regla general, espere aproximadamente 0,75 palabras por token, por lo que el recuento de tokens es un poco mayor que el de palabras.

¿Pago por tokens en la respuesta del modelo?

Sí. Los tokens de salida se facturan por separado de los tokens de entrada y suelen ser los más caros de los dos, por lo que las respuestas más largas cuestan notablemente más.

¿Por qué los textos que no están en inglés cuestan más?

La mayoría de los tokenizadores están optimizados para el inglés, por lo que otros idiomas y códigos a menudo se dividen en más tokens por palabra. El mismo significado puede costar entre 1,5 y 2 veces más tokens en algunos idiomas.

Sólo educación, no asesoramiento financiero.