Cómo funcionan los precios de la API de LLM

Tokens, entrada versus salida, ventanas de contexto: por qué la misma tarea puede costar 50 veces más en un modelo que en otro, explicado de forma sencilla.

HogarAprender › Ventanas de contexto y por qué las indicaciones largas se vuelven caras

Ventanas de contexto y por qué las indicaciones largas se vuelven caras

La ventana de contexto es la cantidad máxima de texto que un modelo puede considerar a la vez y es una de las partes más incomprendidas de los precios de la IA. Una ventana grande parece una función gratuita, pero cada token que coloques dentro se factura en cada llamada. Esta guía explica cómo funciona la ventana y por qué las indicaciones largas inflan silenciosamente su factura.

Qué es una ventana de contexto

La ventana de contexto es la memoria de trabajo del modelo para una única solicitud, medida en tokens. Tiene que contener todo lo que el modelo considera a la vez: el mensaje del sistema, cualquier documento o ejemplo que incluya, el historial de conversaciones, la pregunta actual y el espacio reservado para la respuesta del modelo. Juntos, deben encajar dentro del límite de tokens de la ventana.

Los modelos anuncian ventanas de distintos tamaños, desde unos pocos miles de tokens hasta cientos de miles o más. Una ventana más grande te permite introducir más a la vez, un libro completo, una base de código grande, pero no cambia la regla fundamental de facturación: pagas por lo que ingresas.

Pagas por toda la ventana que utilizas, en cada llamada

Aquí está la parte que sorprende a la gente. Tener una ventana de 200.000 tokens no significa que tengas que pagar por 200.000 tokens. significa tu poder use hasta esa cantidad y se le facturará la cantidad que realmente incluya en cada llamada.

Entonces, si colocas 150.000 tokens de documentos en la ventana y haces 10 preguntas, pagarás aproximadamente 150.000 tokens de entrada diez veces, 1,5 millones de tokens, no una vez. La ventana es un techo, no una suscripción. El contexto largo es poderoso, pero se factura implacablemente por llamada.

¿Por qué las indicaciones largas se vuelven caras rápidamente?

Debido a que los tokens de entrada se facturan por llamada, la duración del aviso se multiplica con el volumen de llamadas. Un mensaje que es 10 veces más largo cuesta aproximadamente 10 veces más en tokens de entrada para la misma cantidad de llamadas. Dos hábitos impulsan las indicaciones durante mucho tiempo sin que la gente se dé cuenta:

  • Historial de chat en crecimiento, se resienten en su totalidad en todo momento, por lo que los mensajes tardíos en una conversación larga llevan la transcripción completa.
  • Recuperación (RAG), donde se pegan documentos recuperados de gran tamaño en el mensaje para darle contexto al modelo. Recupere demasiado y cada consulta pagará por todo.

Ninguno de los dos está mal, pero ambos necesitan disciplina, porque el coste guarda silencio hasta que llega la factura.

Una ilustración trabajada

Ejemplo ilustrativo (tasa inventada de 3 dólares por millón de tokens de entrada). Supongamos que cada consulta incluye un contexto recuperado de 50.000 tokens. Una consulta cuesta 50.000 / 1.000.000 x $3 = $0,15 solo en entrada. Ejecute 100.000 consultas de este tipo al mes y eso equivale a 15.000 dólares solo para el contexto que está reenviando, antes de los costos de producción.

Ahora recorte el contexto recuperado a 10 000 tokens recuperándolo de forma más selectiva. Las mismas 100.000 consultas cuestan 3.000 dólares, una quinta parte, para un contexto que a menudo es igual de útil porque, de todos modos, el modelo se estaba ahogando en los 40.000 tokens adicionales. Es por eso que la disciplina del contexto es uno de los controles de costos de mayor apalancamiento que tiene.

El contexto prolongado también puede perjudicar la calidad

Más contexto no siempre significa mejores respuestas. Los modelos pueden perder la pista de los detalles enterrados en medio de una indicación muy larga, un patrón en el que la información al principio y al final se utiliza bien pero se descuida la mitad. Entonces, una ventana de contexto inflada puede costar más y producir peores resultados.

Alimentar al modelo sólo con el material más relevante a menudo mejora tanto la factura como la respuesta. La precisión supera al volumen: un contexto ajustado y bien elegido de 4.000 tokens con frecuencia supera a un volcado en expansión de 100.000 tokens.

Cómo mantener el contexto optimizado

Tácticas prácticas para controlar el costo del contexto:

  • Recuperar selectivamente. En RAG, devuelva solo los fragmentos más relevantes, no todo lo que coincida vagamente.
  • Resumir viejos giros. Reemplace una conversación pasada larga con un breve resumen en lugar de reenviar la transcripción completa.
  • Almacene en caché la parte fija. Si una gran parte del contexto se repite en las llamadas, el almacenamiento en caché de mensajes (consulte esa guía) puede reducir el costo de reenviarlo.
  • Tamaño correcto de la ventana. Elija un modelo cuya ventana se ajuste a sus necesidades reales en lugar de optar por la más grande disponible de forma predeterminada.

Para ver cómo la longitud del mensaje se relaciona con dinero real para cada modelo, coloque el recuento de tokens en la calculadora de costos de LLM y verifique los precios de ventana por modelo en las páginas de comparación de modelos y /modelos.

Preguntas frecuentes

¿Pago por la ventana de contexto completa del modelo?

No. Pagas solo por los tokens que realmente incluyes en cada solicitud, hasta el límite de la ventana. La ventana tiene una capacidad máxima y cada token que utilice dentro de ella se factura en cada llamada.

¿Una ventana de contexto más grande cuesta más por token?

No necesariamente por token, pero una ventana más grande lo tienta a incluir mucho más texto y, dado que cada token se factura por llamada, las indicaciones más grandes aumentan el total. Algunos proveedores también cobran tarifas más altas por encima de determinadas longitudes de contexto.

¿Más contexto siempre es mejor para la calidad?

No. Los modelos pueden pasar por alto detalles ocultos en indicaciones muy largas, por lo que el exceso de contexto puede aumentar el costo y disminuir la calidad de las respuestas. Un contexto más pequeño y bien elegido suele funcionar mejor.

Sólo educación, no asesoramiento financiero.