Publicado 2026-07-08 · números de referencia, verificar antes de presupuestar
Cuando creas un chatbot con cualquier API LLM, cada mensaje que envías incluye el historial de conversaciones completo como entrada. No solo la última pregunta del usuario: todos los turnos anteriores, todas las respuestas de los asistentes, todo. Así es como los LLM mantienen el contexto. También es la forma en que sus costos se acumulan silenciosamente hasta convertirse en algo sorprendente.
Para el mensaje 30 en una sola conversación, el recuento de tokens de entrada aumentó de aproximadamente 1150 tokens a más de 11 000. En $5/1 millón de tokens de entrada (precio GPT-4o), esa respuesta le cuesta casi 7 veces más que la primera.
Digamos que su chatbot tiene un mensaje de sistema de 1000 tokens, los usuarios envían mensajes con un promedio de 150 tokens y el modelo responde con aproximadamente 200 tokens cada vez. en turno k:
entrada(k) = 1000 (sistema) + (k−1) × (150 + 200) (turnos anteriores) + 150 (mensaje actual)
Eso simplifica a 800+350k. El costo aumenta linealmente con cada turno, porque cada turno agrega 350 fichas a cada llamada futura para siempre.
| Doblar | Fichas de entrada | Costo de insumos ($5/1 millón) | Costo total del turno |
|---|---|---|---|
| 1 | 1,150 | $0.0058 | $0.009 |
| 5 | 2,550 | $0.0128 | $0.016 |
| 10 | 4,300 | $0.0215 | $0.025 |
| 20 | 7,800 | $0.039 | $0.042 |
| 30 | 11,300 | $0.0565 | $0.060 |
Los precios son estimaciones de referencia, julio de 2026. Informar precio desactualizado →
Salida: 200 tokens × $15/1 millón = $0,003 por turno. Modelo: GPT-4o ($5/$15 precio de referencia).
El turno 30 cuesta $0,060, el turno 1 cuesta $0,009 - un 6,8× diferencia para la misma pregunta de usuario de 150 tokens y respuesta de 200 tokens.
Sumando los 30 turnos: la entrada total a lo largo de la conversación es 186.750 fichas. Costo total:
Si la API no tuviera estado y cada llamada solo enviara el turno actual (1150 tokens), los mismos 30 turnos costarían 30 × $0,009 = $0.27. El historial de conversaciones agrega $0,75 en costo de insumos adicionales – dinero gastado en releer lo que el modelo ya procesó.
10.000 usuarios por día, cada uno con un promedio de 15 turnos:
| Costo diario | Costo mensual | |
|---|---|---|
| Conversaciones de 15 turnos (con historial) | $1,840 | $55,200 |
| Apátrida (hipotético, sin antecedentes) | $810 | $24,300 |
| Historia aérea | $1,030 | $30,900 |
La sobrecarga del historial no es un error de facturación. Es el costo estructural de construir IA conversacional en una API lo que fija el precio de cada token en cada llamada. La mayoría de equipos lo descubren cuando llega la factura de fin de mes.
1. Elimina los mensajes antiguos. Mantenga solo los últimos N turnos (por ejemplo, 5 a 8). Funciona bien para asistentes de preguntas y respuestas factuales donde el contexto antiguo rara vez importa. Solución más barata, implementada en una tarde. Compensación: el modelo olvida el contexto inicial.
2. Comprimir con un resumen. Después de cada 5 a 10 turnos, llame al modelo una vez para resumir la conversación hasta el momento. Reemplace el historial sin procesar con el resumen. Costo: una llamada extra por N turnos. Beneficio: la sobrecarga del historial se mantiene casi estable independientemente de la duración de la conversación.
3. Ventana corredera con filtrado semántico. Mantenga siempre los giros recientes e incluya selectivamente solo los giros más antiguos semánticamente relevantes mediante incrustaciones. Más complejo pero conserva el contexto clave sin costo histórico completo. Vale la pena implementarlo a escala para apoyo o asistentes de investigación.
4. Almacenamiento en caché rápido. En Claude y Gemini, marcar el mensaje estático del sistema como almacenable en caché ofrece entre un 50% y un 90% de descuento en esa parte. No ayuda con la historia en crecimiento (que siempre es única), pero reduce los gastos generales fijos. A $0,0050 de un aviso del sistema de 1000 tokens por llamada, el almacenamiento en caché ahorra ~$0,0045 por turno, lo cual es significativo en millones de llamadas. Ver el calculadora de ahorro de almacenamiento en caché rápida.
La mayoría de los chatbots de producción deberían utilizar una ventana móvil de 6 a 10 turnos más un paso de compresión en algún umbral. "Enviar todo el historial para siempre" es un valor predeterminado razonable para los prototipos. Es un defecto costoso para la producción.
Pon tus propios números en el calculadora de costos del historial de conversaciones para ver exactamente dónde se distribuye su costo entre turnos, comparar modelos y estimar los ahorros en compresión. La diferencia entre un historial de 30 turnos y una ventana de 5 turnos suele ser entre un 60% y un 70% menor para la misma experiencia con el producto.
Cada llamada a la API reenvía el historial de conversaciones completo como tokens de entrada. Cada turno agrega el mensaje del usuario y la respuesta del asistente a todo lo que sigue, por lo que el tamaño de entrada crece linealmente con el número de turnos.
La solución más práctica es una ventana móvil: conserve sólo los últimos 5 a 10 turnos en lugar de todo el historial. Para los asistentes donde el contexto importa, el resumen periódico les permite comprimir giros antiguos en un párrafo corto, manteniendo el costo estable. Utilice el calculadora de costos del historial de conversaciones para modelar los ahorros.
Solo para la parte estática (mensaje del sistema, definiciones de herramientas). El historial de crecimiento es único por conversación, por lo que no se puede almacenar en caché. El almacenamiento en caché ayuda a reducir los gastos generales fijos: la parte del historial variable que usted paga de todos modos.
Con GPT-4o a $5/$15 por 1 millón de tokens, un aviso del sistema de 1000 tokens, turnos de usuario de 150 tokens y respuestas de asistente de 200 tokens: alrededor de $1,02 en total. El primer turno cuesta $0,009, el último cuesta $0,060, casi 7 veces más.
Números de referencia basados en los precios de GPT-4o, junio de 2026: verifique las tarifas actuales en la página de precios del proveedor.