Publicado 15 julio 2026 · precios de referencia, verificar antes de presupuestar
"¿Cuánto costará nuestro chatbot de soporte de IA?" es una de las preguntas más comunes que vemos. La respuesta varía 23 veces según el modelo y crece más rápido de lo esperado a medida que se acumula el historial de conversaciones.
| Modelo | $/1 millón en | $/1 millón de salida | Costo por chat | 100.000 chats/mes | Anual |
|---|---|---|---|---|---|
| Flash Géminis 2.0 | $0.10 | $0.40 | $0.0043 | $432 | $5,184 |
| GPT-4o mini | $0.15 | $0.60 | $0.0065 | $648 | $7,776 |
| Claude Haiku 4.5 | $0.80 | $4.00 | $0.0374 | $3,744 | $44,928 |
| GPT-4o | $2.50 | $10.00 | $0.1013 | $10,125 | $121,500 |
| Claudio Soneto 4 | $3.00 | $15.00 | $0.1258 | $12,576 | $150,912 |
Aquí es donde la mayoría de las estimaciones de costos de los chatbots salen mal. Modelan el costo por mensaje con un recuento de tokens fijo, pero en realidad, cada mensaje contiene el historial completo.
| Mensaje # | Tokens de entrada (incluido el historial) | Fichas de salida | Costo flash | Costo de GPT-4o |
|---|---|---|---|---|
| 1 | 550 | 280 | $0.000167 | $0.00418 |
| 2 | 900 | 280 | $0.000202 | $0.00505 |
| 4 | 1,400 | 280 | $0.000252 | $0.00630 |
| 6 | 1,950 | 280 | $0.000307 | $0.00768 |
| 8 (final) | 2,500 | 280 | $0.000362 | $0.00905 |
| Total (8 msg) | ~10,800 | ~2,240 | $0.0043 | $0.101 |
No todas las consultas de soporte necesitan el mismo modelo. Enrutar consultas a diferentes niveles:
Un clasificador de intención simple (en sí mismo barato: Flash a ~$0,002 por llamada de enrutamiento) puede determinar qué nivel maneja cada conversación.
En lugar de incluir la transcripción completa en cada mensaje, resuma la conversación después del mensaje 4 y pase un resumen comprimido (≈200 tokens) para los mensajes 5+. Esto mantiene el contexto estable en lugar de crecer linealmente.
Efecto: reduce la entrada promedio por mensaje de 1350 a ~600 tokens, una reducción del 55 % en los costos de entrada. En GPT-4o: $10,125 → ~$5,400/mes.
El mensaje del sistema y el contexto de las preguntas frecuentes (400 tokens en nuestro modelo) se repiten en cada mensaje. Tanto Anthropic como OpenAI ofrecen almacenamiento en caché rápido: los tokens de prefijo repetidos se facturan entre el 10% y el 50% de la tarifa normal después de la primera solicitud.
Si el mensaje de su sistema es de 1000 tokens y lo almacena en caché, ahorrará el 90 % de esos 1000 tokens en todos los mensajes posteriores. En 100.000 chats × 8 mensajes = 800.000 mensajes, eso son 800 millones de tokens × $0,10/1 millón × 90% = $72/mes ahorrados solo en Flash. En GPT-4o el ahorro es mayor en términos absolutos.
| Escala | Destello | Mezclado (enrutamiento) | GPT-4o |
|---|---|---|---|
| 10.000 chats/mes (inicio) | $43 | $164 | $1,013 |
| 100.000 chats/mes (crecimiento) | $432 | $1,639 | $10,125 |
| 500.000 chats/mes (escala) | $2,160 | $8,195 | $50,625 |
| 1 millón de chats/mes (empresa) | $4,320 | $16,390 | $101,250 |
Con 1 millón de chats al mes, la diferencia entre Flash y GPT-4o es de 97.000 dólares al mes: 1,16 millones de dólares al año. Incluso si Flash requiere un 15% más de escalamientos a agentes humanos, las matemáticas casi siempre favorecen el nivel de modelo más económico.
Esa es la verdadera pregunta y depende completamente de su caso de uso. Para Respuesta a preguntas frecuentes, estado del pedido, política de devoluciones, información de envío — Flash funciona de manera similar a GPT-4o en pruebas controladas. Para manejo matizado de quejas, solución de problemas de varios pasos o situaciones que requieren un razonamiento genuino sobre casos extremos — los modelos de frontera tienen una ventaja mensurable.
El enfoque práctico: ejecute Flash durante 30 días, mida la tasa de escalada y CSAT, luego compárelo con su línea de base. Si la CSAT cae <1 punto y la escalada aumenta <5%, el cambio de modelo se justifica por el ahorro de costos.
A 100.000 chats/mes con un promedio de 8 mensajes: Gemini Flash ~$432, GPT-4o mini ~$648, Claude Haiku ~$3,744, GPT-4o ~$10,125. La elección del modelo es el mayor factor de costes.
Cada mensaje incluye el historial completo como tokens de entrada. El mensaje 1 cuesta ~400 tokens de entrada; El mensaje 8 cuesta ~2500, un aumento de 6 veces para el mismo resultado. Sin un resumen de la conversación, los costos crecen linealmente con la duración del chat.
Para respuestas a preguntas frecuentes, estado de pedidos y preguntas sobre políticas, normalmente sí. Para una gestión matizada de quejas o resolución de problemas complejos, primero haga una evaluación comparativa. Muchos equipos ejecutan Flash entre el 60% y el 70% del volumen y escalan a un modelo de frontera para casos extremos.
Tres palancas principales: (1) enrutamiento de modelos: use Flash para consultas simples, GPT-4o solo para consultas complejas; (2) resumen de conversaciones: comprime el historial antiguo en ~200 tokens; (3) almacenamiento en caché de avisos: tanto Anthropic como OpenAI ofrecen descuentos del 50 al 90% en prefijos de avisos repetidos.