—por minuto
—por hora
—por año
El tiempo real compra latencia, no ahorros
Los modelos de voz a voz parecen mágicos, pero los tokens de audio cuestan más. Si el costo importa más que la latencia, gana una canalización en cascada: póngale precio en función del precio. Calculadora de costos de agentes de voz con IA.
Lo que cuesta un minuto de conversación de voz con IA
Las API de voz a voz facturan tokens de audio en ambas direcciones: aproximadamente entre 0,06 y 0,30 dólares por minuto de conversación, dependiendo del nivel del modelo, que se anualiza rápidamente hasta alcanzar cifras dolorosas: un robot de soporte que maneja 1.000 llamadas de diez minutos al mes cuesta entre 600 y 3.000 dólares sólo en costos de modelo. La alternativa en cascada (STT → LLM → TTS) cuesta entre 0,02 y 0,08 dólares por minuto, pero agrega entre 1 y 3 segundos de latencia, que la investigación de UX de conversación señala constantemente como el umbral en el que los usuarios comienzan a hablar a través del bot. La prima en tiempo real es una compra de latencia: vale la pena por un diálogo genuino, desperdiciado en flujos de menú estilo IVR.
Costo del agente de voz AICosto de generación de imágenesCosto de voz a textoCosto de texto a vozCalculadora de costos de transcodificación de video
Cómo funciona esta calculadora
El Calculadora de costos de API de voz en tiempo real estima el costo mensual de ejecutar un modelo de voz a voz, donde el audio hablado entra y regresa. Introduces tu esperado minutos de conversación al mes y las tarifas por minuto para entrada de audio y salida de audioy multiplica cada tarifa por su uso para producir un total. Los principales impulsores son el volumen y la división de entrada/salida: los minutos totales escalan la factura completa de forma lineal, mientras que el equilibrio entre escuchar (entrada) y hablar (salida) cambia la combinación, ya que los minutos de salida suelen tener un precio más alto que los de entrada.
La contrapartida clave a tener en cuenta es que un solo "minuto de conversación" normalmente se factura como ambos entrada y salida, por lo que el costo efectivo por minuto está más cerca de las dos tasas conjunto que a cualquiera de los dos solos. Debido a que el costo aumenta directamente con el tiempo de conversación, la palanca más importante es el diseño: sesiones más cortas, respuestas concisas y recortar el silencio o el relleno reducen los minutos facturados de manera más confiable que perseguir una tarifa por minuto más baja. Modele esto antes de escalar para que una base de usuarios en crecimiento no multiplique silenciosamente su gasto mensual.
Preguntas frecuentes
¿Cuánto cuesta una API de voz en tiempo real?
Los modelos de voz a voz en tiempo real facturan la entrada y salida de audio por separado por minuto; en conjunto, a menudo cuestan entre 0,20 y 0,40 dólares por minuto. Multiplica por tus minutos de conversación para obtener la factura mensual.
¿Es el tiempo real más barato que STT + LLM + TTS?
Normalmente no. El tiempo real tiene menor latencia y es más simple, pero los tokens de audio son caros. Una canalización en cascada (voz a texto, luego un LLM de texto, luego texto a voz) suele ser más barata si se puede aceptar un poco más de latencia.