—por minuto
—por mes
—del audio del agente
Costo mensual por volumen de llamadas
El audio escala linealmente con los minutos, por lo que la factura mensual sigue estrechamente el volumen de llamadas. Reducir el tiempo de conversación de los agentes (los tokens más caros) o limitar la duración de las llamadas es la palanca más rápida.
| Llamadas / mes | Minutos de audio | Costo mensual |
|---|
El audio es el token caro
Los modelos de voz en tiempo real parecen mágicos: usted habla, el modelo responde, no se puede ver ningún paso de transcripción. Pero en el fondo, cada segundo de audio en ambas direcciones se convierte en tokens de audio, y esos tokens tienen un precio muy superior al del texto. Un minuto de discurso equivale aproximadamente entre mil y mil seiscientos tokens de audio, y el audio que el agente habla suele ser la partida más cara de la factura. Por eso una llamada de voz de ocho minutos puede costar más que un día entero de chat de texto: lo importante no es el razonamiento, sino el sonido.
Las conclusiones prácticas quedan fuera de las matemáticas. Las respuestas más breves de los agentes ahorran más que los turnos más cortos de los usuarios, porque el audio de salida tiene el precio más alto: un asistente conciso es un asistente barato. Limitar la duración máxima de las llamadas lo protege de las llamadas de cola larga que arruinan su presupuesto. Y si su interacción es transaccional en lugar de conversacional, un canal en cascada de voz a texto, un modelo de texto y texto a voz casi siempre será más barato, intercambiando un poco de latencia por muchos ahorros. Modele la alternativa en cascada con el calculadora de costos de agente de voz y el calculadora de voz a textoy cotejar la declaración con el personal del calculadora de ROI del agente de voz. Los precios aquí son estimaciones de referencia editables; siempre confirme las tarifas actuales de tokens de audio en la página de precios de su proveedor.
Costo de API de voz en tiempo realCosto del agente de voz AICosto de generación de imágenesCosto de voz a textoCosto de texto a voz
Preguntas frecuentes
¿Por qué la API de audio en tiempo real es mucho más cara que el texto?
Porque el audio se factura como su propio tipo de token, y los tokens de audio tienen un precio varias veces mayor que los tokens de texto. Un modelo de voz a voz como GPT Realtime o Gemini Live convierte aproximadamente un minuto de voz en del orden de mil tokens de audio, y tanto el audio que usted envía como el audio que el modelo responde se facturan: el audio de salida generalmente tiene la tasa más alta de todas. Por lo tanto, una llamada de voz de diez minutos puede costar más que miles de mensajes de chat de texto. Esta calculadora separa la entrada de audio, la salida de audio y cualquier token de instrucción de texto para que puedas ver exactamente a dónde va el dinero.
¿Es un modelo de voz a voz en tiempo real más barato que STT + LLM + TTS?
Depende de las necesidades de volumen y latencia. Un proceso en cascada (un modelo de voz a texto, luego un LLM de texto, luego un modelo de texto a voz) generalmente cuesta menos por minuto porque los tokens de texto son baratos y la transcripción y la síntesis están mercantilizadas. Un modelo nativo en tiempo real cuesta más por minuto, pero tiene una latencia mucho menor y mantiene el tono, las interrupciones y el tiempo, lo cual es importante para una conversación natural. La regla general: utilice el tiempo real cuando la calidad de la conversación justifique la prima y la cascada cuando sea sensible a los costos o la interacción sea más transaccional. La calculadora muestra el costo en tiempo real para que pueda compararlo con una estimación en cascada de nuestras herramientas de agentes de voz.
¿Cuántas fichas de audio hay en un minuto de discurso?
Como cifra de trabajo, entre mil y mil seiscientos tokens de audio por minuto de voz, según el modelo y cómo codifica el audio. El valor predeterminado aquí es una estimación intermedia que puede anular con la tarifa exacta de los documentos de su proveedor. Lo más importante para un presupuesto es que se facturen ambas direcciones: los minutos que el usuario habla son tokens de audio de entrada y los minutos que habla el agente son tokens de audio de salida, que suelen ser la línea más cara de la factura. Reduzca la verbosidad del agente y reducirá el mayor costo.