—por minuto
—por mês
—do áudio do agente
Custo mensal por volume de chamadas
O áudio é dimensionado linearmente com os minutos, de modo que a conta mensal monitora o volume das chamadas com precisão. Reduzir o tempo de conversação do agente (os tokens mais caros) ou limitar a duração da chamada é a alavanca mais rápida.
| Chamadas / mês | Minutos de áudio | Custo mensal |
|---|
Áudio é o token caro
Os modelos de voz em tempo real parecem mágicos: você fala, o modelo responde, sem nenhuma etapa de transcrição visível. Mas, nos bastidores, cada segundo de áudio em ambas as direções é convertido em tokens de áudio, e esses tokens têm um preço bem superior ao do texto. Um minuto de fala equivale a cerca de mil a mil e seiscentos tokens de áudio, e o áudio que o agente fala geralmente é o item de linha mais caro da fatura. É por isso que uma chamada de voz de oito minutos pode custar mais do que um dia inteiro de chat de texto: não é o raciocínio que importa, é o som.
As conclusões práticas ficam fora da matemática. Respostas mais curtas do agente economizam mais do que turnos mais curtos do usuário, porque o áudio de saída tem o preço mais alto – um assistente conciso é um assistente barato. Limitar a duração máxima da chamada protege você contra chamadas de cauda longa que estouram o orçamento. E se a sua interação for transacional em vez de conversacional, um pipeline em cascata de fala para texto, um modelo de texto e texto para fala será quase sempre mais barato, trocando um pouco de latência por muita economia. Modele a alternativa em cascata com o calculadora de custos de agente de voz e o calculadora de fala para texto, e verifique o retorno em relação ao pessoal com o calculadora de ROI do agente de voz. Os preços aqui são estimativas de referência editáveis – sempre confirme as taxas atuais de token de áudio na página de preços do seu provedor.
Custo da API de voz em tempo realCusto do agente de voz AICusto de geração de imagemCusto de fala para textoCusto de conversão de texto em fala
Perguntas frequentes
Por que a API de áudio em tempo real é muito mais cara que a de texto?
Porque o áudio é cobrado como seu próprio tipo de token, e os tokens de áudio têm um preço várias vezes mais alto do que os tokens de texto. Um modelo de fala para fala como GPT Realtime ou Gemini Live transforma aproximadamente um minuto de fala em cerca de mil tokens de áudio, e tanto o áudio que você envia quanto o áudio que o modelo responde são cobrados – o áudio de saída geralmente na taxa mais alta de todas. Uma chamada de voz de dez minutos pode, portanto, custar mais do que milhares de mensagens de chat de texto. Esta calculadora separa a entrada de áudio, a saída de áudio e quaisquer tokens de instrução de texto para que você possa ver exatamente para onde vai o dinheiro.
Um modelo de fala em fala em tempo real é mais barato que STT + LLM + TTS?
Depende das necessidades de volume e latência. Um pipeline em cascata – um modelo de fala para texto, depois um LLM de texto e depois um modelo de texto para fala – geralmente custa menos por minuto porque os tokens de texto são baratos e a transcrição e a síntese são comoditizadas. Um modelo nativo em tempo real custa mais por minuto, mas tem latência muito menor e mantém o tom, as interrupções e o tempo, o que é importante para uma conversa natural. A regra prática: use tempo real onde a qualidade da conversa justifica o prêmio, e cascata onde você é sensível ao custo ou a interação é mais transacional. A calculadora mostra o custo em tempo real para que você possa compará-lo com uma estimativa em cascata de nossas ferramentas de agente de voz.
Quantos tokens de áudio equivalem a um minuto de fala?
Como valor de trabalho, cerca de mil a mil e seiscentos tokens de áudio por minuto de fala, dependendo do modelo e de como ele codifica o áudio. O padrão aqui é uma estimativa intermediária que você pode substituir pela taxa exata dos documentos do seu provedor. O que mais importa para um orçamento é que ambas as direções sejam cobradas: os minutos que o usuário fala são tokens de áudio de entrada e os minutos que o agente fala são tokens de áudio de saída, que normalmente são a linha mais cara da fatura. Reduza a verbosidade do agente e você reduzirá o maior custo.