—por minuto
—por hora
—por ano
Em tempo real compra latência, não economia
Os modelos de fala para fala parecem mágicos, mas os tokens de áudio custam caro. Se o custo for mais importante do que a latência, um pipeline em cascata vence – avalie-o com base no Calculadora de custos do agente de voz AI.
Quanto custa um minuto de conversa por voz com IA
APIs de fala para fala cobram tokens de áudio em ambas as direções – aproximadamente US$ 0,06 a US$ 0,30 por minuto de conversa, dependendo do nível do modelo, que anualiza rapidamente para números dolorosos: um bot de suporte que atende 1.000 chamadas de dez minutos mensalmente custa de US$ 600 a US$ 3.000 apenas em custos de modelo. A alternativa em cascata (STT → LLM → TTS) custa entre US$ 0,02 e US$ 0,08 por minuto, mas adiciona de 1 a 3 segundos de latência, que a pesquisa de UX de conversação sinaliza consistentemente como o limite onde os usuários começam a falar pelo bot. O prêmio em tempo real é uma compra de latência – vale a pena pelo diálogo genuíno, desperdiçado em fluxos de menu no estilo IVR.
Custo do agente de voz AICusto de geração de imagemCusto de fala para textoCusto de conversão de texto em falaCalculadora de custos de transcodificação de vídeo
Como funciona esta calculadora
O Calculadora de custos da API de voz em tempo real estima o custo mensal de execução de um modelo de fala para fala, onde o áudio falado entra e o áudio falado volta. Você insere o esperado minutos de conversação por mês e as taxas por minuto para entrada de áudio e saída de áudioe multiplica cada taxa pelo seu uso para produzir um total. Os principais impulsionadores são o volume e a divisão de entrada/saída: o total de minutos dimensiona toda a conta linearmente, enquanto o equilíbrio entre ouvir (entrada) e falar (saída) muda o mix, uma vez que os minutos de saída normalmente têm um preço mais alto do que os de entrada.
A principal desvantagem a ser observada é que um único "minuto de conversa" geralmente é cobrado como ambos entrada e saída, então o custo efetivo por minuto está mais próximo das duas taxas combinado do que para qualquer um sozinho. Como o custo aumenta diretamente com o tempo de conversação, a maior alavanca é o design: sessões mais curtas, respostas concisas e a redução do silêncio ou preenchimento reduzem os minutos faturados de forma mais confiável do que buscar uma taxa por minuto mais baixa. Modele isso antes de dimensionar para que uma base crescente de usuários não multiplique silenciosamente seus gastos mensais.
Perguntas frequentes
Quanto custa uma API de voz em tempo real?
Os modelos de fala para fala em tempo real cobram a entrada e a saída de áudio separadamente por minuto – juntas, geralmente entre US$ 0,20 e 0,40/min. Multiplique pelos minutos de conversação para obter a fatura mensal.
O tempo real é mais barato que STT + LLM + TTS?
Geralmente não. O tempo real tem latência mais baixa e é mais simples, mas os tokens de áudio são caros. Um pipeline em cascata (fala para texto, depois um LLM de texto e depois texto para fala) costuma ser mais barato se você puder aceitar um pouco mais de latência.