—por minuto
—mais barato / mês
—mudar e salvar / ano
Cada API de transcrição classificada para o seu volume
Mesmas horas de áudio, mais barato primeiro.
| Provedor/nível | $/minuto | Seu $/mês |
|---|
⚠️ Estimativa. Os preços por minuto são valores de referência (julho de 2026) e variam de acordo com modelo, idioma, tempo real versus lote e descontos por volume – confirme na página de preços do fornecedor. A diarização do palestrante, a redação e outros complementos têm um custo extra. O áudio é cobrado pela duração e não pelo tamanho do arquivo. ·
Informar preço desatualizado →
Preço por minuto, spread de cinco vezes
Fatura de APIs de fala para texto pelo minuto de áudio, não pelo tamanho do arquivo ou pela contagem de palavras, o que simplifica o planejamento do volume: estime suas horas, multiplique por sessenta, multiplique pela taxa por minuto. O problema é quão ampla é a propagação. Os níveis de lote do Deepgram e AssemblyAI transcrevem um minuto por menos de meio centavo, a API Whisper da OpenAI fica em torno de seis décimos de centavo e os serviços hiperescaladores – Google, AWS Transcribe, Azure – normalmente cobram de duas a quatro vezes mais por minuto. Ao longo de milhares de horas por mês, essa diferença transforma-se em milhares de dólares por ano para produção idêntica.
Lote versus tempo real é o outro grande diferencial
A segunda alavanca de custo é latência. A transcrição de streaming em tempo real – legendas ao vivo, agentes de voz, monitoramento de chamadas – mantém uma conexão aberta e retorna as palavras conforme são faladas, e os provedores cobram um valor extra por isso. A transcrição em lote de arquivos gravados é executada em segundo plano e é significativamente mais barata. Se o seu produto puder esperar alguns minutos – resumos de reuniões, transcrições de podcast, análises de chamadas arquivadas – use o lote e embolse a diferença. Pague apenas em tempo real quando o usuário estiver realmente esperando pelas palavras.
Quando auto-hospedar o Whisper
O Whisper de código aberto remove a taxa por minuto, mas adiciona GPU, operações e custo ocioso. Abaixo de algumas centenas de horas por mês, a API hospedada ganha tanto em preço quanto em simplicidade; acima disso, uma GPU bem utilizada rodando perto do relógio pode superá-lo. Encontre o seu crossover no calculadora auto-hospedada vs API. Se a transcrição alimenta um LLM – resumos, perguntas e respostas durante chamadas – adicione o custo do token no Calculadora de custo de token LLM, e totalize todo o pipeline no Estimador de custos de aplicativos de IA.
Ferramentas e guias relacionados
Estimador de custos de aplicativos de IA · Calculadora auto-hospedada vs API · Calculadora de custos do agente de voz AI · API LLM mais barata · Todas as APIs de IA
Custo de geração de vídeo AICusto da API de voz em tempo realCusto do agente de voz AICusto de geração de imagemCusto de conversão de texto em fala
Como funciona esta calculadora
Calculadora de custos de fala para texto gratuita. Insira suas horas de áudio por mês para comparar o custo da API de transcrição em OpenAI Whisper, Deepgram, AssemblyAI, Google…
Perguntas frequentes
Quanto custa a conversão de fala em texto por minuto?
Em 2026, as APIs de transcrição cobram cerca de US$ 0,0037 a US$ 0,024 por minuto de áudio. Os níveis de lote do Deepgram e AssemblyAI são baratos (bem menos de meio centavo por minuto), o OpenAI Whisper custa cerca de US$ 0,006 e os grandes serviços de nuvem – Google, AWS, Azure – são normalmente mais caros por minuto, mas agrupados em contas de nuvem existentes. O streaming em tempo real geralmente custa mais do que a transcrição em lote de arquivos gravados.
Por que a transcrição em tempo real é mais cara do que em lote?
O streaming de voz para texto mantém uma conexão ao vivo e retorna resultados parciais com baixa latência, o que exige mais computação do que transcrever um arquivo finalizado em segundo plano. A maioria dos provedores cobra um prêmio pelo tempo real em relação ao lote. Se o seu caso de uso puder tolerar alguns minutos de atraso – notas de reuniões, transcrições de podcast, análise de chamadas – o modo em lote é visivelmente mais barato para o mesmo áudio.
O Whisper de código aberto é mais barato que a API?
Executar o Whisper de código aberto em sua própria GPU remove a taxa por minuto, mas você paga pela GPU, operações e tempo ocioso. Abaixo de algumas centenas de horas por mês, a API hospedada é quase sempre mais barata e muito mais simples; acima disso, a auto-hospedagem pode vencer. O crossover depende da utilização – uma GPU que transcreve 24 horas por dia, 7 dias por semana, amortiza bem, uma usada algumas horas por dia não.