—por minuto
—mais barato / mês
—mudar e salvar / ano
Cada API de transcrição classificada para o seu volume
Mesmas horas de áudio, mais barato primeiro.
| Provedor/nível | $/minuto | Seu $/mês |
|---|
Os complementos têm um custo extra – os números acima são apenas transcrição básica
A diarização do locutor, o aumento de termos-chave/palavras-chave e os modos especiais são cobrados como sobretaxas separadas além da taxa básica na maioria dos provedores. Verificado por provedor, agosto de 2026:
| Provedor | Adicionar | Sobretaxa |
| Montagem AI | Diarização de alto-falante (assíncrona) | +$0,02/h (≈+$0,00033/min) |
| Montagem AI | Solicitação de termos-chave | +$0,05/h (≈+$0,00083/min) |
| Montagem AI | Modo Médico | +$0,15/h (≈+$0,0025/min) |
| Montagem AI | Diarização de streaming | +$0,12/h (≈+$0,002/min) |
| Deepgram | Diarização de alto-falante | +US$ 0,0020/min fixo |
Em um trabalho em lote de 500 horas/mês, a diarização do AssemblyAI por si só acrescenta cerca de US$ 10/mês – um valor pequeno próximo à conta básica, mas o aumento de termos-chave mais a diarização e um modo especializado podem acumular uma porcentagem significativa no topo. Sempre defina o preço do conjunto exato de recursos que você realmente usará, não apenas a taxa por minuto do título.
⚠️ Estimativa. Os preços por minuto são valores de referência (julho de 2026) e variam de acordo com modelo, idioma, tempo real versus lote e descontos por volume – confirme na página de preços do fornecedor. A diarização do palestrante, a redação e outros complementos têm um custo extra. O áudio é cobrado pela duração e não pelo tamanho do arquivo. ·
Informar preço desatualizado →
Preço por minuto, spread de cinco vezes
Fatura de APIs de fala para texto pelo minuto de áudio, não pelo tamanho do arquivo ou pela contagem de palavras, o que simplifica o planejamento do volume: estime suas horas, multiplique por sessenta, multiplique pela taxa por minuto. O problema é quão ampla é a propagação. Os níveis de lote do Deepgram e AssemblyAI transcrevem um minuto por menos de meio centavo, a API Whisper da OpenAI fica em torno de seis décimos de centavo e os serviços hiperescaladores – Google, AWS Transcribe, Azure – normalmente cobram de duas a quatro vezes mais por minuto. Ao longo de milhares de horas por mês, essa diferença transforma-se em milhares de dólares por ano para produção idêntica.
Lote versus tempo real é o outro grande diferencial
A segunda alavanca de custo é latência. A transcrição de streaming em tempo real – legendas ao vivo, agentes de voz, monitoramento de chamadas – mantém uma conexão aberta e retorna as palavras conforme são faladas, e os provedores cobram um valor extra por isso. A transcrição em lote de arquivos gravados é executada em segundo plano e é significativamente mais barata. Se o seu produto puder esperar alguns minutos – resumos de reuniões, transcrições de podcast, análises de chamadas arquivadas – use o lote e embolse a diferença. Pague apenas em tempo real quando o usuário estiver realmente esperando pelas palavras.
Quando auto-hospedar o Whisper
O Whisper de código aberto remove a taxa por minuto, mas adiciona GPU, operações e custo ocioso. Abaixo de algumas centenas de horas por mês, a API hospedada ganha tanto em preço quanto em simplicidade; acima disso, uma GPU bem utilizada rodando perto do relógio pode superá-lo. Encontre o seu crossover no calculadora auto-hospedada vs API. Se a transcrição alimenta um LLM – resumos, perguntas e respostas durante chamadas – adicione o custo do token no Calculadora de custo de token LLM, e totalize todo o pipeline no Estimador de custos de aplicativos de IA.
Ferramentas e guias relacionados
Estimador de custos de aplicativos de IA · Calculadora auto-hospedada vs API · Calculadora de custos do agente de voz AI · API LLM mais barata · Todas as APIs de IA
Custo de geração de vídeo AICusto da API de voz em tempo realCusto do agente de voz AICusto de geração de imagemCusto de conversão de texto em falaCalculadora de custos do AI Meeting Notetaker
Como funciona esta calculadora
O Calculadora de custos de transcrição de áudio estima seu gasto mensal com voz para texto com base em quantos horas de áudio por mês você processa e quais provedor e nível você seleciona. A maioria das APIs de transcrição – OpenAI Whisper, Deepgram, AssemblyAI, Google – cobra por minuto ou hora de áudio, então a ferramenta multiplica seu volume pela taxa por hora de cada provedor e mostra os resultados lado a lado. Os principais fatores de custo são simplesmente a duração total do áudio e o preço do nível que você escolher, já que níveis mais altos com recursos como diarização, carimbos de data/hora ou modelos premium geralmente têm uma taxa por hora mais alta.
Comparar fornecedores é importante porque as taxas por hora variam amplamente e, em escala, uma pequena diferença se multiplica rapidamente ao longo de milhares de horas. A principal compensação a observar é preço versus precisão: o nível mais barato pode precisar de mais correção manual, enquanto um modelo mais caro pode reduzir o tempo de limpeza. Estime seu volume mensal real antes de se comprometer e verifique novamente as taxas periodicamente, à medida que os preços do provedor mudam.
Perguntas frequentes
Quanto custa a conversão de fala em texto por minuto?
Em 2026, as APIs de transcrição cobram cerca de US$ 0,0037 a US$ 0,024 por minuto de áudio. Os níveis de lote do Deepgram e AssemblyAI são baratos (bem menos de meio centavo por minuto), o OpenAI Whisper custa cerca de US$ 0,006 e os grandes serviços de nuvem – Google, AWS, Azure – são normalmente mais caros por minuto, mas agrupados em contas de nuvem existentes. O streaming em tempo real geralmente custa mais do que a transcrição em lote de arquivos gravados.
Por que a transcrição em tempo real é mais cara do que em lote?
O streaming de voz para texto mantém uma conexão ao vivo e retorna resultados parciais com baixa latência, o que exige mais computação do que transcrever um arquivo finalizado em segundo plano. A maioria dos provedores cobra um prêmio pelo tempo real em relação ao lote. Se o seu caso de uso puder tolerar alguns minutos de atraso – notas de reuniões, transcrições de podcast, análise de chamadas – o modo em lote é visivelmente mais barato para o mesmo áudio.
O Whisper de código aberto é mais barato que a API?
Executar o Whisper de código aberto em sua própria GPU remove a taxa por minuto, mas você paga pela GPU, operações e tempo ocioso. Abaixo de algumas centenas de horas por mês, a API hospedada é quase sempre mais barata e muito mais simples; acima disso, a auto-hospedagem pode vencer. O crossover depende da utilização – uma GPU que transcreve 24 horas por dia, 7 dias por semana, amortiza bem, uma usada algumas horas por dia não.