seu provedor / mês
por minuto
mais barato / mês
mudar e salvar / ano

Cada API de transcrição classificada para o seu volume

Mesmas horas de áudio, mais barato primeiro.

Provedor/nível$/minutoSeu $/mês

Os complementos têm um custo extra – os números acima são apenas transcrição básica

A diarização do locutor, o aumento de termos-chave/palavras-chave e os modos especiais são cobrados como sobretaxas separadas além da taxa básica na maioria dos provedores. Verificado por provedor, agosto de 2026:

ProvedorAdicionarSobretaxa
Montagem AIDiarização de alto-falante (assíncrona)+$0,02/h (≈+$0,00033/min)
Montagem AISolicitação de termos-chave+$0,05/h (≈+$0,00083/min)
Montagem AIModo Médico+$0,15/h (≈+$0,0025/min)
Montagem AIDiarização de streaming+$0,12/h (≈+$0,002/min)
DeepgramDiarização de alto-falante+US$ 0,0020/min fixo

Em um trabalho em lote de 500 horas/mês, a diarização do AssemblyAI por si só acrescenta cerca de US$ 10/mês – um valor pequeno próximo à conta básica, mas o aumento de termos-chave mais a diarização e um modo especializado podem acumular uma porcentagem significativa no topo. Sempre defina o preço do conjunto exato de recursos que você realmente usará, não apenas a taxa por minuto do título.

⚠️ Estimativa. Os preços por minuto são valores de referência (julho de 2026) e variam de acordo com modelo, idioma, tempo real versus lote e descontos por volume – confirme na página de preços do fornecedor. A diarização do palestrante, a redação e outros complementos têm um custo extra. O áudio é cobrado pela duração e não pelo tamanho do arquivo. · Informar preço desatualizado →

Preço por minuto, spread de cinco vezes

Fatura de APIs de fala para texto pelo minuto de áudio, não pelo tamanho do arquivo ou pela contagem de palavras, o que simplifica o planejamento do volume: estime suas horas, multiplique por sessenta, multiplique pela taxa por minuto. O problema é quão ampla é a propagação. Os níveis de lote do Deepgram e AssemblyAI transcrevem um minuto por menos de meio centavo, a API Whisper da OpenAI fica em torno de seis décimos de centavo e os serviços hiperescaladores – Google, AWS Transcribe, Azure – normalmente cobram de duas a quatro vezes mais por minuto. Ao longo de milhares de horas por mês, essa diferença transforma-se em milhares de dólares por ano para produção idêntica.

Lote versus tempo real é o outro grande diferencial

A segunda alavanca de custo é latência. A transcrição de streaming em tempo real – legendas ao vivo, agentes de voz, monitoramento de chamadas – mantém uma conexão aberta e retorna as palavras conforme são faladas, e os provedores cobram um valor extra por isso. A transcrição em lote de arquivos gravados é executada em segundo plano e é significativamente mais barata. Se o seu produto puder esperar alguns minutos – resumos de reuniões, transcrições de podcast, análises de chamadas arquivadas – use o lote e embolse a diferença. Pague apenas em tempo real quando o usuário estiver realmente esperando pelas palavras.

Quando auto-hospedar o Whisper

O Whisper de código aberto remove a taxa por minuto, mas adiciona GPU, operações e custo ocioso. Abaixo de algumas centenas de horas por mês, a API hospedada ganha tanto em preço quanto em simplicidade; acima disso, uma GPU bem utilizada rodando perto do relógio pode superá-lo. Encontre o seu crossover no calculadora auto-hospedada vs API. Se a transcrição alimenta um LLM – resumos, perguntas e respostas durante chamadas – adicione o custo do token no Calculadora de custo de token LLM, e totalize todo o pipeline no Estimador de custos de aplicativos de IA.

Ferramentas e guias relacionados

Estimador de custos de aplicativos de IA · Calculadora auto-hospedada vs API · Calculadora de custos do agente de voz AI · API LLM mais barata · Todas as APIs de IA

Compartilhar: 𝕏 Postar Reddit
Hospede seu projeto:DigitalOcean – $ 200 grátis ↗VPS da Hostinger
Custo de geração de vídeo AICusto da API de voz em tempo realCusto do agente de voz AICusto de geração de imagemCusto de conversão de texto em falaCalculadora de custos do AI Meeting Notetaker