Cada API de transcripción clasificada según su volumen
Mismas horas de audio, más barato primero.
| Proveedor/nivel | $/minuto | Tu $/mes |
|---|
Los complementos tienen un costo adicional: los números anteriores son solo transcripción básica
La programación del orador, la mejora de términos clave/palabras clave y los modos especializados se facturan como recargos separados además de la tarifa base en la mayoría de los proveedores. Verificado por proveedor, agosto de 2026:
| Proveedor | Añadir | Recargo |
|---|---|---|
| AsambleaAI | Registro de oradores (asíncrono) | +$0,02/hora (≈+$0,00033/min) |
| AsambleaAI | Términos clave que incitan | +$0,05/hora (≈+$0,00083/min) |
| AsambleaAI | Modo médico | +$0,15/hora (≈+$0,0025/min) |
| AsambleaAI | Diarización en streaming | +$0,12/hora (≈+$0,002/min) |
| gramo profundo | Diarización del orador | +$0.0020/min fijo |
En un trabajo por lotes de 500 horas al mes, la diarioización de AssemblyAI por sí sola agrega alrededor de $10/mes: una cantidad pequeña en comparación con la factura base, pero el impulso de términos clave más la diarioización más un modo especializado pueden acumularse hasta un porcentaje significativo en la parte superior. Siempre fije el precio exacto del conjunto de funciones que realmente utilizará, no solo la tarifa por minuto del título.
Precio por minuto, cinco veces mayor
Las API de voz a texto facturan por parte del minuto de audio, no por el tamaño del archivo o el número de palabras, lo que simplifica la planificación del volumen: calcule sus horas, multiplíquelas por sesenta y multiplíquelas por la tarifa por minuto. El problema es cuán amplia es la propagación. Los niveles por lotes de Deepgram y AssemblyAI transcriben un minuto por mucho menos de medio centavo, la API Whisper de OpenAI cuesta alrededor de seis décimas de centavo y los servicios de hiperescalado (Google, AWS Transcribe, Azure) generalmente cobran de dos a cuatro veces más por minuto. Durante miles de horas al mes, esa brecha se convierte en miles de dólares al año para una producción idéntica.
Lote versus tiempo real es el otro gran dial
La segunda palanca de costos es estado latente. La transcripción en tiempo real (subtítulos en vivo, agentes de voz, monitoreo de llamadas) mantiene una conexión abierta y devuelve las palabras a medida que se pronuncian, y los proveedores cobran una prima por ello. La transcripción por lotes de archivos grabados se ejecuta en segundo plano y es notablemente más económica. Si su producto puede esperar unos minutos (resúmenes de reuniones, transcripciones de podcasts, análisis de llamadas archivadas), utilice lotes y gane la diferencia. Pague solo en tiempo real cuando el usuario realmente esté esperando las palabras.
Cuándo autohospedar Whisper
Whisper, de código abierto, elimina la tarifa por minuto pero agrega GPU, operaciones y costos de inactividad. Por debajo de unos pocos cientos de horas al mes, la API alojada gana tanto en precio como en simplicidad; por encima de eso, una GPU bien utilizada que se ejecute cerca del reloj puede superarlo. Encuentra tu crossover en el calculadora autohospedada vs API. Si la transcripción alimenta un LLM (resúmenes, preguntas y respuestas sobre llamadas), agregue ese costo simbólico en el Calculadora de costos de tokens LLM, y sumar toda la tubería en el Estimador de costos de aplicaciones de IA.
Herramientas y guías relacionadas
Estimador de costos de aplicaciones de IA · Calculadora autohospedada frente a API · Calculadora de costos de agentes de voz con IA · API LLM más barata · Todas las API de IA