—par minute
—par mois
—à partir de l'audio de l'agent
Coût mensuel par volume d'appels
L'audio évolue linéairement avec les minutes, de sorte que la facture mensuelle suit étroitement le volume des appels. Réduire le temps de conversation des agents (les jetons les plus chers) ou limiter la durée des appels est le levier le plus rapide.
| Appels / mois | Minutes audio | Coût mensuel |
|---|
L'audio est le jeton cher
Les modèles vocaux en temps réel semblent magiques : vous parlez, le modèle répond, aucune étape de transcription n'est visible. Mais sous le capot, chaque seconde d’audio dans les deux sens est convertie en jetons audio, et le prix de ces jetons est bien supérieur à celui du texte. Une minute de discours équivaut à environ mille à seize cents jetons audio, et l'audio de l'agent parle est généralement le poste le plus cher de la facture. C’est pourquoi un appel vocal de huit minutes peut coûter plus cher qu’une journée entière de conversation textuelle : ce n’est pas le raisonnement qui compte, c’est le son.
Les enseignements pratiques ne relèvent pas des mathématiques. Des réponses d'agent plus courtes permettent d'économiser plus que des tours d'utilisateur plus courts, car le prix de sortie audio est le plus élevé – un assistant laconique est un assistant bon marché. Le plafonnement de la durée maximale des appels vous protège des appels de longue durée qui font exploser le budget. Et si votre interaction est transactionnelle plutôt que conversationnelle, un pipeline en cascade de synthèse vocale, un modèle de texte et une synthèse vocale sera presque toujours moins cher, échangeant un peu de latence contre de nombreuses économies. Modélisez l'alternative en cascade avec le calculateur de coût d'agent vocal et le calculateur de synthèse vocale, et vérifiez le retour auprès du personnel avec le Calculateur de retour sur investissement pour agent vocal. Les prix ici sont des estimations de référence modifiables : confirmez toujours les tarifs actuels des jetons audio sur la page de tarification de votre fournisseur.
Coût de l'API vocale en temps réelCoût de l'agent vocal IACoût de génération d'imagesCoût de la synthèse vocaleCoût de la synthèse vocale
Questions fréquemment posées
Pourquoi l’API audio en temps réel est-elle beaucoup plus chère que le texte ?
Parce que l’audio est facturé comme son propre type de jeton, et que le prix des jetons audio est plusieurs fois plus élevé que celui des jetons texte. Un modèle de synthèse vocale comme GPT Realtime ou Gemini Live transforme environ une minute de parole en un millier de jetons audio, et l'audio que vous envoyez et l'audio que le modèle répond sont facturés - l'audio de sortie généralement au taux le plus élevé de tous. Un appel vocal de dix minutes peut donc coûter plus cher que des milliers de messages texte. Cette calculatrice sépare l'entrée audio, la sortie audio et tous les jetons d'instruction textuelle afin que vous puissiez voir exactement où va l'argent.
Un modèle de synthèse vocale en temps réel est-il moins cher que STT + LLM + TTS ?
Cela dépend des besoins en volume et en latence. Un pipeline en cascade – un modèle parole-texte, puis un LLM texte, puis un modèle texte-parole – coûte généralement moins cher par minute car les jetons de texte sont bon marché et la transcription et la synthèse sont banalisées. Un modèle natif en temps réel coûte plus cher par minute mais a une latence beaucoup plus faible et conserve le ton, les interruptions et le timing, ce qui est important pour une conversation naturelle. La règle générale : utilisez le temps réel lorsque la qualité de la conversation justifie le prix, et la cascade lorsque vous êtes sensible aux coûts ou que l'interaction est plus transactionnelle. Le calculateur affiche le coût en temps réel afin que vous puissiez le comparer à une estimation en cascade de nos outils d'agent vocal.
Combien de jetons audio représente une minute de discours ?
En tant que chiffre de travail, environ mille à seize cents jetons audio par minute de parole, selon le modèle et la manière dont il encode l'audio. La valeur par défaut ici est une estimation moyenne que vous pouvez remplacer par le tarif exact figurant dans les documents de votre fournisseur. Ce qui compte le plus pour un budget, c'est que les deux sens soient facturés : les minutes pendant lesquelles l'utilisateur parle sont des jetons audio d'entrée, et les minutes pendant lesquelles l'agent parle sont des jetons audio de sortie, qui constituent généralement la ligne la plus chère de la facture. Réduisez la verbosité des agents et vous réduisez les coûts les plus importants.