—al minuto
—al mese
—dall'audio dell'agente
Costo mensile in base al volume delle chiamate
L'audio si adatta linearmente ai minuti, quindi la fattura mensile tiene traccia in modo preciso del volume delle chiamate. Ridurre il tempo di conversazione degli agenti (i gettoni più costosi) o limitare la durata delle chiamate è la leva più rapida.
| Chiamate/mese | Minuti audio | Costo mensile |
|---|
L'audio è il gettone costoso
I modelli vocali in tempo reale sembrano magici: tu parli, il modello risponde, nessun passaggio di trascrizione puoi vedere. Ma dietro le quinte ogni secondo di audio in entrambe le direzioni viene convertito in token audio e tali token hanno un prezzo ben superiore al testo. Un minuto di discorso equivale a circa mille-seicento token audio e l'audio è l'agente speaks di solito è la voce più costosa della fattura. Ecco perché una chiamata vocale di otto minuti può costare più di un'intera giornata di chat testuale: non è il ragionamento a essere caro, ma il suono.
The practical takeaways fall out of the maths. Shorter agent responses save more than shorter user turns, because output audio is priced highest — a terse assistant is a cheap assistant. Capping maximum call length protects you from the long-tail calls that blow the budget. And if your interaction is transactional rather than conversational, a cascaded pipeline of speech-to-text, a text model and text-to-speech will almost always be cheaper, trading a little latency for a lot of savings. Model the cascaded alternative with the calcolatore dei costi degli agenti vocali e il calcolatore di sintesi vocalee controlla il reso rispetto al personale con il file Calcolatore del ROI dell'agente vocale. I prezzi qui sono stime di riferimento modificabili: conferma sempre le tariffe attuali dei token audio nella pagina dei prezzi del tuo fornitore.
Costo dell'API vocale in tempo realeCosto dell'agente vocale AICosto di generazione delle immaginiCosto della sintesi vocaleCosto della sintesi vocale
Come funziona questa calcolatrice
IL Calcolatore dei costi API voce/audio in tempo reale stima i costi di implementazione della sintesi vocale su modelli come GPT Realtime o Gemini Live. Inserisci il utente E agente minuti di conversazione per chiamata, token audio generati al minuto, chiamate al mese, più prezzi per milione di token per input audio, output audio ed eventuali token di istruzioni di testo. Converte i minuti parlati in volume di token, applica la tariffa di input a ciò che dice l'utente e la tariffa di output a ciò che risponde l'agente, aggiunge il costo fisso delle istruzioni di testo per chiamata e lo moltiplica per il volume di chiamate mensile per produrre totali per chiamata e mensili.
La cosa fondamentale da guardare è questa l'uscita audio è solitamente il costo dominante, perché la voce generata viene fatturata alla tariffa di output più elevata e gli agenti spesso parlano più degli utenti. Ridurre la verbosità degli agenti, rendere più stringenti le istruzioni di sistema e mantenere le chiamate concise riduce la spesa più velocemente rispetto alla riduzione dell'input dell'utente. Poiché le ipotesi relative ai token al minuto guidano tutto, modifica tale cifra in modo che corrisponda al tuo traffico reale prima di fidarti del totale.
Domande frequenti
Perché l'API audio in tempo reale è molto più costosa del testo?
Perché l'audio viene fatturato come un tipo di token a sé stante e i token audio hanno un prezzo molte volte superiore rispetto ai token di testo. Un modello di sintesi vocale come GPT Realtime o Gemini Live trasforma circa un minuto di discorso nell'ordine di mille token audio, e sia l'audio inviato che l'audio restituito dal modello vengono fatturati: l'audio in uscita solitamente alla velocità più alta di tutte. Una chiamata vocale di dieci minuti può quindi costare più di migliaia di messaggi di testo in chat. Questa calcolatrice separa l'input audio, l'output audio e qualsiasi token con istruzioni di testo in modo da poter vedere esattamente dove vanno i soldi.
Un modello di sintesi vocale in tempo reale è più economico di STT + LLM + TTS?
Dipende dalle esigenze di volume e latenza. Una pipeline a cascata – un modello di sintesi vocale, poi un LLM di testo, quindi un modello di sintesi vocale – di solito costa meno al minuto perché i token di testo sono economici e la trascrizione e la sintesi sono mercificate. Un modello nativo in tempo reale costa di più al minuto ma ha una latenza molto più bassa e mantiene il tono, le interruzioni e il tempismo, che sono importanti per una conversazione naturale. La regola pratica: usa il tempo reale dove la qualità della conversazione giustifica il premio e a cascata dove sei sensibile ai costi o l'interazione è più transazionale. Il calcolatore mostra il costo in tempo reale in modo da poterlo confrontare con una stima a cascata dei nostri strumenti di voice agent.
A quanti token audio corrisponde un minuto di discorso?
Come cifra di lavoro, da mille a milleseicento token audio al minuto di discorso, a seconda del modello e di come codifica l'audio. L'impostazione predefinita qui è una stima media che puoi sovrascrivere con la tariffa esatta dai documenti del tuo provider. Ciò che conta di più per un budget è che vengano fatturate entrambe le direzioni: i minuti in cui parla l'utente sono token audio di input, mentre i minuti in cui parla l'agente sono token audio di output, che in genere rappresentano la linea più costosa del conto. Riduci la verbosità dell'agente e riduci i costi maggiori.