—pro Minute
—pro Monat
—von Agent Audio
Monatliche Kosten nach Anrufvolumen
Audio skaliert linear mit den Minuten, sodass die monatliche Rechnung das Anrufvolumen genau widerspiegelt. Die Verkürzung der Gesprächszeit der Agenten (die teuersten Token) oder die Begrenzung der Anruflänge ist der schnellste Hebel.
| Anrufe/Monat | Audioprotokolle | Monatliche Kosten |
|---|
Audio ist der teure Token
Echtzeit-Sprachmodelle fühlen sich wie Magie an – Sie sprechen, das Modell spricht zurück, Sie können keinen Transkriptionsschritt sehen. Aber unter der Haube wird jede Sekunde Audio in beide Richtungen in Audio-Tokens umgewandelt, und diese Tokens kosten deutlich mehr als Text. Eine Redeminute besteht aus ungefähr tausend- bis sechzehnhundert Audio-Tokens, und die Audio-Tokens sind der Agent spricht ist in der Regel der teuerste Einzelposten auf der Rechnung. Deshalb kann ein achtminütiger Sprachanruf mehr kosten als ein ganzer Text-Chat-Tag: Es kommt nicht auf die Begründung an, sondern auf den Klang.
Die praktischen Erkenntnisse ergeben sich aus der Mathematik. Kürzere Agentenantworten sparen mehr als kürzere Benutzerrundgänge, da die Audioausgabe am teuersten ist – ein knapper Assistent ist ein billiger Assistent. Die Begrenzung der maximalen Anruflänge schützt Sie vor Long-Tail-Anrufen, die Ihr Budget sprengen. Und wenn es sich bei Ihrer Interaktion eher um eine Transaktion als um eine Konversation handelt, ist eine kaskadierte Pipeline aus Speech-to-Text, einem Textmodell und Text-to-Speech fast immer günstiger, da man bei geringer Latenz viel sparen kann. Modellieren Sie die kaskadierte Alternative mit dem Kostenrechner für Sprachagenten und die Speech-to-Text-Rechner, und überprüfen Sie die Rückgabe anhand des Personals ROI-Rechner für Sprachagenten. Bei den hier aufgeführten Preisen handelt es sich um bearbeitbare Referenzschätzungen. Überprüfen Sie immer die aktuellen Audio-Token-Preise auf der Preisseite Ihres Anbieters.
Kosten für Echtzeit-Sprach-APIKosten für AI Voice AgentKosten für die BilderzeugungSpeech-to-Text-KostenKosten für Text-to-Speech
Häufig gestellte Fragen
Warum ist die Echtzeit-Audio-API so viel teurer als Text?
Da Audio als eigene Art von Token abgerechnet wird und Audio-Tokens um ein Vielfaches teurer sind als Text-Tokens. Ein Speech-to-Speech-Modell wie GPT Realtime oder Gemini Live wandelt etwa eine Minute Sprache in etwa tausend Audio-Tokens um, und sowohl der von Ihnen gesendete Ton als auch der Ton, den das Modell zurückspricht, werden in Rechnung gestellt – der ausgegebene Ton kostet normalerweise den höchsten Preis von allen. Ein zehnminütiger Sprachanruf kann daher mehr kosten als Tausende von Text-Chat-Nachrichten. Dieser Rechner trennt Audioeingang, Audioausgang und alle Textanweisungs-Token, sodass Sie genau sehen können, wohin das Geld fließt.
Ist ein Echtzeit-Speech-to-Speech-Modell günstiger als STT + LLM + TTS?
Dies hängt von den Lautstärke- und Latenzanforderungen ab. Eine kaskadierte Pipeline – ein Speech-to-Text-Modell, dann ein Text-LLM, dann ein Text-to-Speech-Modell – kostet normalerweise weniger pro Minute, weil Text-Tokens günstig sind und Transkription und Synthese zur Ware werden. Ein natives Echtzeitmodell kostet mehr pro Minute, hat aber eine viel geringere Latenz und behält Ton, Unterbrechungen und Timing bei, was für eine natürliche Konversation wichtig ist. Als Faustregel gilt: Verwenden Sie Echtzeit, wenn die Gesprächsqualität den Aufpreis rechtfertigt, und kaskadieren Sie, wenn Sie kostenbewusst sind oder die Interaktion eher transaktional ist. Der Rechner zeigt die Kosten in Echtzeit an, sodass Sie sie mit einer kaskadierten Schätzung unserer Sprachagenten-Tools vergleichen können.
Wie viele Audio-Tokens enthält eine Redeminute?
Als Arbeitszahl gelten etwa eintausend bis sechzehnhundert Audio-Tokens pro Sprechminute, je nach Modell und Art der Audiokodierung. Der Standardwert hier ist eine mittlere Schätzung, die Sie mit dem genauen Tarif aus den Dokumenten Ihres Anbieters überschreiben können. Was für ein Budget am wichtigsten ist, ist, dass beide Richtungen abgerechnet werden: Die Minuten, die der Benutzer spricht, sind Eingabe-Audio-Tokens, und die Minuten, die der Agent spricht, sind Ausgabe-Audio-Tokens, die normalerweise die teuerste Zeile auf der Rechnung sind. Reduzieren Sie die Ausführlichkeit der Agenten, und Sie senken die größten Kosten.