通話量別の月額料金
音声は分数に応じて直線的に変化するため、月々の請求額は通話量を厳密に追跡します。エージェントの通話時間 (最も高価なトークン) を削減するか、通話の長さを制限することが最も早い方法です。
オーディオは高価なトークンです
リアルタイム音声モデルはまるで魔法のように感じられます。あなたが話すとモデルが話し返しますが、文字起こしのステップは目に見えません。しかし、内部では両方向の音声が毎秒音声トークンに変換され、それらのトークンの価格はテキストよりもはるかに高くなっています。 1 分間のスピーチはおよそ 1,000 ~ 1,600 個の音声トークンであり、その音声はエージェントによって異なります。 話す 通常、請求書の単一の最も高価な項目です。 8 分間の音声通話が、丸 1 日のテキスト チャットよりもコストがかかるのはこのためです。重要なのは理屈ではなく、音です。
実際的なポイントは数学からは外れます。出力音声の価格が最も高く、簡潔なアシスタントは安価なアシスタントであるため、エージェントの応答が短い方が、ユーザーのターンが短い場合よりも節約できます。最大通話時間を制限すると、予算を超過するロングテール通話から保護されます。また、インタラクションが会話型ではなくトランザクション型の場合、音声からテキストへの変換、テキスト モデル、テキストから音声へのカスケード パイプラインは、ほとんどの場合、多少の遅延と引き換えに大幅な節約と引き換えにコストが安くなります。カスケードされた代替案を次のようにモデル化します。 音声エージェントのコスト計算ツール そして 音声テキスト変換計算機を使用してスタッフに対するリターンを確認します。 音声エージェントの ROI 計算ツール。ここでの価格は編集可能な参考見積もりです。プロバイダーの価格ページで現在のオーディオ トークンの料金を常に確認してください。
リアルタイム音声 API のコストAI音声エージェントのコスト画像生成コストSpeech-to-Text のコストテキスト読み上げのコスト
よくある質問
リアルタイム オーディオ API はテキストよりもはるかに高価なのはなぜですか?
オーディオは独自の種類のトークンとして請求され、オーディオ トークンの価格はテキスト トークンの数倍であるためです。 GPT Realtime や Gemini Live などの音声合成モデルでは、約 1 分間の音声が約 1,000 個の音声トークンに変換され、送信した音声とモデルが返信した音声の両方に料金が請求されます。通常、出力音声の料金が最も高くなります。したがって、10 分間の音声通話には、数千のテキスト チャット メッセージよりも多くの費用がかかる可能性があります。この計算機は、音声入力、音声出力、およびテキスト指示トークンを分離するので、お金がどこに使われるかを正確に確認できます。
リアルタイム音声読み上げモデルは、STT + LLM + TTS よりも安価ですか?
それはボリュームとレイテンシーのニーズによって異なります。カスケード パイプライン (音声テキスト変換モデル、テキスト LLM、テキスト音声変換モデル) は、通常、テキスト トークンが安価であり、転写と合成がコモディティ化されているため、1 分あたりのコストが低くなります。ネイティブ リアルタイム モデルは、1 分あたりのコストが高くなりますが、遅延がはるかに低く、自然な会話に重要なトーン、中断、タイミングが維持されます。経験則: 会話の質がプレミアムに見合った場合はリアルタイムを使用し、コストを重視する場合や対話がよりトランザクション的な場合はカスケードを使用します。計算ツールにはリアルタイムのコストが表示されるため、音声エージェント ツールからのカスケード見積もりと比較できます。
1 分間の音声トークンは何個ですか?
実際の数値としては、モデルと音声のエンコード方法に応じて、音声 1 分あたり約 1,000 ~ 1,600 の音声トークンが発生します。ここでのデフォルトは中間の推定値であり、プロバイダーのドキュメントに記載されている正確な料金で上書きできます。予算にとって最も重要なことは、双方向で請求されることです。ユーザーが話した分は入力音声トークンであり、エージェントが話した分は出力音声トークンであり、通常、これが請求書で最も高価なラインとなります。エージェントの冗長性を削減すれば、最大のコストを削減できます。