すべての文字起こし API がボリュームに応じてランク付けされます
同じオーディオ時間、安い順。
| プロバイダー/層 | ドル/分 | 月額料金 |
|---|
1分あたりの価格設定、スプレッド5倍
Speech-to-Text API の請求書は 1分間の音声ファイル サイズやワード数ではないため、作業量の計画が簡単になります。時間を見積もり、60 倍し、1 分あたりの料金を掛けます。問題はスプレッドの広さです。 Deepgram と AssemblyAI のバッチ層の文字起こし料金は 1 分あたり 0.5 セント未満ですが、OpenAI の Whisper API は 10 分の 6 セント程度で、ハイパースケーラー サービス (Google、AWS Transcribe、Azure) は通常、1 分あたり 2 ~ 4 倍の料金がかかります。月に数千時間以上かかると、同じ生産量の場合、その差は年間数千ドルに変わります。
もう 1 つの大きな基準はバッチとリアルタイムです
2 番目のコストレバーは、 レイテンシ。リアルタイム ストリーミング文字起こし (ライブ キャプション、音声エージェント、通話モニタリング) はオープンな接続を保持し、話されたとおりに単語を返します。プロバイダーはこれに対して割増料金を請求します。記録されたファイルのバッチ転写はバックグラウンドで実行され、大幅にコストがかかります。会議の概要、ポッドキャストのトランスクリプト、アーカイブされた通話分析など、数分間待つことができる製品の場合は、バッチを使用して差額をポケットに入れましょう。ユーザーが本当に言葉を待っている場合にのみ、リアルタイム料金を支払います。
Whisper をセルフホストする場合
オープンソースの Whisper では、分単位の料金はかかりませんが、GPU、運用コスト、アイドルコストが追加されます。月に数百時間未満では、ホスト型 API が価格とシンプルさの両方で優れています。それ以上であれば、GPU を十分に活用してほぼほぼ時間内で実行すれば、それを上回る可能性があります。あなたのクロスオーバーを見つけてください セルフホスト型と API の計算ツール。文字起こしが LLM にフィードされる場合 (要約、通話上の Q&A)、そのトークン コストが LLM トークンコスト計算ツール、パイプライン全体を合計します。 AI アプリのコスト見積りツール.
関連ツールとガイド
AI アプリのコスト見積りツール · セルフホスト型と API の計算ツール · AI音声エージェントコスト計算ツール · 最安の LLM API · すべての AI API