—
$ / 100万トークン—トークン/時間
—トークン / GPU 月
—$ / GPU 月
GPU のアイドル時間は実際の推論コストです
トークンあたりのコストは、GPU の使用料を実際に提供されるトークンで割ったものです。そのため、実際の速度ではなく使用率によって料金が決まります。セルフホスティングがプロバイダーに勝るかどうかを判断します。 セルフホストと API の計算ツール、および基盤となるハードウェアの価格を設定します。 GPUクラウドコスト計算ツール.
GPU のレンタルとスループットを、100 万個のセルフホスト トークンあたりの実際のコストに換算します。
トークンあたりのコストは、GPU の使用料を実際に提供されるトークンで割ったものです。そのため、実際の速度ではなく使用率によって料金が決まります。セルフホスティングがプロバイダーに勝るかどうかを判断します。 セルフホストと API の計算ツール、および基盤となるハードウェアの価格を設定します。 GPUクラウドコスト計算ツール.
無料の GPU 推論コスト計算ツール — GPU の 1 時間あたりの価格、スループット、使用率をセルフホスト モデルの 100 万トークンあたりの実際のコストに変換します。
GPU の時間当たりの価格を、1 時間あたりに実際に提供されるトークンの数で割ります。これは、実際の使用率に応じてスループット (トークン/秒) の 3600 倍になります。 GPU は継続的に課金されますが、半分アイドル状態でトークンの半分を提供するため、トークンあたりのコストはデータシートのスループットと比較して 2 倍になります。
ほとんどの場合、使用とバッチ処理が行われます。ベンチマークのスループットは、バッチ処理された完全な負荷を想定しています。実際のトラフィックはバースト的であるため、メーターの実行中、GPU はリクエスト間でアイドル状態になります。継続的なバッチ処理、GPU の適切なサイズ設定、少数のより負荷の高い GPU へのトラフィックの統合が、トークンあたりのコストを下げる主な方法です。