この計算機の仕組み
の セルフホストと API のコスト計算ツール では、トークンごとの API レートでプロバイダーに支払う金額と、GPU をレンタルしてオープン モデルを自分で実行する場合にかかる費用の 2 つの月次数値を並べて計算します。 API 側はシンプルです。 月あたりのトークン を乗じた 100万トークンあたりのAPI価格。セルフホスト側は、 GPU 時間当たり料金、モデルの 1 秒あたりのトークン単位のスループット、そしてあなたの 現実的な活用法、これらを合わせてトークンあたりの実効コストを設定します。次に、ツールは、セルフホスティングがトークンごとに支払うよりも安くなる月間ボリュームを見つけます。
最も注目すべき数字は 利用。レンタルした GPU は、ビジーでもアイドルでも 1 時間ごとに請求が行われるため、容量の 20% で実行されているカードは、飽和状態に保たれているカードよりも実質的にトークンあたり 5 倍のコストがかかります。セルフホスティングは次の場合にのみ成功する傾向があります。 大きくて安定した音量;損益分岐点を下回ると、API の価格は通常より安くなり、固定のコミットメントはありません。切り替える前に、実際のトラフィックがハードウェアを本当にビジー状態に保つことができることを確認してください。 楽観的なスループットまたは使用率の推定 セルフホスティングを実際のパフォーマンスよりもはるかに優れたものにすることができます。
よくある質問
LLM のセルフホスティングが API より安いのはどのような場合ですか?
安定した大音量の場合のみ。レンタル GPU は 24 時間年中無休の固定コストであるため、トークンのスループットがいっぱいになると元が取れます。損益分岐点以下では、使用した分だけ料金を支払うため、トークンごとの API の方が安くなります。それ以上であれば、GPU をうまく活用すれば従量制価格よりも優れています。
セルフホスティングによって追加される隠れたコストは何ですか?
重要なのは使用率です。GPU は 24 時間課金されますが、30% の時間使用されると、トークンあたりの実効コストが 3 倍になります。それに加えて、エンジニアリング時間、スパイクの自動スケーリング、フロンティア API とのモデル品質のギャップ、および信頼性が伴います。ステッカーを保存するために切り替える前に、それらを考慮してください。