LLM API の価格設定の仕組み

トークン、入力と出力、コンテキスト ウィンドウ — 同じタスクが、あるモデルでは別のモデルの 50 倍のコストがかかる理由を簡単に説明します。

学ぶ › LLM のセルフホスティングと API 呼び出しごとの支払い

LLM の自己ホストと API 呼び出しごとの支払い

API の請求額が大きくなると、「オープンウェイト モデルを独自のハードウェアで実行して、トークンごとの支払いをやめたらどうだろう?」という魅力的な考えが浮かび上がります。それが正しい行動である場合もあります。多くの場合、そうではありません。このガイドでは、両側の実際のコストを示しているため、推測する代わりに損益分岐点を見つけることができます。

2 つの非常に異なるコスト形状

中心的な違いはコストの形状です。ホスト型 API は、 純粋な変動費: トークンごとに料金が発生し、アイドル状態では何も発生せず、1 回の通話から数百万回の通話までスムーズに拡張できます。セルフホスティングは ほとんどが固定費: GPU をレンタルまたは購入すると、GPU がビジー状態であってもアイドル状態であっても同じコストがかかり、さらにそれらを実行するためのエンジニアリング時間がかかります。

その 1 つの違いが全体の決定を左右します。 API は、使用量が少ない、急増している、または予測できない場合に最適です。セルフホスティングが成功できるのは、使用量が高く、安定しており、高価なハードウェアをビジー状態に保つのに十分な予測可能な場合に限られます。

セルフホスティングの実際の費用

GPU のレンタルまたは購入は見出しの数字にすぎません。完全な請求書には次のものが含まれます。

  • コンピューティング, GPU インスタンスは時間単位で価格設定されており、モデルを常に利用できるようにしたい場合は、24 時間年中無休で料金を支払います。
  • エンジニアリング時間、サービスを展開、最適化、監視、パッチ適用し、稼働状態を維持します。これは、一時的なものではなく、定期的に発生する給与コストです。
  • アイドル廃棄物、GPU がフル使用率を下回る時間ごとに、無駄にお金が費やされてしまいます。
  • 信頼性のオーバーヘッド、冗長性、フェイルオーバー、トラフィックピーク時のスケーリングなど、ホストされた API が目に見えない形で処理します。

チームはいつも最後の 3 つを過小評価します。 GPU の請求額が表示されます。人間とアイドル時間はそうではありません。

APIの価格に含まれるもの

ホスト型プロバイダーにトークンごとに支払う場合、単にコンピューティングを購入するだけではありません。あなたはハードウェア、稼働時間、スケーリング、セキュリティ、運用チーム、そしてゼロから大規模なボリュームに瞬時に移行する能力を購入することになります。トークンごとの価格には、それらすべてがバンドルされています。

また、容量計画の必要もありません。ウォームを維持する GPU の数については決定がなく、ノードが停止したときに午前 3 時にページが表示されることもありません。多くのチームにとって、その運用上の軽減は、プロバイダーが請求する生のコンピューティング マージンよりも価値があります。

損益分岐点ロジック

損益分岐点とは使用率のことです。セルフホスト型 GPU には、ほぼ固定された月額コストと、生成できるトークンの最大スループットがあります。月額コストを実際にプッシュするトークンで割ると、トークンごとの有効コストが求められます。トラフィックによって GPU が全負荷に近い状態に保たれる場合、その実効コストが API を低下させる可能性があります。 GPU が半分アイドル状態の場合、トークンあたりの実効コストは 2 倍になり、API が勝つ可能性が高くなります。

説明的な例 (架空の数字): GPU インスタンスのコストが月額 1,500 ドルで、現実的に、たとえばフル稼働で月額 5 億トークンを提供できる場合、フロアコストは 100 万トークンあたり 3 ドルですが、これは実際に 5 億すべてを使用した場合に限ります。わずか 1 億を実行すると、実際のコストは 100 万あたり 15 ドルとなり、5 倍悪くなります。モデル比較ページでその実効数値を API レートと比較してください。

品質と能力の違い

コストだけが軸ではありません。最強のフロンティア モデルは通常、ホストされた API を通じてのみ利用できますが、セルフホスティングとはオープンウェイト モデルを実行することを意味し、これは優れていますが、最も困難なタスクでは最高のクローズド モデルに劣る可能性があります。ユースケースで最上位の機能が必要な場合、セルフホスティングは選択肢にさえ入らない可能性があります。

一方、セルフホスティングでは、データ制御 (インフラストラクチャから何も出ない)、独自のハードウェアを超えるレート制限がなく、プロバイダーの価格変更からの自由が得られます。規制された業界やプライバシーに敏感なデータの場合は、より高い実効コストを上回る可能性があります。

現実的な意思決定パス

合理的な経験則:

  • ホストされた API から始めます。 これは、資本支出なしで実際の量を達成し、製品を検証するための最も安価な方法です。
  • 毎月の支出を追跡します。 それが大きく安定して大きくなったら、エンジニアリング時間と現実的な (理論的ではなく) 使用率を含めて、セルフホストの代替モデルを正直にモデル化します。
  • ハイブリッドを考えてみましょう。 小規模な自己ホスト型オープン モデルで大量の単純なタスクを処理し、ハード クエリをホスト型フロンティア API にルーティングします。

LLM コスト計算ツールを使用して現在の API 使用量の価格を計算し、完全にロードされたセルフホストの見積もりと比較します。運営に携わる人々の給与コストを忘れずに含めてください。損益分岐点の計算では、この線がひっそりと省略されています。

よくある質問

セルフホスティングが安くなるのはいつですか?

エンジニアリング時間を考慮した上で、高価な GPU をフル稼働に近い状態に保つのに十分なほど使用率が高く、安定している場合に限ります。ボリュームが少ないか急増している場合は、ほとんどの場合、ホスト型 API の方が安価です。

同じ品質のモデルを自分で実行できますか?

強力なオープンウェイト モデルを実行できますが、最も有能なフロンティア モデルは通常 API のみです。タスクに最高レベルのパフォーマンスが必要な場合、セルフホスティングではそれに匹敵しない可能性があります。

セルフホスティングの際に人々が忘れてしまうコストは何でしょうか?

エンジニアリングと運用時間に加えて、GPU のアイドル時間。ハードウェアの請求額は目に見えていますが、それを実行するための給与と、支払ったものの使用されなかった容量が、ほとんどの見積もりを下回るコストとなります。

教育のみであり、経済的なアドバイスではありません。