この用語集の使い方
API と AI の価格ページには、実際に支払う金額が隠されている専門用語が満載です。以下に、最も一般的な 40 の用語をグループ化して示します。 LLM の価格とトークン, インフラストラクチャとセルフホスティング、 そして 課金モデル。各定義はベンダー中立であり、コストの観点に焦点を当てています。 LLM 請求を初めて使用しますか?まずは私たちのものから始めましょう LLM API の価格設定の仕組み ガイドを使用して実数を推定します。 トークンコスト計算ツール.
トークンコスト計算ツール →すべての学習ガイド →LLM の価格とトークン
- トークン
- LLM が読み書きするテキストの小さな単位。英語では単語の約 3/4、またはおよそ 4 文字です。請求はトークンごとに行われるため、LLM の請求額はトークン数 (リクエスト数ではありません) によって決まります。
- 入力トークン
- The tokens you send to the model: your prompt, system instructions, conversation history and any attached context.通常は 2 つの料金のうち安い方ですが、呼び出しのたびにコンテキストを再送信すると、料金は速く増加します。
- 出力トークン
- モデルが応答で生成するトークン。テキストの生成には読み取りよりも多くのコンピューティング コストがかかるため、出力の価格はほとんどの場合入力よりも高くなります (通常は 3 ~ 5 倍)。
- コンテキストウィンドウ
- モデルが一度に考慮できるトークンの最大数 (例: 128K または 1M)。これは空き容量ではなく、容量の上限です。ウィンドウに配置したすべてのトークンは、呼び出しごとに請求されます。
- 100万トークンあたりのコスト
- 標準ユニット LLM 価格は ($/100 万トークン) で見積もられ、入力と出力に分けてリストされます。毎月のトークン量にこれらのレートを乗じることが、費用を見積もる最も早い方法です。
- 即時キャッシュ
- 繰り返されるプロンプト プレフィックス (長いシステム メッセージまたはドキュメント) を保存し、呼び出しごとに再処理されないようにする。キャッシュされた入力は大幅な割引 (多くの場合 75 ~ 90% オフ) で請求され、反復的なワークロードのコストが削減されます。
- 推論トークン
- 一部のモデルが目に見える答えの前に生成する、隠された「思考」トークン。これらは目には見えませんが、出力として請求されます。これは、推論モデルにおいて見落とされがちな主要なコスト要因です。
- マルチモーダルトークン
- 画像、音声、ビデオは、課金用のトークンに相当するものに変換されます。 1 つの高解像度画像には数百または数千の入力トークンが必要となるため、マルチモーダル プロンプトはテキストだけよりも早く加算されます。
- ブレンド率
- 一般的な組み合わせに従って入力レートと出力レートを組み合わせた、トークンあたりの単一の平均価格。簡単な見積もりには役立ちますが、出力が請求額の高価な半分であることは隠されます。
- バッチAPI
- 通常約 50% の割引と引き換えに、遅延ウィンドウ (多くの場合最大 24 時間) 内で大規模なジョブを処理する非同期エンドポイント。一括分類や埋め込みなどの緊急ではない作業に最適です。
- 埋め込み
- 類似性によって検索できるように、テキスト、画像、またはその他のデータの意味を表す数値ベクトル。これらはトークンごとに生成するのに安価であり、セマンティック検索と RAG を支えます。
- 微調整
- 独自のサンプルに基づいて基本モデルをさらにトレーニングして、その動作を特殊化します。事前のトレーニング コストが追加され、ホストされたモデルでは、多くの場合、基本モデルよりもトークンごとの推論レートが高くなります。
- RAG (検索拡張生成)
- ドキュメント全体をコンテキストに詰め込むのではなく、ナレッジ ベースから関連するスニペットのみを取得してプロンプトに追加するパターン。データに基づく回答を維持しながら、入力トークンをトリミングします。
- モデル層(フラッグシップ/ミッド/ナノ)
- プロバイダーは、フラッグシップ (最も機能が高く、最も高価)、ミッドレンジ (バランスのとれた)、およびナノ/スモール (最も安く、最速) など、さまざまな機能と価格レベルのモデル ファミリを提供しています。タスクの難易度に応じてレベルを調整することが、コストを左右する最大の要因となります。
- 温度
- 出力のランダム性を制御する 0 から約 2 までの設定。これは価格に直接影響するのではなく、回答スタイルに影響しますが、値が高いほど、より長い応答やより多様な応答が生成され、出力トークンのコストが変化する可能性があります。
- 関数/ツール呼び出し
- 定義されたツールまたは API の 1 つを実行するための構造化リクエストをモデルに返すようにします。ツール定義は呼び出しごとに入力トークンとして送信され、複数ステップのツール ループにより合計トークン使用量が増加します。
- ストリーミング
- モデルの出力トークンを 1 つのブロックではなく生成時にトークンごとに配信します。体感速度が向上し、最初のトークンまでの時間が短縮されますが、トークンの合計価格は変わりません。
- 蒸留
- より小さな「生徒」モデルをトレーニングして、より大きな「教師」モデルを模倣します。その結果、対象のタスク セットの品質の多くを維持しながら、トークンあたりの実行コストがはるかに安くなります。
- 量子化
- モデルの重みの数値精度を下げることで (例: 16 ビットから 4 ビットに)、必要なメモリが減り、より高速に実行されます。セルフホスティングの場合、これにより GPU コストが削減されますが、通常は品質が若干犠牲になります。
- 推論
- トレーニングされたモデルを実行して出力を生成します。これは、API 呼び出しごとに料金を支払う行為です。推論コストは、ホスト型 API のトークンとセルフホスト型 GPU のコンピューティング時間に応じて変化します。
インフラストラクチャとセルフホスティング
- レート制限 (RPM / TPM)
- プロバイダーがアカウントごとに適用する上限: RPM は 1 分あたりのリクエスト、TPM は 1 分あたりのトークンです。どちらかを超えると 429 エラーが返されるため、スケールするにはバッチ処理、キューイング、またはより上位の層が必要です。
- 同時実行制限
- 同時に実行できるリクエストの最大数。実行できる並列ジョブの数に制限があり、セルフホストまたはプロビジョニングされたセットアップでは、支払う必要があるハードウェアのサイズが直接決まります。
- TTFT / レイテンシ
- TTFT (time-to-first-token) は、最初の出力トークンが到着するまでの時間です。レイテンシは合計応答時間です。これらはユーザー エクスペリエンスを形成し、レンタル GPU では遅延が長くなり、リクエストごとに請求されるコンピューティングが増加します。
- スループット
- システムが 1 秒あたりに処理するトークンまたはリクエストの数。スループットが高くなると、同じハードウェア上でより多くのユーザーにサービスを提供できるため、セルフホストまたはキャパシティを予約する場合のリクエストあたりのコストが下がります。
- ベクトルデータベース
- エンベディングを保持し、類似性によって検索するために最適化されたストア。 RAG とセマンティック検索を強化し、通常はトークンではなく、保存されたベクトル、ディメンション、クエリによって価格が設定されます。
- GPU / VRAM
- モデル推論を実行するグラフィックス プロセッサとそのビデオ メモリ。モデルをロードするには VRAM に収まる必要があるため、モデルが大きくなると、より高価でメモリの多い GPU (セルフホスティングのコアコスト) が必要になります。
- セルフホスティング
- ホストされた API を呼び出す代わりに、独自のハードウェアまたはレンタルしたハードウェアでオープンウェイト モデルを実行します。これにより、トークンごとの料金はなくなりますが、固定の GPU、エンジニアリング、アイドル容量のコストが追加され、大量の場合にのみ利益が得られます。
- 下り/帯域幅
- クラウド プロバイダーのネットワークから送信されるデータの料金。 AI 予算の中で忘れられがちですが、大規模なデータセット、メディア、またはモデルの重みをサービス間またはリージョン間で移動する場合、下り料金が多額になる可能性があります。
- コールド スタート (サーバーレス)
- サーバーレス関数またはモデル コンテナーがアイドル状態からスピンアップして応答するまでの遅延。これによりレイテンシが追加され、ロード時間が長い大規模なモデルの場合は、よりコストがかかる常時ウォーム キャパシティーを使用することになる可能性があります。
- プロビジョニングされたスループット
- トークンごとに支払うのではなく、固定の保証された量のモデル容量を、定額の時間料金または月額料金で予約します。安定した大容量トラフィックのコストと遅延は安定しますが、アイドル状態ではコストが無駄になります。
- スポットとオンデマンド
- オンデマンド インスタンスはいつでも定価で利用できます。スポット (プリエンプティブル) インスタンスは、大幅な割引価格で予備容量を使用しますが、ほとんど通知せずに再利用できます。スポットは、待ち時間が重要なサービスではなく、中断可能なバッチ ジョブに適しています。
- 確約利用/予約容量
- 1 ~ 3 年間の最低支出または特定のハードウェアの利用と引き換えに割引。予測可能なワークロードの実効レートは低下しますが、拘束されてしまいます。
- SLA (稼働時間)
- サービス レベル アグリーメントは、可用性 (例: 99.9%) と、それを達成できなかった場合のクレジットのプロバイダーの契約上の約束です。通常、SLA レベルが高くなるとコストも高くなりますが、運用の信頼性にとっては重要です。
請求と価格モデル
- シートごとの価格設定と使用量ベースの価格設定
- シートごとでは、アクティビティに関係なく、各ユーザーに対して定額料金が請求されます。実際に消費したもの (トークン、通話、コンピューティング) に対する使用量ベースの料金。席は予測可能です。使用量は需要に応じて増減するため、予期せず急増する可能性があります。
- クレジット
- サービスを使用するときに購入し、引き落としられるプリペイド残高。クレジットは請求をスムーズにしますが、有効期限が切れる可能性があり、そのユニットあたりの価値により、実際のトークンあたりまたはコールあたりの価格がわかりにくくなる場合があります。
- 超過料金
- プランに含まれている許容量を超える使用量には、別の (多くの場合、より高い) 料金が請求されます。超過料金は、トラフィックがサインアップしたレベルを超えた場合に突然請求される一般的な原因です。
- 無料利用枠
- サービスを評価するための無料の枠 (毎月のクレジット、通話制限、または試用期間)。テストには便利ですが、実稼働には十分ではなく、制限や有効期限が適用されます。
- TCO (総所有コスト)
- ソリューションの実行にかかる全コスト。API や GPU の料金だけでなく、エンジニアリング、モニタリング、ストレージ、下り、オーバーヘッドも含まれます。ホスト型とセルフホスト型の比較は、TCO に関してのみ意味があり、ヘッドライン料金では意味がありません。
- ユーザーあたりのコスト
- AI または API の合計支出をアクティブ ユーザーで割ったもの。生の使用量をユニットエコノミーに変換し、収益やサブスクリプション価格と比較して、機能が収益性があるかどうかを確認できます。
- ゲートウェイ/ルーターのマークアップ
- AI ゲートウェイまたはモデル ルーターがルーティング、フォールバック、分析、または統合請求の基礎となるプロバイダーの価格に追加する料金。便利ではありますが、マークアップによりトークンごとの有効コストが大幅に上昇する可能性があります。
よくある質問
トークンとは何ですか?
トークンは、LLM が読み取って生成するテキストの小さな塊で、英語では単語のおよそ 3/4、または約 4 文字です。プロバイダーは、送信するテキスト (入力) とモデルが生成するテキスト (出力) の両方に対してトークンごとに料金を請求します。そのため、リクエスト数ではなくトークン数によって LLM の料金が発生します。
プロンプト キャッシングとは何ですか?
プロンプト キャッシュを使用すると、プロバイダーは長いシステム プロンプトやドキュメントなどの繰り返しのプレフィックスを保存できるため、呼び出しごとに再処理されることがなくなります。キャッシュされた入力トークンは大幅な割引 (多くの場合 75 ~ 90% オフ) で請求されるため、同じコンテキストを再送信するワークロードのコストが削減されます。
レート制限における TPM と RPM は何を意味しますか?
RPM は 1 分あたりのリクエスト、TPM は 1 分あたりのトークンであり、プロバイダーがアカウントに強制する 2 つの上限です。どちらかを押すと 429 エラーが返されるため、大容量アプリは無制限のスループットを想定するのではなく、より高い階層をバッチ、キュー、またはリクエストする必要があります。
教育上の参考のみ - 価格条件と割引はプロバイダーによって異なります。現在の詳細は各プロバイダーの料金ページでご確認ください。