LLM API の価格設定の仕組み

トークン、入力と出力、コンテキスト ウィンドウ — 同じタスクが、あるモデルでは別のモデルの 50 倍のコストがかかる理由を簡単に説明します。

学ぶ › LLM API の価格設定の仕組み

すべてはトークンごとに価格設定されます

LLM プロバイダーはリクエストごとまたはワードごとに料金を請求しません。 トークン。トークンはテキストの塊で、英語の単語のおよそ 3/4 (約 4 文字) です。 「APICostCalc は便利です」は ~5 トークンです。送信するテキストの両方 (入力) とモデルが生成するテキスト (出力)がカウントされ、通常は価格が付けられます 違う.

トークンコスト計算ツール →

入力と出力 — 出力は高価なものです

ほぼすべてのモデルで、 出力トークンのコストは入力トークンよりも高くなります — 多くの場合、3 ~ 5 倍になります — テキストの生成は、テキストを読み取るよりも多くの計算量を必要とするためです。同じリクエスト量であっても、長い回答を書くチャットボットのコストが、テキストを 1 つの単語に分類するチャットボットよりもはるかに高くなるのはこのためです。

コスト要因請求書への影響
通話ごとに長いシステム プロンプトが送信される入力トークンにリクエスト数を乗算します
詳細な模範解答出力トークン — 最も高価な種類
大きなコンテキスト (RAG チャンク、履歴)入力トークンのバルーンが速い
推論/「思考」モデル出力として課金される非表示の推論トークン

コンテキスト ウィンドウはコストの上限であり、空き領域ではありません

モデルさんの コンテキストウィンドウ (例: 128,000 または 1,000 万トークン) が一度に読み取れる最大値ですが、そこに入れられたすべてのトークンに対して料金が請求されます。 電話。各リクエストのコンテキストにドキュメント全体を詰め込むのは便利ですが、コストがかかります。それが RAG とキャッシュによって解決される問題です。

コンテキストウィンドウのコスト →トークンコストの推論 →

同じタスクがモデル間で 50 倍も異なる理由

フロンティア モデルは、100 万トークンあたり数十ドルの費用がかかる場合があります。小型モデルまたはオープンモデルは数セントです。安価なモデルが許容できる品質でタスクを処理する場合、1 行の構成でコストを一桁削減できます。このスキルは、モデルの強度をタスクの難易度に合わせることです。「」を参照してください。 コスト削減ガイド.

モデル価格を比較 →

実用的な例: 同じタスクにおける nano とフラッグシップ

分類していると言う 毎月 100,000 サポート チケット。各呼び出しは、最大 2,000 の入力トークン (チケット テキスト + 数ショットのプロンプト) を送信し、最大 500 の出力トークン (ラベル + 短い説明) を返します (合計 200M の入力トークンと 5000 万の出力トークン)。

モデル投入コスト出力コスト合計/月
GPT-5 ナノ (1M あたり 0.10 ドル / 0.40 ドル)200M × 0.10 ドル = 20 ドル5,000万 × 0.40ドル = 20ドル$40
GPT-5.5 ($5.00 / 1M あたり $30.00)2 億 × 5.00 ドル = 1,000 ドル5000 万 × 30.00 ドル = 1,500 ドル$2,500

同じタスク、同じ量 – フラッグシップモデルのコスト 62倍以上 純粋にトークンごとの価格設定から、nano モデルよりも優れています。分類などの制限されたタスクの場合、安価なモデルの精度が基準をクリアしているかどうかをテストすることは、通常、他のコスト最適化よりも価値があります。

GPT-5コスト計算ツール →

機種変更せずに料金を安くする2つの方法

より安価なモデルを選択することがすべての節約につながるわけではありません。プロバイダー側​​の 2 つのメカニズムにより、 同じ のモデル 同じ タスクの呼び出し方法を変更するだけです。

技術通常の割引トレード・オフ
即時キャッシュ入力のキャッシュされた部分を最大 90% オフ繰り返されるプレフィックス (システム プロンプト、固定ドキュメント) のみが割引されます。各リクエストの一意の末尾は通常どおり請求されます。
バッチAPI通話全体が最大 50% オフ結果は数秒ではなく数分から数時間で届きます。レポートや一括ラベル付けには適していますが、ライブチャットボットには適していません。

これらは、モデルの選択に反するのではなく、モデルの選択と重なります。夜間のラベル付けにはレイテンシー要件がないため、安価なモデルですでに実行されているサポートチケット分類子は、多くの場合、バッチ処理を上に追加できます。 プロンプトキャッシュ節約計算ツール そして バッチ API ガイド ワークロードの正確な計算については。

LLM コストを見積もる際のよくある間違い

学び続ける

LLM 請求額を削減する方法 →トークンとリクエスト →LLM の選び方 →

よくある質問

LLM API のトークンとは何ですか?

トークンは、モデルが処理するテキストの小さな塊です。英語では、単語のおよそ 3/4 または約 4 文字です。プロバイダーは、送信するテキスト (入力) とモデルが生成するテキスト (出力) の両方に対してトークンごとに請求します。

出力トークンのコストが入力トークンよりも高いのはなぜですか?

テキストの生成には読み取りよりも多くの計算が必要となるため、プロバイダーは出力トークンの価格を高く設定します (通常、入力レートの 3 ~ 5 倍)。これにより、冗長なモデル応答が主なコスト要因となります。

コンテキスト ウィンドウを大きくするとコストも高くなりますか?

実際に使用するトークンのみ。このウィンドウは最大容量ですが、コンテキスト内に配置したすべてのトークンは呼び出しごとに請求されるため、大規模なプロンプトを繰り返し送信すると、すぐにコストが高くなります。

1 つのモデルで同じタスクに 50 倍のコストがかかるのはなぜでしょうか?

100 万トークンあたりのモデル価格は、フロンティア モデルと小規模/オープン モデルの間で大きく異なります。より安価なモデルが特定のタスクの品質基準を満たしている場合、そのモデルに切り替えることでコストを桁違いに削減できます。

機種変更せずにコスト削減はできるのか?

はい - プロンプト キャッシュはリクエストの繰り返しのプレフィックスを約 90% 割引し、バッチ API は緊急でないジョブ全体を約 50% 割引します。どちらもまったく同じモデルに適用されるため、モデル選択による節約と積み重なっていきます。

教育上の参考のみ — 価格は推定値です。各プロバイダーの料金ページで現在の料金を確認してください。

Tools & Hosting

📈 TradingView🔒 NordVPN💳 RevolutDigitalOcean $200Hostinger