すべてはトークンごとに価格設定されます
LLM プロバイダーはリクエストごとまたはワードごとに料金を請求しません。 トークン。トークンはテキストの塊で、英語の単語のおよそ 3/4 (約 4 文字) です。 「APICostCalc は便利です」は ~5 トークンです。送信するテキストの両方 (入力) とモデルが生成するテキスト (出力)がカウントされ、通常は価格が付けられます 違う.
トークンコスト計算ツール →入力と出力 — 出力は高価なものです
ほぼすべてのモデルで、 出力トークンのコストは入力トークンよりも高くなります — 多くの場合、3 ~ 5 倍になります — テキストの生成は、テキストを読み取るよりも多くの計算量を必要とするためです。同じリクエスト量であっても、長い回答を書くチャットボットのコストが、テキストを 1 つの単語に分類するチャットボットよりもはるかに高くなるのはこのためです。
| コスト要因 | 請求書への影響 |
|---|---|
| 通話ごとに長いシステム プロンプトが送信される | 入力トークンにリクエスト数を乗算します |
| 詳細な模範解答 | 出力トークン — 最も高価な種類 |
| 大きなコンテキスト (RAG チャンク、履歴) | 入力トークンのバルーンが速い |
| 推論/「思考」モデル | 出力として課金される非表示の推論トークン |
コンテキスト ウィンドウはコストの上限であり、空き領域ではありません
モデルさんの コンテキストウィンドウ (例: 128,000 または 1,000 万トークン) が一度に読み取れる最大値ですが、そこに入れられたすべてのトークンに対して料金が請求されます。 毎 電話。各リクエストのコンテキストにドキュメント全体を詰め込むのは便利ですが、コストがかかります。それが RAG とキャッシュによって解決される問題です。
コンテキストウィンドウのコスト →トークンコストの推論 →同じタスクがモデル間で 50 倍も異なる理由
フロンティア モデルは、100 万トークンあたり数十ドルの費用がかかる場合があります。小型モデルまたはオープンモデルは数セントです。安価なモデルが許容できる品質でタスクを処理する場合、1 行の構成でコストを一桁削減できます。このスキルは、モデルの強度をタスクの難易度に合わせることです。「」を参照してください。 コスト削減ガイド.
モデル価格を比較 →実用的な例: 同じタスクにおける nano とフラッグシップ
分類していると言う 毎月 100,000 サポート チケット。各呼び出しは、最大 2,000 の入力トークン (チケット テキスト + 数ショットのプロンプト) を送信し、最大 500 の出力トークン (ラベル + 短い説明) を返します (合計 200M の入力トークンと 5000 万の出力トークン)。
| モデル | 投入コスト | 出力コスト | 合計/月 |
|---|---|---|---|
| GPT-5 ナノ (1M あたり 0.10 ドル / 0.40 ドル) | 200M × 0.10 ドル = 20 ドル | 5,000万 × 0.40ドル = 20ドル | $40 |
| GPT-5.5 ($5.00 / 1M あたり $30.00) | 2 億 × 5.00 ドル = 1,000 ドル | 5000 万 × 30.00 ドル = 1,500 ドル | $2,500 |
同じタスク、同じ量 – フラッグシップモデルのコスト 62倍以上 純粋にトークンごとの価格設定から、nano モデルよりも優れています。分類などの制限されたタスクの場合、安価なモデルの精度が基準をクリアしているかどうかをテストすることは、通常、他のコスト最適化よりも価値があります。
GPT-5コスト計算ツール →機種変更せずに料金を安くする2つの方法
より安価なモデルを選択することがすべての節約につながるわけではありません。プロバイダー側の 2 つのメカニズムにより、 同じ のモデル 同じ タスクの呼び出し方法を変更するだけです。
| 技術 | 通常の割引 | トレード・オフ |
|---|---|---|
| 即時キャッシュ | 入力のキャッシュされた部分を最大 90% オフ | 繰り返されるプレフィックス (システム プロンプト、固定ドキュメント) のみが割引されます。各リクエストの一意の末尾は通常どおり請求されます。 |
| バッチAPI | 通話全体が最大 50% オフ | 結果は数秒ではなく数分から数時間で届きます。レポートや一括ラベル付けには適していますが、ライブチャットボットには適していません。 |
これらは、モデルの選択に反するのではなく、モデルの選択と重なります。夜間のラベル付けにはレイテンシー要件がないため、安価なモデルですでに実行されているサポートチケット分類子は、多くの場合、バッチ処理を上に追加できます。 プロンプトキャッシュ節約計算ツール そして バッチ API ガイド ワークロードの正確な計算については。
LLM コストを見積もる際のよくある間違い
- 入力と出力を 1 つのトークン カウントに平均化します。 出力の価格は 3 ~ 5 倍高いため、それらをブレンドすると、冗長な応答スタイルの実際のコストが隠れてしまいます。
- システムプロンプトを忘れると、通話ごとに料金が請求されます。 長いシステム プロンプトまたは会話履歴は、入力トークンとしてカウントされます。 それぞれ リクエストはセッションごとに 1 回ではありません。
- 間違ったポイントリリースに対するベンチマーク。 「GPT-5」と「GPT-5.5」では価格が数倍異なる場合があります。ファミリー名ではなく、実際に呼び出す正確なモデル ID を必ず確認してください。
- 隠された推論トークンを無視します。 「思考」モデルは、目に見える応答には決して現れない場合でも、内部推論を出力トークンとして請求します。 推論トークン計算機.
よくある質問
LLM API のトークンとは何ですか?
トークンは、モデルが処理するテキストの小さな塊です。英語では、単語のおよそ 3/4 または約 4 文字です。プロバイダーは、送信するテキスト (入力) とモデルが生成するテキスト (出力) の両方に対してトークンごとに請求します。
出力トークンのコストが入力トークンよりも高いのはなぜですか?
テキストの生成には読み取りよりも多くの計算が必要となるため、プロバイダーは出力トークンの価格を高く設定します (通常、入力レートの 3 ~ 5 倍)。これにより、冗長なモデル応答が主なコスト要因となります。
コンテキスト ウィンドウを大きくするとコストも高くなりますか?
実際に使用するトークンのみ。このウィンドウは最大容量ですが、コンテキスト内に配置したすべてのトークンは呼び出しごとに請求されるため、大規模なプロンプトを繰り返し送信すると、すぐにコストが高くなります。
1 つのモデルで同じタスクに 50 倍のコストがかかるのはなぜでしょうか?
100 万トークンあたりのモデル価格は、フロンティア モデルと小規模/オープン モデルの間で大きく異なります。より安価なモデルが特定のタスクの品質基準を満たしている場合、そのモデルに切り替えることでコストを桁違いに削減できます。
機種変更せずにコスト削減はできるのか?
はい - プロンプト キャッシュはリクエストの繰り返しのプレフィックスを約 90% 割引し、バッチ API は緊急でないジョブ全体を約 50% 割引します。どちらもまったく同じモデルに適用されるため、モデル選択による節約と積み重なっていきます。
教育上の参考のみ — 価格は推定値です。各プロバイダーの料金ページで現在の料金を確認してください。