すべてはトークンごとに価格設定されます
LLM プロバイダーはリクエストごとまたはワードごとに料金を請求しません。 トークン。トークンはテキストの塊で、英語の単語のおよそ 3/4 (約 4 文字) です。 「APICostCalc は便利です」は ~5 トークンです。送信するテキストの両方 (入力) とモデルが生成するテキスト (出力)がカウントされ、通常は価格が付けられます 違う.
トークンコスト計算ツール →入力と出力 — 出力は高価なものです
ほぼすべてのモデルで、 出力トークンのコストは入力トークンよりも高くなります — 多くの場合、3 ~ 5 倍になります — テキストの生成は、テキストを読み取るよりも多くの計算量を必要とするためです。同じリクエスト量であっても、長い回答を書くチャットボットのコストが、テキストを 1 つの単語に分類するチャットボットよりもはるかに高くなるのはこのためです。
| コスト要因 | 請求書への影響 |
|---|---|
| 通話ごとに長いシステム プロンプトが送信される | 入力トークンにリクエスト数を乗算します |
| 詳細な模範解答 | 出力トークン — 最も高価な種類 |
| 大きなコンテキスト (RAG チャンク、履歴) | 入力トークンのバルーンが速い |
| 推論/「思考」モデル | 出力として課金される非表示の推論トークン |
コンテキスト ウィンドウはコストの上限であり、空き領域ではありません
モデルさんの コンテキストウィンドウ (例: 128,000 または 1,000 万トークン) が一度に読み取れる最大値ですが、そこに入れられたすべてのトークンに対して料金が請求されます。 毎 電話。各リクエストのコンテキストにドキュメント全体を詰め込むのは便利ですが、コストがかかります。それが RAG とキャッシュによって解決される問題です。
コンテキストウィンドウのコスト →トークンコストの推論 →同じタスクがモデル間で 50 倍も異なる理由
フロンティア モデルは、100 万トークンあたり数十ドルの費用がかかる場合があります。小型モデルまたはオープンモデルは数セントです。安価なモデルが許容できる品質でタスクを処理する場合、1 行の構成でコストを一桁削減できます。このスキルは、モデルの強度をタスクの難易度に合わせることです。「」を参照してください。 コスト削減ガイド.
モデル価格を比較 →よくある質問
LLM API のトークンとは何ですか?
トークンは、モデルが処理するテキストの小さな塊です。英語では、単語のおよそ 3/4 または約 4 文字です。プロバイダーは、送信するテキスト (入力) とモデルが生成するテキスト (出力) の両方に対してトークンごとに請求します。
出力トークンのコストが入力トークンよりも高いのはなぜですか?
テキストの生成には読み取りよりも多くの計算が必要となるため、プロバイダーは出力トークンの価格を高く設定します (通常、入力レートの 3 ~ 5 倍)。これにより、冗長なモデル応答が主なコスト要因となります。
コンテキスト ウィンドウを大きくするとコストも高くなりますか?
実際に使用するトークンのみ。このウィンドウは最大容量ですが、コンテキスト内に配置したすべてのトークンは呼び出しごとに請求されるため、大規模なプロンプトを繰り返し送信すると、すぐにコストが高くなります。
1 つのモデルで同じタスクに 50 倍のコストがかかるのはなぜでしょうか?
100 万トークンあたりのモデル価格は、フロンティア モデルと小規模/オープン モデルの間で大きく異なります。より安価なモデルが特定のタスクの品質基準を満たしている場合、そのモデルに切り替えることでコストを桁違いに削減できます。
教育上の参考のみ — 価格は推定値です。各プロバイダーの料金ページで現在の料金を確認してください。