推論の各作業にかかる費用
選択したモデルで同じプロンプトと音量 - 推論の乗数がまったくの違いになります。
| 努力 | 推論トークン | リクエストに応じて | 毎月 |
|---|
usage.reasoning_tokens 独自のトラフィック用の(または同等の)フィールド。以下の料金は、2026 年の代表的な産出/投入価格です。各プロバイダーに現在の価格を確認してください。 · 古い価格を報告する →推論モデルの請求書が見た目よりも大きい理由
通常のチャット モデルでは、送信したトークン (入力) と書き戻されたトークン (出力) に対して料金が発生します。推論モデルは、3 番目の目に見えないカテゴリを追加します。 思考トークン 表示される答えを作成する前に問題を解決するために内部で生成されます。そのスクラッチ作業を受け取ることはありませんが、その対価を支払うのです。プロバイダーはその料金を測定します。 出力レート、最も高価な層。その結果、単純な「入力 + 目に見える出力」の見積もりが予測する額の数倍の請求額になる可能性があります。これは、ハードなプロンプトでは、モデルが 400 トークンの答えを生成するために 5,000 トークンの推論を消費する可能性があるためです。
この計算機は隠れた半分を見えるようにします。期待する入力と表示される出力を入力し、推論作業を選択する (または API の使用状況フィールドから正確な推論トークン数を入力する) と、3 つのストリームすべての価格が計算されます。 「実際の月額コスト」には、次のような考え方が含まれます。 「推論を無視した場合」の数値は罠です。プロンプトと応答のみを確認するトークン カウンターから得られる数値です。月末にチームを驚かせるのは、両者の差だ。
コストの推論に関する 3 つのレバー
1. 努力。 ほとんどの推論 API は、低/中/高 (またはトークンバジェット) コントロールを公開します。深く考える必要のないプロンプトを高から中まで下げると、回答の品質に目に見える変化はなく、請求額を半分にすることができます。上の表は、ワークロードの正確な違いを示しています。 2. ルーティング。 本当に難しいタスクについては推論にお金を払う価値があり、簡単なタスクにはまったくの無駄が伴います。単純なリクエストをより安価な非推論モデルに送信し、ハードテールのために思考を留保します。分割のサイズを指定します。 モデル ルーティングの節約計算ツール. 3. 迅速な設計。 より明確で制約の多いプロンプトでは、探索が少なくて済むため、生成される推論トークンが少なくなります。これは、より優れたプロンプトが安価なプロンプトであるというまれなケースです。
使い方
1. 推論モデルを選択し、毎月のリクエスト量を入力します。
2. リクエストごとに一般的な入力トークンと表示される出力トークンを入力します。
3. 推論の取り組みを選択するか、「手動」を選択して測定した推論トークンを入力します。
4. 実際のコストを読み、隠れた考えがどれだけあるかを確認し、表を使用して予算に合った労力レベルを見つけてください。
よくある間違い
目に見える出力のみに予算を設定します。 通常、思考トークンは大きい半分です。これらを無視すると、予測は何倍も外れます。 あらゆる場所で努力を怠りません。 高い労力はデフォルトであり、要件ではありません。ほとんどのプロンプトでは必要ありません。 ヘッドライン価格に関する推論モデルとチャット モデルを比較します。 トークンあたりのレートは同じですが、トークン数は大きく異なります。100 万あたりではなく、リクエストあたりの実際のコストで比較します。 キャッシュが推論に役立つと仮定します。 プロンプト キャッシング割引が繰り返される 入力;新たに生成された推論トークンに対しては何も行いません。
よくある質問
読み取ることさえできないトークンに対して料金が請求されるのでしょうか?
はい。推論モデルは、応答から思考トークンを隠しますが、出力レートでそれらに請求します。 API は使用状況フィールドにカウントを返すので、それを監査できます。
「通常」の推論トークンの数はいくつですか?
労力と難易度に応じてスケールします。難しい問題の場合、少ない労力で目に見える出力が約 2 倍、中程度の労力で約 5 倍、高い労力で 10 ~ 15 倍以上になります。正確な乗数を得るには、独自のトラフィックを測定してください。
推論モデルがチャット モデルよりも安いことはありますか?
コストだけで考えられることはほとんどありません。難しいタスクを実行するには、より大きなモデルや数回の再試行が必要になる場合でも、結果的には安くなります。簡単なタスクの場合は、常に非推論モデルが価格で勝ちます。
推論の支出に上限を設けることはできますか?
多くの API では、推論努力の設定または明示的な思考トークンの予算によって可能です。それを引き下げることは、この法案の唯一最大の手段である。表は節約を示しています。
見積もりのみ。推論トークンの使用量は、プロンプトとプロバイダーの労力制御によって決まります。予算を立てる前に、実際の API 使用量データに対して検証してください。