思考トークンは出力レートで課金され、応答からは隠されます。 同じモデルの p50 (標準) 呼び出しと p99 (ハード) 呼び出しは同一のコードを実行しますが、請求書では大きく異なります。平均ではなく、その差が月々の予算を狂わせる原因となります。
単純推定 vs 典型 vs テール
「単純な」行は、単純なトークン計算ツールが示すものです。隠れた思考は完全に無視されます。典型的な行とのギャップは、実際に支払うことになる思考上のプレミアムです。最後尾の列との差が予算リスクになります。
| シナリオ | 思考トークン | 料金/通話 | 月額料金 | vsナイーブ |
|---|
テール重大度別の予算バンド
ハードプロンプトのテールがどれだけ重くなるかによって、毎月の請求額がどの程度変動する可能性があります。プロンプトが実際にどれだけ変化するかに一致する末尾の倍数を選択してください。
| テールマルチプル | p99 思考トークン | 料金/通話 | 月額料金 |
|---|
単一の通話あたりのコスト番号が推論モデルに関係する理由
非推論モデルはコストに関してほぼ決定論的です。N 個の入力トークンを送信し、M 個の出力トークンを返し、レートを乗算して完了です。推論モデルはそれを打破します。プロンプトと回答の間に、モデルはプライベートな思考の連鎖を実行します。 思考トークン — そして、それらが応答に表示されない場合でも、出力レートでそれらすべてに対して請求されます。重要なのは、カウントは データに依存する: 簡単な分類には数百ドル、厄介な複数ステップの証明やエージェント ツールの計画には数万ドルがかかる場合があります。つまり、コールあたりの本当のコストは数値ではなく分布であり、その中央値 (p50) だけを引用すると、実際に予算を使い果たす分布の部分、つまりテールが隠れてしまいます。
p50 / p99 スプレッドと税の根拠
通話あたりのコストは インプット×インプット価格 + (目に見えるアウトプット + 思考)×アウトプット価格。思考以外のすべてを固定しておくと、すべてがその 1 つの変数に基づいて回転します。通常の思考回数では、p50 のコストが得られます。ハードプロンプトの場合の思考にテールファクターを掛けると、p99 が得られます。強力な推論を使用すると、2 つは 3 ~ 5 倍離れて座ることができます。つまり、その月のプロンプトがどれだけ難しかったかに応じて、同じ月次ボリュームがその範囲のどこにいても請求される可能性があります。の 税金の理屈 — 送信した入力や受け取った回答ではなく、考えている請求書の一部 — ハードなワークロードでは、通常 70 ~ 80% をクリアします。あなたは主にスクラッチ作業に対して支払いを行っています。通常、そのシェアを確認するのは、チームが思考の上限を追加した瞬間です。
バンドを縮める方法
3本のレバーで動かします。尻尾が物理的に逃げられないように、推論の労力や最大思考トークンに制限を設けます。これにより、最も困難なプロンプトに対する回答の質が若干低下する代わりに、コストの厳しい上限が設定されます。難易度によるルーティング: 簡単な多数派を安価な非推論モデルに送信し、本当に必要なプロンプトのために推論モデルを予約します。また、平均ではなく p99 を監視します。これは、一連のハード プロンプトが平均を動かすずっと前に尾を上げているためです。ご了承ください プロンプトキャッシュ 入力側はカットしますが、思考側はカットしません。そのため、推論が多いトラフィックでは思考キャップが重要なレバーになります。これを フラット推論トークン計算機 点の推定と エージェント ループの予算計算ツール マルチステップの場合。
この計算機の仕組み
これは、推論コールの価格を、100 万トークンあたりの input×input_price + (visible_output + Thinking)×output_price として計算し、3 つのポイントを計算します。思考を無視した単純な推定、典型的な思考回数での典型 (p50) コール、および p50 での思考 × テールの倍数でのテール (p99) コールです。これは、推論税 (p50 請求額の考えられる割合)、コール量での典型的な月次合計とテールマルチプルの合計、およびテールマルチプルにわたる感応度テーブルをレポートするため、予算帯域全体を確認できます。
よくある質問
推論モデルの予算がこれほど予測できないのはなぜですか?
彼らは出力として請求される隠れた思考トークンを発行し、その数は簡単なプロンプトでは数百から、難しいプロンプトでは数万まで変動します。通常の通話で予算を設定すると、テールは通話ごとに 3 ~ 5 倍の金額を請求する可能性があります。
推論トークンのコストはどのように計算すればよいですか?
コールあたりのコスト = input×input_price + (visible_output + Thinking)×output_price、100 万トークンあたり。 Thinking は出力レートで請求され、目に見えず変動します。典型的な値とテールマルチプルを推定し、両方の価格を設定します。
根拠税とは何ですか?
入力や答えではなく、隠れた思考が請求書に占める割合。高度な推論の通話では、その料金は通常 70 ~ 80% を超えます。目に見える会話よりもスクラッチ作業に多くの費用を支払うことになります。