HomeBlog › 推論トークン税

トークン税の推論: なぜ o3 は同じ定価で GPT-4.1 の 4 倍かかるのか

2026 年 7 月 30 日発行 · 参考価格、予算を立てる前に確認してください

価格表を開くと、o3 と GPT-4.1 は同じように見えます。どちらも 100 万トークンあたり 2.00 ドルのイン、8.00 ドルのアウトです。そこで、同じ請求書を期待して、両方で同じ抽出ジョブを実行しました。 o3が帰ってきた 4.3倍高価。同じ入力、同じ目に見える答え、同じトークンごとのレート。ギャップは、価格設定ページでほとんどの人が目にすることのない項目、つまり推論トークンです。

推論トークンは課金され、出力として課金されます

推論モデル (OpenAI の o1、o3、o4-mini、および GPT-5 の推論モード) は、すぐに答えにたどり着くわけではありません。彼らは最初にプライベートな思考の連鎖を生成し、次に目に見える短い応答を生成します。チェーンを見ることはありませんが、チェーンのすべてのトークンに対して支払いを行います。 出力 レート。モデルが 400 個の可視トークンを返すタスクでは、舞台裏でさらに 2,000 個の推論トークンを静かに焼き付けることができます。請求は、400 ではなく 2,400 の出力トークンに基づいて計算されます。

それがすべてのトリックです。ステッカー価格は正直です。それはトークンの価格を記述するだけであり、推論モデルははるかに高価な種類のトークンを排出します。

ヘッドライン価格(100万トークンあたりのドル)

モデル入力出力タイプ
GPT-4.1$2.00$8.00標準
o3$2.00$8.00推論
o4-mini 安い$1.10$4.40推論
o1$15.00$60.00推論
GPT-5$1.25$10.00ハイブリッド
⚠️ 参考価格、2026 年 7 月。必ずプロバイダーのページで確認してください。で独自の数字を試してください。 コスト計算機。 · 古い価格を報告する →

具体的な計算

実際の形状のワークロードを取り上げます。 1,000 リクエスト/日、それぞれ 800 個の入力トークンと 400 個の表示可能な出力トークン。 1 か月間実行します (30,000 リクエスト、2,400 万の入力トークン、1,200 万の可視出力トークン)。次に、隠れた部分を追加します。私自身の o シリーズの実行では、適度に難しいタスクが発生します。 1,500 ~ 2,500 の推論トークン;ここでは 2,000 を使用します。これにより、表示される 12M に加えて 60M の請求対象出力トークンが追加されます。

モデル推論トークン/要求月額料金
GPT-4.1 (根拠なし)0$144
o4-mini~2,000$343
o3~2,000$624

GPT-4.1 と o3 は価格表を共有していますが、o3 の請求書はありません 624ドル対144ドル — 7,200 万の出力トークン (1,200 万の可視 + 6,000 万の推論) が、1,200 万ではなく $8 メーターを通過するためです。 o4-mini はその中間です。トークンあたりの価格は安くなりますが、推論税を支払うため、価格は 343 ドルになります。これは、同じ目に見える作業を行う非推論モデルの 2 倍以上です。

誰も設定しないレバー:reasoning_effort

OpenAI は、 reasoning_effort パラメータ(最小/低/中/高)。これはこの法案の中で唯一最大のノブであり、ほとんどのコードではデフォルトのままになっています。 o3 を約 2,000 の推論トークンから約 400 に下げると、同じ月は 624ドルから​​240ドル。同じモデル、同じタスク、1 つのパラメータ - 62% カット。本当に難しい多段階問題でないものについては、通常、少ない労力または最小限の労力で評価に合格し、税金の大部分が静かに削除されます。

私が今実際にやっていること

1. 反射的に推論モデルに手を伸ばさないでください。 抽出、分類、タグ付け、ルーティング、短い要約には一連の思考は必要ありません。同じステッカー価格の標準モデルは、推論トークンを発行しないため、価格が 4 分の 1 になります。

2. If I do need reasoning, I set reasoning_effort 明示的に 低く開始し、評価で回答の品質が低下したことが証明された場合にのみ段階を上げます。

3. 読みました completion_tokens_details 分野。 API 応答が分割される reasoning_tokens 個別に - それはお金が漏れる場所であり、リクエストごとの「400 トークンが返された」メンタルモデルでは見えません。

4. ルーティングします。 安価なタスク→標準的な小型モデル。困難なタスク→測定された努力による推論モデル。シンプルなルーターであれば数日で元が取れます。の数字を参照してください。 LLM カスケード節約計算ツール.

トークン ミックスの正確な数が知りたいですか?入力したものを出力し、目に見える形で出力する そして 現実的な推論トークンの推定値を AI API コスト計算ツール →、またはプロバイダーを直接比較します。 チャットボットのコスト計算ツール。トークンの価格設定は初めてですか?から開始 学ぶ: API の価格設定の仕組み.

参考推定値、2026 年 7 月。推論トークンの数はワークロードに依存し、プロバイダーの数値ではなく、弊社独自の実行から取得されます。自分で測定してください。 OpenAIとは無関係です。