ランク付けされたモデル
混合価格はインプット/アウトプット比率を使用します。価値スコア = インテリジェンス ÷ 混合価格。リーダーが 100 になるように正規化されます。インテリジェンスは参照指標であり、信頼できるベンチマークではありません。
| モデル | イン/アウト $/1M | ブレンド $/100 万 | IQ* | 価値 | 月額料金 |
|---|
見出し価格は本当の決定を隠す
100 万トークンあたりの入力価格で LLM を比較するのが、ほとんどのコスト表の仕組みですが、これは 2 つの点で誤解を招きます。まず、出力トークンのコストは通常、入力の 3 ~ 5 倍であるため、入力では安く見えるモデルでも、長い応答を書き込むワークロードでは高価になる可能性があります。第二に、価格は機能、つまりモデルのポイントについては何も語っていません。コストが 10 分の 1 なのに、タスクの 3 分の 1 が失敗するツールは決して安いものではありません。再試行と人間によるクリーンアップを考慮すると、コストが高くなります。価格対パフォーマンスでは、両方の問題が 1 つの数値にまとめられます。つまり、能力スコアを ブレンド 実際のトークンミックスの価格を確認できるため、コストだけでなく価値を比較できます。
リフレーミングによって意思決定が変わります。大量の寛容な作業 (分類、タグ付け、初稿の抽出) の場合、最も価値のあるモデルは、数分の 1 の価格でフロンティアとほぼ同等の小型またはオープン モデルであることがよくあります。本番コード、法律や医療の草案、エージェントのアクションなど、ミスが高くつく作業では、より高いスコアがプレミアムを上回るため、価値計算ではより強力なモデルが有利になります。ほとんどのチームがたどり着く賢いパターンは、 ルート 簡単なリクエストはバリューリーダーに任せ、難しいリクエストにはフロンティアモデルを確保します。選択したら、実際の紙幣のサイズを確認します。 LLM トークンコスト計算ツール そしてさらにそれを切ります プロンプトキャッシュ.
使い方
1. 1 つのリクエストに対する一般的な入力トークンと出力トークンを入力します。これにより、実際のコスト構成が決まります。
2. 必要に応じて、月次リクエストを追加して、ワークロードに対する各モデルのコストを確認します。
3. 価値、生の価格、またはインテリジェンスのいずれによってランク付けするかを選択し、表を読んでください。バリュー リーダーは、1 ドルあたりの能力が最も高いモデルです。 あなたの トークンの形状。
よくある間違い
投入価格のみで判断します。 アウトプットの多い仕事はアウトプット率によって価格が決定されます。実際の比率を設定してください。 絶対的な安さを追求します。 タスクが失敗した場合、再作業には保存されたトークンよりも多くのコストがかかります。 どこでもフロンティアモデルに過剰な支払いをしている。 ほとんどのリクエストではこれは必要ありません。ハードスライス用に取っておきます。 1点を信じて。 インテリジェンス指標は出発点です。重要なベンチマークは、独自のプロンプトに基づいて設定された独自の評価だけです。
よくある質問
どのようなトークン比率を使用すればよいですか?
チャットボットと Q&A はほぼ互角であることがよくあります。抽出と分類は大量の入力を必要とします (長いコンテキスト、短い答え)。書き込みとコード生成は出力を重視します。ログがある場合はそれを使用します。それ以外の場合は、入力:出力が 3:1 付近から開始して調整します。
知能スコアはどこから来たのでしょうか?
これは、2026 年の公開推論、コーディング、ナレッジ ベンチマーク全体で各モデルが一般的にどの位置にあるかを近似的にまとめたものです。これは方向性を持って階層をランク付けすることを目的としており、あるモデルが点でより賢いと認定するものではありません。
最も安価なモデルが常にバリューリーダーではないのはなぜですか?
なぜなら、価値は能力を価格で割ったものだからです。 40% 安くても 40% 性能が低いモデルは、同様の価値があります。若干高価ですが、意味のある意味でより高性能なものが先頭に立つ可能性があります。ランキングでは、ミックスのトレードオフを把握しています。
見積もりのみ。インテリジェンスインデックスは方向性の参照です。選択する前に自分のタスクを検証してください。