LLM の選び方

コストと品質、段階ごと - 過剰な支払いをせずにモデルの強度とタスクの難易度を一致させるためのベンダー中立のフレームワーク。

学ぶ › LLM の選択方法

重要なトレードオフ: 品質と価格

OpenAI、Anthropic、Google、およびオープンウェイト エコシステム (Llama、Mistral、Qwen など) のすべての主要プロバイダーは、 モデルのはしご、1つのモデルではありません。一番上に座る フロンティア/フラッグシップ モデル: 推論、コーディング、微妙な表現が最も得意で、はるかに高価です。それらの下には、 中層 品質を少し犠牲にして大幅な値下げをしたモデル、そして 小型 / 低予算 / ナノ 安価で高速で、実際のタスクの大部分に十分に適したモデルです。

チームが犯す間違いは、「安全のために」すべてを旗艦に設定することです。多くの場合、タスクに必要のなかった品質に対して 10 ~ 50 倍の費用がかかります。スキルは最適なモデルを選択することではなく、 品質基準をクリアした最安モデル 特定のジョブごとに。

モデルをタスクに適合させる

重要度ではなく難易度がレベルを決定します。一か八かのタスクでも簡単な場合があります。このマッピングを開始点として使用します。

タスクの種類推奨される階層なぜ
複数ステップの推論、エージェントワークフロー、ハードコーディング、計画フロンティア/フラッグシップこれらは、弱いモデルが黙って失敗する場所です。品質はそれ自体で報われます
原稿作成、まとめ、日常雑談、適度なコーディング中層フラッグシップに近い品質をわずかなコストで実現
分類、抽出、タグ付け、フォーマット、ルーティング、短い回答スモール/ナノ安価なモデルでも確実に処理できる狭く明確な出力
数百万行の一括/オフライン処理ハードルを超えた最安値量的には、トークンあたりの価格が他のすべてを支配します

有力なパターンとしては、 ルーティング: 簡単なリクエストを小規模モデルに送信し、難しいリクエストのみをフラッグシップにエスカレーションします。ほとんどの実稼働トラフィックは簡単であるため、重要な部分の品質を保護しながら、ルーティングによって節約のほとんどが実現されます。

モデルルーティングの節約→

選択にかかる費用

階層間の価格差は非常に大きいです。 2026 年の経験則として、フラッグシップモデルはおおよそ動作します 100 万入力トークンあたり 1 ~ 5 ドル以上 (より多くのトークンを出力)、その間 ナノ / バジェット層は 100 万あたり 0.10 ドル近くにあります10~50×スイング まったく同じワークロードで。

作業例

処理すると言う 5,000 万の入力トークン 1 か月のサポート チケットの分類:

それは 毎月 145 ドル節約 (~30 倍) 分類タスクについては、ナノモデルも同様に正確に行います。スタック内のすべての単純なタスクを掛け合わせると、デフォルトでの主力の習慣が、削減できる単一の最大の項目になります。

トークンコスト計算ツール →ライブ価格を比較 →

実際の選択手順

反復可能なプロセスはベンチマークからの推測に勝ります — 公開リーダーボードにはほとんど反映されません あなたの データ。

考慮すべき二次要素

層と品質が適合すると、さらに 3 つの変数が決定を変える可能性があります。

これらの背後にあるメカニズムを読む LLM API の価格設定の仕組み.

よくある質問

単純なタスクにはどの LLM 層を使用する必要がありますか?

分類、抽出、フォーマット、タグ付け、またはルーティングには、通常、小型またはナノティアのモデルで十分であり、コストは主力モデルの数分の一です。小規模モデルが独自のテスト データの品質基準に満たない場合にのみ、フロンティア モデルにエスカレーションします。

低価格 LLM は主力モデルと比べてどれくらい安いですか?

ナノ層と小規模層は 100 万入力トークンあたり約 0.10 ドルですが、主力モデルは通常 1 ~ 5 ドル以上です。これは 10 ~ 50 倍の変動となるため、層をタスクに合わせることが最大のコスト レバーの 1 つとなります。

実際に 2 つのモデルから選択するにはどうすればよいですか?

測定可能な品質バーを定義し、タスクから 20 ~ 50 の実際の例を 2 つまたは 3 つの層で実行し、そのバーをクリアする最も安価なモデルを選択します。価格とモデルの品質は急速に変化するため、数か月ごとに再テストしてください。

教育上の参考のみ — 価格は推定値です。各プロバイダーの料金ページで現在の料金を確認してください。