ヒント: チャット製品は通常、出力トークンの 3 ~ 6 倍の入力を実行します (履歴はターンごとに再送信されます)。トークンの総数しかわかっていない場合は、80/20 に分割します。
ヘッドルーム欄の使い方
ヘッドルームとは、モデルが予算を超過する前に、現在のボリュームが何倍に増加する可能性があるかです。予算の 45% のモデルには、最大 2.2 倍のヘッドルームがあります。 90% の場合、わずか 1.1 倍です。最初の成長月がそれを破ります。 LLM の使用量は、ほとんどの場合、計画よりも早く増加します (会話が長くなり、再試行が長くなり、新機能が静かに追加されます)。そのため、実稼働環境のピックでは 2 倍のヘッドルームを実用的な最小値として扱います。
スマートなプレーは通常、 ペア: 簡単なクエリの 80% に対して 5 倍以上のヘッドルームを備え、さらに難しい 20% に対してフラッグシップを控えめに使用する、予算内での安価な主力製品。の モデルルーティング計算機 は混合数学を示し、 完全な比較表 このファインダーが表示するあらゆるモデルを検査できます。ここでの価格は、一定の能力で年間最大 10 倍低下します — を参照してください。 価格履歴トラッカー — したがって、このチェックを四半期ごとに再実行します。予算に合ったモデルのセットは自然に増えていきます。