HomeTools › AI モデルのフォールバック チェーンのコスト
混合月額費用
オーバーヘッドと純粋なプライマリ
オーバーヘッド%
ブレンド $/リクエスト

各フォールバック率にかかる費用

同じトークン、同じトラフィック - プライマリ→フォールバックのトリガー レートのみが変わります。

フォールバック率月額費用オーバーヘッドとプライマリオーバーヘッド%
⚠️お見積り。レート制限された呼び出しまたは失敗した呼び出しは、それらを拒否した層によって請求されず、要求を完了した層のみに請求されると想定します。デフォルトの価格は、 参考数値(2026年7月) — 各プロバイダーのダッシュボードで現在の 100 万あたりのトークン価格を確認します。 · 古い価格を報告する →

信頼性層の隠れたコスト

モデル フォールバック チェーンは、2026 年の標準的な AI ゲートウェイ パターンです。つまり、リクエストを安価で高速なプライマリ モデルに送信します。その呼び出しがレート制限されているかエラーである場合、ゲートウェイ (OpenRouter、Portkey、LiteLLM、またはカスタム ラッパー) は、より高価で信頼性の高いフォールバック モデルに対して自動的に再試行します。フォールバックも失敗した場合は、場合によっては第 3 層に対して再試行します。これは稼働時間にとって適切なアーキテクチャですが、フォールバック層の価格は通常、トークンあたりプライマリの 5 ~ 20 倍です。これは、まさにプライマリが安価であるという理由からです。ダッシュボードでは無視できるフォールバック率 (5%、さらには 2%) でも、その割合が示すよりもはるかに大きく請求額が変動する可能性があります。

2 つの層の価格は同じではないため、計算は直線的ではありません。リクエストあたりの混合コスト = Primary_cost × (1 − p1) + fallback_cost × p1 × (1 − p2) + tertiary_cost × p1 × p2、ここで、p1 は 1 次からフォールバックへのトリガー レート、p2 は (非常にまれな) 3 次へのフォールバック レートです。層間の価格差が 14 倍であるため、リクエストの 95% が依然として安価なプライマリに到達したとしても、5% のフォールバック レートにより、混合請求額が 50 ~ 65% 追加される可能性があります。これは、トラフィックの 5% が総コストの半分以上を支払っているためです。

これは、これまでとはまったく異なるコストの形です。 意図的なモデルルーティング (デザインによって安いか高いかを選択する場合) または単純な 失敗時の再試行 コスト (同じモデルがそれ自体を再試行する場合)。ここでのエスカレーション ターゲットは、別のより高価なモデルであり、タスクの難易度ではなく、インフラストラクチャの条件 (容量、レート制限) によってトリガーされます。

関連している: モデルルーティングの節約, API 再試行コスト, LLM ベンダーの移行コスト, エージェントループバジェット.

使い方

1. プリセット チェーンを選択するか、プライマリ層、フォールバック層、および三次層の 100 万あたりの独自の価格を入力します。
2. 毎月のリクエストとリクエストごとの一般的な入出力トークンを入力します。
3. 観察された (または推定された) 1 次→フォールバックおよびフォールバック→ 3 次トリガー レートを設定します。
4. 純粋なプライマリベースラインと比較した、混合された月額コストとオーバーヘッドを読み取ります。この表を使用して、請求がフォールバック レートにどの程度影響されるかを確認してください。

よくある間違い

フォールバック コストがフォールバック レートに比例すると仮定します。 それはそうではありません。フォールバック率と階層間の価格比率の積でスケールされますが、通常はこれよりもはるかに大きくなります。 三次層は無視します。 持続的な負荷でフォールバックも失敗する場合、第 3 層 (存在する場合) のコストは通常​​フォールバックと同じですが、遅延リスクが追加されます。たとえ低レートでもモデル化してください。 請求が失敗した通話。 ほとんどのプロバイダーは、ハードレート制限の拒否に対して料金を請求しません。あなたの場合(ストリーム途中のエラーの前に部分的に生成された場合)、実際のオーバーヘッドはこの推定値よりも高くなります。 最も高価なフォールバックを使用して 100% の稼働時間を追求します。 多くの場合、中間層のフォールバックにより、フラッグシップ モデルに直接移行する場合の数分の 1 のコストで信頼性の大部分が回復されます。

よくある質問

AI モデルのフォールバック チェーンとは何ですか?

失敗したリクエストまたはレート制限されたリクエストが自動的にバックアップ モデルに対して再試行され、それも失敗した場合はオプションで 3 番目の層に対して再試行されるゲートウェイ パターン。 OpenRouter、Portkey、LiteLLM、および同様のツールによって使用されます。

フォールバック率が小さいと、なぜこれほどコストがかかるのでしょうか?

フォールバック モデルの価格は通常、トークンあたりのプライマリよりもはるかに高くなります。フォールバックのコストがリクエストごとに 10 ~ 14 倍になる場合は、トリガー レートが 5% であっても、請求額が 50% 以上追加される可能性があります。

拒否されたリクエストは請求されますか?

標準的な方法: トークンが生成されないため、ハード 429 レート制限の拒否の請求額は 0 ドルです。この計算機はその規則を前提としています。

フォールバック率を安く下げるにはどうすればよいですか?

プライマリ層のレート制限を引き上げ、エスカレーションする前にプライマリにバックオフと再試行を追加し、キー/プロバイダー間でトラフィックを分散するか、最も高価なモデルに直接ジャンプするのではなく中間層のフォールバックを挿入します。

見積もりの​​み。モデルの価格は参考値であり、頻繁に変更されます。現在の価格は各プロバイダーに確認してください。