使用量とクラウドの料金
デバイスの機能とフォールバック
—
毎月の節約と純粋なクラウド、ハイブリッド オンデバイス アプローチの比較—節約率 %
—純粋なクラウドのベースライン / 月
—ハイブリッド合計/月
コストの内訳
| 品目 | 推論/月 | 月あたりのコスト |
| 純粋なクラウドのベースライン (100% クラウド、オンデバイスなし) | — | — |
| — クラウド専用ユーザー (オンデバイス対応ではない) | — | — |
| — オンデバイス対応ユーザーからのクラウド フォールバック | — | — |
| = ハイブリッド クラウドの請求書 | — | — |
| + 償却後のオンデバイスセットアップコスト | — | — |
| = ハイブリッドの月額総コスト | — | — |
これが他のツールにどのように接続されるか
このサイトにはすでに 2 つの計算ツールがあり、関連するものの構造的に異なる決定の価格を決定しています。の セルフホストと API のコスト計算ツール そして セルフホスト型 LLM と API の計算ツール 両方のモデル サーバー側 セルフホスティング — トークンごとまたは呼び出しごとにプロバイダーに支払うのと比較して、独自の GPU またはクラウド インスタンスをレンタルし、そこで推論を自分で実行します。どちらのコスト形態でも、実際のホスティング料金がかかるサーバーはどこかにあり、ベンダーのものではなくあなたが管理するものにすぎません。この計算機は代わりにモデルを作成します クライアント側 オンデバイス推論はエンド ユーザーの電話ハードウェア上で直接実行されます。サーバーをレンタルする必要はなく、モデルの出荷後は推論あたりの限界コストが事実上ゼロになります。また、まったく別のボトルネックがあります。GPU 時間ではなく、十分な機能を備えたデバイスを所有しているユーザーの割合と、それらのデバイスでさえクラウドにフォールバックする必要がある頻度です。 GPU ボックスをレンタルするか、クラウド API に料金を支払うかを決定する場合は、セルフホスト型の計算ツールを使用してください。量子化モデルをモバイル アプリ自体の内部で出荷するかどうかを決定している場合、これがそのコスト形状に一致するものになります。
数字の読み方
デフォルトでは、月間アクティブ ユーザー数 100,000 人、ユーザーあたり 1 日あたり 50 回の推論、クラウド推論あたり 0.001 ドル、1 回限りのオンデバイス ビルド、40,000 ドルの 1 回限りのデバイス上でのユーザー、60% のユーザーが対応デバイス、これらの対応ユーザーの 5% のクラウド フォールバック率、12 か月で償却される場合、純粋なクラウドのベースラインは月額 150,000 ドルとなります。ハイブリッドに移行すると、クラウドの残りの請求額は月額 64,500 ドル (クラウドのみのユーザーからの推論 60,000,000 回と、有能なユーザーからのフォールバック推論 4,500,000 件) に下がり、償却セットアップ費用が月額約 3,333 ドル追加され、ハイブリッドの合計は月額約 67,833 ドルに達します。つまり、月額約 82,167 ドルの節約となります。 ピュアクラウドのベースラインから 55% オフ。 40,000 ドルのセットアップコスト自体は、この量であれば、半月もかからずに元に戻ります。毎月のクラウド費用 (約 85,500 ドル/月) によって、1 回限りの構築コストがすぐに小さくなってしまうからです。この計算は、より低いスケールでは急速に変化します。同じ入力を 100,000 ユーザーではなく 5,000 ユーザーで実行すると、損益分岐点は約 20 倍に伸びます (半月未満ではなく約 9.4 か月)。これは、構築コストをすぐに回収するのに十分な月あたりの偏向推論が存在しないためです。オンデバイス ビルドにエンジニアリング予算を投入する前に、野心的な MAU ではなく、アプリの実際の MAU を組み込みます。
セルフホストと API のコスト計算ツールセルフホスト型 LLM と API の計算ツールGPU 推論コスト計算ツールAI アプリのコスト見積りツール
この計算機の仕組み
の エッジ/オンデバイス AI 推論とクラウド API の計算ツール 最初に純粋なクラウドのベースラインを計算します。 ユーザーごとの 1 日あたりの推論数 × 月間アクティブ ユーザー数 × 30、推論ごとのクラウド料金で価格設定されています。これは、オンデバイス モデルがまったくない場合に支払う金額です。次に、ユーザーベースを次のように分割します。 オンデバイス対応の割合 有能なユーザーとクラウドのみのユーザーに分けられます。クラウドのみのユーザーは、デバイスがローカル モデルをまったく実行できないため、推論ごとに全額のクラウド請求書を生成します。オンデバイス対応ユーザーはほとんどの場合、実質的に限界費用ゼロでローカルで推論を実行します。 を除外する のために クラウドフォールバックの割合 複雑すぎるクエリ、バッテリー残量の低下、ローカル モデルのダウンロードが完了する前のコールド スタート、または信頼性の低いローカル結果などのクエリは、依然としてクラウド API に対して請求されます。
この計算機は意図的に次のことを行います。 ない オンデバイスのコンピューティング、バッテリーの消耗、またはストレージのフットプリント自体にドルの数字を置きます。モデルが出荷されると、ローカル推論の限界コストはゼロとして扱われます。これは、最新のフラッグシップ チップ上で実行される小規模で適切に量子化されたモデルにとっては現実的な簡素化であり、推論ごとのバッテリーとコンピューティングの増分コストは、クラウド API の料金に比べれば無視できるものです。非常に大規模なオンデバイス モデルや古い/ローエンド デバイスの実際のコストは過小評価されており、サーマル スロットリング、バッテリの消耗、ストレージの圧力が実際に発生するため (ドル価格での価格設定が難しい場合)、個別に検討する価値があります。残りのクラウドのみの推論とクラウド フォールバックの推論は合計されます。 ハイブリッドクラウドの請求書、その後、 1 回限りのデバイス上セットアップのコスト (エンジニアリング、量子化、出荷) を選択した償却ウィンドウで割って上に加算して、 ハイブリッドの月額総コスト。これを純粋なクラウドのベースラインと比較すると、セットアップ コストを 毎月 クラウドの支出はそれを反映します (純粋なクラウドからハイブリッド クラウドの請求額を差し引いたもので、償却は無視されます)。 数カ月で損益分岐点になる — クラウドの節約だけで、1 回限りのビルドでどれほど早く元が取れるか。
よくある質問
クラウド API のような推論ごとのコストではなく、オンデバイス推論に 1 回限りのコストがかかるのはなぜですか?
オンデバイス推論のコストがかかる部分は、実行ではなく構築であるためです。モデルを電話機に適合するサイズまで量子化し、それを Core ML または TensorFlow Lite / NNAPI 形式に変換し、デバイス階層全体でテストし、アプリ バイナリ内で、またはダウンロード可能なアセットとして出荷することは、固定価格の固定エンジニアリング プロジェクトであり、最終的に 1 ユーザーが実行するか 1,000 万ユーザーが実行するかに関係なく、一度だけ支払われます。プロバイダーの GPU 時間は呼び出しごとに実際の限界コストとなるため、クラウド API はリクエストごとに請求されます。オンデバイス モデルが量子化されて出荷されると、ユーザー自身の電話機でもう 1 回推論を実行すると、アプリの所有者にかかる費用は基本的にユーザーのバッテリーとコンピューティングのほんの一部しかかかりません (サーバーも通話ごとの請求もありません)。これはまさに、1 回限りのセットアップ コストを通話ごとの費用ではなく、数か月で償却する価値のあるものに変えることになります。
オンデバイス対応のパーセンテージが低い場合はどうなりますか? オンデバイスの価値がなくなることはありますか?
はい、この計算機はその線がどこにあるかを正確に示すように作られています。オンデバイス対応のパーセンテージが低下すると、より多くのユーザー ベースがクラウドのみのバケットに戻ります。そのため、セットアップ コストに上乗せして償却するために支払いを続けている間、残りの月々のクラウド請求額はピュア クラウドのベースラインに向かって上昇します。ある程度の十分に低い対応可能パーセンテージでは、ハイブリッド アプローチのコストは、ピュア クラウドがこれまでにかかったよりもむしろ高くなる可能性があります。同様に重要なもう 1 つの要因は、推論の総量です。月間アクティブ ユーザー数 100,000 人の場合は 1 か月以内に元が取れる同じセットアップ コストでも、数千ユーザーの場合は何ヶ月もかかるか、事実上製品の寿命内で採算が取れなくなる可能性があります。これは、単純に構築コストを回収するためにクラウドの請求から転嫁される十分な推論が存在しないためです。オンデバイスのビルドにエンジニアリング予算を投入する前に、経済性が直線的にスケールダウンすると仮定するのではなく、実際の MAU とデバイスの機能の実際の最良の推定値を考慮する価値があります。
オンデバイスで実行しているユーザーに対してもクラウド料金が発生するのはなぜですか?
実際には、オンデバイスの機能がすべてかゼロかということは決してないからです。ローカル モデルを完全に実行できる電話機であっても、クエリの一部は依然としてクラウドに送信する必要があります。クエリが複雑すぎるか、圧縮されたオンデバイス バージョンでは適切に処理できないローカル モデルの範囲を超えすぎている場合、OS がオンデバイスのコンピューティングを制限するバッテリ低下またはサーマル スロットリングの状況、インストールまたは更新後にローカル モデル アセットのダウンロードが完了する前のコールド スタート ウィンドウ、または信頼性が低くクラウドが必要な単純なローカル推論が返される場合です。モデルを再確認してください。この計算ツールは、デバイスがオンデバイス推論をまったく実行できないユーザーがまだ負っているクラウド請求額全額に加えて、オンデバイス対応ユーザーのクエリにのみ適用されるクラウド フォールバックの割合をモデル化します。そのため、デバイス機能率が非常に高い場合でも、ハイブリッド合計の残りのクラウド項目がゼロになることはありません。
これは、このサイトにすでにあるセルフホスト型の LLM と API の計算ツールとどう違うのですか?
すでにこのサイトに掲載されているセルフホスト対 API 計算ツールとセルフホスト LLM 対 API 計算ツールはどちらも、サーバー側のセルフホスティングをモデル化しています。独自の GPU インスタンスまたはクラウド ボックスをレンタルし、そこで推論を自分で実行することで、トークンごとまたは呼び出しごとにクラウド プロバイダーに支払うのと比較します。どちらの場合でもコストの形状は、依然としてどこかのサーバーにホスティング料金がかかり、ベンダーのものではなく自分のものになります。この計算ツールは、構造的に異なるものをモデル化しています。クライアント側のオンデバイス推論は、エンド ユーザー自身の電話ハードウェア上で直接実行されます。レンタルするサーバーはなく、モデルが出荷されると、推論ごとの限界費用は事実上ゼロになります。ここでのホスティング料金に代わるものは、モデルを構築して量子化するための 1 回限りのエンジニアリングコストであり、数か月にわたって償却されます。さらに、実際にクラウドに費やせる費用の上限が設定されます。これは、十分な機能を備えたデバイスを所有するユーザーの割合と、それらのデバイスでさえクラウドにフォールバックする必要がある頻度によって設定されます。