この計算機の仕組み
の Cloudflare Workers AI ニューロンのコスト計算ツール 3 つの異なるワークロード タイプを 1 つの共有ユニットに変換します。 文章: デフォルト (Llama 3.1 70B、300 リクエスト/日、800 入力 + 300 出力トークン/リクエスト) では、各リクエストのコストは 800/1,000,000 × 26,668 + 300/1,000,000 × 204,805 = 21.33 + 61.44 = 82.78 ニューロンなので、1 日あたり 300 リクエストがおおよそ燃えます 24,833 ニューロン/日. 画像: 1 タイル (512×512) および 4 ステップでの Flux-1-schnell コストは 1 × 4.80 + 4 × 9.60 = 43.20 ニューロン/画像、つまり 1 日あたり 20 枚の画像が追加されます 864 ニューロン/日. 埋め込み: 100,000 入力トークン/日の BGE-small コスト 100,000/1,000,000 × 1,841 = 184.1 ニューロン/日。合計使用量はおよそ 25,881 ニューロン/日.
反対して 10,000 ニューロン/日 無料許容量 (3 つのワークロード タイプすべてで共有、毎日 00:00 UTC にリセット)、残りは約 15,881 個の過剰ニューロン/日、1,000 ニューロンあたり 0.011 ドルで請求されます: 15.881 × 0.011 ドル ≈ $0.175/日、またはおおよそ $5.24/月 アクティブな日が 30 日の場合。これらの設定では、テキストの生成が主な要因 (毎日のニューロンの約 96%) であるため、テキストのモデルの選択 (70B 対 1B) は、画像や埋め込み量よりもはるかに重要です。無料利用枠は、モデルごとに 1 つの割り当てではなく、アカウント全体で 1 つの共有プールであるため、すでにテキストの多いアプリに画像を追加したり、呼び出しを埋め込んだりすると、いずれかのワークロードを単独で実行するよりも早く、有料 Neurons に移行することになります。
よくある質問
Cloudflare Workers AI Neuron とは何ですか?また、どのように計算されますか?
Neuron は、Workers AI で AI リクエストが消費する GPU コンピューティングを測定するための Cloudflare の正規化された単位で、1,000 Neuron あたり 0.011 ドルで請求されます。各モデルには作業単位あたりの独自のニューロン レートがあります。Llama-3.2-1B のコストは 100 万入力トークンあたり 2,457 ニューロン、100 万出力トークンあたり 18,252 ニューロンです。より大きな Llama-3.1-70B のコストは、入力トークン 100 万あたり 26,668、出力トークン 100 万あたり 204,805 です。 Flux-1-schnell 画像の生成には、512×512 タイルあたり 4.80 ニューロンとステップあたり 9.60 ニューロンのコストがかかります。 BGE-small 埋め込みでは 100 万入力トークンあたり 1,841 ニューロンのコストがかかり、BGE-large では 18,582 のコストがかかります。すべてのモデル タイプが同じ Neuron ユニットに変換されるため、テキストの多いワークロードと画像の多いワークロードを 1 行で比較して請求できます。
Cloudflare Workers AI はどのくらい無料ですか?
Workers Free プランと Workers Payed プランの両方で、すべてのアカウントに 1 日あたり 10,000 Neurons が無料で付与され、毎日 00:00 UTC にリセットされます。この許容量は、アカウント全体にわたる単一の共有プールです。ニューロンがテキスト生成、画像生成、埋め込みのいずれからのものであるかは関係なく、すべて同じ毎日 10,000 個から引き出されます。特定の日に超過すると、超過分は 1,000 ニューロンあたり 0.011 ドルで請求されます。これには、Workers Payed プランに加入している必要があります。
1 つのアプリ内でモデル タイプを混在させることが Neuron の請求に影響するのはなぜですか?
10,000 ニューロン/日の無料枠は、モデルごとに割り当てられるのではなく、呼び出すすべてのモデル間で共有されるためです。小さなテキスト モデルを呼び出し、いくつかの画像を生成し、ドキュメントを埋め込むアプリは、すべて同じ日次プールを使用するため、呼び出しの順序と組み合わせによって無料枠を使い切る速度が決まります。モデルの選択も非常に重要です。Llama-3.1-70B は、Llama-3.2-1B に比べ、入力トークンあたり約 11 倍、出力トークンあたり約 11 倍多くのニューロンを燃焼します。そのため、混雑した日により大きなモデルに切り替えると、同じトラフィック量であっても、0 ドルの請求書が有料の請求書に変わる可能性があります。
Workers AI Neuron の価格は、OpenAI または Anthropic の未加工トークンの価格とどのように比較されますか?
OpenAI や Anthropic などのハイパースケーラー LLM API は、100 万トークンあたりのドルで直接請求され、モデルごとに異なる入出力レートがあり、モデル タイプ間で共有される統一された 1 日の無料枠はありません。コンテキスト ウィンドウのコスト計算ツールと、その形状の 387 モデルの価格比較を参照してください。代わりに、Workers AI は、すべてのモデルのコンピューティング コストを 1 つの抽象ユニット (Neuron) に変換し、1,000 ニューロンあたり 0.011 ドルの単一の定額料金で請求されます。また、どのモデルを組み合わせても適用される 10,000 ニューロン/日のアカウント全体の無料枠が付いています。トレードオフは、予測可能なユニットあたり 1 つのレートと毎日の無料ヘッドルームと引き換えに、フロンティアクローズドモデルではなくエッジで Cloudflare がホストする小規模なオープンモデル (Llama、Flux、BGE) を実行することです。