HomeBlog › Groq vs Together vs Fireworks Llama コスト 70B

Groq vs Together AI vs Fireworks: Llama 70B 推論の実際のコスト (2026)

2026 年 9 月 7 日 · AI と LLM · 5 分で読めます

私は 70B クラスのオープン モデルを実行するエージェント ワークロード用の高速推論プロバイダーの価格を設定していましたが、Groq、Togetter AI、Fireworks という 3 つの名前が次々と登場し、それらはすべて一見すると同じように見えるトークンごとの価格を提示しています。そうではありません。 Llama-70B クラスのモデルでは、Groq は次のように動作します。 100 万トークンあたり 0.59 ドルのインプット / 0.79 ドルのアウトプット、Togetter AI はフラットです。 $0.88 / $0.88、そしてFireworksはブレンドを請求します 100 万あたり ~0.90 ドル 16 ~ 80B 層の場合。現実的な 70/30 の入力/出力分割では、これは 月額 250 ドルの差 10 億トークンをプッシュすると、Groq と Fireworks のどちらになりますか。最も安いトークンが自動的に適切な選択になるわけではありません。

2026 年の実際の数字

3 つすべてが OpenAI 互換 API の背後でオープンウェイト モデル (Llama、Qwen、Mixtral、DeepSeek) を実行するため、プロバイダーの切り替えは通常、ベース URL の変更になります。それぞれの価格ページから抜粋した、Llama-70B クラスの推論の実際のそれぞれの費用は次のとおりです。

プロバイダーモデル$/1M を入力出力 $/1M
グロクラマ 3.3 70B$0.59$0.79
一緒にAIラマ 3.1 70B$0.88$0.88
花火中間層 (16 ~ 80B、例: ラマ 70B)~$0.90 ブレンド

Groq は、入力価格が Together の定額料金より 33% 低いため、一般的なチャット形式のワークロード (出力よりも入力トークンの方が多い) としては理論上最も安価です。 AI は同時に入力と出力の価格を同一に設定するため、予測が容易になりますが、ほとんどの RAG およびエージェント ワークロードが実際に送信する入力の多いプロンプトではコストが高くなります。 Fireworks は入力/出力をまったく分割しません。その ~0.90 ドルは 16 ~ 80B モデル クラス全体にわたる単一の混合レートであり、推定は簡単ですが、Groq や Together のように出力長を縮小して最適化することはできないことを意味します。

Groq のほうが安いのに、必ずしも選ばれない理由

Groq の低価格は、その速度と同じところから来ています。それは、汎用 GPU ではなく、トークン生成専用に構築されたカスタム LPU (言語処理ユニット) ハードウェアです。これは、他の 2 つに対する Groq の本当のセールスポイントでもあります。毎秒数百のトークンがあり、H100 ベースのサービスが通常提供する量をはるかに上回っています。ユーザーがカーソルを見ている音声エージェントやチャット UI の場合、入力トークンの 0.29/100 万ドルの差よりも、その遅延の違いの方が重要です。問題点: Groq のホスト モデル カタログは Together や Fireworks のものよりも狭く、専用の容量や微調整が提供されていません。必要なモデルが Groq のリストにない場合、価格は決定要素ではなくなります。

代わりに Together AI と Fireworks が勝てる場所

Together AI は、3 つのモデル (Llama、Mixtral、Qwen、DeepSeek など) の中で最も広範なオープン モデル カタログに加え、微調整および専用のエンドポイントを備えているため、仕事が「ストック モデルを呼び出す」のではなく「独自の微調整されたバリアントを実行する」場合には、Togetter のフラットで予測しやすい価格設定とツールの方が、Groq の範囲が狭く速度優先のラインナップよりも優れています。 Fireworks も同様の立場にあります。クイック スタート向けのサーバーレス トークンごとの価格設定だけでなく、大規模な予約済みスループットと予測可能なレイテンシを必要とするチーム向けの GPU 時間ごとの専用デプロイメントもあり、Groq の固定カタログも Together のサーバーレス ファースト セットアップも同様にカバーしていません。ワークロードが「サポートされているモデルの最も安価なトークン」以上のものを必要とする場合は、どちらもより良いデフォルトです。

さまざまなボリュームでどのように見えるか

チャットや RAG スタイルのプロンプトに典型的な、現実的な 70% 入力 / 30% 出力分割を想定すると、次のようになります。

トークン/月グロク一緒にAI花火
1,000万(小規模アプリ)$6.50$8.80$9.00
1億(安定品)$65$88$90
10億(高スループットエージェント)$650$880$900

この 3 つはすべて、モデル自体にプランの下限や階層がない純粋なトークンごとの価格設定であるため、その差はボリュームに比例して拡大します。月あたり 10 億トークンの場合、Groq の 650 ドルと Fireworks の 900 ドルは、四捨五入誤差ではなく、実質 250 ドルの差です。しかし、これらの数字はいずれも、必要なモデルが安価なプロバイダーにない場合、または Groq の速度によって他の場所での実効コストが削減される場合に何が起こるかを説明するものではありません。つまり、再試行が減り、ユーザー セッションが短くなり、遅延を隠すためだけに積極的にキャッシュする必要性が減ります。

実際にどうするか

遅延に敏感な製品 (音声、ライブ チャット、ストリーミング中にユーザーが見つめているもの): モデルがリストに載っている場合は、Groq から始めてください。実際の製品は速度によって決まります。また、たまたま安価であることもあります。微調整されたオープン モデルまたは一般的ではないオープン モデルが必要な場合、または予測可能なスループットを備えた専用キャパシティが必要な場合は、Togetter AI または Fireworks を選択します。Togetter の幅広いカタログと Fireworks の GPU 時間専用オプションのどちらを重視するかに基づいて選択してください。 3 つすべてを並行して実行することも不合理ではありません。OpenAI 互換 API を使用すると、コードは変更されず、ベース URL と請求書のみが変更されることになります。

使用量ベースの AI 料金設定は初めてですか?から始めてください 無料の API コストガイド。同じ決定のクローズドモデル側については、を参照してください。 GPT 対クロード対ジェミニ: 同じワークロードの実際のコスト.

料金は Groq、Togetter AI、Fireworks の公式料金ページに対して検証され、最終確認日は 2026 年 8 月 15 日です。参考見積もり — モデルの入手可能性、数量割引、および交渉によるエンタープライズ料金は異なります。予算を立てる前に現在の価格を確認してください。