LLM API の価格設定の仕組み

トークン、入力と出力、コンテキスト ウィンドウ — 同じタスクが、あるモデルでは別のモデルの 50 倍のコストがかかる理由を簡単に説明します。

学ぶ › 微調整に実際にかかる費用

微調整に実際にかかる費用

自分の例に基づいてベース モデルをさらにトレーニングする微調整は、AI モデルを真に自分のものにする方法としてよく宣伝されます。隠蔽されているのはコストであり、コストはいくつかの部分に分かれており、明らかな部分と隠れた部分があります。このガイドでは、実際に支払った金額を分析して、より良いプロンプトを作成することよりも良いかどうかを判断できます。

微調整には 3 つのコスト層があります

微調整にかかる総コストは桁違いです。これは 3 つの異なる部分に分かれています。

  • 研修費用、微調整ジョブを実行するための 1 回限りの料金で、通常はトレーニング データセット内のトークンごとに料金が設定され、データのパス (エポック) 数が乗算される場合もあります。
  • 推論コスト、その後、微調整されたモデルを呼び出すたびに支払う料金。これは多くの場合、トークンあたりの基本モデルよりも高くなります。
  • データ準備費用、高品質のトレーニング セットを構築、クリーンアップ、フォーマットするための人間の努力。多くの場合、これが最大のコストですが、請求書には記載されません。

これらのいずれかをスキップすると、後でひどい驚きにつながります。

The training charge

トレーニングは、フィードしたデータの量に基づいて課金されます。データセットが 100 万トークンで、モデルが 3 エポックトレーニングする場合、トレーニング レートで 300 万トークンを処理したものとして料金が請求されます。したがって、データセットのサイズとエポック数の両方が請求額を左右します。

以下にわかりやすい例(発明率)を示します。トレーニング料金が 100 万トークンあたり 8 ドルの場合、3 エポックにわたる 100 万トークンのデータセットのトレーニング実行コストは 3 x 8 ドル = 24 ドルとなります。その部分は人々が予想するよりも安いことがよくあります。問題はその後に来るものです。

継続的な推論プレミアム

微調整されたモデルを実行すると、通常、構築された基本モデルよりもトークンあたりのコストが高くなります。これは決して止まらないコストです。月に数百万回の通話を行う場合、推論率が高くなると、1 回限りのトレーニング料金が何倍にも見えなくなる可能性があります。

Illustrative example: if a base model serves at $1 per million input tokens but the fine-tuned version costs $3 per million, then at high volume you are paying triple for every single call, forever. Before fine-tuning, always model the ongoing inference cost at your expected call volume, not just the training cost. The LLM cost calculator and model comparison pages help you put the base rate and a fine-tuned rate side by side.

隠れたコスト: データの準備

品質の微調整はトレーニング データに左右されます。通常は、入力と理想的な出力を示す高品質のサンプル ペアが数百から数千必要になります。これらの例を作成し、その正確性と一貫性をレビューするのは、熟練した人間の作業であり、数日から数週間かかる場合があります。

この労力がコスト見積もりに現れることはほとんどありませんが、多くの場合、実際の費用は最大になります。乱雑なデータや一貫性のないデータでトレーニングされた微調整では、基本モデルよりもパフォーマンスが低下する可能性があります。これは、トレーニングにお金を払ってダウングレードされたことを意味します。データのキュレーションに現実的な人的時間を割り当てなければ、開始しないでください。

微調整に価値がある場合とそうでない場合

微調整は、必要なときに効果を発揮する傾向があります。 一貫したスタイル、形式、または動作 これは、プロンプトを短縮したい場合 (微調整モデルでは長い手順や例が不要になり、呼び出しごとに入力トークンが節約される場合があります)、または、小規模で大量のタスクがある場合、より小規模な微調整モデルでより大きな高価なモデルを置き換えることができる場合に、これをプロンプトで指定するのは困難です。

タスクが頻繁に変更される場合 (それぞれの変更が再トレーニングを意味する場合)、適切な例が少なすぎる場合、または慎重なプロンプトと検索によってすでに目的地に到達している場合には、通常は価値がありません。ほとんどのチームにとって、正直な最初のステップは、微調整に着手する前に、プロンプトとプロンプトのキャッシュを徹底的に行うことです。

両方のパスの合計コストを比較します

公正な比較は、実際の使用期間にわたる総コストです。パス A: より長く、慎重に設計されたプロンプト、より高い呼び出しごとの入力トークンを備えた基本モデルですが、トレーニング コストと標準の推論レートはありません。パス B: プロンプトは短くなりますが、トレーニング料金と高い推論率を備えた微調整されたモデル。

たとえば、1 年間に予想されるコールの各パスを合計します。場合によっては、微調整の短いプロンプトが勝つこともあります。多くの場合、good-prompt を使用した基本モデルのパスの方が安価で、はるかに柔軟です。ボリュームに応じて答えが変わるため、コミットする前に独自のトークン数を使用して LLM コスト計算ツールで両方を実行します。

よくある質問

微調整にかかる費用は 1 回限りですか?

いいえ。トレーニングは 1 回限りの料金ですが、通常、微調整モデルは基本モデルよりもトークンあたりの実行コストが高いため、使用する限りすべての呼び出しに対して割増料金を支払い続けることになります。

どれくらいのトレーニング データが必要ですか?

タスクによって異なりますが、高品質のサンプル ペアは数百から数千が一般的です。品質と一貫性は生の量よりもはるかに重要であり、多くの場合、そのデータの準備が実際のコストで最大になります。

プロンプトを微調整する必要がありますか、それとも単に改善する必要がありますか?

最初に、プロンプト、数ショットの例、および検索を試してください。微調整は主に、一貫した書式設定や、短いプロンプトがより高い推論率を相殺する大量の狭いタスクの場合に価値があります。

教育のみであり、経済的なアドバイスではありません。