この計算機の仕組み
の LoRA / QLoRA 微調整: マネージド API と GPU レンタルの計算ツール トレーニングの総ワークロードから始まります。 データセットのサイズ (トレーニング例) × 例ごとの平均トークン数 × エポック 合計を与える トレーニングトークン ジョブは処理する必要があります。デフォルトでは、50,000 × 512 × 2 は 51,200,000 のトレーニング トークンになります。マネージド側では、そのトークン数を 1,000,000 で割って、選択したプロバイダーの数を乗算します。 100 万トレーニング トークンあたりのレート を与えます マネージドプロバイダーのコスト — Together AI のデフォルトで 24.58 ドル。 GPU レンタル側では、同じトレーニング トークン数を (トレーニングのスループット 単位: トークン/秒 × 3,600) は、 GPU時間 必要な値を乗じたもの GPUレート 1 時間あたりの生のコンピューティング コストが得られます。追加する セットアップ時間 × あなたの時給 (オプション、デフォルトでは $0) は完全な値を提供します。 GPUのレンタル費用 — A100 のデフォルトでは約 1.79 ドル、セットアップ コストは 0 ドルです。
管理コストから GPU コストを引くと、 貯蓄 自分で GPU をレンタルし、それを管理コストで割ると、 コストギャップ 割合 — デフォルトでの GPU レンタルにより約 92.7% 安くなります。これはマイナスになる可能性があります。スループットの見積もりが低すぎる場合、GPU レートが高すぎる場合、または十分なセットアップ時間に対してゼロ以外の時間料金を設定している場合、マネージド API の方が安くなる可能性があります。この計算ツールは、DIY が常に勝つと仮定するのではなく、正直にそれを示しています。の トレーニングのスループット フィールドは最も機密性の高い単一の入力です。これはモデル パラメーターの数によって大きく異なります。そのため、デフォルトの 15,000 トークン/秒は単なる開始推定値にすぎません。実際の予算を決定する際に金額を信頼する前に、実際のモデル サイズと GPU でベンチマークされた数値に置き換えてください。
よくある質問
LoRA の微調整は API を使用するのと GPU をレンタルするのどちらのほうが安くなりますか?
一般的なデータセット サイズでは、GPU を自分でレンタルして LoRA/QLoRA トレーニング ジョブを直接実行するほうが、マネージド プロバイダーのトークンごとのトレーニング料金を支払うよりも、現金換算ではるかに安くなります。この計算機のデフォルト (50,000 サンプル、512 トークン/サンプル、2 エポック) では、Togetter AI 上のマネージド LoRA ジョブ (100 万トレーニング トークンあたり 0.48 ドル) のコストは約 24.58 ドルですが、レンタル A100 80GB では同じ 5,120 万トレーニング トークンが 1.89 ドル/時間、15,000 トークン/秒のスループットで使用されます。価格は約 1.79 ドルで、90% 以上安くなります。ただし、このギャップは生のコンピューティング コストの比較であり、完全な総所有コストの比較ではありません。マネージド API ではトレーニング パイプラインのセットアップ、チェックポイントの処理、障害のデバッグにかかる時間は含まれていません。 GPU のレンタルが実際に安いかどうかは、そのセットアップ時間をどの程度重視するかによって決まります。そのため、この計算ツールにはオプションのセットアップ時間フィールドがあり、ゼロより大きくして画像の変化を確認できます。
LoRA の微調整にはどの GPU が必要ですか?
およそ 13B ~ 34B パラメーターまでのモデルでのほとんどの LoRA/QLoRA ジョブの場合、単一の 80GB GPU (A100 80GB または H100 80GB) で十分です。LoRA はモデル全体ではなく、追加された低ランクのアダプターの重みの小さなセットのみをトレーニングし、QLoRA はメモリをさらに縮小するために凍結された基本の重みを 4 ビットに量子化するため、ジョブ全体がマルチ GPU クラスターではなく 1 枚のカードに収まります。微調整が必要になります。基本モデルが大きくなったり、コンテキスト ウィンドウが長くなると、メモリの必要量が増加し、より小さいバッチ サイズ、より積極的な量子化、またはより大きな GPU が必要になる場合があり、実際のトレーニング スループット (トークン/秒) はパラメーター数によって大きく異なります。この計算ツールのデフォルトは推定値として 15,000 トークン/秒ですが、ドルの出力を信頼する前に、独自のモデル サイズと GPU でベンチマークされた数値に調整する必要があります。
管理とDIYの間にこれほど大きなコスト差があるのはなぜですか?
Together AI や Fireworks などのマネージド LoRA トレーニング API は、生の GPU 秒数に対してのみ請求されるわけではありません。トークンごとのレートには、インフラストラクチャの信頼性、ジョブ オーケストレーション、自動チェックポイント、キューイングと再試行、トレーニング実行が途中で失敗した場合にエスカレーションできるサポート チームがバンドルされており、ベア GPU インスタンスを自分でレンタルすることはできません。このバンドルには、基礎となるコンピューティング コストを超える実際の値上げが含まれており、時間単位で請求されるレンタル A100 または H100 には、クラウド プロバイダー自身のマージンを超えるような値上げが組み込まれていないため、コンピューティング コストのラインだけを比較すると、2 つの間の差は巨大に見える可能性があります。正直な注意点は、この比較でわかるように DIY は無料ではないということです。誰かがトレーニング スクリプトを作成してデバッグし、チェックポイントを管理し、サポート ラインに電話することなく障害を処理する必要があります。これは、トークンごとの料金として表示されない場合でもリアルタイムです。
LoRA と完全な微調整コストの違いは何ですか?
完全な微調整では、モデル内のすべてのパラメーターが更新されます。そのため、完全な微調整計算ツールでは、完全に変更しているベース モデル上で、データセット トークンとエポックの積とプロバイダー トレーニング レートの積としてトレーニング コストをモデル化します。また、通常、パラメーター数全体の勾配とオプティマイザーの状態を保持するのに十分な GPU メモリ (またはマネージド トレーニング バジェット) が必要ですが、これは実際のモデル サイズでは高価です。 LoRA と QLoRA は、代わりにベース モデルをフリーズし、追加された少数の低ランク アダプターの重みをトレーニングするため、コンピューティングとメモリのフットプリント、つまりマネージド API 側と GPU レンタル側の両方のコストは、同等のデータセットの完全な微調整のほんの一部で済みます。このため、この計算ツールと完全な微調整計算ツールでは異なるコスト形状が使用されます。完全な微調整の価格は主にプロバイダーのトレーニング料金に基づいて設定されています。これは、DIY による完全な微調整が 1 つのレンタル GPU で実際的であることはほとんどないためです。一方、LoRA/QLoRA は安価で十分に小さいため、1 つの GPU を自分でレンタルすることが現実的であり、多くの場合はるかに安価で、マネージド API の代替となります。