よくある質問
ビデオを LLM に送信すると、どのように請求されますか?
マルチモーダル モデルは、人間が行うようにビデオを視聴するわけではありません。フレームをサンプリングし (通常は 1 秒あたり約 1 つ)、各フレームをトークンで構成される画像として扱い、その後、オーディオ トラックを独自のトークン ストリームとして追加します。したがって、入力コストは、サンプリングされたフレームの数とフレームごとのトークン、音声トークン、およびテキスト プロンプトを乗算したものになります。 Gemini は、デフォルトの解像度でビデオの場合は 1 秒あたり約 258 トークン、オーディオの場合は 1 秒あたり約 32 トークンを請求します。 GPT-4o ではフレームを自分で抽出し、タイル化された各フレームは詳細に応じて約 85 個から 1,000 個以上のトークンで実行されます。いずれにせよ、ビデオは最もトークンを大量に消費する入力モダリティであり、この計算機はそれを具体化します。
1 時間のビデオの分析にこれほどコストがかかるのはなぜですか?
トークンは映像の長さに応じて変化するためです。 1 秒あたり 1 フレーム、フレームあたり 258 トークンの場合、1 時間のビデオは 3,600 フレームと約 929,000 の画像トークン、さらに約 115,000 の音声トークンになります。これは、モデルが応答を書き込むまでに、1 つのビデオに対して 100 万をはるかに超える入力トークンになります。入力トークン 100 万件あたり数ドルという金額は、ビデオごとに意味のある請求額となり、ライブラリ全体で急速に増加します。計算ツールにはビデオごとのトークン、ビデオあたりのコスト、月ごとの合計が表示されるため、1 回限りの実験が大規模になっても驚くような結果にはなりません。
ビデオ理解をより安価にするにはどうすればよいですか?
最大の要因はフレーム レートです。1 秒あたり 1 フレームではなく 2 ~ 5 秒ごとに 1 フレームでサンプリングすると、画像トークンが比例的に削減され、講義、セキュリティ フィード、画面録画などのゆっくりとした動きの映像の場合、重要なものが失われることはほとんどありません。ビジュアルのみが必要な場合にオーディオ トラックを削除するか、安価な音声テキスト変換モデルを使用して音声を文字に起こし、音声トークン料金を支払う代わりに文字起こしをテキストとしてフィードすることも、大幅な節約になります。フレーム解像度を下げるとフレームあたりのトークンが減り、ファイル全体を送信するのではなく、関連するセグメントにクリップすることが最も簡単な方法です。このページのフレームレート表は、各設定がどの程度の影響を与えるかを正確に示しています。
ビデオ全体を送信するよりも、音声を文字に起こした方が安くなりますか?
多くの場合、あなたの質問が、何が示されているかではなく、何が言われているかに関するものであれば、そうです。 Speech-to-Text モデルの料金は音声 1 分あたりわずか 1 セントで、結果として得られるトランスクリプトは 1 時間の音声に対して数千のテキスト トークンになります。これは、フレームごとに 1 秒ごとに画像トークンの料金を支払うよりも桁違いに安くなります。視覚的なコンテンツが本当に重要な場合にのみ、完全なビデオを送信してください。トーキングヘッドの映像、会議、ポッドキャストの場合は、まず文字に起こして、テキストを検討します。この計算ツールを使用すると、オーディオ トークンをゼロに設定してトランスクリプト ルートをモデル化し、それをフレームの送信と比較できます。