2026 年 8 月 8 日公開 · 参照番号、予算編成前に確認してください
まったく同じ 1024×1024 画像を GPT-4o と Claude に送信すると、2 つの同一ピクセルに対して 2 つの異なるトークン請求書が発行されます。 GPT-4o はおおよそ次のようになります 765トークン。クロードは大体こう出てくる 1,400トークン —ほぼ2倍。イメージに関しては何も変わりませんでした。プロバイダーがピクセルをトークンに変換するために使用する式が変更されただけで、「GPT-4o 対 クロード」の価格設定をしているほとんどのチームはテキスト料金表を無視して気づくことはありません。
Vision の価格は、ファイル サイズではなく、解像度 (ピクセル寸法) によって決まります。高度に圧縮された JPEG と同じ幅と高さの鮮明な PNG のコストはまったく同じです。これは、モデルがファイルを認識することはなく、デコードされたピクセルが認識されるためです。異なる点は、各プロバイダーがそれらのピクセルを請求可能なトークンに変換する方法です。
| プロバイダー | 式 | 1024×1024の画像 | キャッチ |
|---|---|---|---|
| OpenAI GPT-4o (高精細) | 基本 85 + 512 ピクセル タイルあたり 170 | ≈765 トークン | タイリングとは、コストがサイズに比例するのではなく、ピクセル領域に応じて変化することを意味します。 |
| OpenAI GPT-4o (低詳細) | フラット 85 トークン、任意のサイズ | トークン85個 | 画像は最初にサムネイルにダウンサンプリングされます。細かいテキストは残りません。 |
| 人間的なクロード | 幅×高さ ÷ 750 | ≈1,400トークン | ディテールの低い避難ハッチはありません - すべての画像がピクセル領域の全コストを支払います |
| Google ジェミニ | 384×384 までのフラット 258 トークン、それを超えるとタイル化 | 258 + タイリング | 小さな画像の場合は最も安価ですが、384 ピクセルを超える正確なタイル数は他の 2 つほどきれいに公開されません |
2026 年に各プロバイダーによって公開された参照式。プロバイダーは時間の経過とともにタイル/ピクセル ルールを四捨五入および改訂します — 古い価格を報告する →
真ん中の2列を見てください。 OpenAI の高精細モードと Anthropic の唯一のモードは、ほぼ 2 倍離れた同じ 1024 × 1024 画像上に配置されます (約 1,400 に対して 765 トークン)。これは、GPT-4o が固定サイズのタイルをカウントするのに対し、Claude は生のピクセル領域を定数で除算するためです。どちらの数字も間違いではありません。これらは同じ種類の数字ではなく、GPT-4o のビジョンラインからクロードへの移行の価格を設定したチームは、画像が流れ始めると 2 倍近く不足することになります。
モデルの価格比較は、デフォルトでテキスト (入力トークンおよび出力トークン 100 万あたりのドル数、料金表の数値) に表示されます。ビジョンがモデル化されている場合、ビジョンは後から追加されます。これは、ドキュメント QA アプリ、レシート スキャナー、スクリーンショットを撮るサポート ツールなど、多くの実際の製品では逆であり、すべてのリクエストには少なくとも 1 つの画像が含まれており、その画像は周囲のプロンプトを簡単に上回ります。クロード トークン 1,400 個での 1024×1024 のスクリーンショットは、それに関する質問テキストよりも大きくなる可能性があります。
リクエストごとのコストと同様に、ギャップはボリュームとともに増大します。 GPT-4o ハイディテールは、月あたり 100,000 枚の画像で約 7,650 万個の画像トークンを実行します。クロードの同じコーパスは約 1 億 4,000 万で実行されます。コスト モデルがテキスト価格のみで構築されている場合、月あたり 6,350 万の余分なトークンが表示されることはありません。それを、次のようなテキストのみの数値と比較してください。 GPT vs Claude vs Gemini: どの AI API が安いか また、ビジョンに重点を置いたワークロードにより、ランキングが完全に逆転する可能性があります。
タイリングはピクセルに合わせて拡大縮小するため、 エリア、幅と高さの両方を 2 倍にすると、タイル数とコストはおよそ 4 倍になります。そもそも追加の解像度を必要としなかったタスクの場合、2048 × 2048 のスクリーンショットのコストは 768 × 768 のトリミングよりも数倍高くなります。必要な詳細が含まれる最小の解像度にダウンスケーリングすることは、どのプロバイダーを選択するかよりも先に、ビジョンのコストを左右する最大の要因となります。
2 番目のレバーは詳細モードで、OpenAI にのみ存在します。低詳細モードでは、モデルが画像を読み取る前に画像がサムネイルにダウンサンプリングされるため、画像サイズに関係なく一律 85 トークンが課金されます。これは、レシート、グラフ、猫などの「これは一般的に何ですか」には問題ありませんが、高精細な解像度を維持する必要がある細かい文字や小さなラベルを読み取る場合には役に立ちません。タスクで要点のみが必要な場合に画像を低詳細にルーティングすると、すべての画像をデフォルトで高詳細に設定するのと比べて、5 ~ 10 倍のカットになります。これは、ほとんどの統合が何も考えずに行うことです。
2 つのプロバイダーは、まったく同じピクセルを 2 倍近く異なるトークン カウントにタイル化または分割することができ、そのギャップは画像を多用する製品が実際に出荷されるまで目に見えません。この修正には費用はかかりません。ビジョン広告申込情報をテキスト広告申込情報から分離し、送信前にダウンスケールし、デフォルトではなく意図的に詳細モードを選択します。
方法論: 式と参照トークン数は、各プロバイダーのドキュメントで公開されているものであり、このサイト独自のビジョン コスト計算ツールと照合されます。プロバイダーはタイル サイズとタイルごとのレートを定期的に改訂します。ここでの特定のカウントは、永続的な定数ではなく、検証するためのスナップショットとして扱われます。 100,000 枚の画像の月間比較は、実稼働システムからのテレメトリではなく、上記の画像ごとの数値に基づいて構築された例示的なシナリオです。