トークンとは何ですか? (そしてなぜそれによって請求されるのか)
AI モデルを呼び出すたびに、単語、キャラクター、リクエストに対して料金が請求されることはありません。トークンによって課金されます。トークンが実際に何であるかを理解することは、API コストを管理する前に学ぶことができる最も有益なことです。
トークンは単語ではなくテキストの塊です
トークンは、言語モデルが読み書きする単位です。通常、これは単語全体ではなく、単語の断片です。などの一般的な短い単語 the または and は単一のトークンですが、長い単語や珍しい単語はいくつかの部分に分割されます。たとえば、この言葉は、 tokenization 侵入されるかもしれない token + ization、トークン 2 つ。
英語に関して広く使用されている大まかなルールは次のとおりです。 1 トークンは約 4 文字、またはおよそ 0.75 ワードです。。つまり、1,000 トークンは約 750 ワードに相当し、1 ページのテキスト (約 500 ワード) はおよそ 650 ~ 700 トークンに相当します。正確な分割はモデルのトークナイザーによって異なるため、これらは近似値であり、保証ではありません。
スペース、句読点、改行もすべてカウントされます。プロンプトの目に見えない構造でもトークンを消費します。
モデルが単語の代わりにトークンを使用する理由
言語モデルは文字や単語を直接理解することはできません。テキストを数値に変換し、トークンがその橋渡しとなります。各トークンはモデルのボキャブラリ内のエントリにマップされ、モデルはそれらの番号付き部分に対してすべての計算を実行します。
この設計により、モデルは完全な単語の固定辞書なしで、あらゆる言語、コード、絵文字、または造語を処理できるようになります。モデルが全体として見たことのない珍しい専門用語は、おなじみのサブピースのシーケンスとして表すことができます。その代償として、特殊なテキスト、コード、または英語以外の言語では、平易な英語の散文よりも単語ごとに多くのトークンが使用されることがよくあります。
入力トークンと出力トークンの価格は異なります
ほぼすべてのプロバイダーは 2 つの別々の料金を請求します。 入力トークン (プロンプト、システム指示、会話履歴など、送信するすべてのもの) と 1 つ 出力トークン (モデルが生成するすべてが返されます)。通常、出力トークンは入力トークンよりも数倍高価です。
以下は仕組みを示すための説明的な例です (実際の価格ではなく、わかりやすくするために考え出された数字です): 入力のコストが 100 万トークンあたり 1 ドル、出力のコストが 100 万トークンあたり 5 ドルの場合、2,000 個の入力トークンを送信し、500 個の出力トークンを受信する呼び出しには (2,000 / 1,000,000 x 1 ドル) + (500 / 1,000,000 x 5 ドル) の費用がかかります。 = 0.002 ドル + 0.0025 ドル = 0.0045 ドル。 1 回あたりのコールは小さいですが、数十万回のコールが増えると重要になります。
モデルごとの実際の料金を並べて確認するには、モデルの比較と /models ページに各プロバイダーの現在の入力および出力の料金がリストされているため、推測する必要はありません。
会話履歴はターンごとに課金されます
最も一般的な請求上の驚きは、チャット モデルがステートレスであることです。モデルは、通話間の前回のメッセージを記憶しません。コンテキストを維持するために、アプリケーションは新しいターンごとに会話履歴全体を再送信します。
つまり、増大するトランスクリプトが毎回入力トークンとして再送信されるため、長時間のチャットはメッセージごとにコストが高くなります。 20 メッセージの会話は、最終ターンに何万もの入力トークンを静かに送信できます。長時間のセッション中にコストが上昇する場合、通常はこれが理由です。プロンプト キャッシュ (独自のガイドで説明されています) は、これを鈍化させる 1 つの方法です。
構築前に請求額を見積もる方法
呼び出しあたりの平均入力トークン、呼び出しあたりの平均出力トークン、および 1 日または 1 か月あたりに予想される呼び出し数の 3 つの数値を使用して、実行可能な見積もりを得ることができます。各トークン数にトークンごとのレートを乗算し、それらを合計します。
- トークン数の見積もり 現実的なプロンプトと応答のサンプルを取得し、文字数を 4 で割るか、正確性を高めるためにトークナイザー ツールを使用します。
- 体積を掛ける 日次または月次の数値を取得します。
- バッファを追加する 再試行、予想よりも長い出力、および増大するチャット履歴の場合は 20 ~ 30% です。
LLM コスト計算ツールは、この計算を自動的に実行します。トークン数とコール量を入力し、モデルを選択すると、推定月額コストが返されるので、コードを記述する前にオプションを比較できます。
トークンの使用量を減らすための実用的な方法
トークンで考えると、節約が明らかになります。通話のたびに同じ指示をそのまま繰り返すシステム プロンプトを削除します。古い会話を完全に再送信するのではなく、要約してください。出力トークンのコストが最もかかるため、長い回答が必要ない場合は簡潔な出力を求めます。
フラッグシップ モデルと軽量モデルのトークンあたりの価格差は 10 倍以上になる場合があるため、単純なタスクには小規模なモデルを選択することが最も重要なことがよくあります。デフォルトで最も強力なモデルを選択するのではなく、ジョブの難易度にモデルを合わせます。
学び続ける
関連ツール
よくある質問
典型的な文はどれくらいのトークンで構成されますか?
15 ~ 20 単語の短い英語の文は、通常、約 20 ~ 30 のトークンになります。経験則として、トークンあたり約 0.75 単語が予想されるため、トークン数は単語数よりも少し多くなります。
モデルの応答でトークンの料金を支払う必要がありますか?
はい。出力トークンは入力トークンとは別に請求され、通常は 2 つのトークンのうちの方が高価であるため、応答が長いほどコストが大幅に高くなります。
なぜ英語以外のテキストの方が値段が高いのでしょうか?
ほとんどのトークナイザーは英語用に最適化されているため、他の言語やコードでは単語ごとにさらに多くのトークンに分割されることがよくあります。一部の言語では、同じ意味のトークンに 1.5 ~ 2 倍のコストがかかる場合があります。
教育のみであり、経済的なアドバイスではありません。