—
合計応答時間—生成時間
—最初のトークンまでの時間
—ストリームごとのリクエスト/分
レイテンシーは TTFT に世代を加えたものであり、1 つの数字ではありません
ユーザーは、最初のトークンが着地する速さ、および残りのトークンが流れる速さで速度を判断します。このツールは両方を分離するので、高速だと感じるモデルとストリーミング戦略を選択できます。その速度に基づいて料金を計算します。 トークンコスト計算ツール.
LLM 応答に実際にかかる時間 (最初のトークンと生成までの時間)。
ユーザーは、最初のトークンが着地する速さ、および残りのトークンが流れる速さで速度を判断します。このツールは両方を分離するので、高速だと感じるモデルとストリーミング戦略を選択できます。その速度に基づいて料金を計算します。 トークンコスト計算ツール.
無料の LLM レイテンシ計算ツール — 出力トークン、生成速度、最初のトークンまでの時間をユーザーが感じる実際の応答時間に換算します。
2 つのこと: 最初のトークンまでの時間 (TTFT) — ストリーミングが開始されるまでの待機時間 (通常、推論モデルの場合は 0.3 ~ 2 秒以上) — と 1 秒あたりのトークン (生成速度)。合計時間 = TTFT + (出力トークン ÷ 1 秒あたりのトークン)。入力長は主に TTFT に影響し、出力長は生成に影響します。
ユーザーはストリーミング中にトークンを読み取るため、知覚される遅延は合計時間ではなく TTFT に近くなります。非ストリーミング応答 (構造化 JSON、ツール呼び出し、バッチ ジョブ) は、応答全体が準備できるまでブロックされるため、応答時間は最大限に感じられます。人間が待っているものはすべてストリーミングします。