—последний ход один
—против фиксированной стоимости
—с окном/кешем
Стоимость увеличивается с количеством ходов
Затраты за ход продолжают расти по мере накопления истории, поэтому кривая совокупных затрат изгибается вверх — удвоение оборотов более чем удваивает счет.
| В свою очередь | Этот ход стоит | кумулятивный |
|---|
Вы платите за историю на каждом шагу
Языковая модель не имеет состояния: она ничего не запоминает между вызовами API, поэтому для продолжения диалога ваше приложение повторно отправляет всю расшифровку — системное приглашение, каждое прошлое сообщение пользователя и каждый прошлый ответ — в качестве входных данных каждого нового запроса. Это означает, что ввод увеличивается по одному обмену за раз, а стоимость всего разговора растет примерно пропорционально квадрату количества ходов, а не линейно. Последний ход длинного чата является самым дорогим, поскольку он содержит большую часть истории, а фиксированное системное приглашение оплачивается один раз за ход. Три рычага опускают его обратно: раздвижное окно который сохраняет только последние ходы (стоимость становится линейной за счет памяти), быстрое кэширование это выставляет счет за повторный префикс с огромной скидкой, а подведение итогов старого превращается в краткий обзор. Сравните одно окно на Калькулятор стоимости контекстного окна, размер выигрыша в кэшировании на быстрый калькулятор экономии кэширования, и стоит полноценного помощника на калькулятор стоимости чат-бота.
Калькулятор предоставленной пропускной способности (PTU)Калькулятор разметки шлюза AIКалькулятор цен на место и использованиеОценщик стоимости приложения AIЦены на оболочку ИИ
Как работает этот калькулятор
Бесплатный калькулятор стоимости многоходового чата — поскольку каждый ход повторно отправляет всю историю, стоимость разговора LLM растет пропорционально квадрату количества ходов, а не линейно.
Часто задаваемые вопросы
Почему длинный чат стоит больше, чем предполагает количество сообщений?
Поскольку LLM не имеет памяти между вызовами, каждый ход должен повторно отправлять весь предыдущий разговор в качестве входных данных, чтобы модель могла видеть контекст. На десятом ходу модель перечитывает все девять предыдущих обменов информацией плюс системное приглашение, на двадцатом ходу она перечитывает девятнадцать и так далее. Таким образом, входные жетоны растут с каждым ходом, а совокупная стоимость всего разговора растет примерно пропорционально квадрату количества ходов, а не линейно. Разговор на сто оборотов может стоить гораздо дороже, чем сто одноразовых звонков того же размера сообщения: история — это то, за что вы платите, снова и снова.
Как я могу предотвратить взрыв стоимости разговора?
Три рычага. Скользящее окно сохраняет только последние несколько поворотов истории, ограничивая входные данные фиксированным размером, поэтому стоимость растет линейно, а не квадратично — ценой того, что модель забывает старый контекст. Кэширование подсказок позволяет провайдеру хранить повторяющийся префикс и выставлять счет за него с большой скидкой при каждом повторном использовании, что идеально, когда ранняя история и системное подсказка остаются идентичными. А обобщение сжимает старые повороты в краткое изложение, так что вы сохраняете смысл, не сохраняя лексемы. Этот калькулятор показывает наивную стоимость полной истории наряду с оконной и кэшированной версией, чтобы вы могли увидеть, какой рычаг окупается в зависимости от продолжительности вашего разговора.
Имеет ли значение более крупная системная подсказка в долгом разговоре?
Да, больше, чем люди ожидают, потому что системное приглашение отправляется повторно при каждом ходе. Системное приглашение из 2000 токенов в диалоге из пятидесяти ходов оплачивается пятьдесят раз — сто тысяч входных токенов до того, как будет засчитано любое пользовательское сообщение. В длинных или объемных чатах фиксированное системное приглашение часто составляет большую часть счета, чем сам разговор, а это именно тот вид затрат, для устранения которого предназначено кэширование подсказок. Калькулятор разделяет вклад системной подсказки, чтобы вы могли увидеть, стоит ли его обрезать или кэшировать.