—последний ход один
—против фиксированной стоимости
—с окном/кешем
Стоимость увеличивается с количеством ходов
Затраты за ход продолжают расти по мере накопления истории, поэтому кривая совокупных затрат изгибается вверх — удвоение оборотов более чем удваивает счет.
| В свою очередь | Этот ход стоит | кумулятивный |
|---|
Вы платите за историю на каждом шагу
Языковая модель не имеет состояния: она ничего не запоминает между вызовами API, поэтому для продолжения диалога ваше приложение повторно отправляет всю расшифровку — системное приглашение, каждое прошлое сообщение пользователя и каждый прошлый ответ — в качестве входных данных каждого нового запроса. Это означает, что ввод увеличивается по одному обмену за раз, а стоимость всего разговора растет примерно пропорционально квадрату количества ходов, а не линейно. Последний ход длинного чата является самым дорогим, поскольку он содержит большую часть истории, а фиксированное системное приглашение оплачивается один раз за ход. Три рычага опускают его обратно: раздвижное окно который сохраняет только последние ходы (стоимость становится линейной за счет памяти), быстрое кэширование это выставляет счет за повторный префикс с огромной скидкой, а подведение итогов старого превращается в краткий обзор. Сравните одно окно на Калькулятор стоимости контекстного окна, размер выигрыша в кэшировании на быстрый калькулятор экономии кэширования, и стоит полноценного помощника на калькулятор стоимости чат-бота.
Калькулятор предоставленной пропускной способности (PTU)Калькулятор разметки шлюза AIКалькулятор цен на место и использованиеОценщик стоимости приложения AIЦены на оболочку ИИ
Как работает этот калькулятор
The Калькулятор стоимости многооборотного разговора оценивает общую стоимость токена полного сеанса чата, а не одного запроса. Поскольку большинство API чата не сохраняют состояние, каждый новый ход повторно отправляет всю предыдущую историю, поэтому калькулятор умножает ваш системная подсказка, токены за сообщение пользователя, и жетоны за ответ помощника по растущему транскрипту для каждого из указанных поворачивается, затем применяет входные и выходные цены за миллион токенов. Основной фактор затрат заключается в том, что повторная отправка истории приводит к накоплению входных токенов. квадратично с подсчетом оборотов, поэтому долгий разговор может стоить гораздо дороже, чем предполагают отдельные сообщения.
Ключевым компромиссом является контроль над этим ростом. Установка раздвижное окно сохраняет только самые последние ходы, ограничивая количество пересылаемых историй, в то время как скидка на кэш снижает цену повторной приставки. И более низкая стоимость, но более узкое окно означает, что модель забывает более ранний контекст, поэтому следите за тем, насколько агрессивно вы обрезаете, прежде чем качество пострадает.
Часто задаваемые вопросы
Почему длинный чат стоит больше, чем предполагает количество сообщений?
Поскольку LLM не имеет памяти между вызовами, каждый ход должен повторно отправлять весь предыдущий разговор в качестве входных данных, чтобы модель могла видеть контекст. На десятом ходу модель перечитывает все девять предыдущих обменов информацией плюс системное приглашение, на двадцатом ходу она перечитывает девятнадцать и так далее. Таким образом, входные жетоны растут с каждым ходом, а совокупная стоимость всего разговора растет примерно пропорционально квадрату количества ходов, а не линейно. Разговор на сто оборотов может стоить гораздо дороже, чем сто одноразовых звонков того же размера сообщения: история — это то, за что вы платите, снова и снова.
Как я могу предотвратить взрыв стоимости разговора?
Три рычага. Скользящее окно сохраняет только последние несколько поворотов истории, ограничивая входные данные фиксированным размером, поэтому стоимость растет линейно, а не квадратично — ценой того, что модель забывает старый контекст. Кэширование подсказок позволяет провайдеру хранить повторяющийся префикс и выставлять счет за него с большой скидкой при каждом повторном использовании, что идеально, когда ранняя история и системное подсказка остаются идентичными. А обобщение сжимает старые повороты в краткое изложение, так что вы сохраняете смысл, не сохраняя лексемы. Этот калькулятор показывает наивную стоимость полной истории наряду с оконной и кэшированной версией, чтобы вы могли увидеть, какой рычаг окупается в зависимости от продолжительности вашего разговора.
Имеет ли значение более крупная системная подсказка в долгом разговоре?
Да, больше, чем люди ожидают, потому что системное приглашение отправляется повторно при каждом ходе. Системное приглашение из 2000 токенов в диалоге из пятидесяти ходов оплачивается пятьдесят раз — сто тысяч входных токенов до того, как будет засчитано любое пользовательское сообщение. В длинных или объемных чатах фиксированное системное приглашение часто составляет большую часть счета, чем сам разговор, а это именно тот вид затрат, для устранения которого предназначено кэширование подсказок. Калькулятор разделяет вклад системной подсказки, чтобы вы могли увидеть, стоит ли его обрезать или кэшировать.