Опубликовано 8 июля 2026 г. · справочные номера, проверьте перед составлением бюджета
Когда вы создаете чат-бота с помощью любого API LLM, каждое отправляемое вами сообщение включает в себя полная история разговоров в качестве ввода. Не только последний вопрос пользователя — все предыдущие ходы, каждый ответ помощника, все. Вот как LLM поддерживают контекст. Это также то, как ваши затраты незаметно превращаются в нечто удивительное.
К сообщению 30 в одном разговоре количество входных токенов выросло примерно с 1150 токенов до более чем 11 000. В Входные токены $5/1M (цена GPT-4o), один ответ обойдется вам почти в 7 раз дороже, чем первый.
Предположим, ваш чат-бот имеет системное приглашение на 1000 токенов, пользователи отправляют сообщения, в среднем содержащие 150 токенов, а модель каждый раз отвечает примерно 200 токенами. На ходу к:
input(k) = 1000 (система) + (k−1) × (150 + 200) (предыдущие ходы) + 150 (текущее сообщение)
Это упрощает 800 + 350к. Стоимость растет линейно с каждым ходом, потому что каждый ход навсегда добавляет 350 жетонов к каждому будущему вызову.
| Повернуть | Входные токены | Входная стоимость (5 долларов США/1 миллион долларов США) | Общая стоимость хода |
|---|---|---|---|
| 1 | 1,150 | $0.0058 | $0.009 |
| 5 | 2,550 | $0.0128 | $0.016 |
| 10 | 4,300 | $0.0215 | $0.025 |
| 20 | 7,800 | $0.039 | $0.042 |
| 30 | 11,300 | $0.0565 | $0.060 |
Цены являются ориентировочными на июль 2026 года. Сообщить об устаревшей цене →
Выход: 200 токенов × 15 долларов США/1 миллион долларов = 0,003 доллара США за ход. Модель: GPT-4o (справочная цена 5/15 долларов США).
30-й ход стоит 0,060 доллара, 1-й — 0,009 доллара. Разница в 6,8× за один и тот же вопрос пользователя за 150 токенов и ответ за 200 токенов.
Сложив все 30 ходов: общий вклад в разговор составит 186 750 токенов. Общая стоимость:
Если бы API не сохранял состояние и каждый вызов отправлял бы только текущий ход (1150 токенов), те же 30 ходов стоили бы 30 × 0,009 доллара США = $0.27. История разговоров добавляет 0,75 доллара США дополнительных затрат — деньги потрачены на перечитывание того, что модель уже обработала.
10 000 пользователей в день, каждый в среднем по 15 ходов:
| Ежедневная стоимость | Ежемесячная стоимость | |
|---|---|---|
| 15-ти ходовые разговоры (с историей) | $1,840 | $55,200 |
| Лица без гражданства (гипотетические, без истории) | $810 | $24,300 |
| Накладные расходы на историю | $1,030 | $30,900 |
Накладные расходы на историю не являются ошибкой при выставлении счетов. Это структурные затраты на создание диалогового ИИ на основе API, который оценивает каждый токен при каждом вызове. Большинство команд обнаруживают это, когда приходит счет на конец месяца.
1. Удалите старые сообщения. Keep only the last N turns (e.g., 5–8). Works well for factual Q&A assistants where old context rarely matters. Cheapest fix, implemented in an afternoon. Trade-off: the model forgets early context.
2. Сжатие с резюме. После каждых 5–10 ходов звоните модели один раз, чтобы подвести итоги разговора. Замените необработанную историю сводкой. Стоимость: один дополнительный вызов за N ходов. Преимущество: накладные расходы на историю остаются практически неизменными независимо от продолжительности разговора.
3. Скользящее окно с семантической фильтрацией. Всегда сохраняйте недавние повороты и выборочно включайте только семантически релевантные старые повороты, используя встраивания. Более сложный, но сохраняет ключевой контекст без полной стоимости истории. Стоит внедрять в масштабе для поддержки или научных сотрудников.
4. Оперативное кэширование. В Claude и Gemini пометка статического системного приглашения как кэшируемого дает скидку 50–90 % на эту часть. Не помогает с растущей историей (которая всегда уникальна), но снижает фиксированные накладные расходы. При цене 0,0050 доллара США за системное приглашение в 1000 токенов за вызов кэширование экономит ~0,0045 доллара США за ход, что значимо для миллионов вызовов. См. быстрый калькулятор экономии кэширования.
Большинству производственных чат-ботов следует использовать скользящее окно в 6–10 ходов плюс этап сжатия при определенном пороге. «Отправить всю историю навсегда» — разумный вариант по умолчанию для прототипов. Это дорогостоящий дефолт для производства.
Вставьте свои цифры в Калькулятор стоимости истории разговоров чтобы точно увидеть, как ваши затраты распределяются между поворотами, сравнить модели и оценить экономию при сжатии. Разница между историей из 30 оборотов и окном из 5 оборотов часто заключается в снижении затрат на 60–70 % при том же опыте использования продукта.
Каждый вызов API повторно отправляет полную историю разговоров в качестве входных токенов. Каждый ход добавляет сообщение пользователя и ответ помощника ко всему последующему — поэтому размер входных данных растет линейно с количеством ходов.
Наиболее практичным решением является скользящее окно: сохраняйте только последние 5–10 ходов вместо всей истории. Для помощников, для которых важен контекст, периодическое обобщение позволяет сжать старые повороты в короткий абзац, сохраняя при этом затраты на неизменном уровне. Используйте Калькулятор стоимости истории разговоров моделировать сбережения.
Только для статической части (системная подсказка, определения инструментов). Растущая история уникальна для каждого разговора, поэтому ее нельзя кэшировать. Кэширование помогает снизить фиксированные накладные расходы — часть переменной истории, за которую вы платите в любом случае.
С GPT-4o по цене 5/15 долларов за 1 миллион токенов, системным приглашением на 1000 токенов, обращениями пользователей на 150 токенов и ответами помощника на 200 токенов: всего около 1,02 доллара. Первый ход стоит 0,009 доллара, последний — 0,060 доллара — почти в 7 раз дороже.
Справочные номера основаны на ценах GPT-4o, июнь 2026 г. — проверьте текущие тарифы на странице цен поставщика.
Разверните проект чат-бота
DigitalOcean — бесплатный кредит в размере 200 долларов США → Хостингер VPS →