Опубликовано 15 июля 2026 г. · справочные цены, проверьте перед составлением бюджета
«Сколько будет стоить наш чат-бот для поддержки искусственного интеллекта?» — один из самых частых вопросов, которые мы видим. Ответ варьируется в 23 раза в зависимости от модели — и растет быстрее, чем вы ожидаете, по мере накопления истории разговоров.
| Модель | $/1 млн в | Выход $/1 миллион | Стоимость за чат | 100 тыс. чатов в месяц | Ежегодно |
|---|---|---|---|---|---|
| Близнецы 2.0 Флэш | $0.10 | $0.40 | $0.0043 | $432 | $5,184 |
| ГПТ-4о мини | $0.15 | $0.60 | $0.0065 | $648 | $7,776 |
| Клод Хайку 4.5 | $0.80 | $4.00 | $0.0374 | $3,744 | $44,928 |
| ГПТ-4о | $2.50 | $10.00 | $0.1013 | $10,125 | $121,500 |
| Клод Сонет 4 | $3.00 | $15.00 | $0.1258 | $12,576 | $150,912 |
Именно здесь большинство оценок стоимости чат-ботов ошибаются. Они моделируют стоимость сообщения при фиксированном количестве токенов, но на самом деле каждое сообщение несет полную историю.
| Сообщение # | Входные токены (включая историю) | Выходные токены | Стоимость флэш-памяти | Стоимость ГПТ-4о |
|---|---|---|---|---|
| 1 | 550 | 280 | $0.000167 | $0.00418 |
| 2 | 900 | 280 | $0.000202 | $0.00505 |
| 4 | 1,400 | 280 | $0.000252 | $0.00630 |
| 6 | 1,950 | 280 | $0.000307 | $0.00768 |
| 8 (финальный) | 2,500 | 280 | $0.000362 | $0.00905 |
| Всего (8 сообщений) | ~10800 | ~2240 | $0.0043 | $0.101 |
Не для всех запросов в службу поддержки требуется одна и та же модель. Направляйте запросы на разные уровни:
Простой классификатор намерений (сам по себе дешевый — Flash стоит ~0,002 доллара за вызов маршрутизации) может определить, какой уровень обрабатывает каждый диалог.
Вместо того, чтобы включать полную расшифровку в каждое сообщение, суммируйте разговор после сообщения 4 и передайте сжатое резюме (≈200 токенов) для сообщений 5+. Это сохраняет контекст стабильным, а не растет линейно.
Эффект: уменьшает средний ввод на одно сообщение с 1350 до ~600 токенов — сокращение затрат на ввод на 55%. На GPT-4o: 10 125 долларов США → ~ 5 400 долларов США в месяц.
Контекст системного приглашения и часто задаваемых вопросов (400 токенов в нашей модели) повторяется в каждом отдельном сообщении. И Anthropic, и OpenAI предлагают оперативное кэширование — токены повторяющихся префиксов оплачиваются по ставке 10–50 % от обычной ставки после первого запроса.
Если ваша системная подсказка содержит 1000 токенов и вы ее кэшируете, вы экономите 90% на этих 1000 токенах во всех последующих сообщениях. При 100 тысячах чатов × 8 сообщений = 800 тысяч сообщений это 800 миллионов токенов × 0,10 доллара США/1 миллиона × 90% = Экономия 72 долл. США в месяц только на Flash. На GPT-4o экономия в абсолютном выражении больше.
| Шкала | Вспышка | Смешанный (маршрутизация) | ГПТ-4о |
|---|---|---|---|
| 10 тыс. чатов в месяц (стартап) | $43 | $164 | $1,013 |
| 100 тыс. чатов в месяц (рост) | $432 | $1,639 | $10,125 |
| 500 тыс. чатов в месяц (масштаб) | $2,160 | $8,195 | $50,625 |
| 1 млн чатов в месяц (корпоративное) | $4,320 | $16,390 | $101,250 |
При 1 млн чатов в месяц разница между Flash и GPT-4o составляет 97 тысяч долларов в месяц — 1,16 миллиона долларов в год. Даже если Flash требует на 15% больше эскалации до агентов-людей, математика почти всегда отдает предпочтение более дешевому уровню модели.
Это реальный вопрос, и он полностью зависит от вашего варианта использования. Для Ответы на часто задаваемые вопросы, статус заказа, политика возврата, информация о доставке. — В контролируемых оценках производительность Flash сравнима с GPT-4o. Для тонкая обработка жалоб, многоэтапное устранение неполадок или ситуации, требующие подлинного рассуждения о крайних случаях — Передовые модели имеют измеримое преимущество.
Практический подход: запустить Flash в течение 30 дней, измерить скорость эскалации и CSAT, а затем сравнить с базовым уровнем. Если CSAT падает <1 балла, а эскалация возрастает <5%, смена модели оправдана экономией средств.
При 100 000 чатов в месяц с 8 сообщениями в среднем: Gemini Flash ~ 432 доллара, GPT-4o mini ~ 648 долларов, Claude Haiku ~ 3744 доллара, GPT-4o ~ 10 125 долларов. Выбор модели является самым большим рычагом затрат.
Каждое сообщение включает полную историю в качестве входных токенов. Сообщение 1 стоит ~400 жетонов ввода; Сообщение 8 стоит ~2500 — в 6 раз больше при том же выходе. Без обобщения разговоров затраты растут линейно с длиной чата.
Для ответов на часто задаваемые вопросы, статуса заказа и вопросов политики — обычно да. Для детальной обработки жалоб или сложного устранения неполадок — сначала сравните результаты. Многие команды используют Flash на 60–70 % объема и в крайних случаях переходят на передовую модель.
Три основных рычага: (1) маршрутизация модели — используйте Flash для простых запросов, GPT-4o только для сложных; (2) обобщение разговоров — сжать старую историю примерно в 200 токенов; (3) кэширование подсказок — и Anthropic, и OpenAI предлагают скидки 50–90 % на повторяющиеся префиксы подсказок.