HomeBlog › Быстрое кэширование

Как быстрое кэширование сокращает ваши счета за LLM до 90 %

Опубликовано 21 июня 2026 г. · справочные номера, проверьте перед составлением бюджета

Если ваше приложение отправляет одно и то же длинное системное приглашение, одни и те же полученные документы или одну и ту же растущую историю чата при каждом вызове, вы платите полную цену за перечитывание текста, который модель уже видела несколько секунд назад. Оперативное кэширование это исправление, и это самая большая скидка на позицию, которую большинство команд никогда не включает. Если все сделано правильно, затраты на вводимые ресурсы сокращаются на от 50% до 90%. Вот как это работает, цифры 2026 года и где это незаметно не помогает.

Что на самом деле делает кэширование подсказок

Законопроект LLM в основном входные жетоны × цена + выходные жетоны × цена. Кэширование атакует входную половину. Когда вы помечаете часть приглашения как кэшируемую, поставщик сохраняет обработанную форму в течение короткого окна; при следующем вызове, в котором повторно используется тот же префикс, вам будет выставлен счет дробь обычной скорости ввода для этих токенов вместо полной суммы. Выходная цена не изменяется — кэширование учитывает только ту часть, которую вы продолжаете отправлять повторно.

Скидки 2026 года (справка)

ПоставщикКэшированная входная ценаПримечания
ОпенАИ~50% вводаАвтоматически при длинных подсказках, без изменения кода
Антропный (Клод)~10% ввода при чтенииСкидки до 90 %, но ~25 % пишут премиум в первый раз.
Гугл Близнецы~25% вводаКэширование контекста; может добавить небольшую плату за хранение
⚠️ Справочные данные по состоянию на июнь 2026 г. — точные скидки, срок действия кэша и плата за хранение изменятся. Подтвердите действие на странице цен каждого поставщика. Anthropic и Gemini используют явные маркеры кэша; OpenAI автоматически применяет его к соответствующим префиксам.

Проработанный пример

Допустим, помощник службы поддержки отправляет Системная подсказка на 2000 токенов + база знаний для каждого сообщения плюс ~200 токенов фактического вопроса пользователя и возвращает ~300 токенов вывода. При 10 000 разговоров в месяц фиксированный блок в 2 000 токенов пересылается 10 000 раз. Использование модели с входом 2,50 доллара США / 1 миллион долларов:

Масштабируйте это до 100 тысяч или 1 миллиона разговоров, и статический префикс станет разницей между комфортным счетом и тревожным. Чем больше и чаще повторяется ваш фиксированный контекст, тем больше стоит кэширование — больше всего выигрывают приложения RAG и агенты с длинными системными подсказками.

Когда кеширование НЕ помогает (подводные камни)

Эмпирическое правило

Кэшируйте, когда вы часто и быстро повторно отправляете большой идентичный блок контекста: системные подсказки, определения инструментов, документы RAG, примеры с несколькими кадрами, длинную историю чата. Не беспокойтесь об разовых вызовах, сильно меняющихся подсказках или рабочих нагрузках с большим объемом вывода. Структурируйте приглашение статический первый, переменный последний, а скидка близка к свободным деньгам. Поставьте номер на свой случай с помощью быстрый калькулятор экономии кэшированияи сравнить модели на Калькулятор стоимости AI API.

Часто задаваемые вопросы

Сколько можно сэкономить на кэшировании запросов?

Обычно скидка 50–90 % от входной цены кэшированной части, в зависимости от поставщика. Он учитывает только повторяющиеся входные токены, а не выходные.

Изменяет ли кэширование подсказок ответы модели?

Нет. Это оптимизация выставления счетов и задержки — модель видит одни и те же токены, вы просто платите меньше за повторную отправку кэшированного префикса. Ответы не изменились.

Почему из-за кэширования мой счет увеличился?

Почти всегда надбавка за запись (например, надбавка Anthropic ~25% за создание кэша) для префиксов, которые недостаточно повторно используются до истечения срока действия, или префикса, который изменяет каждый вызов, поэтому он никогда не попадает. Кэширование окупается при частом и идентичном повторном использовании.

Справочные оценки — всегда проверяйте скидки и сборы на официальной странице цен поставщика.