Использование API LLM

Стоимость кэша

Метрика Без кеша С кешем

Как работает семантическое кэширование

Каждый входящий запрос преобразуется в вектор внедрения. Кэш проверяет, существует ли подобный вектор (косинусное сходство ≥ порога, обычно 0,92–0,97). Если да, сохраненный ответ возвращается мгновенно — токены LLM не расходуются. Если нет, запрос передается в LLM, а результат сохраняется для будущих обращений.

Откуда берется процент попаданий: повторяющиеся запросы (боты FAQ, поддержка клиентов) — 30–60%. Разнообразные открытые запросы (помощники по программированию, творческое письмо) — 5–15%. Вы можете увеличить частоту попаданий, снизив порог сходства, но это может привести к получению слегка неверных кэшированных ответов.

Стоимость встраивания: Каждый запрос (попадание или промах) требует встроенного поиска. При цене 0,02 доллара США за 1 миллион токенов встраивание запроса из 300 токенов стоит 0,000006 доллара США — ничтожно мало, если у вас нет миллионов запросов в день.

См. также: Быстрая экономия при кэшировании · Калькулятор стоимости Тряпки · Стоимость векторной БД

Часто задаваемые вопросы

Что такое семантический кеш для LLM?

Семантический кеш хранит предыдущие ответы LLM и использует встроенное сходство для обнаружения семантически схожих запросов. Когда сходство превышает пороговое значение, кэшированный ответ возвращается без вызова LLM, сохраняя полную стоимость токена для этого запроса.

Какая частота попадания в кеш является реалистичной?

Боты службы поддержки клиентов с повторяющимися вопросами часто достигают 30–60% ответов. Открытые чат-боты или помощники по программированию могут получить 5–15%. Хороший порог сходства (косинус 0,92–0,97) уравновешивает частоту попаданий и ухудшение качества.

Каков уровень безубыточности?

Безубыточность = стоимость кэша ÷ (запросы/месяц × токены × цена LLM/токен). Если ваш LLM стоит 0,003 доллара США за запрос, а кэш стоит 50 долларов США в месяц при 100 000 запросов в месяц, вам понадобится всего 1,7% процента попаданий, чтобы выйти на уровень безубыточности.

Чем семантическое кэширование отличается от оперативного кэширования?

Оперативное кэширование (Anthropiccache_control, автоматическое кэширование OpenAI) повторно использует вычисление KV для идентичных префиксов токенов. Семантическое кэширование осуществляется на уровне приложения — оно обслуживает полностью кэшированные ответы, когда запросы семантически схожи. Они дополняют друг друга.

Какие инструменты обеспечивают семантическое кэширование для LLM?

Популярные варианты: GPTCache (с открытым исходным кодом), Momento Vector Index (управляемый), Zep (уровень памяти), LangChain CacheBackedEmbeddings, Redis с векторным поиском. Управляемые варианты стоят 10–200 долларов в месяц; Самостоятельное размещение Redis стоит 5–30 долларов в месяц на небольшой виртуальной машине.