Использование API LLM
Стоимость кэша
| Метрика | Без кеша | С кешем |
|---|
Как работает семантическое кэширование
Каждый входящий запрос преобразуется в вектор внедрения. Кэш проверяет, существует ли подобный вектор (косинусное сходство ≥ порога, обычно 0,92–0,97). Если да, сохраненный ответ возвращается мгновенно — токены LLM не расходуются. Если нет, запрос передается в LLM, а результат сохраняется для будущих обращений.
Откуда берется процент попаданий: повторяющиеся запросы (боты FAQ, поддержка клиентов) — 30–60%. Разнообразные открытые запросы (помощники по программированию, творческое письмо) — 5–15%. Вы можете увеличить частоту попаданий, снизив порог сходства, но это может привести к получению слегка неверных кэшированных ответов.
Стоимость встраивания: Каждый запрос (попадание или промах) требует встроенного поиска. При цене 0,02 доллара США за 1 миллион токенов встраивание запроса из 300 токенов стоит 0,000006 доллара США — ничтожно мало, если у вас нет миллионов запросов в день.
См. также: Быстрая экономия при кэшировании · Калькулятор стоимости Тряпки · Стоимость векторной БД
Часто задаваемые вопросы
Что такое семантический кеш для LLM?
Семантический кеш хранит предыдущие ответы LLM и использует встроенное сходство для обнаружения семантически схожих запросов. Когда сходство превышает пороговое значение, кэшированный ответ возвращается без вызова LLM, сохраняя полную стоимость токена для этого запроса.
Какая частота попадания в кеш является реалистичной?
Боты службы поддержки клиентов с повторяющимися вопросами часто достигают 30–60% ответов. Открытые чат-боты или помощники по программированию могут получить 5–15%. Хороший порог сходства (косинус 0,92–0,97) уравновешивает частоту попаданий и ухудшение качества.
Каков уровень безубыточности?
Безубыточность = стоимость кэша ÷ (запросы/месяц × токены × цена LLM/токен). Если ваш LLM стоит 0,003 доллара США за запрос, а кэш стоит 50 долларов США в месяц при 100 000 запросов в месяц, вам понадобится всего 1,7% процента попаданий, чтобы выйти на уровень безубыточности.
Чем семантическое кэширование отличается от оперативного кэширования?
Оперативное кэширование (Anthropiccache_control, автоматическое кэширование OpenAI) повторно использует вычисление KV для идентичных префиксов токенов. Семантическое кэширование осуществляется на уровне приложения — оно обслуживает полностью кэшированные ответы, когда запросы семантически схожи. Они дополняют друг друга.
Какие инструменты обеспечивают семантическое кэширование для LLM?
Популярные варианты: GPTCache (с открытым исходным кодом), Momento Vector Index (управляемый), Zep (уровень памяти), LangChain CacheBackedEmbeddings, Redis с векторным поиском. Управляемые варианты стоят 10–200 долларов в месяц; Самостоятельное размещение Redis стоит 5–30 долларов в месяц на небольшой виртуальной машине.