—за запрос
—единовременная индексация
—самая большая ежемесячная стоимость
Самая дешевая модель ответа для этой Тряпки
Тот же поиск и трафик, каждая модель ранжирована по ежемесячной стоимости.
| Модель | Стоимость / месяц | По запросу |
|---|
⚠️ Редактируемая смета с использованием справочных цен (июль 2026 г.). Стоимость Vector DB сильно варьируется в зависимости от провайдера и плана — задайте самостоятельно. Реальные счета также меняются в зависимости от реранжирования, кэширования, фильтрации метаданных и частоты переиндексации. ·
Сообщить об устаревшей цене →
Куда на самом деле идут деньги RAG
Люди полагают, что встраивания — это дорогая часть RAG. Обычно они самые дешевые. Встраивание 10 000 коротких документов часто стоит несколько центов, оплачиваемых один раз. Реальные текущие затраты – это LLM по каждому запросу - и конкретно полученный контекст ты его кормишь. Возьмите 5 блоков по 400 токенов, и вы добавите 2000 токенов ввода к каждому вопросу еще до того, как пользователь закончит печатать. Умножьте на объем запроса и получите счет.
Большие рычаги по порядку: извлечение меньше/меньшие куски (top-k и размер фрагмента), используйте более дешевая модель ответа для обычных запросов и ограничения длины ответа. Повторное внедрение только измененных документов (а не всего корпуса) предотвращает повторение единовременных затрат. Создаете остальную часть приложения? Цена бота поддержки с калькулятор стоимости чат-бота, целая особенность с Оценщик стоимости приложения с искусственным интеллектомили полный бэкэнд с Калькулятор стоимости стека API. Просто определить размер слоя хранения? См. векторный калькулятор стоимости базы данных для шишки, Qdrant и pgvector.
БинансТвилиоГугл БлизнецыМонетаGeckoAI и LLM
Часто задаваемые вопросы
Из чего складывается стоимость системы RAG?
Три части. Единоразово: встраивание всех ваших документов в векторы. Постоянно ежемесячно: база данных векторов, в которой хранятся и выполняются поиск этих векторов, плюс стоимость LLM для каждого запроса, которая включает полученные фрагменты, которые вы помещаете в подсказку в качестве контекста. Для большинства приложений RAG стоимость LLM для каждого запроса доминирует, поскольку полученный контекст может быть намного больше, чем фактический вопрос пользователя.
Почему получение контекста является самой большой затратой на RAG?
Каждый запрос отправляет в модель первые k извлеченных фрагментов в качестве входных токенов. Получите 5 фрагментов по 400 токенов, и вы заплатите 2000 входных токенов за запрос, прежде чем пользователь что-то скажет. Получение меньшего количества или меньших фрагментов или использование более дешевой модели сокращает расходы гораздо больше, чем изменение моделей внедрения.