Стоимость чат-бота RAG во многом зависит от контекста, который вы вставляете в подсказку., не вопрос. Каждый запрос = встраивание + векторный поиск + вызов LLM, переносящий ваши фрагменты. Введите объем использования, чтобы увидеть ежемесячный счет.
—за запрос
—в год
—запросов/мес.
Разбивка затрат по каждому запросу
| Компонент | $/запрос | % от общего количества |
|---|
⚠️Справочная смета (июль 2026). Внедрение токенов стоимостью ~ 0,02 доллара за 1 миллион долларов и векторный запрос ничтожны по сравнению с вызовом LLM, передающим полученный контекст. Цены варьируются в зависимости от модели и поставщика — введите свои реальные цены. Хранилище векторной БД оплачивается отдельно (см. калькулятор стоимости векторной БД). ·
Сообщить об устаревшей цене →
Почему полученный контекст является фактором затрат
Люди предполагают, что этот вопрос влияет на стоимость RAG. Это не так — полученные куски вы вставляете в командную строку do. Возьмите 8 блоков по 500 токенов, и каждый запрос будет содержать 4000 входных токенов, прежде чем модель запишет слово. Вот почему получение меньшего количества, меньших и лучших кусков превосходит любую другую оптимизацию, за которой следует кэширование статическое системное приглашение. Измените размер векторного хранилища с помощью векторный калькулятор стоимости базы данныхи сравнить модели на Калькулятор стоимости AI API. Информацию о боте, отличном от RAG, см. калькулятор стоимости чат-бота.
Калькулятор предоставленной пропускной способности (PTU)Калькулятор стоимости многооборотного разговораКалькулятор разметки шлюза AIКалькулятор цен на место и использованиеОценщик стоимости приложения AI
Как работает этот калькулятор
Оцените, сколько стоит чат-бот RAG за запрос и в месяц — встраивания, векторный поиск и вызов LLM, передающий ваш контекст.
Часто задаваемые вопросы
Сколько стоит чат-бот RAG за запрос?
Каждый запрос RAG оплачивает встраивание вопроса, поиск в векторной базе данных и вызов LLM, который включает полученные фрагменты в качестве контекста. Входные данные LLM (ваш полученный контекст может состоять из тысяч токенов) обычно доминирует; вложения и векторный запрос стоят центов или меньше.
Как сократить расходы на RAG?
Получайте все меньше и меньше фрагментов, кэшируйте системные приглашения, используйте более дешевую модель для рутинных ответов и кэшируйте внедрения для повторяющихся запросов. Размер полученного контекста является самым большим рычагом затрат.