—
ежемесячная стоимость
—стоимость/запрос
—доля затрат на поиск-API
—Доля затрат на синтез LLM

Статическая стоимость, эквивалентная RAG, по сравнению с фактической стоимостью автоответчика

Те же входные и выходные данные LLM, за вычетом платы за API живого веб-поиска — это то, во что будет стоить точно такой же запрос, как и в предварительно индексированной статической RAG-системе без поиска в реальном времени. Разрыв – это премия за живой поиск.

Базис затратСтоимость / запросЕжемесячная стоимость
Статический эквивалент RAG (только синтез LLM, без платы за поиск в реальном времени)——
Фактическая стоимость системы ответов (синтез LLM + API живого поиска)——

Стоимость по полученным фрагментам (top-K)

Все остальное соответствует указанным выше значениям и зависит от того, сколько результатов поиска попадает в контекст LLM на каждый запрос. Больше фрагментов может означать более обоснованные ответы, но каждый дополнительный фрагмент — это дополнительные входные токены, оплачиваемые за каждый отдельный запрос.

Фрагменты (top-K)Входные токены/запросСтоимость / запросЕжемесячная стоимость

Как это связано с другими инструментами

На этой странице цены система ответов в реальном времени — конвейер в стиле Perplexity/You.com/Bing Copilot, в котором каждый запрос попадает в сторонний API веб-поиска еще до того, как LLM увидит вопрос. Это архитектура, отличная от системы, построенной на основе уже имеющегося у вас корпуса: если ваш этап поиска представляет собой векторный поиск по документам, которые вы проиндексировали самостоятельно, без платы за API живого поиска по любому запросу, оцените его по Калькулятор стоимости тряпки вместо этого, или Калькулятор стоимости чат-бота RAG для диалогового интерфейса с историей поверх того же статического корпуса. Если вы специально рассматриваете архитектуру графа знаний вместо простого векторного поиска, Калькулятор стоимости индексации GraphRAG оценивает одноразовый пропуск на добычу, который его строит. И поскольку каждый запрос здесь оплачивает полную стоимость входных токенов для одних и тех же системных токенов приглашения и накладных расходов при повторении, проверьте, может ли кэширование подсказок сократить эти повторяющиеся затраты на Быстрый калькулятор экономии кэширования. Обратите внимание, что это также не связано с добавлением окна поиска на ваш собственный веб-сайт или в приложение — если это то, что вам нужно, это мгновенный поиск по вашему собственному контенту с защитой от опечаток с помощью Algolia, Typesense или Meilisearch по цене Калькулятор стоимости API поиска по сайту.

Поделиться: - Post (Почта) Reddit
Разместите свой проект:DigitalOcean — 200 долларов бесплатно ↗Хостингер VPS