costo mensual
costo/consulta
participación del costo de la API de búsqueda
Participación del costo de síntesis de LLM

Costo equivalente a RAG estático versus costo real del motor de respuesta

Las mismas entradas y salidas de LLM, menos la tarifa de API de búsqueda web en vivo: esto es lo que costaría exactamente la misma consulta como un sistema RAG estático preindexado y sin búsqueda en vivo. La brecha es la prima de búsqueda en vivo.

base de costoCosto/consultaCosto mensual
Equivalente a RAG estático (solo síntesis LLM, sin tarifa de búsqueda en vivo)
Costo real del motor de respuestas (síntesis LLM + API de búsqueda en vivo)

Costo por fragmentos recuperados (top-K)

Todo lo demás se mantiene en los valores anteriores, teniendo en cuenta cuántos resultados de búsqueda se incluyen en el contexto del LLM por consulta. Más fragmentos pueden significar respuestas mejor fundamentadas, pero cada fragmento adicional son tokens de entrada adicionales que se facturan en cada consulta.

Fragmentos (top-K)Tokens de entrada/consultaCosto/consultaCosto mensual

Cómo se conecta esto con otras herramientas

Esta página tiene un precio motor de respuesta de búsqueda en vivo – un canal estilo Perplexity / You.com / Bing Copilot donde cada consulta llega a una API de búsqueda web de terceros antes de que el LLM vea la pregunta. Se trata de una arquitectura diferente a la de un sistema construido en torno a un corpus que ya posee: si su paso de recuperación es una búsqueda vectorial en documentos que usted mismo indexó, sin tarifa de API de búsqueda en vivo para ninguna consulta, póngale precio en el Calculadora de costos RAG en cambio, o el Calculadora de costos del chatbot RAG para una interfaz conversacional con historial sobre ese mismo corpus estático. Si está sopesando específicamente una arquitectura de gráficos de conocimiento en lugar de una simple recuperación de vectores, el Calculadora de costos de indexación GraphRAG valora el pase de extracción único que lo construye. Y debido a que aquí cada consulta paga el precio total del token de entrada por el mismo mensaje del sistema y tokens generales al repetirse, verifique si el almacenamiento en caché del mensaje puede reducir ese costo recurrente en el Calculadora de ahorro de almacenamiento en caché rápida.

Aloja tu proyecto:Océano Digital — $200 gratis ↗VPS Hostinger