Costo del circuito compartido
ReAct: referencia de agente único
árbol del pensamiento
Debate entre múltiples agentes
Planificador/orquestador + subagentes aislados
—arquitectura más cara
—brecha de costos, más barato → más caro
—más caro es este número × más barato
Costo por arquitectura, misma tarea.
Ordenado por costo total del token, el más barato primero. ReAct está marcado como la línea de base de agente único con la que se mide cada multiplicador.
| Arquitectura | fichas totales | Costo | × frente a la línea base de ReAct |
|---|
Cómo se conecta esto con otras herramientas
Esta calculadora valora la capa de arquitectura (la forma del flujo de trabajo agente en sí), que es una pregunta diferente de otras dos herramientas que ya se encuentran en este sitio. El Calculadora de presupuesto de bucle de agente valora el presupuesto de iteración de bucle de un ÚNICO agente: dado un costo de token por bucle y un límite de gasto, ¿cuántos giros de pensar, actuar y observar puede permitirse ese agente antes de que usted tenga que cortarlo? Nunca se compara entre arquitecturas, solo entre cuántos turnos obtiene un agente dentro de un patrón. El Calculadora de costos del marco del agente de IA compara la sobrecarga de herramientas e infraestructura entre marcos (CrewAI versus LangGraph versus un bucle personalizado) ejecutando el MISMO patrón de arquitectura bajo diferentes tuberías. Esta calculadora se encuentra una capa por encima de ambos: mantiene constantes el marco y el costo del token por bucle y, en su lugar, compara cuatro PATRONES arquitectónicos diferentes para resolver la misma tarea (ReAct de agente único, ramificación del árbol de pensamiento, debate entre múltiples agentes y planificador/orquestador con subagentes aislados) porque el patrón que elija multiplica su gasto en token antes de que la elección del marco o el presupuesto del bucle entren en escena.
Calculadora de presupuesto de bucle de agenteCalculadora de costos del marco del agente de IACalculadora de costos de enjambre de agentes de IAAhorro de almacenamiento en caché rápido
Cómo funciona esta calculadora
Cada una de las cuatro arquitecturas tiene el mismo precio compartido. fichas por bucle cifra, por lo que lo único que cambia el costo entre ellos es la FORMA del flujo de trabajo, no el precio por paso. Reaccionar es la línea de base con un solo agente: reactLoops × tokensPerLoop — un agente, un bucle, listo cuando esté terminado. árbol del pensamiento multiplica ese mismo costo por bucle por ambos factor de ramificación y profundidad — branching × depth × tokensPerLoop - porque explorar 3 ramas en 3 niveles de profundidad significa ejecutar aproximadamente 9 bucles de razonamiento en lugar de uno. Debate entre múltiples agentes dirige cada agente de debate para sus propias rondas. agents × rounds × tokensPerLoop — luego agrega las fichas que el juez debe leer: la respuesta final de cada agente más el razonamiento del propio juez, agents × answerTokens + judgeTokens.
Planificador/orquestador es el más involucrado: el orquestador gasta su propio fichas de planificación al frente, luego genera una serie de subagentes, cada uno de los cuales ejecuta su PROPIO bucle interno completo de forma aislada: subagents × subagentLoops × tokensPerLoop - y cada uno de los cuales informa solo un comprimido resumen que lee el orquestador, subagents × summaryTokens. El propio contexto del orquestador sigue siendo pequeño porque solo ve los resúmenes, no los rastros completos de los subagentes, pero el gasto total de tokens en TODO EL SISTEMA, que es lo que realmente se factura en cada llamada de modelo en proceso, aún incluye cada token que cada subagente generó internamente. Un orquestador eficiente no significa un sistema barato: significa que la parte costosa salió de la ventana contextual del orquestador y se colocó en un conjunto de bucles de subagente paralelos que se facturan de todos modos. El costo de cada arquitectura es totalTokens / 1,000,000 × pricePerMillion, y el multiplicador de cada patrón que no es ReAct es simplemente el total de tokens dividido por el total de tokens de la línea base de ReAct.
Preguntas frecuentes
¿Por qué el patrón de planificador/orquestador "inteligente" termina costando más que un único agente ReAct en esta calculadora?
Porque que el orquestador sea eficiente y que el sistema sea económico son dos cosas diferentes. En el patrón planificador/trabajador, el orquestador central solo lee un resumen comprimido de cada subagente (unos pocos cientos de tokens), lo que hace que el PROPIO contexto del orquestador sea pequeño y lo mantiene muy por debajo de cualquier límite máximo de ventana de contexto. Pero cada uno de esos subagentes todavía ejecuta su propio bucle interno completo de pasos de pensar, actuar y observar para realizar su parte de la tarea, y cada uno de esos tokens de bucle se genera y factura en algún lugar, aunque el orquestador nunca los ve directamente. Con 3 subagentes cada uno ejecutando 4 bucles a 3000 tokens por bucle, es decir, 36 000 tokens de trabajo de subagente que se realizan a un lado, más los propios tokens de planificación del orquestador y los resúmenes que regresan: gasto en todo el sistema que un solo agente ReAct que realiza 5 bucles de la misma tarea nunca tiene que pagar, porque solo hay un bucle en ejecución, no un bucle de orquestador más tres bucles de subagente paralelos.
¿Vale alguna vez la pena el costo adicional del debate sobre el árbol del pensamiento o entre múltiples agentes?
Sí, pero el argumento para pagar el multiplicador tiene que basarse en algo más que el costo bruto del token, porque solo con los tokens ambos patrones pierden ante un único ciclo de ReAct cada vez. El árbol del pensamiento gana 1,8 veces (o peor, con mayor ramificación o profundidad) cuando una tarea tiene un espacio de solución genuinamente grande donde el compromiso prematuro con una ruta de razonamiento probablemente produzca una respuesta incorrecta que luego debe rehacerse desde cero: las ramas adicionales son un seguro contra un reintento mucho más costoso, no una actualización gratuita. El debate entre múltiples agentes gana su costo cuando la autoconsistencia de un solo modelo es el riesgo real, como en la clasificación de alto riesgo o la revisión contradictoria, donde el hecho de que agentes independientes alcancen respuestas por separado y luego sean juzgados detecta errores que un pase en solitario pasaría por alto. Si la tarea está dentro del rango confiable de un solo agente, ninguno de los patrones vale su multiplicador: estás pagando por un seguro que no necesitas.
¿El almacenamiento en caché rápido cambia qué arquitectura es más barata?
Reduce los cuatro costos aproximadamente en la misma proporción sin reordenarlos, porque el almacenamiento en caché descuenta los prefijos repetidos de los tokens de entrada (indicaciones del sistema, esquemas de herramientas, contexto compartido) y cada uno de estos cuatro patrones aún necesita esos prefijos presentes en cada bucle, rama, turno de agente o paso de subagente. Cada uno de los 5 bucles de ReAct se beneficia en parte del almacenamiento en caché del prefijo repetido, al igual que las ramas del árbol de pensamiento, las rondas por agente del debate y los bucles internos de cada subagente planificador: el descuento se aplica de manera más o menos uniforme en todos los ámbitos en lugar de favorecer la forma de un patrón sobre otro. Lo que el almacenamiento en caché no hace es cambiar la aritmética subyacente del recuento de bucles: un planificador que genera 3 subagentes, cada uno de los cuales ejecuta 4 bucles, sigue generando muchos más tokens generados (de salida) que un solo agente ReAct de 5 bucles, y los tokens de salida generalmente no son elegibles para el descuento de entrada en caché, por lo que la clasificación del patrón de arquitectura en esta calculadora se mantiene independientemente de su configuración de almacenamiento en caché.
¿En qué se diferencia de la calculadora de presupuesto del ciclo de agentes y la calculadora de costos del marco de agentes de IA que ya se encuentran en este sitio?
Los tres tokens del agente de precios se gastan pero en diferentes capas de la misma pila. La calculadora de presupuesto de bucle de agente valora el presupuesto de iteración de bucle de un ÚNICO agente: dado un costo de token por bucle y un límite de gasto, cuántos turnos de pensar, actuar y observar puede permitirse ese agente antes de tener que cortarlo; nunca se compara entre arquitecturas, solo entre cuántos turnos obtiene un agente. La calculadora de costos del marco del agente de IA compara la sobrecarga de herramientas e infraestructura de ejecutar una carga de trabajo de agente determinada en diferentes marcos, como CrewAI versus LangGraph versus un bucle personalizado: el mismo patrón de arquitectura, con precios según diferentes tuberías. Esta calculadora se encuentra una capa por encima de ambos: mantiene constantes el marco y el costo por bucle y, en su lugar, compara cuatro PATRONES ARQUITECTÓNICOS diferentes para resolver la misma tarea (ReAct de un solo agente, ramificación del árbol de pensamiento, debate entre múltiples agentes y planificador/orquestador con subagentes aislados) para mostrar que el patrón que elija multiplica su gasto simbólico antes de que la elección del marco o el presupuesto del bucle entren en escena.