Comment fonctionne cette calculatrice
Chacune des quatre architectures est tarifée à partir du même prix partagé jetons par boucle chiffre, donc la seule chose qui change le coût entre eux est la FORME du flux de travail, pas le prix par étape. Réagir est la ligne de base pour un agent unique : reactLoops × tokensPerLoop — un agent, une boucle, terminé quand c'est fait. Arbre de pensée multiplie ce même coût par boucle par les deux facteur de branchement et profondeur — branching × depth × tokensPerLoop - parce qu'explorer 3 branches à 3 niveaux de profondeur signifie exécuter environ 9 boucles de raisonnement au lieu d'une. Débat multi-agents dirige chaque agent de débat pour ses propres tours - agents × rounds × tokensPerLoop — ajoute ensuite les jetons que le juge doit lire : la réponse finale de chaque agent plus le propre raisonnement du juge, agents × answerTokens + judgeTokens.
Planificateur/orchestre est le plus impliqué : l'orchestrateur dépense ses propres jetons de planification à l'avant, puis génère un certain nombre de sous-agents, dont chacun exécute sa PROPRE boucle interne complète de manière isolée — subagents × subagentLoops × tokensPerLoop - et dont chacun ne renvoie qu'un contenu compressé résumé que l'orchestrateur lit, subagents × summaryTokens. Le propre contexte de l'orchestrateur reste petit car il ne voit que les résumés, pas les traces complètes des sous-agents - mais la dépense totale en jetons à l'échelle du système, qui est réellement facturée pour chaque appel de modèle dans le pipeline, inclut toujours chaque jeton généré en interne par chaque sous-agent. Un orchestrateur Lean ne signifie pas un système bon marché : cela signifie que la partie coûteuse est déplacée hors de la fenêtre contextuelle de l'orchestrateur et vers un ensemble de boucles de sous-agents parallèles qui sont facturées de la même manière. Le coût de chaque architecture est totalTokens / 1,000,000 × pricePerMillion, et le multiplicateur de chaque modèle non ReAct est simplement le nombre total de jetons divisé par le nombre total de jetons de la ligne de base ReAct.
Questions fréquemment posées
Pourquoi le modèle planificateur/orchestrateur « intelligent » finit-il par coûter plus cher qu'un seul agent ReAct dans ce calculateur ?
Parce qu’un orchestrateur lean et un système bon marché sont deux choses différentes. Dans le modèle planificateur/travailleur, l'orchestrateur central relit uniquement un résumé compressé de chaque sous-agent (quelques centaines de jetons), ce qui rend le contexte PROPRE de l'orchestrateur petit et le maintient bien en dessous du plafond de la fenêtre de contexte. Mais chacun de ces sous-agents exécute toujours sa propre boucle interne complète d'étapes de réflexion-action-observation pour réellement accomplir sa part de tâche, et chacun de ces jetons de boucle est généré et facturé quelque part, même si l'orchestrateur ne les voit jamais directement. Avec 3 sous-agents exécutant chacun 4 boucles à 3 000 jetons par boucle, cela représente 36 000 jetons de travail de sous-agent se produisant en parallèle, plus les propres jetons de planification de l'orchestrateur et les résumés qui reviennent - des dépenses à l'échelle du système qu'un seul agent ReAct effectuant 5 boucles de la même tâche n'a jamais à payer, car il n'y a qu'une seule boucle en cours d'exécution, pas une boucle d'orchestrateur plus trois boucles de sous-agent parallèles.
L’arbre de pensée ou le débat multi-agents valent-ils le coût supplémentaire ?
Oui, mais les arguments en faveur du paiement du multiplicateur doivent reposer sur autre chose que le coût brut des jetons, car sur les seuls jetons, les deux modèles perdent à chaque fois face à une seule boucle ReAct. L'arbre de la pensée gagne 1,8x (ou pire, avec une ramification ou une profondeur plus élevée) lorsqu'une tâche a un espace de solution véritablement vaste où un engagement prématuré dans un chemin de raisonnement est susceptible de produire une mauvaise réponse qui doit ensuite être refaite à partir de zéro - les branches supplémentaires sont une assurance contre une nouvelle tentative beaucoup plus coûteuse, pas une mise à niveau gratuite. Le débat multi-agents gagne son prix lorsque la propre cohérence d'un modèle unique constitue le risque réel, comme dans le cas d'une classification à enjeux élevés ou d'un examen contradictoire, où des agents indépendants parviennent aux réponses séparément et sont ensuite jugés pour détecter les erreurs qu'un passage en solo manquerait. Si la tâche se situe dans la plage de fiabilité d'un seul agent, aucun des deux modèles ne vaut son multiplicateur : vous payez pour une assurance dont vous n'avez pas besoin.
La mise en cache rapide modifie-t-elle l'architecture la moins chère ?
Cela réduit les quatre coûts à peu près dans la même proportion sans les réorganiser, car la mise en cache réduit les préfixes répétés des jetons d'entrée (invites système, schémas d'outils, contexte partagé) et chacun de ces quatre modèles a toujours besoin de ces préfixes renvoyés à chaque boucle, branche, tour d'agent ou étape de sous-agent. Les 5 boucles de ReAct bénéficient chacune en partie de la mise en cache du préfixe répété, tout comme les branches de l'arbre de pensée, les cycles de débat par agent et les boucles internes de chaque sous-agent du planificateur - la réduction s'applique à peu près uniformément dans tous les domaines plutôt que de favoriser la forme d'un modèle par rapport à une autre. Ce que la mise en cache ne fait pas, c'est modifier l'arithmétique sous-jacente du nombre de boucles : un planificateur générant 3 sous-agents qui exécutent chacun 4 boucles génère toujours beaucoup plus de jetons générés (de sortie) au total qu'un seul agent ReAct à 5 boucles, et les jetons de sortie ne sont généralement pas du tout éligibles à la remise sur les entrées mises en cache, de sorte que le classement des modèles d'architecture dans cette calculatrice est valable quelle que soit votre configuration de mise en cache.
En quoi est-ce différent du calculateur de budget de boucle d'agent et du calculateur de coût du cadre d'agent d'IA déjà présents sur ce site ?
Les trois jetons d'agent de prix dépensent mais à différentes couches de la même pile. Le calculateur de budget de boucle d'agent évalue le budget d'itération de boucle d'un SEUL agent - étant donné le coût du jeton par boucle et un plafond de dépenses, combien de tours de réflexion-action-observation un agent peut-il se permettre avant de devoir l'interrompre - il ne compare jamais les architectures, mais uniquement le nombre de tours qu'un agent obtient. Le calculateur de coût du framework d'agent IA compare les frais généraux d'outillage et d'infrastructure liés à l'exécution d'une charge de travail d'agent donnée sur différents frameworks, tels que CrewAI et LangGraph, par rapport à une boucle personnalisée - le même modèle d'architecture, tarifé selon une plomberie différente. Ce calculateur se situe à un niveau supérieur des deux : il maintient le cadre et le coût par boucle constants et compare à la place quatre MODÈLES ARCHITECTURAUX différents pour résoudre la même tâche : ReAct à agent unique, branchement d'arbre de pensée, débat multi-agents et planificateur/orchestrateur avec sous-agents isolés - pour montrer que le modèle que vous choisissez multiplie vos dépenses en jetons avant que le choix du cadre ou la budgétisation en boucle n'entre en scène.