—
frais généraux de compactage—compactages
—frais généraux
—coût total d'exploitation
Là où le compactage porte ses fruits : appuyer sur la gâchette
Compactez trop tôt et vous déclenchez de nombreux événements ; compacter trop tard (ou jamais) et chaque étape relit un contexte énorme. La colonne du coût total comporte généralement un minimum au milieu.
| Compacter à | Compactages | Aérien | Coût total d'exploitation |
|---|
Le ménage pour lequel personne ne budgétise
An autonomous agent has no long-term memory of its own run, so it keeps the whole working context in the prompt: the system instructions, the tool definitions, every tool result it has seen and every step it has taken. Ce contexte croît de façon monotone, et bien avant qu'il ne déborde de la fenêtre du modèle, l'agent doit compact - transmettez l'intégralité du contexte au modèle, récupérez un résumé compressé et continuez à partir du résumé. Le compactage est ce qui maintient un agent en vie pendant plusieurs heures, mais il n'est pas gratuit : résumer un contexte de 150 000 jetons facture 150 000 jetons d'entrée pour cet événement, et une exécution qui compacte trois ou quatre fois peut dépenser un cinquième à un tiers de son total de jetons pour cela seul. Il s’agit d’un coût qui n’apparaît jamais dans le prix par appel et n’apparaît jamais dans une estimation symbolique naïve, c’est exactement pourquoi les factures des agents sont plus élevées que les calculs au dos de l’enveloppe. La façon de le contrôler est de régler le moment où vous compactez et la taille à laquelle vous réinitialisez, et de facturer la relecture à un prix réduit avec la mise en cache ou un résumé moins cher. Dimensionner le côté multitours sur le calculateur de coût de conversation multi-tours, toute la boucle sur le calculateur de budget de boucle d'agent, et la mise en cache gagne sur le calculateur d'économies de mise en cache rapide.
Calculateur de budget de boucle d'agentCoût d'une conversation à plusieurs toursCoût de l'étape de l'agent IACoût de la fenêtre contextuelleÉconomies de mise en cache rapide
Comment fonctionne cette calculatrice
Il simule la course étape par étape. Le contexte commence à la taille de base et augmente à chaque étape ; lorsqu'il franchit le déclencheur, un compactage se déclenche (l'ensemble du contexte est facturé comme une entrée plus une sortie récapitulative) et le contexte est réinitialisé. Il additionne le coût de production (lecture du contexte pour effectuer chaque étape) et les frais généraux de compactage séparément, puis balaie le déclencheur afin que vous puissiez trouver le coût total minimum.
Questions fréquemment posées
Qu’est-ce que le compactage de contexte et pourquoi cela coûte-t-il de l’argent ?
Un agent à exécution longue accumule le contexte (résultats de l'outil, messages, raisonnement) jusqu'à ce qu'il s'approche de la fenêtre contextuelle du modèle. Pour continuer, il se compacte : il alimente le modèle avec tout le contexte actuel et demande un résumé compressé, puis continue à partir de ce résumé au lieu de l'historique complet. Le problème est que résumer signifie tout relire, donc chaque événement de compactage facture l'ensemble du contexte sous forme de jetons d'entrée plus une petite sortie pour le résumé. Un seul compactage d'un contexte de 150 000 jetons coûte le même prix que 150 000 jetons d'entrée, et un agent long qui compacte plusieurs fois peut consacrer un cinquième à un tiers de son total de jetons pour ce seul entretien.
Combien de fois mon agent va-t-il compacter ?
Cela dépend de la rapidité avec laquelle le contexte se développe et de l’endroit où se situe le déclencheur. Si chaque étape ajoute quelques milliers de jetons de sortie de l'outil et que l'agent compacte lorsqu'il atteint, disons, 140 000 jetons, puis se réinitialise à un résumé de 25 000 jetons, il compactera à peu près chaque fois qu'il franchira à nouveau cet écart. Une exécution qui ajoute 8 000 jetons par étape et compacte à 140 000 déclenchera un compactage toutes les quinze étapes environ. Ce calculateur simule l'exécution étape par étape, compte les compactages et sépare le coût de production des frais généraux de compactage afin que vous puissiez voir la répartition.
Comment puis-je réduire les frais de compactage ?
Trois leviers le déplacent. Compacter plus tard (un déclencheur plus élevé) signifie des compactages moins nombreux et plus importants, mais des étapes de production plus coûteuses, car le contexte que vous relisez à chaque tour est plus large – il existe un véritable point idéal plutôt que toujours « plus haut est mieux ». La réinitialisation à un résumé plus petit permet d'acheter plus de piste entre les compactages. Et acheminer le résumé lui-même vers un modèle moins cher, ou utiliser la mise en cache rapide pour que le préfixe relu soit facturé à prix réduit, réduit directement le coût par événement. Le tableau de cette page balaie le seuil de déclenchement afin que vous puissiez voir comment le coût total évolue, et ne jamais compacter du tout est également affiché - généralement la pire option car le contexte croît alors sans limite et chaque étape en paie le prix.
Le compactage est-il moins coûteux que la simple utilisation d’une fenêtre contextuelle plus grande ?
Souvent oui, car l’alternative au compactage consiste à conserver l’historique complet de chaque étape, et le coût des intrants augmente avec le carré de la longueur du parcours lorsque rien n’est jamais coupé. Le compactage limite cette croissance : après chaque résumé, le contexte par étape redescend, de sorte que le coût de production reste à peu près linéaire au lieu de quadratique. Vous payez une somme forfaitaire à chaque événement de compactage, mais vous évitez de relire des milliers de fois une transcription toujours plus volumineuse. Pour les très courts tirages, les frais généraux n’en valent pas la peine ; pour les agents autonomes depuis longtemps, cela se rentabilise généralement plusieurs fois, ce que cette calculatrice vous permet de confirmer avec vos propres chiffres.