Le compactage lit tout le contexte en entrée
frais généraux de compactage
compactages
frais généraux
coût total d'exploitation

Là où le compactage porte ses fruits : appuyer sur la gâchette

Compactez trop tôt et vous déclenchez de nombreux événements ; compacter trop tard (ou jamais) et chaque étape relit un contexte énorme. La colonne du coût total comporte généralement un minimum au milieu.

Compacter àCompactagesAérienCoût total d'exploitation

Le ménage pour lequel personne ne budgétise

An autonomous agent has no long-term memory of its own run, so it keeps the whole working context in the prompt: the system instructions, the tool definitions, every tool result it has seen and every step it has taken. Ce contexte croît de façon monotone, et bien avant qu'il ne déborde de la fenêtre du modèle, l'agent doit compact - transmettez l'intégralité du contexte au modèle, récupérez un résumé compressé et continuez à partir du résumé. Le compactage est ce qui maintient un agent en vie pendant plusieurs heures, mais il n'est pas gratuit : résumer un contexte de 150 000 jetons facture 150 000 jetons d'entrée pour cet événement, et une exécution qui compacte trois ou quatre fois peut dépenser un cinquième à un tiers de son total de jetons pour cela seul. Il s’agit d’un coût qui n’apparaît jamais dans le prix par appel et n’apparaît jamais dans une estimation symbolique naïve, c’est exactement pourquoi les factures des agents sont plus élevées que les calculs au dos de l’enveloppe. La façon de le contrôler est de régler le moment où vous compactez et la taille à laquelle vous réinitialisez, et de facturer la relecture à un prix réduit avec la mise en cache ou un résumé moins cher. Dimensionner le côté multitours sur le calculateur de coût de conversation multi-tours, toute la boucle sur le calculateur de budget de boucle d'agent, et la mise en cache gagne sur le calculateur d'économies de mise en cache rapide.

Hébergez votre projet :DigitalOcean — 200 $ gratuits ↗VPS Hostinger
Calculateur de budget de boucle d'agentCoût d'une conversation à plusieurs toursCoût de l'étape de l'agent IACoût de la fenêtre contextuelleÉconomies de mise en cache rapide