Comment fonctionne cette calculatrice
Le Calculateur de coût de la fenêtre contextuelle estime ce qu'il en coûte pour remplir une grande fenêtre de contexte à chaque appel de modèle - le scénario derrière CHIFFON pipelines et invites de documents longs. Cela multiplie votre jetons de contexte par appel par le prix d'entrée par million de jetons, ajoute votre jetons de sortie par appel fois le prix de production par million, et met à l'échelle le total en fonction de votre appels par mois pour afficher les chiffres par appel et mensuels. Le facteur dominant est presque toujours la taille du contexte : les jetons d'entrée se répètent à chaque appel, de sorte qu'une charge utile de récupération importante ou une longue invite système définit le coût de base bien plus élevé que la réponse que vous obtenez.
Le principal compromis est la profondeur du contexte par rapport aux dépenses. Doubler les passages récupérés ou compléter l'invite avec des documents supplémentaires peut multiplier votre facture sans améliorer les réponses. Utilisez la calculatrice pour vérifier si contexte de découpage, le resserrement de la récupération ou le passage à un niveau d'entrée moins cher diminuent le total mensuel et surveillent le nombre par appel lorsque le volume est élevé : de petits montants par appel s'accumulent rapidement sur des milliers de requêtes.
Questions fréquemment posées
Pourquoi une grande fenêtre contextuelle coûte-t-elle si cher ?
Vous payez le prix d'entrée sur chaque jeton dans le contexte, pour chaque appel. Une invite de 32 000 jetons à 2,50 $/1 million représente 0,08 $ d'entrée avant que le modèle n'écrive quoi que ce soit - et cela se répète à chaque requête.
Comment puis-je réduire le coût du contexte ?
Récupérez des morceaux moins nombreux et plus petits, résumez l'historique et mettez en cache la partie statique de l'invite. La taille du contexte est généralement le plus grand levier sur une facture RAG ou long-doc.