HomeToolsLearn › Calculateur de fenêtre contextuelle
de la fenêtre contextuelle utilisée
jetons utilisés / fenêtre
plus de virages qui conviennent encore
coût par appel

Même conversation entre les modèles

Remplissage de la fenêtre et coût par appel pour les entrées ci-dessus.

ModèleFenêtre% utiliséTourne à gaucheCoût / appel
⚠️ Estimation. Le nombre de jetons est approximatif (1 jeton ≈ 0,75 mots anglais ; le code et les autres langues diffèrent). Les fenêtres contextuelles et les prix sont chiffres de référence (juillet 2026) et varient selon la version du modèle et le fournisseur – confirmez dans les documents du fournisseur et dans votre tableau de bord. · Signaler un prix obsolète →

Pourquoi la fenêtre se remplit plus vite que vous ne le pensez

Une fenêtre contextuelle ne se limite pas à « combien de temps un document puis-je coller ». Dans une vraie application de chat, le modèle relit le conversation entière à chaque tour, car l'API est sans état : elle n'a pas de mémoire entre les appels, vous renvoyez donc l'historique à chaque fois. Une invite système de 200 jetons plus dix tours de messages de 250 jetons représentent déjà 2 800 jetons avant même que l'utilisateur n'ait tapé sa prochaine question, et tout ce bloc est envoyé encore prochain tour. Ajoutez un espace réservé pour la réponse et vous pourrez voir comment une « petite » conversation atteint la limite et pourquoi votre facture augmente à mesure qu'une conversation s'allonge.

Cette calculatrice sépare les quatre éléments (invite système, historique des renvois, nouvelle salle de messages et sortie réservée) et affiche le total dans la fenêtre de chaque modèle. Le pourcentage global vous indique la marge de manœuvre qu’il vous reste ; "Les tours qui conviennent encore" vous indiquent combien de temps la conversation peut durer avant que vous deviez couper ou résumer les messages plus anciens. Étant donné que la sortie réside également à l’intérieur de la fenêtre, réserver 4 000 jetons pour une réponse longue ronge l’espace disponible pour le contexte, ce qui explique pourquoi les tâches à sortie longue semblent à l’étroit, même sur les modèles à grande fenêtre.

Une fois que vous savez que cela vous convient, évaluez-le. Le Calculateur du coût des jetons LLM transforme ces jetons en un coût par appel sur chaque modèle, le calculateur de mise en cache rapide montre combien vous économisez en mettant en cache cette invite système fixe au lieu de la refacturer, et le calculateur de coût de chatbot lie tout cela au volume mensuel.

Comment l'utiliser

1. Choisissez un modèle : sa fenêtre contextuelle se charge automatiquement.
2. Entrez la taille de l'invite de votre système, le nombre moyen de jetons par message et le nombre de tours passés que vous conservez dans l'historique.
3. Réservez des jetons pour la réponse du modèle (les réponses plus longues nécessitent plus).
4. Lisez le % utilisé, les tours qui conviennent encore et le coût, puis comparez les modèles dans le tableau.

Erreurs courantes

Oublier le nombre de sorties. La réponse partage la fenêtre avec l'entrée ; réserver un gros max_tokens réduit le contexte que vous pouvez transmettre. Tout renvoyer pour toujours. La refacturation d'un historique croissant à chaque tour est la principale raison pour laquelle les coûts de chat montent en flèche - résumez ou fenêtrez l'historique. Faire confiance aux mots compte. Les jetons ne sont pas des mots ; le code, le JSON et le texte non anglais utilisent beaucoup plus de jetons par caractère. Confondre fenêtre et coût. Une fenêtre de 1 million est gratuite mais coûteuse à remplir à chaque appel.

Estimation seulement. Le nombre de jetons, les fenêtres contextuelles et les prix sont des chiffres de référence et varient selon le modèle et le fournisseur — vérifiez avant de vous y fier.

Partager : 𝕏 Publier Reddit
Hébergez votre projet :DigitalOcean — 200 $ gratuits ↗VPS Hostinger
Prix ​​​​du wrapper IACalculateur de coût de chatbotCalculateur du coût des agents IABudget de boucle d'agent (P99)Coût de migration du fournisseur LLM