Même conversation entre les modèles
Remplissage de la fenêtre et coût par appel pour les entrées ci-dessus.
| Modèle | Fenêtre | % utilisé | Tourne à gauche | Coût / appel |
|---|
Pourquoi la fenêtre se remplit plus vite que vous ne le pensez
Une fenêtre contextuelle ne se limite pas à « combien de temps un document puis-je coller ». Dans une vraie application de chat, le modèle relit le conversation entière à chaque tour, car l'API est sans état : elle n'a pas de mémoire entre les appels, vous renvoyez donc l'historique à chaque fois. Une invite système de 200 jetons plus dix tours de messages de 250 jetons représentent déjà 2 800 jetons avant même que l'utilisateur n'ait tapé sa prochaine question, et tout ce bloc est envoyé encore prochain tour. Ajoutez un espace réservé pour la réponse et vous pourrez voir comment une « petite » conversation atteint la limite et pourquoi votre facture augmente à mesure qu'une conversation s'allonge.
Cette calculatrice sépare les quatre éléments (invite système, historique des renvois, nouvelle salle de messages et sortie réservée) et affiche le total dans la fenêtre de chaque modèle. Le pourcentage global vous indique la marge de manœuvre qu’il vous reste ; "Les tours qui conviennent encore" vous indiquent combien de temps la conversation peut durer avant que vous deviez couper ou résumer les messages plus anciens. Étant donné que la sortie réside également à l’intérieur de la fenêtre, réserver 4 000 jetons pour une réponse longue ronge l’espace disponible pour le contexte, ce qui explique pourquoi les tâches à sortie longue semblent à l’étroit, même sur les modèles à grande fenêtre.
Une fois que vous savez que cela vous convient, évaluez-le. Le Calculateur du coût des jetons LLM transforme ces jetons en un coût par appel sur chaque modèle, le calculateur de mise en cache rapide montre combien vous économisez en mettant en cache cette invite système fixe au lieu de la refacturer, et le calculateur de coût de chatbot lie tout cela au volume mensuel.
Comment l'utiliser
1. Choisissez un modèle : sa fenêtre contextuelle se charge automatiquement.
2. Entrez la taille de l'invite de votre système, le nombre moyen de jetons par message et le nombre de tours passés que vous conservez dans l'historique.
3. Réservez des jetons pour la réponse du modèle (les réponses plus longues nécessitent plus).
4. Lisez le % utilisé, les tours qui conviennent encore et le coût, puis comparez les modèles dans le tableau.
Erreurs courantes
Oublier le nombre de sorties. La réponse partage la fenêtre avec l'entrée ; réserver un gros max_tokens réduit le contexte que vous pouvez transmettre. Tout renvoyer pour toujours. La refacturation d'un historique croissant à chaque tour est la principale raison pour laquelle les coûts de chat montent en flèche - résumez ou fenêtrez l'historique. Faire confiance aux mots compte. Les jetons ne sont pas des mots ; le code, le JSON et le texte non anglais utilisent beaucoup plus de jetons par caractère. Confondre fenêtre et coût. Une fenêtre de 1 million est gratuite mais coûteuse à remplir à chaque appel.
FAQ
Quelle est la différence entre la fenêtre contextuelle et la sortie maximale ?
La fenêtre représente le budget total pour les entrées et les sorties combinées. max_tokens ne fait que plafonner la sortie, et cette sortie est découpée dans la même fenêtre – ils s'échangent donc les uns contre les autres.
Comment estimer les jetons sans tokenizer ?
Environ 1 jeton ≈ 0,75 mots anglais, soit ~4 caractères. Pour des décomptes exacts, collez votre texte dans le compteur de jetons. Le code et le texte non anglais sont plus élevés.
Que se passe-t-il lorsque je dépasse la fenêtre ?
L'API rejette la demande ou tronque silencieusement les messages les plus anciens, en fonction du fournisseur et de votre configuration. Dans tous les cas, le modèle perd le début de la conversation : coupez ou résumez avant d'atteindre la limite.
Une fenêtre plus grande rend-elle le modèle plus intelligent ?
Non, il contient simplement plus de texte. Les modèles s'intéressent souvent de manière moins fiable au milieu d'un contexte très long, de sorte qu'une invite ciblée et tronquée bat souvent une invite chargée.
Estimation seulement. Le nombre de jetons, les fenêtres contextuelles et les prix sont des chiffres de référence et varient selon le modèle et le fournisseur — vérifiez avant de vous y fier.