Fenêtres contextuelles et pourquoi les invites longues deviennent coûteuses
La fenêtre contextuelle correspond à la quantité maximale de texte qu'un modèle peut prendre en compte à la fois, et c'est l'une des parties les plus mal comprises de la tarification de l'IA. Une grande fenêtre semble être une fonctionnalité gratuite, mais chaque jeton que vous y placez est facturé pour chaque appel. Ce guide explique comment fonctionne la fenêtre et pourquoi les longues invites gonflent tranquillement votre facture.
Qu'est-ce qu'une fenêtre contextuelle
La fenêtre contextuelle est la mémoire de travail du modèle pour une seule requête, mesurée en jetons. Il doit contenir tout ce que le modèle prend en compte en même temps : l'invite de votre système, tous les documents ou exemples que vous incluez, l'historique des conversations, la question actuelle et l'espace réservé à la réponse du modèle. Ensemble, ceux-ci doivent correspondre à la limite de jetons de la fenêtre.
Les modèles annoncent des fenêtres de différentes tailles, de quelques milliers de jetons à des centaines de milliers ou plus. Une fenêtre plus grande vous permet d'alimenter davantage à la fois, un livre entier, une grande base de code, mais cela ne change pas la règle fondamentale de facturation : vous payez pour ce que vous mettez.
Vous payez pour toute la fenêtre que vous utilisez, chaque appel
Voici la partie qui surprend les gens. Avoir une fenêtre de 200 000 jetons ne signifie pas que vous payez pour 200 000 jetons. Cela veut dire que tu peut utilisez-en autant, et vous êtes facturé pour le nombre que vous incluez réellement, pour chaque appel.
Ainsi, si vous placez 150 000 jetons de documents dans la fenêtre et posez 10 questions, vous payez environ 150 000 jetons d'entrée dix fois, 1,5 million de jetons, pas une seule fois. La fenêtre est un plafond, pas un abonnement. Le contexte long est puissant, mais il est facturé sans relâche par appel.
Pourquoi les invites longues deviennent rapidement coûteuses
Étant donné que les jetons d'entrée sont facturés par appel, la durée de l'invite est multipliée par le volume d'appels. Une invite 10 fois plus longue coûte environ 10 fois plus en jetons d’entrée pour le même nombre d’appels. Deux habitudes poussent les invites longtemps sans que les gens ne s'en aperçoivent :
- Historique de discussion croissant, entièrement ressenti à chaque tour, de sorte que les messages tardifs dans une longue conversation contiennent l'intégralité de la transcription.
- Récupération (RAG), où vous collez des documents récupérés volumineux dans l'invite pour donner le contexte du modèle. Récupérez trop de données et chaque requête paie pour la totalité.
Ni l’un ni l’autre n’a tort, mais tous deux ont besoin de discipline, car le coût reste silencieux jusqu’à l’arrivée de la facture.
Une illustration travaillée
Exemple illustratif (taux inventé de 3 $ par million de jetons d'entrée). Supposons que chaque requête inclut un contexte récupéré de 50 000 jetons. Une requête coûte 50 000/1 000 000 x 3 $ = 0,15 $ en entrée seule. Exécutez 100 000 requêtes de ce type par mois, ce qui représente 15 000 $ rien que pour le contexte que vous renvoyez, avant les coûts de sortie.
Réduisez maintenant le contexte récupéré à 10 000 jetons en récupérant de manière plus sélective. Les mêmes 100 000 requêtes coûtent 3 000 dollars, soit un cinquième de plus, pour un contexte qui est souvent tout aussi utile car le modèle était de toute façon noyé dans les 40 000 jetons supplémentaires. C’est pourquoi la discipline contextuelle est l’un des contrôles de coûts les plus efficaces dont vous disposez.
Un contexte long peut également nuire à la qualité
Plus de contexte ne signifie pas toujours de meilleures réponses. Les modèles peuvent perdre la trace des détails enfouis au milieu d’une très longue invite, un modèle dans lequel les informations du début et de la fin sont bien utilisées mais le milieu est négligé. Une fenêtre contextuelle gonflée peut donc coûter plus cher et produire de pires résultats.
Nourrir le modèle uniquement avec les éléments les plus pertinents améliore souvent à la fois la facture et la réponse. La précision bat le volume : un contexte serré et bien choisi de 4 000 tokens surpasse souvent un dump tentaculaire de 100 000 tokens.
Comment garder un contexte simple
Tactiques pratiques pour contrôler le coût du contexte :
- Récupérez de manière sélective. Dans RAG, renvoie uniquement les quelques morceaux les plus pertinents, pas tout ce qui correspond vaguement.
- Résumez les anciens virages. Remplacez la conversation passée de longue date par un court résumé au lieu de renvoyer la transcription complète.
- Cache la partie fixe. Si une grande partie du contexte se répète lors des appels, la mise en cache des invites (voir ce guide) peut réduire considérablement le coût de son renvoi.
- Redimensionnez la fenêtre. Choisissez un modèle dont la fenêtre correspond à vos besoins réels plutôt que de choisir par défaut la plus grande disponible.
Pour voir comment la longueur de l'invite correspond à l'argent réel pour chaque modèle, insérez le nombre de jetons dans le calculateur de coût LLM et vérifiez les prix de fenêtre par modèle sur les pages de comparaison de modèles et /models.
Continuer à apprendre
Outils associés
Questions fréquemment posées
Dois-je payer pour la fenêtre contextuelle complète du modèle ?
Non. Vous ne payez que pour les jetons que vous incluez réellement dans chaque demande, dans la limite de la fenêtre. La fenêtre a une capacité maximale et chaque jeton que vous utilisez à l'intérieur est facturé à chaque appel.
Une fenêtre contextuelle plus grande coûte-t-elle plus cher par jeton ?
Pas nécessairement par jeton, mais une fenêtre plus grande vous incite à inclure beaucoup plus de texte, et comme chaque jeton est facturé par appel, des invites plus grandes font augmenter le total. Certains fournisseurs facturent également des tarifs plus élevés au-delà de certaines durées de contexte.
Est-ce que plus de contexte est toujours meilleur pour la qualité ?
Non. Les modèles peuvent ignorer des détails enfouis dans de très longues invites, de sorte qu'un excès de contexte peut à la fois augmenter les coûts et diminuer la qualité des réponses. Un contexte plus petit et bien choisi est souvent plus performant.
Uniquement éducatif – pas de conseils financiers.