—facture totale / mois
—est le préambule
—sauvegardes du cache / mois
Où vont vos jetons d'entrée
La facture mensuelle est divisée en préambule fixe que vous renvoyez à chaque fois, en jetons d'utilisateur et de contexte dynamiques et en sortie. La première ligne est la taxe : elle ne diminue pas lorsque les utilisateurs en disent moins.
| Partie | Jetons / demande | Coût / mois | Partager |
|---|
Comment la taille de l'invite fait évoluer la taxe
Chaque ligne correspond à une longueur d'invite système différente pour votre volume actuel. La colonne non mise en cache correspond au coût naïf ; la colonne mise en cache applique votre taux de réussite et votre remise. C'est pourquoi une invite qui est passée de 500 à 4 000 jetons a tranquillement multiplié votre facture.
| Invite système | Non mis en cache / mois | En cache / mois | contre le vôtre |
|---|
L'invite que vous avez écrite une fois, vous la payez un million de fois
Une invite système semble gratuite car vous l'écrivez une fois et l'oubliez, mais l'API est sans état, de sorte que le préambule accompagne chaque appel et est facturé comme jetons d'entrée à chaque fois. Le piège, ce sont les requêtes courtes et volumineuses : un classificateur ou un routeur qui reçoit vingt jetons de texte utilisateur et un bloc d'instructions de deux mille jetons dépense 99 % de son budget d'entrée sur des mots que l'utilisateur n'a jamais envoyés. Le correctif est ennuyeux et efficace : lisez l'invite de votre système comme si vous payiez au mot, car c'est le cas, et supprimez les remplissages polis, les règles dupliquées et les schémas d'outils que vous n'invoquez presque jamais. Ensuite, mettez en cache ce qui survit, car un préambule stable est exactement ce pour quoi la mise en cache rapide a été conçue et une lecture en cache coûte environ un dixième d'une nouvelle lecture. La raison pour laquelle le découpage vient en premier est qu'il aide inconditionnellement, tant en cas d'échec que d'accès au cache, tandis que la mise en cache n'est payante que sur les requêtes qui arrivent lorsque le cache est chaud et seulement si le préfixe reste identique octet par octet - un horodatage près du haut et la remise s'évapore. Dimensionnez le levier de mise en cache précisément sur le calculateur d'économies de mise en cache rapide, vérifiez le seuil de rentabilité écriture/lecture sur le calculateur de seuil de rentabilité en écriture de cache, et comptez les jetons dans votre invite actuelle avec le compteur de jetons.
Économies de mise en cache rapideSeuil de rentabilité en écriture du cacheCoût des appels de fonctionCompteur de jetonsOptimisation des coûts LLM
Comment fonctionne cette calculatrice
Il compte vos demandes mensuelles comme des demandes par jour multipliées par 30,4. Chaque demande paie pour l'invite du système plus l'entrée dynamique au débit d'entrée et la sortie au débit de sortie. Le coût de l'invite système correspond au nombre de jetons multiplié par les requêtes mensuelles au débit d'entrée ; la mise en cache réduit la part du taux de réussite au taux réduit tandis que la part manquée reste au prix fort. La facture totale additionne le préambule fixe, l'entrée dynamique et la sortie. Le partage correspond au coût de l'invite système sur ce total, et la sauvegarde du cache correspond au coût du préambule non mis en cache moins celui mis en cache. La table de mise à l'échelle réexécute le coût du préambule à plusieurs longueurs d'invite afin que vous puissiez voir comment il augmente, et le chiffre de réduction applique votre pourcentage de réduction à l'invite actuelle.
Questions fréquemment posées
Pourquoi l'invite du système coûte-t-elle de l'argent à chaque demande ?
Étant donné que l'API est sans état (elle ne se souvient pas de votre appel précédent), tout ce que vous voulez que le modèle sache à chaque fois doit être envoyé à chaque fois. L'invite du système, le personnage, les exemples de quelques plans et les schémas d'outils vivent tous dans ce préambule fixe, et chacun est compté comme jeton d'entrée à chaque requête. Un utilisateur qui tape un seul mot paie toujours pour l'intégralité du préambule qui l'accompagne, c'est pourquoi une invite système gonflée se comporte comme une taxe fixe facturée en totalité sur les requêtes les plus petites comme les plus grandes.
Quelle part de ma facture représente l'invite du système ?
Cela dépend du rapport entre votre préambule fixe et le contenu variable de chaque requête. Une invite de deux mille jetons contre un tour d'utilisateur de cinq cents jetons représente la plupart de vos jetons d'entrée et peut dominer la facture - en particulier sur les appels courts et à volume élevé comme la classification où il n'y a pratiquement aucun texte utilisateur pour le diluer. Si vos demandes contiennent de longs documents ou des historiques de discussion, le préambule est une tranche plus petite. Le cas dangereux est celui d'un volume élevé, de requêtes courtes et d'une invite longue.
La mise en cache des invites supprime-t-elle le coût des invites système ?
Il en supprime la majeure partie, sur les appels qui atteignent le cache. La mise en cache stocke un préfixe stable (l'invite de votre système est le candidat idéal) et les factures s'y rapportent avec une remise importante, généralement d'environ 90 %, de sorte qu'une invite système en cache coûte environ un dixième d'une invite non mise en cache. Le problème est que seules les requêtes arrivant alors que le cache est chaud bénéficient de la réduction, il y a parfois une petite prime d'écriture et le préfixe doit être identique octet par octet, donc un horodatage près du haut le casse.
Est-il préférable de supprimer l’invite système ou de la mettre en cache ?
Faites les deux, mais ils résolvent des problèmes différents. Le découpage supprime les jetons dans le préambule, réduisant ainsi le coût de chaque requête, y compris les échecs de cache, et libère la fenêtre de contexte. La mise en cache laisse l'invite longue mais rend les lectures répétées peu coûteuses lors des appels chaleureux. Le découpage est la victoire la plus robuste car il aide inconditionnellement, tandis que la mise en cache dépend du maintien du cache au chaud par votre trafic. Supprimez d’abord tout ce qui ne rapporte pas ses jetons, puis mettez en cache ce qui reste.