| Métrique | Par jour | Par mois |
|---|
Qu’est-ce qui coûte réellement de l’argent avec les tentatives ?
429 erreurs elles-mêmes sont gratuites — aucun jeton n'est facturé lorsqu'une demande est limitée en débit avant le début du traitement. Les coûts réels sont :
- Réessayer les demandes - chaque nouvelle tentative renvoie à nouveau l'invite de saisie complète. Si la nouvelle tentative réussit, vous payez les jetons. Si votre entrée est de 2 000 jetons, 3 tentatives sur 3 % des requêtes ajoutent 0,09 entrées supplémentaires par requête réussie.
- Doublons après expiration du délai - lorsqu'une requête prend trop de temps et que votre code réessaye, mais que l'original a été effectivement traité. Vous payez pour deux réalisations. Cela s’avère particulièrement coûteux pour les requêtes à grand volume.
- Demandes ayant échoué - si toutes les tentatives sont épuisées et que la demande échoue, vous gaspillez la latence et tout coût de jeton d'entrée partiel si le fournisseur facture à la réception.
Corrigez-le : Utilisez un limiteur de débit de jetons par minute local (par exemple LangChain's ContextWindowExceededHandler ou un simple compartiment de jetons) pour lisser les rafales avant qu'elles n'atteignent l'API. Cela élimine la plupart des 429 sans augmenter les coûts.
En rapport: Planificateur de budget API · Prévision des coûts · Piste de niveau gratuit
Questions fréquemment posées
Suis-je facturé pour les appels d'API qui renvoient une erreur de limite de débit 429 ?
Non : les erreurs 429 sont rejetées avant traitement et elles ne vous sont pas facturées. Le coût réel est la logique de nouvelle tentative, les réponses retardées et parfois les achèvements en double si la logique de nouvelle tentative comporte des bogues.
Qu’est-ce que l’intervalle exponentiel et pourquoi augmente-t-il le coût de latence ?
L'intervalle exponentiel signifie attendre 1 s, 2 s, 4 s, 8 s... entre les nouvelles tentatives. Un seul 429 avec 2 tentatives ajoute 3 à 7 secondes de latence. Si les systèmes en aval ont des SLA, cela a un coût opérationnel réel même si le coût du jeton est nul.
Comment les nouvelles tentatives entraînent-elles des frais en double ?
Si une requête réussit mais expire avant l’arrivée de la réponse, une nouvelle tentative naïve est renvoyée – et si la première réussit, vous payez pour deux achèvements. Utilisez toujours des clés d'idempotence ou vérifiez les résultats existants avant de réessayer après expiration du délai.
Quel est le taux moyen de 429 pour les API LLM ?
Le trafic en rafale peut atteindre des taux d'erreur de 10 à 30 %. Un trafic régulier bien en dessous des limites est généralement inférieur à 0,1 %. La plupart des fournisseurs utilisent désormais des limites de jetons par minute, qui punissent davantage les requêtes à grand contexte que les limites de nombre de requêtes.
Comment puis-je réduire les coûts de nouvelle tentative d'API ?
Quatre approches : (1) Limite de débit localement avec un compartiment de jetons. (2) Utilisez une file d’attente avec une concurrence contrôlée. (3) Configurez le traitement asynchrone pour que les nouvelles tentatives se produisent en arrière-plan. (4) Mettre en cache les réponses pour des invites identiques.