Publié 2026-08-07 · numéros de référence, vérifier avant de budgétiser
OpenAI, Anthropic et Gemini pratiquent tous le même métier : soumettre une tâche au lieu d'une demande, attendre jusqu'à 24 heures, payer environ la moitié. Même modèle, mêmes poids, même qualité de sortie : la seule chose qui change, c'est lorsque la réponse apparaît. Les équipes traitent cela comme une décision de volume, quelque chose que vous activez une fois qu'une charge de travail devient suffisamment importante pour vous en préoccuper. Ce n'est pas le cas. C'est une décision d'interaction et cela n'a rien à voir avec la taille.
Les trois principaux fournisseurs effectuent des regroupements de la même manière : téléchargez un fichier d'invites, la tâche s'exécute de manière asynchrone dans une fenêtre de 24 heures et le prix par jeton s'élève à environ 50 % du tarif synchrone standard. Ce n’est pas un modèle plus petit ou plus stupide qui fait le travail – c’est le modèle identique, générant le même résultat qu’il aurait généré en temps réel. Les économies proviennent de la planification, et non d'un raccourci : les fournisseurs disposent d'une capacité en temps réel prête à faire face aux pics de trafic, et cette marge d'inactivité coûte cher. Un travail par lots peut être exécuté chaque fois qu'une capacité disponible existe, de sorte que le fournisseur restitue une partie de cette efficacité.
Les calculs n'ont pas besoin d'une calculatrice pour en ressentir la forme : un travail qui coûte 200 $ au tarif standard coûte 100 $ via le point final du lot, pour le même résultat. Sur une charge de travail que vous exécutez une seule fois, c'est un élément de campagne intéressant. Sur une charge de travail que vous exécutez tous les soirs pendant un an, c'est la différence entre un poste budgétaire réel et une erreur d'arrondi.
Classement d'un million de documents courts (500 jetons d'entrée et 20 jetons de sortie chacun) par rapport à un taux de référence de 2,50 $/10,00 $ par million de jetons (entrée/sortie ; prix de référence illustratif, confirmez le taux réel de votre modèle avant de budgétiser) :
| Chemin | Coût des intrants | Coût de sortie | Total |
|---|---|---|---|
| Synchrone (tarif standard) | $1,250.00 | $200.00 | $1,450.00 |
| Lot (~50 % de réduction) | $625.00 | $100.00 | $725.00 |
| Enregistré | $725.00 (50%) | ||
| 1 million de documents × 500 jetons entrants / 20 jetons sortants. Tarification de référence – exécutez votre propre tarif sur le calculateur d'économies d'API par lots. | |||
725 $ économisés sur une passe de classification. Exécutez ce même travail tous les soirs pour un pipeline de réindexation et le point de terminaison du lot s'est rentabilisé dès la première semaine - pour un changement nul dans la qualité de sortie, car rien dans ce que produit le modèle n'est différent.
La documentation par lots de chaque fournisseur utilise le même mot prudent : cible. La fenêtre de 24 heures n'est pas un SLA. Les travaux se terminent souvent plus rapidement – parfois en quelques minutes – mais rien ne l’oblige, et un pipeline construit en supposant un délai d’exécution rapide finira par attendre des heures sans recours. De très gros lots peuvent également atteindre des limites de taille ou de débit, ce qui signifie qu'un travail véritablement énorme peut devoir être divisé en plusieurs soumissions plutôt qu'une seule, ajoutant ainsi à l'orchestration un appel synchrone qui n'était jamais nécessaire en premier lieu.
Rien de tout cela n’a d’importance pour un travail que rien n’attend. Cela est tout à fait important pour un travail pour lequel une personne regarde une fileuse. C'est la véritable ligne de démarcation : non pas "cette charge de travail est-elle suffisamment importante", mais "est-ce que quelque chose est bloqué dans cette réponse en ce moment".
Ignorez le seuil de volume. Posez une question : un humain ou un système en aval attend-il de manière synchrone cette réponse spécifique ? Si non – un remplissage d'intégrations nocturnes, une reclassification en masse, un arriéré de documents que personne ne regarde en temps réel – le lot est proche d'une réduction gratuite de 50 %, point final, prenez-le. Si oui (une réponse d'un chatbot, un résultat de recherche en direct, tout ce qui s'affiche derrière un spinner de chargement), le lot n'est pas du tout une réduction à laquelle vous pouvez accéder, quel que soit le volume qui le justifierait sur papier. L'ampleur du travail n'entre jamais en ligne de compte dans la décision. Seulement si quelque chose l'attend.
Cela signifie également que la même application peut utiliser les deux chemins à la fois : synchrone pour le chat en direct qu'un utilisateur regarde, par lots pour le travail de nuit qui réintègre tout ce que le chat a touché ce jour-là. Évaluez le côté synchrone avec le calculateur d'économies de mise en cache rapide s'il s'agit d'une charge de travail en contexte répété, et le côté batch avec le calculateur d'économies d'API par lots – ils résolvent différentes moitiés du même projet de loi. Pour connaître les mécanismes de ce qui compte comme une tâche par lots et quels fournisseurs prennent en charge quoi, voir API par lots expliquée; pour savoir si votre pipeline peut réellement tolérer l'attente, le calculateur de temps de traitement par lots évalue directement le côté redressement.
Méthodologie : la remise par lots d'environ 50 % et la fenêtre cible de 24 heures reflètent les conditions d'API par lots publiées par OpenAI, Anthropic et Gemini en août 2026. L'exemple utilisé utilise un taux de référence rond et clairement étiqueté (2,50 $/10,00 $ par million de jetons) plutôt que le prix actuel exact d'un fournisseur unique : confirmez les taux synchrones et par lots réels de votre modèle avant la budgétisation. L'exemple est un scénario construit destiné à montrer comment la remise évolue, et non une télémétrie à partir d'un système de production.