L'API Batch : 50 % de réduction sur les tâches non urgentes
La plupart des gens appellent un modèle d’IA et attendent une réponse en temps réel. Mais une grande partie du travail d’IA n’est pas du tout urgent : génération de rapports du jour au lendemain, classification en masse, étiquetage des ensembles de données. Pour ces tâches, les API par lots proposent les mêmes modèles avec une remise importante, généralement d'environ 50 %, en échange de l'abandon de résultats instantanés.
Qu'est-ce qu'une API par lots
Une API par lots vous permet de soumettre plusieurs requêtes à la fois en une seule tâche, plutôt qu'une à la fois en temps réel. Vous téléchargez un fichier contenant toutes vos invites, le fournisseur les traite de manière asynchrone sur une fenêtre de temps et vous téléchargez les résultats lorsqu'ils sont prêts.
L'échange que vous effectuez est simple : vous abandonnez la vitesse et obtenez un prix inférieur. Au lieu d'une réponse en quelques secondes, vous pouvez attendre des minutes ou des heures. En retour, le coût par jeton est généralement réduit d'environ la moitié par rapport au tarif synchrone standard.
Pourquoi les fournisseurs peuvent offrir la réduction
Le trafic des API en temps réel est irrégulier et imprévisible. Les fournisseurs doivent conserver une capacité de réserve prête à faire face aux pics de demande, et cette marge inutilisée coûte cher. Les tâches par lots sont flexibles : elles peuvent être exécutées chaque fois qu'une capacité disponible existe, lissant ainsi la charge.
Parce que vous laissez le fournisseur planifier votre travail pendant des périodes plus calmes, il peut utiliser le matériel plus efficacement et vous reverser une partie de cette économie. La remise n’est pas un modèle de moindre qualité, c’est exactement le même modèle exécuté selon un horaire détendu.
À quoi ressemble le flux de travail
Le flux de lots typique comporte quatre étapes :
- Préparer un dossier où chaque ligne correspond à une requête, généralement dans un format structuré avec un identifiant personnalisé afin que vous puissiez faire correspondre les résultats aux entrées.
- Soumettre le lot et recevez un identifiant de travail.
- Sondage pour le statut tandis que le fournisseur travaille dans la file d'attente, souvent avec un objectif d'achèvement déclaré, par exemple dans les 24 heures.
- Récupérer le fichier de sortie une fois terminé, mappez chaque résultat à sa demande à l'aide des identifiants.
La logique de votre application change à peine, les mêmes invites et les mêmes modèles sont utilisés. Ce qui change, c'est que vous ne bloquez pas à chaque réponse.
Quelles tâches correspondent au modèle par lots
Batch est idéal lorsqu'un humain n'attend pas la réponse :
- Classification ou marquage en masse de grands ensembles de données.
- Génération de contenu pour les catalogues, les descriptions de produits ou les résumés réalisés à l’avance.
- Extraction de données provenant de grandes collections de documents.
- Évaluations et backtesting où vous exécutez une invite sur des milliers de cas de test.
- Intégrations génération pour tout un corpus à la fois.
Il ne convient pas à tout ce qui est interactif : les chatbots, la recherche en direct ou toute fonctionnalité dans laquelle un utilisateur regarde une icône de chargement.
L’économie de l’attente
L’économie est simple à raisonner. Si un travail coûte 200 $ au tarif standard et que la remise par lots est de 50 %, il coûte 100 $ à la place, pour un résultat identique. Sur les grosses charges de travail récurrentes, cette différence s’aggrave mois après mois.
Voici un exemple concret avec des taux illustratifs, pour que les calculs restent concrets. Classer 1 million de documents courts avec 500 jetons d'entrée et 20 jetons de sortie chacun équivaut à 500 millions de jetons d'entrée et 20 millions de jetons de sortie au total. À un taux indicatif de 0,15 $ par million de jetons d'entrée et de 0,60 $ par 1 million de jetons de sortie, la tarification synchrone s'élève à environ 75 $ + 12 $ = 87 $ pour l'ensemble du travail. Le même travail via le point final par lots à moitié prix ramène ce montant à environ 43,50 $, soit une économie de 43,50 $ sur une seule exécution, avant même de compter l'exécution du mois suivant. Le calculateur de coûts LLM vous permet de saisir votre propre nombre et volume de jetons, puis de diviser par deux le total pour prévisualiser le scénario par lots par rapport à celui en temps réel en utilisant les tarifs actuels du fournisseur.
Choses à surveiller
Quelques mises en garde pratiques. Les délais d'exécution sont des objectifs et non des garanties, alors construisez votre pipeline pour tolérer des retards variables. Les lots très volumineux peuvent être soumis à des limites de taille ou de débit, vous devrez donc peut-être diviser d'énormes tâches en morceaux. Et vous payez toujours pour les jetons d'entrée et de sortie, la réduction s'applique au tarif, pas au nombre de jetons, donc l'efficacité rapide compte toujours.
Les demandes ayant échoué dans un lot ne sont généralement pas facturées. Si une ligne de votre fichier d'entrée est mal formée ou si une seule requête est erronée, les fournisseurs ne facturent généralement que les requêtes réellement terminées, et non celles qui ont échoué. Cela signifie qu'une poignée de mauvaises lignes ne gâcheront pas la remise sur le reste du travail, mais cela signifie également que votre fichier de sortie doit être vérifié par rapport à vos ID d'entrée pour voir quelles demandes vous devez soumettre à nouveau.
Enfin, vérifiez les spécificités de chaque fournisseur sur les pages /models, car la remise exacte, l'objectif de délai d'exécution et les fonctionnalités prises en charge (comme si la mise en cache ou les outils fonctionnent par lots) diffèrent d'un fournisseur à l'autre.
Continuer à apprendre
Outils associés
Questions fréquemment posées
L’API batch est-elle un modèle plus faible ?
Non. Vous obtenez le même modèle et la même qualité de sortie que l’API en temps réel. La seule différence est que les résultats arrivent plus tard, c'est pourquoi le prix est plus bas.
Combien de temps dure un travail par lots ?
Les fournisseurs donnent généralement un objectif d'achèvement, par exemple dans les 24 heures, et de nombreux travaux se terminent beaucoup plus rapidement lorsque la capacité est disponible. Ce n'est pas instantané, alors utilisez-le uniquement lorsque personne n'attend la réponse.
Combien les API par lots permettent-elles généralement d’économiser ?
Une réduction d'environ 50 % sur le tarif standard par jeton est courante chez les principaux fournisseurs, appliquée à la fois aux jetons d'entrée et de sortie. Confirmez toujours la remise actuelle pour votre fournisseur et votre modèle spécifiques.
Dois-je payer pour les demandes qui échouent dans un lot ?
Généralement non. Les fournisseurs ne facturent généralement que les demandes d'un lot qui se sont réellement déroulées avec succès. Ainsi, une invite mal formée ou une erreur occasionnelle ne vous coûte pas la réduction sur le reste du travail. Vous devez toujours vérifier le fichier de sortie par rapport à vos identifiants soumis pour voir quelles demandes ont échoué et les soumettre à nouveau.
Uniquement éducatif – pas de conseils financiers.