28 juillet 2026 · IA & LLM · 6 min de lecture
J'ai intégré toute une documentation le mois dernier - environ 50 millions de jetons de texte - et le projet de loi OpenAI est arrivé à un dollar. Un seul dollar. En fait, j'ai relu la facture car j'étais sûr d'avoir laissé tomber une décimale. Les intégrations sont la chose la moins chère de toute la pile d’IA, si bon marché que comparer les fournisseurs sur le seul taux d’intégration est presque inutile. Le numéro qui vous fera réellement du mal est ailleurs, et j'y reviendrai. Mais d’abord les vrais prix, car les gens le demandent encore.
Ce sont les tarifs d’entrée par répartition que je suis. Les intégrations ne facturent que l'entrée : vous envoyez du texte, vous récupérez des vecteurs, il n'y a pas de côté "jeton de sortie" sur la facture. Tout ce qui suit représente des dollars pour un million de jetons de texte intégrés.
| Modèle | Prix / 1 million de jetons | Dimensions | Remarques |
|---|---|---|---|
| Intégration de texte OpenAI-3-small | $0.02 | 1536 | Le choix de valeur par défaut |
| Voyage-3-lite | $0.02 | 512 | Vecteurs bon marché + minuscules |
| Voyage-3 | $0.06 | 1024 | Forte qualité de récupération |
| Cohérer Intégrer v3 | $0.10 | 1024 | Bon multilingue |
| Mistral Intégrer | $0.10 | 1024 | Option hébergée par l'UE |
| Intégration de texte OpenAI-3-large | $0.13 | 3072 | Meilleure qualité OpenAI |
| Google gemini-intégration-001 | $0.15 | 3072 | Un niveau gratuit généreux d’abord |
L’écart du moins cher au plus cher est d’environ 7× — 0,02 $ à 0,15 $. Cela semble dramatique jusqu'à ce que vous le multipliiez par un corpus réaliste et que vous voyiez à quel point les nombres absolus restent petits.
Voici le coût unique pour intégrer trois tailles de corpus. 50M tokens est un site de documentation ou une base de connaissances de taille moyenne. 200M est le centre d'aide complet d'un gros produit ainsi que son historique. 1B est à l’échelle de l’entreprise : pensez à chaque ticket d’assistance que vous avez déposé.
| Corpus | 3-petits / Voyage-lite | Voyage-3 | Cohere / Mistral | 3-grand | Gémeaux |
|---|---|---|---|---|---|
| 50 millions de jetons | $1.00 | $3.00 | $5.00 | $6.50 | $7.50 |
| 200 millions de jetons | $4.00 | $12.00 | $20.00 | $26.00 | $30.00 |
| Jetons 1 B | $20.00 | $60.00 | $100.00 | $130.00 | $150.00 |
Même avec un milliard de jetons, l'option la plus chère ici est de 150 $ — une fois. Votre côté requête est encore moins cher : une application RAG qui intègre un million de questions d'utilisateurs par mois à environ 80 jetons chacun brûle 80 millions de jetons, soit 1,60 $ pour 3 petits. Je n'ai jamais vu l'élément de campagne intégré représenter ne serait-ce que 2 % de la facture mensuelle d'un produit d'IA. Alors pourquoi est-ce que tout le monde se soucie de celui que vous choisissez ?
Look back at the dimensions column. That is the number that actually costs money, and it costs it every single month, not once. A vector database charges you to store and search ces vecteurs et les échelles de prix en fonction du nombre de dimensions de chacun. text-embedding-3-large produit 3072 dimensions vecteurs. Voyage-3-lite produit 512. C'est un 6× différence de stockage et de mémoire pour exactement les mêmes documents.
Ainsi, le modèle « premium » à 0,13 $ ne coûte pas seulement 6 fois plus cher à intégrer ; il peut coûter plusieurs fois plus cher à intégrer. hôte, pour toujours. Sur une base de données vectorielle gérée, quelques millions de vecteurs de 3 072 dim en mémoire constituent un véritable élément de ligne mensuel, tandis que le même corpus à 512 dim peut s'intégrer dans un niveau gratuit ou quasi gratuit. L'API d'intégration est une erreur d'arrondi. L'indice qu'il alimente est la charge récurrente. J'ai évalué le côté stockage séparément dans le Répartition pomme de pin vs pgvector – c’est là que vit réellement l’argent.
Les intégrations de différents modèles sont non compatible. Un vecteur d'OpenAI ne signifie rien pour un index Cohere. Ainsi, le jour où vous décidez de changer de fournisseur – ou même de passer du 3-small au 3-large – vous devrez réintégrez l'intégralité de votre corpus à partir de zéro et reconstruisez l'index. Ce travail à 1 $ est peu coûteux à exécuter une fois ; c'est ennuyeux à exécuter car vous avez échangé des modèles six mois plus tard et maintenant chaque vecteur stocké est un déchet.
C’est pourquoi la solution intelligente n’est pas de « choisir le moins cher par jeton ». Il s'agit de "choisir un modèle dont votre base de données vectorielle peut se permettre d'héberger le nombre de dimensions et dont la qualité de récupération est suffisamment bonne pour que vous n'ayez jamais besoin de le réintégrer". Pour la plupart des gens, la réponse est text-embedding-3-small ou Voyage-3-lite : deux cents le million de jetons, de petits vecteurs, une qualité qui tient le coup. Vous optez pour 3-large ou un reranker uniquement lorsque la qualité de la récupération échoue de manière mesurable, et non par défaut.
Je par défaut intégration de texte-3-small. C'est 0,02 $/1 million, les vecteurs ont 1 536 dimensions gérables et OpenAI vous permet de les raccourcir davantage si votre base de données manque de mémoire. Lorsque j'ai besoin d'un meilleur rappel multilingue, je teste Voyage ou Cohere sur mon propre ensemble d'évaluation avant de m'engager, car changer plus tard signifie tout réintégrer. Et je budgétise la base de données vectorielles comme le coût réel, pas l'API. Exécutez vos propres chiffres avant de vous engager sur un nombre de dimensions que vous devez payer chaque mois :
Vous débutez dans la tarification des API basées sur l'utilisation ? Commencez par le guides gratuits sur les coûts des API. Et si vous créez l'application de récupération complète, les intégrations sont le troisième bon marché - voir combien coûte le côté LLM après la mise en cache pour savoir où va l'argent réel par appel.
Les prix sont les tarifs répertoriés par les fournisseurs tels qu'ils figurent dans notre catalogue (juillet 2026) et sont des estimations de référence : confirmez les tarifs actuels sur la page de tarification de chaque fournisseur avant de budgétiser. Les décomptes de dimensions sont les sorties du modèle par défaut ; certains modèles (y compris ceux d'OpenAI) prennent en charge le raccourcissement. Les frais de corpus sont uniques ; le stockage de bases de données vectorielles est récurrent et facturé séparément.