Comment fonctionne cette calculatrice
Le Calculateur de coûts d'inférence d'IA de Confidential Computing (TEE) commence à partir de votre demandes mensuelles × jetons moyens par requête obtenir total de jetons mensuels — par défaut, 1 000 000 × 500 équivaut à 500 000 000 de jetons. En divisant cela par 1 000 000 et en multipliant par le coût standard (non confidentiel) par million de jetons donne le coût mensuel standard — 1 000,00 $ à la valeur par défaut de 2,00 $/1 M. Le mode Confidentiel/TEE n'ajoute pas de balisage plat à cela : il réduit le débit effectif, car le GPU consacre des cycles au cryptage de la mémoire, à l'attestation cryptographique et fonctionne avec un accès restreint aux compteurs de performances matérielles utilisés pour l'optimisation. Cette calculatrice modélise cela comme confidentielComputeCost = standardMonthlyCost ÷ (1 − frais généraux% ÷ 100), ce qui revient mathématiquement à dire que le GPU fait le même travail en moins de temps d'utilisation – avec la valeur par défaut de 12 %, 1 000 $ ÷ 0,88 = 1 136,36 $.
En plus de ce coût de calcul, certains fournisseurs facturent une petite somme frais de service d'attestation par demande pour couvrir la poignée de main cryptographique qui prouve que la charge de travail s'exécute véritablement dans un TEE vérifié avant l'envoi des données sensibles – au taux par défaut de 0,0001 $/requête × 1 000 000 de requêtes, soit 100,00 $/mois. L'ajout du coût de calcul et du coût d'attestation donne le coût total du calcul confidentiel (1 236,36 $ par défaut), et en soustrayant le coût standard, on obtient le prime en dollars (236,36 $) et en pourcentage (23,6 %) – de manière équivalente, le coût effectif par million de jetons passe de 2,00 $ standard à environ 2,47 $ confidentiels. Le pourcentage de frais généraux est l'entrée à surveiller de plus près : les implémentations de TEE se sont considérablement améliorées, les rapports de l'industrie passant d'une efficacité d'environ 70 à 75 % (charge de 25 à 30 %) dans le calcul confidentiel H100 de l'ère 2024 et les premières piles TDX/SEV-SNP à environ 85 à 92 % d'efficacité (charge de 8 à 15 %) sur le matériel H100/H200 de la génération actuelle et les piles de pilotes plus matures - utilisez le tableau de sensibilité ci-dessous pour voir dans quelle mesure ce seul l'hypothèse déplace votre facture mensuelle.
Questions fréquemment posées
Qu’est-ce que l’informatique confidentielle pour l’inférence de l’IA ?
L'informatique confidentielle pour l'inférence de l'IA exécute votre modèle et vos données dans un environnement d'exécution sécurisé (TEE) isolé du matériel afin que le contenu de la mémoire (invites, pondérations de modèle, activations) reste chiffré même à partir du système d'exploitation, de l'hyperviseur et des administrateurs du fournisseur de cloud. NVIDIA implements this as a confidential-compute mode on H100 and H200 GPUs, where the GPU memory is encrypted and a cryptographic attestation proves to the client that the workload is actually running inside a genuine, unmodified TEE before any sensitive data is sent. Côté CPU, Intel TDX (Trust Domain Extensions) et AMD SEV-SNP (Secure Encrypted Virtualization) assurent une isolation équivalente pour la machine hôte coordonnant le GPU. L'effet pratique est qu'un hôpital, une banque ou une agence gouvernementale peut envoyer des dossiers de patients ou des données financières à des fins d'inférence exécutées sur la flotte de GPU partagée d'un cloud tiers avec une garantie matérielle que le fournisseur lui-même ne peut pas lire les données en clair ou exfiltrer les poids des modèles propriétaires.
Combien coûte en plus l’inférence TEE/confidentielle ?
Aux valeurs par défaut de cette calculatrice : coût standard de 2,00 $ par million de jetons, frais généraux de performance de 12 %, frais d'attestation de 0,0001 $ par demande, 1 000 000 de requêtes mensuelles d'une moyenne de 500 jetons chacune - l'inférence en mode confidentiel coûte environ 1 236,36 $/mois contre 1 000,00 $/mois standard, soit une prime d'environ 236,36 $ ou 23,6 %, faisant passer le coût effectif de 2,00 $ à environ 2,47 $ par million de jetons. L'essentiel de cet écart réside dans la surcharge de débit de calcul (le GPU effectue le même travail de chiffrement et d'attestation quelle que soit la taille de la requête, il traite donc moins de jetons par seconde en mode confidentiel), et non dans les frais d'attestation forfaitaires, qui sont relativement faibles, à moins que le volume de requêtes ne soit très élevé avec de petites charges utiles. Le pourcentage de frais généraux est l'entrée à surveiller : il varie de manière significative selon la génération de GPU et le fournisseur, cette prime en dollars doit donc être traitée comme une illustration jusqu'à ce que vous ayez confirmé les frais généraux réels fournis par votre fournisseur spécifique et votre combinaison matérielle.
La surcharge est-elle la même pour chaque GPU ?
Non. La surcharge de calcul confidentiel dépend de la génération du GPU, de la charge de travail spécifique (taille du lot, longueur de la séquence, architecture du modèle) et de la manière dont le fournisseur met en œuvre l'attestation et la gestion des clés. Les anciens accélérateurs compatibles TEE et les piles logicielles en mode confidentiel de première génération affichaient une efficacité d'environ 70 à 75 % par rapport au mode non confidentiel, ce qui signifie une surcharge de 25 à 30 %, car les premiers chemins de cryptage et d'attestation de la mémoire ajoutaient des coûts de sérialisation et de bande passante substantiels. Les nouvelles implémentations de calcul confidentiel H100/H200 et les piles de pilotes et de micrologiciels plus matures ont poussé cette efficacité jusqu'à environ 85 à 92 %, soit une surcharge proche de 8 à 15 %, car les fournisseurs ont optimisé les moteurs de chiffrement et réduit les contrôles d'attestation qui se trouvent sur le chemin chaud. Des lots plus petits et des séquences plus courtes ont tendance à afficher des frais généraux proportionnellement plus élevés, car le coût fixe d'attestation et de chiffrement par demande est amorti sur un calcul réel moindre, tandis que les charges de travail par lots volumineux et à contexte long diluent ce coût fixe et affichent des frais généraux plus proches du bas de la fourchette.
Quand la prime TEE vaut-elle la peine d’être payée ?
La prime TEE vaut la peine d'être payée chaque fois qu'un cadre réglementaire, un accord contractuel de traitement des données ou une politique de risque interne exigent une preuve matérielle qu'un tiers ne peut pas accéder aux données en clair ou aux pondérations de modèle pendant l'inférence - les charges de travail de soins de santé touchant les PHI, les services financiers traitant des données de compte ou de transaction, les déploiements gouvernementaux et de défense, et tout fournisseur d'IA B2B dont les entreprises clientes l'exigent dans un questionnaire de sécurité sont les cas les plus clairs. Il est beaucoup plus difficile de justifier des outils internes, du prototypage, des données publiques ou déjà anonymisées, ou toute charge de travail pour laquelle un accord de traitement de données signé et des contrôles standard de chiffrement au repos/en transit satisfont déjà à vos obligations de conformité, car une augmentation des coûts de 10 à 25 % s'accumule rapidement à grande échelle sans aucun avantage si personne n'exige réellement l'attestation matérielle. La décision n'est généralement pas vraiment une question d'optimisation des coûts - il s'agit de savoir si une exigence de conformité spécifique ou un contrat client impose le TEE, auquel cas la prime est simplement le prix pour être autorisé à servir cette charge de travail, et ce calculateur existe pour évaluer ce prix plutôt que pour vous empêcher de le payer.