Come funziona questa calcolatrice
IL Calcolatore dei costi di inferenza AI di Confidential Computing (TEE). inizia dal tuo richieste mensili × token medi per richiesta ottenere token mensili totali — Per impostazione predefinita, 1.000.000 × 500 equivale a 500.000.000 di token. Dividendolo per 1.000.000 e moltiplicandolo per costo standard (non confidenziale) per 1 milione di token dà il costo mensile standard — $ 1.000,00 al valore predefinito di $ 2,00/1 milione. La modalità riservata/TEE non aggiunge un markup piatto in più: riduce il throughput effettivo, perché la GPU dedica cicli alla crittografia della memoria, all'attestazione crittografica e opera con accesso limitato ai contatori delle prestazioni hardware utilizzati per l'ottimizzazione. Questa calcolatrice lo modella come confidenzialeComputeCost = standardMonthlyCost ÷ (1 − sovraccarico% ÷ 100), che matematicamente equivale a dire che la GPU fa lo stesso lavoro in meno tempo utilizzabile: con un valore predefinito del 12%, $ 1.000 ÷ 0,88 = $ 1.136,36.
Oltre al costo di elaborazione, alcuni provider addebitano una piccola commissione tariffa del servizio di attestazione per richiesta per coprire l'handshake crittografico che dimostra che il carico di lavoro è effettivamente in esecuzione all'interno di un TEE verificato prima che i dati sensibili vengano inviati: al valore predefinito di $ 0,0001/richiesta × 1.000.000 di richieste, ovvero $ 100,00/mese. L'aggiunta del costo di calcolo e del costo di attestazione fornisce il risultato costo totale del calcolo riservato ($ 1.236,36 per impostazione predefinita) e sottraendo il costo standard si ottiene il premio in dollari ($ 236,36) e percentuale (23,6%): allo stesso modo, il costo effettivo per 1 milione di token aumenta da $ 2,00 standard a circa $ 2,47 confidenziali. IL percentuale di spese generali è l'input da osservare più da vicino: le implementazioni TEE sono migliorate sostanzialmente, con i report di settore che sono passati da un'efficienza di circa il 70-75% (25-30% di sovraccarico) nel calcolo riservato H100 dell'era 2024 e dai primi stack TDX/SEV-SNP a circa l'85-92% di efficienza (8-15% di sovraccarico) sull'hardware H100/H200 di attuale generazione e stack di driver più maturi: utilizza la tabella di sensibilità di seguito per vedere quanto questo un'unica ipotesi sposta la tua fattura mensile.
Domande frequenti
Che cos'è l'elaborazione riservata per l'inferenza dell'intelligenza artificiale?
L'elaborazione riservata per l'inferenza dell'intelligenza artificiale esegue il tuo modello e i tuoi dati all'interno di un Trusted Execution Environment (TEE) isolato dall'hardware in modo che i contenuti della memoria (prompt, pesi del modello, attivazioni) rimangano crittografati anche dal sistema operativo, dall'hypervisor e dagli amministratori del fornitore di servizi cloud. NVIDIA lo implementa come modalità di elaborazione riservata sulle GPU H100 e H200, in cui la memoria della GPU è crittografata e un'attestazione crittografica dimostra al cliente che il carico di lavoro è effettivamente in esecuzione all'interno di un TEE autentico e non modificato prima che vengano inviati dati sensibili. Sul lato CPU, Intel TDX (Trust Domain Extensions) e AMD SEV-SNP (Secure Encrypted Virtualization) forniscono l'isolamento equivalente per la macchina host che coordina la GPU. L'effetto pratico è che un ospedale, una banca o un ente governativo può inviare cartelle cliniche o dati finanziari a un'inferenza in esecuzione su una flotta di GPU condivise di un cloud di terze parti con una garanzia supportata dall'hardware che il fornitore stesso non può leggere i dati in chiaro o estrarre pesi di modelli proprietari, motivo per cui le implementazioni di settori regolamentati la richiedono sempre più come casella di controllo insieme a controlli standard come la crittografia in transito e la registrazione degli accessi.
Quanto costa in più il TEE/l'inferenza confidenziale?
Con i valori predefiniti di questo calcolatore (costo standard di $ 2,00 per 1 milione di token, sovraccarico delle prestazioni del 12%, tariffa di attestazione di $ 0,0001 per richiesta, 1.000.000 di richieste mensili con una media di 500 token ciascuna) l'inferenza in modalità riservata costa circa $ 1.236,36 al mese rispetto a $ 1.000,00 al mese standard, un premio di circa $ 236,36 o 23,6%, spingendo il costo effettivo da $ 2,00 a circa $ 2,47 per 1 milione di token. Gran parte di questo divario è dovuto al sovraccarico del throughput di calcolo (la GPU esegue lo stesso lavoro di crittografia e attestazione indipendentemente dalle dimensioni della richiesta, quindi elabora meno token al secondo in modalità riservata), non alla tariffa fissa di attestazione, che è relativamente piccola a meno che il volume delle richieste non sia molto elevato con piccoli carichi utili. La percentuale di sovraccarico è l'input da tenere d'occhio: varia in modo significativo in base alla generazione di GPU e al fornitore, quindi questo premio in dollari dovrebbe essere considerato come illustrativo fino a quando non avrai confermato il sovraccarico effettivo offerto dal tuo fornitore specifico e dalla combinazione hardware.
Il sovraccarico è lo stesso per ogni GPU?
No. Il sovraccarico di calcolo riservato dipende dalla generazione della GPU, dal carico di lavoro specifico (dimensione del batch, lunghezza della sequenza, architettura del modello) e dal modo in cui il provider implementa l'attestazione e la gestione delle chiavi attorno ad esso. I precedenti acceleratori con funzionalità TEE e gli stack software in modalità riservata di prima generazione riportavano un'efficienza intorno al 70-75% rispetto alla modalità non riservata, il che significa un sovraccarico del 25-30%, perché i primi percorsi di crittografia e attestazione della memoria aggiungevano sostanziali costi di serializzazione e larghezza di banda. Le più recenti implementazioni di elaborazione riservata H100/H200 e stack di driver e firmware più maturi hanno spinto l'efficienza fino a circa l'85-92%, ovvero un sovraccarico più vicino all'8-15%, poiché i fornitori hanno ottimizzato i motori di crittografia e ridotto i controlli di attestazione che si trovano sul percorso caldo. Batch di dimensioni più piccole e sequenze più brevi tendono a mostrare un sovraccarico proporzionalmente più elevato perché il costo fisso di attestazione e crittografia per richiesta viene ammortizzato su un calcolo meno effettivo, mentre i carichi di lavoro di grandi batch e con contesto lungo diluiscono tale costo fisso e mostrano un sovraccarico più vicino al limite inferiore dell'intervallo.
Quando conviene pagare il premio TEE?
Vale la pena pagare il premio TEE ogni volta che un quadro normativo, un accordo contrattuale sull'elaborazione dei dati o una politica di rischio interna richiedono una prova supportata dall'hardware che una terza parte non possa accedere ai dati in chiaro o ai pesi del modello durante l'inferenza: i carichi di lavoro sanitari che toccano PHI, i servizi finanziari che gestiscono dati di conti o transazioni, implementazioni governative e di difesa e qualsiasi fornitore di intelligenza artificiale B2B i cui clienti aziendali lo richiedono in un questionario sulla sicurezza sono i casi più chiari. È molto più difficile da giustificare per strumenti interni, prototipazione, dati pubblici o già anonimizzati o qualsiasi carico di lavoro in cui un accordo firmato sull'elaborazione dei dati e controlli standard di crittografia a riposo/in transito soddisfano già gli obblighi di conformità, perché un aumento dei costi del 10-25% si accumula rapidamente su larga scala senza alcun vantaggio se nessuno richiede effettivamente l'attestazione dell'hardware. La decisione di solito non è affatto una questione di ottimizzazione dei costi: riguarda se uno specifico requisito di conformità o un contratto con il cliente impone il TEE, nel qual caso il premio è semplicemente il prezzo per poter servire quel carico di lavoro, e questo calcolatore esiste per dimensionare quel prezzo piuttosto che per convincerti a non pagarlo.