Como funciona esta calculadora
O Calculadora de custos de inferência de IA de computação confidencial (TEE) começa a partir do seu solicitações mensais × tokens médios por solicitação obter total de tokens mensais — nos padrões, 1.000.000 × 500 equivale a 500.000.000 tokens. Dividindo isso por 1.000.000 e multiplicando pelo custo padrão (não confidencial) por 1 milhão de tokens dá o custo mensal padrão — US$ 1.000,00 no padrão de US$ 2,00/1 milhão. O modo Confidencial/TEE não adiciona uma marcação plana – ele reduz o rendimento efetivo, porque a GPU gasta ciclos em criptografia de memória, atestado criptográfico e opera com acesso restrito aos contadores de desempenho de hardware usados para otimização. Esta calculadora modela isso como confidencialComputeCost = standardMonthlyCost ÷ (1 - overhead% ÷ 100), o que é matematicamente o mesmo que dizer que a GPU faz o mesmo trabalho em menos tempo útil – no padrão de 12%, US$ 1.000 ÷ 0,88 = US$ 1.136,36.
Além desse custo de computação, alguns provedores cobram uma pequena taxa de serviço de atestado por solicitação para cobrir o handshake criptográfico que prova que a carga de trabalho está genuinamente sendo executada dentro de um TEE verificado antes que os dados confidenciais sejam enviados – no padrão de US$ 0,0001/solicitação × 1.000.000 solicitações, isso é US$ 100,00/mês. Adicionar custo de computação e custo de atestado fornece o custo total de computação confidencial ($ 1.236,36 nos padrões), e subtraindo o custo padrão dá o prêmio em dólares (US$ 236,36) e porcentagem (23,6%) — equivalentemente, o custo efetivo por 1 milhão de tokens aumenta de US$ 2,00 padrão para cerca de US$ 2,47 confidenciais. O porcentagem de custos indiretos é a entrada a ser observada mais de perto: as implementações de TEE melhoraram substancialmente, com os relatórios da indústria passando de aproximadamente 70-75% de eficiência (25-30% de sobrecarga) na computação confidencial H100 da era 2024 e nas primeiras pilhas TDX/SEV-SNP para aproximadamente 85-92% de eficiência (8-15% de sobrecarga) no hardware H100/H200 da geração atual e pilhas de drivers mais maduras - use a tabela de sensibilidade abaixo para ver quanto isso uma única suposição movimenta sua fatura mensal.
Perguntas frequentes
O que é computação confidencial para inferência de IA?
A computação confidencial para inferência de IA executa seu modelo e seus dados dentro de um Trusted Execution Environment (TEE) isolado por hardware para que o conteúdo da memória (prompts, pesos de modelo, ativações) permaneça criptografado até mesmo no próprio sistema operacional, hipervisor e administradores do provedor de nuvem. A NVIDIA implementa isso como um modo de computação confidencial nas GPUs H100 e H200, onde a memória da GPU é criptografada e um atestado criptográfico prova ao cliente que a carga de trabalho está realmente sendo executada dentro de um TEE genuíno e não modificado antes que quaisquer dados confidenciais sejam enviados. No lado da CPU, Intel TDX (Trust Domain Extensions) e AMD SEV-SNP (Secure Encrypted Virtualization) fornecem o isolamento equivalente para a máquina host que coordena a GPU. O efeito prático é que um hospital, banco ou agência governamental pode enviar registros de pacientes ou dados financeiros para inferência executada em uma frota de GPU compartilhada em nuvem de terceiros com uma garantia apoiada por hardware de que o próprio provedor não pode ler os dados de texto simples ou exfiltrar pesos de modelos proprietários, razão pela qual as implantações na indústria regulamentada exigem cada vez mais isso como uma caixa de seleção ao lado de controles padrão, como criptografia em trânsito e registro de acesso.
Quanto custa mais o TEE/inferência confidencial?
Nos padrões desta calculadora - $ 2,00 por custo padrão de 1 milhão de tokens, 12% de sobrecarga de desempenho, uma taxa de atestado de $ 0,0001 por solicitação, 1.000.000 solicitações mensais com média de 500 tokens cada - a inferência no modo confidencial custa cerca de $ 1.236,36 / mês versus $ 1.000,00 / mês padrão, um prêmio de cerca de $ 236,36 ou 23,6%, elevando o custo efetivo de US$ 2,00 para cerca de US$ 2,47 por 1 milhão de tokens. A maior parte dessa lacuna é a sobrecarga da taxa de transferência de computação (a GPU faz o mesmo trabalho de criptografia e atestado, independentemente do tamanho da solicitação, portanto, processa menos tokens por segundo no modo confidencial), e não a taxa fixa de atestado, que é comparativamente pequena, a menos que o volume de solicitação seja muito alto com cargas pequenas. A porcentagem de sobrecarga é a entrada a ser observada: ela varia significativamente de acordo com a geração e o provedor de GPU, portanto, esse prêmio em dólares deve ser tratado como ilustrativo até que você confirme a sobrecarga real que seu provedor específico e combinação de hardware oferecem.
A sobrecarga é a mesma para cada GPU?
A sobrecarga de computação confidencial depende da geração da GPU, da carga de trabalho específica (tamanho do lote, comprimento da sequência, arquitetura do modelo) e de como o provedor implementa o atestado e o gerenciamento de chaves em torno dela. Aceleradores anteriores com capacidade de TEE e pilhas de software de modo confidencial de primeira geração relataram eficiência em aproximadamente 70-75% em relação ao modo não confidencial – o que significa sobrecarga de 25-30% – porque a criptografia de memória inicial e os caminhos de atestado adicionaram serialização substancial e custo de largura de banda. Implementações mais recentes de computação confidencial H100/H200 e pilhas de drivers e firmware mais maduras aumentaram a eficiência para aproximadamente 85-92%, ou seja, uma sobrecarga próxima de 8-15%, à medida que os fornecedores otimizaram os mecanismos de criptografia e reduziram as verificações de atestado que ficam no caminho quente. Tamanhos de lote menores e sequências mais curtas tendem a mostrar sobrecarga proporcionalmente maior porque o custo fixo de atestado e criptografia por solicitação é amortizado em menos computação real, enquanto cargas de trabalho de lote grande e contexto longo diluem esse custo fixo e mostram sobrecarga mais próxima do limite inferior do intervalo.
Quando vale a pena pagar o prêmio TEE?
Vale a pena pagar o prêmio TEE sempre que uma estrutura regulatória, um acordo contratual de processamento de dados ou uma política de risco interna exigir prova apoiada por hardware de que um terceiro não pode acessar dados de texto simples ou pesos de modelo durante a inferência – cargas de trabalho de saúde relacionadas a PHI, serviços financeiros que lidam com dados de contas ou transações, implantações governamentais e de defesa, e qualquer fornecedor de IA B2B cujos clientes corporativos exijam isso em um questionário de segurança são os casos mais claros. É muito mais difícil justificar ferramentas internas, prototipagem, dados públicos ou já anonimizados ou qualquer carga de trabalho em que um contrato de processamento de dados assinado e controles padrão de criptografia em repouso/em trânsito já satisfaçam suas obrigações de conformidade, porque um aumento de custo de 10 a 25% aumenta rapidamente em escala sem nenhum benefício se ninguém realmente exigir o atestado de hardware. A decisão geralmente não é realmente uma questão de otimização de custos - é se um requisito de conformidade específico ou um contrato de cliente exige o TEE, caso em que o prêmio é simplesmente o preço de poder servir essa carga de trabalho, e esta calculadora existe para dimensionar esse preço, em vez de dissuadi-lo de pagá-lo.