Uso e preços da nuvem

Capacidade e substituto do dispositivo

economia mensal versus abordagem de nuvem pura e híbrida no dispositivo
% de poupança
linha de base de nuvem pura / mês
total híbrido / mês

Detalhamento de custos

Item de linhaInferências / mêsCusto / mês
Linha de base de nuvem pura (100% nuvem, sem dispositivo)
— usuários somente na nuvem (não compatíveis com o dispositivo)
— fallback na nuvem de usuários com capacidade no dispositivo
= Conta de nuvem híbrida
+ Custo amortizado de configuração no dispositivo
= Custo mensal total híbrido
Ponto de equilíbrio no custo de configuração único

Como isso se conecta a outras ferramentas

Duas calculadoras já neste site avaliam uma solução semelhante, mas estruturalmente diferente. O Calculadora de custos de auto-hospedagem vs API e o LLM auto-hospedado vs calculadora API ambos os modelos lado do servidor auto-hospedagem – alugando sua própria GPU ou instância de nuvem e executando inferência lá você mesmo, em comparação com o pagamento de um provedor por token ou por chamada. O custo em ambos ainda é um servidor em algum lugar com uma conta de hospedagem real, apenas um que você controla em vez de um fornecedor. Esta calculadora, em vez disso, modela lado do cliente inferência no dispositivo executada diretamente no hardware do telefone do usuário final — sem servidor para alugar, custo marginal efetivamente zero por inferência assim que o modelo for lançado e um gargalo completamente diferente: não horas de GPU, mas que fração de seus usuários possui dispositivos com capacidade suficiente e com que frequência até mesmo esses dispositivos ainda precisam voltar para a nuvem. Se você estiver decidindo entre alugar uma caixa de GPU e pagar uma API em nuvem, use as calculadoras auto-hospedadas; se você está decidindo se deseja enviar um modelo quantizado dentro do seu próprio aplicativo móvel, este é aquele que corresponde a esse formato de custo.

Lendo os números

Nos padrões – 100.000 usuários ativos mensais, 50 inferências por usuário por dia, US$ 0,001 por inferência na nuvem, uma construção única no dispositivo de US$ 40.000, 60% dos usuários em dispositivos capazes, uma taxa de fallback de nuvem de 5% para esses usuários capazes, amortizada em 12 meses — a linha de base da nuvem pura custa US$ 150.000/mês. A adoção do híbrido reduz a conta residual da nuvem para US$ 64.500/mês (60.000.000 inferências de usuários somente na nuvem mais 4.500.000 inferências substitutas de usuários capacitados), acrescenta cerca de US$ 3.333/mês em custo de configuração amortizado e chega a um total híbrido próximo de US$ 67.833/mês – uma economia de cerca de US$ 82.167/mês, ou aproximadamente 55% de desconto na linha de base da nuvem pura. O custo de configuração de US$ 40.000 atinge o equilíbrio em menos de meio mês neste volume, porque o gasto mensal com nuvem que ele desvia (cerca de US$ 85.500/mês) supera o custo único de construção quase imediatamente. Essa matemática muda rapidamente em escala menor: execute as mesmas entradas em 5.000 usuários em vez de 100.000 e o ponto de equilíbrio se estende por cerca de 20 vezes mais – cerca de 9,4 meses em vez de menos de meio mês – porque simplesmente não há inferências desviadas suficientes por mês para recuperar rapidamente o custo de construção. Conecte o MAU real do seu aplicativo, não um aspiracional, antes de comprometer o orçamento de engenharia para uma construção no dispositivo.

Hospede seu projeto:DigitalOcean – $ 200 grátis ↗VPS da Hostinger
Calculadora de custos de auto-hospedagem vs APILLM auto-hospedado vs calculadora APICalculadora de custos de inferência de GPUEstimador de custos de aplicativos de IA