Uso e preços da nuvem

Capacidade e substituto do dispositivo

—
economia mensal versus abordagem de nuvem pura e híbrida no dispositivo
—% de poupança
—linha de base de nuvem pura / mês
—total híbrido / mês

Detalhamento de custos

Item de linhaInferências / mêsCusto / mês
Linha de base de nuvem pura (100% nuvem, sem dispositivo)——
— usuários somente na nuvem (não compatíveis com o dispositivo)——
— fallback na nuvem de usuários com capacidade no dispositivo——
= Conta de nuvem híbrida——
+ Custo amortizado de configuração no dispositivo——
= Custo mensal total híbrido——
Ponto de equilíbrio no custo de configuração único
—

Como isso se conecta a outras ferramentas

Duas calculadoras já neste site avaliam uma solução semelhante, mas estruturalmente diferente. O Calculadora de custos de auto-hospedagem vs API e o LLM auto-hospedado vs calculadora API ambos os modelos lado do servidor auto-hospedagem – alugando sua própria GPU ou instância de nuvem e executando inferência lá você mesmo, em comparação com o pagamento de um provedor por token ou por chamada. O custo em ambos ainda é um servidor em algum lugar com uma conta de hospedagem real, apenas um que você controla em vez de um fornecedor. Esta calculadora, em vez disso, modela lado do cliente inferência no dispositivo executada diretamente no hardware do telefone do usuário final – sem servidor para alugar, custo marginal efetivamente zero por inferência assim que o modelo for lançado e um gargalo completamente diferente: não horas de GPU, mas que fração de seus usuários possui dispositivos com capacidade suficiente e com que frequência até mesmo esses dispositivos ainda precisam voltar para a nuvem. Se você estiver decidindo entre alugar uma caixa de GPU e pagar uma API em nuvem, use as calculadoras auto-hospedadas; se você está decidindo se deseja enviar um modelo quantizado dentro do seu próprio aplicativo móvel, este é aquele que corresponde a esse formato de custo.

Ler os números

At the defaults — 100,000 monthly active users, 50 inferences per user per day, $0.001 per cloud inference, a $40,000 one-time on-device build, 60% of users on capable devices, a 5% cloud-fallback rate on those capable users, amortized over 12 months — the pure-cloud baseline runs $150,000/month. Going hybrid brings the residual cloud bill down to $64,500/month (60,000,000 inferences from cloud-only users plus 4,500,000 fallback inferences from capable users), adds roughly $3,333/month in amortized setup cost, and lands on a hybrid total near $67,833/month — a savings of about $82,167/month, or roughly 55% de desconto na linha de base da nuvem pura. The $40,000 setup cost itself breaks even in under half a month at this volume, because the monthly cloud spend it deflects (about $85,500/month) dwarfs the one-time build cost almost immediately. That math changes fast at lower scale: run the same inputs at 5,000 users instead of 100,000 and the break-even stretches to roughly 20x longer — about 9.4 months instead of under half a month — because there simply are not enough deflected inferences per month to recoup the build cost quickly. Plug in your app's real MAU, not an aspirational one, before committing engineering budget to an on-device build.

Compartilhar: 𝕏 Postar Reddit
Hospede seu projeto:DigitalOcean – $ 200 grátis ↗VPS da Hostinger
Calculadora de custos de auto-hospedagem vs APILLM auto-hospedado vs calculadora APICalculadora de custos de inferência de GPUEstimador de custos de aplicativos de IA