Utilizzo e prezzi del cloud
Funzionalità e fallback del dispositivo
—
risparmi mensili rispetto all'approccio ibrido on-device e cloud puro—% di risparmio
—riferimento di cloud puro/mese
—ibrido totale/mese
Ripartizione dei costi
| Elemento pubblicitario | Inferenze/mese | Costo/mese |
| Base di riferimento puramente cloud (100% cloud, non sul dispositivo) | — | — |
| — utenti solo cloud (non compatibili con il dispositivo) | — | — |
| — fallback cloud da parte di utenti abilitati sul dispositivo | — | — |
| = Fattura del cloud ibrido | — | — |
| + Costo di installazione sul dispositivo ammortizzato | — | — |
| = Costo mensile totale ibrido | — | — |
Break-even sul costo di installazione una tantum
—
Come si collega ad altri strumenti
Due calcolatori già presenti su questo sito valutano una decisione correlata ma strutturalmente diversa. IL Calcolatore dei costi Self-Host e API e il Calcolatore LLM self-hosted e API entrambi i modelli lato server self-hosting: noleggiare la propria GPU o istanza cloud ed eseguire l'inferenza da soli, rispetto al pagamento di un provider per token o per chiamata. La forma del costo in entrambi è ancora un server da qualche parte con una fattura di hosting reale, solo quella che controlli invece di quella del fornitore. Questa calcolatrice invece modella lato client inferenza sul dispositivo eseguita direttamente sull'hardware del telefono dell'utente finale: nessun server da noleggiare, costo marginale per inferenza effettivamente pari a zero una volta spedito il modello e un collo di bottiglia completamente diverso: non ore di GPU, ma quale frazione di utenti possiede dispositivi sufficientemente capaci e quanto spesso anche questi dispositivi devono ancora ricorrere al cloud. Se stai decidendo tra noleggiare una GPU box e pagare un'API cloud, utilizza i calcolatori self-hosted; se stai decidendo se spedire un modello quantizzato all'interno della tua stessa app mobile, questo è quello che corrisponde a quella forma di costo.
Leggere i numeri
Ai valori predefiniti (100.000 utenti attivi mensili, 50 inferenze per utente al giorno, 0,001 dollari per inferenza cloud, una build su dispositivo una tantum da 40.000 dollari, 60% degli utenti su dispositivi abilitati, un tasso di fallback cloud del 5% su quegli utenti capaci, ammortizzato in 12 mesi) la linea di base del cloud puro è di 150.000 dollari al mese. Il passaggio all'ibrido riduce la fattura residua del cloud a 64.500 dollari al mese (60.000.000 di inferenze da utenti solo cloud più 4.500.000 inferenze di fallback da utenti competenti), aggiunge circa 3.333 dollari al mese in costi di installazione ammortizzati e arriva a un totale ibrido vicino a 67.833 dollari al mese: un risparmio di circa 82.167 dollari al mese, o all'incirca Sconto del 55% rispetto al modello di base del cloud puro. Il costo di installazione di $ 40.000 di per sé va in pareggio in meno di metà mese con questo volume, perché la spesa mensile per il cloud che devia (circa $ 85.500 al mese) fa impallidire quasi immediatamente il costo di costruzione una tantum. Questi calcoli cambiano velocemente su scala più bassa: esegui gli stessi input a 5.000 utenti invece che a 100.000 e il pareggio si estende fino a circa 20 volte più a lungo – circa 9,4 mesi invece di meno di mezzo mese – perché semplicemente non ci sono abbastanza inferenze deviate al mese per recuperare rapidamente i costi di costruzione. Collega il MAU reale della tua app, non quello ambizioso, prima di impegnare il budget di progettazione per una build sul dispositivo.
Calcolatore dei costi Self-Host e APICalcolatore LLM self-hosted e APICalcolatore dei costi di inferenza GPUStima dei costi delle app AI
Come funziona questa calcolatrice
IL Calcolatore Inferenza AI Edge/On-Device e API Cloud innanzitutto calcola una linea di base del cloud puro: inferenze per utente al giorno × utenti attivi mensili × 30, al prezzo del tuo cloud per inferenza: questo è ciò che pagheresti con il modello zero on-device. Quindi divide la tua base utenti per percentuale di capacità sul dispositivo in utenti capaci e utenti solo cloud. Gli utenti solo cloud generano una fattura cloud completa per ciascuna delle loro inferenze, poiché i loro dispositivi non possono eseguire affatto il modello locale. Gli utenti abilitati sul dispositivo eseguono per lo più l'inferenza localmente a un costo marginale effettivamente pari a zero, tranne per un percentuale di fallback nel cloud delle loro query (troppo complesse, batteria scarica, avvio a freddo prima che il modello locale finisca il download o un risultato locale con scarsa attendibilità) che viene comunque addebitato all'API cloud.
Deliberatamente, questa calcolatrice lo fa non attribuisci una cifra in dollari al calcolo sul dispositivo, al consumo della batteria o all'ingombro dello spazio di archiviazione stesso: tratta il costo marginale di un'inferenza locale come zero una volta che il modello è stato spedito. Si tratta di una semplificazione realistica per modelli piccoli e ben quantizzati in esecuzione su moderni chip di punta, dove la batteria incrementale e il costo di elaborazione per inferenza sono trascurabili rispetto alla fattura dell'API cloud. Sottostima il costo reale per modelli on-device molto grandi o dispositivi più vecchi/di fascia bassa, dove la limitazione termica, il consumo della batteria e la pressione di stoccaggio sono costi reali (se difficili da quantificare in dollari) che vale la pena valutare separatamente. Le inferenze residue solo cloud e fallback cloud vengono riassunte in a Fattura del cloud ibrido, quindi il costo di configurazione una tantum sul dispositivo (ingegneria, quantizzazione, spedizione) viene diviso per la finestra di ammortamento scelta e aggiunto in cima per ottenere il costo mensile totale ibrido. Il confronto con il valore di base del cloud puro fornisce il risparmio mensile e la percentuale di risparmio, dividendo il costo di installazione per mensile la spesa cloud deviata (cloud puro meno la fattura del cloud ibrido, ignorando l'ammortamento) fornisce il valore autonomo pareggio in mesi — quanto velocemente la creazione una tantum si ripaga grazie ai soli risparmi sul cloud.
Domande frequenti
Perché l'inferenza sul dispositivo ha un costo una tantum anziché un costo per inferenza come le API cloud?
Perché la parte costosa dell'inferenza sul dispositivo è costruirla, non eseguirla. Quantizzare un modello fino a dimensioni adatte a un telefono, convertirlo in Core ML o in un formato TensorFlow Lite/NNAPI, testarlo su più livelli di dispositivi e spedirlo all'interno del file binario dell'app o come risorsa scaricabile è un progetto di ingegneria fisso con un prezzo fisso, pagato una volta indipendentemente dal fatto che un utente o dieci milioni di utenti finiscano per eseguirlo. Un'API cloud fattura invece per richiesta perché il tempo della GPU del provider è un costo marginale reale su ogni singola chiamata. Una volta che il modello sul dispositivo è stato quantizzato e spedito, eseguire un'ulteriore inferenza sul telefono di un utente non costa al proprietario dell'app essenzialmente nulla oltre a un frammento della batteria e del calcolo dell'utente - nessun server, nessuna fattura per chiamata - che è esattamente ciò che trasforma il costo di installazione una tantum in qualcosa che vale la pena ammortizzare nel corso dei mesi anziché spendere per chiamata.
Cosa succede se la mia percentuale di funzionalità sul dispositivo è bassa: l'uso del dispositivo smette mai di valerne la pena?
Sì, e questa calcolatrice è progettata per mostrare esattamente dove si trova quella linea. Man mano che la percentuale di capacità sul dispositivo diminuisce, una parte maggiore della tua base utenti ricade nel segmento solo cloud, quindi la fattura mensile residua del cloud torna verso la linea di base del cloud puro mentre stai ancora pagando per ammortizzare il costo di installazione su di esso: a una percentuale di capacità sufficientemente bassa, l'approccio ibrido può costare più di quanto il cloud puro avrebbe mai avuto, non di meno. L'altra leva che conta altrettanto è il volume totale delle inferenze: lo stesso costo di installazione che si ripaga da solo in meno di un mese con 100.000 utenti attivi mensili può richiedere molti mesi, o effettivamente non raggiungere mai il pareggio nel corso della vita di un prodotto, con poche migliaia di utenti, perché semplicemente non ci sono abbastanza inferenze deviate dalla bolletta del cloud per recuperare i costi di costruzione. Prima di impegnare il budget di progettazione per una build su dispositivo, vale la pena collegare il tuo MAU effettivo e la tua migliore stima reale della capacità del dispositivo piuttosto che presumere che l'economia si riduca linearmente.
Perché esiste ancora una fattura cloud anche per gli utenti che utilizzano il dispositivo?
Perché in pratica la capacità sul dispositivo non è mai tutto o niente. Anche su un telefono che è pienamente in grado di eseguire il modello locale, una parte delle query deve ancora essere trasferita nel cloud: una query troppo complessa o troppo al di fuori dell'ambito del modello locale perché una versione compressa sul dispositivo possa gestirla bene, una situazione di batteria scarica o di limitazione termica in cui il sistema operativo limita l'elaborazione sul dispositivo, una finestra di avvio a freddo prima che la risorsa del modello locale abbia terminato il download dopo l'installazione o l'aggiornamento o semplicemente un'inferenza locale che restituisce un livello di confidenza basso e necessita di un modello cloud per essere completata. ricontrollalo. Questo calcolatore lo modella come una percentuale di fallback del cloud applicata solo alle query degli utenti abilitati sul dispositivo, oltre all'intera fattura del cloud ancora dovuta dagli utenti i cui dispositivi non possono eseguire affatto l'inferenza sul dispositivo, quindi la voce cloud residua nel totale ibrido non è mai pari a zero, anche a tassi di capacità del dispositivo molto elevati.
In che cosa differisce dal calcolatore LLM e API self-hosted già presente su questo sito?
Sia il calcolatore Self-Host vs API che il calcolatore LLM vs API self-hosted sono già presenti su questo modello di sito di self-hosting lato server: affittare la propria istanza GPU o cloud box ed eseguire l'inferenza da soli, rispetto al pagamento di un provider cloud per token o per chiamata: la forma del costo in entrambi i casi è ancora un server da qualche parte con una fattura di hosting, solo tua invece che di un fornitore. Questo calcolatore modella qualcosa di strutturalmente diverso: inferenza sul dispositivo lato client eseguita direttamente sull'hardware del telefono dell'utente finale, dove non è necessario noleggiare un server e il costo marginale per inferenza è effettivamente pari a zero una volta spedito il modello. Ciò che sostituisce la fattura di hosting in questo caso è un costo di progettazione una tantum per costruire e quantizzare il modello, ammortizzato nel corso di mesi, oltre a un tetto massimo sulla quantità di spesa per il cloud che puoi effettivamente deviare, fissato in base alla frazione di utenti che possiedono dispositivi sufficientemente capaci e alla frequenza con cui anche tali dispositivi devono ancora ricorrere al cloud.