Utilisation et tarification du cloud

Capacité de l'appareil et solution de repli

économies mensuelles par rapport à une approche hybride sur appareil en cloud pur
% d'économies
référence de cloud pur / mois
hybride total / mois

Répartition des coûts

Élément de campagneInférences / moisCoût / mois
Base de référence purement cloud (100 % cloud, pas sur l'appareil)
— utilisateurs cloud uniquement (non compatibles avec l'appareil)
— solution de secours dans le cloud pour les utilisateurs disposant de capacités sur l'appareil
= Facture cloud hybride
+ Coût d'installation amorti sur l'appareil
= Coût mensuel total hybride
Seuil de rentabilité sur le coût d'installation unique

Comment cela se connecte à d'autres outils

Deux calculateurs déjà présents sur ce site évaluent une décision similaire mais structurellement différente. Le Calculateur de coût d'auto-hébergement et d'API et le Calculateur LLM auto-hébergé vs API les deux modèles côté serveur auto-hébergement : louer votre propre GPU ou instance cloud et y exécuter vous-même l'inférence, par rapport au paiement d'un fournisseur par jeton ou par appel. Dans les deux cas, le coût est toujours celui d'un serveur quelque part avec une vraie facture d'hébergement, un seul que vous contrôlez au lieu de celui d'un fournisseur. Cette calculatrice modélise à la place côté client l'inférence sur l'appareil s'exécutant directement sur le matériel téléphonique de l'utilisateur final : pas de serveur à louer, un coût marginal par inférence effectivement nul une fois le modèle livré, et un goulot d'étranglement complètement différent : pas d'heures GPU, mais quelle fraction de vos utilisateurs possède des appareils suffisamment performants et à quelle fréquence même ces appareils doivent encore recourir au cloud. Si vous hésitez entre louer un boîtier GPU et payer une API cloud, utilisez les calculatrices auto-hébergées ; si vous décidez d'expédier un modèle quantifié dans votre application mobile elle-même, c'est celui qui correspond à cette forme de coût.

Lire les chiffres

Avec les valeurs par défaut : 100 000 utilisateurs actifs mensuels, 50 inférences par utilisateur et par jour, 0,001 $ par inférence cloud, une version unique de 40 000 $ sur l'appareil, 60 % des utilisateurs sur des appareils compatibles, un taux de repli du cloud de 5 % sur ces utilisateurs capables, amorti sur 12 mois - la base de référence du cloud pur s'élève à 150 000 $/mois. Le passage à l'hybride ramène la facture cloud résiduelle à 64 500 $/mois (60 000 000 d'inférences provenant d'utilisateurs cloud uniquement plus 4 500 000 inférences de secours d'utilisateurs capables), ajoute environ 3 333 $/mois en coût de configuration amorti et aboutit à un total hybride proche de 67 833 $/mois, soit une économie d'environ 82 167 $/mois, soit environ 55 % de réduction sur la base de référence du cloud pur. Le coût d'installation de 40 000 $ lui-même atteint le seuil de rentabilité en moins d'un demi-mois à ce volume, car les dépenses mensuelles dans le cloud qu'il détourne (environ 85 500 $/mois) éclipsent presque immédiatement le coût de construction unique. Ce calcul change rapidement à petite échelle : exécutez les mêmes entrées sur 5 000 utilisateurs au lieu de 100 000 et le seuil de rentabilité s'étend jusqu'à environ 20 fois plus longtemps – environ 9,4 mois au lieu de moins d'un demi-mois – parce qu'il n'y a tout simplement pas suffisamment d'inférences détournées par mois pour récupérer rapidement le coût de construction. Branchez le véritable MAU de votre application, et non un objectif ambitieux, avant d'engager un budget d'ingénierie dans une version sur l'appareil.

Hébergez votre projet :DigitalOcean — 200 $ gratuits ↗VPS Hostinger
Calculateur de coût d'auto-hébergement et d'APICalculateur LLM auto-hébergé vs APICalculateur de coût d'inférence GPUEstimateur du coût des applications IA