Uso y precios de la nube
Capacidad y respaldo del dispositivo
—
ahorros mensuales frente a un enfoque híbrido en la nube pura en el dispositivo—% de ahorro
—línea base de nube pura / mes
—híbrido total / mes
Desglose de costos
| Línea de pedido | Inferencias / mes | Costo / mes |
| Línea base pura en la nube (100 % en la nube, sin dispositivo) | — | — |
| — usuarios solo en la nube (no compatibles con el dispositivo) | — | — |
| — respaldo de la nube por parte de usuarios con capacidad en el dispositivo | — | — |
| = Factura de nube híbrida | — | — |
| + Costo amortizado de instalación en el dispositivo | — | — |
| = Costo mensual total híbrido | — | — |
Punto de equilibrio sobre el costo único de instalación
—
Cómo se conecta esto con otras herramientas
Dos calculadoras que ya están en este sitio valoran una decisión relacionada pero estructuralmente diferente. El Calculadora de costos de autohospedaje frente a API y el Calculadora LLM autohospedada frente a API ambos modelos lado del servidor Autohospedaje: alquilar su propia GPU o instancia en la nube y ejecutar inferencias allí usted mismo, en comparación con pagar a un proveedor por token o por llamada. La forma de costo en ambos sigue siendo la de un servidor en algún lugar con una factura de alojamiento real, solo una que usted controla en lugar de la de un proveedor. En cambio, esta calculadora modela lado del cliente inferencia en el dispositivo que se ejecuta directamente en el hardware del teléfono del usuario final: no hay que alquilar un servidor, efectivamente hay un costo marginal cero por inferencia una vez que se envía el modelo y un cuello de botella completamente diferente: no las horas de GPU, sino qué fracción de sus usuarios poseen dispositivos con suficiente capacidad y con qué frecuencia incluso esos dispositivos aún necesitan recurrir a la nube. Si está decidiendo entre alquilar una GPU y pagar una API en la nube, utilice las calculadoras autohospedadas; Si está decidiendo si desea enviar un modelo cuantificado dentro de su aplicación móvil, este es el que coincide con esa forma de costo.
leyendo los numeros
Según los valores predeterminados (100.000 usuarios activos mensuales, 50 inferencias por usuario por día, 0,001 dólares por inferencia en la nube, una construcción única en el dispositivo de 40.000 dólares, el 60% de los usuarios en dispositivos capaces, una tasa de respaldo de la nube del 5% para esos usuarios capaces, amortizado en 12 meses), la línea de base de nube pura cuesta $150.000/mes. La opción híbrida reduce la factura residual de la nube a $64 500/mes (60 000 000 de inferencias de usuarios exclusivos de la nube más 4 500 000 inferencias alternativas de usuarios capaces), agrega aproximadamente $3333/mes en costos de instalación amortizados y aterriza en un total híbrido cercano a $67 833/mes: un ahorro de alrededor de $82 167/mes, o aproximadamente 55% de descuento en la línea base puramente en la nube. El costo de instalación de $40,000 en sí mismo se equilibra en menos de medio mes con este volumen, porque el gasto mensual en la nube que desvía (alrededor de $85,500/mes) eclipsa el costo único de construcción casi de inmediato. Esas matemáticas cambian rápidamente a menor escala: ejecute las mismas entradas con 5.000 usuarios en lugar de 100.000 y el punto de equilibrio se extiende a aproximadamente 20 veces más (alrededor de 9,4 meses en lugar de menos de medio mes) porque simplemente no hay suficientes inferencias desviadas por mes para recuperar el costo de construcción rápidamente. Conecte la MAU real de su aplicación, no una aspiracional, antes de comprometer el presupuesto de ingeniería para una compilación en el dispositivo.
Calculadora de costos de autohospedaje frente a APICalculadora LLM autohospedada frente a APICalculadora de costos de inferencia de GPUEstimador de costos de aplicaciones de IA
Cómo funciona esta calculadora
El Calculadora de inferencia de IA en el dispositivo o en el borde frente a API en la nube Primero calcula una línea base de nube pura: inferencias por usuario por día × usuarios activos mensuales × 30, con un precio según su tarifa de nube por inferencia: esto es lo que pagaría sin ningún modelo en el dispositivo. Luego divide su base de usuarios en porcentaje de capacidad en el dispositivo en usuarios capaces y usuarios exclusivos de la nube. Los usuarios que solo utilizan la nube generan una factura completa por cada una de sus inferencias, ya que sus dispositivos no pueden ejecutar el modelo local en absoluto. Los usuarios con capacidad en el dispositivo en su mayoría realizan inferencias localmente a un costo marginal efectivamente nulo, excepto por un porcentaje de respaldo de la nube de sus consultas (demasiado complejas, con poca batería, un arranque en frío antes de que el modelo local termine de descargarse o un resultado local de baja confianza) que aún se facturan contra la API de la nube.
Deliberadamente, esta calculadora no Ponga una cifra en dólares en el cálculo del dispositivo, el consumo de batería o la huella de almacenamiento en sí: trata el costo marginal de una inferencia local como cero una vez que el modelo se ha enviado. Esta es una simplificación realista para modelos pequeños y bien cuantificados que se ejecutan en chips emblemáticos modernos, donde el costo incremental de batería y cómputo por inferencia es insignificante en comparación con una factura de API en la nube. Subestima el costo real para modelos muy grandes en dispositivos o dispositivos más antiguos o de gama baja, donde la limitación térmica, el consumo de batería y la presión de almacenamiento son costos reales (aunque difíciles de valorar en dólares) que vale la pena sopesar por separado. Las inferencias residuales de solo nube y de respaldo de la nube se resumen en un factura de nube híbrida, entonces el costo único de configuración en el dispositivo (ingeniería, cuantificación, envío) se divide por la ventana de amortización elegida y se agrega en la parte superior para obtener el costo mensual total híbrido. Al comparar eso con la línea de base pura de la nube, se obtienen los ahorros mensuales y el porcentaje de ahorro, mientras se divide el costo de instalación por el mensual el gasto en la nube que se desvía (la factura de la nube pura menos la de la nube híbrida, ignorando la amortización) proporciona la solución independiente punto de equilibrio en meses – qué tan rápido se amortiza la construcción única solo con los ahorros en la nube.
Preguntas frecuentes
¿Por qué la inferencia en el dispositivo tiene un costo único en lugar de un costo por inferencia como las API en la nube?
Porque la parte costosa de la inferencia en el dispositivo es construirla, no ejecutarla. Cuantificar un modelo hasta un tamaño que quepa en un teléfono, convertirlo a Core ML o a formato TensorFlow Lite/NNAPI, probarlo en distintos niveles de dispositivos y enviarlo dentro del binario de la aplicación o como un activo descargable es un proyecto de ingeniería fijo con un precio fijo, que se paga una vez, independientemente de si un usuario o diez millones de usuarios terminan ejecutándolo. En cambio, una API en la nube factura por solicitud porque el tiempo de GPU del proveedor es un costo marginal real en cada llamada. Una vez que el modelo en el dispositivo se cuantifica y envía, ejecutar una inferencia más en el propio teléfono de un usuario no le cuesta al propietario de la aplicación esencialmente nada más que una pequeña parte de la batería y la computación del usuario (sin servidor, sin factura por llamada), que es exactamente lo que convierte el costo único de configuración en algo que vale la pena amortizar durante meses en lugar de gastarlo por llamada.
¿Qué sucede si mi porcentaje de capacidad en el dispositivo es bajo? ¿Alguna vez deja de valer la pena el uso en el dispositivo?
Sí, y esta calculadora está diseñada para mostrar exactamente dónde está esa línea. A medida que cae el porcentaje de capacidad en el dispositivo, una mayor parte de su base de usuarios vuelve a caer en el grupo de solo nube, por lo que la factura mensual residual de la nube vuelve a subir hacia la línea base de nube pura mientras usted todavía está pagando para amortizar el costo de instalación además de eso; con un porcentaje de capacidad suficientemente bajo, el enfoque híbrido puede costar más de lo que costaría la nube pura, no menos. La otra palanca que importa tanto es el volumen total de inferencias: el mismo costo de instalación que se amortiza en menos de un mes con 100.000 usuarios activos mensuales puede tardar muchos meses, o efectivamente nunca alcanzar el punto de equilibrio dentro de la vida útil de un producto, con unos pocos miles de usuarios, porque simplemente no hay suficientes inferencias desviadas de la factura de la nube para recuperar el costo de construcción. Antes de comprometer el presupuesto de ingeniería para la construcción del dispositivo, vale la pena ingresar su MAU real y su mejor estimación real de la capacidad del dispositivo en lugar de asumir que la economía se reduce linealmente.
¿Por qué todavía hay una factura de la nube incluso para los usuarios que ejecutan el dispositivo?
Porque la capacidad del dispositivo nunca es todo o nada en la práctica. Incluso en un teléfono que es totalmente capaz de ejecutar el modelo local, una fracción de las consultas aún necesita ir a la nube: una consulta demasiado compleja o demasiado fuera del alcance del modelo local para que una versión comprimida en el dispositivo pueda manejarla bien, una situación de batería baja o de aceleración térmica en la que el sistema operativo restringe la computación en el dispositivo, una ventana de inicio en frío antes de que el activo del modelo local haya terminado de descargarse después de la instalación o actualización, o simplemente una inferencia local que resulta con poca confianza y necesita un modelo en la nube. para volver a comprobarlo. Esta calculadora modela eso como un porcentaje de respaldo de la nube que se aplica solo a las consultas de los usuarios con capacidad en el dispositivo, además de la factura completa de la nube que aún deben los usuarios cuyos dispositivos no pueden ejecutar inferencia en el dispositivo en absoluto, por lo que la partida residual de la nube en el total híbrido nunca es cero, incluso con tasas de capacidad de dispositivo muy altas.
¿En qué se diferencia de la calculadora LLM vs API autohospedada que ya se encuentra en este sitio?
Tanto la Calculadora Self-Host vs API como la Calculadora Self-Hosted LLM vs API que ya están en este sitio modelan el autohospedaje del lado del servidor: alquilar su propia instancia de GPU o caja de nube y ejecutar la inferencia allí usted mismo, en comparación con pagar a un proveedor de nube por token o por llamada; la forma del costo en ambos casos sigue siendo un servidor en algún lugar con una factura de hosting, solo suya en lugar de la de un proveedor. Esta calculadora modela algo estructuralmente diferente: inferencia del lado del cliente en el dispositivo que se ejecuta directamente en el hardware del teléfono del usuario final, donde no hay ningún servidor para alquilar y el costo marginal por inferencia es efectivamente cero una vez que se envía el modelo. Lo que reemplaza la factura de alojamiento aquí es un costo único de ingeniería para construir y cuantificar el modelo, amortizado a lo largo de meses, más un límite máximo sobre cuánto gasto en la nube realmente puede desviar, establecido por qué fracción de sus usuarios poseen dispositivos suficientemente capaces y con qué frecuencia incluso esos dispositivos aún necesitan recurrir a la nube.