Cada GPU a tus horas y cuenta
Costo mensual para el recuento de horas y GPU anterior: bajo demanda y al contado, en paralelo.
| GPU | VRAM | Bajo demanda $/h | Spot $/h | Mensual (tu nivel) |
|---|
Una GPU alquilada factura cada hora que está encendida
Lo que sorprende a los equipos que pasan de API a sus propias GPU es que el medidor nunca se detiene. Una API por token no cuesta nada cuando el tráfico es tranquilo; un H100 alquilado cuesta lo mismo ya sea que esté saturado o con un 2% de utilización, porque estás pagando por la hora, no por el trabajo. Es por eso que el factor más importante en tu factura no es la GPU que elijas, sino la cantidad horas lo mantienes funcionando. Un H100 que sólo necesitas ocho horas al día cuesta un tercio de uno que se deja encendido las 24 horas. Esta calculadora lo hace explícito: establezca las horas reales, no el máximo teórico, y observe cómo cambia el número mensual. El menú desplegable de configuración rápida cubre los patrones comunes: inferencia siempre activa, un cuadro de capacitación para el día laborable, ejecuciones por lotes de fin de semana.
El nivel es la segunda palanca. La capacidad bajo demanda está garantizada mientras la mantenga y tiene un precio superior; Las instancias spot, comunitarias e interrumpibles son capacidad sobrante que se vende entre un 20% y un 50% más barata, con el inconveniente de que el proveedor puede recuperarlas. Para capacitación con puntos de control o trabajos por lotes tolerantes a fallas, el lugar está cerca del dinero gratis; para un punto final de inferencia que no puede parpadear, la prima bajo demanda le proporciona estabilidad. La tabla muestra ambas tarifas para cada tarjeta, por lo que la compensación está frente a usted. Una vez que tenga el número de alquiler, la verdadera pregunta es si poseer horas de GPU realmente supera el pago por token; resuélvalo con el Calculadora LLM vs API autohospedada, luego valora el ancho de banda que sirve tu modelo con el calculadora de salida de la nube y la inferencia termina con el calculadora de costos de funciones sin servidor.
como usarlo
1. Elija su GPU: sus tarifas típicas bajo demanda y al contado se cargan automáticamente.
2. Elija bajo demanda o puntual y establezca cuántas GPU está ejecutando.
3. Configure las horas por mes o utilice el menú desplegable de configuración rápida para un ciclo de trabajo común.
4. Lea el costo mensual y el ahorro puntual, y compare cada GPU en la tabla.
Errores comunes
Suponiendo que esté siempre activo. 730 horas es el máximo, no su uso; la mayoría de las cargas de trabajo necesitan muchas menos horas. Olvidar las facturas de tiempos muertos. Una GPU que se deja funcionando entre trabajos todavía cuesta la tarifa completa; ciérrelo o use el escalado automático. Escoger la carta más grande. Un L4 o 4090 a menudo sirve para un modelo pequeño a una fracción del costo de un H100: haga coincidir la GPU con el modelo. Ignorando el almacenamiento y la salida. Los volúmenes, las instantáneas y la transferencia de datos son partidas separadas; agregue almacenamiento arriba y valore la salida por separado.
Estimación únicamente. Las tarifas de GPU cambian constantemente y varían según el proveedor y la región: verifique los precios en vivo antes de confiar en ellos.