—
ahorros al utilizar el alquiler de GPU frente a la API administrada—costo del proveedor administrado
—Costo de alquiler de GPU
—Horas de GPU necesarias
Tarifas de proveedores administrados versus alquiler de GPU, según el tamaño de su conjunto de datos
El mismo recuento de tokens de entrenamiento que el anterior (conjunto de datos × tokens promedio × épocas), con un precio según la tarifa LoRA publicada de cada proveedor administrado, junto a la configuración de alquiler de GPU.
| Opción | Tasa | Costo de capacitación |
|---|
Costo por tamaño del conjunto de datos
Todo lo demás se mantuvo en los valores anteriores, barriendo el tamaño del conjunto de datos (ejemplos de capacitación), comparando la tarifa administrada seleccionada con la configuración de alquiler de GPU. La fila resaltada es la más cercana al tamaño actual de su conjunto de datos.
| Ejemplos | Fichas de entrenamiento | Costo gestionado | costo de la GPU | Opción más barata |
|---|
Cómo se conecta esto con otras herramientas
Esta calculadora valora una decisión específica: si pagar la tarifa por token de un proveedor administrado por el entrenamiento LoRA/QLoRA, o alquilar una GPU usted mismo y ejecutar el trabajo directamente. Si tu trabajo es un lleno ajustar (actualizar cada parámetro, no un pequeño conjunto de adaptadores de bajo rango) es una forma de costo completamente diferente, cuyo precio se compara con las tarifas de tokens de entrenamiento de OpenAI, Google y Mistral en el sitio web. calculadora de costos de ajuste; Para conocer el costo completo de ajuste entre esos proveedores, consulte esa herramienta en lugar de esta. Si está sopesando el ajuste fino en lugar de simplemente solicitar un modelo base, el Calculadora rápida vs de ajuste fino y RAG vs ajuste fino Las páginas cubren esa decisión anterior. Y una vez que se entrena un modelo sintonizado con LoRA, servirlo a largo plazo es su propia cuestión de construir versus comprar: el Calculadora LLM vs API autohospedada valora esa decisión de inferencia continua de la misma manera que esta página valora la decisión de capacitación única.
Cómo funciona esta calculadora
El Ajuste de LoRA / QLoRA: API administrada frente a calculadora de alquiler de GPU parte de la carga de trabajo total de formación: tamaño del conjunto de datos (ejemplos de entrenamiento) × tokens promedio por ejemplo × épocas da el total fichas de entrenamiento el trabajo tiene que procesarse; en los valores predeterminados, 50.000 × 512 × 2 son 51.200.000 tokens de entrenamiento. En el lado administrado, ese recuento de tokens se divide por 1.000.000 y se multiplica por el proveedor seleccionado. tasa por 1 millón de tokens de entrenamiento da el costo del proveedor administrado – $ 24,58 en el valor predeterminado de Together AI. En el lado del alquiler de GPU, el mismo recuento de tokens de entrenamiento dividido por (rendimiento del entrenamiento en tokens/seg × 3600) da el Horas de GPU necesario, que multiplicado por el Tasa de GPU por hora proporciona el coste de cálculo bruto; agregando horas de instalación × tu tarifa por hora (opcional, $0 por defecto) proporciona el total Costo de alquiler de GPU – alrededor de $1,79 en el valor predeterminado del A100 con un costo de instalación de $0.
Restar el costo de la GPU del costo administrado da como resultado ahorros alquilar una GPU usted mismo, y dividir eso por el costo administrado da el brecha de costos porcentaje: aproximadamente un 92,7% más barato mediante el alquiler de GPU en los valores predeterminados. Esto puede resultar negativo: si su estimación de rendimiento es demasiado baja, su velocidad de GPU demasiado alta o establece una tarifa por hora distinta de cero para suficientes horas de configuración, la API administrada puede resultar más barata, y esta calculadora muestra eso honestamente, en lugar de asumir que el bricolaje siempre gana. El rendimiento del entrenamiento El campo es la entrada más sensible: varía enormemente según el recuento de parámetros del modelo, por lo que el valor predeterminado de 15.000 tokens/seg es sólo una estimación inicial; reemplácelo con un número comparado con el tamaño real de su modelo y GPU antes de confiar en la producción en dólares para una decisión presupuestaria real.
Preguntas frecuentes
¿Es más barato el ajuste de LoRA a través de API o alquilando una GPU?
En tamaños de conjuntos de datos típicos, alquilar una GPU usted mismo y ejecutar el trabajo de capacitación LoRA/QLoRA directamente suele ser mucho más barato en términos de dólares brutos que pagar la tarifa de capacitación por token de un proveedor administrado. Con los valores predeterminados de esta calculadora (50.000 ejemplos, 512 tokens/ejemplo, 2 épocas), un trabajo LoRA administrado en Together AI ($0,48 por 1 millón de tokens de entrenamiento) cuesta alrededor de $24,58, mientras que los mismos 51,2 millones de tokens de entrenamiento en un A100 de 80 GB alquilado a $1,89/h y un rendimiento de 15.000 tokens/seg cuesta aproximadamente $1,79: más del 90 % menos. Pero esa brecha es una comparación bruta del costo de cómputo, no una comparación total del costo total de propiedad: no incluye el tiempo que dedica a configurar el canal de capacitación, manejar los puntos de control o depurar fallas, nada de lo cual una API administrada le obliga a hacer. Si el alquiler de GPU es realmente más barato para usted depende de cuánto valore ese tiempo de configuración, razón por la cual esta calculadora tiene un campo de horas de configuración opcional que puede elevar por encima de cero para ver cómo cambia la imagen.
¿Qué GPU necesito para ajustar LoRA?
Para la mayoría de los trabajos LoRA/QLoRA en modelos con parámetros de hasta aproximadamente 13B-34B, una sola GPU de 80 GB (una A100 de 80 GB o una H100 de 80 GB) es suficiente, porque LoRA solo entrena un pequeño conjunto de pesos de adaptadores de bajo rango agregados en lugar del modelo completo, y QLoRA cuantifica los pesos base congelados a 4 bits para reducir aún más la memoria, por lo que todo el trabajo cabe en una tarjeta en lugar del clúster de múltiples GPU. Se necesitaría un ajuste completo. Los modelos base más grandes o las ventanas de contexto más largas aumentan las necesidades de memoria y pueden requerir un tamaño de lote más pequeño, una cuantificación más agresiva o una GPU más grande, y el rendimiento de entrenamiento real (tokens/segundo) varía mucho según el recuento de parámetros. Esta calculadora tiene como valor predeterminado 15,000 tokens/seg como estimación ilustrativa, pero debes ajustarla a un número comparado con el tamaño de tu propio modelo y GPU antes de confiar en la producción en dólares.
¿Por qué existe una diferencia de costes tan grande entre la gestión gestionada y el bricolaje?
Las API de entrenamiento de LoRA administradas, como Together AI y Fireworks, no solo facturan por segundos de GPU sin procesar: la tarifa por token incluye confiabilidad de la infraestructura, orquestación de trabajos, puntos de control automáticos, colas y reintentos, y un equipo de soporte al que puede escalar si una ejecución de entrenamiento falla a la mitad, nada de lo cual usted mismo puede alquilar una instancia de GPU desnuda. Ese paquete conlleva un margen real sobre el costo de computación subyacente, y debido a que un A100 o H100 alquilado facturado por horas no tiene ese margen de beneficio más allá del propio margen del proveedor de la nube, la brecha entre los dos puede parecer enorme cuando solo se compara la línea de costo de computación. La advertencia honesta es que el bricolaje no es gratuito en la forma en que lo hace parecer la comparación: alguien tiene que escribir y depurar el script de capacitación, administrar los puntos de control y manejar fallas sin una línea de soporte a la que llamar, lo cual es en tiempo real incluso si nunca aparece como un cargo por token.
¿Cuál es la diferencia entre LoRA y el costo total de ajuste?
El ajuste completo actualiza cada parámetro en el modelo, razón por la cual nuestra calculadora de ajuste completo modela el costo de entrenamiento como tokens de conjuntos de datos multiplicados por épocas multiplicados por una tasa de entrenamiento del proveedor además de un modelo base que está modificando por completo, y generalmente necesita suficiente memoria de GPU (o presupuesto de entrenamiento administrado) para mantener los gradientes y el estado del optimizador para todo el recuento de parámetros, lo cual es costoso en cualquier tamaño de modelo real. En cambio, LoRA y QLoRA congelan el modelo base y entrenan una pequeña cantidad de pesos de adaptadores de bajo rango agregados, por lo que la huella de cómputo y memoria (y por lo tanto el costo, tanto en el lado de la API administrada como del alquiler de GPU) es una pequeña fracción del ajuste completo para un conjunto de datos comparable. Es por eso que esta calculadora y la calculadora de ajuste completo utilizan diferentes formas de costos: el precio del ajuste completo se basa principalmente en las tarifas de capacitación del proveedor porque el ajuste completo hecho por usted mismo rara vez es práctico en una sola GPU alquilada, mientras que LoRA/QLoRA es barato y lo suficientemente pequeño como para que alquilar una sola GPU usted mismo se convierta en una alternativa realista, a menudo mucho más barata, a una API administrada.