—
economia usando aluguel de GPU versus API gerenciada—custo do provedor gerenciado
—Custo de aluguel de GPU
—Horas de GPU necessárias
Taxas de provedor gerenciadas versus aluguel de GPU, no tamanho do seu conjunto de dados
A mesma contagem de tokens de treinamento acima (conjunto de dados × tokens médios × épocas), com preço em relação à taxa LoRA publicada de cada provedor gerenciado, próximo às configurações de aluguel de GPU.
| Opção | Avaliar | Custo de treinamento |
|---|
Custo por tamanho do conjunto de dados
Todo o resto mantido nos valores acima foi analisado pelo tamanho do conjunto de dados (exemplos de treinamento), comparando a taxa gerenciada selecionada com as configurações de aluguel de GPU. A linha destacada está mais próxima do tamanho atual do conjunto de dados.
| Exemplos | Tokens de treinamento | Custo gerenciado | Custo da GPU | Opção mais barata |
|---|
Como isso se conecta a outras ferramentas
Esta calculadora avalia uma decisão específica: pagar a taxa por token de um provedor gerenciado para treinamento LoRA/QLoRA ou alugar você mesmo uma GPU e executar o trabalho diretamente. Se o seu trabalho é um completo ajuste fino - atualizando todos os parâmetros, não um pequeno conjunto de adaptadores de baixa classificação - esse é um formato de custo totalmente diferente, com preço em relação às taxas de token de treinamento da OpenAI, Google e Mistral no calculadora de custos de ajuste fino; para obter o custo total de ajuste fino entre esses provedores, consulte essa ferramenta em vez desta. Se você está avaliando o ajuste fino em vez de apenas solicitar um modelo básico, o calculadora de prompt vs ajuste fino e RAG vs ajuste fino as páginas cobrem essa decisão anterior. E uma vez treinado um modelo ajustado para LoRA, atendê-lo a longo prazo é a sua própria questão de construção versus compra – a calculadora LLM vs API auto-hospedada avalia essa decisão de inferência contínua da mesma forma que esta página avalia a decisão de treinamento única.
Como funciona esta calculadora
O Ajuste fino de LoRA / QLoRA: API gerenciada vs calculadora de aluguel de GPU começa a partir da carga total de treinamento: tamanho do conjunto de dados (exemplos de treinamento) × média de tokens por exemplo × épocas dá o total fichas de treinamento o trabalho deve ser processado - nos padrões, 50.000 × 512 × 2 equivalem a 51.200.000 tokens de treinamento. No lado gerenciado, essa contagem de tokens dividida por 1.000.000 e multiplicada pelo provedor selecionado taxa por 1 milhão de tokens de treinamento dá o custo do provedor gerenciado – $ 24,58 no padrão Together AI. No lado do aluguel de GPU, a mesma contagem de tokens de treinamento dividida por (rendimento de treinamento em tokens/seg × 3.600) dá o Horas de GPU necessário, que multiplicado pelo Taxa de GPU por hora fornece o custo bruto de computação; adicionando horas de configuração × sua taxa horária (opcional, $0 por padrão) fornece o valor completo Custo de aluguel de GPU – cerca de US$ 1,79 no padrão A100 com custo de configuração de US$ 0.
Subtrair o custo da GPU do custo gerenciado dá ao poupança alugar você mesmo uma GPU e dividir isso pelo custo gerenciado dá o lacuna de custo porcentagem – cerca de 92,7% mais barato por meio do aluguel de GPU nos padrões. Isso pode ser negativo: se sua estimativa de rendimento for muito baixa, sua taxa de GPU muito alta ou você definir uma taxa horária diferente de zero para horas de configuração suficientes, a API gerenciada pode sair mais barata, e esta calculadora mostra isso honestamente, em vez de presumir que o DIY sempre vence. O rendimento de treinamento field é a entrada mais sensível — varia enormemente de acordo com a contagem de parâmetros do modelo, portanto, o padrão de 15.000 tokens/s é apenas uma estimativa inicial; substitua-o por um número comparado ao tamanho real do seu modelo e GPU antes de confiar na produção em dólares para uma decisão orçamentária real.
Perguntas frequentes
O ajuste fino do LoRA é mais barato via API ou alugando uma GPU?
Em tamanhos típicos de conjuntos de dados, alugar você mesmo uma GPU e executar o trabalho de treinamento LoRA/QLoRA diretamente geralmente é muito mais barato em termos de dólares brutos do que pagar a taxa de treinamento por token de um provedor gerenciado. Nos padrões desta calculadora (50.000 exemplos, 512 tokens/exemplo, 2 épocas), um trabalho LoRA gerenciado no Together AI (US$ 0,48 por 1 milhão de tokens de treinamento) custa cerca de US$ 24,58, enquanto os mesmos 51,2 milhões de tokens de treinamento em um A100 80GB alugado a US$ 1,89/h e taxa de transferência de 15.000 tokens/s custam cerca de US$ 1,79 – mais de 90% menos. Mas essa lacuna é uma comparação bruta de custos de computação, não um custo total de propriedade completo: ela não inclui seu tempo configurando o pipeline de treinamento, lidando com pontos de verificação ou depuração de falhas, nada disso que uma API gerenciada obriga você a fazer. Se o aluguel da GPU é realmente mais barato para você depende de quanto você valoriza esse tempo de configuração, e é por isso que esta calculadora tem um campo opcional de horas de configuração que você pode elevar acima de zero para ver a mudança de imagem.
Qual GPU eu preciso para o ajuste fino do LoRA?
Para a maioria dos trabalhos LoRA / QLoRA em modelos com parâmetros de aproximadamente 13B-34B, uma única GPU de 80 GB - um A100 80 GB ou H100 80 GB - é suficiente, porque LoRA treina apenas um pequeno conjunto de pesos de adaptador de baixa classificação adicionados em vez do modelo completo, e QLoRA quantiza os pesos básicos congelados em 4 bits para reduzir ainda mais a memória, para que todo o trabalho caiba em uma placa em vez do cluster multi-GPU completo seria necessário um ajuste fino. Modelos básicos maiores ou janelas de contexto mais longas aumentam as necessidades de memória e podem exigir um tamanho de lote menor, quantização mais agressiva ou uma GPU maior, e a taxa de transferência de treinamento real (tokens/segundo) varia muito de acordo com a contagem de parâmetros. O padrão desta calculadora é 15.000 tokens/seg como uma estimativa ilustrativa, mas você deve ajustá-la para um número comparado ao tamanho do seu próprio modelo e GPU antes de confiar na produção em dólares.
Por que existe uma diferença de custos tão grande entre o gerenciado e o DIY?
APIs de treinamento LoRA gerenciadas, como Together AI e Fireworks, não cobram apenas por segundos brutos de GPU - a taxa por token agrupa confiabilidade de infraestrutura, orquestração de trabalho, pontos de verificação automáticos, filas e novas tentativas, e uma equipe de suporte para a qual você pode escalar se uma execução de treinamento falhar no meio, nenhum dos quais você mesmo aluga uma instância de GPU simples. Esse pacote carrega uma margem real sobre o custo de computação subjacente, e como um A100 ou H100 alugado cobrado por hora não tem tal marcação além da margem do próprio provedor de nuvem, a diferença entre os dois pode parecer enorme quando você compara apenas a linha de custo de computação. A ressalva honesta é que o DIY não é gratuito da maneira que a comparação faz parecer - alguém tem que escrever e depurar o script de treinamento, gerenciar pontos de verificação e lidar com falhas sem linha de suporte para ligar, o que é em tempo real, mesmo que nunca apareça como uma cobrança por token.
Qual é a diferença entre LoRA e custo total de ajuste fino?
O ajuste fino completo atualiza todos os parâmetros do modelo, e é por isso que nossa calculadora de ajuste fino completo modela o custo de treinamento como tokens de conjunto de dados vezes épocas vezes uma taxa de treinamento do provedor em cima de um modelo base que você está modificando inteiramente - e normalmente precisa de memória GPU suficiente (ou orçamento de treinamento gerenciado) para manter gradientes e estado do otimizador para toda a contagem de parâmetros, o que é caro em qualquer tamanho real de modelo. Em vez disso, LoRA e QLoRA congelam o modelo básico e treinam um pequeno número de pesos de adaptador de baixa classificação adicionados, de modo que o consumo de computação e memória – e, portanto, o custo, tanto no lado da API gerenciada quanto no aluguel de GPU – é uma pequena fração do ajuste fino completo para um conjunto de dados comparável. É por isso que esta calculadora e a calculadora de ajuste fino completo usam formas de custo diferentes: o preço do ajuste fino completo é cobrado principalmente de acordo com as taxas de treinamento do fornecedor porque o ajuste fino completo DIY raramente é prático em uma única GPU alugada, enquanto LoRA/QLoRA é barato e pequeno o suficiente para que o aluguel de uma única GPU se torne uma alternativa realista, muitas vezes muito mais barata, a uma API gerenciada.