Como funciona o preço da API LLM

Tokens, entrada versus saída, janelas de contexto - por que a mesma tarefa pode custar 50 vezes mais em um modelo do que em outro, explicado de forma simples.

LarAprender › Quanto custa realmente o ajuste fino

Quanto custa realmente o ajuste fino

O ajuste fino, o treinamento adicional de um modelo básico com base em seus próprios exemplos, costuma ser apresentado como a maneira de tornar um modelo de IA verdadeiramente seu. O que é encoberto é o custo, que vem em várias partes, algumas óbvias e outras ocultas. Este guia detalha o que você realmente paga, para que você possa avaliar se é melhor simplesmente escrever um prompt melhor.

O ajuste fino tem três camadas de custos

O custo total do ajuste fino não é um número único. Ele se divide em três partes distintas:

  • Custo de treinamento, uma cobrança única para executar o trabalho de ajuste fino, geralmente cobrada por token no conjunto de dados de treinamento, às vezes multiplicada pelo número de passagens (épocas) nos dados.
  • Custo de inferência, o que você paga cada vez que liga para o modelo ajustado posteriormente. Isso é frequentemente maior por token do que o modelo básico.
  • Custo de preparação de dados, o esforço humano para construir, limpar e formatar um conjunto de treinamento de alta qualidade. Muitas vezes, este é o custo mais elevado e não aparece em nenhuma fatura.

Ignorar qualquer um deles leva a uma surpresa desagradável mais tarde.

A taxa de treinamento

O treinamento é cobrado de acordo com o volume de dados que você alimenta. Se o seu conjunto de dados tiver 1 milhão de tokens e o modelo treinar por 3 épocas, você será cobrado como se tivesse processado 3 milhões de tokens na taxa de treinamento. Portanto, tanto o tamanho do conjunto de dados quanto a contagem de épocas determinam a conta.

Aqui está um exemplo ilustrativo (taxa inventada). A um preço de treinamento de US$ 8 por milhão de tokens, um conjunto de dados de 1 milhão de tokens em 3 épocas custa 3 x US$ 8 = US$ 24 para a execução de treinamento. Essa parte costuma ser mais barata do que as pessoas esperam. O problema é o que vem depois.

O prêmio de inferência contínuo

A execução de um modelo ajustado geralmente custa mais por token do que o modelo básico a partir do qual foi construído. Este é o custo que nunca para. Se você fizer milhões de ligações por mês, uma taxa de inferência mais alta poderá diminuir muitas vezes a taxa única de treinamento.

Exemplo ilustrativo: se um modelo básico custa US$ 1 por milhão de tokens de entrada, mas a versão ajustada custa US$ 3 por milhão, então, em alto volume, você estará pagando o triplo por cada chamada, para sempre. Antes do ajuste fino, sempre modele o custo de inferência contínua de acordo com o volume de chamadas esperado, e não apenas com o custo de treinamento. A calculadora de custos do LLM e as páginas de comparação de modelos ajudam você a colocar lado a lado a taxa básica e uma taxa ajustada.

O custo oculto: preparação de dados

A qualidade do ajuste fino vive ou morre nos dados de treinamento. Normalmente, você precisa de centenas a milhares de pares de exemplos de alta qualidade, cada um mostrando a entrada e a saída ideal. Produzir esses exemplos e revisá-los quanto à correção e consistência é um trabalho humano qualificado que pode levar dias ou semanas.

Este esforço raramente aparece nas estimativas de custos, mas é muitas vezes a maior despesa real. Um ajuste fino treinado em dados confusos ou inconsistentes pode ter um desempenho pior do que o modelo básico, o que significa que você pagou pelo treinamento e recebeu um downgrade. Reserve um tempo humano realista para a curadoria de dados ou não comece.

Quando o ajuste fino vale a pena e quando não vale

O ajuste fino tende a compensar quando você precisa de um estilo, formato ou comportamento consistente isso é difícil de especificar em um prompt, quando você deseja encurtar os prompts (um modelo ajustado pode não precisar de instruções ou exemplos longos, salvando tokens de entrada em cada chamada) ou quando você tem uma tarefa restrita e de alto volume onde um modelo menor e ajustado pode substituir um modelo maior e caro.

Geralmente não vale a pena quando sua tarefa muda com frequência (cada mudança significa reciclagem), quando você tem poucos bons exemplos ou quando a solicitação cuidadosa e a recuperação já levam você até lá. Para a maioria das equipes, o primeiro passo honesto é esgotar os prompts e o cache de prompts antes de fazer o ajuste fino.

Compare o custo total de ambos os caminhos

A comparação justa é o custo total ao longo do seu horizonte de uso real. Caminho A: modelo básico com prompt mais longo e cuidadosamente projetado, tokens de entrada por chamada mais altos, mas sem custo de treinamento e taxas de inferência padrão. Caminho B: modelo ajustado com prompts mais curtos, mas com carga de treinamento e taxa de inferência mais alta.

Some cada caminho ao longo de, digamos, um ano de ligações esperadas. Às vezes, os prompts mais curtos de um ajuste fino vencem; muitas vezes, o caminho do modelo básico com bom prompt é mais barato e muito mais flexível. Execute ambos na calculadora de custos do LLM usando suas próprias contagens de tokens antes de confirmar, porque a resposta muda dependendo do volume.

Perguntas frequentes

O ajuste fino é um custo único?

O treinamento é uma cobrança única, mas o modelo ajustado geralmente custa mais por token para ser executado do que o modelo básico, então você continua pagando um prêmio em cada chamada enquanto o usar.

De quantos dados de treinamento eu preciso?

Depende da tarefa, mas centenas a alguns milhares de pares de exemplos de alta qualidade é um intervalo comum. A qualidade e a consistência são muito mais importantes do que a quantidade bruta, e a preparação desses dados costuma ser o maior custo real.

Devo ajustar ou apenas melhorar meu prompt?

Tente solicitar, exemplos de poucas cenas e recuperação primeiro. O ajuste fino vale a pena principalmente para formatação consistente ou tarefas estreitas de alto volume, onde prompts mais curtos compensam a taxa de inferência mais alta.

Apenas educacional – não aconselhamento financeiro.