Como funciona o preço da API LLM

Tokens, entrada versus saída, janelas de contexto - por que a mesma tarefa pode custar 50 vezes mais em um modelo do que em outro, explicado de forma simples.

Lar › Aprender › Auto-hospedagem de um LLM versus pagamento por chamada de API

Auto-hospedagem de um LLM versus pagamento por chamada de API

Quando sua conta de API aumenta, surge o pensamento tentador: por que não executar um modelo aberto em nosso próprio hardware e parar de pagar por token? Às vezes, esse é o movimento certo. Muitas vezes não é. Este guia apresenta os custos reais de ambos os lados para que você possa encontrar seu ponto de equilíbrio em vez de adivinhar.

Duas formas de custos muito diferentes

A principal diferença é a forma do custo. Uma API hospedada é custo variável puro: você paga por token, nada quando está ocioso e pode variar facilmente de uma chamada para milhões. Auto-hospedagem é principalmente custo fixo: você aluga ou compra GPUs que custam o mesmo, estejam elas ocupadas ou ociosas, mais o tempo de engenharia para executá-las.

Essa única diferença impulsiona toda a decisão. As APIs vencem quando o uso é baixo, intermitente ou imprevisível. A auto-hospedagem só pode vencer quando o uso é alto, estável e previsível o suficiente para manter o hardware caro ocupado.

Quanto custa realmente a auto-hospedagem

O aluguel ou compra da GPU é apenas o número do título. A conta completa inclui:

  • Calcular, instâncias de GPU com preço por hora, que você paga 24 horas por dia, 7 dias por semana, se quiser que o modelo esteja sempre disponível.
  • Tempo de engenharia, para implantar, otimizar, monitorar, corrigir e manter o serviço ativo. Este é um custo salarial recorrente, não único.
  • Desperdício ocioso, cada hora que sua GPU fica abaixo da utilização total é dinheiro gasto em vão.
  • Sobrecarga de confiabilidade, redundância, failover e escalonamento para picos de tráfego, que uma API hospedada trata para você de forma invisível.

As equipes subestimam rotineiramente os três últimos. A conta da GPU está visível; os humanos e o tempo ocioso não.

O que o preço da API inclui

Ao pagar por token a um provedor hospedado, você não está apenas comprando computação. Você está comprando o hardware, o tempo de atividade, o dimensionamento, a segurança, a equipe de operações e a capacidade de ir de zero a um grande volume instantaneamente. O preço por token agrupa tudo isso.

Você também está livre de planejamento de capacidade. Nenhuma decisão sobre quantas GPUs manter aquecidas, nenhuma página às 3 da manhã quando um nó morre. Para muitas equipes, esse alívio operacional vale mais do que a margem bruta de computação cobrada pelo provedor.

A lógica do ponto de equilíbrio

O ponto de equilíbrio tem a ver com utilização. Uma GPU auto-hospedada tem um custo mensal aproximadamente fixo e um rendimento máximo de tokens que pode produzir. Divida o custo mensal pelos tokens que você realmente envia para obter o custo efetivo por token. Se o seu tráfego mantiver a GPU quase com carga total, esse custo efetivo poderá prejudicar a API. Se a GPU estiver meio ociosa, seu custo efetivo por token dobrará e a API provavelmente vencerá.

Exemplo ilustrativo (números inventados): se uma instância de GPU custa US$ 1.500/mês e pode realisticamente servir, digamos, 500 milhões de tokens/mês a todo vapor, seu custo mínimo é de US$ 3 por milhão de tokens, mas apenas se você realmente usar todos os 500 milhões. Execute apenas 100 milhões e seu custo real será de US$ 15 por milhão, cinco vezes pior. Compare esse valor efetivo com a taxa API nas páginas de comparação de modelos.

Diferenças de qualidade e capacidade

O custo não é o único eixo. Os modelos de fronteira mais fortes geralmente estão disponíveis apenas por meio de APIs hospedadas, enquanto a auto-hospedagem significa executar modelos de peso aberto, que são excelentes, mas podem acompanhar os melhores modelos fechados nas tarefas mais difíceis. Se o seu caso de uso precisar de recursos de alto nível, a auto-hospedagem pode nem ser uma opção.

Por outro lado, a auto-hospedagem oferece controle de dados (nada sai da sua infraestrutura), sem limites de taxa além do seu próprio hardware e livre de alterações nos preços do provedor. Para indústrias regulamentadas ou dados sensíveis à privacidade, estes podem compensar um custo efetivo mais elevado.

Um caminho de decisão prático

Uma regra prática razoável:

  • Comece em uma API hospedada. É a forma mais barata de atingir o volume real e validar seu produto sem desembolso de capital.
  • Acompanhe seus gastos mensais. Quando ela crescer grande e estável, modele honestamente a alternativa de auto-hospedagem, incluindo tempo de engenharia e utilização realista (não teórica).
  • Considere um híbrido. Atenda tarefas simples de alto volume em um pequeno modelo aberto auto-hospedado e encaminhe consultas difíceis para uma API de fronteira hospedada.

Use a calculadora de custos do LLM para definir o preço do uso atual da API e, em seguida, compare-o com uma estimativa de auto-host totalmente carregada. Não se esqueça de incluir o custo salarial das pessoas que irão administrá-lo, essa linha é o que a maioria dos cálculos de ponto de equilíbrio omitem silenciosamente.

Perguntas frequentes

Em que ponto a auto-hospedagem fica mais barata?

Somente quando seu uso for alto e estável o suficiente para manter GPUs caras próximas da utilização total e após contabilizar o tempo de engenharia. Em volumes baixos ou elevados, uma API hospedada é quase sempre mais barata.

Posso executar o mesmo modelo de qualidade sozinho?

Você pode executar modelos fortes de peso aberto, mas os modelos de fronteira mais capazes são normalmente apenas API. Se sua tarefa precisar de desempenho de alto nível, a auto-hospedagem pode não corresponder a isso.

Qual o custo que as pessoas esquecem quando se auto-hospedam?

Tempo de engenharia e operações, além de horas ociosas de GPU. A conta do hardware é visível, mas os salários para operá-lo e a capacidade que você paga, mas não utiliza, são os custos que afundam a maioria das estimativas.

Apenas educacional – não aconselhamento financeiro.