Perguntas frequentes
Quando a auto-hospedagem de um LLM é mais barata do que uma API?
Somente em volume alto e constante. Uma GPU alugada tem um custo fixo 24 horas por dia, 7 dias por semana, por isso compensa quando a taxa de transferência do token a preenche. Abaixo do volume de equilíbrio, a API por token é mais barata porque você paga apenas pelo que usa; acima dela, uma GPU bem utilizada supera o preço medido.
Que custos ocultos a auto-hospedagem adiciona?
A utilização é o grande problema: uma GPU faturada 24 horas por dia, mas usada 30% do tempo, triplica seu custo efetivo por token. Além disso, chega a hora da engenharia, escalonamento automático para picos, lacunas de qualidade do modelo em relação às APIs de fronteira e confiabilidade. Fatore-os antes de mudar para salvar o adesivo.