A taxa de fallback é todo o jogo. Um modelo destilado que lida com 90% do seu tráfego e encaminha o restante de volta ao professor não entrega o múltiplo do título – o décimo escalonado é cobrado com taxas fronteiriças completas e normalmente representa a maior parte da conta restante. Insira um número honesto abaixo e observe o movimento do período de retorno.

somente professor / mês
período de retorno
destilado + substituto / mês
líquido após 12 meses

O que a taxa de fallback faz com o seu ROI

O mesmo modelo de aluno, o mesmo gasto inicial – apenas muda a parcela do tráfego que deve retornar ao professor. Esta é a variável que decide se um projeto de destilação é uma vitória de um quarto ou um erro de arredondamento.

Taxa de reservaEfetivo / mêsSalvando / mêsSalvando vs professorRetorno
⚠️ Estimativa utilizando taxas de referência (julho de 2026). Os padrões dos professores aproximam-se de um modelo de fronteira de nível intermediário de US$ 3/US$ 15 por 1 milhão de tokens; os padrões do aluno se aproximam de um modelo hospedado pequeno ou de sua própria implantação de classe 7-8B por US$ 0,10/US$ 0,40. O padrão de custo de treinamento pressupõe cerca de 40 horas de GPU com taxas de aluguel de commodities. Seus próprios números serão diferentes – esta ferramenta é uma estrutura para seus números, não uma lista de preços. Compare os preços dos modelos ao vivo no comparação de preços de modelos. · Informar preço desatualizado →

Por que o número do título “20x mais barato” não é sua economia

A destilação funciona, e os múltiplos publicados são reais: treine um aluno pequeno para imitar um professor grande em uma tarefa restrita e o custo de serviço por token normalmente cai entre cinco e vinte vezes. O que esses números descrevem é o custo de um token que passa pelo aluno e não pelo professor. O que eles não descrevem é o custo de funcionamento de um sistema de produção, que é uma quantidade diferente, porque os sistemas de produção não encaminham 100% do tráfego para um modelo que é apenas quase tão bom. Eles encaminham os casos confiáveis ​​para o aluno e encaminham o restante – e o restante é cobrado de acordo com as taxas integrais do professor. Com uma taxa de reserva de 10%, o professor ainda lida com um décimo do seu volume a 30x o preço do aluno, o que significa que ainda é responsável pela maior parte da sua conta restante. Modelar a destilação como uma troca limpa é o erro mais comum nesses casos de negócios.

O custo inicial é principalmente de pessoas, não de GPUs

A linha de computação é quase sempre a parte mais barata. Rotular 50.000 exemplos através do professor custa algumas centenas de dólares a preços normais. Um ajuste fino para um estudante pequeno equivale a dezenas de horas de GPU – chame isso de mais cem dólares a preços de aluguel de commodities. Depois vem a parte que não aparece na calculadora de custos de nenhum fornecedor: alguém precisa fazer a curadoria do conjunto de treinamento, criar um equipamento de avaliação que possa realmente dizer se o aluno é bom o suficiente, definir o limite de confiança para o roteador substituto e validá-lo em relação ao tráfego de produção antes que você ouse transferir usuários reais para ele. Quarenta horas de engenharia é uma estimativa otimista para esse trabalho e, em qualquer taxa combinada realista, domina todo o resto na coluna inicial. É por isso que a calculadora pede isso explicitamente, em vez de deixá-lo silenciosamente em zero.

O relógio que você está correndo

A última consideração é algo que nenhuma planilha impõe a você: os preços fronteiriços continuam caindo. Um projeto com retorno de dois meses está seguro contra isso; um projecto com um retorno de dezoito meses aposta que o preço do professor e o panorama dos pequenos modelos permanecerão parados durante um ano e meio, o que a história recente diz que não acontecerá. Se o valor do retorno acima ultrapassar alguns trimestres, a leitura honesta geralmente é que você deve procurar um modelo mais barato e pronto para uso, compactação imediata ou armazenamento em cache primeiro - consulte o calculadora de economia de cache imediata e o calculadora de economia de roteamento de modelo, sendo que ambos proporcionam uma fração da poupança por uma fração do compromisso. A destilação ganha seu sustento em tarefas de alto volume, estreitas e estáveis, e é punida em todos os outros lugares. Compare com um ajuste fino direto com o calculadora de ajuste fino versus solicitação, ou contra executar o modelo sozinho com o calculadora LLM vs API auto-hospedada.

Hospede seu projeto:DigitalOcean – $ 200 grátis ↗VPS da Hostinger
Ajuste fino versus solicitaçãoLLM auto-hospedado vs APIEconomia de roteamento de modeloCusto de ajuste finoCusto de migração de modelo