A taxa de fallback é todo o jogo. Um modelo destilado que lida com 90% do seu tráfego e encaminha o restante de volta ao professor não entrega o múltiplo do título – o décimo escalonado é cobrado com taxas fronteiriças completas e normalmente representa a maior parte da conta restante. Insira um número honesto abaixo e observe o movimento do período de retorno.
O que a taxa de fallback faz com o seu ROI
O mesmo modelo de aluno, o mesmo gasto inicial – apenas muda a parcela do tráfego que deve retornar ao professor. Esta é a variável que decide se um projeto de destilação é uma vitória de um quarto ou um erro de arredondamento.
| Taxa de reserva | Efetivo / mês | Salvando / mês | Salvando vs professor | Retorno |
|---|
Por que o número do título “20x mais barato” não é sua economia
A destilação funciona, e os múltiplos publicados são reais: treine um aluno pequeno para imitar um professor grande em uma tarefa restrita e o custo de serviço por token normalmente cai entre cinco e vinte vezes. O que esses números descrevem é o custo de um token que passa pelo aluno e não pelo professor. O que eles não descrevem é o custo de funcionamento de um sistema de produção, que é uma quantidade diferente, porque os sistemas de produção não encaminham 100% do tráfego para um modelo que é apenas quase tão bom. Eles encaminham os casos confiáveis para o aluno e encaminham o restante – e o restante é cobrado de acordo com as taxas integrais do professor. Com uma taxa de reserva de 10%, o professor ainda lida com um décimo do seu volume a 30x o preço do aluno, o que significa que ainda é responsável pela maior parte da sua conta restante. Modelar a destilação como uma troca limpa é o erro mais comum nesses casos de negócios.
O custo inicial é principalmente de pessoas, não de GPUs
A linha de computação é quase sempre a parte mais barata. Rotular 50.000 exemplos através do professor custa algumas centenas de dólares a preços normais. Um ajuste fino para um estudante pequeno equivale a dezenas de horas de GPU – chame isso de mais cem dólares a preços de aluguel de commodities. Depois vem a parte que não aparece na calculadora de custos de nenhum fornecedor: alguém precisa fazer a curadoria do conjunto de treinamento, criar um equipamento de avaliação que possa realmente dizer se o aluno é bom o suficiente, definir o limite de confiança para o roteador substituto e validá-lo em relação ao tráfego de produção antes que você ouse transferir usuários reais para ele. Quarenta horas de engenharia é uma estimativa otimista para esse trabalho e, em qualquer taxa combinada realista, domina todo o resto na coluna inicial. É por isso que a calculadora pede isso explicitamente, em vez de deixá-lo silenciosamente em zero.
O relógio que você está correndo
A última consideração é algo que nenhuma planilha impõe a você: os preços fronteiriços continuam caindo. Um projeto com retorno de dois meses está seguro contra isso; um projecto com um retorno de dezoito meses aposta que o preço do professor e o panorama dos pequenos modelos permanecerão parados durante um ano e meio, o que a história recente diz que não acontecerá. Se o valor do retorno acima ultrapassar alguns trimestres, a leitura honesta geralmente é que você deve procurar um modelo mais barato e pronto para uso, compactação imediata ou armazenamento em cache primeiro - consulte o calculadora de economia de cache imediata e o calculadora de economia de roteamento de modelo, sendo que ambos proporcionam uma fração da poupança por uma fração do compromisso. A destilação ganha seu sustento em tarefas de alto volume, estreitas e estáveis, e é punida em todos os outros lugares. Compare com um ajuste fino direto com o calculadora de ajuste fino versus solicitação, ou contra executar o modelo sozinho com o calculadora LLM vs API auto-hospedada.