Como funciona esta calculadora
O Calculadora de custos de geração de dados sintéticos estima quanto custa produzir um conjunto de dados artificial com um modelo de linguagem. Você entra no número de linhas para gerar, o tokens por linha (prompt mais saída) e o preço por 1 milhão de tokens, e os multiplica para projetar o gasto total. Também leva em consideração um porcentagem de rejeição/nova tentativa, uma vez que as linhas geradas que falham na validação ou nas verificações de qualidade devem ser regeneradas, adicionando tokens pelos quais você realmente paga. Os principais fatores de custo são, portanto, a contagem de linhas, o peso do token por linha, o preço do modelo e a frequência com que a produção é repetida.
A principal compensação é qualidade versus custo. Modelos mais baratos reduzem a taxa por token, mas muitas vezes aumentam a taxa de rejeição, de modo que as novas tentativas podem apagar a economia. Antes de gerar em escala total, execute uma pequena amostra para medir sua porcentagem real de rejeição e, em seguida, reduza o comprimento do prompt e restrinja os esquemas de saída para reduzir tokens por linha. Pequenas alterações ocorrem fortemente em milhares de linhas.
Perguntas frequentes
Quanto custa para gerar dados sintéticos?
Linhas vezes tokens por linha vezes a taxa do modelo, mais os tokens queimados nas gerações rejeitadas que você filtra. Um modelo barato a um dólar por milhão de tokens produz dezenas de milhares de linhas por alguns dólares – a taxa de rejeição/nova tentativa é o que move o número.
Como posso gerar dados sintéticos de forma barata?
Use um modelo pequeno e barato para geração em massa e reserve um modelo mais forte para validação, restrinja o prompt para que menos linhas sejam rejeitadas e elimine a duplicação. O desperdício está em novas tentativas e linhas quase duplicadas, não na geração base.