Perguntas frequentes
Quanto custa para gerar dados sintéticos?
Linhas vezes tokens por linha vezes a taxa do modelo, mais os tokens queimados nas gerações rejeitadas que você filtra. Um modelo barato a um dólar por milhão de tokens produz dezenas de milhares de linhas por alguns dólares – a taxa de rejeição/nova tentativa é o que move o número.
Como posso gerar dados sintéticos de forma barata?
Use um modelo pequeno e barato para geração em massa e reserve um modelo mais forte para validação, restrinja o prompt para que menos linhas sejam rejeitadas e elimine a duplicação. O desperdício está em novas tentativas e linhas quase duplicadas, não na geração base.