Часто задаваемые вопросы
Сколько стоит создание синтетических данных?
Количество строк, умноженное на количество токенов в каждой строке, умноженное на ставку модели, плюс токены, сожженные в отклоненных поколениях, которые вы отфильтровываете. Дешевая модель с ценой доллара за миллион токенов позволяет выполнять десятки тысяч строк за несколько долларов — показатель отклонения/повторной попытки — это то, что меняет число.
Как дешево генерировать синтетические данные?
Используйте небольшую и дешевую модель для массовой генерации и зарезервируйте более надежную модель для проверки, ужесточите подсказку, чтобы отклонялось меньше строк, и выполните дедупликацию. Потери происходят в повторных попытках и почти повторяющихся строках, а не в базовой генерации.