So funktioniert dieser Rechner
Der Kostenrechner für die Erzeugung synthetischer Daten schätzt, wie viel es kostet, einen künstlichen Datensatz mit einem Sprachmodell zu erstellen. Sie betreten die Anzahl der zu generierenden Zeilen, Die Token pro Reihe (Eingabeaufforderung plus Ausgabe) und die Preis pro 1 Million Token, und es multipliziert diese, um die Gesamtausgaben zu projizieren. Es berücksichtigt auch a Ablehnungs-/Wiederholungsprozentsatz, da generierte Zeilen, die die Validierung oder Qualitätsprüfung nicht bestehen, neu generiert werden müssen, wodurch Token hinzugefügt werden, für die Sie tatsächlich bezahlen. Die Hauptkostentreiber sind daher die Zeilenanzahl, das Token-Gewicht pro Zeile, der Modellpreis und die Häufigkeit der Ausgabewiederholungen.
Der wichtigste Kompromiss ist Qualität versus Kosten. Billigere Modelle senken die Rate pro Token, erhöhen aber häufig die Ablehnungsrate, sodass die Ersparnisse durch Wiederholungsversuche zunichte gemacht werden können. Führen Sie vor der Generierung in vollem Umfang eine kleine Stichprobe durch, um Ihren tatsächlichen Ausschussprozentsatz zu messen. Kürzen Sie dann die Eingabeaufforderungslänge und straffen Sie die Ausgabeschemata, um die Anzahl der Token pro Zeile zu reduzieren. Kleine Änderungen wirken sich über Tausende von Zeilen hinweg stark aus.
Häufig gestellte Fragen
Wie viel kostet die Generierung synthetischer Daten?
Zeilen multipliziert mit Token pro Zeile multipliziert mit der Modellrate plus den verbrannten Token für abgelehnte Generationen, die Sie herausfiltern. Ein günstiges Modell mit einem Dollar pro Million Token schafft Zehntausende Zeilen für ein paar Dollar – die Ablehnungs-/Wiederholungsrate bestimmt die Zahl.
Wie erzeuge ich kostengünstig synthetische Daten?
Verwenden Sie ein kleines, kostengünstiges Modell für die Massengenerierung und reservieren Sie ein stärkeres Modell für die Validierung, verschärfen Sie die Eingabeaufforderung, damit weniger Zeilen abgelehnt werden, und deduplizieren Sie. Die Verschwendung erfolgt in Wiederholungsversuchen und nahezu doppelten Zeilen, nicht in der Basisgeneration.