Come funziona questa calcolatrice
IL Calcolatore dei costi di generazione dei dati sintetici stima quanto costa produrre un set di dati artificiale con un modello linguistico. Inserisci il numero di righe da generare, IL gettoni per riga (prompt più output) e il prezzo per 1 milione di tokene li moltiplica per proiettare la spesa totale. Inoltre tiene conto di a percentuale di rifiuto/riprova, poiché le righe generate che non superano la convalida o i controlli di qualità devono essere rigenerate, aggiungendo token per i quali paghi effettivamente. I principali fattori di costo sono quindi il numero di righe, il peso del token per riga, il prezzo del modello e la frequenza con cui viene ritentato l'output.
Il compromesso chiave è qualità rispetto al costo. I modelli più economici abbassano il tasso per token ma spesso aumentano il tasso di rifiuto, quindi i tentativi possono cancellare i risparmi. Prima di generare su vasta scala, esegui un piccolo campione per misurare la percentuale di scarto reale, quindi riduci la lunghezza del prompt e restringi gli schemi di output per ridurre i token per riga. Piccole modifiche si accumulano pesantemente su migliaia di righe.
Domande frequenti
Quanto costa generare dati sintetici?
Righe moltiplicate per token per riga moltiplicate per la tariffa del modello, più i token masterizzati sulle generazioni rifiutate filtrate. Un modello economico con un dollaro per milione di token crea decine di migliaia di righe per pochi dollari: il tasso di rifiuto/riprova è ciò che sposta il numero.
Come posso generare dati sintetici a basso costo?
Utilizza un modello piccolo ed economico per la generazione in blocco e riserva un modello più potente per la convalida, rafforza la richiesta in modo che vengano rifiutate meno righe ed effettua la deduplicazione. Lo spreco sta nei tentativi e nelle righe quasi duplicate, non nella generazione di base.