Come funziona questa calcolatrice
IL Calcolatore rapido del risparmio di compressione stima quanto risparmi sui costi di input dell'API quando riduci una richiesta ripetuta. Inserisci il tuo token di richiesta correnti per chiamata, IL token prompt compressi per chiamata dopo aver tagliato il prompt del sistema e gli esempi di pochi scatti, il tuo numero di chiamate al mesee il tuo prezzo di input per milione di token. Moltiplica la riduzione del token per chiamata per il volume delle chiamate mensili e la tariffa di ingresso per mostrare il costo mensile evitato, quindi lo annualizza. Perché viene inviato un prompt di sistema e i relativi esempi ogni singola richiesta, anche una modesta riduzione per chiamata si trasforma in una cifra significativa su larga scala, che è ciò che questo strumento rende visibile.
Il compromesso chiave da tenere d’occhio è che meno token possono significare meno contesto per il modello. Tagliare le istruzioni o eliminare esempi di pochi scatti può ridurre la precisione, aumentare i tentativi o produrre output più lunghi e i token di output hanno solitamente un prezzo più alto e sono non conteggiato qui, poiché questa calcolatrice modella solo i risparmi di input. Usalo per dare priorità alla compressione sugli endpoint con il volume più elevato, dove la stessa modifica ripaga di più, ma convalidare la qualità dopo ogni taglio prima di presumere che il risparmio sia reale. Una richiesta più economica per chiamata ma che richiede un secondo tentativo può costare di più nel complesso, quindi misura la qualità della risposta insieme al conteggio dei token anziché ottimizzare i token isolatamente.
Domande frequenti
Quanto si risparmia effettivamente tagliando il mio prompt?
Ogni token rimosso da un prompt viene rimosso da ogni singola chiamata che lo utilizza. Moltiplica i token risparmiati per chiamata per il volume delle tue chiamate mensili e il prezzo di ingresso per milione di token. Un taglio di 1.000 token su un prompt eseguito un milione di volte al mese a 3 dollari al milione fa risparmiare 3.000 dollari al mese: la dimensione del prompt conta molto più di quanto la maggior parte dei team pensi perché si ripete ad ogni richiesta.
La compressione rapida influisce sul costo o sulla qualità dell'output?
La compressione tocca solo il lato di input: i token di output e il loro prezzo rimangono invariati. Tagliare istruzioni ridondanti, esempi prolissi di poche riprese e contesto duplicato di solito mantiene intatta la qualità, ma tagliare in modo troppo aggressivo può compromettere la precisione. Combina il taglio con la memorizzazione nella cache del prompt per i prefissi stabili in modo che il contesto fisso rimanente venga fatturato alla tariffa scontata di lettura della cache.