—
prompt del sistema / mese—fattura totale/mese
—è il preambolo
—salvataggi cache/mese
Dove vanno i tuoi token di input
La fattura mensile è suddivisa nel preambolo fisso che invii ogni volta, nell'utente dinamico, nei token di contesto e nell'output. La prima riga è la tassa: non diminuisce quando gli utenti dicono di meno.
| Parte | Gettoni/richiesta | Costo/mese | Condividere |
|---|
Come la dimensione tempestiva ridimensiona l'imposta
Ogni riga ha una lunghezza diversa del prompt di sistema al volume corrente. La colonna non memorizzata nella cache rappresenta il costo ingenuo; la colonna memorizzata nella cache applica la percentuale di successo e lo sconto. Questo è il motivo per cui un prompt cresciuto da 500 a 4.000 token ha moltiplicato silenziosamente la tua fattura.
| Richiesta di sistema | Non memorizzato nella cache/mese | Mese in cache/mese | contro il tuo |
|---|
Il messaggio che hai scritto una volta, lo paghi un milione di volte
Un prompt di sistema sembra gratuito perché lo scrivi una volta e lo dimentichi, ma l'API è senza stato, quindi il preambolo viene seguito in ogni singola chiamata e viene fatturato ogni volta come token di input. La trappola sono richieste brevi e ad alto volume: un classificatore o un router che riceve venti token di testo dell'utente e un blocco di istruzioni da duemila token spende il 99% del suo budget di input in parole che l'utente non ha mai inviato. La soluzione è noiosa ed efficace: leggi il prompt del tuo sistema come se stessi pagando per parola, perché lo sei, ed elimina il riempitivo educato, le regole duplicate e gli schemi di strumenti che non invochi quasi mai. Quindi memorizza nella cache ciò che sopravvive, poiché un preambolo stabile è esattamente ciò per cui è stata creata la memorizzazione nella cache e una lettura memorizzata nella cache costa circa un decimo di una nuova. Il motivo per cui il trimming viene prima di tutto è che aiuta incondizionatamente, sia sui mancati che sugli hit della cache, mentre il caching ripaga solo sulle richieste che arrivano mentre la cache è calda e solo se il prefisso rimane identico byte per byte: un timestamp vicino alla parte superiore e lo sconto evapora. Dimensionare la leva di memorizzazione nella cache esattamente su calcolatore rapido del risparmio di memorizzazione nella cache, controlla il pareggio scrittura/lettura sul calcolatore del pareggio di scrittura della cachee conta i token nel prompt corrente con il contatore di gettoni.
Risparmio immediato nella cachePareggio di scrittura della cacheCosto chiamata funzioneContatore di gettoniOttimizzazione dei costi LLM
Come funziona questa calcolatrice
Conta le tue richieste mensili come richieste giornaliere moltiplicate per 30.4. Ogni richiesta paga per il prompt del sistema più l'input dinamico alla velocità di input e l'output alla velocità di output. Il costo della richiesta di sistema corrisponde al conteggio dei token moltiplicato per le richieste mensili alla tariffa di input; la memorizzazione nella cache riduce la quota di successo al tasso scontato mentre la quota di mancato successo rimane a prezzo intero. La fattura totale somma il preambolo fisso, l'input dinamico e l'output. La condivisione rappresenta il costo del prompt di sistema rispetto al totale, mentre il risparmio nella cache corrisponde al costo del preambolo non memorizzato nella cache meno quello memorizzato nella cache. La tabella di ridimensionamento riesegue il costo del preambolo a diverse lunghezze di prompt in modo da poter vedere come cresce e la cifra di ritaglio applica la percentuale di taglio al prompt corrente.
Domande frequenti
Perché il sistema richiede un costo per ogni richiesta?
Poiché l'API è senza stato, ovvero non ricorda la chiamata precedente, quindi tutto ciò che desideri che il modello sappia ogni volta deve essere inviato ogni volta. Il prompt del sistema, la persona, gli esempi di pochi scatti e gli schemi degli strumenti risiedono tutti in quel preambolo fisso e ognuno viene conteggiato come token di input su ogni richiesta. Un utente che digita una sola parola paga comunque l'intero preambolo che la accompagna, motivo per cui un prompt di sistema gonfiato si comporta come un'imposta fissa addebitata per intero sia sulle richieste più piccole che su quelle più grandi.
Quanto della mia fattura è richiesto dal sistema?
Dipende dal rapporto tra il preambolo fisso e il contenuto variabile di ciascuna richiesta. Un prompt da duemila token contro un turno utente da cinquecento token rappresenta la maggior parte dei token di input e può dominare il conto, specialmente su chiamate brevi e ad alto volume come la classificazione dove c'è a malapena il testo dell'utente per diluirlo. Se le tue richieste contengono documenti lunghi o cronologie di chat, il preambolo è una fetta più piccola. Il caso pericoloso è costituito da un volume elevato più richieste brevi più un prompt lungo.
La memorizzazione nella cache dei prompt rimuove il costo dei prompt del sistema?
Ne rimuove la maggior parte, nelle chiamate che colpiscono la cache. La memorizzazione nella cache memorizza un prefisso stabile (il prompt del sistema è il candidato perfetto) e le fatture vengono lette con un forte sconto, in genere circa il 90%, quindi un prompt del sistema memorizzato nella cache costa circa un decimo di uno non memorizzato nella cache. Il problema è che solo le richieste che arrivano mentre la cache è calda ottengono lo sconto, a volte c'è un piccolo premio di scrittura e il prefisso deve essere identico byte per byte, quindi un timestamp vicino alla parte superiore lo interrompe.
È meglio tagliare il prompt del sistema o memorizzarlo nella cache?
Fanno entrambe le cose, ma risolvono problemi diversi. Il trimming taglia i token nel preambolo, riducendo i costi su ogni richiesta, compresi i mancati riscontri nella cache, e libera la finestra di contesto. La memorizzazione nella cache lascia il prompt lungo ma rende le letture ripetute economiche nelle chiamate calde. Il trimming è la soluzione più efficace perché aiuta incondizionatamente, mentre la memorizzazione nella cache dipende dal traffico che mantiene la cache calda. Prima rimuovi tutto ciò che non guadagna i suoi gettoni, quindi memorizza ciò che rimane.