prompt del sistema / mese
fattura totale/mese
è il preambolo
salvataggi cache/mese

Dove vanno i tuoi token di input

La fattura mensile è suddivisa nel preambolo fisso che invii ogni volta, nell'utente dinamico, nei token di contesto e nell'output. La prima riga è la tassa: non diminuisce quando gli utenti dicono di meno.

ParteGettoni/richiestaCosto/meseCondividere

Come la dimensione tempestiva ridimensiona l'imposta

Ogni riga ha una lunghezza diversa del prompt di sistema al volume corrente. La colonna non memorizzata nella cache rappresenta il costo ingenuo; la colonna memorizzata nella cache applica la percentuale di successo e lo sconto. Questo è il motivo per cui un prompt cresciuto da 500 a 4.000 token ha moltiplicato silenziosamente la tua fattura.

Richiesta di sistemaNon memorizzato nella cache/meseMese in cache/mesecontro il tuo

Il messaggio che hai scritto una volta, lo paghi un milione di volte

Un prompt di sistema sembra gratuito perché lo scrivi una volta e lo dimentichi, ma l'API è senza stato, quindi il preambolo viene seguito in ogni singola chiamata e viene fatturato ogni volta come token di input. La trappola sono richieste brevi e ad alto volume: un classificatore o un router che riceve venti token di testo dell'utente e un blocco di istruzioni da duemila token spende il 99% del suo budget di input in parole che l'utente non ha mai inviato. La soluzione è noiosa ed efficace: leggi il prompt del tuo sistema come se stessi pagando per parola, perché lo sei, ed elimina il riempitivo educato, le regole duplicate e gli schemi di strumenti che non invochi quasi mai. Quindi memorizza nella cache ciò che sopravvive, poiché un preambolo stabile è esattamente ciò per cui è stata creata la memorizzazione nella cache e una lettura memorizzata nella cache costa circa un decimo di una nuova. Il motivo per cui il trimming viene prima di tutto è che aiuta incondizionatamente, sia sui mancati che sugli hit della cache, mentre il caching ripaga solo sulle richieste che arrivano mentre la cache è calda e solo se il prefisso rimane identico byte per byte: un timestamp vicino alla parte superiore e lo sconto evapora. Dimensionare la leva di memorizzazione nella cache esattamente su calcolatore rapido del risparmio di memorizzazione nella cache, controlla il pareggio scrittura/lettura sul calcolatore del pareggio di scrittura della cachee conta i token nel prompt corrente con il contatore di gettoni.

Ospita il tuo progetto:DigitalOcean: $ 200 gratis ↗Hostinger VPS
Risparmio immediato nella cachePareggio di scrittura della cacheCosto chiamata funzioneContatore di gettoniOttimizzazione dei costi LLM