Come funziona questa calcolatrice
IL Calcolatore dei costi della finestra di contesto stima quanto costa riempire un'ampia finestra di contesto su ciascuna chiamata del modello: lo scenario sottostante STRACCIO pipeline e prompt di documenti lunghi. Moltiplica il tuo token di contesto per chiamata dal prezzo di input per milione di token, aggiunge il tuo token di output per chiamata volte il prezzo di produzione per milionee ridimensiona il totale in base al tuo chiamate al mese per mostrare sia i dati per chiamata che quelli mensili. Il fattore dominante è quasi sempre la dimensione del contesto: i token di input si ripetono ad ogni chiamata, quindi un pesante carico utile di recupero o un lungo prompt di sistema impostano il costo di base molto più della risposta ottenuta.
Il compromesso chiave è la profondità del contesto rispetto alla spesa. Raddoppiare i passaggi recuperati o riempire la richiesta con documenti aggiuntivi può moltiplicare la fattura senza migliorare le risposte. Usa la calcolatrice per verificare se contesto di ritaglio, restringere il recupero o passare a un livello di input più economico riduce il totale mensile e osserva il numero per chiamata quando il volume è elevato: piccoli importi per chiamata si sommano rapidamente a migliaia di richieste.
Domande frequenti
Perché una grande finestra di contesto costa così tanto?
Paghi il prezzo di input su ogni token nel contesto, ogni singola chiamata. Un prompt di 32.000 token a 2,50 dollari/1 milione equivale a 0,08 dollari di input prima che il modello scriva qualcosa, e questo si ripete ad ogni richiesta.
Come posso ridurre il costo del contesto?
Recupera porzioni sempre più piccole, riepiloga la cronologia e memorizza nella cache la parte statica del prompt. La dimensione del contesto è solitamente la leva più importante su una fattura RAG o su un documento lungo.