Le tre leve e perché si impilano
La maggior parte dei consigli "riduci i costi LLM del 90%" è reale: si applica solo a parte del tuo traffico e i numeri dei titoli presuppongono il caso migliore. Questo calcolatore rende esplicita la quota. Memorizzazione nella cache immediata sconta il prefisso ripetuto dell'input (prompt di sistema, contesto RAG, un documento lungo) al 10–50% della velocità di input; non fa nulla per i token di output o per l'input che cambia ogni chiamata. Elaborazione batch offre uno sconto fisso del 50% su qualsiasi richiesta che può essere eseguita in modo asincrono: ottimo per la classificazione, il riepilogo e la generazione di report, inutile per una chat dal vivo. Instradamento del modello invia le richieste facili a un modello più piccolo e molto più economico e mantiene il modello di frontiera per quelle difficili. Applicati alle fette di traffico che ciascuno di essi può effettivamente raggiungere, si sommano a una riduzione davvero ampia.
Perché lo sconto effettivo è inferiore ai titoli dei giornali
Se il 90% del caching, il 50% del batch e l'85% del routing raggiungessero l'intero costo, non pagheresti quasi nulla, ma non è così. La memorizzazione nella cache tocca solo l'input memorizzabile nella cache; il batch tocca solo il traffico asincrono; il routing tocca solo le richieste che un modello più economico può gestire. Imposta quelle azioni onestamente e la calcolatrice restituisce il valore miscelato sconto sul carico di lavoro reale. Quel numero misto – spesso 40-70% anziché 90% – è quello da inserire in un budget. Convalidare le singole leve con il calcolatore di memorizzazione nella cache rapida, IL calcolatore del risparmio in lotti e il calcolatore di routing del modello.
L'ordine delle operazioni è importante
Le leve interagiscono: la memorizzazione nella cache riduce innanzitutto i costi di input, quindi batch e routing si applicano a ciò che rimane, quindi impilarli non è una semplice aggiunta. Questo strumento applica la memorizzazione nella cache alla sezione di input memorizzabile nella cache, quindi applica sconti batch e di routing alle relative parti del file rimanente spendere, motivo per cui lo sconto combinato è inferiore alla somma delle parti. Prima di ottimizzare, ottieni la tua linea di base corretta con Calcolatore del costo del token LLM e trova il modello base più economico con API LLM più economica.
Come usarlo
1. Inserisci la tua spesa LLM mensile attuale e approssimativamente la quota rappresentata dai token di input rispetto a quelli di output.
2. Imposta la quantità di input ripetuta/memorizzabile nella cache e il prezzo di accesso alla cache del tuo provider (10% Anthropic, 25–50% OpenAI).
3. Imposta la quota di traffico che puoi raggruppare e la quota che puoi instradare a un modello più economico.
4. Leggi la fattura ottimizzata e lo sconto effettivo, quindi implementa prima le leve con le righe "Risparmi" più grandi.
Domande frequenti
La memorizzazione nella cache e il batching si impilano?
Sì: una richiesta batch può anche utilizzare un prefisso memorizzato nella cache. Questo strumento applica prima la memorizzazione nella cache all'input, quindi gli sconti batch/routing alla spesa rimanente, quindi l'effetto combinato è moltiplicativo, non additivo.
Quale prezzo di cache-hit dovrei usare?
La cache delle fatture antropiche legge al 10% della velocità di input; OpenAI al 25–50% a seconda del modello; Caching del contesto di Google al 10% circa. Utilizza la cifra del tuo provider per la sezione di input memorizzabile nella cache.
Il routing è rischioso per la qualità?
Solo se indirizzi richieste difficili a un modello debole. Il modello sicuro è un classificatore o un livello di regole che invia richieste semplici/brevi al modello economico e intensifica il resto. Modella la suddivisione della spesa con calcolatore di percorso.
Solo stima. Gli sconti dipendono dall'esatto mix di traffico e dai prezzi del fornitore: verifica le tariffe attuali prima di stabilire il budget.