Il verificatore viene eseguito su ogni richiesta, non solo sulle escalation.
cascata/mese
sempre-premium/mese
risparmio
escalation di pareggio

Da dove viene il costo a cascata

Il modello economico e il verificatore vengono pagati sull'intero volume; il modello premium viene pagato solo sulla quota incrementata. Per il confronto vengono mostrati il ​​traffico sempre premium e quello semplice.

ComponenteCosto mensileCondividere

Risparmi attraverso i tassi di escalation

Il tasso di escalation è il fattore di oscillazione. Questo mantiene tutto il resto fisso e lo fa avanzare per mostrare dove la cascata smette di battere sempre-premio: la riga di pareggio è contrassegnata.

EscalationCascata/meseRisparmioVerdetto

Un modello economico innanzitutto non è una fattura economica per impostazione predefinita

Il fascino del sistema a cascata è evidente: la maggior parte delle richieste sono facili, un modello piccolo le soddisfa e pagare prezzi maggiorati per un lavoro facile è uno spreco. Esegui prima il modello economico, mantieni le risposte che superano il controllo e intensifica solo quelle che falliscono: il risultato di FrugalGPT ha dimostrato che questo può eguagliare la qualità di un modello di frontiera a una frazione del costo. La trappola è considerare il modello economico come l’intero costo. Lo paghi ad ogni richiesta, che la risposta sopravviva o meno. Paghi anche un verificatore per ogni richiesta, perché qualcosa deve decidere cosa si intensifica e quel qualcosa di solito è un altro modello di chiamata. E sulla quota che aumenti, paghi il modello premium in aggiunta al tentativo economico che hai già fatto. Sommateli e il quadro cambia: il sistema a cascata consente un notevole risparmio quando l'escalation è bassa, si riduce man mano che l'escalation aumenta e, superato il tasso di pareggio, costa di più che chiamare semplicemente il modello premium per tutto, perché hai pagato per niente il modello economico e il verificatore e hai comunque pagato il prezzo premium intero. Questo calcolatore valuta tutte e tre le tratte in base ai conteggi e alle tariffe dei token, confronta la cascata con sempre premium e con una semplice suddivisione del traffico che non paga mai il doppio e contrassegna il tasso di escalation in cui l'aritmetica si inverte. Se indirizzi ogni richiesta a un singolo modello in anticipo invece di aumentarla, valutala con il calcolatore del modello di router; per impilare la memorizzazione nella cache, il batching e altre leve in primo piano, utilizzare il comando calcolatore di ottimizzazione dei costi; e per confrontare i due modelli stessi, vedere il confronto dei modelli.

Ospita il tuo progetto:DigitalOcean: $ 200 gratis ↗Hostinger VPS
Modello RouterOttimizzazione dei costiAutocoerenzaConfronto dei modelli