Suggerimento: un prodotto di chat in genere esegue 3-6 volte più input rispetto ai token di output (la cronologia viene inviata nuovamente ogni turno). Se conosci solo i token totali, dividili 80/20.

0 i modelli si adattano · ordinati per livello di qualità, quindi spazio per la testa ·

ModelloFornitoreCosto mensile% del budgetAltezza liberaLivello

I prezzi sono stime di riferimento (). Segnala prezzo obsoleto →

Come utilizzare la colonna headroom

L'headroom è quante volte il tuo volume attuale potrebbe crescere prima che il modello superi il budget. Un modello al 45% del budget ha un margine di circa 2,2 volte maggiore; al 90%, solo 1,1×: il primo mese di crescita supera questo limite. L'utilizzo di LLM cresce quasi sempre più velocemente del previsto (conversazioni più lunghe, nuovi tentativi, nuove funzionalità aggiunte silenziosamente), quindi considera il 2× headroom come il minimo pratico per una scelta di produzione.

The smart play is usually a paio: un cavallo di battaglia economico e all'interno del budget con un margine di 5×+ per l'80% delle query facili, oltre a un fiore all'occhiello usato con parsimonia per il 20% difficile. IL calcolatore di routing del modello mostra la matematica mista e il file tabella comparativa completa ti consente di ispezionare qualsiasi modello superficiale di questo cercatore. I prezzi qui scendono di circa 10 volte all'anno a capacità costante: vedi tracker della cronologia dei prezzi — ripetere quindi questo controllo trimestralmente; l'insieme di modelli adatti al tuo budget cresce da solo.