Le fatture relative a AI e API sfuggono al controllo perché i prezzi sono confusi: token, finestre di contesto, tariffe per richiesta, uscita. Queste guide spiegano come funziona effettivamente in termini semplici e ognuna si collega a una calcolatrice gratuita in modo da poter inserire i propri numeri.
Guide
Come funzionano i prezzi dell'API LLM
Token, input e output, finestre di contesto: perché la stessa attività può costare 50 volte di più su un modello rispetto a un altro.
Come ridurre la fattura API LLM
Le sette leve che effettivamente riducono i costi: caching, routing, batching, RAG, modelli più economici e altro ancora.
Cos'è un token? (E perché ti viene fatturato)
Una guida in inglese semplice ai token LLM: cosa sono, come il testo diventa token, perché input e...
Memorizzazione nella cache dei prompt: come ridurre i costi delle chiamate ripetute
Scopri come funziona la memorizzazione nella cache, quando consente di risparmiare denaro, i livelli di sconto tipici e il design...
L'API Batch: 50% di sconto per lavori non urgenti
Come le API batch ti offrono un ampio sconto, in genere circa il 50%, in cambio di tempi più lenti...
Quanto costa effettivamente la messa a punto
Una chiara ripartizione dei costi di ottimizzazione: costo di formazione una tantum, token più elevato...
Hosting autonomo di un LLM rispetto al pagamento per chiamata API
Un confronto onesto tra costi e impegno tra l'esecuzione del proprio modello aperto su GPU e l'utilizzo di un...
Le finestre di contesto e perché i prompt lunghi diventano costosi
Comprendere le finestre di contesto, come viene fatturato ogni token nella finestra per ogni chiamata, perché è lungo...
Spiegazione di token e richieste
Cos'è realmente un token, in cosa differisce da una richiesta API e come stimarli entrambi prima di crearli.
Come scegliere un LLM
Abbina il livello del modello all'attività: l'oscillazione dei costi di 10-50 volte tra ammiraglia e nano.
Guide →Spiegazione della memorizzazione nella cache dei prompt
Memorizza un prefisso ripetuto e pagalo circa il 10%: spesso dimezza la fattura di un chatbot.
Guida →RAG vs messa a punto
Costi, compromessi e quando ciascuno di essi è vincente, con un confronto efficace.
Guida →Limiti di velocità API
RPM, TPM e throughput: quanti utenti possono servire i tuoi limiti.
Guida →API Cost Glossary
40 termini relativi ai costi di AI e API in un inglese semplice: token, memorizzazione nella cache, TPM e altro ancora.
Riferimento →Calcolatori popolari
Costo del token LLM
Costo esatto di una richiesta + completamento su qualsiasi modello.
Risparmio immediato nella cache
Quanto risparmia la memorizzazione nella cache del prompt del sistema.
Risparmi relativi al routing del modello
Indirizza le chiamate facili ai modelli economici, le chiamate difficili a quelli forti.
Self-host e API
Quando esegui la tua GPU, è meglio pagare per token.
Solo riferimento didattico: i prezzi sono stime; confermare le tariffe attuali sulla pagina dei prezzi di ciascun fornitore.