Quanto costa ciascuna tariffa di riserva
Stessi token, stesso traffico: cambia solo il tasso di attivazione primario→fallback.
| Tasso di ripiego | Costo mensile | Spese generali vs primarie | % spese generali |
|---|
Il costo nascosto del tuo livello di affidabilità
Una catena di fallback del modello è il modello standard del gateway AI 2026: invia la richiesta a un modello primario economico e veloce; se la chiamata ha una velocità limitata o presenta errori, il gateway (OpenRouter, Portkey, LiteLLM o un wrapper personalizzato) riprova automaticamente con un modello di fallback più costoso e affidabile e talvolta con un terzo livello se anche il fallback fallisce. È l'architettura giusta per l'uptime, ma il livello di fallback ha solitamente un prezzo di 5-20 volte quello primario per token, proprio perché il primario è stato scelto perché è economico. Un tasso di fallback che sembra trascurabile in un dashboard – 5%, anche 2% – può spostare il conto molto più di quanto suggerisca tale percentuale.
Il calcolo non è lineare perché i due livelli non hanno lo stesso prezzo. Costo misto per richiesta = costo_primario × (1 − p1) + costo_di riserva × p1 × (1 − p2) + costo_terziario × p1 × p2, dove p1 è il tasso di attivazione dal primario al fallback e p2 è il (molto più raro) tasso dal fallback al terziario. Con un divario di prezzo di 14 volte tra i livelli, un tasso di fallback del 5% può aggiungere il 50-65% al conto misto anche se il 95% delle richieste raggiunge ancora il primario a basso costo, perché quel 5% del traffico paga più della metà del costo totale in dollari.
Questa è una forma di costo veramente diversa da quella instradamento deliberato del modello (dove scegli la suddivisione economico/costoso in base al design) o semplice riprovare in caso di fallimento costo (dove lo stesso modello riprova). In questo caso l’obiettivo dell’escalation è un modello diverso, più costoso, ed è attivato dalle condizioni dell’infrastruttura – capacità, limiti di velocità – e non dalla difficoltà del compito.
Imparentato: risparmio di routing del modello, Costo del nuovo tentativo API, Costo di migrazione del fornitore LLM, budget del ciclo dell'agente.
Come usarlo
1. Scegli una catena preimpostata o inserisci i tuoi prezzi per milione per i livelli primario, di riserva e terziario.
2. Inserisci le richieste mensili e i token di input/output tipici per richiesta.
3. Imposta i tassi di attivazione primari→fallback e fallback→terziari osservati (o stimati).
4. Leggere il costo mensile misto e le spese generali rispetto a una linea di base primaria pura; utilizza la tabella per vedere quanto è sensibile la tua fattura al tasso di riserva.
Errori comuni
Supponendo che i costi di fallback siano proporzionali al tasso di fallback. Non è così: si ridimensiona con il tasso di fallback moltiplicato per il rapporto di prezzo tra i livelli, che di solito è molto più grande. Ignorando il livello terziario. Se anche il tuo fallback fallisce sotto carico sostenuto, il livello terziario (se presente) di solito costa lo stesso del fallback ma aggiunge rischio di latenza: modellalo anche a un ritmo basso. Fatturazione delle chiamate non riuscite. La maggior parte dei fornitori non addebita alcun costo per il rifiuto di un limite tariffario rigido; se il tuo lo fa (generazione parziale prima di un errore a metà flusso), il tuo sovraccarico reale è superiore a questa stima. Alla ricerca di un uptime del 100% con il fallback più costoso. Un fallback di livello intermedio spesso recupera la maggior parte dell'affidabilità a una frazione del costo del passaggio diretto al modello di punta.
Domande frequenti
Cos'è una catena di fallback del modello AI?
Un modello gateway in cui una richiesta non riuscita o con velocità limitata riprova automaticamente rispetto a un modello di backup e facoltativamente un terzo livello se anche questo fallisce. Utilizzato da OpenRouter, Portkey, LiteLLM e strumenti simili.
Perché un piccolo tasso di riserva costa così tanto?
I modelli di fallback hanno solitamente un prezzo molto superiore a quello primario per token. Anche un tasso di attivazione del 5% può aggiungere oltre il 50% al conto se il fallback costa 10-14 volte di più per richiesta.
Le richieste rifiutate vengono fatturate?
Pratica standard: un rifiuto rigido del limite di velocità 429 fattura $ 0, poiché non sono stati generati token. Questa calcolatrice presuppone questa convenzione.
Come posso ridurre il tasso di fallback in modo economico?
Aumenta il limite di velocità del livello primario, aggiungi backoff e riprova sul primario prima dell'escalation, distribuisci il traffico tra chiavi/provider o inserisci un fallback di livello intermedio invece di passare direttamente al modello più costoso.
Solo stima. I prezzi dei modelli sono cifre di riferimento e cambiano frequentemente: verifica i prezzi attuali con ciascun fornitore.