—costo tutto standard
—salvato/mese
—miscelato $/1 milione
Dove vanno i soldi: per livello
Il tuo traffico è suddiviso su tre livelli. Tutto ciò che non è differibile o critico rimane nello standard. Batch/flex viene addebitato con lo sconto; la priorità comporta il premio.
| Livello | Condividere | Tariffa rispetto allo standard | Costo mensile |
|---|
Quanto puoi batch? — la composizione differibile
La leva più importante è la quota di volume che puoi spostare dallo standard al livello scontato. Ogni riga mantiene fissa la tua quota di priorità e varia la quota differibile; il risparmio è rispetto all'esecuzione di tutto su standard.
| Quota differibile | Costo misto | Salvato/mese | Risparmio |
|---|
Il token più economico è quello che eri disposto ad aspettare
La maggior parte dei team tratta il prezzo del modello come un singolo numero, ma gli stessi gettoni ora sono disponibili in livelli e il divario tra loro è enorme: circa la metà del prezzo per tutto ciò che puoi differire, un premio per tutto ciò che insisti a servire immediatamente. L'errore in entrambe le direzioni è l'uniformità: eseguire tutto su standard lascia sul tavolo lo sconto batch e eseguire tutto su priorità paga una tassa di latenza sulle chiamate che nessun utente sta aspettando. La vittoria sta quasi sempre nella noiosa via di mezzo: etichettare il traffico in base al ritardo che può assorbire, spingere la metà offline su batch o flex, mantenere il lavoro interattivo ordinario su standard e riservare la priorità per l'insieme ristretto di percorsi in cui una risposta lenta in realtà costa denaro. Il premio prioritario è il numero che le persone giudicano erroneamente, quindi questo calcolatore lo isola: stampa i dollari extra al mese che paghi esclusivamente per il livello di servizio sulla tua quota critica, separati dai token stessi, quindi la decisione è un confronto e non un'alzata di spalle. Dimensiona lo sconto offline esattamente su calcolatore del risparmio API batch, impilalo con i risultati della cache su calcolatore rapido del risparmio di memorizzazione nella cache, e piegare insieme tutte le leve sul Calcolatore per l'ottimizzazione dei costi LLM.
Risparmi API batchRisparmio immediato nella cacheOttimizzazione dei costi LLMPrezzi per livelli LLMLatenza LLM
Come funziona questa calcolatrice
Determina il prezzo dell'intero volume mensile alle tariffe di input e output standard per ottenere la base di riferimento standard, quindi suddivide il costo in base alla quota su tre livelli. La quota differibile viene fatturata allo sconto batch/flex, la quota critica alla latenza alla tariffa standard più il premio prioritario e tutto ciò che rimane rimane standard. La somma dei tre dà il costo mensile misto; il risparmio è dato dalla linea di base meno la cifra combinata e l'effettivo milione di dollari combinati divide il costo combinato per i token totali. La tabella di scansione riesegue l'intera suddivisione in una serie di condivisioni differibili in modo da poter vedere il profitto derivante dallo spostamento di più lavoro offline.
Domande frequenti
Cosa sono i livelli di servizio LLM e perché costano importi diversi?
Lo stesso modello può essere fatturato a livelli di elaborazione diversi che scambiano la latenza con il prezzo. Standard è il prezzo di listino sincrono. I livelli batch e flessibile eseguono la stessa richiesta in modo asincrono o con priorità inferiore per circa la metà della tariffa standard: sono pensati per lavori che possono attendere minuti o ore, come la classificazione in blocco, gli incorporamenti, il riepilogo offline o la generazione di report notturni. L'elaborazione prioritaria va nella direzione opposta: paghi un sovrapprezzo rispetto allo standard per ottenere una latenza più rapida, più coerente e una migliore affidabilità durante i picchi di carico, il che è importante per le chiamate interattive rivolte agli utenti. I token sono identici; stai pagando per la rapidità e l'affidabilità con cui vengono serviti.
Quanto si può effettivamente risparmiare con l'elaborazione batch o flessibile?
Lo sconto è in genere pari a circa il 50% rispetto alla tariffa standard, quindi ogni fetta di traffico che puoi spostare a un livello batch o flessibile costa circa la metà. Il problema è la latenza: i lavori batch possono richiedere fino a un giorno per essere restituiti e le richieste flessibili possono essere più lente o occasionalmente messe in coda, quindi solo il lavoro veramente differibile è idoneo. La leva è la quota del volume che può tollerare l'attesa: una pipeline che è per l'80% offline e per il 20% interattiva si avvicina a un risparmio complessivo del 40%, mentre un prodotto completamente interattivo in questo modo non risparmia nulla.
L'elaborazione prioritaria vale il premio?
Solo per il traffico in cui la latenza ha un valore reale (un flusso di pagamento, un agente in tempo reale, qualsiasi cosa un utente stia aspettando) e solo per quella fetta, non per l'intero volume. La priorità in genere costa molto di più dello standard per token, quindi inserire tutto il traffico su di essa è il modo più costoso di funzionare. Il test onesto è se la risposta più rapida e affidabile vale i dollari extra che aggiunge, che questo calcolatore stampa come numero autonomo: il premio prioritario in dollari al mese per la quota critica selezionata.
Come posso suddividere il traffico su livelli nella pratica?
Inizia contrassegnando ciascun percorso di chiamata in base al ritardo che può tollerare. Tutto ciò che un utente non sta aspettando attivamente (lavori notturni, riempimenti, valutazioni, arricchimento in massa) viene trasferito in batch o flessibile a una tariffa scontata. Tutto ciò che un utente sta aspettando ma che non è critico per la latenza rimane sullo standard. Riserva la priorità all'insieme ristretto di percorsi interattivi in cui una risposta lenta o interrotta ti costa denaro. Quindi imposta qui queste tre condivisioni per vedere il tasso misto e il risparmio rispetto all'esecuzione di tutto su standard.