conversazione completa
ultimo turno da solo
rispetto al costo forfettario
con finestra/cache

Il costo accelera con il conteggio dei turni

L’input per turno continua a salire man mano che la storia si accumula, quindi la curva dei costi cumulativi si piega verso l’alto: raddoppiando i turni si raddoppia il conto.

A turnoQuesto turno costaCumulativo

Paghi per la cronologia ad ogni turno

Un modello linguistico è senza stato: non ricorda nulla tra le chiamate API, quindi per continuare una conversazione la tua applicazione invia nuovamente l'intera trascrizione (prompt di sistema, ogni messaggio utente passato e ogni risposta passata) come input di ogni nuova richiesta. Ciò significa che l’input cresce di uno scambio alla volta e il costo dell’intera conversazione cresce all’incirca con il quadrato del numero di turni, non in modo lineare. L'ultimo turno di una chat lunga è quello più costoso perché contiene la maggior parte della cronologia e il prompt di sistema fisso viene fatturato una volta per turno. Tre leve lo riportano giù: a finestra scorrevole che conserva solo le svolte recenti (il costo diventa lineare, a scapito della memoria), memorizzazione nella cache tempestiva questo fattura il prefisso ripetuto con un forte sconto e il riassunto del vecchio si trasforma in un breve riepilogo. Confronta una singola finestra sul calcolatore dei costi della finestra di contesto, dimensiona la vincita della memorizzazione nella cache su calcolatore rapido del risparmio di memorizzazione nella cache, e costa un assistente completo sul calcolatore dei costi del chatbot.

Ospita il tuo progetto:DigitalOcean: $ 200 gratis ↗Hostinger VPS
Calcolatore del throughput fornito (PTU).Calcolatore del markup di AI GatewayCalcolatore dei prezzi per posto e utilizzoStima dei costi delle app AIPrezzi del wrapper AI