—token di input/video
—gettoni di ingresso/minuto
—costo mensile
Il frame rate è il quadrante: spazzalo via
I token immagine si ridimensionano direttamente con i fotogrammi campionati. Per filmati lenti (lezioni, registrazioni di schermate, feed di sicurezza) un frame rate inferiore raramente perde qualcosa e riduce il conto in proporzione. L'audio e il messaggio vengono mantenuti secondo le tue impostazioni.
| Campionamento | Input tokens / video | Costo/video | Mensile |
|---|
The modality nobody budgets for
Il testo costa poco, le immagini sono più costose e il video rientra in una categoria a sé stante, perché un modello trasforma un video in un muro di token immagine, un fotogramma campionato alla volta, e sovrappone la traccia audio sopra. La trappola dell'intuizione è pensare a un video come a "un input" come un documento; in realtà una clip di dieci minuti a un fotogramma al secondo equivale a 600 fotogrammi, circa 155.000 token di immagine più 19.000 token audio, e un'ora intera attraversa un milione di token di input prima che il modello produca una singola parola di output. Questo è il motivo per cui una funzionalità di comprensione video che sembrava banale in una demo può dominare un’intera fattura dell’intelligenza artificiale una volta eseguita in una libreria. Le leve sono dirette: campiona meno fotogrammi al secondo, elimina l'audio quando hai solo bisogno delle immagini, trascrivi il parlato con un modello di sintesi vocale economico e ragiona sul testo invece di pagare tariffe per token audio, e ritaglia il segmento che conta. Dimensiona l'alternativa alla trascrizione su calcolatore dei costi di sintesi vocale, il lato dell'immagine fissa sul calcolatore di input dell'immagine visivae la direzione di generazione su calcolatore dei costi di generazione video.
Costo di input dell'immagine visivaCosto della sintesi vocaleCosto di generazione videoCosto dell'API GeminiCosto dell'API Vision
Come funziona questa calcolatrice
Conta i fotogrammi campionati (lunghezza in secondi × fotogrammi al secondo), li moltiplica per i token per fotogramma per ottenere i token immagine, aggiunge i token audio (secondi × token audio al secondo) e la richiesta di ottenere i token di input totali, quindi valuta l'input e l'output alle tariffe per milione. Il costo per video moltiplicato per il volume mensile fornisce la fattura mensile e la tabella riesegue il tutto su una gamma di frame rate in modo da poter vedere il compromesso.
Domande frequenti
Come viene fatturato il video quando lo invii a un LLM?
Un modello multimodale non guarda il video come fa una persona: campiona i fotogrammi, di solito circa uno al secondo, e tratta ogni fotogramma come un'immagine fatta di token, quindi aggiunge la traccia audio come il proprio flusso di token. Quindi il costo di input è il numero di fotogrammi campionati moltiplicato per i token per fotogramma, più i token audio e il messaggio di testo. Gemini fattura circa 258 token al secondo di video alla risoluzione predefinita e circa 32 token al secondo di audio; con GPT-4o estrai tu stesso i frame e ogni frame piastrellato va da circa 85 a oltre 1.000 token a seconda dei dettagli. In ogni caso, il video è di gran lunga la modalità di input più affamata di token, cosa che questa calcolatrice rende concreta.
Perché un video di un'ora è così costoso da analizzare?
Perché i token si adattano alla lunghezza del filmato. Con un fotogramma al secondo e 258 token per fotogramma, un'ora di video equivale a 3.600 fotogrammi e circa 929.000 token immagine, oltre a circa 115.000 token audio: ben oltre un milione di token di input per un singolo video, prima che il modello scriva una parola di risposta. Con pochi dollari per milione di token di input si tratta di una fattura significativa per video e si moltiplica rapidamente in una libreria. Il calcolatore mostra i token per video, il costo per video e il totale mensile, quindi un esperimento una tantum non si trasforma in una sorpresa su larga scala.
Come posso rendere più economica la comprensione del video?
La leva più importante è il frame rate: il campionamento di un fotogramma ogni due o cinque secondi anziché uno al secondo taglia proporzionalmente i token dell'immagine e per le riprese lente (una conferenza, un feed di sicurezza, una registrazione dello schermo) raramente perde qualcosa di importante. Eliminare la traccia audio quando hai solo bisogno delle immagini o trascrivere l'audio con un modello economico di sintesi vocale e alimentare la trascrizione come testo invece di pagare tariffe per token audio, è un altro grande risparmio. Abbassare la risoluzione dei fotogrammi riduce i token per fotogramma e ritagliare il segmento pertinente anziché inviare l'intero file è la vittoria più semplice di tutte. La tabella del frame rate in questa pagina mostra esattamente quanto ciascuna impostazione sposta il conto.
È più economico trascrivere l'audio piuttosto che inviare l'intero video?
Molto spesso sì, se la tua domanda riguarda ciò che viene detto piuttosto che ciò che viene mostrato. I modelli di sintesi vocale fanno pagare una frazione di centesimo per minuto di audio e la trascrizione risultante ammonta a poche migliaia di token di testo per un'ora di discorso: ordini di grandezza più economici rispetto al pagamento di tariffe per token di immagine su un fotogramma al secondo. Invia il video completo solo quando il contenuto visivo è davvero importante; per filmati, riunioni e podcast, trascrivi prima e ragiona sul testo. Questo calcolatore ti consente di impostare i token audio su zero per modellare il percorso di trascrizione e confrontarlo con l'invio dei frame.