Gemelli ≈ 258 tok/s video, 32 tok/s audio
cost per video
token di input/video
gettoni di ingresso/minuto
costo mensile

Il frame rate è il quadrante: spazzalo via

I token immagine si ridimensionano direttamente con i fotogrammi campionati. Per filmati lenti (lezioni, registrazioni di schermate, feed di sicurezza) un frame rate inferiore raramente perde qualcosa e riduce il conto in proporzione. L'audio e il messaggio vengono mantenuti secondo le tue impostazioni.

CampionamentoInput tokens / videoCosto/videoMensile

The modality nobody budgets for

Il testo costa poco, le immagini sono più costose e il video rientra in una categoria a sé stante, perché un modello trasforma un video in un muro di token immagine, un fotogramma campionato alla volta, e sovrappone la traccia audio sopra. La trappola dell'intuizione è pensare a un video come a "un input" come un documento; in realtà una clip di dieci minuti a un fotogramma al secondo equivale a 600 fotogrammi, circa 155.000 token di immagine più 19.000 token audio, e un'ora intera attraversa un milione di token di input prima che il modello produca una singola parola di output. Questo è il motivo per cui una funzionalità di comprensione video che sembrava banale in una demo può dominare un’intera fattura dell’intelligenza artificiale una volta eseguita in una libreria. Le leve sono dirette: campiona meno fotogrammi al secondo, elimina l'audio quando hai solo bisogno delle immagini, trascrivi il parlato con un modello di sintesi vocale economico e ragiona sul testo invece di pagare tariffe per token audio, e ritaglia il segmento che conta. Dimensiona l'alternativa alla trascrizione su calcolatore dei costi di sintesi vocale, il lato dell'immagine fissa sul calcolatore di input dell'immagine visivae la direzione di generazione su calcolatore dei costi di generazione video.

Ospita il tuo progetto:DigitalOcean: $ 200 gratis ↗Hostinger VPS
Costo di input dell'immagine visivaCosto della sintesi vocaleCosto di generazione videoCosto dell'API GeminiCosto dell'API Vision