—jetons d'entrée / vidéo
—jetons d'entrée / minute
—coût mensuel
La fréquence d'images est le cadran - le balayer
Les jetons d’image évoluent directement avec les images échantillonnées. Pour les séquences lentes – conférences, enregistrements d’écran, flux de sécurité – une fréquence d’images inférieure fait rarement perdre quoi que ce soit et réduit la facture proportionnellement. L'audio et l'invite sont conservés selon vos paramètres.
| Échantillonnage | Jetons d'entrée / vidéo | Coût / vidéo | Mensuel |
|---|
La modalité pour laquelle personne ne budgétise
Le texte est bon marché, les images sont plus chères et la vidéo est dans une catégorie à part, car un modèle transforme une vidéo en un mur de jetons d'images, une image échantillonnée à la fois, et empile la piste audio par-dessus. Le piège de l'intuition consiste à considérer une vidéo comme « une seule entrée » comme un document ; en réalité, un clip de dix minutes à une image par seconde équivaut à 600 images, soit environ 155 000 jetons d'image plus 19 000 jetons audio, et une heure complète traverse un million de jetons d'entrée avant que le modèle ne produise un seul mot de sortie. C'est pourquoi une fonctionnalité de compréhension vidéo qui semblait triviale dans une démo peut dominer l'ensemble d'une facture d'IA une fois qu'elle est exécutée dans une bibliothèque. Les leviers sont directs : échantillonnez moins d'images par seconde, supprimez l'audio lorsque vous n'avez besoin que des éléments visuels, transcrivez la parole avec un modèle parole-texte bon marché et raisonnez sur le texte au lieu de payer des tarifs de jetons audio, et coupez le segment qui compte. Dimensionnez l'alternative de transcription sur le calculateur de coût de synthèse vocale, le côté image fixe du calculateur de saisie d'image de vision, et le sens de génération sur le calculateur de coût de génération vidéo.
Coût d’entrée de l’image de visionCoût de la synthèse vocaleCoût de génération vidéoCoût de l'API GeminiCoût de l'API Vision
Comment fonctionne cette calculatrice
Il compte les images échantillonnées (durée en secondes × images par seconde), multiplie par le nombre de jetons par image pour obtenir des jetons d'image, ajoute des jetons audio (secondes × jetons audio par seconde) et votre invite pour obtenir le total des jetons d'entrée, puis évalue les entrées et sorties à vos tarifs par million. Le coût par vidéo multiplié par votre volume mensuel donne la facture mensuelle, et le tableau réexécute le tout sur une gamme de fréquences d'images afin que vous puissiez voir le compromis.
Questions fréquemment posées
Comment la vidéo est-elle facturée lorsque vous l'envoyez à un LLM ?
Un modèle multimodal ne regarde pas la vidéo comme le fait une personne : il échantillonne des images, généralement environ une par seconde, et traite chaque image comme une image composée de jetons, puis ajoute la piste audio comme son propre flux de jetons. Ainsi, le coût d'entrée correspond au nombre d'images échantillonnées multiplié par le nombre de jetons par image, plus les jetons audio et votre invite de texte. Gemini facture environ 258 jetons par seconde de vidéo à la résolution par défaut et environ 32 jetons par seconde d'audio ; avec GPT-4o, vous extrayez vous-même les images et chaque image en mosaïque comporte d'environ 85 à plus de 1 000 jetons selon les détails. Quoi qu’il en soit, la vidéo est de loin la modalité d’entrée la plus gourmande en jetons, ce que cette calculatrice concrétise.
Pourquoi une vidéo d’une heure est-elle si coûteuse à analyser ?
Parce que les jetons évoluent avec la longueur de la séquence. À une image par seconde et 258 jetons par image, une heure de vidéo équivaut à 3 600 images et environ 929 000 jetons d'image, plus environ 115 000 jetons audio, soit bien plus d'un million de jetons d'entrée pour une seule vidéo, avant que le modèle n'écrive un mot de réponse. À quelques dollars par million de jetons d’entrée, cela représente une facture significative par vidéo, et elle se multiplie rapidement dans une bibliothèque. Le calculateur affiche les jetons par vidéo, le coût par vidéo et le total mensuel afin qu'une expérience ponctuelle ne se transforme pas en surprise à grande échelle.
Comment puis-je rendre la compréhension vidéo moins chère ?
Le plus grand levier est la fréquence d'images : l'échantillonnage à une image toutes les deux ou cinq secondes au lieu d'une par seconde réduit proportionnellement les jetons d'image, et pour les séquences au ralenti - une conférence, un flux de sécurité, un enregistrement d'écran - il perd rarement tout ce qui compte. Supprimer la piste audio lorsque vous n'avez besoin que des éléments visuels, ou transcrire l'audio avec un modèle parole-texte bon marché et transmettre la transcription sous forme de texte au lieu de payer les tarifs des jetons audio, constitue une autre économie importante. Réduire la résolution d'image réduit le nombre de jetons par image, et le découpage sur le segment concerné plutôt que l'envoi de l'intégralité du fichier est la victoire la plus simple de toutes. Le tableau de fréquence d'images sur cette page montre exactement dans quelle mesure chaque paramètre fait bouger la facture.
Est-il moins coûteux de transcrire l’audio que d’envoyer la vidéo entière ?
Très souvent, oui, si votre question porte sur ce qui est dit plutôt que sur ce qui est montré. Les modèles de synthèse vocale facturent une minute d'audio à une fraction de centime, et la transcription résultante est de quelques milliers de jetons de texte pour une heure de parole – des ordres de grandeur moins chers que de payer des tarifs de jetons d'image pour une image chaque seconde. Envoyez la vidéo complète uniquement lorsque le contenu visuel compte vraiment ; pour les séquences de têtes parlantes, les réunions et les podcasts, transcrivez d'abord et raisonnez sur le texte. Cette calculatrice vous permet de définir les jetons audio sur zéro pour modéliser l'itinéraire de transcription et de le comparer à l'envoi des trames.