—входные токены/видео
—входных токенов/минуту
—ежемесячная стоимость
Частота кадров — это шкала, подметайте ее
Токены изображений масштабируются напрямую с выбранными кадрами. Для медленных видеороликов — лекций, записей с экрана, каналов безопасности — более низкая частота кадров редко что-то теряет и пропорционально сокращает расходы. Звук и подсказки сохраняются в ваших настройках.
| Выборка | Входные токены/видео | Стоимость / видео | Ежемесячно |
|---|
Модальность, на которую никто не рассчитывает бюджет
Текст стоит дешево, изображения дороже, а видео находится в отдельной категории, потому что модель превращает видео в стену токенов изображений, по одному выбранному кадру за раз, и помещает звуковую дорожку поверх нее. Ловушка интуиции — думать о видео как о «одном входе», как о документе; на самом деле десятиминутный клип со скоростью один кадр в секунду составляет 600 кадров, примерно 155 000 токенов изображений плюс 19 000 токенов аудио, а целый час пересекает миллион входных токенов, прежде чем модель выдаст одно слово на выходе. Вот почему функция понимания видео, которая в демо-версии выглядела тривиальной, может доминировать во всем законопроекте об искусственном интеллекте, как только она будет реализована в библиотеке. Рычаги прямые: сэмплируйте меньше кадров в секунду, отключайте звук, когда вам нужны только визуальные эффекты, транскрибируйте речь с помощью дешевой модели преобразования речи в текст и анализируйте текст вместо того, чтобы платить за аудиотокены, и вырезайте тот сегмент, который имеет значение. Размер альтернативной расшифровки на калькулятор стоимости преобразования речи в текст, сторона неподвижного изображения на Калькулятор ввода изображений Vision, а направление генерации на Калькулятор стоимости создания видео.
Стоимость ввода изображения VisionСтоимость преобразования речи в текстСтоимость создания видеоСтоимость API GeminiСтоимость API визуализации
Как работает этот калькулятор
Он подсчитывает выбранные кадры (длина в секундах × кадры в секунду), умножает их на количество токенов на кадр, чтобы получить токены изображения, добавляет аудиотокены (секунды × аудиотокены в секунду) и подсказку для получения общего количества входных токенов, а затем оценивает ввод и вывод по вашим ставкам за миллион. Стоимость видео, умноженная на ваш ежемесячный объем, дает ежемесячный счет, и таблица повторяет все это в диапазоне частот кадров, чтобы вы могли увидеть компромисс.
Часто задаваемые вопросы
Как выставляется счет за видео, отправленное в LLM?
Мультимодальная модель не смотрит видео так, как это делает человек — она выбирает кадры, обычно примерно один в секунду, и обрабатывает каждый кадр как изображение, состоящее из токенов, а затем добавляет звуковую дорожку как собственный поток токенов. Таким образом, входная стоимость равна количеству выбранных кадров, умноженному на количество токенов на кадр, плюс аудиотокены и текстовое приглашение. Gemini взимает примерно 258 токенов за секунду видео с разрешением по умолчанию и около 32 токенов за секунду аудио; с GPT-4o вы сами извлекаете кадры, и каждый мозаичный кадр содержит от 85 до более 1000 токенов в зависимости от детализации. В любом случае, видео на сегодняшний день является наиболее ресурсоемкой формой ввода, которую этот калькулятор конкретизирует.
Почему анализ часового видео так дорог?
Потому что токены масштабируются вместе с длиной отснятого материала. При одном кадре в секунду и 258 токенах на кадр час видео составляет 3600 кадров и около 929 000 токенов изображений плюс примерно 115 000 токенов аудио — более миллиона входных токенов для одного видео, прежде чем модель напишет слово ответа. При цене в несколько долларов за миллион входных токенов это значимая сумма за видео, и она быстро увеличивается в библиотеке. Калькулятор показывает токены за видео, стоимость за видео и общую сумму за месяц, поэтому разовый эксперимент не превратится в сюрприз в масштабе.
Как сделать понимание видео дешевле?
Самым большим рычагом является частота кадров: выборка одного кадра каждые две или пять секунд вместо одного кадра в секунду пропорционально сокращает токены изображения, а для медленно движущихся кадров — лекции, ленты безопасности, записи экрана — редко теряется что-то важное. Отказ от звуковой дорожки, когда вам нужны только визуальные эффекты, или расшифровка звука с помощью дешевой модели преобразования речи в текст и подача расшифровки в виде текста вместо оплаты ставок аудио-токенов — еще одна значительная экономия. Понижение разрешения кадра уменьшает количество токенов на кадр, а самым простым из всех преимуществ является отсечение соответствующего сегмента вместо отправки всего файла. Таблица частоты кадров на этой странице показывает, насколько именно каждая настройка влияет на счет.
Дешевле расшифровать аудио, чем отправить видео целиком?
Очень часто да, если ваш вопрос касается того, что говорится, а не того, что показано. В моделях преобразования речи в текст плата за минуту аудио составляет доли цента, а итоговая расшифровка составляет несколько тысяч текстовых жетонов за час речи — на порядки дешевле, чем платить за кадр каждую секунду по тарифам за токен изображения. Отправляйте полное видео только в том случае, если визуальный контент действительно важен; для видеозаписей, встреч и подкастов сначала расшифровывайте и рассуждайте над текстом. Этот калькулятор позволяет установить для аудиотокенов нулевое значение, чтобы смоделировать маршрут расшифровки и сравнить его с отправкой кадров.