Модель и профиль задачи
—входные жетоны/задача
—скриншот доли счета
—стоимость/задача
Сохранение скриншотов — самый большой рычаг затрат
Та же задача, те же шаги — меняется только количество предыдущих скриншотов, оставшихся в контексте. Старые снимки экрана с устаревшими состояниями экрана редко улучшают следующее действие, но они всегда считаются новыми входными токенами.
| Стратегия | Ввод токена/задачи | Стоимость/задача | Ежемесячно | против «держать все» |
|---|
Цикл создания скриншотов — это место, где умирают бюджеты на автоматизацию браузеров
Агент использования компьютера не читает DOM — он смотрит на экран. Каждый шаг каждой задачи представляет собой полный цикл действий: сделайте снимок экрана, отправьте его модели в качестве жетонов ввода изображения, получите в ответ действие щелчка, ввода или прокрутки, выполните его и сделайте снимок следующего снимка экрана. При примерно 1000–1600 токенах на скриншот (в зависимости от разрешения) и 10–30 шагах для рутинной задачи один только ввод изображения затмевает все остальное в запросе. Фактический текстовый вывод модели — координаты и краткое обоснование — по сравнению с этим тривиально мал. Такая инверсия застает команды врасплох: в рабочих нагрузках чата выходные токены являются самой дорогой частью; при использовании компьютера затраты обычно составляют 80–95% счета.
Накопление контекста — это множитель сверху. Если агент сохраняет каждый предыдущий снимок экрана в разговоре, шаг 15 повторно отправляет четырнадцать устаревших снимков экрана плюс текущий, а общее количество токенов снимков экрана увеличивается квадратично с длиной задачи — задача из 15 шагов с 1200 токенами на снимок экрана сжигает около 144 000 токенов снимков экрана с полной историей против примерно 50 000, сохраняющих только последние три. Эта единая настройка хранения изменяет доминирующий компонент затрат почти в 3 раза, поэтому эталонная реализация Anthropic по умолчанию обрезает старые снимки экрана. Та же математика с накоплением контекста для текстовых агентов описана в нашей статье. Калькулятор стоимости шагов ИИ-агента; скриншоты просто повышают ставки на порядок.
Два практических замечания. Во-первых, определите бюджет на повторные попытки: агенты, использующие компьютеры, терпят неудачу и повторно запускают задачи со значительной частотой (изменения пользовательского интерфейса, тайм-ауты, неправильные щелчки), и при любой честной оценке допускается 10–20 % повторных попыток. Во-вторых, разрешение является реальным рычагом: уменьшение масштаба захвата до эффективного разрешения модели перед отправкой позволяет избежать оплаты за пиксели, которые модель в любом случае повторно выбирает. Если ваша рабочая нагрузка представляет собой очистку, а не взаимодействие, сравните ее с обычным API веб-скрапинга: когда не требуется нажимать или печатать, снимки экрана — дорогой способ прочитать страницу.
Стоимость шага ИИ-агентаАгентский цикл P99 БюджетСтоимость ввода изображения VisionСтоимость API глубоких исследований
Как работает этот калькулятор
Бесплатный калькулятор стоимости агента для использования компьютера — снимки экрана в виде токенов видения за шаг, накопление контекста и стратегия сохранения последних N снимков экрана, которая сокращает расходы на автоматизацию браузера в 2–3 раза.
Часто задаваемые вопросы
Почему агенты, использующие компьютер, намного дороже, чем агенты, работающие в чате?
Агент, использующий компьютер, работает в цикле: делает снимок экрана, отправляет его модели в качестве токенов ввода изображения, получает действие щелчка или нажатия клавиши, выполняет его, делает снимок экрана еще раз. Каждый снимок экрана стоит примерно 1000–1600 токенов ввода в зависимости от разрешения, а выполнение одной задачи обычно занимает 10–30 шагов. Если агент сохраняет предыдущие снимки экрана в контексте, входные токены растут с каждым шагом — 15-шаговая задача, сохраняющая полную историю, может сжечь более 150 тысяч входных токенов, что в сотни раз превышает типичное завершение чата. В счете доминируют жетоны видения, а не текстовый вывод модели.
Что такое стратегия сохранения скриншотов «сохранять последние N» и сколько она экономит?
Вместо повторной отправки каждого предыдущего снимка экрана на каждом этапе агент сохраняет в контексте только самые последние N снимков экрана (эталонная реализация Anthropic по умолчанию обрезает старые). Для задачи из 15 шагов с 1200 токенами на скриншот сохранение полной истории отправляет около 144 тысяч токенов скриншотов по задаче, а сохранение последних трех — около 50 тысяч — примерно в 2,9 раза меньше доминирующего компонента затрат, обычно без потери успеха задачи, поскольку старые снимки экрана с устаревшими состояниями экрана редко помогают следующему действию. Это единственный рычаг затрат, обеспечивающий максимальную эффективность при использовании компьютеров.
Как сравниваются цены на использование компьютера Claude и цены на предварительную версию использования компьютера OpenAI?
Обе стандартные ставки токенов выставляются в цикле: использование компьютера класса Claude Sonnet по цене 3 доллара за миллион на входе и 15 долларов за миллион на выходе (с рекламной ставкой 2 доллара за 10 долларов, действующей до августа 2026 года), предварительный просмотр компьютерного использования OpenAI при входе 3 доллара на миллион и выводе 12 долларов на миллион. Поскольку токены входного зрения доминируют в рабочей нагрузке, скорость ввода имеет наибольшее значение, и они близки — реальная разница в стоимости связана с количеством шагов на задачу и стратегией хранения снимков экрана, а не поставщиком. Компьютерный инструмент Клода также добавляет примерно 700–1200 фиксированных токенов системы/инструмента за каждый запрос, которые этот калькулятор моделирует как накладные расходы на каждый шаг.