Модель и профиль задачи
—входные жетоны/задача
—скриншот доли счета
—стоимость/задача
Сохранение скриншотов — самый большой рычаг затрат
Та же задача, те же шаги — меняется только количество предыдущих скриншотов, оставшихся в контексте. Старые снимки экрана с устаревшими состояниями экрана редко улучшают следующее действие, но они всегда считаются новыми входными токенами.
| Стратегия | Ввод токена/задачи | Стоимость/задача | Ежемесячно | против «держать все» |
|---|
Цикл создания скриншотов — это место, где умирают бюджеты на автоматизацию браузеров
Агент использования компьютера не читает DOM — он смотрит на экран. Каждый шаг каждой задачи представляет собой полный цикл действий: сделайте снимок экрана, отправьте его модели в качестве жетонов ввода изображения, получите в ответ действие щелчка, ввода или прокрутки, выполните его и сделайте снимок следующего снимка экрана. При примерно 1000–1600 токенах на скриншот (в зависимости от разрешения) и 10–30 шагах для рутинной задачи один только ввод изображения затмевает все остальное в запросе. Фактический текстовый вывод модели — координаты и краткое обоснование — по сравнению с этим тривиально мал. Такая инверсия застает команды врасплох: в рабочих нагрузках чата выходные токены являются самой дорогой частью; при использовании компьютера затраты обычно составляют 80–95% счета.
Накопление контекста — это множитель сверху. Если агент сохраняет каждый предыдущий снимок экрана в разговоре, шаг 15 повторно отправляет четырнадцать устаревших снимков экрана плюс текущий, а общее количество токенов снимков экрана увеличивается квадратично с длиной задачи — задача из 15 шагов с 1200 токенами на снимок экрана сжигает около 144 000 токенов снимков экрана с полной историей против примерно 50 000, сохраняющих только последние три. Эта единая настройка хранения изменяет доминирующий компонент затрат почти в 3 раза, поэтому эталонная реализация Anthropic по умолчанию обрезает старые снимки экрана. Та же математика с накоплением контекста для текстовых агентов описана в нашей статье. Калькулятор стоимости шагов ИИ-агента; скриншоты просто повышают ставки на порядок.
Два практических замечания. Во-первых, определите бюджет на повторные попытки: агенты, использующие компьютеры, терпят неудачу и повторно запускают задачи со значительной частотой (изменения пользовательского интерфейса, тайм-ауты, неправильные щелчки), и при любой честной оценке допускается 10–20 % повторных попыток. Во-вторых, разрешение является реальным рычагом: уменьшение масштаба захвата до эффективного разрешения модели перед отправкой позволяет избежать оплаты за пиксели, которые модель в любом случае повторно выбирает. Если ваша рабочая нагрузка представляет собой очистку, а не взаимодействие, сравните ее с обычным API веб-скрапинга: когда не требуется нажимать или печатать, снимки экрана — дорогой способ прочитать страницу.
Стоимость шага ИИ-агентаАгентский цикл P99 БюджетСтоимость ввода изображения VisionСтоимость API глубоких исследований
Как работает этот калькулятор
The Калькулятор стоимости агента по использованию компьютера оценивает стоимость запуска агента автоматизации использования компьютера или браузера, где каждый шаг дает новую информацию. снимок экрана модели в виде жетонов видения. Вы вводите свою модель, количество задач в месяц, входные и выходные цены за миллион токенов, сколько снимков экрана вы сохраняете в контексте, а также процент неудачных или повторных попыток выполнения задач. Исходя из этого, инструмент прогнозирует ваш ежемесячный счет. Ключевым драйвером, который он фиксирует, является накопление контекста: поскольку агент выполняет множество шагов, а каждый снимок экрана требует больших затрат, сохраненные изображения накапливаются в рамках задачи, поэтому затраты растут с увеличением количества шагов, сохранения изображений и повторных попыток, а не только с количеством задач.
Практический рычаг, который подчеркивает этот калькулятор, — это сохранение скриншотов. Сохранение каждого предыдущего скриншота в контексте заставляет каждый шаг переплачивать за все предыдущие изображения, поэтому стратегия сохранения последнего N — сохраняя только самые последние скриншоты — можно сократить расходы примерно в два-три раза без особой потери полезного состояния. Компромисс, на который следует обратить внимание, заключается в том, что слишком агрессивная обрезка может лишить контекста, который нужен агенту, и повысить неудачно/повторная попытка скорость, и повторные попытки также оплачиваются. Совместно отрегулируйте параметры удержания и повторите попытку, чтобы найти точку, в которой вы тратите меньше всего, сохраняя при этом надежность задач.
Часто задаваемые вопросы
Почему агенты, использующие компьютер, намного дороже, чем агенты, работающие в чате?
Агент, использующий компьютер, работает в цикле: делает снимок экрана, отправляет его модели в качестве токенов ввода изображения, получает действие щелчка или нажатия клавиши, выполняет его, делает снимок экрана еще раз. Каждый снимок экрана стоит примерно 1000–1600 токенов ввода в зависимости от разрешения, а выполнение одной задачи обычно занимает 10–30 шагов. Если агент сохраняет предыдущие снимки экрана в контексте, входные токены растут с каждым шагом — 15-шаговая задача, сохраняющая полную историю, может сжечь более 150 тысяч входных токенов, что в сотни раз превышает типичное завершение чата. В счете доминируют жетоны видения, а не текстовый вывод модели.
Что такое стратегия сохранения скриншотов «сохранять последние N» и сколько она экономит?
Вместо повторной отправки каждого предыдущего снимка экрана на каждом этапе агент сохраняет в контексте только самые последние N снимков экрана (эталонная реализация Anthropic по умолчанию обрезает старые). Для задачи из 15 шагов с 1200 токенами на скриншот сохранение полной истории отправляет около 144 тысяч токенов скриншотов по задаче, а сохранение последних трех — около 50 тысяч — примерно в 2,9 раза меньше доминирующего компонента затрат, обычно без потери успеха задачи, поскольку старые снимки экрана с устаревшими состояниями экрана редко помогают следующему действию. Это единственный рычаг затрат, обеспечивающий максимальную эффективность при использовании компьютеров.
Как сравниваются цены на использование компьютера Claude и цены на предварительную версию использования компьютера OpenAI?
Обе стандартные ставки токенов выставляются в цикле: использование компьютера класса Claude Sonnet по цене 3 доллара за миллион на входе и 15 долларов за миллион на выходе (с рекламной ставкой 2 доллара за 10 долларов, действующей до августа 2026 года), предварительный просмотр компьютерного использования OpenAI при входе 3 доллара на миллион и выводе 12 долларов на миллион. Поскольку токены входного зрения доминируют в рабочей нагрузке, скорость ввода имеет наибольшее значение, и они близки — реальная разница в стоимости связана с количеством шагов на задачу и стратегией хранения снимков экрана, а не поставщиком. Компьютерный инструмент Клода также добавляет примерно 700–1200 фиксированных токенов системы/инструмента за каждый запрос, которые этот калькулятор моделирует как накладные расходы на каждый шаг.