Ваша рабочая нагрузка
—Всего однопотоков
—Всего разветвлений
—сбережения
Общая стоимость по количеству задач (N)
Все остальное, удерживаемое на ваших входах выше, перешло через N. Посмотрите, где разветвление догоняет однопоток.
| Задачи (Н) | Однопоточный | Разветвление | Дешевле |
|---|
Как это связано с другими инструментами
Этот калькулятор моделирует стоимость токенов решения «многоагент против монолита» — более узкий, чем общий Калькулятор стоимости ИИ-агента, который оценивает цикл вызова инструментов одного агента и отличается от Калькулятор атрибуции расходов на нескольких серверах MCP, который разделяет существующий счет между серверами, а не моделирует, почему разветвление вообще меняет счет. Если вашим узким местом является сам размер контекста, а не количество задач, см. Калькулятор стоимости контекстного окна и Калькулятор стоимости сжатия контекста о том, сколько будет стоить входной размер каждого запроса, независимо от того, сколько запросов вы отправляете.
Как работает этот калькулятор
А один накапливающийся разговор обработка N задач каждый ход повторно отправляет свою полную историю: входные данные задачи i базовый контекст + (i-1) × токены предыдущего вывода. Если суммировать N задач, этот исторический член растет как Н×(Н-1)/2 — квадратично по N — хотя объем работы каждой задачи идентичен. Разветвление на изолированные субагенты дает каждой задаче новый контекст: базовый контекст + задача плюс фиксированное приглашение на отправку оркестратора для ее запуска, а выходные данные субагента считываются как входные данные оркестратора. Эти накладные расходы относятся к каждой задаче, а не накапливаются, поэтому общая сумма разветвлений масштабируется. линейно в N плюс один заключительный этап синтеза.
По умолчанию (20 задач, 4000 токенов базового контекста, 1200 токенов вывода на задачу, отправка 300 токенов, цены класса Sonnet) один только термин однопоточной истории добавляет примерно 19×20/2 = 190 дополнительных блоков «предыдущего вывода» по 1200 токенов к вводу последующих задач — стоимость, которую платит один поток, а разветвление просто никогда не накапливается. Маленькое значение N предпочитает однопоточный режим, поскольку позволяет избежать накладных расходов на отправку/загрузку; таблица развертки точно показывает, где находится пересечение вашей рабочей нагрузки.
Часто задаваемые вопросы
Почему один длинный разговор с течением времени становится дороже в расчете на задачу?
Поскольку большинство API-интерфейсов завершения чата не сохраняют состояние — каждый ход повторно отправляет полную историю разговоров в качестве входных токенов. Задача 1 отправляет только базовый контекст. Задача 20 отправляет базовый контекст плюс выходные данные задач 1–19. Этот исторический член увеличивается с каждой задачей, поэтому общее количество входных токенов для N задач масштабируется как N*(N-1)/2 — квадратично по N — даже несмотря на то, что собственная работа каждой отдельной задачи имеет одинаковый размер.
Почему разветвление на изолированные субагенты позволяет избежать такого роста?
Каждый субагент получает новое окно контекста — свой собственный базовый контекст плюс одну задачу, а не другие задачи N-1. Оркестратор платит только за короткое приглашение к отправке для запуска каждого субагента и краткое описание для считывания каждого результата. Эти накладные расходы фиксированы для каждой задачи, поэтому общие затраты масштабируются линейно с N, а не квадратично. Компромиссом являются сами накладные расходы оркестратора на отправку/захват, поэтому разветвление не удешевляется автоматически при очень маленьком N.
При каком счете задач разветвление начинает побеждать?
Это зависит от того, насколько велики выходные данные для каждой задачи относительно накладных расходов оркестратора на отправку/поглощение — более крупные выходные данные ускоряют раздувание термина истории однопоточного процесса, уменьшая точку пересечения до меньшего N. Используйте приведенную ниже таблицу развертки с вашим собственным базовым контекстом, размером вывода и накладными расходами оркестратора, чтобы найти точное пересечение, вместо того, чтобы полагаться на эмпирическое правило.
Применимо ли это к субагентам Claude Code, LangGraph или CrewAI таким же образом?
Базовая математика одинакова для любой среды, где оркестратор отправляет рабочие процессы с изолированным контекстом и собирает обратно короткие результаты — субагенты Claude Code, подграфы LangGraph, команды CrewAI или разветвленный цикл, выполняемый вручную. Что различается между платформами, так это точные накладные расходы на отправку и прием данных для каждого субагента, поэтому здесь это отдельные входные данные, а не жестко закодированные.