Стоимость самостоятельного вывода — это время графического процессора на один токен. Спекулятивное декодирование увеличивает количество токенов в секунду без изменения выходных данных, поэтому снижает стоимость токена — но только в том случае, если черновик достаточно точен, чтобы принятые токены опережали дополнительные проходы черновика. В счете указано чистое ускорение, а не главное.

Черновик ≈ модель примерно в 10–20 раз меньше цели.
токены/проверить пропуск (сырой)
чистое ускорение
стоимость / 1М (со спецификациями)
ежемесячная экономия

Базовый уровень против спекулятивного

Простое авторегрессионное декодирование — это один токен на целевой проход. Спекулятивное декодирование увеличивает пропускную способность за счет чистого ускорения, а вместе с ним падает стоимость токена — при условии, что чистое ускорение уменьшается в 1 раз.

РежимПропускная способность (ток/с)Стоимость / 1МСтоимость / месяц

Чувствительность к скорости принятия

Единственное число, которое решает все, — это то, насколько часто драфт угадает. Ниже уровня безубыточности для вашей глубины черновика и накладных расходов спекулятивное декодирование является чистым убытком.

Скорость принятияЖетоны/пропускЧистое ускорениеСтоимость / месяц
⚠️ Модель, июль 2026 г. Пропускная способность и производительность графического процессора — это редактируемые справочные значения для декодирования с привязкой к пропускной способности памяти; действительные числа зависят от модели, квантования, размера пакета и стека обслуживания (vLLM, TGI, TensorRT-LLM). Уровень принятия зависит от рабочей нагрузки и проекта — измеряйте его по своему трафику. Модель затрат предполагает, что декодирование доминирует, а целевая прямая передача по k+1 позициям обходится примерно в одно декодирование токена, что справедливо для обслуживания с одиночной/малой задержкой; интенсивное пакетирование сужает выигрыш. · Сообщить о проблеме →

Почему принятые догадки почти бесплатны

Декодирование большой модели по одному токену за раз ограничено пропускной способностью памяти: каждый отдельный токен требует потоковой передачи всего набора веса через графический процессор, и эта фиксированная стоимость затмевает арифметику. Умное наблюдение, лежащее в основе спекулятивного декодирования, заключается в том, что проверка к Предлагаемые токены за один прямой проход стоят почти так же, как декодирование одного токена — в любом случае вы передаете веса один раз. Таким образом, если дешевая черновая модель предлагает несколько токенов, а большая модель принимает большинство из них, вы получаете несколько токенов по цене одного. Вывод идентичен обычному декодированию, поскольку цель по-прежнему проверяет каждый токен и отклоняет все, что не было бы создано; меняется только пропускная способность. При самостоятельном выводе, когда ваш счет по сути представляет собой часы работы графического процессора, разделенные на количество произведенных токенов, большее количество токенов за секунду графического процессора — это деньги прямо сверху.

Формула и накладные расходы, которые кусаются

С оплатой за токен а и глубина осадки к, ожидаемое количество токенов, которые цель выдает за проход проверки, равно Е = (1 - ак+1) ÷ (1 − а) — геометрическая серия принятых предположений плюс один бонусный жетон. Это чистое ускорение. Загвоздка заключается в самой тяге: она выполняет k небольших проходов вперед за цикл, поэтому, если тяга стоит дробную часть с цели за проход, каждый цикл действительно стоит 1 + к·с целевые эквивалентные единицы. чистое ускорение равно E ÷ (1 + k·c), а стоимость токена снижается на 1 − 1 ÷ чистая скорость. Нажмите слишком сильное значение k при рабочей нагрузке, где a низкое, а E растет медленно, а k·c растет линейно - чистое ускорение падает до 1× и превышает его. Это режим отказа, который охраняет этот инструмент: черновик, который заведомо неправильный, хуже, чем полное отсутствие черновика.

Где это подходит

Спекулятивное декодирование — это рычаг самостоятельного размещения, а не API — хостинг-провайдеры уже включили его в цену, поэтому вы фиксируете его только при запуске графического процессора. Соедините его с Калькулятор стоимости облака графического процессора чтобы оценить оборудование, которое вы ускоряете, LLM VRAM и калькулятор параллелизма чтобы увидеть, как пакетная обработка взаимодействует с ним, и Калькулятор самостоятельного размещения и API чтобы решить, в первую очередь, лучше ли использование вашей собственной модели платить за токен. Соответствующий трюк, перегонка меньшей модели, сокращает стоимость цели, а не ускоряет ее — два суммируются.

Разместите свой проект:DigitalOcean — 200 долларов бесплатно ↗Хостингер VPS
Стоимость облака графического процессораLLM VRAM и параллелизмСамостоятельное размещение и APIМодель окупаемости дистилляции

Обмены

БайбитБинансОКХКуКоин

Инструменты и хостинг

📈 ТрейдингВьюХостингер

Как работает этот калькулятор

Он вычисляет ожидаемые токены за каждый проход целевой проверки, E = (1 − aк+1)/(1 - a), исходя из вашей скорости приемки a и глубины уклона k, затем чистое ускорение E/(1 + k·c) после накладных расходов на проход c. Базовая стоимость миллиона составляет GPU$/час ÷ (пропускная способность × 3600) × 1 000 000; спекулятивная стоимость делится на чистое ускорение. Ежемесячная стоимость — это ваш объем выходных токенов по каждой ставке, экономия — это разница, и любая конфигурация, чистое ускорение которой падает ниже 1×, помечается как чистый убыток.

Часто задаваемые вопросы

Что такое спекулятивное декодирование и почему оно экономит деньги?

Небольшой черновой вариант модели предлагает токены, которые большая модель проверяет за один проход; принятые предположения - это почти бесплатная пропускная способность. При самостоятельном выводе стоимость равна времени графического процессора на один токен, поэтому более высокая пропускная способность означает меньшую стоимость на миллион — с идентичным выходом, поскольку цель проверяет каждый токен.

Как рассчитывается чистое ускорение?

Ожидаемое количество токенов за проход проверки E = (1 − a^(k+1))/(1 − a), деленное на черновые накладные расходы 1 + k·c. Стоимость токена снижается на 1–1/netSpeedup.

Когда он теряет деньги?

Когда приемка низкая, а глубина черновика высока, k дополнительных проходов черновика стоят больше, чем экономия принятых жетонов, в результате чего чистое ускорение снижается ниже 1×. Этот инструмент отмечает этот случай.