Стоимость самостоятельного вывода — это время графического процессора на один токен. Спекулятивное декодирование увеличивает количество токенов в секунду без изменения выходных данных, поэтому снижает стоимость токена — но только в том случае, если черновик достаточно точен, чтобы принятые токены опережали дополнительные проходы черновика. В счете указано чистое ускорение, а не главное.
Базовый уровень против спекулятивного
Простое авторегрессионное декодирование — это один токен на целевой проход. Спекулятивное декодирование увеличивает пропускную способность за счет чистого ускорения, а вместе с ним падает стоимость токена — при условии, что чистое ускорение уменьшается в 1 раз.
| Режим | Пропускная способность (ток/с) | Стоимость / 1М | Стоимость / месяц |
|---|
Чувствительность к скорости принятия
Единственное число, которое решает все, — это то, насколько часто драфт угадает. Ниже уровня безубыточности для вашей глубины черновика и накладных расходов спекулятивное декодирование является чистым убытком.
| Скорость принятия | Жетоны/пропуск | Чистое ускорение | Стоимость / месяц |
|---|
Почему принятые догадки почти бесплатны
Декодирование большой модели по одному токену за раз ограничено пропускной способностью памяти: каждый отдельный токен требует потоковой передачи всего набора веса через графический процессор, и эта фиксированная стоимость затмевает арифметику. Умное наблюдение, лежащее в основе спекулятивного декодирования, заключается в том, что проверка к Предлагаемые токены за один прямой проход стоят почти так же, как декодирование одного токена — в любом случае вы передаете веса один раз. Таким образом, если дешевая черновая модель предлагает несколько токенов, а большая модель принимает большинство из них, вы получаете несколько токенов по цене одного. Вывод идентичен обычному декодированию, поскольку цель по-прежнему проверяет каждый токен и отклоняет все, что не было бы создано; меняется только пропускная способность. При самостоятельном выводе, когда ваш счет по сути представляет собой часы работы графического процессора, разделенные на количество произведенных токенов, большее количество токенов за секунду графического процессора — это деньги прямо сверху.
Формула и накладные расходы, которые кусаются
С оплатой за токен а и глубина осадки к, ожидаемое количество токенов, которые цель выдает за проход проверки, равно Е = (1 - ак+1) ÷ (1 − а) — геометрическая серия принятых предположений плюс один бонусный жетон. Это чистое ускорение. Загвоздка заключается в самой тяге: она выполняет k небольших проходов вперед за цикл, поэтому, если тяга стоит дробную часть с цели за проход, каждый цикл действительно стоит 1 + к·с целевые эквивалентные единицы. чистое ускорение равно E ÷ (1 + k·c), а стоимость токена снижается на 1 − 1 ÷ чистая скорость. Нажмите слишком сильное значение k при рабочей нагрузке, где a низкое, а E растет медленно, а k·c растет линейно - чистое ускорение падает до 1× и превышает его. Это режим отказа, который охраняет этот инструмент: черновик, который заведомо неправильный, хуже, чем полное отсутствие черновика.
Где это подходит
Спекулятивное декодирование — это рычаг самостоятельного размещения, а не API — хостинг-провайдеры уже включили его в цену, поэтому вы фиксируете его только при запуске графического процессора. Соедините его с Калькулятор стоимости облака графического процессора чтобы оценить оборудование, которое вы ускоряете, LLM VRAM и калькулятор параллелизма чтобы увидеть, как пакетная обработка взаимодействует с ним, и Калькулятор самостоятельного размещения и API чтобы решить, в первую очередь, лучше ли использование вашей собственной модели платить за токен. Соответствующий трюк, перегонка меньшей модели, сокращает стоимость цели, а не ускоряет ее — два суммируются.
Как работает этот калькулятор
Он вычисляет ожидаемые токены за каждый проход целевой проверки, E = (1 − aк+1)/(1 - a), исходя из вашей скорости приемки a и глубины уклона k, затем чистое ускорение E/(1 + k·c) после накладных расходов на проход c. Базовая стоимость миллиона составляет GPU$/час ÷ (пропускная способность × 3600) × 1 000 000; спекулятивная стоимость делится на чистое ускорение. Ежемесячная стоимость — это ваш объем выходных токенов по каждой ставке, экономия — это разница, и любая конфигурация, чистое ускорение которой падает ниже 1×, помечается как чистый убыток.
Часто задаваемые вопросы
Что такое спекулятивное декодирование и почему оно экономит деньги?
Небольшой черновой вариант модели предлагает токены, которые большая модель проверяет за один проход; принятые предположения - это почти бесплатная пропускная способность. При самостоятельном выводе стоимость равна времени графического процессора на один токен, поэтому более высокая пропускная способность означает меньшую стоимость на миллион — с идентичным выходом, поскольку цель проверяет каждый токен.
Как рассчитывается чистое ускорение?
Ожидаемое количество токенов за проход проверки E = (1 − a^(k+1))/(1 − a), деленное на черновые накладные расходы 1 + k·c. Стоимость токена снижается на 1–1/netSpeedup.
Когда он теряет деньги?
Когда приемка низкая, а глубина черновика высока, k дополнительных проходов черновика стоят больше, чем экономия принятых жетонов, в результате чего чистое ускорение снижается ниже 1×. Этот инструмент отмечает этот случай.