Веса – это самая легкая часть. Подбор модели — это однострочный расчет, который почти ничего вам не говорит. Решает, сможете ли вы обслуживать восемь пользователей или восемьдесят, — это кэш KV — память, которая масштабируется в зависимости от длины контекста. и с каждой параллельной последовательностью в полете. Этот инструмент измеряет оба показателя, а затем преобразует полученную мощность в стоимость за миллион токенов, которые вы можете удерживать в счет счета API.
Параллелизм и стоимость единицы в зависимости от длины контекста
Та же модель, тот же графический процессор, те же деньги — меняется только контекстное окно каждого запроса. Это таблица, которая превращает фразу «мы просто поднимем max_model_len» в решение о мощности.
| Контекст | КВ / запрос | Параллельно | Токенов/сек. | $/1 млн токенов |
|---|
Обрыв использования
Графический процессор выставляет счета по часам, а не по жетонам. Ваша истинная стоимость единицы — это общая цифра, разделенная на ваш рабочий цикл — именно здесь большинство бизнес-кейсов с самостоятельным хостингом разваливаются.
| Среднее использование | Эффективные токены/сек. | $/1 млн токенов | против API |
|---|
Подгонка модели – это не то же самое, что ее обслуживание.
Совет, который вы найдете повсюду, заключается в том, что модели 70B с INT4 требуется около 35 ГБ, поэтому она помещается на одну карту емкостью 80 ГБ с запасом места. Это правда, и это почти бесполезно, поскольку описывает модель, сидящую без дела. В момент поступления запросов каждая летающая последовательность выделяет свой собственный кэш KV: два тензора на слой, размер которых равен размеру головы KV, умноженному на размер головы, и хранятся для каждого токена в контексте этой последовательности. При 80 слоях, 8 головках KV, 128 измерениях и FP16, что составляет 327 680 байт на токен — треть мегабайта — что в контексте 8K составляет около 2,7 ГБ. за одновременный запрос. 45 ГБ свободного места, которые выглядели такими удобными, — это примерно дюжина пользователей, а тринадцатый оказывается в очереди. Планирование емкости для вывода — это планирование кэша KV; веса просто устанавливают вступительный взнос.
Количество голов КВ — это число, которое на самом деле движется
Внимание к групповым запросам — это причина, по которой современные модели с открытым весом вообще обслуживаются, и его обычно упускают из виду те, кто определяет размер оборудования на основе количества параметров. Модель с 64 головками внимания и 8 головками KV хранит восьмую часть кэша эквивалентной конструкции с несколькими головками, что почти линейно преобразуется в восьмикратный параллелизм на одной и той же карте. Попробуйте предустановку с несколькими головками 13B, описанную выше, в сравнении с предустановкой 70B: у модели меньшего размера часто заканчивается память первой, что не интуитивно понятно, пока вы не увидите, куда идут байты. Уменьшение точности KV вдвое до FP8 снова удваивает параллелизм при скромных затратах на точность. Эти два переключателя увеличивают емкость гораздо больше, чем покупка карты большего размера, и они ничего не стоят.
Использование решает экономику, а не оборудование
Итоговая таблица — это та, которая честно завершает большинство самостоятельных проектов. Арендованный H100 стоит те же 2,50 доллара в час в 3 часа ночи без трафика, как и в часы пик, поэтому ваша реальная стоимость за миллион токенов — это цифра заголовка, разделенная на ваш средний рабочий цикл. При обслуживании с использованием 20% вы платите в пять раз больше, чем предполагает оптимистичная цифра калькулятора - и по сравнению со ставками API для стандартной модели для небольшой модели это далеко не так. Самостоятельный хостинг выигрывает за счет устойчивого, насыщенного и предсказуемого объема, рабочих нагрузок с ограничениями по размещению данных или задержке, с которыми API не может справиться, а также за счет моделей, которые никто не продает по токенам. Он проигрывает из-за скачков трафика, и проигрывает тихо, потому что счет-фактура является фиксированным, а потраченная впустую мощность никогда не отображается в отдельной позиции. Сверьте вывод с самостоятельный калькулятор LLM и API, оцените само оборудование с Калькулятор стоимости вывода графического процессора, и если ответ незначителен, посмотрите на дистиллированная меньшая модель или быстрое кэширование прежде чем купить стойку.