Выходные токены — это счет. Генерация выполняет полный проход вперед для каждого токена; prefill обрабатывает все приглашение параллельно, тратя примерно десятую часть энергии на токен. Короткая подсказка с длинным ответом стоит гораздо дороже, чем длинная подсказка с коротким ответом, а скрытая трассировка модели рассуждения считается результатом.

кВтч / месяц
кг CO2-экв/месяц
по запросу
компенсационная стоимость в год при $85/т

Одинаковая рабочая нагрузка для каждого класса модели

Идентичный объем запроса и форма токена, направляемые на разные уровни. Переход на уровень рассуждений не является постепенным — это единственный крупнейший контролируемый фактор в выводе о углеродном балансе.

Класс моделиВыход Втч/1к токкВтч / мес.кг CO2-экв/мес.Стоимость электроэнергии/мес.

Одинаковая рабочая нагрузка в каждом регионе

Идентичные вычисления, идентичная энергия — меняется только сетка. Это самое дешевое сокращение выбросов, доступное любому, чей поставщик позволяет ему выбирать регион.

Областьг CO2-экв/кВтчкг CO2-экв/мес.т CO2-экв/годпротив вашего региона
⚠️Смоделированная смета, а не замер. Энергия каждого токена не публикуется ни одним крупным поставщиком API, поэтому приведенные здесь значения классов представляют собой справочные значения порядка величины, соответствующие раскрытиям операторов и публичным исследованиям энергии умозаключений; реальное потребление зависит от размера партии, длины последовательности, квантования, генерации и использования оборудования. За входные токены взимается плата в размере 10 % от выходной ставки, чтобы отразить параллельное предварительное заполнение. Интенсивность сети является средним национальным коэффициентом генерации и игнорирует рыночные инструменты, такие как PPA и REC, поэтому собственные сообщаемые оператором цифры обычно будут ниже этого. Используйте для масштабирования и сравнения, а не для раскрытия нормативной информации. · Предложить лучший фактор →

Почему разделение ввода/вывода имеет большее значение, чем общая сумма токенов

Почти каждая попытка оценить энергию ИИ умножает общее количество токенов на одно число для каждого токена, и это неверно в важном смысле. Трансформаторный вывод состоит из двух этапов с совершенно разными профилями затрат. Предварительное заполнение считывает все ваше приглашение за один сильно параллельный проход, поэтому приглашение на 1500 токенов стоит немногим больше, чем приглашение на 150 токенов в современных стеках обслуживания. Декодирование генерирует по одному токену за раз, каждый из которых требует полного прохождения весов модели, поэтому выходная длина масштабирует энергию почти линейно. Практическим последствием является то, что наполнение подсказки большим количеством контекста обходится сравнительно дешево, а позволить модели болтаться дорого — полная противоположность интуиции, с которой начинает большинство команд, и противоположность тому, как формируется прайс-лист, поскольку поставщики тоже взимают входные данные со скидкой, но далеко не в 10 раз.

Уровень рассуждений – это место, где следы уходят умирать.

Выводится след мышления модели рассуждения. Он проходит через декодер точно так же, как и видимый ответ, но никогда не доходит до пользователя. Запрос, который производит 200 видимых токенов после обдумывания 2000 токенов, сгенерировал 2200 токенов, и если эта модель также на порядок больше на токен, чем альтернатива среднего уровня, энергия на один запрос может быть в пятьдесят раз выше, чем на ту же задачу, на которую выполняется прямой ответ. Запустите приведенную выше таблицу классов моделей со своим собственным объемом, и арифметика станет очевидной. Это также наиболее удобный рычаг: перенаправление простых запросов на меньший уровень и резервирование обоснований для случаев, когда это необходимо, одновременно сокращает и расходы, и занимаемую площадь. Размер этой сделки с Калькулятор экономии на маршрутизации моделии проверьте, сколько жетоны мышления стоят вам в долларах с помощью Калькулятор стоимости жетона рассуждения.

Энергия — это ошибка округления рядом с суммой, которую вы платите, и в этом вся суть.

Запустите числа по умолчанию, и электричество, необходимое для двух миллионов запросов среднего уровня, будет стоить десятки долларов по сравнению с тысячами счетов за API. Никто не меняет провайдера, чтобы это сохранить. Причина его вычисления в любом случае заключается в том, что число углерода, в отличие от стоимости энергии, в конечном итоге раскрывается в CSRD или анкете клиента, где оно должно быть обоснованным, и все чаще в переговорах о закупках, где поставщика просят указать выбросы на единицу услуги. Строка региона — это то, на что следует воздействовать: идентичные вычисления в низкоуглеродной сети производят пятнадцатую часть того, что они производят в угольной сети, с которой не может сравниться никакая оптимизация модели. Если вас сюда привело само обязательство по раскрытию информации, оцените соответствующую программу управления с учетом Калькулятор стоимости соответствия Закону ЕС об искусственном интеллекте.

Разместите свой проект:DigitalOcean — 200 долларов бесплатно ↗Хостингер VPS
Стоимость соответствия Закону ЕС об искусственном интеллектеЭкономия на маршрутизации моделиСтоимость вывода графического процессораСамостоятельный LLM против APILLM VRAM и параллелизм