Как использовать этот глоссарий
Страницы цен на API и AI полны жаргона, который скрывает то, сколько вы на самом деле заплатите. Ниже приведены 40 наиболее распространенных терминов, сгруппированных в Цены и токены LLM, инфраструктура и самостоятельный хостинг, и модели выставления счетов. Каждое определение не зависит от поставщика и ориентировано на стоимость. Впервые в системе выставления счетов LLM? Начните с нашего как работает ценообразование LLM API руководство, затем оцените действительное число с помощью калькулятор стоимости токена.
Калькулятор стоимости токена →Все руководства Learn →Цены и токены LLM
- Токен
- Небольшая единица текста, которую читает и пишет LLM — на английском языке около ¾ слова или примерно 4 символа. Оплата производится за токен, поэтому счет за LLM зависит от количества токенов (а не количества запросов).
- Входные токены
- The tokens you send to the model: your prompt, system instructions, conversation history and any attached context. Обычно они дешевле двух тарифов, но быстро размножаются, когда вы повторно отправляете контекст при каждом вызове.
- Выходные токены
- Токены, которые модель генерирует в своем ответе. Выходные данные почти всегда стоят дороже входных — обычно в 3–5 раз — потому что генерация текста требует больше вычислений, чем его чтение.
- Контекстное окно
- Максимальное количество токенов, которые модель может учитывать одновременно (например, 128 КБ или 1 М). Это потолок мощности, а не свободное пространство: каждый жетон, который вы помещаете в окно, оплачивается при каждом вызове.
- Стоимость за миллион токенов
- Стандартные цены LLM за единицу указаны в ($/1 млн токенов) и указаны отдельно для входных и выходных данных. Умножение ежемесячного объема токенов на эти ставки — самый быстрый способ оценить расходы.
- Оперативное кэширование
- Сохранение повторяющегося префикса приглашения — длинного системного сообщения или документа — чтобы он не обрабатывался повторно при каждом вызове. Кэшированные входные данные оплачиваются с большой скидкой (часто 75–90 %), что снижает затраты на повторяющиеся рабочие нагрузки.
- Жетоны рассуждений
- Скрытые жетоны «мышления», которые некоторые модели генерируют перед видимым ответом. Вы их не видите, но они учитываются как результат — основной и легко упускаемый из виду фактор затрат в моделях рассуждений.
- Мультимодальные токены
- Изображения, аудио и видео конвертируются в эквиваленты токенов для выставления счетов. Одно изображение с высоким разрешением может стоить сотни или тысячи входных токенов, поэтому мультимодальные подсказки складываются быстрее, чем один только текст.
- Смешанная ставка
- Единая средняя цена за токен, которая сочетает в себе скорости ввода и вывода в соответствии с вашим типичным сочетанием. Полезно для быстрых оценок, хотя и скрывает, что производительность составляет половину стоимости.
- Пакетный API
- Асинхронная конечная точка, которая обрабатывает большие задания в пределах окна задержки (часто до 24 часов) в обмен на скидку, обычно около 50%. Идеально подходит для несрочных работ, таких как массовая классификация или встраивание.
- Вложения
- Числовые векторы, которые представляют значение текста, изображений или других данных, поэтому их можно искать по сходству. Их дешевая генерация на каждый токен и лежит в основе семантического поиска и RAG.
- Тонкая настройка
- Дальнейшее обучение базовой модели на собственных примерах для специализации ее поведения. Это добавляет первоначальные затраты на обучение и, в случае размещенных моделей, часто более высокую скорость вывода для каждого токена, чем базовая модель.
- RAG (генерация с расширенным поиском)
- Шаблон, который извлекает из базы знаний только соответствующие фрагменты и добавляет их в подсказку вместо того, чтобы вставлять в контекст целые документы. Он сокращает входные токены, сохраняя при этом ответы на основе ваших данных.
- Уровень модели (флагман/мид/нано)
- Поставщики предлагают семейства моделей с разными возможностями и ценовыми уровнями — флагманские (наиболее мощные, самые дорогие), среднего класса (сбалансированные) и нано/маленькие (самые дешевые и быстрые). Соответствие уровня сложности задачи является самым большим рычагом снижения затрат.
- Температура
- Настройка от 0 до примерно 2, которая контролирует случайность выходных данных. Это влияет на стиль ответа, а не на цену напрямую, но более высокие значения могут привести к более длинным или более разнообразным ответам, которые изменят стоимость выходных токенов.
- Вызов функции/инструмента
- Разрешение модели возвращать структурированный запрос на запуск одного из определенных вами инструментов или API. Определения инструментов отправляются в виде входных токенов при каждом вызове, а многоэтапные циклы инструментов умножают общее использование токенов.
- Потоковое вещание
- Доставка выходного токена модели по токену по мере его создания, а не в одном блоке. Это улучшает воспринимаемую скорость и сокращает время появления первого токена, но не меняет общую цену токена.
- Дистилляция
- Обучение меньшей модели «ученика» имитации более крупной модели «учителя». Результат обходится намного дешевле в расчете на один токен, сохраняя при этом большую часть качества при выполнении целевого набора задач.
- Квантование
- Уменьшение числовой точности весов модели (например, с 16 бит до 4 бит), чтобы ей требовалось меньше памяти и она работала быстрее. Для самостоятельных хостеров это снижает стоимость графического процессора, обычно с небольшим компромиссом в качестве.
- Вывод
- Запуск обученной модели для получения выходных данных — действие, за которое вы платите при каждом вызове API. Стоимость вывода масштабируется с помощью токенов на размещенных API и времени вычислений на локальных графических процессорах.
Инфраструктура и самостоятельный хостинг
- Ограничение скорости (RPM/TPM)
- Потолок, который провайдер устанавливает для каждой учетной записи: RPM — это запросы в минуту, TPM — токены в минуту. Превышение любого из этих значений возвращает ошибку 429, поэтому для масштабирования требуется пакетная обработка, организация очередей или более высокий уровень.
- Предел параллелизма
- Максимальное количество запросов, разрешенное в полете одновременно. Он ограничивает количество параллельных заданий, которые вы можете выполнять, и, при самостоятельном размещении или предоставленных установках, напрямую определяет размер оборудования, за которое вы должны платить.
- TTFT/задержка
- TTFT (время до первого токена) — это время до прибытия первого выходного токена; задержка — это общее время ответа. Они формируют пользовательский опыт, а на арендованных графических процессорах более длительная задержка означает более высокую плату за вычислительные ресурсы за запрос.
- Пропускная способность
- Сколько токенов или запросов система обрабатывает в секунду. Более высокая пропускная способность обслуживает больше пользователей на одном и том же оборудовании, что снижает стоимость запроса при самостоятельном размещении или резервировании ресурсов.
- База данных векторов
- Магазин, оптимизированный для хранения вложений и поиска их по сходству. Он поддерживает RAG и семантический поиск и обычно оценивается по хранимым векторам, измерениям и запросам, а не по токенам.
- графический процессор/видеопамять
- Графический процессор и его видеопамять, которые выполняют вывод модели. Для загрузки модель должна поместиться во VRAM, поэтому более крупные модели требуют более дорогих графических процессоров с большим объемом памяти — это основная стоимость самостоятельного хостинга.
- Самостоятельный хостинг
- Запуск модели с открытым весом на собственном или арендованном оборудовании вместо вызова размещенного API. Он устраняет плату за токен, но добавляет фиксированные затраты на графический процессор, проектирование и простои, которые окупаются только при больших объемах.
- Выходная/пропускная способность
- Плата за передачу данных из сети облачного провайдера. В бюджетах на ИИ легко забыть, что плата за исходящие данные может быть значительной при перемещении больших наборов данных, медиа или весов моделей между сервисами или регионами.
- Холодный старт (бессерверный)
- Задержка, когда бессерверная функция или контейнер модели выходит из режима ожидания, прежде чем она сможет ответить. Это увеличивает задержку, а для больших моделей с длительным временем загрузки может подтолкнуть вас к постоянному использованию емкости, которая стоит дороже.
- Обеспеченная пропускная способность
- Резервирование фиксированного гарантированного объема мощности модели за фиксированную почасовую или ежемесячную плату вместо оплаты за токен. Он стабилизирует стоимость и задержку для стабильного большого объема трафика, но тратит деньги впустую в режиме ожидания.
- Спот против спроса
- Инстансы по требованию доступны в любое время по полной цене; Спотовые (вытесняемые) экземпляры используют свободные мощности с большой скидкой, но их можно вернуть без предварительного уведомления. Спотовый поток подходит для прерываемых пакетных заданий, а не для обслуживания, требующего критической задержки.
- Обязательная/зарезервированная мощность
- Скидка в обмен на минимальные расходы или использование определенного оборудования в течение одного-трех лет. Это снижает эффективную ставку для предсказуемых рабочих нагрузок, но блокирует вас.
- SLA (время безотказной работы)
- Соглашение об уровне обслуживания — это договорное обещание провайдера о доступности (например, 99,9%) и кредитах, причитающихся в случае его невыполнения. Более высокие уровни SLA обычно стоят дороже, но имеют значение для надежности производства.
Модели выставления счетов и ценообразования
- Цены за рабочее место и за использование
- За каждое рабочее место взимается фиксированная плата за каждого пользователя независимо от его активности; плата за использование того, что вы фактически потребляете (токены, звонки, вычисления). Места предсказуемы; использование масштабируется вместе со спросом и может неожиданно резко возрасти.
- Кредиты
- Предоплаченный баланс, который вы покупаете и расходуете по мере использования услуги. Кредиты обеспечивают плавное выставление счетов, но срок их действия может истекать, а их стоимость за единицу иногда закрывает реальную цену за токен или за вызов.
- Избыток
- Использование сверх включенного в ваш план лимита оплачивается по отдельной — часто более высокой — ставке. Плата за перерасход является распространенным источником неожиданных счетов, когда трафик превышает уровень, на который вы подписались.
- Бесплатный уровень
- Бесплатное вознаграждение (ежемесячный кредит, ограниченное количество звонков или пробное окно), позволяющее вам оценить услугу. Это полезно для тестирования, но редко достаточно для производства, и применяются ограничения или даты истечения срока действия.
- TCO (общая стоимость владения)
- Полная стоимость запуска решения — не только плата за API или графический процессор, но и проектирование, мониторинг, хранение, исходящие данные и накладные расходы. Сравнивать хостинг и самостоятельный хостинг имеет смысл только с точки зрения совокупной стоимости владения, а не общих показателей.
- Стоимость за пользователя
- Ваши общие расходы на AI или API, разделенные на активных пользователей. Он превращает необработанное использование в единицу экономической эффективности, которую вы можете сравнить с доходом или ценой подписки, чтобы проверить, прибыльна ли функция.
- Разметка шлюза/маршрутизатора
- Плата, которую шлюз AI или модель маршрутизатора добавляет к цене базового поставщика за маршрутизацию, резервный вариант, аналитику или единый биллинг. Удобно, но наценка может значительно повысить эффективную стоимость токена.
Часто задаваемые вопросы
Что такое токен?
Токен — это небольшой фрагмент текста, который LLM читает и генерирует — на английском языке это примерно ¾ слова или около 4 символов. Поставщики выставляют счет за токен как за текст, который вы отправляете (вход), так и за текст, который создает модель (выход), поэтому счет за LLM определяется количеством токенов, а не количеством запросов.
Что такое оперативное кэширование?
Кэширование подсказок позволяет провайдеру хранить повторяющийся префикс — например, длинное системное приглашение или документ — поэтому он не обрабатывается повторно при каждом вызове. За кэшированные входные токены выставляются счета с большой скидкой (часто 75–90 %), что снижает затраты на рабочие нагрузки, повторно отправляющие один и тот же контекст.
Что означают TPM и RPM в ограничении скорости?
RPM — это запросы в минуту, а TPM — токены в минуту — два потолка, которые провайдер устанавливает для вашей учетной записи. Нажатие любого из них возвращает ошибку 429, поэтому приложения большого объема должны группировать, ставить в очередь или запрашивать более высокий уровень, а не предполагать неограниченную пропускную способность.
Только образовательная справка — условия ценообразования и скидки зависят от поставщика; подтвердите текущие данные на странице цен каждого поставщика.