Глоссарий стоимости AI и API

Каждый термин, который вы встречаете на странице цен — токены, контекстные окна, ограничения ставок, выводы, кредиты, совокупная стоимость владения — определяется одним или двумя предложениями на простом английском языке.

ДомУчиться › Глоссарий стоимости AI и API

Как использовать этот глоссарий

Страницы цен на API и AI полны жаргона, который скрывает то, сколько вы на самом деле заплатите. Ниже приведены 40 наиболее распространенных терминов, сгруппированных в Цены и токены LLM, инфраструктура и самостоятельный хостинг, и модели выставления счетов. Каждое определение не зависит от поставщика и ориентировано на стоимость. Впервые в системе выставления счетов LLM? Начните с нашего как работает ценообразование LLM API руководство, затем оцените действительное число с помощью калькулятор стоимости токена.

Калькулятор стоимости токена →Все руководства Learn →

Цены и токены LLM

Токен
Небольшая единица текста, которую читает и пишет LLM — на английском языке около ¾ слова или примерно 4 символа. Оплата производится за токен, поэтому счет за LLM зависит от количества токенов (а не количества запросов).
Входные токены
The tokens you send to the model: your prompt, system instructions, conversation history and any attached context. Обычно они дешевле двух тарифов, но быстро размножаются, когда вы повторно отправляете контекст при каждом вызове.
Выходные токены
Токены, которые модель генерирует в своем ответе. Выходные данные почти всегда стоят дороже входных — обычно в 3–5 раз — потому что генерация текста требует больше вычислений, чем его чтение.
Контекстное окно
Максимальное количество токенов, которые модель может учитывать одновременно (например, 128 КБ или 1 М). Это потолок мощности, а не свободное пространство: каждый жетон, который вы помещаете в окно, оплачивается при каждом вызове.
Стоимость за миллион токенов
Стандартные цены LLM за единицу указаны в ($/1 млн токенов) и указаны отдельно для входных и выходных данных. Умножение ежемесячного объема токенов на эти ставки — самый быстрый способ оценить расходы.
Оперативное кэширование
Сохранение повторяющегося префикса приглашения — длинного системного сообщения или документа — чтобы он не обрабатывался повторно при каждом вызове. Кэшированные входные данные оплачиваются с большой скидкой (часто 75–90 %), что снижает затраты на повторяющиеся рабочие нагрузки.
Жетоны рассуждений
Скрытые жетоны «мышления», которые некоторые модели генерируют перед видимым ответом. Вы их не видите, но они учитываются как результат — основной и легко упускаемый из виду фактор затрат в моделях рассуждений.
Мультимодальные токены
Изображения, аудио и видео конвертируются в эквиваленты токенов для выставления счетов. Одно изображение с высоким разрешением может стоить сотни или тысячи входных токенов, поэтому мультимодальные подсказки складываются быстрее, чем один только текст.
Смешанная ставка
Единая средняя цена за токен, которая сочетает в себе скорости ввода и вывода в соответствии с вашим типичным сочетанием. Полезно для быстрых оценок, хотя и скрывает, что производительность составляет половину стоимости.
Пакетный API
Асинхронная конечная точка, которая обрабатывает большие задания в пределах окна задержки (часто до 24 часов) в обмен на скидку, обычно около 50%. Идеально подходит для несрочных работ, таких как массовая классификация или встраивание.
Вложения
Числовые векторы, которые представляют значение текста, изображений или других данных, поэтому их можно искать по сходству. Их дешевая генерация на каждый токен и лежит в основе семантического поиска и RAG.
Тонкая настройка
Дальнейшее обучение базовой модели на собственных примерах для специализации ее поведения. Это добавляет первоначальные затраты на обучение и, в случае размещенных моделей, часто более высокую скорость вывода для каждого токена, чем базовая модель.
RAG (генерация с расширенным поиском)
Шаблон, который извлекает из базы знаний только соответствующие фрагменты и добавляет их в подсказку вместо того, чтобы вставлять в контекст целые документы. Он сокращает входные токены, сохраняя при этом ответы на основе ваших данных.
Уровень модели (флагман/мид/нано)
Поставщики предлагают семейства моделей с разными возможностями и ценовыми уровнями — флагманские (наиболее мощные, самые дорогие), среднего класса (сбалансированные) и нано/маленькие (самые дешевые и быстрые). Соответствие уровня сложности задачи является самым большим рычагом снижения затрат.
Температура
Настройка от 0 до примерно 2, которая контролирует случайность выходных данных. Это влияет на стиль ответа, а не на цену напрямую, но более высокие значения могут привести к более длинным или более разнообразным ответам, которые изменят стоимость выходных токенов.
Вызов функции/инструмента
Разрешение модели возвращать структурированный запрос на запуск одного из определенных вами инструментов или API. Определения инструментов отправляются в виде входных токенов при каждом вызове, а многоэтапные циклы инструментов умножают общее использование токенов.
Потоковое вещание
Доставка выходного токена модели по токену по мере его создания, а не в одном блоке. Это улучшает воспринимаемую скорость и сокращает время появления первого токена, но не меняет общую цену токена.
Дистилляция
Обучение меньшей модели «ученика» имитации более крупной модели «учителя». Результат обходится намного дешевле в расчете на один токен, сохраняя при этом большую часть качества при выполнении целевого набора задач.
Квантование
Уменьшение числовой точности весов модели (например, с 16 бит до 4 бит), чтобы ей требовалось меньше памяти и она работала быстрее. Для самостоятельных хостеров это снижает стоимость графического процессора, обычно с небольшим компромиссом в качестве.
Вывод
Запуск обученной модели для получения выходных данных — действие, за которое вы платите при каждом вызове API. Стоимость вывода масштабируется с помощью токенов на размещенных API и времени вычислений на локальных графических процессорах.

Инфраструктура и самостоятельный хостинг

Ограничение скорости (RPM/TPM)
Потолок, который провайдер устанавливает для каждой учетной записи: RPM — это запросы в минуту, TPM — токены в минуту. Превышение любого из этих значений возвращает ошибку 429, поэтому для масштабирования требуется пакетная обработка, организация очередей или более высокий уровень.
Предел параллелизма
Максимальное количество запросов, разрешенное в полете одновременно. Он ограничивает количество параллельных заданий, которые вы можете выполнять, и, при самостоятельном размещении или предоставленных установках, напрямую определяет размер оборудования, за которое вы должны платить.
TTFT/задержка
TTFT (время до первого токена) — это время до прибытия первого выходного токена; задержка — это общее время ответа. Они формируют пользовательский опыт, а на арендованных графических процессорах более длительная задержка означает более высокую плату за вычислительные ресурсы за запрос.
Пропускная способность
Сколько токенов или запросов система обрабатывает в секунду. Более высокая пропускная способность обслуживает больше пользователей на одном и том же оборудовании, что снижает стоимость запроса при самостоятельном размещении или резервировании ресурсов.
База данных векторов
Магазин, оптимизированный для хранения вложений и поиска их по сходству. Он поддерживает RAG и семантический поиск и обычно оценивается по хранимым векторам, измерениям и запросам, а не по токенам.
графический процессор/видеопамять
Графический процессор и его видеопамять, которые выполняют вывод модели. Для загрузки модель должна поместиться во VRAM, поэтому более крупные модели требуют более дорогих графических процессоров с большим объемом памяти — это основная стоимость самостоятельного хостинга.
Самостоятельный хостинг
Запуск модели с открытым весом на собственном или арендованном оборудовании вместо вызова размещенного API. Он устраняет плату за токен, но добавляет фиксированные затраты на графический процессор, проектирование и простои, которые окупаются только при больших объемах.
Выходная/пропускная способность
Плата за передачу данных из сети облачного провайдера. В бюджетах на ИИ легко забыть, что плата за исходящие данные может быть значительной при перемещении больших наборов данных, медиа или весов моделей между сервисами или регионами.
Холодный старт (бессерверный)
Задержка, когда бессерверная функция или контейнер модели выходит из режима ожидания, прежде чем она сможет ответить. Это увеличивает задержку, а для больших моделей с длительным временем загрузки может подтолкнуть вас к постоянному использованию емкости, которая стоит дороже.
Обеспеченная пропускная способность
Резервирование фиксированного гарантированного объема мощности модели за фиксированную почасовую или ежемесячную плату вместо оплаты за токен. Он стабилизирует стоимость и задержку для стабильного большого объема трафика, но тратит деньги впустую в режиме ожидания.
Спот против спроса
Инстансы по требованию доступны в любое время по полной цене; Спотовые (вытесняемые) экземпляры используют свободные мощности с большой скидкой, но их можно вернуть без предварительного уведомления. Спотовый поток подходит для прерываемых пакетных заданий, а не для обслуживания, требующего критической задержки.
Обязательная/зарезервированная мощность
Скидка в обмен на минимальные расходы или использование определенного оборудования в течение одного-трех лет. Это снижает эффективную ставку для предсказуемых рабочих нагрузок, но блокирует вас.
SLA (время безотказной работы)
Соглашение об уровне обслуживания — это договорное обещание провайдера о доступности (например, 99,9%) и кредитах, причитающихся в случае его невыполнения. Более высокие уровни SLA обычно стоят дороже, но имеют значение для надежности производства.

Модели выставления счетов и ценообразования

Цены за рабочее место и за использование
За каждое рабочее место взимается фиксированная плата за каждого пользователя независимо от его активности; плата за использование того, что вы фактически потребляете (токены, звонки, вычисления). Места предсказуемы; использование масштабируется вместе со спросом и может неожиданно резко возрасти.
Кредиты
Предоплаченный баланс, который вы покупаете и расходуете по мере использования услуги. Кредиты обеспечивают плавное выставление счетов, но срок их действия может истекать, а их стоимость за единицу иногда закрывает реальную цену за токен или за вызов.
Избыток
Использование сверх включенного в ваш план лимита оплачивается по отдельной — часто более высокой — ставке. Плата за перерасход является распространенным источником неожиданных счетов, когда трафик превышает уровень, на который вы подписались.
Бесплатный уровень
Бесплатное вознаграждение (ежемесячный кредит, ограниченное количество звонков или пробное окно), позволяющее вам оценить услугу. Это полезно для тестирования, но редко достаточно для производства, и применяются ограничения или даты истечения срока действия.
TCO (общая стоимость владения)
Полная стоимость запуска решения — не только плата за API или графический процессор, но и проектирование, мониторинг, хранение, исходящие данные и накладные расходы. Сравнивать хостинг и самостоятельный хостинг имеет смысл только с точки зрения совокупной стоимости владения, а не общих показателей.
Стоимость за пользователя
Ваши общие расходы на AI или API, разделенные на активных пользователей. Он превращает необработанное использование в единицу экономической эффективности, которую вы можете сравнить с доходом или ценой подписки, чтобы проверить, прибыльна ли функция.
Разметка шлюза/маршрутизатора
Плата, которую шлюз AI или модель маршрутизатора добавляет к цене базового поставщика за маршрутизацию, резервный вариант, аналитику или единый биллинг. Удобно, но наценка может значительно повысить эффективную стоимость токена.

Часто задаваемые вопросы

Что такое токен?

Токен — это небольшой фрагмент текста, который LLM читает и генерирует — на английском языке это примерно ¾ слова или около 4 символов. Поставщики выставляют счет за токен как за текст, который вы отправляете (вход), так и за текст, который создает модель (выход), поэтому счет за LLM определяется количеством токенов, а не количеством запросов.

Что такое оперативное кэширование?

Кэширование подсказок позволяет провайдеру хранить повторяющийся префикс — например, длинное системное приглашение или документ — поэтому он не обрабатывается повторно при каждом вызове. За кэшированные входные токены выставляются счета с большой скидкой (часто 75–90 %), что снижает затраты на рабочие нагрузки, повторно отправляющие один и тот же контекст.

Что означают TPM и RPM в ограничении скорости?

RPM — это запросы в минуту, а TPM — токены в минуту — два потолка, которые провайдер устанавливает для вашей учетной записи. Нажатие любого из них возвращает ошибку 429, поэтому приложения большого объема должны группировать, ставить в очередь или запрашивать более высокий уровень, а не предполагать неограниченную пропускную способность.

Только образовательная справка — условия ценообразования и скидки зависят от поставщика; подтвердите текущие данные на странице цен каждого поставщика.