—
смешанная ежемесячная стоимость—полностью стандартная стоимость
—сохранено / мес.
—смешанный $/1 млн.
Куда идут деньги — по уровням
Ваш трафик разделен на три уровня. Все, что не является отсроченным или критическим, остается стандартным. Пакетная/гибкая обработка оплачивается со скидкой; приоритет несет в себе премию.
| Уровень | Делиться | Тариф по сравнению со стандартом | Ежемесячная стоимость |
|---|
Сколько вы можете партиять? — отложенный циферблат
Самым большим рычагом является доля объема, которую вы можете перенести со стандартной на уровень со скидкой. В каждой строке фиксирована ваша приоритетная доля и варьируется доля отсрочки; экономия по сравнению с запуском всего по стандарту.
| Отложенная доля | Смешанная стоимость | Сохранено/мес. | Сохранение |
|---|
Самый дешевый токен — тот, который вы готовы дождаться
Большинство команд рассматривают цену модели как одно число, но одни и те же токены теперь делятся на уровни, и разрыв между ними огромен: примерно половина цены за все, что вы можете отложить, надбавка за все, что вы настаиваете на немедленном обслуживании. Ошибка в обоих направлениях заключается в единообразии: запуск всего в стандартном режиме оставляет пакетную скидку в таблице, а запуск всего в приоритете приводит к уплате налога на задержку вызовов, которых не ждет ни один пользователь. Победа почти всегда находится в скучной середине: пометьте свой трафик по тому, какую задержку он может поглотить, перенесите офлайн-половину на пакетную или гибкую обработку, оставьте обычную интерактивную работу стандартной и оставьте приоритет для узкого набора путей, где медленный ответ фактически стоит денег. Приоритетная премия — это число, которое люди больше всего ошибочно оценивают, поэтому этот калькулятор изолирует ее — он печатает дополнительные доллары в месяц, которые вы платите исключительно за уровень обслуживания вашей критической доли, отдельно от самих токенов, поэтому решение — это сравнение, а не пожимание плечами. Размер офлайн-скидки точно зависит от Калькулятор экономии пакетного API, складывайте его с попаданиями в кэш на быстрый калькулятор экономии кэшированияи сложите все рычаги вместе на Калькулятор оптимизации затрат LLM.
Экономия пакетного APIОперативная экономия при кэшированииОптимизация затрат на получение степени LLMЦены уровня LLMЗадержка LLM
Как работает этот калькулятор
Он оценивает ваш полный ежемесячный объем по стандартным ставкам ввода и вывода, чтобы получить полностью стандартный базовый уровень, а затем распределяет эту стоимость по долям на три уровня. Отложенная доля выставляется по пакетной/гибкой скидке, доля, требующая критической задержки, по стандартной ставке плюс надбавка за приоритет, а все остальное остается стандартным. Сложив эти три, вы получите смешанную ежемесячную стоимость; экономия — это базовый уровень минус смешанная цифра, а эффективная смешанная стоимость в долларах США/1 миллион делится на общее количество токенов. Таблица развертки повторно обрабатывает все разделение по ряду акций с отсрочкой, чтобы вы могли увидеть выгоду от перевода большего количества работы в автономный режим.
Часто задаваемые вопросы
Что такое уровни обслуживания LLM и почему они стоят по-разному?
Одна и та же модель может выставляться на разных уровнях обработки, где задержка зависит от цены. Стандартная цена — это синхронная прейскурантная цена. Пакетные и гибкие уровни выполняют один и тот же запрос асинхронно или с более низким приоритетом примерно за половину стандартной скорости — они предназначены для работы, которая может ждать минуты или часы, например массовая классификация, внедрение, автономное суммирование или ночное создание отчетов. Приоритетная обработка работает по-другому: вы платите больше, чем стандартно, чтобы получить более быструю, более постоянную задержку и лучшую надежность во время пиков нагрузки, что важно для интерактивных вызовов, обращенных к пользователю. Токены идентичны; вы платите за то, насколько быстро и надежно они обслуживаются.
Сколько на самом деле может сэкономить пакетная или гибкая обработка?
Скидка обычно составляет около 50 % от стандартной ставки, поэтому каждый фрагмент трафика, который вы можете перенести на пакетный или гибкий уровень, стоит примерно половину. Загвоздка заключается в задержке: возврат пакетных заданий может занять до суток, а гибкие запросы могут выполняться медленнее или иногда помещаться в очередь, поэтому квалифицируется только действительно отложенная работа. Рычаг — это доля вашего объема, которая может выдержать ожидание — конвейер, который на 80 % состоит из офлайн-пакетов и на 20 % в интерактивном режиме, обеспечивает общую экономию около 40 %, в то время как полностью интерактивный продукт таким образом ничего не экономит.
Стоит ли приоритетная обработка переплаты?
Только для трафика, где задержка имеет реальную ценность — поток оформления заказа, работающий агент, все, чего ожидает пользователь — и только для этого фрагмента, а не всего вашего объема. Приоритет обычно стоит значительно дороже, чем стандартный, за токен, поэтому передача на него всего трафика — самый дорогой способ запуска. Честный тест заключается в том, стоит ли более быстрый и надежный ответ дополнительных долларов, которые он добавляет, и этот калькулятор печатает как отдельное число: премию за приоритет в долларах в месяц для выбранной вами критической доли.
Как на практике разделить трафик по уровням?
Начните с маркировки каждого пути вызова с указанием допустимой задержки. Все, чего пользователь не ждет активно — ночные задания, повторные заполнения, оценки, массовое обогащение — отправляется в пакетную или гибкую обработку по сниженной цене. Все, чего ожидает пользователь, но не имеет критического значения для задержки, остается стандартным. Оставьте приоритет для узкого набора интерактивных путей, где медленный или пропущенный ответ будет стоить вам денег. Затем установите здесь эти три доли, чтобы увидеть смешанную ставку и экономию по сравнению с использованием всего стандартного.