7 сентября 2026 г. · AI и LLM · Чтение 5 минут
Я оценивал поставщика быстрого вывода для рабочей нагрузки агента, работающего с открытой моделью класса 70B, и три имени, которые продолжают появляться — Groq, Together AI, Fireworks — все указывают цену за токен, которая на первый взгляд выглядит одинаково. Это не так. На моделях класса Llama-70B Грок работает над 0,59 доллара США на входе / 0,79 доллара США на выходе за 1 миллион токенов, Вместе AI — это квартира $0.88 / $0.88, а Fireworks выставляет смешанные счета ~$0,90 за 1 миллион для своего уровня 16–80B. При реалистичном разделении ввода/вывода 70/30 это Разница в 250 долларов в месяц между Groq и Fireworks, как только вы продаете миллиард токенов — и самый дешевый из них не является автоматически правильным выбором.
Все три используют модели с открытым весом — Llama, Qwen, Mixtral, DeepSeek — на базе API-интерфейсов, совместимых с OpenAI, поэтому смена поставщика обычно представляет собой изменение базового URL-адреса. Вот сколько фактически стоит вывод о классе Llama-70B для каждого из них, взятый с их собственных страниц цен:
| Поставщик | Модель | Ввод $/1 млн. | Выход $/1 млн. |
|---|---|---|---|
| Грок | Лама 3.3 70Б | $0.59 | $0.79 |
| Вместе ИИ | Лама 3.1 70Б | $0.88 | $0.88 |
| Фейерверк | Средний уровень (16–80B, например Лама 70B) | ~$0,90 смешанный | |
Groq является самым дешевым на бумаге для типичной рабочей нагрузки в форме чата — больше входных токенов, чем выходных — потому что его входная цена на 33% ниже фиксированной ставки Together. Вместе ИИ оценивает входные и выходные данные одинаково, что проще прогнозировать, но затраты на подсказки с большим объемом ввода фактически отправляются большинством рабочих нагрузок RAG и агентов. Fireworks вообще не разделяет ввод/вывод; его ~ 0,90 доллара США — это единая смешанная ставка для всего класса моделей 16–80B, что упрощает оценку, но означает, что вы не можете оптимизировать за счет сокращения длины вывода, как это можно сделать на Groq или Together.
Более низкая цена Groq обусловлена той же причиной, что и его скорость: специальным оборудованием LPU (Language Processing Unit), созданным специально для генерации токенов, а не графическими процессорами общего назначения. Это также является реальным преимуществом Groq по сравнению с двумя другими — сотни токенов в секунду, что значительно превышает то, что обычно обеспечивает обслуживание на основе H100. Для голосового агента или пользовательского интерфейса чата, где пользователь наблюдает за курсором, эта разница в задержке имеет большее значение, чем разница в 0,29 доллара США за 1 миллион входных токенов. Подвох: каталог моделей Groq, размещенный на хостинге, уже, чем у Together или Fireworks, и не предлагает выделенной емкости или точной настройки — если нужная вам модель отсутствует в списке Groq, цена перестает быть решающим фактором.
Together AI предлагает самый широкий каталог открытых моделей из трех (Llama, Mixtral, Qwen, DeepSeek и другие), а также тонкую настройку и выделенные конечные точки, поэтому, если задача состоит в том, чтобы «запустить мой собственный точно настроенный вариант», а не «вызвать стандартную модель», фиксированные, легко прогнозируемые цены и инструменты Together выигрывают у более узкой и скоростной линейки Groq. Fireworks находится в аналогичном положении — цена за бессерверный токен для быстрого запуска, а также выделенное развертывание за час использования графического процессора для команд, которым нужна зарезервированная пропускная способность и предсказуемая задержка в масштабе, что ни фиксированный каталог Groq, ни установка «сначала без сервера» Together не покрывают таким же образом. Оба варианта являются лучшим вариантом по умолчанию, если для рабочей нагрузки требуется нечто большее, чем «самые дешевые токены для поддерживаемой модели».
Предполагая реалистичное разделение входных данных на 70 % и выходных данных на 30 %, типичное для чата и подсказок в стиле RAG:
| Токенов/месяц | Грок | Вместе ИИ | Фейерверк |
|---|---|---|---|
| 10 миллионов (небольшое приложение) | $6.50 | $8.80 | $9.00 |
| 100 миллионов (постоянный продукт) | $65 | $88 | $90 |
| 1 миллиард (агент высокой пропускной способности) | $650 | $880 | $900 |
Разрыв масштабируется линейно с объемом, поскольку все три цены представляют собой чистую цену за токен без каких-либо минимальных или уровней плана в самой модели — при 1 миллиарде токенов в месяц 650 долларов Groq против 900 долларов Fireworks — это реальная разница в 250 долларов, а не ошибка округления. Но ни одно из этих чисел не учитывает, что происходит, когда нужная вам модель отсутствует у более дешевого поставщика или когда скорость Groq снижает ваши эффективные затраты в другом месте — меньше повторных попыток, более короткие пользовательские сеансы, меньше необходимости агрессивного кэширования только для того, чтобы скрыть задержку.
Продукт, чувствительный к задержке (голос, чат, все, на что пользователь смотрит во время потоковой передачи): начните с Groq, если ваша модель есть в его списке — фактическое решение для продукта — это скорость, и она также оказывается дешевле. Вам нужна точно настроенная или менее распространенная открытая модель или вам нужна выделенная емкость с предсказуемой пропускной способностью: Together AI или Fireworks, и выбирайте в зависимости от того, цените ли вы более широкий каталог Together или выделенную опцию Fireworks для графических часов. Запуск всех трех одновременно не является необоснованным — API-интерфейс, совместимый с OpenAI, означает, что код не меняется, а только базовый URL-адрес и счет.
Вы впервые начали устанавливать цены на ИИ на основе использования? Начните с бесплатные руководства по стоимости API. О стороне закрытой модели того же решения см. GPT против Claude против Gemini: сколько на самом деле стоит одна и та же рабочая нагрузка.
Цены сверены с официальными страницами цен Groq, Together AI и Fireworks, последняя проверка 15 августа 2026 г. Справочные оценки — наличие модели, оптовые скидки и согласованные корпоративные тарифы различаются; подтвердите текущие цены перед составлением бюджета.