HomeBlog › Сравнение стоимости API для встраивания

Сколько на самом деле стоят встраивания: OpenAI против Cohere против Voyage против Gemini (2026 г.)

28 июля 2026 г. · AI и LLM · Чтение: 6 мин.

В прошлом месяце я внедрил целый набор документации — около 50 миллионов текстовых токенов — и законопроект об OpenAI был принят. один доллар. Один доллар. На самом деле я перечитал счет, потому что был уверен, что опустил десятичную дробь. Встраивания — самая дешевая вещь во всем стеке ИИ, настолько дешевая, что сравнивать поставщиков только по скорости внедрения практически бессмысленно. Число, которое на самом деле причинит вам боль, находится где-то в другом месте, и я доберусь до него. Но сначала реальные цены, потому что люди все равно спрашивают.

Реальные цены 2026 года за 1 миллион токенов

Это ставки ввода с оплатой по мере использования, которые я отслеживаю. Встраивания взимают плату только за ввод — вы отправляете текст, получаете обратно векторы, в счете нет стороны «выходной токен». Все, что указано ниже, представляет собой доллары за один миллион токенов встроенного текста.

МодельPrice / 1M tokensРазмерыПримечания
OpenAI text-embedding-3-маленький$0.021536Выбор значения по умолчанию
Voyage-3-lite$0.02512Cheap + tiny vectors
Вояж-3$0.061024Высокое качество поиска
Cohere Встроить v3$0.101024Хороший многоязычный
Мистраль Встроить$0.101024вариант с хостингом в ЕС
OpenAI text-embedding-3-большой$0.133072Лучшее качество OpenAI
Google Gemini-Embedding-001$0.153072Щедрый бесплатный уровень в первую очередь

Разброс от самых дешевых до самых дорогих примерно равен — от 0,02 до 0,15 доллара. Это звучит драматично, пока вы не умножите это на реалистичный корпус и не увидите, насколько малы абсолютные числа.

Сколько стоит встраивание реального корпуса

Вот единовременная стоимость внедрения трех размеров корпуса. 50M tokens — это сайт документации или база знаний среднего размера. 200M — это полный справочный центр и история большого продукта. 1B — это корпоративный масштаб — подумайте о каждом обращении в службу поддержки, которое вы когда-либо отправляли.

Корпус3-малый / Вояж-лайтВояж-3Когере / Мистраль3-большойБлизнецы
50 миллионов токенов$1.00$3.00$5.00$6.50$7.50
200 миллионов токенов$4.00$12.00$20.00$26.00$30.00
1B токенов$20.00$60.00$100.00$130.00$150.00

Даже при миллиарде токенов самый дорогой вариант здесь — 150 долларов — один раз. Ваша сторона запроса еще дешевле: приложение RAG, которое встраивает один миллион пользовательских вопросов в месяц по ~ 80 токенов каждый, сжигает 80 миллионов токенов, что составляет 1,60 доллара США для 3-small. Я никогда не видел, чтобы позиция по внедрению превышала хотя бы 2% ежемесячного счета за продукт AI. Так почему кого-то волнует, какой из них вы выберете?

Настоящий счет — это база данных векторов.

Вернитесь к столбцу размеров. Это сумма, которая на самом деле стоит денег, и она стоит их каждый месяц, а не один раз. База данных векторов взимает с вас хранить и искать эти векторы, а цена зависит от того, сколько измерений имеет каждый из них. text-embedding-3-large производит 3072-мерное измерение векторы. «Вояж-3-лайт» производит 512. Это 6-кратная разница в памяти и памяти по тем же самым документам.

Таким образом, «премиальная» модель стоимостью 0,13 доллара не просто стоит в 6 раз дороже — она может стоить в несколько раз дороже. хозяин, навсегда. В управляемой векторной базе данных несколько миллионов векторов размером 3072 тусклых, находящихся в памяти, представляют собой реальную ежемесячную статью расходов, в то время как тот же корпус с 512 тусклыми изображениями может поместиться на бесплатном или почти бесплатном уровне. API внедрения — это ошибка округления. Индекс, который он подает, представляет собой периодический платеж. Я оценил сторону хранения отдельно в Сосновая шишка и разбивка pgvector — вот где на самом деле живут деньги.

Ловушка, о которой вас никто не предупреждает

Вложения от разных моделей есть. не совместимо. Вектор из OpenAI ничего не значит для индекса Cohere. Поэтому в тот день, когда вы решите сменить провайдера или даже перейти с 3-х маленьких на 3-х больших, вам придется заново встроить весь корпус с нуля и перестроить индекс. Эту работу стоимостью 1 доллар дешево выполнить один раз; запускать его раздражает, потому что вы поменяли модели шесть месяцев назад, и теперь каждый сохраненный вектор — мусор.

Вот почему разумным решением не будет «выбирать самый дешевый токен». Это «выбрать модель, размерность которой может позволить себе разместить ваша векторная БД, и качество извлечения которой достаточно хорошее, и вам никогда не придется повторно встраивать ее». Для большинства людей ответом будет text-embedding-3-small или Voyage-3-lite: два цента за миллион жетонов, небольшие векторы, стабильное качество. Вы достигаете 3-крупного или реранкера только тогда, когда качество поиска заметно ухудшается, а не по умолчанию.

Что я на самом деле делаю

Я по умолчанию встраивание текста-3-маленький. Это 0,02 доллара США за 1 миллион долларов, векторы представляют собой управляемые 1536 измерений, и OpenAI позволяет вам сокращать их еще больше, если в вашей БД не хватает памяти. Когда мне нужно улучшить многоязычный отзыв, я тестирую Voyage или Cohere на своем собственном тестовом наборе перед фиксацией, поскольку более позднее переключение означает повторное встраивание всего. И я рассчитываю реальную стоимость векторной базы данных, а не API. Проведите собственные расчеты, прежде чем приступать к подсчету измерений, за которые вам придется платить каждый месяц:

Вы впервые узнали о ценах на API в зависимости от использования? Начните с бесплатные руководства по стоимости API. А если вы создаете полнофункциональное приложение для извлечения данных, встраивание — третье дешевое решение — см. сколько стоит сторона LLM после кэширования куда идут реальные деньги за звонок.

Цены представляют собой справочные цены поставщиков, указанные в нашем каталоге (июль 2026 г.), и являются справочными — перед составлением бюджета проверьте текущие цены на странице цен каждого поставщика. Подсчеты измерений являются выходными данными модели по умолчанию; некоторые модели (включая OpenAI) поддерживают сокращение. Затраты на корпус являются единовременными; Хранение векторной базы данных является периодическим и оплачивается отдельно.