28 de julio de 2026 · IA y LLM · Lectura de 6 minutos
El mes pasado incorporé todo un conjunto de documentación (alrededor de 50 millones de tokens de texto) y el proyecto de ley OpenAI llegó a su fin. un dolar. Un solo dólar. De hecho, releí la factura porque estaba seguro de que se me había caído un decimal. Las incrustaciones son lo más barato de toda la pila de IA, tan baratas que comparar proveedores sólo por la tasa de incrustación es casi inútil. El número que realmente te hará daño está en otra parte, y llegaré a él. Pero primero, los precios reales, porque la gente todavía pregunta.
Estas son las tasas de entrada de pago por uso que sigo. Las incrustaciones solo cobran por la entrada: envías texto, recuperas vectores, no hay ningún lado de "token de salida" en la factura. Todo lo que aparece a continuación son dólares por millón de tokens de texto incrustados.
| Modelo | Precio / 1 millón de tokens | Dimensiones | Notas |
|---|---|---|---|
| Incrustación de texto OpenAI-3-pequeño | $0.02 | 1536 | La elección del valor predeterminado |
| Viaje-3-lite | $0.02 | 512 | Vectores baratos + pequeños |
| Viaje-3 | $0.06 | 1024 | Fuerte calidad de recuperación |
| Cohere Insertar v3 | $0.10 | 1024 | Buen multilingüe |
| Mistral Insertar | $0.10 | 1024 | Opción alojada en la UE |
| Incrustación de texto OpenAI-3-grande | $0.13 | 3072 | La mejor calidad de OpenAI |
| Google gemini-incrustación-001 | $0.15 | 3072 | Generoso nivel gratuito primero |
La diferencia entre el más barato y el más caro es aproximadamente 7× — 0,02 dólares a 0,15 dólares. Eso suena dramático hasta que lo multiplicas por un corpus realista y ves cuán pequeños siguen siendo los números absolutos.
Aquí está el costo único para incorporar tres tamaños de corpus. 50M tokens es un sitio de documentos o una base de conocimientos de tamaño mediano. 200M es el centro de ayuda completo más el historial de un producto importante. 1B es a escala empresarial: piense en cada ticket de soporte que haya presentado.
| Cuerpo | 3 pequeños / Voyage-lite | Viaje-3 | Coheré / Mistral | 3-grande | Géminis |
|---|---|---|---|---|---|
| 50M tokens | $1.00 | $3.00 | $5.00 | $6.50 | $7.50 |
| 200 millones de fichas | $4.00 | $12.00 | $20.00 | $26.00 | $30.00 |
| 1 billón de fichas | $20.00 | $60.00 | $100.00 | $130.00 | $150.00 |
Incluso con mil millones de tokens, la opción más cara aquí es de 150 dólares. una vez. Su lado de consultas es incluso más barato: una aplicación RAG que incorpora un millón de preguntas de usuarios al mes a ~80 tokens cada una quema 80 millones de tokens, lo que cuesta $1,60 por 3 unidades pequeñas. Nunca he visto que la línea de pedido de inserción supere ni siquiera el 2% de la factura mensual de un producto de IA. Entonces, ¿por qué a alguien le importa cuál eliges?
Mire nuevamente la columna de dimensiones. Esa es la cifra que realmente cuesta dinero, y lo cuesta cada mes, no una vez. Una base de datos vectorial te cobra por almacenar y buscar esos vectores, y el precio escala con cuantas dimensiones tiene cada uno. incrustación de texto-3-grande produce 3072 dimensiones vectores. Voyage-3-lite produce 512. eso es un 6× diferencia en almacenamiento y memoria para exactamente los mismos documentos.
Por lo tanto, incorporar el modelo "premium" de 0,13 dólares no sólo cuesta 6 veces más, sino que también puede costar varias veces más. anfitrión, para siempre. En una base de datos vectorial administrada, unos pocos millones de vectores de 3072 atenuaciones almacenados en la memoria son una línea de pedido mensual real, mientras que el mismo corpus con 512 atenuaciones podría caber en un nivel libre o casi libre. La API de inserción es un error de redondeo. El índice que alimenta es el cargo recurrente. Calculé el precio del lado de almacenamiento por separado en el Desglose de piña vs pgvector – ahí es donde realmente vive el dinero.
Se incluyen incrustaciones de diferentes modelos. no compatible. Un vector de OpenAI no significa nada para un índice Cohere. Entonces, el día que decida cambiar de proveedor, o incluso actualizar de 3 pequeños a 3 grandes, debe Vuelva a insertar todo su corpus desde cero. y reconstruir el índice. Ese trabajo de 1 dólar es barato de ejecutar una vez; Es molesto ejecutarlo porque intercambiaste modelos seis meses después y ahora cada vector almacenado es basura.
Es por eso que la decisión inteligente no es "elegir el token más barato". Se trata de "elegir un modelo cuyo recuento de dimensiones su base de datos vectorial pueda permitirse albergar y cuya calidad de recuperación sea lo suficientemente buena como para que nunca necesite volver a incrustarlo". Para la mayoría de la gente, la respuesta es incrustación de texto-3-pequeño o Voyage-3-lite: dos centavos el millón de tokens, vectores pequeños, calidad que se mantiene. Se opta por 3 grandes o un reranker solo cuando la calidad de recuperación falla de manera mensurable, no de manera predeterminada.
Yo por defecto text-embedding-3-small. Cuesta $ 0,02/1 millón, los vectores tienen 1536 dimensiones manejables y OpenAI le permite acortarlos aún más si su base de datos tiene poca memoria. Cuando necesito una mejor recuperación multilingüe, pruebo Voyage o Cohere en mi propio conjunto de evaluación antes de comprometerme, porque cambiar más tarde significa volver a incrustar todo. Y presupuesto la base de datos vectorial como costo real, no la API. Haga sus propios números antes de comprometerse con un recuento de dimensiones por el que tendrá que pagar cada mes:
¿Es nuevo en los precios de API basados en el uso? Comience con el guías gratuitas de costos de API. Y si está creando la aplicación de recuperación completa, las incrustaciones son la tercera opción más económica; consulte ¿Cuánto cuesta el lado LLM después del almacenamiento en caché? dónde va el dinero real por llamada.
Los precios son tarifas de lista de proveedores según lo registrado en nuestro catálogo (julio de 2026) y son estimaciones de referencia: confirme las tarifas actuales en la página de precios de cada proveedor antes de realizar el presupuesto. Los recuentos de dimensiones son resultados del modelo predeterminados; algunos modelos (incluido el de OpenAI) admiten el acortamiento. Los costos del corpus son únicos; El almacenamiento de bases de datos vectoriales es recurrente y se factura por separado.