Cómo utilizar este glosario
Las páginas de precios de API e IA están llenas de jerga que oculta lo que realmente pagarás. A continuación se muestran 40 de los términos más comunes, agrupados en Precios y tokens de LLM, infraestructura y autohospedaje, y modelos de facturación. Cada definición es neutral en cuanto al proveedor y se centra en el ángulo de los costos. ¿Nuevo en facturación de LLM? Comience con nuestro cómo funcionan los precios de LLM API guía, luego estima un número real con la calculadora de costo simbólico.
Calculadora de costo de token →Todas las guías de aprendizaje →Precios y tokens de LLM
- Simbólico
- La pequeña unidad de texto que un LLM lee y escribe: en inglés, aproximadamente ¾ de palabra, o aproximadamente 4 caracteres. La facturación es por token, por lo que el recuento de tokens (no el número de solicitudes) determina su factura de LLM.
- Fichas de entrada
- The tokens you send to the model: your prompt, system instructions, conversation history and any attached context. Suelen ser las más económicas de las dos tarifas, pero se multiplican rápidamente cuando reenvías el contexto en cada llamada.
- Fichas de salida
- Los tokens que genera el modelo en su respuesta. La salida casi siempre tiene un precio más alto que la entrada (comúnmente entre 3 y 5 veces más) porque generar texto cuesta más computación que leerlo.
- ventana contextual
- La cantidad máxima de tokens que un modelo puede considerar a la vez (por ejemplo, 128K o 1M). Se trata de un límite de capacidad, no de espacio libre: cada token que coloques en la ventana se factura en cada llamada.
- Costo por millón de tokens
- Los precios unitarios estándar de LLM se cotizan en tokens ($/1 millón), y se enumeran por separado para entrada y salida. Multiplicar su volumen de tokens mensual por estas tasas es la forma más rápida de estimar el gasto.
- Almacenamiento en caché rápido
- Almacenar un prefijo de aviso repetido (un mensaje o documento largo del sistema) para que no se reprocese en cada llamada. La entrada almacenada en caché se factura con un gran descuento (a menudo entre un 75% y un 90%), lo que reduce el costo de las cargas de trabajo repetitivas.
- fichas de razonamiento
- Las fichas de "pensamiento" ocultas que generan algunos modelos antes de su respuesta visible. No los ve, pero se facturan como resultado: un factor de costo importante y que fácilmente se pasa por alto en los modelos de razonamiento.
- Fichas multimodales
- Las imágenes, el audio y el vídeo se convierten en equivalentes de tokens para la facturación. Una única imagen de alta resolución puede costar cientos o miles de tokens de entrada, por lo que las indicaciones multimodales se acumulan más rápido que el texto solo.
- Tarifa combinada
- Un precio promedio único por token que combina tasas de entrada y salida de acuerdo con su combinación típica. Útil para estimaciones rápidas, aunque oculta que la producción es la mitad cara de la factura.
- API por lotes
- Un punto final asincrónico que procesa trabajos grandes dentro de un período de retraso (a menudo de hasta 24 horas) a cambio de un descuento, normalmente alrededor del 50 %. Ideal para trabajos no urgentes como clasificación a granel o incrustaciones.
- Incrustaciones
- Vectores numéricos que representan el significado de texto, imágenes u otros datos para que puedan ser buscados por similitud. Son baratos de generar por token y sustentan la búsqueda semántica y RAG.
- Sintonia FINA
- Entrene aún más un modelo base con sus propios ejemplos para especializar su comportamiento. Agrega un costo de capacitación inicial y, en los modelos alojados, a menudo una tasa de inferencia por token más alta que el modelo base.
- RAG (Generación aumentada de recuperación)
- Un patrón que recupera solo los fragmentos relevantes de una base de conocimientos y los agrega al mensaje, en lugar de poner documentos completos en contexto. Recorta los tokens de entrada y mantiene las respuestas basadas en tus datos.
- Nivel de modelo (buque insignia/medio/nano)
- Los proveedores ofrecen familias de modelos con diferentes capacidades y niveles de precio: buque insignia (el más capaz, más caro), de rango medio (equilibrado) y nano/pequeño (el más barato, más rápido). Hacer coincidir el nivel con la dificultad de la tarea es el mayor factor de coste.
- Temperatura
- Una configuración de 0 a aproximadamente 2 que controla la aleatoriedad en la salida. Afecta el estilo de respuesta, no el precio directamente, pero valores más altos pueden producir respuestas más largas o más variadas que modifican el costo del token de producción.
- Llamada a función/herramienta
- Permitir que el modelo devuelva una solicitud estructurada para ejecutar una de sus herramientas o API definidas. Las definiciones de herramientas se envían como tokens de entrada en cada llamada y los bucles de herramientas de varios pasos multiplican el uso total de tokens.
- Transmisión
- Entregar la salida del modelo token por token a medida que se genera en lugar de en un bloque. Mejora la velocidad percibida y reduce el tiempo para obtener el primer token, pero no cambia el precio total del token.
- Destilación
- Entrenar un modelo de "estudiante" más pequeño para imitar un modelo de "maestro" más grande. El resultado es mucho más económico por token y al mismo tiempo conserva gran parte de la calidad en un conjunto específico de tareas.
- Cuantización
- Reducir la precisión numérica de los pesos de un modelo (por ejemplo, de 16 bits a 4 bits) para que necesite menos memoria y se ejecute más rápido. Para los autohospedadores, esto reduce el costo de la GPU, generalmente con una pequeña compensación por la calidad.
- Inferencia
- Ejecutar un modelo entrenado para producir un resultado: el acto por el que paga en cada llamada a la API. El costo de inferencia aumenta con tokens en API alojadas y con tiempo de procesamiento en GPU autohospedadas.
Infraestructura y autohospedaje
- Límite de velocidad (RPM/TPM)
- Los límites que un proveedor impone por cuenta: RPM son solicitudes por minuto, TPM son tokens por minuto. Superar cualquiera de los dos devuelve un error 429, por lo que la escala requiere procesamiento por lotes, cola o un nivel superior.
- Límite de concurrencia
- El número máximo de solicitudes permitidas en vuelo al mismo tiempo. Limita la cantidad de trabajos paralelos que puedes ejecutar y, en configuraciones autohospedadas o aprovisionadas, dimensiona directamente el hardware por el que debes pagar.
- TTFT / latencia
- TTFT (tiempo hasta el primer token) es el tiempo que transcurre antes de que llegue el primer token de salida; La latencia es el tiempo total de respuesta. Dan forma a la experiencia del usuario y, en las GPU alquiladas, una latencia más larga significa más procesamiento facturado por solicitud.
- Rendimiento
- Cuántos tokens o solicitudes procesa un sistema por segundo. Un mayor rendimiento atiende a más usuarios en el mismo hardware, lo que reduce el costo por solicitud cuando usted mismo aloja o reserva capacidad.
- Base de datos vectorial
- Una tienda optimizada para guardar incrustaciones y buscarlas por similitud. Impulsa RAG y la búsqueda semántica, y generalmente su precio se basa en vectores, dimensiones y consultas almacenados en lugar de tokens.
- GPU/VRAM
- El procesador de gráficos y su memoria de video que ejecutan la inferencia de modelos. Un modelo debe caber en VRAM para cargarse, por lo que los modelos más grandes exigen GPU más caras y con mayor memoria: el costo central del autohospedaje.
- Autohospedaje
- Ejecutar un modelo abierto en su propio hardware o en hardware alquilado en lugar de llamar a una API alojada. Elimina las tarifas por token, pero agrega costos fijos de GPU, ingeniería y capacidad inactiva que solo se amortizan en grandes volúmenes.
- Salida/ancho de banda
- El cargo por los datos que salen de la red de un proveedor de nube. Fáciles de olvidar en los presupuestos de IA, las tarifas de salida pueden ser significativas cuando se mueven grandes conjuntos de datos, pesos de medios o modelos entre servicios o regiones.
- Arranque en frío (sin servidor)
- El retraso cuando una función sin servidor o un contenedor de modelo sale de inactivo antes de que pueda responder. Agrega latencia y, para modelos grandes con tiempos de carga prolongados, puede impulsarlo hacia una capacidad siempre activa que cuesta más.
- Rendimiento aprovisionado
- Reservar una cantidad fija y garantizada de capacidad de modelo por una tarifa fija por hora o mensual en lugar de pagar por token. Estabiliza el costo y la latencia para un tráfico constante de gran volumen, pero desperdicia dinero cuando está inactivo.
- Spot versus bajo demanda
- Las instancias bajo demanda están disponibles en cualquier momento a precio completo; Las instancias puntuales (preemprentibles) utilizan capacidad sobrante con un gran descuento, pero pueden recuperarse sin previo aviso. Spot se adapta a trabajos por lotes interrumpibles, no a entregas de latencia crítica.
- Uso comprometido/capacidad reservada
- Un descuento a cambio de comprometerse con un gasto mínimo o hardware específico durante uno a tres años. Reduce la tasa efectiva para cargas de trabajo predecibles pero lo bloquea.
- SLA (tiempo de actividad)
- Un acuerdo de nivel de servicio es la promesa contractual de disponibilidad del proveedor (por ejemplo, 99,9%) y los créditos adeudados si no la cumplen. Los niveles de SLA más altos suelen costar más, pero son importantes para la confiabilidad de la producción.
Modelos de facturación y precios
- Precios por asiento versus precios basados en el uso
- Por asiento cobra una tarifa fija para cada usuario independientemente de su actividad; cargos basados en el uso para lo que realmente consume (tokens, llamadas, computación). Los asientos son predecibles; el uso aumenta con la demanda y puede aumentar inesperadamente.
- Créditos
- Saldo prepago que compras y retiras a medida que utilizas un servicio. Los créditos facilitan la facturación, pero pueden caducar y su valor por unidad a veces oscurece el precio real por token o por llamada.
- Exceso
- El uso que excede la asignación incluida de su plan se factura a una tarifa separada, a menudo más alta. Los cargos por excedente son una fuente común de facturas sorpresa cuando el tráfico excede el nivel al que se registró.
- Nivel gratuito
- Una asignación sin costo (un crédito mensual, llamadas limitadas o una ventana de prueba) para permitirle evaluar un servicio. Es útil para pruebas, pero rara vez es suficiente para producción, y se aplican límites o fechas de vencimiento.
- TCO (coste total de propiedad)
- El costo total de ejecutar una solución: no solo las tarifas de API o GPU, sino también ingeniería, monitoreo, almacenamiento, salida y gastos generales. Comparar alojamiento alojado con alojamiento propio solo tiene sentido en términos del TCO, no de las tasas generales.
- Costo por usuario
- Su gasto total en IA o API dividido por los usuarios activos. Convierte el uso bruto en una unidad económica que se puede comparar con los ingresos o el precio de suscripción para comprobar si una función es rentable.
- Marcado de puerta de enlace/enrutador
- La tarifa que una puerta de enlace de IA o un enrutador modelo agrega al precio del proveedor subyacente por enrutamiento, respaldo, análisis o facturación unificada. Conveniente, pero el margen de beneficio puede aumentar significativamente su costo efectivo por token.
Preguntas frecuentes
¿Qué es una ficha?
Un token es la pequeña porción de texto que un LLM lee y genera; en inglés, aproximadamente ¾ de una palabra, o aproximadamente 4 caracteres. Los proveedores facturan por token tanto por el texto que envía (entrada) como por el texto que produce el modelo (salida), razón por la cual el recuento de tokens, no el recuento de solicitudes, genera una factura de LLM.
¿Qué es el almacenamiento en caché rápido?
El almacenamiento en caché de mensajes permite a un proveedor almacenar un prefijo repetido, como un mensaje o documento largo del sistema, para que no se vuelva a procesar en cada llamada. Los tokens de entrada almacenados en caché se facturan con un gran descuento (a menudo entre un 75% y un 90%), lo que reduce el costo de las cargas de trabajo que reenvían el mismo contexto.
¿Qué significan TPM y RPM en un límite de velocidad?
RPM son solicitudes por minuto y TPM son tokens por minuto: los dos límites que un proveedor impone en su cuenta. Al presionar cualquiera de los dos se devuelve un error 429, por lo que las aplicaciones de gran volumen deben agruparse, ponerse en cola o solicitar un nivel superior en lugar de asumir un rendimiento ilimitado.
Solo referencia educativa: los términos de precios y los descuentos varían según el proveedor; Confirme los detalles actuales en la página de precios de cada proveedor.