Cómo funcionan los precios de la API de LLM

Tokens, entrada versus salida, ventanas de contexto: por qué la misma tarea puede costar 50 veces más en un modelo que en otro, explicado de forma sencilla.

Hogar › Aprender › Hospedaje propio de un LLM versus pago por llamada API

Autohospedaje de un LLM frente a pago por llamada API

Una vez que su factura de API crece, llega el pensamiento tentador: ¿por qué no ejecutar un modelo abierto en nuestro propio hardware y dejar de pagar por token? A veces ese es el movimiento correcto. Muchas veces no lo es. Esta guía establece los costos reales de ambos lados para que pueda encontrar su punto de equilibrio en lugar de adivinar.

Dos formas de costes muy diferentes

La principal diferencia es la forma del costo. Una API alojada es costo variable puro: paga por token, nada cuando está inactivo y escala sin problemas desde una llamada hasta millones. El autohospedaje es costo principalmente fijo: alquilas o compras GPU que cuestan lo mismo ya sea que estén ocupadas o inactivas, más el tiempo de ingeniería para ejecutarlas.

Esa única diferencia impulsa toda la decisión. Las API ganan cuando el uso es bajo, intenso o impredecible. El autohospedaje sólo puede ganar cuando el uso es alto, constante y lo suficientemente predecible como para mantener ocupado el costoso hardware.

Lo que realmente cuesta el autohospedaje

El alquiler o la compra de GPU es solo el número principal. La factura completa incluye:

  • Calcular, instancias de GPU con precio por hora, que pagas las 24 horas del día, los 7 días de la semana si quieres que el modelo esté siempre disponible.
  • tiempo de ingenieria, para implementar, optimizar, monitorear, parchear y mantener el servicio en funcionamiento. Se trata de un coste salarial recurrente, no puntual.
  • Desperdicio inactivo, cada hora que su GPU permanece por debajo de su utilización total es dinero gastado en vano.
  • Gastos generales de confiabilidad, redundancia, conmutación por error y escalamiento para picos de tráfico, que una API alojada maneja por usted de manera invisible.

Los equipos subestiman habitualmente a los últimos tres. La factura de la GPU es visible; los humanos y el tiempo libre no lo son.

Qué incluye el precio de la API

Cuando paga por token a un proveedor alojado, no solo está comprando computación. Estás comprando el hardware, el tiempo de actividad, el escalamiento, la seguridad, el equipo de operaciones y la capacidad de pasar de cero a un volumen enorme al instante. El precio por token incluye todo eso.

También está libre de planificación de capacidad. No hay decisión sobre cuántas GPU mantener calientes, ni página de las 3 a.m. cuando un nodo muere. Para muchos equipos, ese alivio operativo vale más que el margen informático bruto que cobra el proveedor.

La lógica del equilibrio

El punto de equilibrio se trata de utilización. Una GPU autohospedada tiene un costo mensual aproximadamente fijo y un rendimiento máximo de tokens que puede producir. Divida el costo mensual por los tokens que realmente envía para obtener su costo efectivo por token. Si su tráfico mantiene la GPU casi a plena carga, ese costo efectivo puede socavar la API. Si la GPU está medio inactiva, su costo efectivo por token se duplica y es probable que gane la API.

Ejemplo ilustrativo (números inventados): si una instancia de GPU cuesta $1500/mes y, de manera realista, puede servir, digamos, 500 millones de tokens/mes a pleno rendimiento, su costo mínimo es de $3 por millón de tokens, pero solo si realmente usa los 500 millones. Si ejecuta sólo 100 millones, su coste real será de 15 dólares por millón, cinco veces peor. Compare esa cifra efectiva con la tasa API en las páginas de comparación de modelos.

Diferencias de calidad y capacidad.

El costo no es el único eje. Los modelos de frontera más sólidos generalmente están disponibles solo a través de API alojadas, mientras que el autohospedaje significa ejecutar modelos abiertos, que son excelentes pero pueden estar a la zaga de los mejores modelos cerrados en las tareas más difíciles. Si su caso de uso necesita capacidades de primer nivel, es posible que el autohospedaje ni siquiera sea una opción.

Por otro lado, el autohospedaje le brinda control de datos (nada sale de su infraestructura), sin límites de tarifas más allá de su propio hardware y sin cambios de precios de proveedores. Para industrias reguladas o datos sensibles a la privacidad, estos pueden compensar un costo efectivo más alto.

Un camino de decisión práctico

Una regla general razonable:

  • Comience en una API alojada. Es la forma más económica de alcanzar un volumen real y validar su producto sin desembolso de capital.
  • Realice un seguimiento de su gasto mensual. Cuando crezca de manera grande y constante, modele honestamente la alternativa de autohospedaje, incluido el tiempo de ingeniería y la utilización realista (no teórica).
  • Considere un híbrido. Realice tareas simples de gran volumen en un pequeño modelo abierto autohospedado y enrute consultas difíciles a una API de frontera alojada.

Utilice la calculadora de costos de LLM para fijar el precio de su uso actual de API y luego compárelo con una estimación de alojamiento propio completamente cargada. No olvide incluir el costo salarial de las personas que lo ejecutarán; esa línea es lo que la mayoría de los cálculos de equilibrio omiten silenciosamente.

Preguntas frecuentes

¿En qué momento el autohospedaje se vuelve más barato?

Solo cuando su uso sea lo suficientemente alto y estable como para mantener las costosas GPU cerca de su plena utilización, y después de tener en cuenta el tiempo de ingeniería. Con un volumen bajo o elevado, una API alojada casi siempre es más barata.

¿Puedo ejecutar yo mismo el mismo modelo de calidad?

Puede ejecutar modelos sólidos de peso abierto, pero los modelos de frontera más capaces suelen ser solo API. Si su tarea necesita un rendimiento de primer nivel, es posible que el autohospedaje no sea suficiente.

¿Qué costo olvida la gente cuando se autohospeda?

Tiempo de ingeniería y operaciones, más horas de GPU inactiva. La factura del hardware es visible, pero los salarios para ejecutarlo y la capacidad que se paga pero no se utiliza son los costos que hunden la mayoría de las estimaciones.

Sólo educación, no asesoramiento financiero.