Cómo funcionan los precios de la API de LLM

Tokens, entrada versus salida, ventanas de contexto: por qué la misma tarea puede costar 50 veces más en un modelo que en otro, explicado de forma sencilla.

HogarAprender › Lo que realmente cuesta el ajuste

Lo que realmente cuesta el ajuste

El ajuste fino y el entrenamiento de un modelo base a partir de sus propios ejemplos a menudo se presentan como la forma de hacer que un modelo de IA sea realmente suyo. Lo que se pasa por alto es el costo, que se divide en varias partes, algunas obvias y otras ocultas. Esta guía desglosa lo que realmente paga, para que pueda juzgar si es mejor simplemente escribir un mensaje mejor.

El ajuste tiene tres niveles de costos

El coste total del ajuste no es una cifra única. Se divide en tres partes distintas:

  • Costo de capacitación, un cargo único para ejecutar el trabajo de ajuste, generalmente con un precio por token en su conjunto de datos de entrenamiento, a veces multiplicado por la cantidad de pasadas (épocas) sobre los datos.
  • Costo de inferencia, lo que paga cada vez que llama al modelo ajustado posteriormente. Con frecuencia, esto es más alto por token que el modelo base.
  • Costo de preparación de datos, el esfuerzo humano para crear, limpiar y formatear un conjunto de capacitación de alta calidad. Este suele ser el coste más elevado y no aparece en ninguna factura.

Saltarse cualquiera de estos lleva a una sorpresa desagradable más adelante.

El cargo de formación

La capacitación se factura según el volumen de datos que ingresa. Si su conjunto de datos es de 1 millón de tokens y el modelo se entrena durante 3 épocas, se le factura como si hubiera procesado 3 millones de tokens a la tarifa de capacitación. Por lo tanto, tanto el tamaño del conjunto de datos como el recuento de épocas influyen en la factura.

A continuación se muestra un ejemplo ilustrativo (tasa inventada). A un precio de entrenamiento de $8 por millón de tokens, un conjunto de datos de 1 millón de tokens durante 3 épocas cuesta 3 x $8 = $24 para la ejecución de entrenamiento. Esa pieza suele ser más barata de lo que la gente espera. El problema es lo que viene después.

La prima de inferencia en curso

Ejecutar un modelo ajustado generalmente cuesta más por token que el modelo base a partir del cual se construyó. Este es el costo que nunca se detiene. Si realiza millones de llamadas al mes, una tasa de inferencia más alta puede eclipsar muchas veces el cargo único de capacitación.

Ejemplo ilustrativo: si un modelo base ofrece $1 por millón de tokens de entrada pero la versión mejorada cuesta $3 por millón, entonces con un volumen alto estás pagando el triple por cada llamada, para siempre. Antes de realizar ajustes, modele siempre el costo de inferencia continuo según el volumen de llamadas esperado, no solo el costo de capacitación. La calculadora de costos de LLM y las páginas de comparación de modelos lo ayudan a comparar la tarifa base y una tarifa ajustada.

El costo oculto: preparación de datos

El ajuste fino de la calidad vive o muere en los datos de entrenamiento. Normalmente necesitará de cientos a miles de pares de ejemplos de alta calidad, cada uno de los cuales muestre la entrada y la salida ideal. Producir esos ejemplos y revisarlos para comprobar su corrección y coherencia es un trabajo humano cualificado que puede llevar días o semanas.

Este esfuerzo rara vez aparece en las estimaciones de costos, pero a menudo es el mayor gasto real. Un ajuste fino entrenado con datos confusos o inconsistentes puede funcionar peor que el modelo base, lo que significa que pagó por el entrenamiento y obtuvo una degradación. Presuponga un tiempo humano realista para la curación de datos, o no comience.

Cuándo vale la pena realizar ajustes y cuándo no

El ajuste fino tiende a dar sus frutos cuando se necesita un estilo, formato o comportamiento consistente eso es difícil de especificar en un mensaje, cuando desea acortar los mensajes (un modelo ajustado puede no necesitar instrucciones o ejemplos largos, guardando tokens de entrada en cada llamada), o cuando tiene una tarea estrecha y de gran volumen en la que un modelo ajustado más pequeño puede reemplazar a uno más grande y costoso.

Por lo general, no vale la pena cuando su tarea cambia con frecuencia (cada cambio significa volver a capacitarse), cuando tiene muy pocos buenos ejemplos o cuando una indicación cuidadosa y una recuperación ya lo llevan allí. Para la mayoría de los equipos, el primer paso honesto es agotar las solicitudes y el almacenamiento en caché de solicitudes antes de realizar ajustes.

Compare el costo total de ambos caminos.

La comparación justa es el costo total en su horizonte de uso real. Ruta A: modelo base con un mensaje más largo y cuidadosamente diseñado, tokens de entrada por llamada más altos, pero sin costo de capacitación y tasas de inferencia estándar. Ruta B: modelo ajustado con indicaciones más cortas pero una carga de entrenamiento más una tasa de inferencia más alta.

Sume cada ruta durante, digamos, un año de llamadas esperadas. A veces, las indicaciones más breves de un ajuste fino ganan; A menudo, el camino del modelo base con buen aviso es más barato y mucho más flexible. Ejecute ambos a través de la calculadora de costos de LLM utilizando sus propios recuentos de tokens antes de comprometerse, porque la respuesta cambia según el volumen.

Preguntas frecuentes

¿El ajuste es un costo único?

No. La capacitación es un cargo único, pero el modelo optimizado generalmente cuesta más por token para ejecutar que el modelo base, por lo que sigues pagando una prima en cada llamada mientras lo uses.

¿Cuántos datos de entrenamiento necesito?

Depende de la tarea, pero un rango común es de cientos a unos pocos miles de pares de ejemplos de alta calidad. La calidad y la coherencia importan mucho más que la cantidad bruta, y preparar esos datos suele ser el mayor coste real.

¿Debo ajustar o simplemente mejorar mi mensaje?

Pruebe primero con indicaciones, ejemplos breves y recuperación. El ajuste fino vale la pena principalmente para formatos consistentes o tareas estrechas de gran volumen donde las indicaciones más cortas compensan la mayor tasa de inferencia.

Sólo educación, no asesoramiento financiero.