Las pesas son la parte fácil. Ajustar el modelo es un cálculo de una sola línea y no dice casi nada. Lo que decide si puede atender a ocho usuarios u ochenta es la caché KV: memoria que escala con la longitud del contexto. y con cada secuencia concurrente en vuelo. Esta herramienta dimensiona ambos y luego convierte la capacidad resultante en un costo por millón de tokens que puede retener contra una factura de API.
Simultaneidad y costo unitario por longitud del contexto
Mismo modelo, misma GPU, mismo dinero: solo cambia la ventana contextual de cada solicitud. Esta es la tabla que convierte "simplemente aumentaremos max_model_len" en una decisión de capacidad.
| Contexto | KV / solicitud | Concurrente | Fichas/seg est. | $ / 1 millón de tokens |
|---|
El precipicio de la utilización
Una GPU factura por horas, no por token. Su verdadero costo unitario es la cifra principal dividida por su ciclo de trabajo; aquí es donde la mayoría de los casos de negocios de autohospedaje se desmoronan silenciosamente.
| Utilización promedio | Tokens efectivos/seg | $ / 1 millón de tokens | frente a API |
|---|
Montar el modelo no es lo mismo que servirlo
El consejo que se encuentra en todas partes es que un modelo 70B en INT4 necesita alrededor de 35 GB, por lo que cabe en una sola tarjeta de 80 GB con espacio de sobra. Eso es cierto y casi inútil, porque describe un modelo que permanece inactivo. En el momento en que llegan las solicitudes, cada secuencia en vuelo asigna su propia caché KV: dos tensores por capa, dimensionados por cabezas KV multiplicadas por la dimensión de la cabeza, mantenidos para cada token en el contexto de esa secuencia. Con 80 capas, cabezales de 8 KV, 128 dimensiones y FP16, es decir, 327.680 bytes por token (un tercio de megabyte), que en un contexto de 8K son aproximadamente 2,7 GB. por solicitud simultánea. Los 45 GB de espacio libre que parecían tan cómodos son aproximadamente para una docena de usuarios, y el decimotercero se pone en cola. La planificación de capacidad para inferencia es la planificación de caché KV; los pesos simplemente establecen la tarifa de entrada.
El recuento de personas de KV es el número que realmente se mueve.
La atención de consultas agrupadas es la razón por la que los modelos modernos de peso abierto son útiles, y cualquiera que dimensione el hardware a partir de un recuento de parámetros suele omitirla. Un modelo con 64 cabezales de atención y 8 cabezales KV almacena una octava parte del caché de un diseño equivalente de múltiples cabezales, lo que se convierte casi linealmente en ocho veces la concurrencia en la misma tarjeta. Pruebe el preajuste de cabezales múltiples 13B anterior con el preajuste 70B: el modelo más pequeño suele ser el que se queda sin memoria primero, lo cual no es intuitivo hasta que ve a dónde van los bytes. Reducir a la mitad la precisión de KV a FP8 duplica nuevamente la concurrencia por un costo de precisión modesto. Estos dos conmutadores mueven la capacidad mucho más que comprar una tarjeta más grande, y no cuestan nada.
La utilización decide la economía, no el hardware
La mesa final es la que pone fin honestamente a la mayoría de los proyectos de autohospedaje. Un H100 alquilado cuesta los mismos $2,50 por hora a las 3 a. m. sin tráfico que en las horas pico, por lo que su costo real por millón de tokens es el número principal dividido por su ciclo de trabajo promedio. Si sirve con una utilización del 20%, pagará cinco veces más de lo que sugiere la cifra optimista de la calculadora, y en comparación con las tasas API de productos básicos para un modelo pequeño, eso no está cerca. El autohospedaje gana en volúmenes sostenidos, saturados y predecibles, en cargas de trabajo con restricciones de latencia o residencia de datos que una API no puede cumplir y en modelos que nadie vende por token. Pierde con el tráfico en ráfagas, y pierde silenciosamente, porque la factura es plana y la capacidad desperdiciada nunca aparece como una partida individual. Verifique la conclusión con la Calculadora LLM vs API autohospedada, valore el hardware en sí con el Calculadora de costos de inferencia de GPU, y si la respuesta es marginal, mire un modelo más pequeño destilado o almacenamiento en caché rápido antes de comprar un estante.