Las pesas son la parte fácil. Ajustar el modelo es un cálculo de una sola línea y no dice casi nada. Lo que decide si puede atender a ocho usuarios u ochenta es la caché KV: memoria que escala con la longitud del contexto. y con cada secuencia concurrente en vuelo. Esta herramienta dimensiona ambos y luego convierte la capacidad resultante en un costo por millón de tokens que puede retener contra una factura de API.

pesas
solicitudes concurrentes
Caché / solicitud de KV
tus tokens de $/1M

Simultaneidad y costo unitario por longitud del contexto

Mismo modelo, misma GPU, mismo dinero: solo cambia la ventana contextual de cada solicitud. Esta es la tabla que convierte "simplemente aumentaremos max_model_len" en una decisión de capacidad.

ContextoKV / solicitudConcurrenteFichas/seg est.$ / 1 millón de tokens

El precipicio de la utilización

Una GPU factura por horas, no por token. Su verdadero costo unitario es la cifra principal dividida por su ciclo de trabajo; aquí es donde la mayoría de los casos de negocios de autohospedaje se desmoronan silenciosamente.

Utilización promedioTokens efectivos/seg$ / 1 millón de tokensfrente a API
⚠️ Estimación de capacidad, no punto de referencia. Las cifras de VRAM utilizan GB decimales (1 GB = 10⁹ bytes) para coincidir con la forma en que los proveedores cotizan la memoria de la tarjeta. Las pilas de servicio reales agregan relleno de bloque de atención paginado, reutilización opcional de caché de prefijo y margen de maniobra del programador, así que trate el número de concurrencia como un límite superior y planifique entre un 20 y un 30 % menos. El rendimiento es su opinión: mídalo con su propio hardware en lugar de confiar en una hoja de especificaciones. Compare las tarifas API actuales por token en el comparación de precios de modelos. · Informar precio desactualizado →

Montar el modelo no es lo mismo que servirlo

El consejo que se encuentra en todas partes es que un modelo 70B en INT4 necesita alrededor de 35 GB, por lo que cabe en una sola tarjeta de 80 GB con espacio de sobra. Eso es cierto y casi inútil, porque describe un modelo que permanece inactivo. En el momento en que llegan las solicitudes, cada secuencia en vuelo asigna su propia caché KV: dos tensores por capa, dimensionados por cabezas KV multiplicadas por la dimensión de la cabeza, mantenidos para cada token en el contexto de esa secuencia. Con 80 capas, cabezales de 8 KV, 128 dimensiones y FP16, es decir, 327.680 bytes por token (un tercio de megabyte), que en un contexto de 8K son aproximadamente 2,7 GB. por solicitud simultánea. Los 45 GB de espacio libre que parecían tan cómodos son aproximadamente para una docena de usuarios, y el decimotercero se pone en cola. La planificación de capacidad para inferencia es la planificación de caché KV; los pesos simplemente establecen la tarifa de entrada.

El recuento de personas de KV es el número que realmente se mueve.

La atención de consultas agrupadas es la razón por la que los modelos modernos de peso abierto son útiles, y cualquiera que dimensione el hardware a partir de un recuento de parámetros suele omitirla. Un modelo con 64 cabezales de atención y 8 cabezales KV almacena una octava parte del caché de un diseño equivalente de múltiples cabezales, lo que se convierte casi linealmente en ocho veces la concurrencia en la misma tarjeta. Pruebe el preajuste de cabezales múltiples 13B anterior con el preajuste 70B: el modelo más pequeño suele ser el que se queda sin memoria primero, lo cual no es intuitivo hasta que ve a dónde van los bytes. Reducir a la mitad la precisión de KV a FP8 duplica nuevamente la concurrencia por un costo de precisión modesto. Estos dos conmutadores mueven la capacidad mucho más que comprar una tarjeta más grande, y no cuestan nada.

La utilización decide la economía, no el hardware

La mesa final es la que pone fin honestamente a la mayoría de los proyectos de autohospedaje. Un H100 alquilado cuesta los mismos $2,50 por hora a las 3 a. m. sin tráfico que en las horas pico, por lo que su costo real por millón de tokens es el número principal dividido por su ciclo de trabajo promedio. Si sirve con una utilización del 20%, pagará cinco veces más de lo que sugiere la cifra optimista de la calculadora, y en comparación con las tasas API de productos básicos para un modelo pequeño, eso no está cerca. El autohospedaje gana en volúmenes sostenidos, saturados y predecibles, en cargas de trabajo con restricciones de latencia o residencia de datos que una API no puede cumplir y en modelos que nadie vende por token. Pierde con el tráfico en ráfagas, y pierde silenciosamente, porque la factura es plana y la capacidad desperdiciada nunca aparece como una partida individual. Verifique la conclusión con la Calculadora LLM vs API autohospedada, valore el hardware en sí con el Calculadora de costos de inferencia de GPU, y si la respuesta es marginal, mire un modelo más pequeño destilado o almacenamiento en caché rápido antes de comprar un estante.

Aloja tu proyecto:Océano Digital — $200 gratis ↗VPS Hostinger
LLM autohospedado frente a APICosto de inferencia de GPUCosto de la nube de GPUModelo ROI de destilaciónLatencia LLMCosto de la ventana de contexto