Cómo funciona esta calculadora
El Calculadora de costos de inferencia de GPU convierte tres entradas: su Precio de GPU por hora, modelo rendimiento en tokens por segundo, y un porcentaje de utilización realista - en la verdad costo por millón de tokens para un modelo autohospedado. La idea central es simple: una hora de tiempo de GPU compra una cantidad fija de tokens, por lo que dividir el costo por hora por los tokens realmente producidos da el precio por token. El rendimiento establece cuántos tokens genera el hardware cada segundo, mientras que la utilización descuenta esa cifra para reflejar el tiempo de inactividad, las brechas en los lotes y el tráfico que rara vez mantiene la GPU completamente cargada.
La compensación clave es utilización. El rendimiento de referencia supone una GPU constantemente ocupada, pero las cargas de trabajo reales permanecen inactivas entre solicitudes, por lo que una GPU alquilada facturada por horas puede costar mucho más por token de lo que sugiere el número principal. Antes de comprometerte con el autohospedaje, calcula tu verdadero utilice honestamente y compare el resultado con el precio de API por token: el tráfico bajo y elevado a menudo favorece una API, mientras que un volumen alto y constante recompensa la propiedad del hardware.
Preguntas frecuentes
¿Cómo calculo el costo por token en mi propia GPU?
Tome el precio por hora de la GPU y divídalo por la cantidad de tokens que realmente sirve por hora. Esto es un rendimiento (tokens/seg) multiplicado por 3600, escalado según su utilización real. Una GPU facturada continuamente pero medio inactiva sirve la mitad de los tokens, por lo que su costo por token se duplica en comparación con el rendimiento de la hoja de datos.
¿Por qué el costo de mi alojamiento propio es mayor de lo esperado?
Casi siempre utilización y procesamiento por lotes. El rendimiento de referencia supone una carga completa y por lotes; El tráfico real está en ráfagas, por lo que la GPU permanece inactiva entre solicitudes mientras se ejecuta el medidor. El procesamiento por lotes continuo, el tamaño adecuado de la GPU y la consolidación del tráfico en menos GPU y más ocupadas son las principales formas de reducir el costo por token.