✓ Última verificación: 2026-07-27· Modelo: coste efectivo ajustado por precisión· reportar un problema →
El precio del token es el costo de un llamar, no utilizable resultado. Un modelo más barato que es correcto con menos frecuencia te hace pagar por reintentos, así que es cierto costo por respuesta correcta puede vencer a un modelo más caro o perder con él. Ingrese el costo por tarea y la precisión de cada modelo para ver el costo ajustado por precisión, el precisión de equilibrioy qué modelo es realmente más barato por resultado correcto.
—
más barato por correcto
—prima / correcto
—más barato / correcto
—precisión de equilibrio
Precio de etiqueta frente al precio de un resultado
Cada modelo tiene un precio de dos maneras: el costo bruto por llamada y el costo efectivo una vez que se divide por la precisión para pagar los reintentos. La columna "reintentos" está por encima de la precisión: cuántos intentos se necesitan en promedio para obtener una buena respuesta. Se resalta la fila más barata por correcta; No siempre es la pegatina más barata.
Modelo
$/llamada
Exactitud
Intentos/correcto
$/correcto
Mensual
¿Cuánta precisión necesita el modelo más barato?
El costo efectivo del modelo más económico en una variedad de precisiones, frente al costo fijo por corrección del modelo premium. La fila donde se cruzan es la precisión del punto de equilibrio: por encima de ella gana el modelo más barato, por debajo sus reintentos lo convierten en la opción más cara.
Precisión más barata
Más barato $/correcto
Prima $/correcto
Ganador
El descuento que te cuesta dinero
Cada panel de selección de modelo clasifica por precio por millón de tokens, y cada uno de ellos responde la pregunta incorrecta. El costo que aparece en su factura no es el costo de una llamada, es el costo de una llamada que realmente puede utilizar, y en el momento en que su tarea tiene una respuesta correcta y una incorrecta, esos dos números se separan. Un modelo que es un 30% más barato por llamada pero diez puntos menos preciso no es un 30% más barato; una vez que vuelves a intentarlo o descartas sus errores, estás comprando más intentos por resultado utilizable, y la aritmética puede cambiar la clasificación por completo. La solución es una división: tomar el costo de un intento y dividirlo por la probabilidad de que el intento sea bueno, y comparar modelos al respecto. El punto de equilibrio que imprime esta calculadora es toda la decisión en un solo número: la precisión que un modelo más barato debe superar antes de que su descuento sea real, en lugar de un impuesto que se paga en reintentos. Esto supone que puedes distinguir el bien del mal y simplemente volver a ejecutar los fallos, que es exactamente la situación cuando tienes un conjunto de pruebas, un verificador o una revisión humana; si las malas respuestas se envían sin ser detectadas, el modelo barato es aún peor, porque ahora también se paga el costo de equivocarse en el futuro. Cotiza una sola llamada primero con el calculadora de costo simbólico, compare los precios de los modelos sin procesar en el página de comparación de modelosy si está encadenando llamadas a un agente, dimensione la grabación del token de tarea completa con el Calculadora de costos de agentes de IA.
Toma el costo por tarea de cada modelo y su precisión como tasa de éxito. El costo efectivo por respuesta correcta es el costo por tarea dividido por la fracción de precisión, porque en promedio ejecutas uno sobre los intentos de precisión para obtener una buena respuesta y también pagas por los intentos fallidos. El gasto mensual efectivo es el costo por respuesta correcta multiplicado por la cantidad de respuestas correctas que necesita por mes (respuestas correctas por día multiplicado por 30,4). La precisión del punto de equilibrio es la precisión del modelo más caro escalada por la relación entre el costo del modelo más barato y el costo del modelo premium: la precisión con la cual los reintentos del modelo más barato cancelan exactamente su ventaja de precio. Esto supone reintentos independientes y una forma confiable de detectar una respuesta incorrecta; sin un verificador, el costo efectivo es un límite inferior.
Preguntas frecuentes
¿Qué es el costo por respuesta correcta y por qué es más importante que el precio simbólico?
Es lo que paga para obtener un resultado utilizable, no lo que cuesta una llamada. El precio del token no dice nada sobre si el intento fue correcto. Si un modelo tiene éxito el 70% de las veces y vuelves a intentar los fallos, pagas aproximadamente 1,4 intentos por cada buena respuesta, por lo que su coste efectivo es la etiqueta dividida por la precisión. Esa división puede cambiar la clasificación: un modelo 40% más barato por llamada pero menos preciso puede ser más caro por respuesta correcta que uno más caro y confiable.
¿Cómo calculo el costo ajustado por precisión de un modelo?
Divida el costo de una llamada por la tasa de éxito como fracción. Dos centavos al 95% equivalen aproximadamente a 2,1 centavos por respuesta correcta; dos centavos al 65% son aproximadamente 3,1 centavos, porque se necesitan ~1,5 llamadas por cada buena. El multiplicador es uno por encima de la precisión: el 95 % es un impuesto de 1,05 veces, el 65 % es un impuesto de 1,54 veces y el 50 % duplica su costo. Se supone que puedes detectar respuestas incorrectas y volver a intentarlo; si se envían malas respuestas, el costo real es mayor.
¿Cuánta precisión necesita un modelo más barato para ser realmente más barato?
Al menos la precisión del modelo más caro escalada por la relación de precios. Si el modelo premium tiene una precisión del 95 % y el más barato cuesta un 70 % más, el más barato necesita aproximadamente un 66,5 % de precisión para alcanzar el punto de equilibrio. Debajo de eso, sus reintentos consumen el ahorro; por encima de él, gana. Un descuento de título no tiene sentido sin un número de precisión adjunto.
¿Esto se aplica también a la clasificación, la extracción y los agentes?
En cualquier lugar se puede puntuar si una salida es correcta. La precisión es su tasa de aprobación frente a un conjunto etiquetado, o la fracción de ejecuciones del agente que alcanzan un resultado correcto. Para los agentes, el efecto se amplifica: una ejecución fallida puede quemar muchos más tokens que una llamada. Para la generación abierta, utilice la tasa de aceptación (participación mantenida sin reescritura) como entrada de precisión.