✓ Última verificação: 27/07/2026· Modelo: custo efetivo ajustado por precisão· relatar um problema →
O preço do token é o custo de um chamar, não é utilizável resultado. Um modelo mais barato e certo com menos frequência faz você pagar por novas tentativas – então é verdade custo por resposta correta pode vencer um modelo mais caro ou perder para ele. Insira o custo por tarefa e a precisão de cada modelo para ver o custo ajustado pela precisão, o precisão do ponto de equilíbrio, e qual modelo é realmente mais barato por saída correta.
—
mais barato por correto
—premium / correto
—mais barato / correto
—precisão do ponto de equilíbrio
Preço do adesivo versus preço de um resultado
Cada modelo tem dois preços: o custo bruto por chamada e o custo efetivo, uma vez dividido pela precisão para pagar pelas novas tentativas. A coluna "novas tentativas" é sobre a precisão - quantas tentativas são necessárias em média para obter uma boa resposta. A linha mais barata por correta é destacada; nem sempre é o adesivo mais barato.
Modelo
$/chamada
Precisão
Tentativas/corrigir
$/correto
Mensal
Quanta precisão o modelo mais barato precisa
O custo efetivo do modelo mais barato em uma variedade de precisões, em comparação com o custo fixo por acerto do modelo premium. A linha onde eles se cruzam é a precisão do ponto de equilíbrio – acima dela, o modelo mais barato vence, abaixo dela suas novas tentativas o tornam a escolha mais cara.
Precisão mais barata
Mais barato $/correto
Prêmio $/correto
Ganhador
O desconto que custa dinheiro
Cada painel de seleção de modelo classifica por preço por milhão de tokens, e cada um deles está respondendo à pergunta errada. O custo que cai na sua conta não é o custo de uma ligação, é o custo de uma ligação que você pode realmente usar – e no momento em que sua tarefa tem uma resposta certa e uma errada, esses dois números se separam. Um modelo que é 30% mais barato por ligação, mas dez pontos menos preciso, não é 30% mais barato; depois de tentar novamente ou descartar seus erros, você estará comprando mais tentativas por resultado utilizável, e a aritmética pode inverter totalmente a classificação. A solução é uma divisão: pegue o custo de uma tentativa e divida-o pela probabilidade de a tentativa ser boa e compare os modelos sobre isso. O ponto de equilíbrio que esta calculadora imprime é a decisão completa em um único número – a precisão que um modelo mais barato tem de compensar antes que seu desconto seja real, em vez de um imposto que você paga em novas tentativas. Isso pressupõe que você possa distinguir o certo do errado e simplesmente executar novamente as falhas, que é exatamente a situação quando você tem um conjunto de testes, um verificador ou uma revisão humana; se respostas ruins forem enviadas sem serem detectadas, o modelo barato é ainda pior, porque agora você também paga o custo de estar errado no futuro. Defina o preço de uma única chamada primeiro com o calculadora de custo de token, compare os preços brutos do modelo no página de comparação de modelos, e se você estiver encadeando chamadas em um agente, dimensione a gravação do token de tarefa completa com o Calculadora de custos do agente de IA.
Considera o custo por tarefa de cada modelo e sua precisão como uma taxa de sucesso. O custo efetivo por resposta correta é o custo por tarefa dividido pela fração de precisão - porque, em média, você executa uma das tentativas de precisão para obter uma boa resposta e também paga pelas tentativas fracassadas. O gasto efetivo mensal é o custo por acerto vezes o número de respostas corretas necessárias por mês (respostas corretas por dia vezes 30,4). A precisão do ponto de equilíbrio é a precisão do modelo mais caro dimensionada pela razão entre o custo do modelo mais barato e o custo do modelo premium – a precisão com que as novas tentativas do modelo mais barato cancelam exatamente sua vantagem de preço. Isto pressupõe novas tentativas independentes e uma maneira confiável de detectar uma resposta errada; sem um verificador, o custo efetivo é um limite inferior.
Perguntas frequentes
Qual é o custo por resposta correta e por que isso é mais importante do que o preço simbólico?
É o que você paga para obter um resultado utilizável, e não o que custa uma chamada. O preço do token não diz nada sobre se a tentativa foi correta. Se um modelo for bem-sucedido em 70% das vezes e você tentar novamente as falhas, você pagará cerca de 1,4 tentativas por boa resposta, portanto, seu custo efetivo é o adesivo dividido pela precisão. Essa divisão pode inverter a classificação: um modelo 40% mais barato por chamada, mas menos preciso, pode ser mais caro por resposta correta do que um modelo mais caro e confiável.
Como calculo o custo ajustado pela precisão de um modelo?
Divida o custo de uma chamada pela taxa de sucesso como uma fração. Dois centavos a 95% equivalem a cerca de 2,1 centavos por resposta correta; dois centavos a 65% são cerca de 3,1 centavos, porque são necessárias cerca de 1,5 chamadas por chamada boa. O multiplicador é superior à precisão - 95% é um imposto de 1,05x, 65% é um imposto de 1,54x, 50% dobra seu custo. Ele pressupõe que você pode detectar respostas erradas e tentar novamente; se respostas ruins forem enviadas, o custo real será mais alto.
Quanta precisão um modelo mais barato precisa para ser realmente mais barato?
Pelo menos a precisão do modelo mais caro é dimensionada pela relação de preços. Se o modelo premium tiver 95% de precisão e o mais barato custar 70% mais, o mais barato precisa de aproximadamente 66,5% de precisão para atingir o ponto de equilíbrio. Abaixo disso, suas tentativas consomem a economia; acima dele, ele vence. Um desconto de título não tem sentido sem um número preciso anexado.
Isto também se aplica à classificação, extração e agentes?
Em qualquer lugar você pode pontuar se uma saída está correta. A precisão é a sua taxa de aprovação em relação a um conjunto rotulado ou a fração de execuções do agente que alcançam um resultado correto. Para os agentes, o efeito é amplificado: uma execução com falha pode queimar muito mais tokens do que uma chamada. Para geração aberta, use a taxa de aceitação (parcela mantida sem reescrita) como entrada de precisão.