Os tokens de saída são a conta. A geração executa um avanço completo por token; o prefill processa todo o seu prompt em paralelo por aproximadamente um décimo da energia por token. Um prompt curto com uma resposta longa custa muito mais do que um prompt longo com uma resposta curta — e o rastro oculto de um modelo de raciocínio conta como saída.
Mesma carga de trabalho, todas as classes de modelo
Volume de solicitação e formato de token idênticos, roteados para níveis diferentes. O salto para o nível de raciocínio não é incremental – é o maior factor controlável num orçamento de carbono inferido.
| Classe de modelo | Wh/1k saída tok | kWh/mês | kg CO2e / mês | Custo de energia/mês |
|---|
Mesma carga de trabalho, todas as regiões
Computação idêntica, energia idêntica – apenas a rede muda. Esta é a redução de emissões mais barata disponível para qualquer pessoa cujo fornecedor permita escolher uma região.
| Região | g CO2e/kWh | kg CO2e / mês | t CO2e / ano | versus sua região |
|---|
Por que a divisão de entrada/saída é mais importante do que o total de tokens
Quase todas as tentativas de estimar a energia da IA multiplicam o total de tokens por um único número por token, e isso está errado de uma forma importante. A inferência do transformador possui duas fases com perfis de custo completamente diferentes. O Prefill lê todo o seu prompt em uma passagem fortemente paralela, portanto, um prompt de 1.500 tokens custa pouco mais do que um prompt de 150 tokens nas pilhas de serviço modernas. A decodificação gera um token por vez, cada um exigindo uma passagem completa pelos pesos do modelo, de modo que o comprimento da saída dimensiona a energia de maneira quase linear. A consequência prática é que colocar mais contexto em um prompt é comparativamente barato e deixar um modelo divagar é caro – exatamente o oposto da intuição com a qual a maioria das equipes começa, e o oposto de como a tabela de preços é moldada, já que os fornecedores cobram informações com um desconto também, mas nem perto de 10×.
A camada de raciocínio é onde as pegadas vão morrer
O traço de pensamento de um modelo de raciocínio é produzido. Ele passa pelo decodificador exatamente como a resposta visível, mas nunca chega ao usuário. Uma solicitação que produz 200 tokens visíveis após 2.000 tokens de deliberação gerou 2.200 tokens, e se esse modelo também for uma ordem de grandeza maior por token do que a alternativa de nível intermediário, a energia por solicitação pode ser cinquenta vezes maior do que a mesma tarefa respondida diretamente. Execute a tabela de classes de modelo acima com seu próprio volume e a aritmética será nítida. Essa também é a alavanca mais tratável: encaminhar solicitações diretas para uma camada menor e reservar o raciocínio para os casos que precisam dele reduz tanto a conta quanto o espaço ocupado ao mesmo tempo. Tamanho que negocia com o calculadora de economia de roteamento de modeloe verifique quanto os tokens de pensamento estão custando em dólares com o calculadora de custo de token de raciocínio.
Energia é um erro de arredondamento próximo ao que você paga – e esse é o ponto
Execute os números padrão e a eletricidade por trás de dois milhões de solicitações de nível intermediário custa dezenas de dólares em comparação com uma conta de API na casa dos milhares. Ninguém muda de provedor para salvar isso. De qualquer forma, a razão para calculá-lo é que o número de carbono, ao contrário do custo da energia, acaba numa CSRD ou na divulgação de um questionário ao cliente, onde tem de ser defensável, e cada vez mais em conversas sobre aquisições, onde são solicitadas ao fornecedor as emissões por unidade de serviço. A linha da região é aquela sobre a qual agir: a computação idêntica em uma rede de baixo carbono emite um décimo quinto do que em uma rede com alto teor de carvão, o que nenhuma otimização de modelo pode igualar. Se a obrigação de divulgação em si foi o que o trouxe até aqui, avalie o programa de governança envolvente com o Calculadora de custos de conformidade com a Lei AI da UE.