Os tokens de saída são a conta. A geração executa um avanço completo por token; o prefill processa todo o seu prompt em paralelo por aproximadamente um décimo da energia por token. Um prompt curto com uma resposta longa custa muito mais do que um prompt longo com uma resposta curta — e o rastro oculto de um modelo de raciocínio conta como saída.

kWh/mês
kg CO2e/mês
por solicitação
custo de compensação/ano a US$ 85/t

Mesma carga de trabalho, todas as classes de modelo

Volume de solicitação e formato de token idênticos, roteados para níveis diferentes. O salto para o nível de raciocínio não é incremental – é o maior factor controlável num orçamento de carbono inferido.

Classe de modeloWh/1k saída tokkWh/mêskg CO2e / mêsCusto de energia/mês

Mesma carga de trabalho, todas as regiões

Computação idêntica, energia idêntica – apenas a rede muda. Esta é a redução de emissões mais barata disponível para qualquer pessoa cujo fornecedor permita escolher uma região.

Regiãog CO2e/kWhkg CO2e / mêst CO2e / anoversus sua região
⚠️ Estimativa modelada, não uma medição. A energia por token não é publicada por nenhum grande fornecedor de API, portanto, os números de classe aqui são valores de referência de ordem de grandeza consistentes com divulgações do operador e pesquisas públicas sobre energia de inferência; o consumo real varia com o tamanho do lote, comprimento da sequência, quantização, geração e utilização de hardware. Os tokens de entrada são cobrados a 10% da taxa de saída para refletir o pré-preenchimento paralelo. As intensidades da rede são factores de geração médios nacionais e ignoram instrumentos baseados no mercado, como PPAs e RECs, razão pela qual o valor reportado pelo próprio operador será normalmente inferior a este. Use para escala e comparação, não para divulgação regulatória. · Sugira um fator melhor →

Por que a divisão de entrada/saída é mais importante do que o total de tokens

Quase todas as tentativas de estimar a energia da IA ​​​​multiplicam o total de tokens por um único número por token, e isso está errado de uma forma importante. A inferência do transformador possui duas fases com perfis de custo completamente diferentes. O Prefill lê todo o seu prompt em uma passagem fortemente paralela, portanto, um prompt de 1.500 tokens custa pouco mais do que um prompt de 150 tokens nas pilhas de serviço modernas. A decodificação gera um token por vez, cada um exigindo uma passagem completa pelos pesos do modelo, de modo que o comprimento da saída dimensiona a energia de maneira quase linear. A consequência prática é que colocar mais contexto em um prompt é comparativamente barato e deixar um modelo divagar é caro – exatamente o oposto da intuição com a qual a maioria das equipes começa, e o oposto de como a tabela de preços é moldada, já que os fornecedores cobram informações com um desconto também, mas nem perto de 10×.

A camada de raciocínio é onde as pegadas vão morrer

O traço de pensamento de um modelo de raciocínio é produzido. Ele passa pelo decodificador exatamente como a resposta visível, mas nunca chega ao usuário. Uma solicitação que produz 200 tokens visíveis após 2.000 tokens de deliberação gerou 2.200 tokens, e se esse modelo também for uma ordem de grandeza maior por token do que a alternativa de nível intermediário, a energia por solicitação pode ser cinquenta vezes maior do que a mesma tarefa respondida diretamente. Execute a tabela de classes de modelo acima com seu próprio volume e a aritmética será nítida. Essa também é a alavanca mais tratável: encaminhar solicitações diretas para uma camada menor e reservar o raciocínio para os casos que precisam dele reduz tanto a conta quanto o espaço ocupado ao mesmo tempo. Tamanho que negocia com o calculadora de economia de roteamento de modeloe verifique quanto os tokens de pensamento estão custando em dólares com o calculadora de custo de token de raciocínio.

Energia é um erro de arredondamento próximo ao que você paga – e esse é o ponto

Execute os números padrão e a eletricidade por trás de dois milhões de solicitações de nível intermediário custa dezenas de dólares em comparação com uma conta de API na casa dos milhares. Ninguém muda de provedor para salvar isso. De qualquer forma, a razão para calculá-lo é que o número de carbono, ao contrário do custo da energia, acaba numa CSRD ou na divulgação de um questionário ao cliente, onde tem de ser defensável, e cada vez mais em conversas sobre aquisições, onde são solicitadas ao fornecedor as emissões por unidade de serviço. A linha da região é aquela sobre a qual agir: a computação idêntica em uma rede de baixo carbono emite um décimo quinto do que em uma rede com alto teor de carvão, o que nenhuma otimização de modelo pode igualar. Se a obrigação de divulgação em si foi o que o trouxe até aqui, avalie o programa de governança envolvente com o Calculadora de custos de conformidade com a Lei AI da UE.

Hospede seu projeto:DigitalOcean – $ 200 grátis ↗VPS da Hostinger
Custo de conformidade com a Lei de IA da UEEconomia de roteamento de modeloCusto de inferência de GPULLM auto-hospedado vs APILLM VRAM e simultaneidade