Publicado em 23/07/2026 · números de referência, verifique antes de orçamentar
Toda conversa sobre custos de IA começa com tokens. Construímos calculadoras para viver e as calculadoras simbólicas são aquelas que as pessoas usam - as comparação de preços é a página mais movimentada deste site por uma ampla margem. Então, esta semana fizemos o exercício oposto: escrevemos guias para quatro peças de infraestrutura de agente — Cérebros para inferência, E2B para sandboxes de código, Base do navegador para navegadores sem cabeça e Kit ao vivo para transporte em tempo real — e então precificou uma tarefa realista em todas as quatro de uma só vez.
A tarefa: uma chamada de voz de dez minutos em que um agente fala com um usuário, navega por quatro minutos em páginas da web e executa cinco scripts curtos. O resultado não foi próximo. Os tokens LLM chegaram a 0,89% da fatura. A largura de banda do proxy atingiu três quartos disso.
O que dificulta o orçamento da infraestrutura do agente é que nenhum desses serviços é cobrado na unidade em que você pensa sobre a tarefa. Você pensa em "chamadas" ou "tarefas"; eles cobram em segundos de sandbox, horas de navegação, gigabytes e minutos de participante.
| Serviço | Medidor | Avaliar | A armadilha |
|---|---|---|---|
| Cérebros | entrada/saída de tokens | US$ 0,35 / US$ 0,75 por 1 milhão | nenhum - este é o honesto e bem compreendido |
| E2B | vida útil do sandbox, por segundo | ≈US$ 0,10 / hora | o tempo ocioso custa o mesmo que o tempo de execução |
| Base do navegador | horas do navegador + proxy GB | ≈$0,12 / hora · ≈$12 / GB | o medidor GB é 100× o horímetro |
| Kit ao vivo | mínimo de participante + mínimo de agente | ≈$0,0005 · ≈$0,01 | o medidor do agente é 20× o medidor de transporte |
Taxas de referência, julho de 2026. Informar preço desatualizado →
Veja a coluna da armadilha. Três dos quatro serviços têm um medidor secundário que custa uma ordem de grandeza ou mais do que o mostrado no título da página de preços. Isso não é engano – cada um destes números é publicado abertamente. Acontece apenas que o modelo mental que você traz ("um navegador custa doze centavos por hora, tudo bem") está vinculado ao número errado.
Aqui está a ligação de dez minutos, custada duas vezes: uma vez por uma equipe que fecha seus sandboxes e bloqueia imagens no navegador, e uma vez por uma equipe que não faz nada disso. Mesma funcionalidade, mesmo usuário, mesmos modelos.
| Item de linha | Disciplinado | Desleixado | O que mudou |
|---|---|---|---|
| LiveKit – 10 minutos de agente + 20 minutos de participante | $0.1100 | $0.1100 | nada; 91% dele é o medidor do agente |
| Cerebras – tokens de 8k de entrada / 2k de saída | $0.0043 | $0.0043 | nada |
| E2B – 5 caixas de areia | $0.0028 | $0.5040 | fechado após 20s vs deixado para um tempo limite de 1 hora |
| Base de navegador – 4 minutos de navegador | $0.0080 | $0.0080 | nada |
| Base do navegador – largura de banda do proxy | $0.3600 | $2.4000 | 30 MB com imagens bloqueadas vs 200 MB sem |
| Total por chamada | $0.485 | $3.026 | 6.2× |
| Por 1.000 chamadas | $485 | $3,026 | o mesmo produto, duas vezes |
Duas coisas se destacam. A primeira é que a lacuna entre as colunas não é uma decisão de preço – ninguém mudou de provedor, ninguém negociou um nível. São dois hábitos de configuração: chamar kill() em uma sandbox em vez de deixar o tempo expirar e bloquear imagens e fontes em um navegador sem cabeça que existe apenas para ler texto. Entre eles, eles representam uma diferença de 6,2× na economia unitária.
A segunda é que a linha de token, aquela sobre a qual trata todo artigo de custo na Internet, é $0.0043. Menos de um por cento da conta disciplinada e menos de dois décimos de por cento da conta desleixada. Você poderia reduzir pela metade o gasto de tokens – trocar modelos, compactar prompts, armazenar em cache agressivamente – e mover o total em 0,4%. Você pode bloquear imagens em uma linha de configuração do Playwright e movê-la em 42%.
Contas E2B por segundo de sandbox vida, não por segundo de execução. Um script executado por vinte segundos dentro de uma sandbox custa cerca de US$ 0,00056. O script idêntico dentro de uma sandbox deixada para esgotar seu limite de sessão de uma hora custa US$ 0,10 — 180 vezes mais para o mesmo cálculo, com os 3.580 segundos extras gastos sem fazer absolutamente nada. Em um loop de agente que gera uma sandbox por etapa, isso não é um erro de arredondamento; é a diferença entre a infraestrutura do agente ser barata e ser a segunda maior linha da fatura.
A correção é uma linha de código de desmontagem, e o motivo pelo qual as equipes não a percebem é que ela funciona bem no desenvolvimento. Um protótipo com três testes por dia nunca percebe; o medidor só se torna visível no volume de produção, ponto em que o hábito é incorporado ao caminho do código. Se você estiver construindo um loop de agente, modele-o com o calculadora de orçamento de loop de agente antes de escalá-lo, não depois.
O Browserbase cobra cerca de US$ 0,12 por hora de navegação e cerca de US$ 12 por gigabyte de largura de banda de proxy. Essa proporção – 100:1 – significa que uma única hora de navegação precisa mover apenas cerca de dez megabytes antes que a largura de banda e a computação custem o mesmo, e as páginas da web modernas movam dez megabytes sem tentar. Nossa sessão de navegação de quatro minutos a 200 MB custou US$ 2,40 em largura de banda contra US$ 0,008 em tempo de navegação: a largura de banda foi 300× o cálculo.
O bloqueio de imagens, fontes, vídeos e folhas de estilo em um navegador de scraping normalmente reduz a carga útil em 80-90%, e é daí que vem nosso valor disciplinado de 30 MB. Se o agente estiver lendo texto – e para a maioria das tarefas do agente está – nenhuma parte dessa carga será usada. Esta é a mesma lição que os custos ocultos que dobram suas contas de IA e SMS: o formato do uso determina a fatura muito mais do que a taxa do adesivo.
A taxa por minuto de participante do LiveKit é o número em todos os artigos de comparação: cerca de US$ 0,0005 por minuto, o que parece nada porque não é nada. O medidor de sessão do agente custa cerca de US$ 0,01 por minuto – vinte vezes mais alto – e é o que realmente funciona durante uma chamada do agente. Em nosso exemplo de dez minutos, os minutos do participante chegaram a um centavo e os minutos do agente, a dez. Uma estimativa construída a partir da taxa de manchete chega a 10 vezes mais baixa.
Nenhum deles inclui os modelos de fala: a transcrição, a virada do LLM e a conversão de texto em fala são cobradas por quem os fornece, além de tudo acima. Avalie toda a pilha com o Calculadora de custos do agente de voz AI.
A infraestrutura do agente não é cara. A infraestrutura de agente configurada com hábitos de tempo de desenvolvimento em volume de tempo de produção é cara e os dois estão separados por cerca de seis vezes em nossos números. A parte desconfortável é que todo o dinheiro está em medidores sobre os quais ninguém escreve posts em blogs – segundos sandbox, gigabytes de proxy, minutos de sessão do agente – enquanto o medidor sobre o qual todo mundo escreve acabou sendo a menor linha da fatura.
Leia os guias: Cérebros · E2B · Base do navegador · Kit ao vivo · todos APIs de IA e agente.
Metodologia: as taxas são os valores de referência publicados em julho de 2026, comparados com a página pública de preços de cada fornecedor durante a redação dos quatro guias vinculados acima. O exemplo trabalhado é um cenário construído, não a telemetria de um sistema de produção – a questão é a relação entre medidores, que se aplica a uma ampla gama de suposições, e não ao total absoluto. Confirme os preços atuais antes de fazer o orçamento.