OCR / Extração

Análise LLM

Volume

Componente de custo Por página Por documento Por mês

Escala de volume

Páginas mensais Custo de OCR Custo LLM Total

Como modelar seu pipeline de IA de documentos

Um pipeline típico de processamento de documentos tem dois custos principais de API:

  1. OCR / extração — conversão de imagens digitalizadas ou PDFs em texto legível por máquina. Cobrado por página pela maioria dos provedores.
  2. Análise LLM — passar o texto extraído mais um prompt do sistema para um LLM para classificação, resumo ou extração de dados. Cobrado por token.

Para PDFs de texto nativo (não digitalizados), você pode ignorar totalmente o OCR e extrair o texto com bibliotecas gratuitas (pdfplumber, pypdf), reduzindo o custo por página apenas para a cobrança do LLM.

Desconto no processamento em lote: Anthropic e OpenAI oferecem desconto de aproximadamente 50% para trabalhos em lote assíncronos. Para fluxos de trabalho de documentos que não sejam em tempo real (processamento de faturas, lotes noturnos), use sempre o modo em lote.

Relacionado: Custo de OCR e Document AI · Calculadora de custos RAG · Economia de API em lote

Perguntas frequentes

Quanto custa processar PDFs com IA?

Um pipeline típico custa entre US$ 0,003 e US$ 0,05 por página. O AWS Textract cobra US$ 0,0015/página pela detecção de texto. Adicionar Claude 3.5 Haiku a 1.500 tokens/página (US$ 0,0012/página) eleva o total para aproximadamente US$ 0,003/página. Com 10.000 páginas/mês, isso equivale a aproximadamente US$ 30/mês.

Quais APIs de OCR são mais baratas para processamento de documentos?

AWS Textract: US$ 0,0015/página (texto) ou US$ 0,065/página (formulários). Google Document AI: US$ 0,0015/página. Reconhecedor de formulário do Azure: US$ 0,0010/página. OCR Mistral: US$ 0,001/página. Tesseract/PaddleOCR auto-hospedado: ~$0,00005/página (apenas custo do servidor).

Quantos tokens uma página PDF produz?

Uma página típica com muito texto produz de 300 a 800 tokens. Um formulário com tabelas gera de 400 a 1.200 tokens. Relatórios financeiros densos podem atingir mais de 1.500 tokens por página. Use 500 como estimativa inicial.

Devo usar suporte nativo a PDF ou extração de texto OCR +?

Claude 3.5+ e GPT-4o aceitam arquivos PDF diretamente. Claude cobra por bloco de imagem (~1.700 tokens/página ≈ US$ 0,0051/página), competitivo com OCR externo + pipeline de texto para volumes moderados. OCR externo é melhor quando você precisa de extração estruturada ou deseja armazenar o texto em cache.

Como posso reduzir os custos de processamento de documentos em grande escala?

Três alavancas: (1) Usar OCR barato + LLM pequeno para classificação simples, modelo caro apenas para análises complexas. (2) Texto extraído em cache – não repita o OCR do mesmo documento. (3) Use API em lote (desconto de 50%). Um pipeline em camadas pode reduzir custos de 60 a 80%.