OCR / 抽出
LLM 分析
音量
| 原価要素 | ページごと | 文書ごと | 月あたり |
|---|
ボリュームスケーリング
| マンスリーページ | OCRコスト | LLMコスト | 合計 |
|---|
ドキュメント AI パイプラインをモデル化する方法
一般的なドキュメント処理パイプラインには、主に次の 2 つの API コストがあります。
- OCR・抽出 — スキャンした画像または PDF を機械可読テキストに変換します。ほとんどのプロバイダーではページごとに料金がかかります。
- LLM分析 — 抽出されたテキストとシステム プロンプトを分類、要約、またはデータ抽出のために LLM に渡します。トークンごとに課金されます。
テキストネイティブ PDF (スキャンされていない) の場合、OCR を完全にスキップし、無料のライブラリ (pdfplumber、pypdf) を使用してテキストを抽出し、ページごとのコストを LLM 料金のみに削減できます。
バッチ処理割引: Anthropic と OpenAI は両方とも、非同期バッチ ジョブに対して最大 50% の割引を提供します。非リアルタイムのドキュメント ワークフロー (請求書処理、夜間バッチ) の場合は、常にバッチ モードを使用してください。
関連している: OCR とドキュメント AI のコスト · RAG コスト計算ツール · バッチ API の節約
よくある質問
AI で PDF を処理するにはどれくらいの費用がかかりますか?
一般的なパイプラインの料金は、1 ページあたり 0.003 ~ 0.05 ドルです。 AWS Textract では、テキスト検出に 1 ページあたり 0.0015 ドルかかります。 Claude 3.5 Haiku を 1,500 トークン/ページ ($0.0012/ページ) で追加すると、合計は ~$0.003/ページになります。 10,000 ページ/月の場合、月額約 30 ドルになります。
ドキュメント処理に最も安価な OCR API はどれですか?
AWS Textract: 0.0015 ドル/ページ (テキスト) または 0.065 ドル/ページ (フォーム)。 Google ドキュメント AI: 1 ページあたり 0.0015 ドル。 Azure Form Recognizer: 0.0010 ドル/ページ。ミストラル OCR: 1 ページあたり 0.001 ドル。セルフホスト型 Tesseract/PaddleOCR: ~$0.00005/ページ (サーバー費用のみ)。
1 つの PDF ページから生成されるトークンの数は?
一般的なテキストの多いページでは、300 ~ 800 のトークンが生成されます。テーブルを含むフォームでは 400 ~ 1,200 個のトークンが生成されます。高密度の財務レポートでは、1 ページあたり 1,500 以上のトークンが含まれることがあります。開始見積もりとして 500 を使用します。
ネイティブ PDF サポートまたは OCR + テキスト抽出を使用する必要がありますか?
Claude 3.5+ および GPT-4o は PDF ファイルを直接受け入れます。 Claude は画像タイルごとに料金を請求します (~1,700 トークン/ページ ≈ $0.0051/ページ)。中程度のボリュームの場合は、外部 OCR + テキスト パイプラインと競合します。構造化された抽出が必要な場合、またはテキストをキャッシュしたい場合は、外部 OCR が適しています。
文書処理コストを大規模に削減するにはどうすればよいですか?
3 つのレバー: (1) 単純な分類には安価な OCR + 小規模 LLM を使用し、複雑な分析には高価なモデルのみを使用します。 (2) 抽出されたテキストをキャッシュします。同じ文書を再度 OCR しないでください。 (3) バッチ API を使用します (50% 割引)。階層型パイプラインによりコストを 60 ~ 80% 削減できます。