Skip to content

Latest commit

 

History

2 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 

Repository files navigation

Document Intelligence

Automated extraction from unstructured documents using Claude + AWS Textract. Outputs structured JSON with confidence scores.

Overview

This project combines AWS Textract's OCR/layout extraction with Claude's reasoning to turn unstructured documents (PDFs, scanned images, forms) into clean, structured JSON — including per-field confidence scores.

Features

  • Document ingestion (PDF, PNG, JPG)
  • Text and layout extraction via AWS Textract
  • Field-level structuring and validation via Claude
  • JSON output with confidence scores per extracted field
  • Configurable extraction schemas per document type

Architecture

Document → AWS Textract (OCR/layout) → Claude (structuring + validation) → JSON output

Requirements

  • Python 3.10+
  • AWS account with Textract access
  • Anthropic API key

Setup

git clone https://github.com/xdt-ai/document-intelligence.git
cd document-intelligence
pip install -r requirements.txt
cp .env.example .env  # add your AWS and Anthropic credentials

Usage

python src/main.py --input examples/sample_invoice.pdf --schema invoice

Project Structure

document-intelligence/
├── src/          # Core extraction and processing logic
├── tests/        # Unit and integration tests
├── examples/     # Sample documents and expected outputs
├── docs/         # Additional documentation
├── requirements.txt
└── README.md

License

MIT

About

No description, website, or topics provided.

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages