Skip to content

codeone01/docscan

Repository files navigation

DocScan - Extracao Inteligente de Documentos

DocScan e uma demo funcional de document intelligence. A funcao principal funciona de verdade no navegador: o usuario cola ou carrega um arquivo textual, o app identifica o tipo de documento, extrai campos estruturados, calcula confianca, gera JSON normalizado e mostra alertas de validacao.

O projeto nao usa banco, login, OCR pago ou API de LLM. A extracao roda localmente com um motor em TypeScript para provar a experiencia principal sem custo de infraestrutura.

O Que Funciona

  • Entrada por texto colado.
  • Upload local de .txt, .md, .csv, .json e PDF com camada textual via PDF.js.
  • Deteccao de tipo: nota fiscal, contrato, formulario ou generico.
  • Extracao de campos como CNPJ, CPF, e-mail, telefone, valor, datas, contratante, tomador e responsavel.
  • Score de confianca por campo e por documento.
  • Validacao de campos obrigatorios por tipo.
  • JSON normalizado para exportacao.
  • Download do resultado em .json.

O Que E Demo

  • OCR de imagem escaneada.
  • Visao computacional com LLM.
  • Banco de documentos.
  • Fila de processamento.
  • Revisao multiusuario.
  • Treinamento por template.

Esses recursos sao naturais em uma versao SaaS, mas nao sao necessarios para demonstrar a funcao principal no portfolio.

Stack

  • Next.js 14 com App Router
  • TypeScript estrito
  • Tailwind CSS
  • Framer Motion
  • Zod
  • Lucide React
  • Motor local de parsing em TypeScript
  • PDF.js para extracao de texto de PDFs pesquisaveis

Como Rodar Junto Com o Portfolio

Na raiz do portfolio:

npm.cmd run dev:all

Isso sobe:

Portfolio: http://localhost:3000
Aurora:    http://127.0.0.1:3010
FlowMail:  http://127.0.0.1:3011
Pulse:     http://127.0.0.1:3012
Nimbus:    http://127.0.0.1:3013
DocScan:   http://127.0.0.1:3014

Como Rodar So o DocScan

Entre na pasta:

cd projects/docscan

Instale dependencias:

npm install

Rode:

npm run dev

Abra:

http://127.0.0.1:3014

Arquitetura

src/app/page.tsx
  Interface principal, upload, textarea, campos, alertas e JSON.

src/lib/docscan.ts
  Deteccao de tipo, extracao de campos, validacao e normalizacao.

src/lib/pdf.ts
  Extracao de texto real de PDFs com camada textual usando PDF.js.

public/pdf.worker.min.mjs
  Worker estatico do PDF.js servido pelo Next, sem entrar no bundle principal.

src/lib/cn.ts
  Helper de classes Tailwind.

Repositorio GitHub

Nome sugerido:

docscan-document-intelligence

Quando estiver pronto para publicar:

cd projects/docscan
git init
git add .
git commit -m "Projeto inicial do DocScan"

Proximos Passos

  • OCR real com Tesseract, Vision API ou worker dedicado.
  • Parser de PDF robusto no servidor.
  • Templates treinaveis por cliente.
  • Revisao humana com historico.
  • Webhook para enviar JSON a ERP, CRM ou backoffice.

About

Demo de extracao inteligente de documentos no navegador (Next.js)

Resources

Stars

Watchers

Forks

Releases

Packages

Contributors

Languages