DocScan e uma demo funcional de document intelligence. A funcao principal funciona de verdade no navegador: o usuario cola ou carrega um arquivo textual, o app identifica o tipo de documento, extrai campos estruturados, calcula confianca, gera JSON normalizado e mostra alertas de validacao.
O projeto nao usa banco, login, OCR pago ou API de LLM. A extracao roda localmente com um motor em TypeScript para provar a experiencia principal sem custo de infraestrutura.
- Entrada por texto colado.
- Upload local de
.txt,.md,.csv,.jsone PDF com camada textual via PDF.js. - Deteccao de tipo: nota fiscal, contrato, formulario ou generico.
- Extracao de campos como CNPJ, CPF, e-mail, telefone, valor, datas, contratante, tomador e responsavel.
- Score de confianca por campo e por documento.
- Validacao de campos obrigatorios por tipo.
- JSON normalizado para exportacao.
- Download do resultado em
.json.
- OCR de imagem escaneada.
- Visao computacional com LLM.
- Banco de documentos.
- Fila de processamento.
- Revisao multiusuario.
- Treinamento por template.
Esses recursos sao naturais em uma versao SaaS, mas nao sao necessarios para demonstrar a funcao principal no portfolio.
- Next.js 14 com App Router
- TypeScript estrito
- Tailwind CSS
- Framer Motion
- Zod
- Lucide React
- Motor local de parsing em TypeScript
- PDF.js para extracao de texto de PDFs pesquisaveis
Na raiz do portfolio:
npm.cmd run dev:allIsso sobe:
Portfolio: http://localhost:3000
Aurora: http://127.0.0.1:3010
FlowMail: http://127.0.0.1:3011
Pulse: http://127.0.0.1:3012
Nimbus: http://127.0.0.1:3013
DocScan: http://127.0.0.1:3014
Entre na pasta:
cd projects/docscanInstale dependencias:
npm installRode:
npm run devAbra:
http://127.0.0.1:3014
src/app/page.tsx
Interface principal, upload, textarea, campos, alertas e JSON.
src/lib/docscan.ts
Deteccao de tipo, extracao de campos, validacao e normalizacao.
src/lib/pdf.ts
Extracao de texto real de PDFs com camada textual usando PDF.js.
public/pdf.worker.min.mjs
Worker estatico do PDF.js servido pelo Next, sem entrar no bundle principal.
src/lib/cn.ts
Helper de classes Tailwind.
Nome sugerido:
docscan-document-intelligence
Quando estiver pronto para publicar:
cd projects/docscan
git init
git add .
git commit -m "Projeto inicial do DocScan"- OCR real com Tesseract, Vision API ou worker dedicado.
- Parser de PDF robusto no servidor.
- Templates treinaveis por cliente.
- Revisao humana com historico.
- Webhook para enviar JSON a ERP, CRM ou backoffice.