Simplificação automática de decisões judiciais brasileiras utilizando Modelos de Linguagem de Grande Escala (LLMs).
Avaliamos 16 técnicas de simplificação textual (regras lexicais, Big Pickle, Nemotron 3 Ultra, DeepSeek V4 Flash, Qwen 2.5 7B, GPT-5.4 Mini, GPT-5.4 completo, Gemini 3.5 Flash, nos modos Few-Shot, Zero-Shot e Chain-of-Thought) sobre 100 decisões reais do STF nas áreas consumidor, família e previdenciário. As métricas incluem legibilidade (Flesch Adaptado, Gunning-Fog), similaridade lexical (ROUGE), preservação semântica (BERTScore) e análise qualitativa LLM-as-Judge.
├── src/linguagemsimples/ # Pacote Python
│ ├── corpus/ # Carregamento e pré-processamento do corpus
│ ├── metrics/ # Métricas de avaliação (legibilidade, BERTScore, ROUGE)
│ ├── evaluation/ # Orquestração da avaliação
│ └── simplification/ # Técnicas de simplificação (prompt engineering, regras)
├── scripts/ # Scripts executáveis para cada etapa
├── data/corpus/ # Corpus de decisões do STF
├── notebooks/ # Jupyter notebooks
├── tests/ # Testes automatizados
├── pyproject.toml # Configuração do projeto
└── requirements.txt # Dependências Python
- Python >= 3.11
- LaTeX: LuaLaTeX + biber (para compilar o artigo)
- Modelo spaCy:
pt_core_news_lg
# Clone o repositório
git clone https://github.com/jsansao/LinguagemSimples.git
cd LinguagemSimples
# Crie e ative o ambiente virtual
python3 -m venv .venv
source .venv/bin/activate
# Instale as dependências
pip install -r requirements.txt
# Baixe o modelo spaCy para português
python -m spacy download pt_core_news_lgOu use o Makefile:
make setupCopie .env.example para .env e preencha as chaves:
cp .env.example .envChaves necessárias:
OPENAI_API_KEY: API da OpenAI (GPT-5.4 Mini, GPT-5.4)GEMINI_API_KEY: API do Google Gemini (Gemini 3.5 Flash)ZEN_API_KEY: API do OpenCode Zen (Big Pickle, Nemotron, DeepSeek)OPENROUTER_API_KEY: API do OpenRouter (Qwen 2.5 7B)
python scripts/coletar_corpus.pypython scripts/gerar_simplificacoes.pypython scripts/avaliar_corpus.py
python scripts/avaliar_bert_score_pt.py
python scripts/avaliar_llm_as_judge.py --fullpython scripts/gerar_tabelas.py
python scripts/gerar_graficos.py
python scripts/gerar_pipeline.pypython scripts/testes_estatisticos.pymake setup # Instala dependências
make collect # Etapa 1
make simplify # Etapa 2
make evaluate # Etapa 3
make tables # Etapa 4
make stats # Etapa 5pytestO corpus completo com todas as 1.600 saídas simplificadas e avaliações está em data/corpus/corpus_completo.json. Cada documento contém:
- Texto jurídico original (ementa do STF)
- 16 variantes simplificadas
- Métricas (Flesch, Gunning-Fog, ROUGE, BERTScore)
- Avaliação LLM-as-Judge (5 categorias de erro)
Este trabalho está licenciado sob CC BY 4.0.