Skip to content

jsansao/LinguagemSimples

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

1 Commit
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

LinguagemSimples

Simplificação automática de decisões judiciais brasileiras utilizando Modelos de Linguagem de Grande Escala (LLMs).

Resumo

Avaliamos 16 técnicas de simplificação textual (regras lexicais, Big Pickle, Nemotron 3 Ultra, DeepSeek V4 Flash, Qwen 2.5 7B, GPT-5.4 Mini, GPT-5.4 completo, Gemini 3.5 Flash, nos modos Few-Shot, Zero-Shot e Chain-of-Thought) sobre 100 decisões reais do STF nas áreas consumidor, família e previdenciário. As métricas incluem legibilidade (Flesch Adaptado, Gunning-Fog), similaridade lexical (ROUGE), preservação semântica (BERTScore) e análise qualitativa LLM-as-Judge.

Estrutura

├── src/linguagemsimples/   # Pacote Python
│   ├── corpus/             # Carregamento e pré-processamento do corpus
│   ├── metrics/            # Métricas de avaliação (legibilidade, BERTScore, ROUGE)
│   ├── evaluation/         # Orquestração da avaliação
│   └── simplification/     # Técnicas de simplificação (prompt engineering, regras)
├── scripts/                # Scripts executáveis para cada etapa
├── data/corpus/            # Corpus de decisões do STF
├── notebooks/              # Jupyter notebooks
├── tests/                  # Testes automatizados
├── pyproject.toml          # Configuração do projeto
└── requirements.txt        # Dependências Python

Requisitos

  • Python >= 3.11
  • LaTeX: LuaLaTeX + biber (para compilar o artigo)
  • Modelo spaCy: pt_core_news_lg

Instalação

# Clone o repositório
git clone https://github.com/jsansao/LinguagemSimples.git
cd LinguagemSimples

# Crie e ative o ambiente virtual
python3 -m venv .venv
source .venv/bin/activate

# Instale as dependências
pip install -r requirements.txt

# Baixe o modelo spaCy para português
python -m spacy download pt_core_news_lg

Ou use o Makefile:

make setup

API Keys

Copie .env.example para .env e preencha as chaves:

cp .env.example .env

Chaves necessárias:

  • OPENAI_API_KEY: API da OpenAI (GPT-5.4 Mini, GPT-5.4)
  • GEMINI_API_KEY: API do Google Gemini (Gemini 3.5 Flash)
  • ZEN_API_KEY: API do OpenCode Zen (Big Pickle, Nemotron, DeepSeek)
  • OPENROUTER_API_KEY: API do OpenRouter (Qwen 2.5 7B)

Reprodução

1. Coletar corpus

python scripts/coletar_corpus.py

2. Gerar simplificações

python scripts/gerar_simplificacoes.py

3. Avaliar

python scripts/avaliar_corpus.py
python scripts/avaliar_bert_score_pt.py
python scripts/avaliar_llm_as_judge.py --full

4. Gerar tabelas e figuras

python scripts/gerar_tabelas.py
python scripts/gerar_graficos.py
python scripts/gerar_pipeline.py

5. Testes estatísticos

python scripts/testes_estatisticos.py

Atalho via Makefile

make setup      # Instala dependências
make collect    # Etapa 1
make simplify   # Etapa 2
make evaluate   # Etapa 3
make tables     # Etapa 4
make stats      # Etapa 5

Testes

pytest

Corpus

O corpus completo com todas as 1.600 saídas simplificadas e avaliações está em data/corpus/corpus_completo.json. Cada documento contém:

  • Texto jurídico original (ementa do STF)
  • 16 variantes simplificadas
  • Métricas (Flesch, Gunning-Fog, ROUGE, BERTScore)
  • Avaliação LLM-as-Judge (5 categorias de erro)

Licença

Este trabalho está licenciado sob CC BY 4.0.

About

No description, website, or topics provided.

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

No releases published

Packages

 
 
 

Contributors