You signed in with another tab or window. Reload to refresh your session.You signed out in another tab or window. Reload to refresh your session.You switched accounts on another tab or window. Reload to refresh your session.Dismiss alert
Abbiamo 20.711 atti, 20 collezioni, 144 anni di copertura (1874–2026). Prima di costruire analisi su questi dati, però, vale la pena dichiarare cosa il dataset può e non può dirci.
Limiti noti
Copertura selettiva
Il fork Lab mantiene solo 20 collezioni "vive" su 200+ disponibili nell'upstream (ahmeabd/italia-corpus, 288.000+ file). Cosa manca:
Atti abrogati e legislazione storica
Regi decreti, DPR, decreti ministeriali storici
Circolari, atti amministrativi
Leggi regionali (fonte: Normattiva)
Dedup per filename
Atti in più collezioni vengono aggregati con collezione;collezione. Questo ci dice che esistono in entrambe, ma non dove sono nati né qual è la funzione prevalente.
CELEX nel 14% degli atti
Solo 2.867 atti su 20.711 hanno riferimenti CELEX. Per il resto non abbiamo metadata UE, quindi niente analisi di derivazione europea.
Ritardo UE = approssimazione ritardo = anno_atto - anno_dir. anno_dir viene dal CELEX L/R più recente nell'atto, non necessariamente dalla direttiva specifica che l'atto recepisce. Per una misura precisa servirebbe incrocio full-text.
Limite temporale
Prima del 1970 i dati sono scarsi. Probabilmente perché la copertura Normattiva diventa affidabile solo da lì in poi.
Potenziale (inespresso)
Full-text queryabile via MCP
Con italia-corpus_legal_search e legal_get_document si può fare analisi testuale sui 25.000 atti: topic modeling, frequenza termini, classificazione automatica per settore, estrazione di entità (date, luoghi, importi).
Upstream da 288.000 atti
Il dataset upstream permetterebbe analisi su scala enormemente più ampia: serie storiche complete dal 1861, leggi abrogate, evoluzione del linguaggio normativo.
Incrocio con fonti esterne
EUR-Lex: procedimenti d'infrazione, direttive non recepite
Dati governi/legislature/openpolis
Sentenze Corte Costituzionale su legittimità DL
Domanda aperta
Ha senso investire su questo dataset per analisi, o conviene puntare direttamente sull'upstream? Se qualcuno ha esperienza con l'upstream, il confronto è benvenuto.
Discussione per orientare la strategia del Lab su italia-corpus.
reacted with thumbs up emoji reacted with thumbs down emoji reacted with laugh emoji reacted with hooray emoji reacted with confused emoji reacted with heart emoji reacted with rocket emoji reacted with eyes emoji
Uh oh!
There was an error while loading. Please reload this page.
Abbiamo 20.711 atti, 20 collezioni, 144 anni di copertura (1874–2026). Prima di costruire analisi su questi dati, però, vale la pena dichiarare cosa il dataset può e non può dirci.
Limiti noti
Copertura selettiva
Il fork Lab mantiene solo 20 collezioni "vive" su 200+ disponibili nell'upstream (ahmeabd/italia-corpus, 288.000+ file). Cosa manca:
Dedup per filename
Atti in più collezioni vengono aggregati con
collezione;collezione. Questo ci dice che esistono in entrambe, ma non dove sono nati né qual è la funzione prevalente.CELEX nel 14% degli atti
Solo 2.867 atti su 20.711 hanno riferimenti CELEX. Per il resto non abbiamo metadata UE, quindi niente analisi di derivazione europea.
Ritardo UE = approssimazione
ritardo = anno_atto - anno_dir.anno_dirviene dal CELEX L/R più recente nell'atto, non necessariamente dalla direttiva specifica che l'atto recepisce. Per una misura precisa servirebbe incrocio full-text.Limite temporale
Prima del 1970 i dati sono scarsi. Probabilmente perché la copertura Normattiva diventa affidabile solo da lì in poi.
Potenziale (inespresso)
Full-text queryabile via MCP
Con
italia-corpus_legal_searchelegal_get_documentsi può fare analisi testuale sui 25.000 atti: topic modeling, frequenza termini, classificazione automatica per settore, estrazione di entità (date, luoghi, importi).Upstream da 288.000 atti
Il dataset upstream permetterebbe analisi su scala enormemente più ampia: serie storiche complete dal 1861, leggi abrogate, evoluzione del linguaggio normativo.
Incrocio con fonti esterne
Domanda aperta
Ha senso investire su questo dataset per analisi, o conviene puntare direttamente sull'upstream? Se qualcuno ha esperienza con l'upstream, il confronto è benvenuto.
Discussione per orientare la strategia del Lab su italia-corpus.
All reactions