Fase 1 - Probing linguistico Studio delle rappresentazioni interne di BERT
- Ridge Regressor + MinMaxScaler su feature UD (8000train / 2000 test)
- Rappresentazione frase via token [CLS] - Probing su tutte le features (63) dell'ultimo layer (per iniziare)
- Ref: vedi paper sotto ACL 2020 (Contextual Embeddings - Linguistic Profiling) Fase 2 - Studio teorico: DIffusion & Flow Matching Comprendere il pretraining dei modelli generativi per il linguaggio
- Come si addestrano modelli basati su Diffusion (HuggingFace)
- Studio di Flow Matching come alternativa (se possibile nei tempi) Fase 3 - Preparazione dataset e ambiente Dataset fornito (Wikipedia): frasi singole o blocchi di frasi
- Filtrare frasi con len(frase) <6 token (poco informative)
- Configurare ambiente HuggingFace - Modello base per le prime run equivalente a BERT 2x2 Fase 4 - Nuova idea: Diffusion + Bidirectional Mamba Sostituire la backbone Transformer di un Diffusion Model (HuggingFace) con Bi-Mamba
- Capire come addestrare un modello Bi-Mamba da zero
- Partire da modello molto piccolo (~BERT 2x2)
- Salvare checkpoint a granularità variabile (frequenti all'inizio → meno frequenti alla fine) Fase 5 - Analisi comparativa e probing sul pretraining Confronto tra Bi-Mamba e Transformer (modello addestrato da Luca, 40M di parametri)
- Probing linguistici a diversi checkpoint durante il pretraining
- Confronto Bi-Mamba vs Transformer allo stesso punto di addestramento
- Analisi: quale backbone apprende prima le strutture linguistiche? Obiettivo di tesi: valutare se Bidirectional Mamba implementato in un Diffusion Model apprende rappresentazioni linguistiche più rapidamente o meglio rispetto al Transformer nell'ambito dei modelli diffusivi → passo intermedio verso eventuale Flow Matching con Mamba backbone.