Нужно нормализовать адрес, разбив его на отдельные типы адреса (город Москва улиц. Одуванчиковая 6 -> г. Москва, ул. Одуванчиковая д. 6)
adddress- ненормализованный адресsourse- источник данных- остальные колонки - нормализованное представление адреса
С помощью регулярных выражений парсятся префиксы строк трейна, которые подаются в алгоритм ахо-корасика для дальнейшего поиска максимальной подстроки в сыром адресе. Производится обработка для исправления краевых случаев
Финальная метрика: 0.9999507 f1 score
- train.py берет файл по пути data/addresses-train.csv и сохраняет модель re_model.pkl
- predict.py берет файл по пути data/addresses-close.csv и подгружает модель re_model.pkl
- https://disk.yandex.ru/d/ec8ZffPRe7q_Zg - ссылка на данные
