Проект: Создание эталона Нормативно-справочной информации (НСИ) общих центров обслуживания (ОЦО) на языке Python Задача: Предобработка текстовых данных при помощи скриптов, предобученных моделей NLP, GPT-моделей;
Описание задачи: В данной задаче необходимо произвести предобработку данных, осуществляя следующие шаги: Смена регистра на нижний; Убрать лишние символы: точки, запятые, двойные пробелы, пробелы на концах. Внимание! Тире необходимо оставить; Исправить ошибки в текстовых данных; Расшифровать сокращения и аббревиатуры; На каждом шаге предобработки производить группировку уникальных элементов, собирая данные о получившемся количестве.
Исходные данные: Получите исходные данные у наставника. (7 файлов в которых более 44 тысяч предложений) Результат задачи: preprocessed.xlsx — таблица с колонками: before (до предобработки), after (после предобработки); .zip-архив с решением задачи.