Skip to content

Latest commit

 

History

7 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 

Repository files navigation

Проект: Создание эталона Нормативно-справочной информации (НСИ) общих центров обслуживания (ОЦО) на языке Python Задача: Предобработка текстовых данных при помощи скриптов, предобученных моделей NLP, GPT-моделей;

Описание задачи: В данной задаче необходимо произвести предобработку данных, осуществляя следующие шаги: Смена регистра на нижний; Убрать лишние символы: точки, запятые, двойные пробелы, пробелы на концах. Внимание! Тире необходимо оставить; Исправить ошибки в текстовых данных; Расшифровать сокращения и аббревиатуры; На каждом шаге предобработки производить группировку уникальных элементов, собирая данные о получившемся количестве.

Исходные данные: Получите исходные данные у наставника. (7 файлов в которых более 44 тысяч предложений) Результат задачи: preprocessed.xlsx — таблица с колонками: before (до предобработки), after (после предобработки); .zip-архив с решением задачи.

About

No description, website, or topics provided.

Resources

Stars

0 stars

Watchers

1 watching

Forks

Releases

Packages

Contributors

Languages