Нормализация текста.
Входные данные: строка текста UNICODE (при чтении из файла — UTF-8)
Выходные данные (базовый уровень): строка текста, приведённая к стандартному виду: из текста удалены все символы, кроме алфавитно-цифровых (латинский и русский алфавит) и пробелов, все буквы приведены к нижнему регистру, в UNICODE (при выводе в файл — UTF-8).
Дополнительная функциональность: выявление замен символов на похожие по начертанию (русских букв на латинские, цифры и т.п.) и коррекция таких замен.