Классификация астрономических объектов – важная задача при анализе данных крупных обзорных проектов. В современную эпоху наблюдательной астрономии объемы каталогов достигают миллионов объектов, что делает ручную классификацию непрактичной. Практическая цель данного проекта – разработать модель машинного обучения для автоматизированной классификации объектов на классы звезда, галактика или квазар. В рамках работы использован открытый набор данных обзора Sloan Digital Sky Survey (SDSS). Датасет содержит сведения о 100 000 небесных объектах, для каждого из которых представлены измеренные характеристики. Каждому объекту приписан один из трех классов: звезда, галактика либо квазар. Задача классификации формулируется как предсказание класса объекта по его характеристикам. В отчёте представлены результаты полного цикла работы с данными: от разведочного анализа (EDA) и предобработки до построения и оценки моделей классификации. Данные описаны, сформулирована задача, проведён анализ распределений и взаимосвязей признаков, выполнена очистка и отбор информативных признаков, обучены и настроены несколько моделей, выбрана оптимальная модель и проанализированы её показатели.
Всего имеется 100 000 записей, и для каждого объекта заданы различные атрибуты наблюдения. Среди признаков присутствуют как технические идентификаторы, так и физические характеристики объекта. Каждое наблюдение сопровождается меткой класса – указанием, является ли данный объект звездой, галактикой или квазаром. Соотношение классов в выборке заметно неравномерное:
- ~ 59% объектов – галактики,
- ~ 22% – звёзды,
- ~ 19% – квазары.
Это необходимо учитывать при выборе методов и метрик модели, чтобы обеспечить корректную оценку качества классификации и избежать смещения модели в сторону наиболее частого класса.
Решаемая задача заключается в следующем: по набору характеристик объекта предсказать его класс (звезда, галактика или квазар). С точки зрения машинного обучения, это задача мультиклассовой классификации с тремя категориями. Успешное решение позволит автоматически различать звёзды, галактики и квазары по их наблюдательным признакам, что имеет практическую ценность при обработке данных больших обзоров вроде SDSS. Все данные количественные; пропущенных значений нет, что упрощает предобработку. Количество признаков изначально составляет 18, включая технические поля и идентификаторы наблюдений. Целевая переменная – категориальная, изначально представлена текстовыми метками («Star», «Galaxy», «QSO»).
На первом этапе был выполнен разведочный анализ данных (EDA), направленный на понимание структуры признаков, их распределений и потенциальной информативности для задачи классификации.
В рамках анализа были изучены распределения всех количественных признаков и проверено наличие выбросов. В фотометрических величинах (u, g, r, i, z) обнаружены единичные аномальные значения, существенно отклоняющиеся от основной массы наблюдений. Такие значения могут соответствовать как редким астрономическим объектам, так и ошибкам измерений. Аналогичная проверка выполнена для признака красного смещения: для большинства объектов значения лежат в ожидаемых диапазонах (звёзды — около нуля, галактики — малые значения, квазары — существенно выше), однако выявлены отдельные экстремальные наблюдения, которые можно рассматривать как выбросы. На данном этапе выбросы были удалены из выборки для адекватной визуальной оценки данных, однако в обучении моделей они будут использоваться. Для всех признаков построены гистограммы распределений.
Сравнение признаков между классами показало выраженные различия в распределениях:
-
Redshift оказался наиболее информативным признаком:
-
для звёзд значения практически всегда близки к нулю;
-
для галактик наблюдается умеренный разброс;
-
для квазаров характерны существенно более высокие значения.
Высокие значения redshift практически однозначно указывают на квазар, а низкие — на звезду.
-
-
Фотометрические признаки (u, g, r, i, z) также демонстрируют различия между классами. Квазары в среднем слабее в оптических диапазонах и обладают характерными цветовыми свойствами, связанными с красным смещением спектра. Галактики занимают промежуточное положение между звёздами и квазарами.
Для выявления взаимосвязей между признаками была построена матрица корреляций. Анализ показал ожидаемо сильную корреляцию между фотометрическими фильтрами, особенно между соседними диапазонами (g–r и i–z). Это согласуется с физической природой излучения: объекты, яркие в одном оптическом диапазоне, как правило, ярки и в смежных.
Пространственные координаты (прямое восхождение α и склонение δ) не продемонстрировали высокой разделяющей способности. Распределения звёзд, галактик и квазаров по небесной сфере существенно перекрываются.
В целом, разведочный анализ показал, что ключевыми признаками для классификации являются redshift и фотометрические показатели (в том числе их комбинации и цветовые индексы). Результаты EDA подтвердили обоснованность их использования в модели и указали на необходимость учёта коррелированности признаков на этапе предобработки данных.
На этапе подготовки данных выполнены очистка датасета и отбор информативных признаков. Из набора данных удалены неинформативные и технические поля, не влияющие на классификацию. Для моделирования оставлены только физически осмысленные признаки:
- Координаты объекта: прямое восхождение alpha и склонение delta.
- Фотометрические признаки: звёздные величины в фильтрах SDSS u, g, r, i, z, описывающие спектральное распределение энергии.
- Красное смещение (redshift): признак, характеризующий удалённость внегалактических объектов и эффективно отделяющий звёзды (redshift ≈ 0) от галактик и квазаров.
В результате отбора число признаков сокращено до 8 (2 координаты, 5 фотометрических, 1 redshift). Проверка показала полное отсутствие пропусков. Выбросы, выявленные и опущенные на этапе EDA, были сохранены, так как экстремальные значения соответствуют реальным редким объектам (например, наиболее удалённым квазарам).
Целевая переменная изначально задана текстовыми метками и преобразована в числовой формат с помощью Label Encoding: 0 — галактика, 1 — квазар, 2 — звезда.
Для приведения признаков к единому масштабу применено нормирование с использованием StandardScaler (нулевое среднее и единичное стандартное отклонение). Это позволило избежать доминирования отдельных признаков из-за различий в диапазонах значений.
Данные разделены на обучающую, валидационную и тестовую выборки в пропорции 70% / 15% / 15% с сохранением исходного распределения классов (стратификация). Валидационная выборка использовалась для подбора моделей и гиперпараметров, а тестовая — для финальной оценки качества и проверки обобщающей способности модели.
В задачах классификации часто используют метрику Accuracy (долю правильных предсказаний), однако при несбалансированных классах она может быть вводящей в заблуждение. В рассматриваемом наборе данных доминирует класс «галактика», поэтому модель, всегда предсказывающая этот класс, достигала бы Accuracy около 59%, полностью игнорируя звёзды и квазары. По этой причине использование одной лишь Accuracy недостаточно для корректной оценки качества модели.
Для более объективной оценки были выбраны метрики, учитывающие качество классификации по каждому классу. В качестве основной метрики использовалась F1-macro — среднее значение F1-score по всем классам с равными весами. Значение F1-score для каждого класса рассчитывается как гармоническое среднее между Precision и Recall, после чего усредняется отдельно для звёзд, галактик и квазаров.
Дополнительно рассчитывались Precision и Recall для каждого класса, а также средневзвешенная F1-мера. Precision характеризует долю корректных предсказаний внутри выбранного класса, а Recall — долю объектов данного класса, корректно выявленных моделью.
На следующем этапе выполнен выбор и обучение моделей классификации. Для сравнения эффективности были рассмотрены три алгоритма:
- логистическая регрессия;
- дерево решений;
- случайный лес (Random Forest).
Все модели обучались на тренировочной выборке с подбором гиперпараметров с использованием GridSearchCV и 5-кратной кросс-валидации. В качестве целевой метрики оптимизации использовалась F1-macro.
Для логистической регрессии настраивались коэффициент и тип регуляризации (L1/L2) с целью контроля переобучения. Для дерева решений подбирались максимальная глубина, минимальное число объектов в листе и критерий разбиения, определяющие сложность модели. В модели случайного леса, помимо указанных параметров, оптимизировалось число деревьев в ансамбле.
После подбора гиперпараметров каждая модель обучалась на полной тренировочной выборке и оценивалась на валидационных данных.
Сравнение моделей выявило различия в качестве. Логистическая регрессия показала базовый уровень эффективности, хорошо различая звёзды, но слабее - галактики и квазары. Дерево решений оказалось более гибким и лучше справлялось с нелинейными зависимостями, в частности при распознавании квазаров.
Наилучшие результаты показал Random Forest. Эта модель достигла максимального значения F1-macro на валидационной выборке, обеспечив сбалансированное качество по всем классам. Анализ структуры моделей показал, что на верхних уровнях разбиений чаще всего использовался признак redshift, за которым следовали фотометрические показатели, что согласуется с физической интерпретацией признаков.
На основании этих результатов модель Random Forest с оптимальными гиперпараметрами была выбрана в качестве итоговой.
Финальная оценка на тестовой выборке подтвердила качество и обобщающую способность модели. Метрики оказались сопоставимы с валидационными: общая Accuracy и F1-macro составили порядка 0.97. Для класса «звезда» Precision и Recall превышают 0.99, для класса «галактика» находятся в диапазоне 0.98–0.99. Наиболее сложным остаётся класс «квазар», однако и для него показатели точности и полноты сохраняются на высоком уровне. В целом модель демонстрирует минимальное число ошибок и эффективно различает все три типа астрономических объектов.
Анализ матрицы ошибок показал, что основная часть неверных классификаций приходится на пару классов «галактика»–«квазар». Это связано с тем, что некоторые удалённые галактики по redshift и спектральным характеристикам близки к квазарам, а часть квазаров с относительно низким z или необычным спектром иногда классифицируется как галактики. Звёзды же модель различает почти безошибочно благодаря нулевому redshift и характерному сочетанию фотометрических признаков, что отражается в высоких Precision и Recall для этого класса.
Анализ важности признаков в Random Forest подтвердил физическую интерпретацию модели:
- Redshift — основной признак для разделения звёзд и внегалактических объектов.
- Фотометрические фильтры, особенно u и g, — помогают различать галактики и квазары.
- Координаты объекта имеют минимальное значение для классификации, что совпадает с выводами EDA.
Основные ограничения и направления улучшения:
- Дисбаланс классов: квазары распознаются немного хуже из-за меньшего объёма данных. Возможные решения — методы балансировки, например, увеличение числа примеров редких классов.
- Усложнение моделей: использование градиентного бустинга или нейронных сетей может позволить точнее уловить тонкие различия между галактиками и квазарами.
В рамках проекта выполнен полный цикл решения задачи Data Science на реальных данных Sloan Digital Sky Survey. Задача заключалась в автоматическом разделении астрономических объектов на звёзды, галактики и квазары по наблюдательным признакам.
Проведён разведочный анализ данных: изучены распределения признаков, выявлены выбросы и особенности, подтверждена информативность ключевых характеристик — прежде всего redshift и фотометрических фильтров — для классификации. Гипотезы о различиях между классами подтвердились: объекты разных типов существенно различаются по ряду признаков, что делает задачу решаемой с высокой точностью.
Данные были очищены и подготовлены: удалены технические и неинформативные атрибуты, целевая переменная закодирована числовыми метками, признаки нормализованы. Для оценки моделей использовались метрики, учитывающие дисбаланс классов, в частности F1-macro, наряду с общей точностью.
Испытаны три модели машинного обучения разной природы. С помощью кросс-валидации и подбора гиперпараметров определена оптимальная модель — случайный лес, показавший наилучшее качество и стабильность, достаточно эффективно распознавая все классы, включая менее представленные.