Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

13 Commits
 
 
 
 
 
 

Repository files navigation

lab4ML

Теория для защиты

Лаба 2 — инструменты анализа и предобработки данных

В: Что такое DataFrame в pandas?
О: Это табличная структура данных с именованными колонками и индексами, удобная для фильтрации, агрегации и преобразований.

В: Зачем использовать SQL вместе с pandas?
О: SQL хорошо подходит для сложных запросов и агрегаций, а pandas удобен для дальнейшего анализа и визуализаций.

В: Чем отличаются inner, left, right, outer join?
О: inner возвращает только общие ключи, left/right сохраняют все строки слева/справа, outer — объединяет все ключи с пропусками.

В: Что такое пропуски (missing values) и почему они вредны?
О: Это отсутствующие значения; многие алгоритмы не умеют с ними работать, а статистика и модели искажаются.

В: Основные способы обработки пропусков?
О: Удаление строк/столбцов, заполнение средним/медианой/модой, более сложные методы (kNN, модели).

В: Зачем нужна нормализация и стандартизация признаков?
О: Чтобы привести признаки к сопоставимым масштабам, ускорить обучение и корректно считать расстояния.

В: В чем разница между MinMaxScaler и StandardScaler?
О: MinMaxScaler приводит к диапазону [0,1], StandardScaler — к нулевому среднему и единичной дисперсии.

В: Что делает kNN‑импутация?
О: Заполняет пропуски значением, вычисленным по ближайшим соседям в пространстве признаков.

В: Что такое k‑means?
О: Алгоритм кластеризации, который минимизирует суммарное расстояние точек до центров кластеров.

В: Как выбрать число кластеров?
О: Метод локтя (elbow), силуэт, интерпретируемость результатов и стабильность кластеров.

В: Что такое PCA?
О: Метод снижения размерности, проецирующий данные на ортогональные компоненты с максимальной дисперсией.

В: Зачем нужны t‑SNE и UMAP?
О: Для нелинейной визуализации сложных данных в 2D/3D, лучше сохраняют локальные структуры.

В: Что такое EDA?
О: Исследовательский анализ данных: статистики, графики, проверка гипотез, выявление аномалий.

Лаба 6 — нейронные сети

В: Что такое нейронная сеть?
О: Это модель из слоев нейронов, где каждый нейрон вычисляет взвешенную сумму и применяет функцию активации.

В: Зачем нужны функции активации?
О: Они добавляют нелинейность, без которой сеть не сможет моделировать сложные зависимости.

В: Разница между sigmoid, ReLU и softmax?
О: Sigmoid — [0,1], ReLU — max(0,x), softmax — вероятности по классам (сумма = 1).

В: Почему для классификации используют кросс‑энтропию?
О: Она хорошо штрафует уверенные ошибки и соответствует вероятностной интерпретации.

В: Что такое backpropagation?
О: Алгоритм вычисления градиентов по цепному правилу для обновления весов сети.

В: Что такое переобучение и как бороться?
О: Модель запоминает шум; помогают регуляризация, dropout, ранняя остановка, больше данных.

В: Что делает Dropout?
О: Случайно «выключает» нейроны при обучении, уменьшая переобучение и улучшая обобщение.

В: Что такое CNN и зачем свертки?
О: CNN использует свертки для извлечения локальных признаков, эффективно для изображений.

В: Что такое kernel, stride, padding?
О: Kernel — фильтр, stride — шаг, padding — добавление рамки для сохранения размера карты признаков.

В: Зачем нужен pooling?
О: Снижает размерность и делает признаки устойчивее к небольшим смещениям.

В: Что такое RNN и LSTM?
О: RNN обрабатывает последовательности, LSTM добавляет ворота, чтобы бороться с затухающими градиентами.

В: Что такое embedding?
О: Векторное представление категорий/слов, которое обучается вместе с моделью.

В: Что такое language modeling?
О: Задача предсказания следующего токена по предыдущим.

В: Для чего нужны temperature и top‑k sampling?
О: Temperature управляет «случайностью», top‑k ограничивает выбор k наиболее вероятными токенами.

About

No description, website, or topics provided.

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages