В: Что такое DataFrame в pandas?
О: Это табличная структура данных с именованными колонками и индексами, удобная для фильтрации, агрегации и преобразований.
В: Зачем использовать SQL вместе с pandas?
О: SQL хорошо подходит для сложных запросов и агрегаций, а pandas удобен для дальнейшего анализа и визуализаций.
В: Чем отличаются inner, left, right, outer join?
О: inner возвращает только общие ключи, left/right сохраняют все строки слева/справа, outer — объединяет все ключи с пропусками.
В: Что такое пропуски (missing values) и почему они вредны?
О: Это отсутствующие значения; многие алгоритмы не умеют с ними работать, а статистика и модели искажаются.
В: Основные способы обработки пропусков?
О: Удаление строк/столбцов, заполнение средним/медианой/модой, более сложные методы (kNN, модели).
В: Зачем нужна нормализация и стандартизация признаков?
О: Чтобы привести признаки к сопоставимым масштабам, ускорить обучение и корректно считать расстояния.
В: В чем разница между MinMaxScaler и StandardScaler?
О: MinMaxScaler приводит к диапазону [0,1], StandardScaler — к нулевому среднему и единичной дисперсии.
В: Что делает kNN‑импутация?
О: Заполняет пропуски значением, вычисленным по ближайшим соседям в пространстве признаков.
В: Что такое k‑means?
О: Алгоритм кластеризации, который минимизирует суммарное расстояние точек до центров кластеров.
В: Как выбрать число кластеров?
О: Метод локтя (elbow), силуэт, интерпретируемость результатов и стабильность кластеров.
В: Что такое PCA?
О: Метод снижения размерности, проецирующий данные на ортогональные компоненты с максимальной дисперсией.
В: Зачем нужны t‑SNE и UMAP?
О: Для нелинейной визуализации сложных данных в 2D/3D, лучше сохраняют локальные структуры.
В: Что такое EDA?
О: Исследовательский анализ данных: статистики, графики, проверка гипотез, выявление аномалий.
В: Что такое нейронная сеть?
О: Это модель из слоев нейронов, где каждый нейрон вычисляет взвешенную сумму и применяет функцию активации.
В: Зачем нужны функции активации?
О: Они добавляют нелинейность, без которой сеть не сможет моделировать сложные зависимости.
В: Разница между sigmoid, ReLU и softmax?
О: Sigmoid — [0,1], ReLU — max(0,x), softmax — вероятности по классам (сумма = 1).
В: Почему для классификации используют кросс‑энтропию?
О: Она хорошо штрафует уверенные ошибки и соответствует вероятностной интерпретации.
В: Что такое backpropagation?
О: Алгоритм вычисления градиентов по цепному правилу для обновления весов сети.
В: Что такое переобучение и как бороться?
О: Модель запоминает шум; помогают регуляризация, dropout, ранняя остановка, больше данных.
В: Что делает Dropout?
О: Случайно «выключает» нейроны при обучении, уменьшая переобучение и улучшая обобщение.
В: Что такое CNN и зачем свертки?
О: CNN использует свертки для извлечения локальных признаков, эффективно для изображений.
В: Что такое kernel, stride, padding?
О: Kernel — фильтр, stride — шаг, padding — добавление рамки для сохранения размера карты признаков.
В: Зачем нужен pooling?
О: Снижает размерность и делает признаки устойчивее к небольшим смещениям.
В: Что такое RNN и LSTM?
О: RNN обрабатывает последовательности, LSTM добавляет ворота, чтобы бороться с затухающими градиентами.
В: Что такое embedding?
О: Векторное представление категорий/слов, которое обучается вместе с моделью.
В: Что такое language modeling?
О: Задача предсказания следующего токена по предыдущим.
В: Для чего нужны temperature и top‑k sampling?
О: Temperature управляет «случайностью», top‑k ограничивает выбор k наиболее вероятными токенами.