Введение
Пособие посвящено тому, как из сырых данных получить обоснованные выводы. Центральный вопрос курса — что скрывается в данных: какие закономерности в них есть, каким наблюдениям можно доверять и какие утверждения выдерживают статистическую проверку. Мы пройдём путь от сбора разнородных источников до таблицы признаков, пригодной для построения моделей, и на каждом шаге будем интересоваться не только тем, как выполнить операцию, но и тем, что она меняет в выводах.
Курс открывает индивидуальную образовательную траекторию Data & AI из четырёх дисциплин. За ним следуют «Методы искусственного интеллекта», где по подготовленным здесь признакам строятся модели, «Современные хранилища данных», где те же данные переносятся в аналитическое хранилище, и «Платформы аналитики и машинного обучения», где модель превращается в работающий сервис. Отсюда граница курса: машинное обучение в нём сознательно не рассматривается. Разбиение данных на обучающую и тестовую части, выбор метрики и обучение моделей начинаются в следующей дисциплине, а наша задача — передать ей данные, которым можно доверять.
Все темы опираются на один сквозной кейс — данные эксплуатации городской инженерной инфраструктуры. В наборе есть объекты пяти типов (тепловые пункты, трансформаторные подстанции, насосные станции, водомерные узлы и узлы уличного освещения), приборы учёта на них, почасовые показания приборов с октября 2024 по март 2025 года, суточная погода, журнал инцидентов и обращения жителей. Одни приборы накопительные: они отдают нарастающий итог, и расход приходится вычислять как разность соседних значений. Другие мгновенные: они измеряют температуру теплоносителя или напряжение. Данные синтетические и не содержат сведений о реальных людях, но собраны так, как их отдаёт настоящая система телеметрии (англ. telemetry): с пропусками связи, повторными отправками, поздно пришедшими записями, выбросами, залипанием датчика и обнулением счётчика после замены прибора. Искать и обрабатывать эти дефекты предстоит самостоятельно — именно на них видно, почему аналитика начинается не с графиков, а с проверки данных.
Девять тем складываются в три блока. Первый — предмет и данные: что такое аналитика и какое место она занимает в принятии решений (тема 1), откуда берутся данные и как собрать их из разных источников (тема 2). Второй блок — описание и подготовка. Он начинается с описательной статистики (тема 3), и этот порядок выбран намеренно: прежде чем чистить данные, нужно увидеть в числах, чем они плохи, — выброс, незаметный в таблице, сдвигает среднее и раздувает стандартное отклонение. Затем идут предобработка (тема 4) и визуализация (тема 5). Третий блок — анализ и выводы: разведочный анализ данных (англ. exploratory data analysis, EDA) с формулированием гипотез (тема 6), их статистическая проверка (тема 7), построение признаков (тема 8) и сборка аналитического проекта (тема 9).
Практические занятия образуют цепочку: сырой набор, собранный во втором занятии, профилируется в третьем, очищается в четвёртом, а гипотезы, сформулированные в шестом занятии на данных за октябрь–январь, проверяются в седьмом на данных за февраль–март. Такое разделение не случайно: гипотезу, найденную на одних данных, честно проверять только на других. Итог восьмого занятия — таблица признаков со словарём, с которой начинается курс «Методы искусственного интеллекта», а девятое занятие собирает всю цепочку в воспроизводимый проект. Поэтому результаты занятий стоит сохранять и поддерживать в рабочем состоянии до конца семестра.
От читателя требуется базовое владение Python: переменные, списки и словари, циклы, функции. Работа ведётся в Jupyter с библиотеками pandas, NumPy, SciPy, Matplotlib и Seaborn; окружение настраивается на первом практическом занятии и дальше не меняется, а учебный набор данных входит в архив окружения этого занятия. Из математики достаточно школьного курса и начальных представлений о вероятности — понятия статистики вводятся по ходу изложения.