Предмет и задачи аналитики данных
Курс открывается темой, которая отвечает на простой, но важный вопрос: чем именно занимается аналитика данных и зачем она нужна инженеру, исследователю и специалисту, работающему с цифровыми продуктами. От ответа на этот вопрос зависит всё дальнейшее — какие методы мы будем изучать, какие инструменты осваивать, как оценивать качество собственной работы. Рассмотрим дисциплину последовательно: от её предмета и границ — к типологии задач, встраиванию в цикл принятия решений и к ограничениям, за которыми аналитика перестаёт быть добросовестной.
Аналитика данных как дисциплина
Определение: извлечение проверяемых знаний из данных для обоснования решений
Аналитика данных (data analytics) — это организованная деятельность по извлечению проверяемых знаний из массивов наблюдений с целью обоснования инженерных, управленческих или научных решений. В этом определении важно каждое слово. «Проверяемых» — потому что любое утверждение аналитика должно допускать воспроизведение на тех же данных тем же методом. «Организованная» — потому что это не единичное наблюдение, а повторяемая процедура с фиксированными шагами. «Для обоснования решений» — потому что аналитика оправдана только тогда, когда её результат влияет на выбор между альтернативами: запустить или не запустить эксперимент, заменить поставщика или оставить текущего, повысить порог срабатывания алерта или снизить.
Центральная функция аналитики — снижение неопределённости. Решение, принятое без данных, опирается на интуицию и предшествующий опыт; решение, опирающееся на аналитику, дополняет интуицию измерением. Это не отменяет опыт, но делает его проверяемым.
Границы дисциплины и её место среди смежных: статистика, Data Science, BI, Machine Learning
Аналитика данных стоит рядом с несколькими близкими областями, и путаница между ними — типичная проблема студента, впервые столкнувшегося с предметом. Стоит развести их явно.
Статистика — фундамент аналитики, но не тождественна ей. Статистика изучает свойства случайных величин и методы вывода при неполной информации; аналитика использует эти методы как инструмент, но ставит прикладные задачи, привязанные к конкретной предметной области. Аналитик обязательно владеет базовой статистикой, но не обязан доказывать сходимость оценок.
Data Science — шире аналитики. В неё традиционно включают не только исследовательский анализ, но и разработку ML-моделей, инженерию признаков, работу с неструктурированными данными (текст, изображения, сигналы). Граница подвижна, и в разных организациях её проводят по-разному. В рамках этого курса мы остаёмся в пределах аналитики: базовое ML-моделирование будет введено в курсе «Методы искусственного интеллекта» (МИИ), а промышленное развёртывание — в курсе «Платформы аналитики и машинного обучения» (ПАМО).
Business Intelligence (BI) — прикладной слой над аналитикой, ориентированный на регулярный мониторинг бизнес-показателей: дашборды, отчёты, витрины данных. BI отвечает на вопрос «что происходит прямо сейчас», аналитика в более широком смысле — ещё и на вопросы «почему», «что будет» и «что делать».
Machine Learning (ML) — набор методов построения моделей, которые обучаются на данных. ML — один из инструментов аналитики, но не её единственное содержание: значительная часть практической работы аналитика не требует обучаемых моделей и решается средствами описательной статистики и корректной визуализации.
Чтобы не путать названия профессий с содержанием работы, запомним правило: дисциплина определяется вопросами, которые она ставит к данным, а не набором библиотек.
Отличие аналитики данных от анализа данных
В русскоязычной литературе встречаются оба термина — «аналитика данных» и «анализ данных», — и их иногда употребляют как синонимы. В рамках курса мы придерживаемся следующего разграничения.
Анализ данных — это процедура: конкретное исследование, направленное на ответ на заданный вопрос по заданному датасету. Результат анализа — вывод или отчёт.
Аналитика данных — это практика: повторяемая, институционализированная работа с данными, включающая сбор, подготовку, исследование, моделирование и внедрение результатов в процесс принятия решений. Аналитика предполагает воспроизводимость, документирование, мониторинг эффекта и ответственность за качество вывода.
Аналитик проводит анализ как одну из регулярных операций, но не сводится к ней.
Данные, информация, знание: уровни абстракции и переходы между ними
Работу аналитика удобно представлять как последовательные переходы между уровнями абстракции. Классическая пирамида DIKW — Data, Information, Knowledge, Wisdom — даёт компактную модель этих переходов 1, хотя сама по себе и не без критики 2.
Данные — сырые наблюдения: значения датчиков, записи транзакций, строки журналов. Сами по себе они ещё не несут смысла: значение «24.7» превращается во что-то осмысленное только после того, как мы узнаём, что это температура в градусах Цельсия, измеренная в конкретной точке в конкретный момент.
Информация — данные, снабжённые контекстом и приведённые к форме, пригодной для сопоставления. На этом уровне уже возможны агрегации и группировки: «средняя температура за сутки», «число записей за час».
Знание — устойчивые закономерности, выявленные в информации и проверенные на новых данных: «если температура превышает 80 °C в течение 10 минут подряд, вероятность остановки линии существенно возрастает». Знание отличается от информации тем, что допускает перенос на ранее не наблюдавшиеся ситуации.
Мудрость в модели DIKW — способность принимать правильные решения в условиях неопределённости, опираясь на знание и ценности. Эту вершину пирамиды многие авторы справедливо критикуют как плохо операционализируемую; в рамках курса мы ограничимся тремя нижними уровнями и условимся называть «мудростью» корректное встраивание знания в процесс принятия решений — с пониманием ограничений анализа.
Практическое следствие этой лестницы: каждый переход вверх уменьшает объём, но увеличивает плотность смысла. Мегабайты логов сворачиваются в несколько таблиц метрик, те — в десяток устойчивых закономерностей, и уже эти закономерности кладутся в основу решений. Если по итогам анализа не произошло ни одного из этих переходов, аналитическая работа, по существу, не состоялась.
Виды аналитики
Типология аналитики — рабочий инструмент планирования: она помогает заранее понять, какого уровня ответа требует задача, и не тратить усилия на более сложный уровень, когда достаточно более простого. Принято выделять четыре вида, образующих иерархию: описательная, диагностическая, предсказательная и предписывающая. Переход на более высокий уровень оправдан только тогда, когда достигнута достаточная определённость на текущем.
Описательная аналитика: что произошло
Описательная аналитика (descriptive analytics) отвечает на вопрос «что произошло?» Она упорядочивает факты о состоянии системы: динамики показателей, распределения значений, структуры потоков, профили использования ресурсов. Типичный результат — согласованный набор метрик с однозначными определениями и репрезентативные визуализации.
Казалось бы, это простейший уровень; но именно на нём закладывается большинство ошибок всего последующего анализа. Неверно выбранная шкала, неаккуратно суммированные значения «на конец периода», неучтённая сезонность — и любые следующие выводы окажутся недостоверными. Поэтому даже при решении сложных задач предсказательной или предписывающей аналитики значительная доля работы всегда уходит на чистое описание: проверку полноты, сопоставимость периодов, корректную агрегацию.
Описательная аналитика принципиально не порождает причинных утверждений. Она фиксирует, что две величины менялись одновременно, но не объясняет, почему.
Диагностическая аналитика: почему это произошло
Диагностическая аналитика (diagnostic analytics) отвечает на вопрос «почему это произошло?» Она выявляет факторы и сегменты, связанные с наблюдаемыми изменениями: падение конверсии — в каком сегменте пользователей; всплеск ошибок — после какого релиза; рост времени ответа — на каких запросах. Результат — ранжированный перечень факторов с оценками эффектов и сформулированные гипотезы для дальнейшей проверки.
На этом уровне впервые появляется необходимость различать ассоциацию и причинность. Тот факт, что показатель A и показатель B менялись одновременно, не означает, что A вызвал B: они могут зависеть от третьего фактора C или совпасть случайно. Корректная диагностика требует учёта вмешательств (релизов, кампаний, сезонных событий), контроля множественных сравнений и ясного понимания, какие гипотезы требуют подтверждения на независимых данных.
Частая ошибка — смешение диагностики с причинным выводом: «мы нашли, что пользователи iOS имеют более низкую конверсию, значит, надо улучшать приложение под iOS». Правильная интерпретация скромнее: «обнаружен сегмент с отклонением; прежде чем действовать, проверим, не объясняется ли оно различиями трафика или источника установки».
Предсказательная аналитика: что произойдёт
Предсказательная аналитика (predictive analytics) отвечает на вопрос «что произойдёт?» На основе исторических данных она строит прогнозы будущих значений показателей или вероятности событий: нагрузка на кластер в следующие сутки, вероятность оттока клиента в ближайший месяц, оценка остаточного ресурса оборудования.
Корректная предсказательная аналитика требует строгой дисциплины проверки. Прогноз оценивают на периоде, который не использовался при его построении: в данных, упорядоченных во времени, будущее не должно «подсматриваться». Кроме того, учитывают устойчивость прогноза к изменению условий и стоимость ошибок разного рода. Прогноз теплопотребления, в среднем точный, но ошибающийся именно в сильные морозы, бесполезен для службы эксплуатации. Как устроена такая проверка для моделей машинного обучения, рассматривается в курсе «Методы искусственного интеллекта».
Практическое правило: предсказательная модель оправдана только тогда, когда её прогноз оценивается по сравнению с наивной альтернативой (предсказать значение вчерашнего дня, среднее за неделю). Если модель не превосходит наивный прогноз, её внедрение не имеет смысла.
Важное ограничение, к которому мы будем возвращаться: предсказательная полезность не равна причинности. Модель может хорошо прогнозировать отток, опираясь на корреляции, но не даст рецепта, как этот отток снизить.
Предписывающая аналитика: что следует сделать
Предписывающая аналитика (prescriptive analytics) отвечает на вопрос «что следует сделать?» Она предлагает действие, максимизирующее целевую метрику при заданных ограничениях (бюджет, риски, ресурсы, время): как распределить рекламный бюджет между каналами; какой порог срабатывания выбрать для системы мониторинга; в каком порядке обслуживать очередь заявок.
Это самый высокий уровень аналитики и самый требовательный. Честная предписывающая аналитика опирается на экспериментальную или квази-экспериментальную оценку эффектов: прежде чем рекомендовать действие, мы должны показать, что оно действительно приводит к желаемому результату, а не просто коррелирует с ним на исторических данных. Без такой проверки рекомендации превращаются в гадание с цифровым антуражем.
В инженерной практике предписывающие модели часто встраиваются в контуры автоматизированного управления: алгоритм не просто предлагает действие, а сам его совершает (перекладывает нагрузку между узлами, меняет параметры регулятора). Ответственность в таких контурах распределена иначе, и к их проектированию применяются отдельные требования надёжности, к которым мы ещё вернёмся в более поздних темах.
Сложность, стоимость и ценность на каждом уровне
Иерархия четырёх видов аналитики не декоративна. С каждым шагом вверх растут три величины:
- сложность — в терминах требуемой математики, объёма данных и экспертизы;
- стоимость — в терминах инфраструктуры, труда и времени;
- ценность — в терминах влияния на принимаемые решения.
Разумная стратегия — подниматься по этой лестнице постепенно. Попытка сразу строить предписывающую модель поверх неотлаженной описательной аналитики — классическая ошибка молодых проектов: красивая «модель принятия решений» опирается на данные, про которые никто не может сказать, как они были собраны и что именно означают.
Аналитика в цикле принятия решений
Бизнес-вопрос → данные → выводы → действие → обратная связь
Практическая работа аналитика укладывается в повторяющийся цикл: исходный вопрос формулируется в измеримых терминах; необходимые данные собираются и очищаются; применяется метод, адекватный постановке задачи и качеству измерений; вывод фиксируется и превращается в действие; эффект действия подтверждается повторным измерением.
Рассмотрим этот цикл на простом примере. В производственной системе зафиксировано увеличение времени цикла сборки. Аналитик формализует вопрос: на каких операциях возник сдвиг и каков его вклад в общий рост. Собирает телеметрию со станков, устраняет ошибки измерения, описывает динамику (описательный уровень), диагностирует факторы — смена поставщика узла, перенастройка оборудования после планового обслуживания (диагностический уровень). Проверяет гипотезы на независимых периодах и предлагает действие: вернуть прежнего поставщика либо скорректировать регламент настройки. После внедрения оценивает эффект на тех же метриках.
Ключевой элемент цикла — обратная связь. Без неё аналитика превращается в одноразовое упражнение: отчёт написан, рекомендация отдана, но никто не возвращается к данным проверить, что из этого вышло. Зрелая практика требует замыкания контура: каждое нетривиальное решение, принятое на основе аналитики, фиксируется как контрольная точка, к которой мы вернёмся через заданный срок.
Распространённое воплощение этого цикла — модель Cross-Industry Standard Process for Data Mining (CRISP-DM) 3. Она делит аналитическую работу на шесть фаз: понимание бизнеса, понимание данных, подготовка данных, моделирование, оценка и внедрение. Порядок фаз не жёсткий: что делать дальше, решают по итогам текущей фазы, и вернуться можно к любой из предыдущих. Стрелки на схеме показывают лишь самые частые зависимости: понимание бизнеса и понимание данных уточняют друг друга, подготовка данных и моделирование — тоже, а оценка может вернуть к постановке задачи. Внешний круг означает, что внедрением работа не заканчивается: его опыт порождает новые, более узкие вопросы.
В рамках курса мы не будем строго следовать терминологии CRISP-DM, но его логика — от вопроса через данные к действию и обратно — лежит в основе всех последующих тем.
Операционные, тактические и стратегические решения на данных
Решения, которые аналитика поддерживает, удобно классифицировать по горизонту и обратимости.
Операционные решения — короткий горизонт (часы, дни), высокая частота, низкая стоимость ошибки по отдельности. Алерты, автоматические переключения, правила маршрутизации запросов. Здесь ценится скорость отклика и устойчивость: лучше простой алгоритм, стабильно работающий, чем сложная модель с редкими, но критичными сбоями.
Тактические решения — средний горизонт (недели, месяцы), умеренная частота. Планирование ресурсов, настройка кампаний, пересмотр пороговых значений. Здесь важна точность оценок и возможность A/B-сравнений.
Стратегические решения — длинный горизонт (кварталы, годы), низкая частота, высокая стоимость ошибки. Выбор технологической платформы, изменение бизнес-модели, инвестиционные решения. Здесь аналитика редко даёт окончательный ответ — её роль состоит в проверке допущений и очерчивании диапазонов возможных исходов.
Ошибка уровня — распространённая болезнь. Попытка принимать стратегическое решение по короткому операционному ряду даёт ложную уверенность, а попытка управлять оперативным процессом с помощью тяжёлой стратегической модели — паралич.
Критерии успешности аналитической работы
Успех аналитической работы измеряется не точностью модели самой по себе, а тем, повлияла ли она на решение и улучшило ли это решение показатели предметной области. Критически важно различать две группы метрик:
- метрики инструмента — средняя ошибка прогноза, доля аварий, замеченных заранее, и т. п.;
- метрики результата — уровень сервиса, надёжность, затраты, выручка, доля дефектов.
Аналитика с превосходными метриками инструмента, не сдвинувшая метрики результата, — неудача. Аналитика с посредственными метриками инструмента, но приведшая к измеримому улучшению результата, — успех. Это смещение акцента с «качества модели» на «качество решения» отличает зрелую аналитическую практику от её имитации.
Области применения
Аналитика данных применима практически везде, где есть повторяемые наблюдаемые процессы. Рассматривать подряд все отрасли — упражнение бесполезное; кратко обозначим несколько направлений, существенных для контекста курса.
Аналитика в промышленности и IoT
Промышленность и IoT — одна из наиболее технически насыщенных областей применения. Типичные задачи: мониторинг состояния оборудования, предсказательное техническое обслуживание, оптимизация режимов работы, контроль качества продукции по показаниям датчиков. Особенности этой области — высокая частота измерений, высокая доля шума и пропусков, сильная временная структура данных. Многие методы, которые в «чистых» бизнес-датасетах работают без нареканий, в промышленных задачах требуют серьёзной адаптации именно из-за шума и нерегулярности поступления данных.
Аналитика в бизнесе, финансах, маркетинге
Здесь аналитика наиболее массовая и наиболее разработанная. Воронки продаж, сегментация клиентов, оценка эффективности рекламных кампаний, кредитный скоринг, анализ оттока, A/B-тестирование продуктовых гипотез. Большинство открытых датасетов, на которых удобно тренироваться, пришли именно из этой области.
Аналитика в науке, медицине, государственном управлении
Научная аналитика традиционно строга в вопросах методологии: здесь выше требования к воспроизводимости, к учёту ошибок измерения, к корректной статистической обработке. Медицинская аналитика добавляет к этому жёсткий этический контур и строгие регуляторные требования. Государственная аналитика — работа с переписями, статистикой отраслей, данными мониторинга городской среды — особенно чувствительна к репрезентативности выборок и к корректному представлению результатов для не-специалистов.
Типовые кейсы и сквозной кейс курса
Отраслевые примеры полезны, пока за ними стоят конкретные данные. Поэтому все практические занятия курса построены на одном наборе — данных эксплуатации городской инженерной инфраструктуры, описанных во введении: объекты, приборы учёта и их почасовые показания, погода, инциденты и обращения жителей. Разберём на нём типичный вопрос службы эксплуатации: в районе выросло число обращений жителей по отоплению.
На описательном уровне аналитик устанавливает, как менялись теплопотребление и температура теплоносителя на тепловых пунктах района. На диагностическом — совпадают ли провалы с похолоданиями, с инцидентами вроде завоздушивания или утечки теплоносителя, с пропусками связи приборов и не отражает ли рост обращений активность жителей, а не состояние сети. На предсказательном — какое потребление ожидать завтра при прогнозной температуре; эту задачу решает курс «Методы искусственного интеллекта» по таблице признаков, построенной в теме 8. Предписывающий уровень — в каком порядке обслуживать тепловые пункты — остаётся за рамками курса.
Цепочка тем повторяет цикл принятия решений: сбор данных (тема 2), их описание и план очистки (тема 3), очистка (тема 4), визуализация (тема 5), гипотезы на данных октября–января (тема 6) и их проверка на данных февраля–марта (тема 7), признаки (тема 8) и отчёт для службы эксплуатации (тема 9). Тот же набор затем используется в курсах «Методы искусственного интеллекта», «Современные хранилища данных» и «Платформы аналитики и машинного обучения».
Ограничения и ответственность аналитика
Качество данных как верхняя граница качества выводов
Первое правило аналитика звучит неромантично: качество данных задаёт верхнюю границу качества выводов. Никакой, сколь угодно изощрённый, метод не извлечёт достоверного знания из данных, собранных с ошибками. Если датчик измеряет температуру со смещением 3 °C, все построенные на его показаниях модели будут воспроизводить это смещение. Если опросный лист включает наводящие вопросы, все последующие корреляции окажутся артефактом формулировок.
Отсюда — непропорциональная доля времени, которую аналитик тратит на проверку и очистку данных. По оценкам из интервью с аналитиками, приведённым в статье С. Лора, на сбор и подготовку данных уходит от 50 до 80 % рабочего времени 4; это экспертные оценки, а не измерение. В учебных примерах эта доля искусственно занижена, потому что данные уже подготовлены автором.
Предвзятость данных и методов, корректность интерпретации
Данные несут в себе предвзятость (bias) — систематические отклонения, возникающие из-за способа сбора, состава выборки, действий тех, кто данные производил. Простейший пример: модель, обученная на данных только активных пользователей сервиса, не умеет работать с пассивными — но именно поведение пассивных чаще всего представляет интерес. Выявление и документирование предвзятости — обязательная часть работы, а не дополнительная опция 5.
Предвзятость методов — ещё одна ловушка. Закономерность, найденная и подтверждённая на одних и тех же данных, выглядит надёжнее, чем есть на самом деле. Это не вопрос добросовестности, а следствие статистики, и защищаются от этого эффекта процедурой: в курсе гипотезы формулируются на данных октября–января (тема 6), а проверяются на данных февраля–марта с поправкой на множественные сравнения (тема 7). Утечку информации из будущего в признаки разберём в теме 8, а схемы проверки моделей — предмет курса «Методы искусственного интеллекта».
Корректная интерпретация результатов требует сдержанности формулировок. «На данных октября–января теплопотребление пунктов района выше в холодные дни» — корректное утверждение при указании данных и способа сравнения. «Похолодание вызывает перерасход тепла» — некорректное утверждение, пока связь не проверена (темы 6 и 7).
Этические и правовые рамки работы с данными
Работа с данными регулируется как законом, так и профессиональной этикой. Правовые ограничения — от защиты персональных данных (в России — 152-ФЗ 6, в ЕС — GDPR 7) до отраслевых регламентов (медицина, финансы) — определяют, какие данные можно собирать, хранить и обрабатывать, на каких основаниях и с какими предосторожностями. Нарушение этих норм — не абстрактный риск, а прямая ответственность организации и, в ряде случаев, конкретного специалиста.
Этические рамки шире правовых. Даже формально допустимый анализ может быть недопустим по существу: например, сегментация клиентов, приводящая к систематическому ухудшению условий для уязвимых групп. Добросовестный аналитик задаёт вопросы о последствиях своих выводов, а не только об их технической корректности.
В рамках курса мы возвращаемся к теме этики на каждом этапе — при обсуждении сбора данных, предобработки, отчётности и представления результатов. Этика не отдельная дисциплина, приставленная к аналитике сбоку, а её сквозное измерение.
Итоги темы
В этой теме мы зафиксировали предмет и границы аналитики данных, отделив её от смежных дисциплин — статистики, Data Science, BI и ML. Рассмотрели классическую типологию из четырёх видов (описательная, диагностическая, предсказательная, предписывающая) и показали, что переход на более высокий уровень требует зрелости на нижнем. Описали цикл принятия решений на данных, в который аналитика встраивается, — от формулировки вопроса до замыкания обратной связи. Наконец, обозначили рамки: качество данных как верхняя граница качества выводов, предвзятость данных и методов, правовые и этические ограничения.
В следующей теме мы перейдём от постановки задачи к её первому практическому этапу — сбору данных: рассмотрим типологию источников, форматы, способы получения данных и первые инструменты контроля их качества.
Литература
- Ackoff R. L. From Data to Wisdom. — Journal of Applied Systems Analysis, 1989, С. 3–9.
- Rowley J. The Wisdom Hierarchy: Representations of the DIKW Hierarchy. — Journal of Information Science, 2007, С. 163–180.
- Shearer C. The CRISP-DM Model: The New Blueprint for Data Mining. — Journal of Data Warehousing, 2000, С. 13–22.
- Lohr S. For Big-Data Scientists, “Janitor Work” Is Key Hurdle to Insights. — The New York Times, 2014, https://www.nytimes.com/2014/08/18/technology/for-big-data-scientists-hurdle-to-insights-is-janitor-work.html.
- Barocas S., Selbst A. D. Big Data's Disparate Impact. — California Law Review, 2016, С. 671–732.
- Федеральный закон от 27.07.2006 № 152-ФЗ «О персональных данных». — 2006.
- Regulation (EU) 2016/679 of the European Parliament and of the Council (GDPR). — 2016, https://eur-lex.europa.eu/eli/reg/2016/679/oj.