[{"data":1,"prerenderedAt":755},["ShallowReactive",2],{"course:aidt-iot-vvad":3,"course:aidt-iot-vvad:topics":96,"course:aidt-iot-vvad:project":61},{"id":4,"title":5,"body":6,"course_slug":60,"description":56,"env_label":61,"env_url":61,"extension":62,"group":63,"is_course_project":64,"is_index":65,"level":66,"meta":67,"navigation":65,"path":92,"section":61,"seo":93,"stem":94,"topic_number":61,"topic_slug":61,"__hash__":95},"courses\u002Fcourses\u002Faidt-iot-vvad\u002Findex.md","Введение в аналитику данных",{"type":7,"value":8,"toc":55},"minimark",[9,14],[10,11,13],"h2",{"id":12},"документы","Документы",[15,16,17,27,34,41,48],"ul",{},[18,19,20,21,26],"li",{},"Требования к содержанию и оформлению — ",[22,23,25],"a",{"href":24},".\u002Fshared\u002FSTYLEGUIDE","shared\u002FSTYLEGUIDE.md",".",[18,28,29,30,26],{},"Содержание курса — ",[22,31,33],{"href":32},".\u002Ftopics","topics.md",[18,35,36,37,26],{},"Концепция траектории Data & AI — ",[22,38,40],{"href":39},".\u002Fiot-ai-concept","iot-ai-concept.md",[18,42,43,44,26],{},"Учебный набор данных — ",[22,45,47],{"href":46},".\u002Fdata\u002FREADME","data\u002FREADME.md",[18,49,50,51,26],{},"Издательские метаданные учебного пособия — ",[22,52,54],{"href":53},".\u002Fpublishing\u002Ftextbook.yaml","publishing\u002Ftextbook.yaml",{"title":56,"searchDepth":57,"depth":57,"links":58},"",2,[59],{"id":12,"depth":57,"text":13},"aidt-iot-vvad",null,"md","iot",false,true,"бакалавриат",{"topics_count":68,"has_lr":64,"has_pz":65,"has_course_project":64,"final_assessment":56,"tech_focus":69,"kind":70,"authors":71,"publication":85},9,"Python, pandas, NumPy, SciPy, Matplotlib, Seaborn, Jupyter","Учебное пособие",[72,78,82],{"last_name":73,"first_name":74,"patronymic":75,"role":76,"affiliation":77},"Рындин","Никита","Александрович","автор","ВГТУ",{"last_name":79,"first_name":80,"patronymic":81,"role":76},"Корчагин","Сергей","Геннадьевич",{"last_name":83,"first_name":84,"role":76},"Пуговкина","Наталья",{"city":86,"year":56,"founder":87,"publisher":88,"udk":56,"bbk":56,"shelf_mark":56,"isbn":56,"approval_body":91},"Воронеж","Министерство науки и высшего образования Российской Федерации",{"short":77,"full":89,"address":90},"Федеральное государственное бюджетное образовательное учреждение высшего образования «Воронежский государственный технический университет»\n","394026, Воронеж, Московский проспект, 14","Издается по решению редакционно-издательского совета\nВоронежского государственного технического университета\n","\u002Fcourses\u002Faidt-iot-vvad",{"title":5,"description":56},"courses\u002Faidt-iot-vvad\u002Findex","Al8IRco-wPstgi13cZRlSXRxhy1YoFgBBv09f5I5Jbg",[97,144],{"id":98,"title":99,"body":100,"course_slug":60,"description":109,"env_label":61,"env_url":61,"extension":62,"group":61,"is_course_project":64,"is_index":64,"level":61,"meta":136,"navigation":65,"path":137,"section":138,"seo":139,"stem":140,"topic_number":141,"topic_slug":142,"__hash__":143},"courses\u002Fcourses\u002Faidt-iot-vvad\u002Ftopic-00-content.md","Введение",{"type":7,"value":101,"toc":134},[102,106,110,113,121,128,131],[103,104,99],"h1",{"id":105},"введение",[107,108,109],"p",{},"Пособие посвящено тому, как из сырых данных получить обоснованные выводы. Центральный вопрос курса — что скрывается в данных: какие закономерности в них есть, каким наблюдениям можно доверять и какие утверждения выдерживают статистическую проверку. Мы пройдём путь от сбора разнородных источников до таблицы признаков, пригодной для построения моделей, и на каждом шаге будем интересоваться не только тем, как выполнить операцию, но и тем, что она меняет в выводах.",[107,111,112],{},"Курс открывает индивидуальную образовательную траекторию Data & AI из четырёх дисциплин. За ним следуют «Методы искусственного интеллекта», где по подготовленным здесь признакам строятся модели, «Современные хранилища данных», где те же данные переносятся в аналитическое хранилище, и «Платформы аналитики и машинного обучения», где модель превращается в работающий сервис. Отсюда граница курса: машинное обучение в нём сознательно не рассматривается. Разбиение данных на обучающую и тестовую части, выбор метрики и обучение моделей начинаются в следующей дисциплине, а наша задача — передать ей данные, которым можно доверять.",[107,114,115,116,120],{},"Все темы опираются на один сквозной кейс — данные эксплуатации городской инженерной инфраструктуры. В наборе есть объекты пяти типов (тепловые пункты, трансформаторные подстанции, насосные станции, водомерные узлы и узлы уличного освещения), приборы учёта на них, почасовые показания приборов с октября 2024 по март 2025 года, суточная погода, журнал инцидентов и обращения жителей. Одни приборы накопительные: они отдают нарастающий итог, и расход приходится вычислять как разность соседних значений. Другие мгновенные: они измеряют температуру теплоносителя или напряжение. Данные синтетические и не содержат сведений о реальных людях, но собраны так, как их отдаёт настоящая система телеметрии (англ. ",[117,118,119],"em",{},"telemetry","): с пропусками связи, повторными отправками, поздно пришедшими записями, выбросами, залипанием датчика и обнулением счётчика после замены прибора. Искать и обрабатывать эти дефекты предстоит самостоятельно — именно на них видно, почему аналитика начинается не с графиков, а с проверки данных.",[107,122,123,124,127],{},"Девять тем складываются в три блока. Первый — предмет и данные: что такое аналитика и какое место она занимает в принятии решений (тема 1), откуда берутся данные и как собрать их из разных источников (тема 2). Второй блок — описание и подготовка. Он начинается с описательной статистики (тема 3), и этот порядок выбран намеренно: прежде чем чистить данные, нужно увидеть в числах, чем они плохи, — выброс, незаметный в таблице, сдвигает среднее и раздувает стандартное отклонение. Затем идут предобработка (тема 4) и визуализация (тема 5). Третий блок — анализ и выводы: разведочный анализ данных (англ. ",[117,125,126],{},"exploratory data analysis",", EDA) с формулированием гипотез (тема 6), их статистическая проверка (тема 7), построение признаков (тема 8) и сборка аналитического проекта (тема 9).",[107,129,130],{},"Практические занятия образуют цепочку: сырой набор, собранный во втором занятии, профилируется в третьем, очищается в четвёртом, а гипотезы, сформулированные в шестом занятии на данных за октябрь–январь, проверяются в седьмом на данных за февраль–март. Такое разделение не случайно: гипотезу, найденную на одних данных, честно проверять только на других. Итог восьмого занятия — таблица признаков со словарём, с которой начинается курс «Методы искусственного интеллекта», а девятое занятие собирает всю цепочку в воспроизводимый проект. Поэтому результаты занятий стоит сохранять и поддерживать в рабочем состоянии до конца семестра.",[107,132,133],{},"От читателя требуется базовое владение Python: переменные, списки и словари, циклы, функции. Работа ведётся в Jupyter с библиотеками pandas, NumPy, SciPy, Matplotlib и Seaborn; окружение настраивается на первом практическом занятии и дальше не меняется, а учебный набор данных входит в архив окружения этого занятия. Из математики достаточно школьного курса и начальных представлений о вероятности — понятия статистики вводятся по ходу изложения.",{"title":56,"searchDepth":57,"depth":57,"links":135},[],{},"\u002Fcourses\u002Faidt-iot-vvad\u002Ftopic-00-content","content",{"title":99,"description":109},"courses\u002Faidt-iot-vvad\u002Ftopic-00-content",0,"topic-00","hzLeQ8P2kD7OXdUAZbmfcwexgoFUlTwvbzX86rrpzlc",{"id":145,"title":146,"body":147,"course_slug":60,"description":154,"env_label":61,"env_url":61,"extension":62,"group":61,"is_course_project":64,"is_index":64,"level":61,"meta":748,"navigation":65,"path":749,"section":138,"seo":750,"stem":751,"topic_number":752,"topic_slug":753,"__hash__":754},"courses\u002Fcourses\u002Faidt-iot-vvad\u002Ftopic-01-content.md","Предмет и задачи аналитики данных",{"type":7,"value":148,"toc":714},[149,152,155,159,164,167,170,174,177,184,190,196,202,209,213,216,223,230,233,237,266,279,285,291,297,303,314,318,321,325,332,335,338,342,349,360,363,367,374,377,380,383,387,394,397,400,404,407,427,430,434,438,441,448,455,472,481,484,488,491,497,503,509,512,516,526,540,543,547,550,554,557,561,564,568,571,575,578,581,584,588,592,599,612,616,628,631,634,638,661,664,667,671,674,677,681],[103,150,146],{"id":151},"предмет-и-задачи-аналитики-данных",[107,153,154],{},"Курс открывается темой, которая отвечает на простой, но важный вопрос: чем именно занимается аналитика данных и зачем она нужна инженеру, исследователю и специалисту, работающему с цифровыми продуктами. От ответа на этот вопрос зависит всё дальнейшее — какие методы мы будем изучать, какие инструменты осваивать, как оценивать качество собственной работы. Рассмотрим дисциплину последовательно: от её предмета и границ — к типологии задач, встраиванию в цикл принятия решений и к ограничениям, за которыми аналитика перестаёт быть добросовестной.",[10,156,158],{"id":157},"аналитика-данных-как-дисциплина","Аналитика данных как дисциплина",[160,161,163],"h3",{"id":162},"определение-извлечение-проверяемых-знаний-из-данных-для-обоснования-решений","Определение: извлечение проверяемых знаний из данных для обоснования решений",[107,165,166],{},"Аналитика данных (data analytics) — это организованная деятельность по извлечению проверяемых знаний из массивов наблюдений с целью обоснования инженерных, управленческих или научных решений. В этом определении важно каждое слово. «Проверяемых» — потому что любое утверждение аналитика должно допускать воспроизведение на тех же данных тем же методом. «Организованная» — потому что это не единичное наблюдение, а повторяемая процедура с фиксированными шагами. «Для обоснования решений» — потому что аналитика оправдана только тогда, когда её результат влияет на выбор между альтернативами: запустить или не запустить эксперимент, заменить поставщика или оставить текущего, повысить порог срабатывания алерта или снизить.",[107,168,169],{},"Центральная функция аналитики — снижение неопределённости. Решение, принятое без данных, опирается на интуицию и предшествующий опыт; решение, опирающееся на аналитику, дополняет интуицию измерением. Это не отменяет опыт, но делает его проверяемым.",[160,171,173],{"id":172},"границы-дисциплины-и-её-место-среди-смежных-статистика-data-science-bi-machine-learning","Границы дисциплины и её место среди смежных: статистика, Data Science, BI, Machine Learning",[107,175,176],{},"Аналитика данных стоит рядом с несколькими близкими областями, и путаница между ними — типичная проблема студента, впервые столкнувшегося с предметом. Стоит развести их явно.",[107,178,179,183],{},[180,181,182],"strong",{},"Статистика"," — фундамент аналитики, но не тождественна ей. Статистика изучает свойства случайных величин и методы вывода при неполной информации; аналитика использует эти методы как инструмент, но ставит прикладные задачи, привязанные к конкретной предметной области. Аналитик обязательно владеет базовой статистикой, но не обязан доказывать сходимость оценок.",[107,185,186,189],{},[180,187,188],{},"Data Science"," — шире аналитики. В неё традиционно включают не только исследовательский анализ, но и разработку ML-моделей, инженерию признаков, работу с неструктурированными данными (текст, изображения, сигналы). Граница подвижна, и в разных организациях её проводят по-разному. В рамках этого курса мы остаёмся в пределах аналитики: базовое ML-моделирование будет введено в курсе «Методы искусственного интеллекта» (МИИ), а промышленное развёртывание — в курсе «Платформы аналитики и машинного обучения» (ПАМО).",[107,191,192,195],{},[180,193,194],{},"Business Intelligence (BI)"," — прикладной слой над аналитикой, ориентированный на регулярный мониторинг бизнес-показателей: дашборды, отчёты, витрины данных. BI отвечает на вопрос «что происходит прямо сейчас», аналитика в более широком смысле — ещё и на вопросы «почему», «что будет» и «что делать».",[107,197,198,201],{},[180,199,200],{},"Machine Learning (ML)"," — набор методов построения моделей, которые обучаются на данных. ML — один из инструментов аналитики, но не её единственное содержание: значительная часть практической работы аналитика не требует обучаемых моделей и решается средствами описательной статистики и корректной визуализации.",[107,203,204,205,208],{},"Чтобы не путать названия профессий с содержанием работы, запомним правило: ",[180,206,207],{},"дисциплина определяется вопросами, которые она ставит к данным",", а не набором библиотек.",[160,210,212],{"id":211},"отличие-аналитики-данных-от-анализа-данных","Отличие аналитики данных от анализа данных",[107,214,215],{},"В русскоязычной литературе встречаются оба термина — «аналитика данных» и «анализ данных», — и их иногда употребляют как синонимы. В рамках курса мы придерживаемся следующего разграничения.",[107,217,218,219,222],{},"Анализ данных — это ",[117,220,221],{},"процедура",": конкретное исследование, направленное на ответ на заданный вопрос по заданному датасету. Результат анализа — вывод или отчёт.",[107,224,225,226,229],{},"Аналитика данных — это ",[117,227,228],{},"практика",": повторяемая, институционализированная работа с данными, включающая сбор, подготовку, исследование, моделирование и внедрение результатов в процесс принятия решений. Аналитика предполагает воспроизводимость, документирование, мониторинг эффекта и ответственность за качество вывода.",[107,231,232],{},"Аналитик проводит анализ как одну из регулярных операций, но не сводится к ней.",[160,234,236],{"id":235},"данные-информация-знание-уровни-абстракции-и-переходы-между-ними","Данные, информация, знание: уровни абстракции и переходы между ними",[107,238,239,240,243,244,256,257,26],{},"Работу аналитика удобно представлять как последовательные переходы между уровнями абстракции. Классическая пирамида DIKW — ",[117,241,242],{},"Data, Information, Knowledge, Wisdom"," — даёт компактную модель этих переходов ",[245,246,249],"sup",{"className":247},[248],"cite",[22,250,252],{"href":251},"#ref-1",[253,254,255],"span",{},"1",", хотя сама по себе и не без критики ",[245,258,260],{"className":259},[248],[22,261,263],{"href":262},"#ref-2",[253,264,265],{},"2",[267,268,269,270,269,275],"figure",{},"\n  ",[271,272],"img",{"src":273,"alt":274},"\u002Fimg\u002Faidt-iot-vvad\u002Ftopic-01\u002Fdikw_pyramid.svg","Пирамида DIKW: данные, информация, знание, мудрость",[276,277,278],"figcaption",{},"Пирамида DIKW: уровни переработки сырых наблюдений в основания для действий",[107,280,281,284],{},[117,282,283],{},"Данные"," — сырые наблюдения: значения датчиков, записи транзакций, строки журналов. Сами по себе они ещё не несут смысла: значение «24.7» превращается во что-то осмысленное только после того, как мы узнаём, что это температура в градусах Цельсия, измеренная в конкретной точке в конкретный момент.",[107,286,287,290],{},[117,288,289],{},"Информация"," — данные, снабжённые контекстом и приведённые к форме, пригодной для сопоставления. На этом уровне уже возможны агрегации и группировки: «средняя температура за сутки», «число записей за час».",[107,292,293,296],{},[117,294,295],{},"Знание"," — устойчивые закономерности, выявленные в информации и проверенные на новых данных: «если температура превышает 80 °C в течение 10 минут подряд, вероятность остановки линии существенно возрастает». Знание отличается от информации тем, что допускает перенос на ранее не наблюдавшиеся ситуации.",[107,298,299,302],{},[117,300,301],{},"Мудрость"," в модели DIKW — способность принимать правильные решения в условиях неопределённости, опираясь на знание и ценности. Эту вершину пирамиды многие авторы справедливо критикуют как плохо операционализируемую; в рамках курса мы ограничимся тремя нижними уровнями и условимся называть «мудростью» корректное встраивание знания в процесс принятия решений — с пониманием ограничений анализа.",[107,304,305,306,309,310,313],{},"Практическое следствие этой лестницы: каждый переход вверх ",[117,307,308],{},"уменьшает"," объём, но ",[117,311,312],{},"увеличивает"," плотность смысла. Мегабайты логов сворачиваются в несколько таблиц метрик, те — в десяток устойчивых закономерностей, и уже эти закономерности кладутся в основу решений. Если по итогам анализа не произошло ни одного из этих переходов, аналитическая работа, по существу, не состоялась.",[10,315,317],{"id":316},"виды-аналитики","Виды аналитики",[107,319,320],{},"Типология аналитики — рабочий инструмент планирования: она помогает заранее понять, какого уровня ответа требует задача, и не тратить усилия на более сложный уровень, когда достаточно более простого. Принято выделять четыре вида, образующих иерархию: описательная, диагностическая, предсказательная и предписывающая. Переход на более высокий уровень оправдан только тогда, когда достигнута достаточная определённость на текущем.",[160,322,324],{"id":323},"описательная-аналитика-что-произошло","Описательная аналитика: что произошло",[107,326,327,328,331],{},"Описательная аналитика (descriptive analytics) отвечает на вопрос ",[117,329,330],{},"«что произошло?»"," Она упорядочивает факты о состоянии системы: динамики показателей, распределения значений, структуры потоков, профили использования ресурсов. Типичный результат — согласованный набор метрик с однозначными определениями и репрезентативные визуализации.",[107,333,334],{},"Казалось бы, это простейший уровень; но именно на нём закладывается большинство ошибок всего последующего анализа. Неверно выбранная шкала, неаккуратно суммированные значения «на конец периода», неучтённая сезонность — и любые следующие выводы окажутся недостоверными. Поэтому даже при решении сложных задач предсказательной или предписывающей аналитики значительная доля работы всегда уходит на чистое описание: проверку полноты, сопоставимость периодов, корректную агрегацию.",[107,336,337],{},"Описательная аналитика принципиально не порождает причинных утверждений. Она фиксирует, что две величины менялись одновременно, но не объясняет, почему.",[160,339,341],{"id":340},"диагностическая-аналитика-почему-это-произошло","Диагностическая аналитика: почему это произошло",[107,343,344,345,348],{},"Диагностическая аналитика (diagnostic analytics) отвечает на вопрос ",[117,346,347],{},"«почему это произошло?»"," Она выявляет факторы и сегменты, связанные с наблюдаемыми изменениями: падение конверсии — в каком сегменте пользователей; всплеск ошибок — после какого релиза; рост времени ответа — на каких запросах. Результат — ранжированный перечень факторов с оценками эффектов и сформулированные гипотезы для дальнейшей проверки.",[107,350,351,352,355,356,359],{},"На этом уровне впервые появляется необходимость различать ",[117,353,354],{},"ассоциацию"," и ",[117,357,358],{},"причинность",". Тот факт, что показатель A и показатель B менялись одновременно, не означает, что A вызвал B: они могут зависеть от третьего фактора C или совпасть случайно. Корректная диагностика требует учёта вмешательств (релизов, кампаний, сезонных событий), контроля множественных сравнений и ясного понимания, какие гипотезы требуют подтверждения на независимых данных.",[107,361,362],{},"Частая ошибка — смешение диагностики с причинным выводом: «мы нашли, что пользователи iOS имеют более низкую конверсию, значит, надо улучшать приложение под iOS». Правильная интерпретация скромнее: «обнаружен сегмент с отклонением; прежде чем действовать, проверим, не объясняется ли оно различиями трафика или источника установки».",[160,364,366],{"id":365},"предсказательная-аналитика-что-произойдёт","Предсказательная аналитика: что произойдёт",[107,368,369,370,373],{},"Предсказательная аналитика (predictive analytics) отвечает на вопрос ",[117,371,372],{},"«что произойдёт?»"," На основе исторических данных она строит прогнозы будущих значений показателей или вероятности событий: нагрузка на кластер в следующие сутки, вероятность оттока клиента в ближайший месяц, оценка остаточного ресурса оборудования.",[107,375,376],{},"Корректная предсказательная аналитика требует строгой дисциплины проверки. Прогноз оценивают на периоде, который не использовался при его построении: в данных, упорядоченных во времени, будущее не должно «подсматриваться». Кроме того, учитывают устойчивость прогноза к изменению условий и стоимость ошибок разного рода. Прогноз теплопотребления, в среднем точный, но ошибающийся именно в сильные морозы, бесполезен для службы эксплуатации. Как устроена такая проверка для моделей машинного обучения, рассматривается в курсе «Методы искусственного интеллекта».",[107,378,379],{},"Практическое правило: предсказательная модель оправдана только тогда, когда её прогноз оценивается по сравнению с наивной альтернативой (предсказать значение вчерашнего дня, среднее за неделю). Если модель не превосходит наивный прогноз, её внедрение не имеет смысла.",[107,381,382],{},"Важное ограничение, к которому мы будем возвращаться: предсказательная полезность не равна причинности. Модель может хорошо прогнозировать отток, опираясь на корреляции, но не даст рецепта, как этот отток снизить.",[160,384,386],{"id":385},"предписывающая-аналитика-что-следует-сделать","Предписывающая аналитика: что следует сделать",[107,388,389,390,393],{},"Предписывающая аналитика (prescriptive analytics) отвечает на вопрос ",[117,391,392],{},"«что следует сделать?»"," Она предлагает действие, максимизирующее целевую метрику при заданных ограничениях (бюджет, риски, ресурсы, время): как распределить рекламный бюджет между каналами; какой порог срабатывания выбрать для системы мониторинга; в каком порядке обслуживать очередь заявок.",[107,395,396],{},"Это самый высокий уровень аналитики и самый требовательный. Честная предписывающая аналитика опирается на экспериментальную или квази-экспериментальную оценку эффектов: прежде чем рекомендовать действие, мы должны показать, что оно действительно приводит к желаемому результату, а не просто коррелирует с ним на исторических данных. Без такой проверки рекомендации превращаются в гадание с цифровым антуражем.",[107,398,399],{},"В инженерной практике предписывающие модели часто встраиваются в контуры автоматизированного управления: алгоритм не просто предлагает действие, а сам его совершает (перекладывает нагрузку между узлами, меняет параметры регулятора). Ответственность в таких контурах распределена иначе, и к их проектированию применяются отдельные требования надёжности, к которым мы ещё вернёмся в более поздних темах.",[160,401,403],{"id":402},"сложность-стоимость-и-ценность-на-каждом-уровне","Сложность, стоимость и ценность на каждом уровне",[107,405,406],{},"Иерархия четырёх видов аналитики не декоративна. С каждым шагом вверх растут три величины:",[15,408,409,415,421],{},[18,410,411,414],{},[117,412,413],{},"сложность"," — в терминах требуемой математики, объёма данных и экспертизы;",[18,416,417,420],{},[117,418,419],{},"стоимость"," — в терминах инфраструктуры, труда и времени;",[18,422,423,426],{},[117,424,425],{},"ценность"," — в терминах влияния на принимаемые решения.",[107,428,429],{},"Разумная стратегия — подниматься по этой лестнице постепенно. Попытка сразу строить предписывающую модель поверх неотлаженной описательной аналитики — классическая ошибка молодых проектов: красивая «модель принятия решений» опирается на данные, про которые никто не может сказать, как они были собраны и что именно означают.",[10,431,433],{"id":432},"аналитика-в-цикле-принятия-решений","Аналитика в цикле принятия решений",[160,435,437],{"id":436},"бизнес-вопрос-данные-выводы-действие-обратная-связь","Бизнес-вопрос → данные → выводы → действие → обратная связь",[107,439,440],{},"Практическая работа аналитика укладывается в повторяющийся цикл: исходный вопрос формулируется в измеримых терминах; необходимые данные собираются и очищаются; применяется метод, адекватный постановке задачи и качеству измерений; вывод фиксируется и превращается в действие; эффект действия подтверждается повторным измерением.",[107,442,443,444,447],{},"Рассмотрим этот цикл на простом примере. В производственной системе зафиксировано увеличение времени цикла сборки. Аналитик формализует вопрос: ",[117,445,446],{},"на каких операциях возник сдвиг и каков его вклад в общий рост",". Собирает телеметрию со станков, устраняет ошибки измерения, описывает динамику (описательный уровень), диагностирует факторы — смена поставщика узла, перенастройка оборудования после планового обслуживания (диагностический уровень). Проверяет гипотезы на независимых периодах и предлагает действие: вернуть прежнего поставщика либо скорректировать регламент настройки. После внедрения оценивает эффект на тех же метриках.",[107,449,450,451,454],{},"Ключевой элемент цикла — ",[117,452,453],{},"обратная связь",". Без неё аналитика превращается в одноразовое упражнение: отчёт написан, рекомендация отдана, но никто не возвращается к данным проверить, что из этого вышло. Зрелая практика требует замыкания контура: каждое нетривиальное решение, принятое на основе аналитики, фиксируется как контрольная точка, к которой мы вернёмся через заданный срок.",[107,456,457,458,461,462,471],{},"Распространённое воплощение этого цикла — модель ",[117,459,460],{},"Cross-Industry Standard Process for Data Mining"," (CRISP-DM) ",[245,463,465],{"className":464},[248],[22,466,468],{"href":467},"#ref-3",[253,469,470],{},"3",". Она делит аналитическую работу на шесть фаз: понимание бизнеса, понимание данных, подготовка данных, моделирование, оценка и внедрение. Порядок фаз не жёсткий: что делать дальше, решают по итогам текущей фазы, и вернуться можно к любой из предыдущих. Стрелки на схеме показывают лишь самые частые зависимости: понимание бизнеса и понимание данных уточняют друг друга, подготовка данных и моделирование — тоже, а оценка может вернуть к постановке задачи. Внешний круг означает, что внедрением работа не заканчивается: его опыт порождает новые, более узкие вопросы.",[267,473,269,474,269,478],{},[271,475],{"src":476,"alt":477},"\u002Fimg\u002Faidt-iot-vvad\u002Ftopic-01\u002Fcrisp_dm.svg","Цикл CRISP-DM: шесть фаз вокруг центральной сущности «Данные»",[276,479,480],{},"CRISP-DM: шесть фаз аналитической работы, замыкающиеся в цикл",[107,482,483],{},"В рамках курса мы не будем строго следовать терминологии CRISP-DM, но его логика — от вопроса через данные к действию и обратно — лежит в основе всех последующих тем.",[160,485,487],{"id":486},"операционные-тактические-и-стратегические-решения-на-данных","Операционные, тактические и стратегические решения на данных",[107,489,490],{},"Решения, которые аналитика поддерживает, удобно классифицировать по горизонту и обратимости.",[107,492,493,496],{},[117,494,495],{},"Операционные"," решения — короткий горизонт (часы, дни), высокая частота, низкая стоимость ошибки по отдельности. Алерты, автоматические переключения, правила маршрутизации запросов. Здесь ценится скорость отклика и устойчивость: лучше простой алгоритм, стабильно работающий, чем сложная модель с редкими, но критичными сбоями.",[107,498,499,502],{},[117,500,501],{},"Тактические"," решения — средний горизонт (недели, месяцы), умеренная частота. Планирование ресурсов, настройка кампаний, пересмотр пороговых значений. Здесь важна точность оценок и возможность A\u002FB-сравнений.",[107,504,505,508],{},[117,506,507],{},"Стратегические"," решения — длинный горизонт (кварталы, годы), низкая частота, высокая стоимость ошибки. Выбор технологической платформы, изменение бизнес-модели, инвестиционные решения. Здесь аналитика редко даёт окончательный ответ — её роль состоит в проверке допущений и очерчивании диапазонов возможных исходов.",[107,510,511],{},"Ошибка уровня — распространённая болезнь. Попытка принимать стратегическое решение по короткому операционному ряду даёт ложную уверенность, а попытка управлять оперативным процессом с помощью тяжёлой стратегической модели — паралич.",[160,513,515],{"id":514},"критерии-успешности-аналитической-работы","Критерии успешности аналитической работы",[107,517,518,519,355,522,525],{},"Успех аналитической работы измеряется не точностью модели самой по себе, а тем, ",[117,520,521],{},"повлияла ли она на решение",[117,523,524],{},"улучшило ли это решение показатели предметной области",". Критически важно различать две группы метрик:",[15,527,528,534],{},[18,529,530,533],{},[117,531,532],{},"метрики инструмента"," — средняя ошибка прогноза, доля аварий, замеченных заранее, и т. п.;",[18,535,536,539],{},[117,537,538],{},"метрики результата"," — уровень сервиса, надёжность, затраты, выручка, доля дефектов.",[107,541,542],{},"Аналитика с превосходными метриками инструмента, не сдвинувшая метрики результата, — неудача. Аналитика с посредственными метриками инструмента, но приведшая к измеримому улучшению результата, — успех. Это смещение акцента с «качества модели» на «качество решения» отличает зрелую аналитическую практику от её имитации.",[10,544,546],{"id":545},"области-применения","Области применения",[107,548,549],{},"Аналитика данных применима практически везде, где есть повторяемые наблюдаемые процессы. Рассматривать подряд все отрасли — упражнение бесполезное; кратко обозначим несколько направлений, существенных для контекста курса.",[160,551,553],{"id":552},"аналитика-в-промышленности-и-iot","Аналитика в промышленности и IoT",[107,555,556],{},"Промышленность и IoT — одна из наиболее технически насыщенных областей применения. Типичные задачи: мониторинг состояния оборудования, предсказательное техническое обслуживание, оптимизация режимов работы, контроль качества продукции по показаниям датчиков. Особенности этой области — высокая частота измерений, высокая доля шума и пропусков, сильная временная структура данных. Многие методы, которые в «чистых» бизнес-датасетах работают без нареканий, в промышленных задачах требуют серьёзной адаптации именно из-за шума и нерегулярности поступления данных.",[160,558,560],{"id":559},"аналитика-в-бизнесе-финансах-маркетинге","Аналитика в бизнесе, финансах, маркетинге",[107,562,563],{},"Здесь аналитика наиболее массовая и наиболее разработанная. Воронки продаж, сегментация клиентов, оценка эффективности рекламных кампаний, кредитный скоринг, анализ оттока, A\u002FB-тестирование продуктовых гипотез. Большинство открытых датасетов, на которых удобно тренироваться, пришли именно из этой области.",[160,565,567],{"id":566},"аналитика-в-науке-медицине-государственном-управлении","Аналитика в науке, медицине, государственном управлении",[107,569,570],{},"Научная аналитика традиционно строга в вопросах методологии: здесь выше требования к воспроизводимости, к учёту ошибок измерения, к корректной статистической обработке. Медицинская аналитика добавляет к этому жёсткий этический контур и строгие регуляторные требования. Государственная аналитика — работа с переписями, статистикой отраслей, данными мониторинга городской среды — особенно чувствительна к репрезентативности выборок и к корректному представлению результатов для не-специалистов.",[160,572,574],{"id":573},"типовые-кейсы-и-сквозной-кейс-курса","Типовые кейсы и сквозной кейс курса",[107,576,577],{},"Отраслевые примеры полезны, пока за ними стоят конкретные данные. Поэтому все практические занятия курса построены на одном наборе — данных эксплуатации городской инженерной инфраструктуры, описанных во введении: объекты, приборы учёта и их почасовые показания, погода, инциденты и обращения жителей. Разберём на нём типичный вопрос службы эксплуатации: в районе выросло число обращений жителей по отоплению.",[107,579,580],{},"На описательном уровне аналитик устанавливает, как менялись теплопотребление и температура теплоносителя на тепловых пунктах района. На диагностическом — совпадают ли провалы с похолоданиями, с инцидентами вроде завоздушивания или утечки теплоносителя, с пропусками связи приборов и не отражает ли рост обращений активность жителей, а не состояние сети. На предсказательном — какое потребление ожидать завтра при прогнозной температуре; эту задачу решает курс «Методы искусственного интеллекта» по таблице признаков, построенной в теме 8. Предписывающий уровень — в каком порядке обслуживать тепловые пункты — остаётся за рамками курса.",[107,582,583],{},"Цепочка тем повторяет цикл принятия решений: сбор данных (тема 2), их описание и план очистки (тема 3), очистка (тема 4), визуализация (тема 5), гипотезы на данных октября–января (тема 6) и их проверка на данных февраля–марта (тема 7), признаки (тема 8) и отчёт для службы эксплуатации (тема 9). Тот же набор затем используется в курсах «Методы искусственного интеллекта», «Современные хранилища данных» и «Платформы аналитики и машинного обучения».",[10,585,587],{"id":586},"ограничения-и-ответственность-аналитика","Ограничения и ответственность аналитика",[160,589,591],{"id":590},"качество-данных-как-верхняя-граница-качества-выводов","Качество данных как верхняя граница качества выводов",[107,593,594,595,598],{},"Первое правило аналитика звучит неромантично: ",[117,596,597],{},"качество данных задаёт верхнюю границу качества выводов",". Никакой, сколь угодно изощрённый, метод не извлечёт достоверного знания из данных, собранных с ошибками. Если датчик измеряет температуру со смещением 3 °C, все построенные на его показаниях модели будут воспроизводить это смещение. Если опросный лист включает наводящие вопросы, все последующие корреляции окажутся артефактом формулировок.",[107,600,601,602,611],{},"Отсюда — непропорциональная доля времени, которую аналитик тратит на проверку и очистку данных. По оценкам из интервью с аналитиками, приведённым в статье С. Лора, на сбор и подготовку данных уходит от 50 до 80 % рабочего времени ",[245,603,605],{"className":604},[248],[22,606,608],{"href":607},"#ref-4",[253,609,610],{},"4","; это экспертные оценки, а не измерение. В учебных примерах эта доля искусственно занижена, потому что данные уже подготовлены автором.",[160,613,615],{"id":614},"предвзятость-данных-и-методов-корректность-интерпретации","Предвзятость данных и методов, корректность интерпретации",[107,617,618,619,26],{},"Данные несут в себе предвзятость (bias) — систематические отклонения, возникающие из-за способа сбора, состава выборки, действий тех, кто данные производил. Простейший пример: модель, обученная на данных только активных пользователей сервиса, не умеет работать с пассивными — но именно поведение пассивных чаще всего представляет интерес. Выявление и документирование предвзятости — обязательная часть работы, а не дополнительная опция ",[245,620,622],{"className":621},[248],[22,623,625],{"href":624},"#ref-5",[253,626,627],{},"5",[107,629,630],{},"Предвзятость методов — ещё одна ловушка. Закономерность, найденная и подтверждённая на одних и тех же данных, выглядит надёжнее, чем есть на самом деле. Это не вопрос добросовестности, а следствие статистики, и защищаются от этого эффекта процедурой: в курсе гипотезы формулируются на данных октября–января (тема 6), а проверяются на данных февраля–марта с поправкой на множественные сравнения (тема 7). Утечку информации из будущего в признаки разберём в теме 8, а схемы проверки моделей — предмет курса «Методы искусственного интеллекта».",[107,632,633],{},"Корректная интерпретация результатов требует сдержанности формулировок. «На данных октября–января теплопотребление пунктов района выше в холодные дни» — корректное утверждение при указании данных и способа сравнения. «Похолодание вызывает перерасход тепла» — некорректное утверждение, пока связь не проверена (темы 6 и 7).",[160,635,637],{"id":636},"этические-и-правовые-рамки-работы-с-данными","Этические и правовые рамки работы с данными",[107,639,640,641,650,651,660],{},"Работа с данными регулируется как законом, так и профессиональной этикой. Правовые ограничения — от защиты персональных данных (в России — 152-ФЗ ",[245,642,644],{"className":643},[248],[22,645,647],{"href":646},"#ref-6",[253,648,649],{},"6",", в ЕС — GDPR ",[245,652,654],{"className":653},[248],[22,655,657],{"href":656},"#ref-7",[253,658,659],{},"7",") до отраслевых регламентов (медицина, финансы) — определяют, какие данные можно собирать, хранить и обрабатывать, на каких основаниях и с какими предосторожностями. Нарушение этих норм — не абстрактный риск, а прямая ответственность организации и, в ряде случаев, конкретного специалиста.",[107,662,663],{},"Этические рамки шире правовых. Даже формально допустимый анализ может быть недопустим по существу: например, сегментация клиентов, приводящая к систематическому ухудшению условий для уязвимых групп. Добросовестный аналитик задаёт вопросы о последствиях своих выводов, а не только об их технической корректности.",[107,665,666],{},"В рамках курса мы возвращаемся к теме этики на каждом этапе — при обсуждении сбора данных, предобработки, отчётности и представления результатов. Этика не отдельная дисциплина, приставленная к аналитике сбоку, а её сквозное измерение.",[10,668,670],{"id":669},"итоги-темы","Итоги темы",[107,672,673],{},"В этой теме мы зафиксировали предмет и границы аналитики данных, отделив её от смежных дисциплин — статистики, Data Science, BI и ML. Рассмотрели классическую типологию из четырёх видов (описательная, диагностическая, предсказательная, предписывающая) и показали, что переход на более высокий уровень требует зрелости на нижнем. Описали цикл принятия решений на данных, в который аналитика встраивается, — от формулировки вопроса до замыкания обратной связи. Наконец, обозначили рамки: качество данных как верхняя граница качества выводов, предвзятость данных и методов, правовые и этические ограничения.",[107,675,676],{},"В следующей теме мы перейдём от постановки задачи к её первому практическому этапу — сбору данных: рассмотрим типологию источников, форматы, способы получения данных и первые инструменты контроля их качества.",[10,678,680],{"id":679},"литература","Литература",[682,683,686,690,694,698,702,706,710],"ol",{"className":684},[685],"references",[18,687,689],{"id":688},"ref-1","Ackoff R. L. From Data to Wisdom. — Journal of Applied Systems Analysis, 1989, С. 3–9.",[18,691,693],{"id":692},"ref-2","Rowley J. The Wisdom Hierarchy: Representations of the DIKW Hierarchy. — Journal of Information Science, 2007, С. 163–180.",[18,695,697],{"id":696},"ref-3","Shearer C. The CRISP-DM Model: The New Blueprint for Data Mining. — Journal of Data Warehousing, 2000, С. 13–22.",[18,699,701],{"id":700},"ref-4","Lohr S. For Big-Data Scientists, “Janitor Work” Is Key Hurdle to Insights. — The New York Times, 2014, https:\u002F\u002Fwww.nytimes.com\u002F2014\u002F08\u002F18\u002Ftechnology\u002Ffor-big-data-scientists-hurdle-to-insights-is-janitor-work.html.",[18,703,705],{"id":704},"ref-5","Barocas S., Selbst A. D. Big Data's Disparate Impact. — California Law Review, 2016, С. 671–732.",[18,707,709],{"id":708},"ref-6","Федеральный закон от 27.07.2006 № 152-ФЗ «О персональных данных». — 2006.",[18,711,713],{"id":712},"ref-7","Regulation (EU) 2016\u002F679 of the European Parliament and of the Council (GDPR). — 2016, https:\u002F\u002Feur-lex.europa.eu\u002Feli\u002Freg\u002F2016\u002F679\u002Foj.",{"title":56,"searchDepth":57,"depth":57,"links":715},[716,723,730,735,741,746,747],{"id":157,"depth":57,"text":158,"children":717},[718,720,721,722],{"id":162,"depth":719,"text":163},3,{"id":172,"depth":719,"text":173},{"id":211,"depth":719,"text":212},{"id":235,"depth":719,"text":236},{"id":316,"depth":57,"text":317,"children":724},[725,726,727,728,729],{"id":323,"depth":719,"text":324},{"id":340,"depth":719,"text":341},{"id":365,"depth":719,"text":366},{"id":385,"depth":719,"text":386},{"id":402,"depth":719,"text":403},{"id":432,"depth":57,"text":433,"children":731},[732,733,734],{"id":436,"depth":719,"text":437},{"id":486,"depth":719,"text":487},{"id":514,"depth":719,"text":515},{"id":545,"depth":57,"text":546,"children":736},[737,738,739,740],{"id":552,"depth":719,"text":553},{"id":559,"depth":719,"text":560},{"id":566,"depth":719,"text":567},{"id":573,"depth":719,"text":574},{"id":586,"depth":57,"text":587,"children":742},[743,744,745],{"id":590,"depth":719,"text":591},{"id":614,"depth":719,"text":615},{"id":636,"depth":719,"text":637},{"id":669,"depth":57,"text":670},{"id":679,"depth":57,"text":680},{},"\u002Fcourses\u002Faidt-iot-vvad\u002Ftopic-01-content",{"title":146,"description":154},"courses\u002Faidt-iot-vvad\u002Ftopic-01-content",1,"topic-01","zLs-Drnpf0JYEq0VnNmO1ufRJSUP2S3eyL6Uq2vd2fc",1789142469858]