Текст
                    О’КЕИЛГ

□ а 1а Заепсе

Лучшие практики

Достижение успеха
в науке о данных

Дэниел Воган

1пЬегпа1юпа1
риь! 1зН|п§

О’РЕШУ Книги по программированию
Оа1а 8с1епсе: ТИе Нагд РаПз ТесЬгприез €ог Ехсе11т§ ас Оаса Заепсе □огне! Х/аидЬап
О а 1а Заепсе Лучшие практики Достижение успеха в науке о данных Дэниел Воган
УДК 004.42 ББК 32.973 В61 Оа1а 8с1епсе: Иге Лаге! Раг1з Раше! Уаи^Иап © 2026 “АзТапа 1п1егпаНопа1 РиЬПьЫп^"' АиТкопхеб Ниямап 1гап«1а11оп оГ(Не Ел^КзЬ еЛНоп оГ Ра1а 8с1епсе: ТНе Нале! Раги 15ВЛ 9781098146474 © 2024 Раше! Уаи§Ьап. 11115 1гапз1а1юп 18 риЬИзЬес! апб зоИ Ьу ретт1881оп 01О’КеШу МесНа, 1пс„ уЛпсИ о супь ог соп1го1$ а11 пдИи Го риЬНзк ап<1 8е111Не вате. Воган, Дэниел. В61 Лага Боепсе. Лучшие практики / Дэниел Воган, [перевод с английского Е. Жевла- ковой]. — Алматы: Астана иностранная пресса, 2026. — 288 с. — (О’КеШу. Книги по программированию). 15Ш4 978-601 12-7679-5 Не только владение алгоритмами, но и умение применять их там, где это действительно имеет значение отличает хорошего специалиста по данным от выдающегося. Книга для тех, кто хочет выйти за рамки учебных примеров и научиться строить проекты, приносящие ощутимую ценность бизнесу. Автор делится проверенными подходами, которые редко встречаются в классических курсах. В центре внимания не только техника, но и практическое мастерство: как убедительно презентовать результаты, как формулировать сильные аргументы, как превращать аналитику в реальные решения. Настольный справочник для тех, кто стремится не просто «работать с данными», а создавать проекты, которые влияют на решения и меняют процессы. Она будет одинаково полезна как амбициозным новичкам, так и опытным дата-сайенгистам желающим прокачать навыки и повысить эффективность своей работы. УДК 004.42 ББК 32.973 18ВМ 978-601-12-7679-5 © Жевлакова Е.В., перевод на русский язык, 2026 © Издание на русском языке, оформление. ТОО «Издательство «Астана иностранная пресса», 2026 Барлык, кукыктар коргалган Бул кпапты басып шыгарушынын руксатынсыз онлайн немесс кез келген баск,а жолмен сканер; геу, жую еп алу немесе зацсыз тара । у зац бойынша жазаланады / Все нрава защищены Никакая часть данной книги не может быть воспооизведена в какой бы то ни было форме с помощью каких-либо электронных или механических соедс’в включая изготовление фотокопий, аудиозапись репродукцию или любой иной способ или систем поиска и хранения информации без письменного разрешения издателя
Посвящаю эту книгу своему брату Николасу, которого я очень люблю и уважаю.
Оглавление Предисловие .................................................... 11 Условные обозначения, используемые в этой книге 14 Использование примеров кода ................................. 15 Онлайн-обучение в О’КеШу. 15 Как с нами связаться 16 Благодарности ............................................... 16 Часть I Методы анализа данных Глава I. Что дальше? Создание ценности с помощью 1)а1а зшепсе 21 Что такое ценность? 21 Что: хорошо разбираться в бизнесе ........................... 23 Что дальше: суть создания ценности посредством науки о данных 24 Что делагь сейчас: проявляйте инициативу 26 Измерение ценности 26 Основные выводы 29 Дополнительная литература . .. 29 Глава 2. Разработка метрик...................................... 31 Полезные свойства метрик 31 Декомпозиция метрик. 33 Другой вариант декомпозиции выручки 36 Пример с маркетплейсами 36 Основные выводы 37 Дополнительная литература 38 Глава 3. Декомпозиции роста: попутные и встречные ветры 39 Почему именно декомпозиция роста? 39 Аддитивная декомпозиция...... 39 Мультипликативная декомпозиция . 42 Декомпозиция пих-гаГе . 44
Математические производные 47 Основные выводы 48 Дополнительная литература 49 1лава 4. Матрицы 2x2 . ... 50 Аргументы в пользу упрощения ... 50 Что такое матрица 2x2? 51 Пример: тестируем модель и новый признак 53 Пример: анализируем поведение пользователя 55 Пример: оформление и одобрение кредита 57 Пример: расстановка приоритетов в рабочем процессе 58 Основные выводы 59 Дополнительная литература 60 Глава 5. Создание бизнес-кейсов 61 Принципы создания бизнес кейсов . 61 Пример: проактивная стратегия удержания 62 Предотвращение мошенничества 64 Приобретение внешних наборов данных 65 Работа над проектом по Паи заепсе.............................66 Основные выводы 66 Дополнительная литература 67 Глава 6. Что показывает прирост? 68 Расчет прироста 68 Пример: модель классификации 69 Свободный выбор и смещение по выживаемости . 70 Другие варианты использования прироста 72 Основные выводы 72 Дополнительная литература 73 Глава 7. Нарративы ...... ..............74 Нарративы: рассказать историю, используя свои данные 74 Практическая применимость 79 Создание нарратива 79 Последний рывок 82 Основные выводы 88 Дополнительная литература 89 Глава 8.1)а1аУ1з: выбираем диаграмму для передачи идеи 91 Некоторые полезные и не очень методы визуализации данных 91
Общие рекомендации 98 Основные выводы . 103 Дополнительная литература 104 ЧАСТЫ1 Машинное обучение 1лава 9. Моделирование и бутстрэп 107 Основы моделирования 108 Моделирование линейной модели и линейной регрессии 111 Что такое графики частичной зависимости? 114 Смещение вследствие пропущенных переменных 118 Моделирование задач классификации 121 Бутстрэп 125 Основные выводы 127 Дополнительная литература ... ...... 128 Глава 10. Линейная регрессия: возвращаемся к основам 130 Что определяет коэффициент? 130 Теорема Фриша — Во — Ловелла 134 Чем полезна теорема Фриша — Во — Ловелла? 137 Конфаундеры..... 138 Дополнительные переменные ... 140 Ключевая роль дисперсии в МЬ . .. 142 Основные выводы 146 Дополнительная литература ... 148 Глава 11. Утечка данных 149 Что такое утечка данных? 149 Обнаружение утечки данных 153 Полное разделение . 155 Метод скользящего окна (\\Чпс1ом'т§ Ме1Ьос1о1о§у) 158 Утечка данных: что делать сейчас? 162 Основные выводы 163 Дополнительная литература.................................. 164 Глава 12. Вывод модели в продакшн 166 Что означает «готовность к продакшну»? 166 Дрейф данных и модели 170 Основные этапы любого конвейера в продакшне ...171
I —I Основные выводы 176 Дополнительная литература ... 177 Глава 13. Сторигеллинг в машинном обучении 179 Целостный взтляд на сторителлинг в МБ 179 Ех ап!е и 1п1епт сторителлинг ] 80 Сюрителлинт ех роМ: открываем черный ящик 187 Основные выводы 200 Дополнительная литература 201 Глава 14. От прогнозирования к принятию решений 203 Анализ процесса принятия решений ... 204 Простые правила принятия решений с помощью интеллектуального определения пороговых значений (8птаг1 ТЪгезЬоИтд) 206 Оптимизация матрицы несоответствий 210 Основные выводы..............................................213 Дополнительная литература 213 Глава 15. Инкремент альность: святой Грааль науки о данных? 214 Что такое инкрементальность .................................214 Конфаундеры и коллайдеры.....................................217 Смещение выборки.............................................221 Допущение об отсутствии смещения.............................225 Преодоление смещения выборки: рандомизация 226 Мэтчинг .....................................................227 Машинное обучение и причинно-следственный вывод 231 Основные выводы..............................................235 Дополнительная литература....................................236 Глава 16. А/В-тесты............................................240 Что такое А/'В-тест? 240 Критерии принятия решения 241 Минимальные обнаруживаемые эффекты 244 Бэклог гипотез 254 Управление экспериментами 255 Основные выводы 257 Дополнительная литература 257 Глава 17. Большие языковые модели и наука о данных в работе 259 Текущее состояние ИИ 260 Чем занимаются дат а-сайентисты? .. 261
Эволюция должностных обязанностей дата-сайентистов......... 264 Ы.М и эта книга 268 Основные выводы ........................................... 269 Дополнительная литература 270 Об авторе . ... 272 Котофон 273
Предисловие Позвольте мне исходить из того, что изучать науку о данных и применять ее на практике действительно сложно. От вас ожидают отличных навыков програм- миста, который не только разбирается в тонкостях структур данных и их вычи- слительной сложности, но и хорошо знаком с Руйтоп и ЗСД. Статистика и новей- шие методы прогнозирования с помощью машинного обучения должны быть для вас вторым языком, и, конечно, вы должны уметь применять эти знания для решения реальных бизнес-задач. Однако эта работа сложна еще и потому, что вы должны уметь убедительно общаться со стейкхолдерами, которые, воз- можно, не имеют технического образования и не привыкли принимать реше- ния на основе данных. Будем честны: теория и практика в науке о данных сложны. И любая книга, посвященная сложным аспектам в этой области, либо является энциклопедич- ной и исчерпывающей, либо в ней необходимо отобрать нужные нам темы. Прежде всего я должен вас предупредить, что такой отбор я бы провел по сво- им критериям, которые указывают на сложность изучения в области науки о дан- ных, и что такое определение субъективно по своей природе. Чтобы смягчить его, давайте проясним: дело не в том, что эти темы замысловаты и их труднее из- учать, а скорее в том, чю на данный момент профессия придает им достаточно низкий вес как отправным темам для карьеры в науке о данных. И на практике их труднее освоить, потому что по ним трудно найти материал. В учебной программе по науке о данных обычно делается упор на изучение программирования и машинного обучения — темам, которые я называю осно- вополагающими. Ожидается, что почти всему остальному вы нау’читесь на рабо- чем месте, и, к сожалению, это зависит от того, повезет ли вам найти наставника на месте своего первого или второго т рудоустройства. Крупные технологические компании хороши тем, что в них довольно часто встречаются талантливые спе- циалист ы, поэтому многие из этих неосвещенных тем становятся частью местной корпоративной субкультуры, недоступной многим практикам. Эта книга рассказывает о методах, которые помогут вам стать более продук- тивным дага-сайентистом. Я выделил здесь две части: в первой рассматривают- ся вопросы анализа данных и более простые аспекты этой науки, а во второй — все о машинном обучении (птасЬше 1еагшп$, МБ).
Вы можете спокойно читать книгу в любом порядке; в некоторых главах со- держатся ссылки на предыдущие разделы. В большинстве случаев можно про- пустить эти ссылки, материал все равно останется понятным для вас. Ссылки в основном используются для того, чтобы показать связь между, казалось бы, независимыми темами. В части 1 рассматриваются следующие темы. Глава 1. Что дальше? Создание ценности с помощью Иа1а заепсе Какова роль науки о данных в создании ценности для организации и как вы ее оцениваете? Глава 2. Разработка метрик Я считаю, что дата-сайентисты лучше всех могут справиться с усовершенст- вованием разработки действенных метрик. И здесь я расскажу вам, как это сделать. Глава 3. Декомпозиции роста: попутные и встречные ветры Разобраться с тем, что происходит с бизнесом, и составить убедительный нар- ратив — это обычная задача для дата-сайентистов. В этой главе я рассказал о некоторых методах декомпозиции роста, которые можно использовать для частичной автоматизации этого рабочего процесса. Глава 4. Матрицы 2x2 Изучение техник, помогающих упростить мир, может занять у вас много вре- мени. Матрица 2x2 поможет вам сделать это, а также повысить качество вза- имодействия со стейкхолдерами. Глава 5. Создание бизнес-кейсов Перед началом проекта у вас должен быть бизнес-кейс. В этой главе показа- но, как это сделать. Глава 6. Что показывает прирост? Какими бы простыми они ни были, лифты мотут ускорить анализ, кото- рый вы предполагаете сделать с помощью машинного обучения. Я расскажу о лифтах в этой главе. Глава 7. Нарративы Дата-сайентисту необходимо развивать свой навык сторителлинга и состав- лять убедительные нарративы. Здесь я расскажу, как это делается. Глава 8. Оа1ауц: выбираем диаграмму для передачи своей идеи Уделяя достаточно времени визуализации данных, вы сможете составить более убедительный нарратив. В этой главе мы обсудим несколько лучших практик.
Часть II посвящена МЕ и охватывает следующие гемы. Глава 9. Моделирование и бутсгпрэп Методы моделирования помогут вам лучше понять различные алгоритмы прогнозирования. Я покажу вам, как это работает, но с некоторыми предосте режениями относительно использования ваших любимых методов регрессии и классификации. Мы также рассмотрим бутстрэп, который можно приме- нять для определения доверительных интервалов по некоторым трудновы числимым оценкам. Глава 10 Линейная регрессия, возвращаемся к основам Наличие глубоких знаний о линейной регрессии имеет решающее значение для понимания некоторых более сложных тем. В этой главе я возвращаюсь к основам, чтобы сформировать более ясное понимание алгоритмов машин ного обучения. Глава 11 Утечка данных Что такое утечка данных и как ее заметить и предотвратить? Глава 12. Вывод модели в продакшн Модель хороша только в том случае, если она дошла до стадии продакшна. К счаст ью, это понятная и структурированная задача, и я показываю наибо- лее важные ее шаги. Глава 13. Сторителлинг в машинном обучении Есть несколько отличных приемов, которые можно использоват ь, чтобы по- нять логику сторителлинга в контексте МЬ и преуспет ь в нем. Глава 14. От прогнозирования к принятию решений Мы создаем ценность, оттачивая наши способности по принятию решений на основе данных и МЬ. Здесь я покажу вам примеры перехода от прогнози- рования к принятию решения. Глава 15. Инкрементапьностъ: святой Грааль науки о данных:' Техники выявления причинно-следственной связи набрали некоторую попу- лярность в науке о данных, однако по-прежнему считаются в некотором роде нишевыми. В этой тлаве я расскажу об основах и приведу несколько приме ров и фрагменты кода, которые можно легко применить в вашей организа ции Глава 16. А/В-тесты А/В-тесты — типичный пример того, как можно оценить инкременталь- ност ь альтернативных вариантов действий. Но эксперименты требуют опре- деленных базовых знаний в области статистики (и бизнеса). Последняя глава (глава 17) довольно уникальна, поскольку только в ней я не рас сказываю о каком-либо методе. Я размышляю о будущем науки о данных после
появления генеративного искусственного интеллекта (ИИ). Мой основной вы- вод — в ближайшие несколько лег список должностных обязанностей карди- нально изменится, а дата-сайентисты должны быть готовы к этой революции. Эта книга предназначена для дата-сайентистов любого уровня и опыта ра боты. У вас получится извлечь максимум пользы из книги, если вы владеете средними или продвинутыми знаниями об алгоритмах машинного обучения, поскольку я здесь не грачу время на знакомство с линейной регрессией, класси- фикацией и регрессионными деревьями, а также ансамблевыми методами, та- кими как случайный лес или градиентный бустинг. Условные обозначения, используемые в этой книге В этой книге используются следующие типографские условные обозначения. Курсив Указывает на новые термины, 1ЖЬ-адреса, адреса электронной почты, имена файлов и расширения файлов. Моноширинный шрифт Используется в списках программ, а также в тексте при упоминании про- граммных элементов, таких как имена переменных или функций, базы дан ных, типы данных, переменные окружения, операторы и ключевые слова. Этот элемент означает подсказку или предложение. Этот элемент обозначает общее замечание Этот элемент указывает на предупреждение.
Использование примеров кода Дополнительные материалы (примеры кода, упражнения и т. д.) доступны для скачивания по адресу Ьйрз^/огейЛуМьЕр-геро. Если у вас возникнут технические вопросы или проблемы с использова- нием примеров кода, пожалуйста, отправьте электронное письмо по адресу Ьоо1«}ие8(1оп8@огеШу.сопт. Эта книга призвана помогать вам в выполнении вашей работы. Если на ее страницах приведены примеры кода, то, как правило, вы можете использовать их в своих программах и документации. Вам не нужно обращаться к нам за разре- шением, если только вы не воспроизводите значительную часть кода. Например, для написания программы, использующей несколько фрагментов кода из этой книги, разрешение не требуется. Для продажи или распространения примеров из книг О’КеШу требуется разрешение. Если вы хотите ответить на вопрос, со спавшись на эту книгу и приведя пример кода, то разрешение не требуется. Для включения значительного количества примеров кода из этой книги в докумен- тацию к вашему продукту требуется разрешение. Мы ценим указание авторства, но, как правило, не требуем этого. Для ука- зания авторства обычно прописывают название книги, автора, издателя и 18ВК. Например: Дэниел Воган, «Наука о данных: сложные аспекты» (О’КеШу). Авторское право 2024 Дэниел Вотан, 978-1-098 14647-4. Если вы сомневаетесь и считаете применение в вашем проекте примеров кода выходит за рамки добросовестного использования или вышеуказанного разре- шения, смело пишите нам по адресу рептввюпьфогеШу.сот. Онлайн-обучение в О Ке!Ну Вот уже более 40 лет О’КеШу МесНа проводит обучение в сфере технологий и биз- неса, делится знаниями и открытиями, которые помогают компаниям добить- ся успеха. Мы привлекаем уникальных экспертов и новаторов, которые делятся свои- ми знаниями и опытом с помощью книг, статей и курсов на нашей платформе онлайн-обучения. Платформа онлайн-обучения О’КеШу предоставляет вам до- ступ по запросу к учебным курсам с преподавателями в прямом эфире, методам углубленного обучения, интерактивным средам программирования и обширной коллекции текстов и видео от О’КеШу и более 200 других издателей Для получе- ния дополнительной информации посетите сайт Ипр$://огеИ1у.сот.
Как с нами связаться Пожалуйста, направляйте комментарии и вопросы, касающиеся этой книги, из- дателю: О’КеШу МесПа, 1пс. 95472, Калифорния, Себастопол, Северное Гравенштайнское шоссе, 1005 800-998-9938 (в Соединенных Штатах или Канаде) 707-829-0515 (междуна- родные или местные звонки) 707-829-0104 (факс) $иррог1@огеИ1у. сот кНр$://ипншогеИ1у. сот/аЬ(ш1/соп1ас(. к(т1 Для этой книги у нас есть веб-сайт, где мы приводим список исправлений, примеры и другую дополнительную информацию. Вы можете найти на эту стра- ницу по адресу: И11р5://огеИ.1у/с1а1а-$с1спсе (ке-кагскраг!!. Для получения новостей и информации о наших книгах и курсах посетите сайт кИр$://огеН1у.сот. Благодарности Многие темы, затронутые в этой книге, я объяснял на внутренних технических семинарах системы СЫР. Поэтому я в долгу перед потрясающей командой дата- сайенгистов, которой я имел честь руководить, где был наставником и учился. Их опыт и знания сыграли важную роль в формировании содержания и струк туры этой книги. Я также глубоко признателен моему редактору Корбину Коллинзу, кото- рый терпеливо и внимательно вычитывал рукопись, находил ошибки и упуще ния, вносил предложения, которые радикально улучшили изложение материала во многих отношениях. Я также хотел бы выразить свою искреннюю признагель ность Джонатону Оуэну (выпускающему редактору) и Соне Саруба (литератур ному редактору) за их внимательный взгляд, исключительные навыки и предан- ность делу. Их совместные усилия значительно повысили качество этой книги, и я бесконечно благодарен им за это. Большое спасибо техническим рецензентам, которые нашли ошибки и опе- чатки в тексте и сопроводительном коде, а также внесли предложения по улуч- шению содержания книги. Особая благодарность Навину Кришнараджу, Бретту Холлеману и Чандре Шукле за подробную обратную связь Мы часто не соглаша- лись друг с другом, но их конструктивная критика была как усмиряющей пыл,
так и аргументированной. Излишне говорить, что все остальные ошибки — мои собственные. Они никогда не прочтут этого, но я бесконечно благодарен своим собакам, Матильде и Доминго, за их безграничную способность дарить любовь, смех, нежность и дружеское общение. Я также благодарен своим друзьям и семье за их безоговорочную поддержку и одобрение. Особая благодарность Клаудии: невозможно переоценить твое лю бящее терпение, когда я снова и снова обсуждал с тобой некоторые идеи, даже когда они почти ничего не значили для тебя. Наконец, я хотел бы выразить признательность многочисленным исследо- вателям и практикам в области науки о данных, чьи работы вдохновили меня и оказали влияние на мой труд. Эт а книга не появилась бы без их самоотвержен- ности и вклада, и я горд быть частью этого оживленного сообщества. Спасибо вам всем за поддержку.

ЧАСТЬ I Методы анализа данных

ГЛАВА 1 Что дальше? Создание ценности с помощью Оа(а заепсе За последние два десятилетия наука о данных (с1а1а зыепсе) сделала впечатляю- щий рывок, превратившись из относительно нишевой области, которую могли позволить себе только ведущие технологические компании Кремниевой долины, в сферу, представленную во многих организациях различных секторов и стран. Однако многим командам по-прежнему сложно получить из этой дисциплины измеримую ценность для своих компаний. Итак, в чем же ценность науки о данных для организации? Я обнаружил, что дата-сайентисгы всех уровней подготовки ст алкиваются с этим вопросом, и, ес- тественно, он также актуален и для самих компаний. Моя цель в этой главе — обозначить некоторые основные принципы создания ценности с помощью этой дисциплины. Я верю, что их понимание и усвоение поможет вам стать более ком- петентным дата-сайентистом. Что такое ценность? Компании существуют для того, чтобы создавать ценность для акционеров, кли- ентов и сотрудников (и. надеюсь, для общества в целом). Естественно, акцио- неры рассчитывают получить от своих инвестиций прибыль, которая была бы заметнее по сравнению с другими вложениями. Клиенты извлекают выгоду от потребления продукта и ожидают, что она будет как минимум соразмерна с ценой, которую они заплатили. Все команды и подразделения должны вносить определенный вклад в про- цесс создания ценности, но во многих случаях ею количественная оценка дале- ко не очевидна. И такой пробел в измеримости также присущ науке о данных. Я описал этот общий подход к созданию ценности с помощью данных в своей книге Апа1уИса18кИ1з/ог А1 аш1 Оа1а Зсгепсе («.Аналитические навыки для искус- ственного интеллекта и науки о данных»') (О’КеШу) (рис. 1.1). Идея проста: дан- ные сами по себе не дают никакой ценности. Ценность мы получаем от качества
решений, которые мы делаем на их основе. На первом этапе вы описываете те- кущее и прошлое состояние компании. Обычно это делается с помощью тради- ционных инструментов бизнес аналитики (Ьсшпезз шСеШ§епсе, В1), таких как дашборды и отчеты. С помощью машинного обучения (МЬ) вы делаете прогнозы относительно будущего состояния и пробуете развеять неопределенность, кото- рая значительно усложняет процесс принятия решений. Вершина будет достиг- нута, если вы сумеете автоматизировать и оптимизировать некоторые части процесса принятия решений. Я не буду здесь повторяться, поскольку вышеупо- мянутая книга была полностью посвящена тому, как помочь практикам прини- мать более обоснованные решения с помощью данных. ''писательный Предсказательный Предписывающий Рисунок 1.1. Создание ценности с помощью данных Хотя это описание и кажется очевидным, я посчитал его слишком общим и абстрактным для практического использования дата сайентистами. Со време- нем я преобразовал его в структуру, которая еще вам пригодится при знакомст- ве с темой нарративов (глава 7). Все сводится к одному и тому же принципу: увеличение ценности происходит за счет улучшения способностей организации принимать верные решения. Для этого вам действительно нужно понять текущую бизнес-проблему (чмо), тша тельно продумать рычаги воздействия (что дальше') и начать действовать про- активно (что делать сейчас).
Что: хорошо разбираться в бизнесе Я всегда говорю, что дата-сайентист должен так же хорошо понимать бизнес, как и стейкхолдеры. Под бизнесом я подразумеваю все, начиная с операционных деталей, таких как понимание и ввод новых метрик (глава 2) и рычагов, с помо- щью которых стейкхолдеры могут менять ситуацию, и заканчивая экономиче- скими и психологическими факторами, лежащими в основе бизнеса (например, что побуждает потребителя покупать ваш продукт). Все это звучит так, будто дага-сайентисту нужно много учиться, особенно если учесть, что ему приходится постоянно обновлять свои знания о меняющем- ся техническом инструментарии. Действительно ли это обязательно делать? Раз- ве нельзя просто специализироваться на технической (и интересной) части алго- ритмов, стеке технологий, данных, — а в это время стейкхолдеры будут подробно изучать свой предмет (менее интересный)? И вот мое первое утверждение: бизнес — это тоже интересно! Возможно, вы не находите его увлекательным, однако если дата сайентисты хотят, чтобы их голоса были услышаны теми, кто принимает решения, то им необходимо завое- вать уважение стейкхолдеров. Прежде чем двигаться дальше, позвольте мне подчеркнуть, что дата-сайен- тисты редко принимают реальные решения по бизнес-стратегии и тактике: это дело стейкхолдеров, будь то отделов маркетинга, финансов, продуктов, продаж или любой другой команды в компании. Итак, что необходимо сделать? Вот список действий, которые я счел полез- ными. Посещайте нетехнические совещания Ни один учебник не научит вас азам бизнеса: вам действительно нужно быть там и извлекать уроки из коллективных знаний вашей организации. Займите место рябом с теми, кто принимает решения Убедитесь, что вы присутствуете на собраниях, где принимаются решения. Я доказал своим командам в организациях с четким распределением функ- ций, что их присутствие там отвечает интересам каждого. Например, как вы можете придумать великолепные функции для своих моделей, если вы не раз- бираетесь в тонкостях бизнеса7 Изучите ключевые показатели эффективности (КР1) У дата-сайентистов есть одно преимущество перед остальными сотруд- никами: они владеют данными, поэтому их постоянно просят рассчитать
и представить ключевые показатели работы команды. Таким образом, вы обя заны изучить ключевые метрики. Звучит очевидно, но многие дата-сайен тисты считают это скучным занятием, а поскольку они не владеют метри- кой — в том смысле, что они, скорее всего, не ответственны за достижение цели, — они с радостью делегируют их стейкхолдерам. Более того, дата сай- ентисты должны быть экспертами в разработке метрик (глава 2). Будьте любопытны и открыты новой информации Дата-сайентистам следует проявлять любопытство. Под этим я подразуме- ваю не стесняться задавать вопросы и оспаривать общепринят ые факты в ор- ганизации. Забавно, но я обнаружил, что многим дата- сайентистам не хватает этого простого чувства любопытства. Хорошо то, что его можно развивать. В конце главы я поделюсь некоторыми способами это сделать. Децентрализованные структуры Возможно, это не зависит от вас (или от вашего руководителя, или от ме- неджера вашего руководителя), однако те компании, где в работу команд встроена наука о данных, допускают специализацию бизнеса (а также дове- рие и другие положительные внешние эффекты). В организациях с децентра- лизованной структурой в области науки о данных есть команды, состоящие из людей с разной специализацией (дата сайентисты, бизнес-аналитики, ин- женеры, продакты и др.), и они отлично справляются с тем, чтобы все были экспертами в своей области. И наоборот: в централизованных организациях, где группа «экспертов» выступает в качестве консультантов для всей компа- нии, также есть преимущества, но в их число не входит получение необходи мото уровня бизнес-знаний. Что дальше: суть создания ценности посредством науки о данных Почему ваш проект важен для компании? Почему кому-то должен быть интере- сен ваш анализ или модель? И что еще более важно: какие действия предприни- маются на их основе? Это и есть суть проблемы, рассматриваемой в этой главе. Сейчас я вскользь отношу навык ее решения к одному из признаков высокого уровня квалификации в науке о данных. Во время собеседования с кандидата- ми на должность, задав необходимые технические вопросы-фильтры, я всегда перехожу к части «Итак, что дальше...».
Я сталкивался с этой ошибкой снова и снова: дата-сайентисты тратят много времени на разработку своей модели или анализ, а когда приходит время высту- пать с презентацией, они просто комментируют свои красивые графики и визу ализацию данных. В прямом смысле. Поймите меня правильно: объяснение ваших цифр очень важно, потому что стейкхолдеры обычно не разбираются в данных или их визуализации (особенно в технических вопросах; хотя, конечно, они поймут круговую диаграмму в сво- ем отчете). Но вам не следует на этом останавливаться. В главе 7 еще будут рас- смотрены практические аспекты с горит ел лита, но здесь я дам несколько общих рекомендаций о том, как развить этот навык. Ответьте на вопрос «Что дальше?» в самом начале Начиная любой новый проект, я всегда решаю проблему в обратном поряд ке: как лицо, принимающее решение, может использовать результаты моего анализа или модель? Какими рычат ами они располагают? Можно ли вообще что- го здесь предпринять? Никогда не начинайте без ответов на эти вопросы. Запишите ответы Когда вы разберетесь с вопросом «Что дальше?», будет полезно записать свои мысли. Не нужно отводить этому этапу второстепенную роль и сосредоточи- ваться только на технических моментах. Часто вы настолько глубоко погру жаетесь в технические тонкости, что они вас засасывают с головой. Если вы запишете ответы, то вопрос «Что дальше?» будет вашей Полярной звездой в момент отчаяния Определитесь с рычагами Вопрос «Что дальше?» полностью завязан на возможности что-то предпри- нять. Важные для вас КР1, как правило, напрямую не используются, поэтому вам или кому- либо из сотрудников компании необходимо нажать определен ные рычаги и повлиять на эти метрики (например, изменить ценообразо- вание, провести маркетинговые кампании, стимулирование продаж и т. д.). Принципиально важно, чтобы вы хорошо обдумали свои дальнейшие дейст - вия. Кроме того, позволяйте себе мыслить нестандартно. Подумайте о своей аудитории Интересна ли им вычурная глубокая нейросеть, которую вы использовали в своей модели прогнозирования? Или их больше волнует, как именно они применят вашу модель для улучшения своих метрик? Я думаю, им интерес- нее второе, и ваш успех зависит от их успеха.
Что делать сейчас: проявляйте инициативу Как уже упоминалось, дата- сайентисты обычно не принимают решений- Между вами и стейкхолдерами существует симбиоз: вам нужно, чтобы они применяли ваши рекомендации на практике, а им — чтобы вы улу’чшали бизнес. Лучшие дата-сайентисты, которых я видел, — эго инициативные люди, ко- торые контролируют проект от и до: они следят за тем, чтобы каждая команда вносила свой вклад. Они учатся общаться со стейкхолдерами и развивают дру гие так называемые мягкие навыки, чтобы упрочиться в своем успехе. К сожалению, многие дата-сайентисты занимают противоположну ю позицию. Они думают, что их работа начинается и заканчивается на технической части. Они усвоили только функциональную специализацию, но этого следует избегать. Не бойтесь давать рекомендации по продукту, даже если ме- неджер по продукту с вами не согласен, или предлагать аль- тернативные стратегии коммуникации, когда ваш стейкхол- дер по маркетингу считает, что вы нарушаете границы дозволенного. Тем не менее будьте скромны. Если у вас нет опыта, то прежде чем переходить к вопросу «Что делать сейчас?", я советую вам вернуться к этапу с вопросом «Что?» и освоиться с ним. Измерение ценности Ваша цель — создать измеряемую ценность. Как это сделать? Вот один прием, который применим в более общем случае. Дата-сайентист делает X, чтобы повлиять (ггпрас!) на метрику М, в надежде, что она улучшится по сравнению с текущим значением (ЬазеНпе). Давайте пред- ставим М как функцию ОТ X: 1трас1 оГХ = М(Х) - М(ЪаьеНпе) Давайте применим этот принцип на практике для модели прогнозирования оттока: X Модель прогнозирования оттока пользователей М Коэффициент от гока, т. е. процент активны х пользователей в период Г - 1, ко- торые неактивны в период I
ВазеИпе Стратегия сегментации Обратите внимание, что М не является ф^-нкцией от X! Уровень оттока поль- зователей остается одинаковым независимо от использования модели прогно- зирования. Метрика меняется только в том случае, если вы что-то делаете с выходными данными модели. Заметили ли вы, что ценность определяется дей- ствиями, а не данными или моделью7 Итак, давайте скорректируем принцип, чтобы было четко видно, что действия (А) влияют на метрику: 1трас( оГХ = М{А(Х)) - М(А(ЬазеИпе)) Какие рычаги есть в вашем распоряжении? В типичном сценарии вы запу- скаете кампанию по удержанию пользователей, ориентированную только на тех, у кого высокая вероятность стать неактивными в следующем месяце. Напри- мер, вы можете предоставить скидку или запустит ь рекламную кампанию. Давайте также применим принципы «Что», «Что дальше» и «Что делать сейчас». Что? Как измеряется отток пользователей в вашей компании? Является ли этот ме- тод наилучшим? Что делает команда, отвечающая за эту метрику, чтобы сни- зить ее (ЬазеНпе)? Почему пользователи становятся неактивными? Что при- водит к оттоку? Как это повлияет на выручку и убытки? Что дальше? Как будет использоваться оценка вероятности? Можете ли вы помочь им най- ти альтернативные рычаги, которые они смогут опробовать? Доступны ли це- новые скидки? Что насчет программы лояльности? Что делать сейчас? Что вам нужно получить от сотрудников компании, участвующих в приня- тии решений и рабочих процессах? Необходимо ли вам одобрение юриста или финансиста? Согласен ли продакт-менеджер с предлагаемым изменени ем? Когда запускается кампания? Готов ли рынок к ее запуску7 Позвольте мне подчеркнуть важность разделов «Что дальше» и «Что делать сейчас». У вас может получиться отличная прогнозная и, надеюсь, интерпрети- руемая МЬ-модель. Но если на метрику не повлияют те меры, которые реали- зовали лица, принимающие решения, то ценность вашей команды будет равна
нулю (что дальше?). При проактивном подходе вы действительно помогаете им найти альтернат иву (в этом важность этапа «.что» и глубокого понимания про- блемы). Но вам нужно добиться одобрения (что делать сейчас?). Если взять обо- значения из уравнения, то вы должны владеть М(А(Х)), а не только X. Когда вы количественно оцените инкрементальность своей модели, необходи мо будет перевести ее в ценность. Некоторые команды с радостью заявляют, что отток пользователей снизился на несколько позиций, и останавливаются на до- стигнутом. Но даже в этих случаях я считаю полезным пересчитать значения в долларах. Вам будет легче привлечь больше ресурсов для своей команды, если вы сможете показать, какую дополнительную ценность вы приносите компании. Что касается нашего примера, то это можно сделать несколькими способами. Самый простой из них — измерить ценность в деньгах. Предположим, что среднемесячная выручка с одного пользователя равна К и что у компании есть база активных пользователей В: Соз! оЕСЬигп(А, х) = В х СЬигп(А(Х)) х Р Если у вас 100 пользователей, каждый из которых приносит 7 долларов в ме- сяц, а ежемесячный отток составляет 10 %, компания в месяц теряет 70 долларов. Инкрементальная денежная стоимость — это разница между затратами с ис- пользованием модели и без нее. После учета общих условий вы получаете: АСоз! оЕСкигпСА, Ьазекпе, X) - В х АСкигп(А; X, Ьазекпе) х К Если раньше страгегия сегментации позволяла экономить 70 долларов в ме- сяц, а теперь точно настроенная МЕ- модель экономит 90 долларов, то инкремен- тальная ценность для организации составляет 20 долларов. Более сложный подход приносил бы также другие создающие ценность из- менения, например, стоимость ложных позитивных и ложных отрицательных результатов. Ложноположительный результат Общепринято использовать дорогостоящие методы для привлечения пользо- вателей, хотя некоторые из них не собирались даже уходить. Вы можете оце- нить стоимость этих рычагов. Например, если вы предоставите 100 пользо- вателям скидку 10 % от цены Р, но из них только 95 на самом деле собирались уходить, то вы потеряете 5 х 0,1 х Р в виде ложных срабатываний. Ложноотрицательный результат Альтернативные издержки из-за неверных прогнозов — это выручка от тех пользователей, которые в конечном итоге ушли, но не были обнаружены
с помощью исходного метода. Такие издержки рассчитываются с помощью уравнений, которые мы только что рассмотрели. Основные выводы Ниже представлены основные выводы из этой главы. Компании существуют для того, чтобы создавать ценность. Следовательно, команды должны создавать ценность Команда дата-сайентистов, которая не создает ценности, — эго роскошь для компании. Ажиотаж вокруг науки о данных дал вам некоторую поблажку, но чтобы выжить, вам нужно убедиться, что экономическое обоснование ва- шей работы положительное для компании. Ценность создается путем принятия решений Ценность науки о данных в том, что с помощью доказательного и основанно го на данных инструментария, который вы знаете и любите, компания полу чает возможность принимать более успешные решения. Суть создания ценности лежит в ответе на вопрос «Что дальше?» Остановитесь в самом начале, если ваша модель или анализ не позволяют по- лучить применимые в дальнейшем выводы. Подумайте о рычагах воздейст- вия и детально разберитесь в этом бизнес-вопросе. Развивайте свои навыки общения Как только у вас появятся своя модель или результаты анализа и вы дадите практически применимые рекомендации, настанет время обеспечить ком- плексную реализацию. Общение со стейкхолдерами имеет ключевое значе- ние, и не менее важно, чтобы оно располагало их к вам. Если вы знаете свой бизнес вдоль и поперек, не стесняйтесь давать свои рекомендации. Дополнительная литература Я затрагиваю некоторые из вышеперечисленных тем в своей книге Апа1уИса1 8кШ$)ог А1 апй Оага Зсгепсе (О'КеШу). Ознакомьтесь с главами, посвященными тому, как научиться задавать деловые вопросы и находить эффективные рыча- ги для решения вашей бизнес-проблемы.
Развивая свою любознательность, помните, что вы родились с этим качест- вом. Дети всегда задают вопросы, но, вырастая, они забывают об этом. Возмож- но, они стесняются или боятся, что их сочтут невежественными. Вам нужно преодолеть эти психологические барьеры. Вы можете почитать книгу «Краси- вый вопрос. Как неординарные вопросы приводят к гениальным идеям» (А Моге ВеаиИ/и1 ОиезИоп: Иге Ром’ег о/ 1пцшгу (о Зрагк ВгеакЛгоиук 1беаз) Уорена Берге- ра (В1оотзЬигу) или некоторые из книг Ричарда Фейнмана (например «Радость познания» (Тке Р1еазиге о/РтсНп# Ткту>з Оик) [Вазк: Ьоокз]). Что касается социальных и коммуникативных навыков, то для их разви- тия существует множество ресурсов и возможностей. Я считаю, что книха Рика Брэндона и Марти Селдмана «Выживание сообразительных: честная полити- ческая тактика для карьеры и успеха компании»)[8игуКа1 о/ ?Ие Заууу: НгуИ- 1п1еуп1у Ро1Шса1 ТасНсз/ог Сагеег ат! Сатрапу Зиссезз) (Ргее Ргезз) весьма полез- на для развития прах матичного дохода к политике компании. Книга Джоко Виллинка и Лейфа Бабина «Экстремальная ответственность: как „морские котики" управляют и побеждают» {Ногу 1!.3. Иауу Зеа1з 1еаб апб \У!п) (81. МагБп’з Ргезз) доказывает, что выдающиеся лидеры берут па себя все- стороннюю (экстремальную) ответственность. Книга Криса Восса и Таллы Раз «Никаких компромиссов. Веди переговоры так, словно от них зависит твоя жизнь» (К’еуег Зр1й 1ке Эфегепсе) (Нагрет Визшезз) отлично подходит для развития навыков ведения переговоров, а классическая и часто цитируемая книга Дейла Карнеги «Как завоевывать друзей и оказывать влияние на людей» (Нам 1о РИ/и Рпепбз апА 1п/1иепсе Реор1е) (РоскеТ Воокз) помо- жет вам развить некоторые более мягкие навыки, крайне важные для успеха.
ГЛАВА 2 Разработка метрик Позвольте мне предположить, что опытные дата-сайентисты умеют среди про- чего хорошо разрабатывать метрики. Что такое разработка метрик? Если крат ко, то это искусство и наука по поиску метрик с хорошими свойствами. Веко ре я расскажу об этих полезных свойствах, но сначала приведу доводы в пользу того, почему’ дата-сайентисты должны отлично уметь это делать. Ответ прост: если не мы, то кто? В идеале все сотрудники организации долж- ны преуспевать в разработке метрик. Но лучше всего для решения этой зада чи подходят дата сайентисгы. Они постоянно работают с метриками: вычисля- ют, сообщают, анализируют и, надеюсь, пытаются их оптимизировать. Возьмите А/В-тестирование: отправная точка любого хорошего теста — получение пра вильной выходной метрики. Аналогичное обоснование применимо и к машин ному обучению (МЕ): для прогнозирования первостепенное значение имеет по- лучение правильной выходной метрики. Полезные свойства метрик Зачем компаниям нужны метрики? Как говорилось в главе 1, для каких-либо действий необходимы хорошие метрики. Помня об этом критерии успеха, да- вайте проанализируем проблему с конца и определим необходимые условия для достижения успеха. Измеримость Метрики должны быть измеримы по определению. К сожалению, многие метри- ки несовершенны, и, чтобы научиться распознавать их подводные камни, по- требуется немало времени. Так называемые промежуточные метрики, или прок- си, которые обычно коррелирутот с желаемым результатом, имеются в избытке, но вы должны знать плюсы и минусы работы с ними1. 1 Например, при линейной регрессии ошибка измерения признаков приводит к статисти- ческой погрешности оценок параметров.
Простым примером является обусловленность намерением (пйепИопаШу). Предположим, вы хотите понять причины раннего оттока (оттока новых поль- зователей). Некоторые из пользователей на самом деле никогда не собирались использовагь этот продукт, просто решили опробовать его. Следовательно, из- мерение обусловленности намерением значительно улучшило бы вашу модель прогнозирования. Обусловленность намерением на самом деле не поддается из- мерению, поэтому вам нужно найти прокси — например, временной интервал между ознакомлением с приложением и началом его использования. Чем быст- рее вы начнете использовать продукт, тем более серьезное у вас намерение. Другой пример — понятие привычки, используемое экспертами по росту. Пользователи обычно завершают знакомство с приложением, пробуют продукт (момент истины!) и, как мы надеемся, приобретают привычку. Что убедительно доказывает, что пользователь достиг этой стадии? Обычная прокси-метрика — количество взаимодействий за первые х дней с момента его первого использова- ния пользователем. Для меня привычка — это повторение взаимодействий, ка ким бы оно ни было для каждого пользователя. И тогда прокси метрика — это индикатор первых повторений. Практическое значение Чтобы на основе метрик можно было принимать решения, они должны иметь практическое значение. К сожалению, из многих топ-лайн метрик сложно из- влечь практическую пользу напрямую. Подумайте о выручке: она зависит от того, купит ли пользователь продукт, и заставить его сделать это не получит- ся. Но если вы разложите метрику на подметрики, у вас могут появиться неко- торые полезные рычаги, и я покажу это на примерах. Релевантность Информативна ли ме грика для рассматриваемой проблемы? Я назы ваю это свойство релевантностью, поскольку оно подчеркивает, что ме грика хороша только в от ноше нии конкретного бизнес-вопроса. Я мог бы использовать определение «информатив- ная», но все метрики о чем-то могут нам рассказать. Если мы подбираем для правиль- ной проблемы правильную метрику, то последняя считается релевантной. Своевременность Хорошие метрики ведут к действиям, когда перемены назрели. Если я узнаю, что у меня последняя стадия рака, врачи уже не смогут мне помочь. Но если я буду
регулярно проходить обследование, они смогут обнаружить ранние симптомы и предложить мне широкий спектр процедур. Другой пример — отток клиентов. Обычно он измеряется и регистрирует- ся с использованием месячного периода бездействия, рассчитывается процент пользователей, которые были активны в течение одного месяца и неактивны в следующем месяце. К сожалению, этот показатель может привести к ложно - положительным результатам: некоторые пользователи просто взяли перерыв, но не отключались полностью. Для получения более надежной метрики мы можем, например, увеличить пе- риод бездействия с одного до трех месяцев. Чем больше промежуток времени, тем меньше вероятность того, что пользователь просто брал перерыв. Но в этом случае новая метрика будет не совсем своевременной: теперь вам придется ждать три месяца, чтобы отметить отток клиента, и тогда будет уже слишком поздно запускать кампанию по удержанию. Декомпозиция метрик Путем декомпозиции метрики вы сможете улучшить вышеперечисленные свой- ства. Ниже я подробно расскажу о нескольких приемах для этой задачи. Аналитика воронки Воронки — это последовательность действий, которые следуют одно за другим. Например, в примере с привычкой пользовагелю сначала необходимо создать свою учетную запись, попробовать продукт и использовать его повторно. Если у вас есть воронки, вы всегда можете применить простой прием поиска субмет- рик. Сначала я расскажу об этом приеме в общих чертах, а затем приведу не- сколько кратких примеров. На рис. 2.1 показана типичная воронка: последовательность этапов между точкой входа Е и выходом М (.для упрощения записи; они также обозначают со- ответствующие метрики). Моя цель — улучшить показатель М. Внутренние эта- пы обозначаются как 8 , 8 , 5, и для каждого из них есть мет рика гл с соответст- вующим индексом. О Рисунок 2.1. Типичная воронка
Декомпозиция работает следующим образом: вы перемещаетесь справа нале- во, перемножая текущие субметрики, деленные на предыдущие. Чтобы гаранти- ровать, что вы никогда не нарушите равенство, в завершение умножьте метрику на значение в начале воронки (Е). Обратите внимание, что после сокращения об- щих членов мы получаем М = М; благодаря этому мы можем быть уверены, что действительно провели декомпозицию исходной метрики М т т, т М - ж. х т х т х 3 2 I Каждую дробь мы можем рассматривать как коэффициент конверсии, то есть процент пользователей (ипй) на предыдущем этапе, которые переходят на теку щий этап. Обычно свойства одной или всех этих подметрик лучше исходной ме- трики М. Теперь, когда вы познакомились с этим приемом, пришло время при- менить его на практике. Именно так и работает типичная воронка продаж Моя цель — увеличить продажи, но для этого потребуется несколько шагов. Здесь я немного упрощу воронку: — Генерация лидов (1: количество лидов) — Первый контакт (С : количество первых контактов) — Вторые контакты (С . количество вторых контактов) — Делаем предложение (О: количество сделанных предложений) — Закрытие продажи (5: количество продаж) Декомпозиция выглядит так: „ 5 о с; с Т 5 _ ох с.х с; х 1хЛ Чтобы увеличить количество продаж, вы можете увеличить количество ли дов или конверсию между этапами. Некоторые действия относятся к работе дата-сайентиста (например, повышение качества лидов), другие — к команде продаж (например, устанавливают ли они достаточное количество первых кон- тактов; если нет, то компании, возможно, потребуется увеличить численность отдела продаж или нанять других людей). Возможно, им следует изменить стра- тегию переговоров или ценообразования, чтобы повысить коэффициент кон- версии предложения в продажу (ой'ет-1о-за1е га1е). Или даже улучшить продукт! У вас могут быть лучшие лиды или лучший отдел продаж, но продукт еще не бу- дет соответствовать требованиям рынка.
Декомпозиция запасов и потоков Декомпозиция запасов и потоков ($1оск-/1оп‘ (1есотрозИюп$) полезна, когда вы ра- ботаете над метрикой с накопительным значением. Давайте начнем с определе- ния этих понятий: переменная запаса — это величина, которая накапливается, измеряется в определенный момент времени. Переменные потока не накаплива- ются и измеряются в течение определенного периода времени. Полезной анало- гией может служить ванна: объем воды в момент времени I равен объему в мо- мент времени I — 1, плюс объем воды, попавшей через кран между этими двумя моментами, минус вода, кот орая ушла в канализацию Обычно всех интересует информация об ежемесячных активных пользова- телях (МопМу АсИге Цзегз, МАЦ). Сначала я расскажу о декомпозиции, а потом прокомментирую: МАЦ = МАП' 1 + Входящие пользователи, - Отток пользователей, Если цель компании — увеличить МАЦ, вы можете либо увеличить количе- ство привлеченных клиентов, либо сократить отток. Входящих пользователей (1псотт$ Цзегз) потенциально можно разделить на новых пользователей (Лти1 Цзегз) и вернувшихся пользователей (КезиггеМес! Цзегз), что позволит получить нам как минимум один рычаг Аналогичные разложения применимы к любой переменной запаса (напри- мер, к остаткам на банковском счете). Декомпозиция типа РхО Другой распространенный сценарий — попытаться увеличит ь выручку. Метод здесь заключается в том, чтобы умножить и разделить на адекватные метрики и получить субмегрики, по которым будет легче найти нужные рычаги воздей- ствия: Выручка _ Выручка = я--------------- х Проданные единицы = Проданные единицы г = Цена единицы х Обьем продаж Эта формула показывает, как разложить выручку на произведение удельной (средней) цены и объема продаж: Я = р х </. Чтобы увеличить выручку, вы може- те либо увеличить цену, либо увеличить объем продаж. Интересно, что объемы продаж отрицательно зависят от цены, поэтому они связаны нелинейно и явля- ются предпочтительным инструментом для оптимизации выручки.
Другой вариант декомпозиции выручки Исходя из того факта, что выручку мы получаем от активных пользователей, вы можете попробовать провести аналогичную декомпозицию, которая будет по- лезна для решения определенных проблем и выбора рычагов: Выручка Выручка = д- х М АП = АКРИ х МАИ Я выразил выручку как функцию среднего дохода на одного пользователя (Агега^е Кеуепиерсг Ът$ег, АРР С) и активных пользователей. Я мог бы включить здесь уравнение запасов МАЦ если захочу найти еще больше рычагов. Я мог бы т акже включить разложение р х д, чт обы расширить список. Пример с маркетплейсами В качестве последнего примера рассмотрим маркегплейс — двустороннюю плат- форму, которая соединяет покупателей (В) и продавцов (5). Вспомните, напри- мер, Ата/оп, еВау, ИЬег, АтгЬпЬ и так далее. Давайте рассмотрим упрощенную воронку. Продавцы -> Список товаров -> Просмотры -> Покупки Согласно этой схеме, компания сначала привлекает продавцов, которые вы- кладывают списки товаров; они просматриваются и в конечном итоге становят- ся предметом покупки. Ваша цель — увеличить количество покупок. Используя логику воронки, это переводится так (заглавные буквы обознача- ют соответствующую метрику на каждом шаге): _ Р V 1 „ Р = у х у х у х 5 Чтобы учесть и другую сторону рынка, давайте применим еще один из рас смотренных ранее приемов, чтобы общее количество просмотренных товаров (V) было равно числу покупателей (В), умноженному на среднее количество просмотров на одного покупателя: 5= хВ п После преобразований я получаю уравнение: с Р V Ь 1 п р 5 = ту х ух-тхтхВх5 V В б 1 Из этого следует, что для увеличения покупок вы можете либо: — повысить эффективности оформления заказа (Р/У); — повысить вовлеченность покупателей (17В);
— повысить вовлеченность продавцов (Ь/8); — увеличить количество покупателей или продавцов Чтобы соблюсти равенство, я ввел дополнительный множитель, который нс гак просто объяснить (1/Е). На самом деле меня не волнует этот дополнитель- ный множитель, поскольку теперь у меня есть пять подметрик, которые можно по-разному использовать2. Основные выводы Ниже представлены основные выводы из этой главы. Чтобы предпринимать какие-либо меры, вам нужны хорошие метрики Если ваша цель — найти рычаги для дальнейших действий, то разработка метрик имеет решающее значение. Я провел реверс-инжиниринг проблемы, чтобы выделить некоторые полезные свойства метрик для их успешной раз- работки. Полезные свойства, которыми должны обладать хорошие метрики Хорошая метрика должна быть измеримой, применимой на практике, реле- вантной и своевременной. Декомпозиция метрик на подметрики позволяет улучшить эти свойства Воронкообразные декомпозиции просты в использовании, и, как только вы к ним привыкнете, вы начнете видеть их повсюду. Простой метод умножения и деления на одну метрику может дать вам очень много в понимании ситуации. Но выбор этой метрики далеко не оче виден; чтобы найти ее, вам нужно хорошо разбираться в бизнесе. Разработка метрик — это итеративный процесс Можно начинать с несовершенных метрик, но еще лучше, если вы преврати- те их разработку в постоянный итеративный процесс. 2 Вы можете дать дополнительному множителю вероятностную интерпретацию, если просмотры генерируются случайным образом из набора списков товаров. Но это на са- мом деле противоречит цели декомпозиции.
Дополнительная литература Если вам нужна дополнительная информация, вы можете найти ее в моей книге Апа1у11са18кШ$/огА1 апс1 Оа1а Зсгепсе (О’КеШу). Однако в этой главе я более под- робно рассказываю о практических методах и показываю, как можно использо- вать декомпозицию К = р х д для оптимизации выручки. В статье Шона Эллиса и Моргана Брауна «Взлом роста: как современные бы- строрастущие компании добиваются огромного успеха» (Насктд Сгоъ’Вт Ноус ТоДауз Раз1ез1-Сгоут% Сотрашез Оте Вгеакои1 Зиссезз) (Сиггепсу) можно найти обсуждения сторонников роста о разработке метрик. Безусловно, стоит прочитать книгу’Джона Доерра «Измеряйте самое важное» (Меазиге У*/Ъа1 МаНегз) (РогВоПо), хотя она больше посвящена ОК К (цели и клю чевые результаты. — Прим, пер.), чем разработке метрик. Я использовал описан ные в ней методы, чтобы найти субметрики, на которые определенные команды действительно могут влиять. Насколько мне известно, других опубликованных ресурсов по этим темам с точки зрения науки о данных нет.
ГЛАВА 3 Декомпозиции роста: попутные и встречные ветры В главе 2 я описал методы поиска более точных метрик, имеющих практическое при- менение. В этой главе мы рассмотрим совершенно другую тему — как можно раз- ложить метрики, чтобы понять причину их изменений. На корпоративном жаргоне эти изменения обычно связывают с попутным и встречным ветром, то есть фак- торами, которые положительно или отрицательно влияют на состояние компании. Почему именно декомпозиция роста? Дата-сайент истов часто просят помочь найти первопричину изменения метри- ки. Почему выручка росла квартал за кварталом (кв/кв) или месяц за месяцем (м/м)? По моему опыту, на эти вопросы очень сложно ответить не только пото- му, что одновременно происходит много разных событий, но и потому, что неко- торые из этих глубинных причин не поддаются прямому измерению или не дают достаточного разброса, чтобы быть информативными3. Типичные примеры — такие факторы, как состояние экономики или нормативно-правовая среда, а так- же решения, принимаемые конкурентами. Тем не менее вы можете использовать некоторые другие источники вариаций, которые в сочетании с описанными ниже методами могут дать вам представле- ние о том, что происходит. Аддитивная декомпозиция Как следует из названия, эта декомпозиция полезна, когда метрика (выходные показатели), которую вы хотите понять, может быть выражена как сумма дру- гих метрик (входные показатели). В случае двух входных показателей это может 3 В главе 10 я расскажу, почему вам нужны вариации во входных показателях, чтобы объ яснить различия в выходных метриках.
быть выражено каку =у., + у . Обратите внимание, что я ставлю время в ниж ний индекс. Декомпозиция показывает, что рост выходных значений с I - 1 до () — это средневзвешенное значение темпов роста входных значений: 8у, I ~ Ш1,1 - I + ^2,1 - 1^/2’ где веса в сумме равны единице, и) + ш ( = 1. Важно отметить, что весовые коэффициенты отражают относительную важ- ность каждого входного значения за предыдущий период. Таким образом, вход- ным значениям, которые имели большую долю в Г-1, будет придан больший вес. Пример Аддитивный подход довольно распространен в хранилищах данных, где у вас есть таблицы фактов и измерений. Грамматическая аналогия помогает понять отличия: факты можно рассматривать как действия или глаголы, а измерения — как наречия, описывающие действие. В таблицах фактов обычно хранятся ме трики, имеюшие отношение к компании, а в таблицах измерений — измерения, которые помогают вам понять эти метрики. Вот типичный $ОЬ-запрос, который создает набор данных, необходимый в качестве входных значений: 5Е1ЕСТ ОАТЕ_ТЯ1ЖС( МОГЛИ , Н.Гас1_1:1пе51апр) А5 поп1Ь, <Й:.сН|пеп5т.оп1 А5 <Лт_уа1ие5, 5ОМ(<:1:.п)у_пеГгГ.с) А$ попГК1.у_теГггс РВОМ ту_ГасТ_ТаЫе Н: ЬЕРТ ЗО1М ту_с1грт_1аЫе Щ ОМ Н:.р'-гг>1агу_кеу = с11.рггтагу_кеу СКОЦР ВУ 1,2 ОАОЕР ВУ 1,2 Например, ваша метрика — покупки клиентов, и вы хотите разложить ее по регионам. Поскольку' общий объем продаж равняется сумме продаж по реги- онам, такая декомпозиция вполне удобна. Она поможет вам понять, являются ли темпы роста в одном или нескольких регионах основными причинами ускоре ния или замедления на национальном уровне. В примере запроса показано, как можно легко создать свод- ную таблицу, которая разбивает метрику, используя разные измерения. Процесс выглядит следутощим образом.
1. Создайте конвейер, который периодически обновляет сводную таблицу по различным измерениям. 2. Напишите скрипт, который вычисляет декомпозицию для одного измерения и выводит результаты в виде таб- лицы (смотрите репозиторий на СйНиЬ геро4). 3. Выполните цикл по всем измерениям с помощью этого скрипта. 4. В конце вы получите таблицу со всеми источниками ва- риаций. На данном этапе, чтобы выявить закономерности в изме- нениях, вам понадобятся знания о бизнесе. Обычно это са- мая сложная часть работы, и она требует обширных знаний в этой области. Интерпретация и примеры использования Как уже упоминалось, при аддитивной декомпозиции темпы роста в выходных значениях равны средневзвешенным темпам роста во входных значениях. Од нако я предпочитаю рассматривать вклад в рост каждого сегмента или значения измерения, где каждый вклад равен произведению лагового веса и соответству- ющего темпа роста. Аддитивная декомпозиция в виде уравнения Рост выходных значений = 5ОМ(вклад в рост входного значения) Декомпозиция особенно полезна, когда у вас есть несколько измерений, ко торые можно использовать одновременно и которые совместно могут указывать на глубинные причины. Возвращаясь к примеру с продажами, вы можете применить декомпозицию, используя географические регионы, социально-экономический статус района расположения магазина и определенный тип потребительскою сегмента (на- пример, по периодам пользования). Вывод может быть примерно таким: национальные продажи снизились на 7 процентных пунктов (п. п.) м/м по нескольким основным причинам. 4 Ь11рь://§)ЛиЬ.сот/<1уаи§Ьап79/йа1а-5с1епсе-11аг<1-раг15-со4е
— Рост в Юю-Западном регионе снизился на 14 п. п. м/м. — Количество магазинов в районах с высоким социально-экономическим статусом сократилось быстрее. -- Замедление было относительно равномерным по периодам пользования. Обратите внимание, что на самом деле вы не находите первопричин; в луч- шем случае вы получаете подсказки о том, что является движущей силой изме- нений. Замедляется ли экономика Юго-Западного региона? Изменились ли цены в этих магазинах? Как обстоит дело с удовлетворенностью среди клиентов с вы- соким социально-экономическим статусом? На рис. 3.1 показана для примера каскадная диаграмма вкладов регионов. В этом случае на национальном уровне наблюдалось снижение на 4,6%, что объясняется главным образом сильным замедлением темпов роста в Северо Западном регионе (на 5,8 п. п.). Юго-Западный и Западный регионы также за медлили темпы роста, а на Юге наблюдался рост в этом квартале. Рисунок 3.1. Региональный вклад в рост Мультипликативная декомпозиция Мультипликативная декомпозиция работает, когда выходная метрика может быть выражена как произведение двух или более входных показателей. В гла ве 2 показано, как они естественным образом возникают во многих расчетах, например, в формуле р к д.
Декомпозиция гласит, что всякий раз, когда = у1 1 х у2 {, то: Иными словами, темпы роста в выходных показателях равны сумме темпов роста и совокупного эффекта. Пример Если мы рассмотрим декомпозицию выручки из главы 2, то увидим, что перед нами произведение среднего дохода на одного пользователя (АКРИ) и ежемесяч- но активных пользователей (МАС): Выручка = АКРС х МАИ Если выручка росла, это могло быть связано с ростом АКРЦ МАИ или с тем и другим вместе. Что еще более важно, с помощью декомпозиции вы можете ко- личественно оценить каждый из них. На рис. 3.2 показана одна из возможных визуализаций декомпозиции для смоделированного примера с АКРЕ’. В этом случае основной фактор роста в те- чение месяца — значительное увеличение средней выручки на одного пользо- вателя (что составляет -31 рр, или около 96% от общего прироста выручки). Обратите внимание, что совокупный эффект очень мал, поскольку он является произведением темпов роста входных значений. Во многих случаях, если он дей- ствительно очень мал, вы можете просто не учитывать его5. Рисунок 3.2, Мультипликативная декомпозиция АКРУ 5 Если применить логарифмическое преобразование, то с помощью разложения в ряд Тей- лора можно прийти к тому же результату: темп роста произведения равен сумме темпов роста исходных величин.
Интерпретация В мультипликативном режиме рост выходных значений — сумма роста во вход- ных показателях и совокупного эффекта. Если у вас больше двух входных пока- зателей, то это уравнение остается в силе, но вам нужно добавить сумму сово- купных эффектов Мультипликативная декомпозиция в виде уравнения Рост выходных значений = 8Е1М(вклад в рост входного значения) + + совокупный эффект Декомпозиция гтх-гаТе В декомпозиции них-та1е мы берем понемногу из аддитивных и мультипликат ив- ных разложений. Предположим, что ваша выходная метрика — это средневзве- шенное значение других метрик: Л = ?и'5.Л,г = и'1'х1’ где последнее равенство просто выражает эту сумму как точечное или скаляр- ное произведение соответствующих векторов (выделены жирным шрифтом). Позвольте мне конкретизировать эту декомпозицию, а затем объяснить чле- ны уравнения: Ду, = Дл + Д" + Дту Дх, " у у где: △у, Первая разность для выходной метрики. Я обнаружил, что обычно достаточ но хранить все в виде разности, а не темпов роста, и это значительно упро- щает обозначение. Д’ Как изменились бы выходные значения, если бы веса оставались фиксиро- ванными на начальных значениях, а изменялись только входные данные? Обозначение сигнализирует о том, что только входным значениям (над- строчный индекс) можно изменять выходные показатели (подстрочный ин- декс).
А” у Каким было бы изменение выходных значений, если бы исходные показате- ли оставались зафиксированными на начальных значениях и менялись толь- ко веса? Ату Ах Эго скалярное произведение изменений в весах и исходных значениях. Когда я впервые задумался об этой декомпозиции, я двигался интуитивно во втором и третьем пунктах, которые противоречат фактам (т. е. вы не може- те их наблюдать) и очень полезны для целей сторигеллинга. Цифры не сошлись, поэтому мне пришлось перепроверить уравнения. Однажды я представил эти расчеты стейкхолдерам, и они назвали их штх-гаТе; похоже, этот термин уже ког- да-то использовался, но я не смог найти в интернете полезную информацию по нему, поэтому не уверен в его происхождении или использовании. Однако этот термин хорош, поскольку есть два потенциальных источника изменений: — Изменения в весе (тгх) — Изменения во входных значениях (гаге) Пример Среднев звешенные значения возникают повсеместно. Подумайте вот о чем: у вас есть одна метрика и сегменты клиентов. Интуитивно понятно, что метрика — это средневзвешенное значение метрик для сегментов. Обычный случай для гайо-метрик. Давайте попробуем провести расчет со средней выручкой на од- ного пользователя (АКРЦ) для двух сегментов: АКР1А = _Р МАЬ' МАих + МА1Ц Р МАР^ , к2 МА1)2 ~ МАЪ\ МА1' + МАП, + МАи2 МАЪ'} - МА1\ = шАРР1.\ + ш_АРРР\ Обратите внимание, что весовые коэффициенты — это относительная доля активных пользователей в месяц за период для каждого сегмента. Как обычно, сумма весов должна равняться единице.
На рис. 3.3 показана одна из возможных визуализаций этой декомпозиции для смоделированного набора данных в примере с А.КР13 (с тремя сегментами). Если бы не было никаких изменений в долях, АКР13 вырос бы на 3,2 доллара (темп роста, или га1е\, аналогично, если бы не было никаких изменений в АК.РН на сег- мент, средняя выручка на одного пользователя снизилась бы па 1,6 доллара (тис). Рисунок 3.3. Пример гтх-га1е декомпозиции Интерпретация Объяснение здесь простое: изменение метрики равно сумме частей после парци- ального (частичного) исключения (то есть фиксация одного компонента на на- чальных значениях и возможность изменения другого) и совокупного эффекта обоих изменений. Декомпозиция гл 1Х-гаге в виде уравнения Рост метрики = 811М(эффект парциального исключения) + + совокупный эффект Как упоминалось ранее, первая часть весьма привлекательна для сторител- линга: здесь вы можете эффективно моделировать то, что произошло бы, если бы изменились только веса (инх) или темпы роста (га1е).
Математические производные Давайте углубимся в математику. Понимание производных имеет решающее зна- чение для кодирования Я обнаружил, что отлаживаю функцию из-за того, что не использовал правильные веса или временные подстрочные индексы. В дальнейшем я буду упрощать расчеты, беря только два слагаемых (аддитив иые), множители (мультипликативные) или сегменты (ттх-габг). Они обобщают- ся на большее количество входных значений или сегментов (но вам нужно быть осторожным, см репозиторий кода6). Кроме того, я обозначаю скорость роста от х как & =, с Дх: = х. - х первой разностью от х. Аддитивная декомпозиция Поскольку)’ является аддитивным: Л=Л. + Л,( Давайте теперь рассмотрим первые разности, чтобы получить: ДЛ = ДЛ,, + ДЛ.. Наконец, рассчитываем темпы роста: ДЛ = ЛУ„, у.., 1 4 ДЛ,< Л- = ДЛ,. ДЛ Л-1 У).1-1 Л-1 Л.1-1 Л 1 1,1 'Л.1-1 2’ ^2,1-1 или ^,1 = и,1,Г-Л. + Ш2,(-&,г Мультипликативная декомпозиция Поскольку;’является мультипликативным: Л = Л.<ХЛ.1 Берем первую разность выходных значений, затем добавляем и вычитаем лишний член (исключаем их): ДЛ = Л, Л., - Л, 1 - 1Л, 1 -1 + Л, У1,1 -1 - Л. У г.1 -1 = Л. 1ДУ2,1 + Л, 1.1ДУ1,1 6 Ьнр5://§111тиЬ.сот/дуаи§кап79/да1а «с1епсе-Ьагс1-раг15 соде
Чтобы получить темпы роста, вам просто нужно быть внимательным и пом- нить, что выходное значение является мультипликативным для всех периодов времени: Ду, л,( а,-. Ф’1( ,, , у— = У 1“ +У------------- V--- /1-1 /] (-1 /2,1- 1 /2,1-1 /1,1-1 Обратите внимание: если у вас более двух входящих значений, вам необходи- мо просуммировать все комбинации произведений. Декомпозиция т1х-га(е Напомним, что при пнх-га1е декомпозиции выходная метрика может быть вы ражена как средневзвешенное значение метрик для сегментов: У, = ' хе где веса в сумме равны единице, а буквы, выделенные жирным шрифтом, обо- значают векторы. В этом случае я буду идти в обратном направлении и покажу, что после неко- торых упрощений вы придете к исходному выражению. Не самый элегантный способ, но я предпочитаю пойти этим путем, а не добавлять и вычитать члены уравнения, происхождение которых может оказаться для вас непонятным. Д'+ Д“ + Лгу • Дх = те -Дх + х , • Дту I-Дм’• Дх у у , 1 1 1' , Подстановка определений = Дх • (Дх = ту, Л + Дм • Дх, I 1 1 1 11 Вынесение общего множителя Дх за скобки = Х1ЗУ1-Х, 1-------1-----1 Сокращение = ДУ. Основные выводы Ниже представлены основные выводы из этой главы. Обычно очень сложно найти первопричины временных изменений Вам необходимо достаточное разнообразие движущих сил, чтобы оценить их влияние.
I —I Декомпозиция роста может подсказать вам, в чем заключаются первопричи- ны изменений Анализируя дополнительные источники вариаций (из других входных ме- трик), вы можете выдвинуть гипотезу о гом, что послужило причиной изме- нений. Я показал три декомпозиции, которые помогут решить стоящую пе- ред вами задачу: аддитивная, мультипликативная и тгх-гаге. Дополнительная литература Насколько мне извесг но, на эту тему опубликовано не так уж много литературы. Такое впечатление, что этими знаниями делятся только внутри дата-комапд ком- пании и в рамках корпоративной культуры, но они никогда не становятся досто- янием широкой общественности. Я узнал об аддитивной декомпозиции на пре- дыд^щей работе и разработал две другие, когда они понадобились. Математика относительно проста, так что нет необходимости что го приду мывать дальше. Если интересно узнать про методы, которые я здесь использо- вал. то их можно найти в любой вводной книге или конспектам лекций по дис- кретному исчислению
Матрицы 2x2 Несколько лет назад, когда я только начинал свою карьеру в Паи зсГепсе, в наш офис пришла консалтинговая фирма и начала чрезвычайно упрощенно описы- вать наш бизнес. Я тут же решил отмахнуться от этих описаний как от реклам- ной уловки. Однако сегодня я сам использую этот подход для общения и высту- плений, а также как полезный способ упрощения сложного бизнеса. Я считаю, что естественный путь развития в науке о данных — это пере- ход от чрезмерного усложнения к разумному упрощению. В слово «разумный» я здесь вкладываю тот же смысл, что и Эйнштейн в своей фразе: «Сделай на- столько просто, насколько это возможно, но не проще». Прелесть цитаты в том, что она показывает, как трудно этого достичь. В этой главе я расскажу об ис- пользовании инструмента, разработанного специально для упрощения слож- ного мира. Аргументы в пользу упрощения Вам может показаться ироничным, что я выступаю за упрощение в век больших данных, вычислительных мощностей и сложных алгоритмов прогнозирования. Эти инструменты позволяют вам ориентироваться в постоянно растущих объ- емах данных и таким образом, несомненно, повышают производительность да та-сайентистов, но на самом деле мир или бизнес они не упрощают. Давайте на секунду остановимся на этой последней мысли. Если больше дан- ных означают большую сложность, то сегодня дата-сайентисты определенно способны разобраться с этой возросшей сложностью. Однако тот факт, что вы можете проецировать многомерные данные на оценки более низкого уровня, не означает, что вы лучше понимаете, как все работает. Есть много вариантов упрощения, от эстетических до более функциональ- ных и прагматичных. Дата-сайентистам упрощение помогает понять и сформу- лировать то, что является наиболее важным при запуске проекта. Более того, это отличный инструмент для коммуникации. Как сказал Ричард Фейнман: «Если вы не можете объяснить что-то простыми словами, вы этого не понимаете».
С технической точки зрения для выбора простейшей модели, обладающей задан- ной предсказательной эффективностью, обычно используют «бритву Оккама». Что такое матрица 2x2? На рис. 4.1 показано, как выглядит типичная матрица. При ее наполнении вы играете активную роль в принятии решения о том, на каких функциях следует сосредоточиться в том или ином случае. Обратите внимание, как я упростил мир, сосредоточившись только на двух факторах или функциях, которые релевантны для текущей задачи. Факторы 1 и 2 изменяются по горизонтали и вертикали соответственно. Более того, я дискре- тизировал предположительно непрерывный мир, установив некоторые порого вые уровни, очерченные пунктирными вертикальными и горизонтальными ли ниями. Таким образом мы получили четыре квадранта: А Пользователи с высокими фактором 1 и 2 В Пользователи с низким фактором 1 и высоким фактором 2 С Пользователи с низкими факторами 1 и 2 О Пользователи с высоким фактором 1 и низким фактором 2 В зависимости от ситуации я могу поиграть с этими пороговыми значениями.
В экспериментальной матрице эти факторы обычно соответствуют раз,лич- ным воздействиям при проведении теста — например, изменению цвета и текс- та на баннере и ли цены и частот ы общения. В первом при мере рассматри вают ся дискретные факторы, а во втором — непрерывные признаки. Излишне говорить, что при использовании дискретных факторов теряется ощущение порядка, явно заданного на диаграмме. В идеале все остальные важные факторы должны оставаться постоянными. Благодаря этому более общему научному принципу вы можете вычленить вли- яние этих двух факторов на интересующую вас метрику. В главе 10 я вернусь к этой линии рассуждений, но пока обратите внимание, что такое исключение влияния играет важную роль при попытке упростить мир: изменяя по одному Фактору за раз, при неизменности всего остального, вы можете получить неко- торое представление о роли каждого фактора. В статистической матрице 2x2 такое исключение влияния гарантируется за счет использования надлежащей схемы рандомизации, которая предпола- гает, что все участники в группе лечения и контроля в среднем ех ап(е равны. Эта несколько загадочная фраза означает, что до проведения теста экспери- ментальная и контрольная группы в среднем не слишком сильно отличают- ся друг от друга. Эти матрицы хорошо известны специалистам-статистикам, а тема обыч- но рассматривается при изучении дисперсионного анализа (апа1у818 оГ уапапсе, АЕЮУА). Его цель — определить, существуют ли различия в средних значениях выходной метрики по группами. «Лечение» часто проводятся дискретно, но ма- трица позволяет проводить его непрерывно за счет удобной настройки порого- вых значений. Такой же подход можно использовать в неэкспериментальных сценариях На пример, консалтинговые фирмы сегментируют клиентскую базу с исполь зовани- ем только двух признаков, которые могут быть поведенческими или нет Я обыч но использую такой подход, когда могу' разложить метрику мультипликативным способом (например, декомпозицияр х д, рассмотренная в главе 2). Возьмем, к примеру, цену за единицу продукции и транзакционность. Ква дрант А представляет клиентов, которые готовы оплачивать высокую стоимость за единицу продукции и совершать много сделок (что дает высокую среднюю прибыль на одного пользователя/ Обратите внимание, что здесь я не мозу га- рантировать неизменность всех остальных факторов, как в эксперименталь- ных условиях. Тем не менее это по-прежнему позволяет мне сосредоточиться на двух — и только на двух — важных для меня признаках. Давайте разберем несколько примеров.
Пример: тестируем модель и новый признак Когда я хочу одновременно протестировать новую модель и эффективность ры- чага, я обычно использую матрицу 2x2. Тестирование рычат а обычно проводит- ся без этого фреймворка, просто с помощью двух рандомизированных групп: одна получает базовую версию (контроль), а другая — новый рычаг (лечение). Кот да эксперимент завершен, я провожу типичный набор статистических те- стов для определения различий в средних значениях. Матрица 2x2 дополняет эту идею, позволяя вам также протестировать производительность вашей модели. На рис. 4.2 показана матрица 2x2. На горизонтальной оси у меня показана оценка вероятности (в данном примере — полученная из классификационной модели). На вертикальной оси указано состояние тестируемого рычага: «вклю- чена означает, что некоторым пользователям отображается новая альтернатива, а «выключен» — что им показывается базовый рычаг. Рычаг Вкп. Выкл. В $ А $ Низкая Высокая Оценка вероятности ♦ Рисунок 4.2. Матрица 2x2 для тестирования модели и рычага Обратите внимание, как здесь работает мат рица 2x2- вы относите на диаграм- ме пользователей из эксперимента к группам А и В, а конт роль — к группам С и ГХ Вариации в обоих измерениях позволяют вам провести тестирование ры- чага и модели. Чтобы по-настоящему оценить преимущества матрицы, представьте, что вы хот ите провести кампанию перекрестных продаж. Для этого вы обучили класси- фикационную МЬ-модель, которая предсказывает, кто из клиентов примет пред- ложение, а кто нет. Если модель прогнозная, то оценки с высокой вероятностью должны иметь высокие доли истинно положительных результатов. Вы хотите протестироват ь новую коммуникационную кампанию, в которой особенно подчеркиваются преимущества покупки нового продукта («клиенты,
использующие новую функцию мониторинта сердечного ритма в своих умных часах, повышают эффективность бега на 15%»). Давайте также предположим, что базовая кампания сообщала только о наличии новой функции («наши новые умные часы оснащены самыми современными функциями мониторинга для бе- гунов»). Метрика успеха — коэффициент конверсии (сопуегмоп га1е, СК), изме- ряемый через количество покупок/пользователей в кампании. Необходимо протестировать следующие гипотезы. Монотонность Более высокие оценки вероятности имеют более высокие коэффициенты конверсии: СК(А) > СК(В) и СД(О) > СК(С). Эффективность Новый коммуникационный рычаг более эффективен, чем базовый: СК(В) = СК(С) и СК(А) > СК(Э) Причина, по которой я ожидаю, что СП(А) > СК(О), — некоторые пользова тели совершают покупку органично, им не нужно показывать новое сообще- ние. Если модель прогнозная (в смысле истинно положительных срабатываний), то показатели конверсии также должны увеличиваться вместе с оценками. Аналогично, я ожидаю, что СК(В) = СЯ(С), потому что, согласно модели, я тар гетирую пользователей с низкой вероятностью совершения покупки. Да, удач ные коммуникационные кампании могут привлечь некоторых из этих пользова телей со слабым намерением, но я не вижу причин ожидать, что влияние этого рычага будет статистически значимым. Чтобы подготовить эксперимент, вы должны учитывать статистический раз- мер и мощность, поскольку объем выборки и минимальные обнаруживаемые эффекты имеют решающее значение. Как правило, объема ваших выборок не- достаточно, поэтому придется просто смириться с хорошим дизайном рычага (как в классическом фреймворке А/ В тестов) и не самым лучшим дизайном для вашей модели. В этом случае вы можете судить о работе модели лишь косвенно. В большинстве случаев этого достаточно, но если вы готовы сделать смелый шаг и создать хороший дизайн для обоих факторов, то не останавливайтесь. После проведения эксперимента вы можете проверить эти гипотезы и получить неко- торые доказательства эффективности воздействия рычага и модели в реальных условиях.
Пример: анализируем поведение пользователя Я начал обсуждать статистические матрицы 2x2, потому что благодаря воз- можности рандомизации вы контролируете другие факторы, которые могут по- влиять на интересующую вас метрику. В других случаях для фреймворка 2x2, как правило, нет таких удачных условий. Тем не менее он может принести поль- зу, что, я надеюсь, доказывает этот пример. Нс гак давно я решил создать фреймворк 2x2, чтобы понять, подходит ли конкретный продукт рынку. Для этого я взял два фактора, которые были край- не важны для соответствия рынку, и сосредоточился на квадранте А, чтобы вы- делить пользователей с высокими показателями по обеим осям. Затем я постро ил классификационную модель МЬ. в которой пользователи из группы А были помечены единицей, а все остальные — нулем. Цель состояла в том, чтобы по- нять, кто эти пользователи В главе 13 я покажу, как это можно сделать на прак- тике без использования матрицы 2x2. В данном случае я использовал вовлеченность клиентов и цену за единицу продукции. Группа Л состоит из пользователей с высокой степенью вовлеченно- сти и готовых платить большие суммы. Вовлеченность — как правило, хороший показатель соответствия продукта рынку, поэтому ее сочетание с показателем дохода показывает мне так называемое выгодное соответствие (рго(11аЫе/Н). Позвольте мне привести еще один пример с такой же логикой. Напомним, что пожизненная ценность клиента (сивЮтег Шейте уа!ие, ЬТУ) — это текущая сто- имость пожизненных отношений пользователя с компанией: V г, х х. ЬТУ = ?(1+Д)' Здесь г— это выручка в момент времени 1,з( — вероятность выживания с мо- мента 1-1 до I, а с! — ставка дисконта. Иногда вместо выручки можно использо- вать метрику прибыли, которая также учитывает некоторые затраты, но во мно- гих компаниях, особенно начинающих, принято использовать метрику выручки для расчета отношения ЬТУ к затратам на привлечение клиентов (сиз1отег асцикШоп со$1$, САС)'. ЬТУ может быть выражена как (дисконтированное) скалярное произведение потоков выручки и вероятности выживания. Предположим, вы хотите понять, у какого типа пользователей высокий ЬТУ Кто они? Почему выделяются из об- щего числа? И самое главное, есть ли рычаги, позволяющие переместить неко- торых пользователей на верхний уровень ЬТУ? 7 Некоторые компании также приводят в отчетах «недисконтированный» ЬТУ, поэтому это выражение упрощается до слагаемых в числителе.
На рис. 4.3 показана уже знакомая матрица. На горизонтальной оси у меня есть показатель вероятности выживания, а на вертикальной оси — выручка. По скольку ЬТУ — эго скалярное произведение потоков в разные периоды времени, вам нужно найти способы привести эти показатели к одной размерности. Есть несколько способов сделать это, но у всех из них есть свои нюансы. Выручка В1 А ч ; Вкл. ? ' ч • % • ч • Ч ' ч ; "с!........"..........5; Ч ' ч ; Быкл. ; : ч 1 ч • Ч ' Ч ' Ь- —------------------------------------> Высокая Низкая Вероятность выживания Рисунок 4.3. ЬТУ в матрице 2x2 Опустив на время эти детали, вы можете провести такие же расчеты, как в предыдущем примере. 1. Пометьте пользователей в группе А единицами, а всех остальных — ну- лями и обучите классификационную модель, которая предсказывает при- надлежность пользователя к квадранту А. 2. Проанализируйте результаты и узнайте что-нибудь о пользователях, ко- торые с высокой вероятностью мотут оказаться в квадранте А (используя методы, представленные в главе 13). 3. Когда вы оцените всю базу пользователей, то с помощью выбранного по- рогового балла вы можете рассчитать потенциал продукта. Есть по крайней мере два способа приведения потоков данных во времени к двум измерениям. Агрегирование Самый простой способ — использовать агрегированную статистику, такую как средние (медианные) выручки и уровень выживаемости. Обратите впи мание, что актирование с помощью суммирования может поставить в невы годное положение более молодые группы с точки зрения выручки (например,
пользователь, совершающий транзакции в течение 20 месяцев, может дать в 20 раз больше дохода, чем новый пользователь). Выбор произвольного периода Если в прошлом вы обнаружили, что первые шесть месяцев имеют решаю- щее значение для выживания (или выручки), вы можете просто следовать этим выводам и использовать соответствующие значения на данный момент времени. Пример: оформление и одобрение кредита Несколько иной пример — случай корреляции результатов. Давайте рассмотрим кредитный продукт (например, кредитную карту). Эти продукты несколько про- блематичны из-за неблагоприятного отбора (на дорогостоящее кредитное пред- ложение с большей вероятностью согласятся более рискованные пользователи). На рис. 4.4 показан довольно типичный сценарий. Неблагоприятный отбор создает положительную корреляцию, поэтому пользователи, которые с большей вероятностью примут предложение о предоставлении кредита, также с большей вероятностью не возвратят его (А).
Матрица 2x2 упрошаст процесс принятия решений: на каких клиентов вам следует ориентироваться? Предложения в квадранте Б Эти клиенты с большей вероятностью примут кредит и погасят его. Это са- мая безопасная группа. Отрегулируйте пороговые значения, чтобы объемы получились больше Вы можете изменить пороговые значения для низкого или высокого риска неуплаты. Это поможет вам увеличить объем, если масштаб имеет первосте- пенное значение. Банки, выдающие кредит, обычно проводят такой тип кали- бровки с учетом своей склонности к риску. Матрица 2x2 позволяет вам сос- редоточиться на одном рычаге (пороге риска). Пример: расстановка приоритетов в рабочем процессе Последний пример, который постоянно приводят консультанты, должен помочь вам расставить приоритеты в проектах. Здесь используются два измерения: цен- ность проекта для компании и количество усилий, необходимых для его завер- шения. Идея в том, что вы должны ранжировать конкурирующие проекты по этим двум параметрам. На рис. 4.5 вы можете видеть, что проекты х и у имеют почти
одинаковую ценность, но х предпочтительнее, поскольку для е! о выполнения требуется значительно меньше усилий. Таким же образом мы ранжируем про- екты у иг: оба требуют сопоставимых усилий, но первый из них создает значи- тельно большую ценность. Итак, самая удачная область для большинства ваших проектов — верхний левый квадрант. Какой бы емкой ни была эта модель 2x2, у нее есть свои ограничения. Напри мер, как здесь можно сравнить проекты х и г? В главе 5 я расскажу еще об одном методе, который можно более обобщенно использовать для сравнения и ранжи рования любого набора проектов. Основные выводы Ниже представлены основные выводы из этой главы. Аргументы в пользу упрощения Несмотря на объем данных в вашем распоряжении, упрощать задачу край- не необходимо, если вы хотите лучше понимать этот сложный мир и бизнес. Кроме того, это помогает донести технические результаты до стейкхолдеров, а вам — сосредоточит ься на наиболее важных задачах. Матрицы 2x2 Эти инструменты превращают многомерные пространства в двумерные гра- фики, которые позволяют вам сосредоточиться на конкретных признаках или факторах, наиболее важных для решения поставленной задачи. Пример 1: тестирование модели и рычага Распространенный метод — статистическая матрица 2х 2. Один из примеров ее применения — ситуация, когда вы хотите одновременно протестировать эффективность рычага и предсказательную эффективность МЬ-модели. Вы составляете четкие гипотезы, которые могут пройти формальное статисти- ческое тестирование. Рандомизация гарантирует, что все остальное в сред- нем остается неизменным. Пример 2: анализируем ваших клиентов Выделив два конкретных признака, вы можете использовать матрицу в каче- стве отравной точки для более сложных подходов. В этой глазе описано, как можно использовать матрицу, чтобы выделить пользователей с высокой ЕТУ.
Пример 3: коррелированные признаки При наличии взаимосвязанных свойств матрица 2x2 позволяет упростить процесс принятия решений. Я использовал пример с предоставлением кре- дита, где принятие предложения зависит от вероятности неуплаты из-за не- благоприятного отбора. Дополнительная литература Б своей книге Апа1уНса18кН1$/огА1 ат! Иа1а Заепсе я рассказываю о том, что спо- собность упрощать — важный навык для дат а-сайентистов Этот вопрос я об суждаю там в более общих чертах, чем в этой главе, к тому же я не рассматри- ваю матрицу 2x2. Я также объясняю там метрику ЬТУ и разработку А/В-тестов. В книге «Законы простоты» (ТЬе Ьйи^з о/МтрНсНу) (М1Т Ртезз) Джон Маэда описывает точку зрения дизайнера о том, как достичь простоты. Возможно, это прозвучит странно, но я обнаружил, что несколько независимые точки зрения всегда углубляли мое понимание проблемы. Статисгические матрицы 2x2 можно найти в большинстве учебников по ста тистике, где рассматривается дисперсионный анализ. В книге «Статистиче- ские методы в А/В-тестировании: статистика для принятия бизнес решений на основе данных и управления рисками в электронной коммерции» (81аИзИса1 Ме(ко<!$ т ОпИпе А/В Те$Нп$: 81аН$Нсз/ог Па1а-1)теп Вимпсзз Иесиитз ат! Ягзк Мапа%етеп1 т Е-Соттегсе) автор Георгий Здравков Георгиев (опубликована са- мостоятельно) подробно обсуждает тестирование с несколькими вариантами и другие смежные темы. Тип неблагоприятного отбора в примере с предоставлением кредита описы- вается в любом учебнике по микроэкономике, посвященном информационной асимметрии. Если у вас нет экономического образования, технические тонкости могут оказаться излишними. Важно помнить, что пользователи самостоятельно выбирают информацию о себе, которая неизвестна лицам, принимающим реше- ния. И это создает множество проблем.
ГЛАВА 5 Создание бизнес-кейсов Умение писать бизнес-кейсы для модели или эксперимента — важнейший на- вык, который следует развивать дата-сайентистам. Владение им не только по- может вам быстро понять, стоит ли вкладывать в новый проект свое время и усилия, но и заручиться поддержкой стейкхолдеров. Более того, этот навык согласуется с принципом тотальной ответственности, который поможет вам выделиться. Бизнес-кейсы могут быть детальными и сложными, и во многих случаях по- лучается составить достаточно точные оценки. В этой главе я расскажу об осно- вах создания бизнес-кейсов Принципы создания бизнес-кейсов Все бизнес-кейсы отличаются друг от друга, однако для создания большинства из них применяются одни и те же базовые правила: вы анализируете и прини- маете какое-либо решение, рассчитываете затраты и выгоды от всех вариантов, учитываете только инкрементальные изменения и во многих случаях полагае- тесь на юнит-экономку. Решения Бизнес-кейсы чаще всего разрабатываются для оценки нового решения, будь то новая кампания, изменение рычага воздействия или что-то другое. Затраты, выгоды и безубыточность У большинства интересных решений есть плюсы и минусы. Важная отправ ная точка —перечисление основных затрат и выгод для принятого решения. Ядро бизнес-кейса — это чистая прибыль, это денежная разница между дохо- дами и затратами. Безубыточность — это синоним нулевой чистой прибыли, предельный случай или наихудший сценарий для вашего решения.
Инкрементальность Хороший бизнес-кейс должен учитывать только те затраты и выгоды, кото- рые вытекают из принятого решения. Например, ваша зарплата может рас- сматриваться как затраты, если вы получаете ее за проведение эксперимента. Но она не является инкрементальным расходом, если компания продолжает вам платить, пока вы занимаетесь чем-то другим. Следует учитывать только инкрементальные затраты и выгоды. Юнит-экономика В большинстве случаев важно только то, что происходит с вашим средним клиентом, поэтому вы можете просто сосредоточиться на инкременталь ных затратах и выгодах для этой выделенной единицы. Бизнес-кейс зависит от тою, будет ли чистая прибыль положительной после расчетов для данного клиента. Обычно масштабирование на всю клиентскую базу влияет как на за- траты, так и на выгоды в одинаковой пропорции, оставляя знак совокупной чистой прибыли неизменным, Пример: проактивная стратегия удержания Давайте оценим, следует ли компании внедрять проактивную стратегию удер жания. Затраты пойдут на то. чтобы дать клиенту стимул остаться. Для этого есть много способов, и большинство из них можно легко представить в денеж- ном выражении — с. Что касается выгод, то клиент, оставшийся на один допол нительный месяц, приносит среднюю выручку на одного пользователя г, кото- рая без удержания могла быть потеряна. Предположим, вы нацелены на клиентскую базу размером В. Из них часть А получает стимул. Кроме того, из целевой группы только ГР действительно хо тели уйти (истинные положительные, 1гие розйгхе). Условие безубыточности до- стигается за счет выравнивания затрат и выгод: Вх — хс = Вх — х г В В Здесь вы можете увидеть в действии один из приемов, описанный в гла- ве 2. Обратите внимание, что в этом случае вы можете сосредоточиться только на среднем клиенте: Ахс-^хг в в Имеет смысл проводить кампанию, если чистая прибыль неотрицательна: — х г - — х с > О В В
Первая дробная часть — эго просто дояя истинно положительных ре.зульта тов среди клиентов в базе кампании или в выборке; вторая дробная часть — это доля клиентов, принявших стимул. Кроме того, эти же данные удобно рассма- тривать как выборочные оценки потенциальных выгод и издержек. Это прев ращаег вашу задачу в классическую проблему выбора в условиях неопределен ности: перед запуском кампании вы не можете точно сказать, кто откликнется на стимул и кто уйдет, если ничего не предложить. Теперь вы можете подключить некоторые цифры, чтобы смоделировать биз- нес-кейс в разных сценариях. Кроме того, вы также можете проанализировать имеющиеся в вашем распоряжении рычаги. Здесь есть три рычага для того, что- бы бизнес-кейс работал. Повысить долю истинно положительных результатов Вы можете усовершенствовать бизнес-кейс, делая более точные прогнозы с помощью своей модели машинного обучения в отношении истинно поло- жительных результатов. Контролировать расходы Вы можете снизить стоимость стимула (с). Иногда можно с уверенностью предположить, что вместе с таким снижением повышается и уровень приня тия стимула, так что оба показателя меняются в одном направлении. Нацеливаться только на клиентов с высоким АКРИ Интуитивно понятно, что стимулы нужно ориентировать в первую очередь на наиболее прибыльных клиентов. В неравенстве это соответствует более высокому г. Обратите внимание, как проявляется инкрементальность: вы должны вклю чать в выгоды только сэкономленный АКРИ от тех клиентов, которые действи- тельно собирались уйти (истинно положительные результаты). Те, кто соби- рался остаться даже без стимула, увеличивают затраты, если принимают его, но не дают дополнительной выгоды. А как насчет ложноотрицательных срабатываний? Помните, что это клиенты, на которых вы не нацеливались, и они не ушли. Вы можете учесть упущенную выручку как затраты, чтобы найти оптимальное соотношение точности и пол- ноты в вашей МЬ-модели.
Предотвращение мошенничества Банки часто устанавливают лимиты на транзакции для предот вращения мошен- ничества (и борьбы с отмыванием денег). Давайте создадим бизнес-кейс для ре- шения задачи по блокировке транзакции при превышении установленного ли мит а Есть две категории заграт: издержки, связанные с мошенничеством (с^), и упу- щенная выручка в случае оттока клиентов (с .). Для простоты я предположу, что клиент с заблокированной транзакцией наверняка откажется от сцепки, хотя на практике это может так не работать. Что касается выручки, го если транзак- ция разрешается, компания получает сумму по сделке (г). Как только поступает запрос на транзакцию, вы можете либо принять его, либо заблокировать. Он может быть законным или нет, независимо от вашего действия. В таблице 5.1 показаны затраты и выгоды для всех четырех комбина- ций действий и результатов. Табпииа 5.1. Затраты и выгоды от предотвращения мошенничества Действие Результат Выгоды Затраты Принятие запроса Мошеннический ( 9 Принятие запроса Законный ( 0 Блокировка запроса Мошеннический 0 0 Блокировка запроса Законный 0 Сь Обозначим через р вероятность того, что данная транзакция является мо- шеннической. Рассчитывая ожидаемую чистую прибыль от каждого возможно- го действия, вы получаете: Е (чистая прибыль|принятие) = р(1 -с{) + (1 -р)1 = I -рс, Е (чистая прибыль|блокировка) = -(] - р)сл Отказ в транзакции с выручкой I оптимально, когда чистая прибыль от бло- кировки превышает таковую от принятия транзакции: Е (чистая прибыль|блокировка) - Е (чистая прибыль|принятие) = = рс/.-(1 + (1 -р)сск)>0 Суть бизнес-кейса — это последнее неравенство. Что касается выгоды, то если транзакция является мошеннической, то при ее блокировке вы экономите, избе- жав потерь от мошенничества (ср. Что касается затрат, то, блокируя транзакцию,
вы фактически пренебрегаете выручкой I и принимаете на себя затраты из-за от- тока клиентов (с ) при условии, что транзакция не мошенническая. Как и прежде, давайте обратим внимание на рычаги. Помимо блокировки или принятия, вы всегда можете применить лимит (I): он позволит блокиро- вать более высокие суммы, а все остальные — принимать. Но как найти лимит в этом неравенстве? Вероятность мошенничества — обычно функция этого лимита:р(1\Ь). Во мно- гих случаях эта функция обычно возрастает с ростом лимита: это происходит, когда мошенники ориентированы на краткосрочную, быструю и относительно крупную прибыль. Установив достаточно большой лимит, вы сможете сосредо- точиться на транзакциях с высокой вероятностью. Цена мошенничества обыч- но равна сумме сделки, гак что это также напрямую влияет на выгоды. Однако есть компромисс: если транзакция не мошенническая, вы рискуете оттоком цен- ных клиентов. Приобретение внешних наборов данных Эта логика применима к любому решению, которое вы хотите проанализиро- вать. Сейчас я вкратце расскажу о приобретении внешнего набора данных — решении, которое в определенный момент выбирает большинство дата-команд. Затраты — это цена, назначенная вашим поставщиком данных. Выгоды — дополнительная выручка, которую ваша компания может получить с помо- щью этих данных. В некоторых случаях это несложно, поскольку данные сами по себе повышают эффективность процесса принятия решений. Я имею в виду, например, идентификацию клиентов через КУС (англ. кпо\у уонг сизютет — «знай своего клиента». — Прим, пер.) или управление учетными данными. В та- ких вариантах вы можете сопоставить данные с выручкой практически один к одному. В большинстве других случаев, интересных с точки зрения науки о данных, инкрементальная выручка зависит от ключевых предположений. Например, если у вас уже есть рабочая МЬ-модель для принятия решений, вы можете ко личественно оценить минимальную дополнительную производительность, ко торая сделает бизнес-кейс положительным с учетом этих затрат. Кроме того, вы можете договориться о более выгодных условиях, отталкиваясь от этой допол- нительной производительности. Эту идею можно резюмировать примерно гак: КР1 (расширенный набор данных) - КР1 (исходный набор данных) > с
КР1 — это функция от показателя производительности вашей МЬ-модели. Я подчеркиваю, что это функция: вы должны уметь преобразовать показатель производительности в денежное значение, например в выручку, чтобы сравни- вать его с затратами. Обратите внимание, чго, используя исходный набор дан- ных в качестве эталона, вы учитываете только инкрементальные эффекты. Работа над проектом по бага $аепсе Как обсуждалось в главе 1, дата сайентистам стоит участвовать в проектах, ко- торые приносят компании дополнительный доход. Предположим, у вас есть два альтернативных проекта — А и В. С какого из них начать7 Используя ту же ло- гику, вы должны выбрать проект А, если: выручка(А) - затраты(З) > выручка(В) - затраты(В) Чтобы принять решение, вам нужно ввести некоторые цифры, расчет кото- рых сам по себе — отдельная задача. Здесь важны выводы, которые вы сделае- те из этого неравенства: отдавайте приоритет тем проектам, которые приносят существенный дополнительный чистый доход с учетом ваших затрат на реали- зацию. В главе 4 я показал, как простая матрица 2x2 помогает расставить приорит е- ты в рабочем процессе путем ранжирования каждого проекта по осям ценности и усилий. Как бы ни была удобна эта схема, в конечном итоге у вас мотут возник- нуть проблемы с ранжированием проектов, которые выигрывают в одном из- мерении и проигрывают в другом (например, проекты х и г на рис. 4.5). Преды дущее неравенство решает эту проблему, используя общую шкалу (деньги) для оценки усилий (затрат) и выручки. Основные выводы Ниже представлены основные выводы из этой главы. Релевантность Учиться писать бизнес-кейсы важно для эффективного взаимодействия со стейкхолдерами и проявления тотальной ответственности, а также для распределения между альтернативными проектами ресурсов, связанных с обработкой данных.
Принципы составления бизнес-кейса Как правило, вам необходимо знать затраты и выгоды, а также точку безубы- точности. Сосредоточьтесь только на инкрементальных изменениях. Во мно тих случаях вам нужно уделить внимание только юнит-экономике, влияющей на вашего среднего клиента. Дополнительная литература В своей книге Апа1уИса18кШ$ /ог А1 апб Эа(а Заепсе (0’К.еШу) я описываю методы, которые помогут вам упростить бизнес-кейс и сосредоточиться только на пер- вичных эффектах. Эго также поможет вам понять процесс принятия решений в условиях неопределенности. Такой анализ затрат и выгод — стандартный в экономическом анализе. То, что я назвал здесь инкрементальностъю, широко известно как маржинальный ана- лиз. Неэкономистам я бы порекомендовал три книги: «Экономист на диване. Экономическая наука и повседневная жизнь» (Иге Агтскат ЕсопотгзГ. Есопогтсз апб Еуегубау Ы/е) Стивена Э. Ландсбурга (Ргее Ргезз); «Экономика пончика: семь способов мыслить как экономист XXI века» (Оои^кпи! Есопогтсз: Зегеи ХУауз 1о Шпк Ике а 21$1-Сеп1игу ЕсопогтзГ) Кейт Раворг (СЬекеа Сгееп РпЬИзИт^); «Голая экономика. Разоблачение унылой науки» (Хакеб Есопописз: Епбгеззтд 1ке Э1зта1 8с1епсе) Чарльза Уилана (УУ.УС Ыог1оп).
Что показывает прирост? Есть очень простые методы, которые помогут вам выполнить множество раз- личных задач. Прирост (Нр) — один из таких инструментов. К сожалению, мно гие дата-сайентисты не понимают, что такое приросты, или не видят их полез- ности. Эта короткая глава поможет вам освоить их. Расчет прироста Говоря в общем, прирост (Пр) — это отношение между агрегированными метри ками для двух групп. Наиболее распространенный метод агрегирования — по- лучение средних значений, поскольку это очевидные оценки выборки для ожи даемых значений. В этой главе вы познакомитесь с несколькими примерами. ЫЩметрика, А, В', = Совокупная метрика для группы А Совокупная метрика для группы В В более классической литературе по анализу данных агрегирование представ ляет собой частоту и ли вероя тность, а группа А — это сегмен т группы В, обычно исследуемая популяция. Цель здесь — измерить эффективность алгоритма от бора (например, кластеризации или классификатора) по отношению к средне- му показателю по популяции. Рассмотрим прирост для вероятности, что женщины занимают посты гене ральных директоров в США. Согласно исходному принципу случайного отбо- ра, примерно 50% генеральных директоров должны быть женщинами. В одном исследовании говорится о 32%. Прирост для действующего механизма отбора на рынке труда составляет 0,32/0,5 = 0,64. Таким образом, женщины реже зани мают эти посты по сравнению с их исходной частотой в популяции. Прирост измеряет, насколько увеличивается или уменьшается совокупный показатель в одной группе по сравнению с исходным уровнем. Соотношение больше или меньше единицы называется положительным приростом (ирПр) или отрицательным (ронтПр) соответственно. Если изменений нет, соотноше- ние равно единице.
Пример: модель классификации Предположим, вы обучаете классификатор прогнозировать отток клиентов. У вас есть набор данных, в котором пользователи, которые попали в отток, по- мечены единицей, а те, кто все еще активен, — нулем. Исходный уровень оттока рассчитывается на основе выборочного среднего значения результата. Одна из распространенных метрик производительности — доля истинно по- ложительных срабатываний по оценке децилей в тестовой выборке, что в дан- ном примере соответствует уровню оттока по децилям. Чтобы вычислить его, вам просто нужно отсортировать пользователей по баллам и разделить тесто- вую выборку на 10 сегментов, или децилей, одинакового размера. Для каждого сегмента рассчитайте уровень оттока. Эта метрика полезна тем, что она дает вам информацию по крайней мере по трем важным аспектам. Прирост Разделив уровень оггока в дециле на этот же показатель в тестовой выборке, вы вычислите соответствующий прирост. Это оценка того, насколько хоро- шо модель выявляет отток клиентов в каждом дециле относительно уровня отгока в компании. Монотонность Является ли оценка информативной? Если оценка вероятности информатив- на относительно истинно положительных срабатываний, то более высоким баллам должен соответствовать более высокий уровень оттока. Верхний дециль производительности Во мно! их случаях вы нацеливаетесь на пользователей из самого верхнего де- циля. В этом примере вам нужно дать стимул для удержания только тем кли- ентам, которые вероятнее всего собираются уйти. Истинно положительный уровень для этого дециля — это ваша первая оценка ожиданий от кампании по удержанию клиентов. На рис. 6.1 для смоделированного примера показаны доля истинно поло- жительных результатов (1гие розШуе га1е, ТРИ) и прирост. Классификатор вы- являет в верхнем дециле клиентов, которые собираются уйти, с показателем, в 2,7 раза превышающим средний. Эго полезный вывод, который заинтересу- ет стейкхолдера в результатах вашей модели. Вы также можете сравнить этот прирост с тем, который был подушен с помощью их текущего механизма отбора.
ТРР и прирост по оценке децилей Свободный выбор и смещение по выживаемости Свободный выбор (8е1/-5е1ес11оп) возникает, когда человек сам решает вступить в группу. Примерами могут быть группы с официальной (например, политиче- ская партия или команда) или неофициальной регистрацией (например, поку- патели вашего продукта, пользователи функции и т. д.) Важно то, что есть некая внутренняя характеристика, которая побуждает человека стать членом группы. Смещение по выживаемости противоположно по смыслу свободному выбо- ру: по неким своим характеристикам в вашу выборку попадают («выживают») только некоторые пользователи. Классический пример — история с истребите- лями времен Второй мировой войны, проанализированная статистиком Абра- хамом Уолдом. Она учит нас тому, что вы можете прийти к неверным выводам из-за предвзятого характера процесса отбора проб. В главе 15 обсуждается наличие предвзятости при свободном выборе в рабо- те дата сайентистов. Пока будет достаточно показать, как показатель прироста помогает вам быст ро выявить эту ошибку. В таблице 6.1 вы увидите, как это обычно делается. В строках указаны не которые признаки или характеристики, которые, по вашему мнению, важны
для понимания текущей проблемы; столбцы указывают на статус пользовате- ля, а также на прирост. Здесь я включаю только четыре переменные для клиента: — ежемесячные траты на продукт компании; — оценка удовлетворенности; — ежемесячный доход; — срок пользования. Таблица 6.}. Прирост в примере с оттоком Активные Отток Прирост Ежемесячные трать. 29,9 32,7 1,1 Оценка удовлетворенности 10,00 10,08 1,01 клиентов Доход (К) 46,52 54,80 1,18 Срок пользования (месяцы) 9,84 8,14 0,83 Как правило, чем больше у вас признаков, тем лучше на основании приро- ста вы понимаете механизм выбора. Почему бы не указать географические, от раслевые сегменты или количество продуктов, которые клиент уже приобрел у компании? В каждой ячейке таблицы показано среднее значение соответствующего признака для активных и ушедших пользователей, а также прирост. Например, средние граты активных и ушедших пользователей составляют $29,9 и $32,7 соответственно. Глядя на колонку прироста, мы можем легко заметить законо- мерность: ушедшие клиенты дают более высокий доход (прирост 1,18, или рост 18%), тратят больше (1,1) и являются клиентами в течение более короткого времени (0,83). Показатели удовлетворенности клиентов не существенны (не- значительный подъем). Один из возможных выводов — относительно состоя тельные потребители предъявляют более высокие требования к продуктам; по- видимому, это продукт для сегмента с более низким социально-экономическим статусом. Вы поняли идею, самый простой и понятный подход к пониманию механиз- ма выбора — создать таблицу с показателем прироста. Если признаки выбраны правильно, вы можете сразу же получить представление о том, что происходит с изучаемой группой.
Другие варианты использования прироста Этот метод очень прост в использовании: определите метрику и группы, затем вычислите соотношение. Механизм отбора может быть любым. Например, вы можете использовать матрицы 2x2, о которых мы говорили в главе 4, и сосредоточиться на одном из квадрантов. Показатели прироста очень просты для анализа и могут помочь вам понять, что движет пользователями из этой группы. Другой распространенный пример использования — анализ свободного вы бора в маркетинговых кампаниях. При отсутствии смещения выборки вы мо- жете измерить эффективность кампании с помощью контрольной группы. Бла- годаря показателю прироста становится понятно, стоит ли вам продолжать это направление или нет. Аналогичным образом, многие опросы в конечном итоге дают предвзятые результаты из-за разной доли ответивших в группах. В прошлом я автоматизи- ровал проверку репрезентативности опросов удовлетворенности клиентов с по- мощью прироста. Основные выводы Ниже представлены основные выводы из этой главы. Что такое прирост Прирост (ЙД) — это отношение совокупных метрик двух групп. Наиболее распространенный метод агрегирования — получение средних значений. Прирост при машинном обучении Вы можете рассчитать прирост с помощью моделей-классификаторов, про- демонстрировав прогнозирующую эффективность модели по отношению к общей выборке. Я представил пример прогнозирования оттока и рассчи- тал прирост для истинно положительных срабатываний ио всем опенкам де- цилей. Свободный выбор В целом мы можем использовать показатель прироста для анализа свободно- го выбора или смещения по выживаемости в вашей выборке. Рассчитав при- рост метрики у тех пользователей, которые самостоятельно выбрали группу, вы сможете легко вычислить влияющие на это факторы.
Дополнительная литература Информацию о приростах вы найдете во многих классических книгах по ин теллектуальному анализу данных. Например, в книге «Интеллектуальный ана- лиз данных: практические инструменты и методы машинного обучения» (1)йГй М1тп$ РгасНса!МасЫпе Ьеагтпд Тоо1$ апЛ Тес^т^^ие$) Яна Виттена и др. (Мог§ап КаиГтапп). Больше упоминаний можно найти в научных статьях и блогосфере. Напри- мер, в статьях «Анализ прироста — секретное оружие дата-сайентиста» (Ы/1 Апа1ум$ — А Иаш 8аепО$Г$ 8есге1 Убеароп) Энди Голдшмидта на сайте КОпп§§еИ8 и «Кривая КОС, диаграмма прироста и калибровочный график» (КОС Сипе, 1лЙ СНагГ апб СаНЬгаНоп Р1оГ) Михи Вука и Томаза Курка (Ме1обо1озк1 Хуегка, 3, № 1, 2006 89-108). Ьйр5://^туа<.к<1пи88еи.сот/2016/03/НЙ-апа1уы5-<1аГа-8С1еп11й-«есге{-5Уеароп.Ь1т1
Нарративы Вы потратили несколько недель на свой проект и теперь готовы представить ре- зультаты. Вам кажется, что почти все готово. Многие дата-сайентисты думаю именно так и практически не прилагают уси- лий для составления убедительного нарратива. Как описано в главе 1, для полно- ценного владения проектом крайне важно убедить стейкхолдеров предпринять какие-либо действия на основании ваших результатов. Такой тип тотальной от- ветственности за проект имеет решающее значение для создания ценности; сле- довательно, вы должны овладет ь искусством сторителлинга. Есть множество ресурсов для овладения искусством сторителлинга (я при веду некоторые из них в конце главы). В этой главе я затрат иваю эту тему, а также немного описываю некоторые навыки, необходимые в контексте пау- ки о данных. Нарративы: рассказать историю, используя свои данные Согласно словарю, нарратив — это просто последовательность связанных со бытий. Эги связи создают историю. Я дополню это определение, сказав, что нар ратив также должен помогать достигать какую либо цель. Какую цель вы ставите перед собой? В обычных нарративах это обычно убе- ждение или вовлечение, что также верно для науки о данных (баГа «степсе). Од- нако здесь для вас важнее создавать ценность, а для этого нужно побуждать к действиям. Успешная история должна помочь вам достичь этой цели. Давайте проведем реверс-инжиниринг проблемы и определим условия, ко- торые помогут нам достичь этого: — ясность и уместность; — достоверность; — запоминаемость; — практическая применимость.
Ясность и уместность Ясность — понятие относительное, оно меняется в зависимости от контекста и во многом зависит от вашей аудитории. Технические детали вашей реализа ции машинного обучения (МЬ) могут быть абсолютно понятны вашей коман де дата-сайентистов, но загадочны для стейкхолдеров бизнеса. Поэтому первый важный шаг к созданию ясного нарратива — определить вашу аудиторию. Вы- бор правильного языка и гона для нужной аудитории имеет решающее значение. Наука о данных — по своей сути технический предмет. И очень часто дата- сайентисты испытывают искушение включить в свои презентации причудливый технический жаргон (а еще лучше, если к ним будут прилагаться какие-нибудь уравнения). А вот рассказывать историю — это не про них. Для таких случаев есть хороший совет: если вы хотите привести технические материалы, го лучше их включить в раздел приложений Довольно распространено ошибочное мнение о том, что технический язык поможет вам завоевать доверие (подробнее об этом позже). Иногда оно выража ется в попытке доказать, что набор инструментов для работы с данными необ- ходим организации. Мой совет — сбалансируйте эго желание с преимущества- ми получения эффективной коммуникации, которая поможет вам достичь цели. А это возможно именно через создание сильных нарративов. В обычном процессе работы с данными вполне нормально выполнять множе- ство тестов и создавать множество визуализаций. В попытке обосновать объем проделанной работы некоторые люди испытывают искушение включить в пре- зентацию все, что только можно, а это перегружает и отвлекает аудиторию. Сос- редоточьтесь только на ключевых идеях и приведите результаты, которые их подкрепляют Все остальное должно быть отброшено. Если какие-то факты на- прямую не подкрепляют ваше выступление, но все же могут оказаться полез- ным, укажите их в приложении. Но постарайтесь не загромождать его: этот раз- дел также служит цели вашей презентации (а если нет, отбросьте его). Достижение нужной степени простоты требует много практики и усилий, эго навык. Хороший совет — записать ключевые, по вашему мнению, идеи, а затем исключить из презентации все остальное. Повторяйте это до тех пор, пока не до- бьетесь результата, и остановитесь, когда вы отбросите так много, что смысл выступления станет непонятным. Этот совет также применим к предложениям и абзацам. По возможности ис пользуйте короткие предложения менее 10 слов. Длинные предложения и абза- цы визуально утомляют, поэтому их могут просто не прочитать. После подго- товки первого черновика я прорабатываю каждое предложение и абзац и делаю их как можно более короткими и четкими.
Ясность должна присутствовать независимо от средства связи. Часто вы го- товитесь к живому выступлению и упускаете из виду, что часть слушателей — возможно, топ-менеджеры — ознакомятся с презентацией позже. Поэтому пре- зентация должна быть понятной и не требовать объяснений Это относится не только к тексту, но и к визуализации данных. Убедитесь, что вы обозначили все важные оси и написали осмысленные заголовки. Если вы хо- тите что-то подчеркнуть па схеме, используйте визуальные средства, такие как выделение, текст или рамки, которые привлекут внимание вашей аудитории. Визуализация данных — неотъемлемая часть презентации в науке о данных. Эти принципы применимы к любым вашим иллюстрациям. В главе 8 я расска- жу о некоторых полезных методах визуализации данных. Как добиться ясности Вот несколько важных советов о том, как добиться ясности. Аудитория Сначала определите свою аудиторию и убедитесь, что язык и тон бу- дут ей соответствовать. Технический жаргон Боритесь с искушением использовать технический жаргон. Всегда по- мещайте технические материалы в приложении. Сосредоточьтесь на ключевых идеях Ключевые идеи должны быть ясно сформулированы с самого начала, а нарратив уже строится вокруг них. Все остальное следует отбросить. Убирайте отвлекающие факторы Напишите первый черновик, а затем вычеркните все ненужное. Этот совет также относится к предложениям и абзацам. История, не требующая объяснений Нарратив всегда должен быть понятными без дополнительных разъяс- нений, независимо от формы презентации. Визуализация данных Применяйте все вышеперечисленные советы к визуализациям данных.
Достоверность В деловой среде убедительные нарративы должны быт ь надежными и достовер- ными. К сожалению, это очень трудноуловимое качество: чтобы его наработать, требуется много времени, а потерять его можно за мгновение. Поэтому для пре- зентации данных вам нужно учесть три измерения: — достоверность данных; — техническая достоверность; — достоверность с позиции бизнеса. Качество данных лежит в основе первого измерения, и вы должны взять за правило запускать проверки как в источнике, так и в ходе цикла разработки. Дата-сайентисты пишут много кода, что чревато ошибками. Худшее происходит, котда ваш код все-таки запускается и вы получаете неверные результаты (логи- ческие ошибки). По моему опыту, такое случается часто. Лучшие программи- сты уже сделали тестирование неотъемлемой частью своего повседневного ра бочего процесса. Более того, данные невозможно использовать вне кон текста, поэтому ваши результаты должны иметь смысл с точки зрения бизнеса. Я видел, как многие дата-сайентисты теряли доверие к себе, потому что не проверяли, несут ли их результаты какой то смысл. Как минимум вы должны знать порядок величи- ны ключевых метрик, с которыми работаете. В идеале вы должны знать ме- трики наизусть. Не забывайте всегда проверять результаты, прежде чем пред- ставлять их. С технической достоверностью стейкхолдеры обычно просто соглашаются. Однако высокое начальство несет огромную ответственность. Поэтому дата- сайентистам необходимо научиться использовать правильный инструмент для решения каждой задачи и овладеть соответствующими техниками. Кроме того, всегда полезно провести несколько внутренних встреч, где ваши коллеги могут поспорить с вашей точкой зрения. Как было описано в главе 1, крайне важно продемонстрировать аудитории свои бизнес-компетенции. Техническая сторона вашего выступления может быть безупречной, но если какая-то часть в ней будет бессмысленной с точки зрения бизнеса, вы потеряете доверие со стороны стейкхолдеров Я ьидел, как дата сайентисты начинали с ошибочных предположений о том, как работает продукт или бизнес. Еще одна распространенная ошибка — делать невероятные предположения о поведении клиентов: всегда спрашивайте себя, поступили бы вы так, если бы были клиентом.
Рекомендации о том, как добиться достоверности Ниже я привел несколько рекомендаций о том, как добиться достовер- ности. Достоверность данных Проверьте, имеют ваши результаты смысл с точки зрения бизнеса. Техническая достоверность По возможности обсуждайте технические результаты с опытными кол- легами. Достоверность с позиции бизнеса Поставьте себе цель разбираться в бизнесе так же хорошо, как и ваши стейкхолдеры. Запоминаемость В обычные нарративы для запоминаемости часто включают некую форму борь- бы или интриги, что делает последовательность событий менее линейной. Я на своем горьком опыте убедился, что это не лучшая стратегия для презента ции по работе с данными. В науке о данных запоминаемость чаще всего создается через получение ин- сайтов. Они обычно возникают, когда вы показываете неожиданный результат, создающий ценность Эга последняя часть важна: в деловой среде интеллекту- альные курьезы запоминаются лишь на короткое время. Самые лучшие момен- ты озарений — эю те, которые побуждают к действиям. Многие авторы предлагают создавать незабываемые нарративы, используя точную комбинацию данных и эмоций. И действительно, есть доказательст- ва того, что человеческий мозг запоминает волнующие ваше сердце вещи луч- ше, чем голые научные факты. Я согласен с этим общим замечанием, но, на мой взгляд, не стоит стремиться к повествованиям и подаче информации в стиле ТЕЮ, Вам лучше не усложнять задачу и находить полезные инсайты, которые по- чти всегда запоминаются сами по себе. Добиться запоминаемости лучше всего помогут «Ага!»-пере- живания — полезные и несколько неожиданные инсайты.
Практическая применимость Если вы уже прочитали предыдущие главы, то вас не должно удивлять мое мне- ние о том, что это свойство должно быть Полярной звездой и главным героем вашей истории. Прежде чем приступить к нарративу, убедитесь, что в вашем проекте есть идеи, осуществимые на практике. Если нет, вернитесь к черновикам. Я видел та- кие презентации, где аудитории показывали чго-то интересное, но они все рав- но оставались в недоумении с вопросом в голове «И что дальше!». Определите рычаги влияния, вытекающие из вашего анализа. Презентация без практически применимых инсайтов не мо- жет быть эффективной с точки зрения создания ценности. Создание нарратива В предыдущем разделе мы говорили о характеристиках успешного нарратива. Кроме того, я привел несколько рекомендаций, которые помогут вам на практи- ке. Теперь я расскажу о процессе создания нарративов Сторителлинг в науке Многие дата-сайентисты думают, что сторителлинг не имеет отношения к их технической области знаний и применяется только на стадии выпуска продукта. Я же считаю, что дата-сайентисты должны также играть роль ученых и сделать это неотъемлемой частью своего всестороннего рабочего процесса. Учитывая это, позвольте мне предложить два альтернативных способа со- здания нарратива. — Сначала выполните техническую работу, а затем создайте нарратив. — Начните с первоначального нарратива, развивайте его итеративно, а когда будете готовы, отточите повествование для выступления. Первый процесс наиболее распространен в науке о данных- специалисты- практики сначала выполняют сложную техническую работу, а затем формула руют нарратив под свои результаты. Зачастую результат становится просто набором неких находок — возможно, интересных, но не складывающихся в це лостную картину.
В отличие от этого, второй процесс превращает сторителлинг в неотъемле- мую часть рабочего процесса дата-сайентиста (рис. 7.1). В этом случае вы начи- наете с бизнес-вопроса, глубоко погружаетесь в него, придумываете несколько объяснений или гипотез, проверяете их с помощью данных и после нескольких итераций предоставляете результаты. В ходе такого процесса вам может пона- добиться вернуться назад и переосмыслить бизнес-вопрос. Рисунок 7.1. Итеративный процесс создания нарратива К сторителлинг)' вы обращаетесь в начале (этап 2); в середине, когда вы до- рабатываете свои гипотезы (этап 3); и в конце (этап 4). Эти нарративы уже от- личаются друг от друга, но они связаны. Вы и ваша потребность разобраться в вопросе — это аудитория для перво начального нарратива; стейкхолдеры вашего бизнеса — аудитория для оконча- тельного. Как я уже упоминал, язык и интонация здесь должны быть разными Но важно то, что ключевые идеи в финале напрямую вытекают из первоначаль- ных, отточенных в ходе итеративного процесса в середине. Вы должны начать проект с исходного набора ключевых идей, которые, по вашему мнению, дойдут до финала. Возможно, они будут не совсем верны- ми, но чаще всего — если у вас достаточно опыта в бизнесе — не такими уж да- лекими от окончательных. При таком подходе создание нарратива для вашей презентации начинается еще до того, как вы доберетесь до данных. Так вам будет легче ориентироваться во время работы с данными и итерациями. Бла- годаря этому промежуточному этапу вы можете выявлять ошибки (в данных, логике, кодировании или даже в вашем понимании бизнеса); обычно имен- но здесь переживаются моменты озарений. Для нарратива на этапе презента- ции у вас сменяется аудитория, и теперь вы рассказываете об окончательных и уточненных идеях.
«Что», «что дальше» и «что делать сейчас»? При приближении к стации выступления вам нужно будет придать своему по- вествованию определенную структуру. Некоторым людям нравится следовать стандартной структуре сторител линта, также известной как сюжетная арка, ко- торая состоит из трех этапов, завязки, развития и развязки Для некоторых ситуаций это работает, однако я предпочитаю использовать последовательность «что, что дальше и что делать сейчас?»: она лучше подкреп- ляет вашу главную цель — привести к действиям. Эта цепочка тесно связана с процессом, описанным в главе 1. Что? Эт а часть посвящена описанию бизнес-проблемы и ее важности для компании в данный момент времени. Б нее также необходимо включить некоторые цифры о текущей ситуации, например, о недавней эволюции основных ключевых КР1 и оценке потенциала возможностей. Представьте, что вы пытаетесь количественно оценить влияние акции со скидками. Здесь следует дать общий контекст: например, как часто менялись цены в последнее время, в каком диапазоне и какое это оказало влияние на про дажи, удержание клиентов и выручку в целом. Если есть какие-то доказательст- ва, пусть даже случайные, вы также можете подчеркнуть их стратегическую важ- ность в нынешней конкурентной среде. Чю дальше? Самое главное в этой части — сосредоточиться на практическом применении. Здесь нужно прописать основные результаты, в том числе те, которые приносят ваши инсайты. Инсайты бывают двух типов: — неожиданные результаты; — в целом ожидаемые результаты (с точки зрения направления развития), но с неожиданным нюансом, который проявился благодаря количествен ной оценке или анализу практической реализации. Я предпочитаю второй тип, потому что вам нужно ориентироваться на дей- ствия. Если у вас есть неожиданные результаты и план действий, вы справились с задачей. Возвращаясь к примеру с ценой, отметим, что снижение пен обычно способ ствует росту продаж. Это ожидаемое поведение, поэтому демонстрация такой
отрицательной корреляции ни у кого не вызовет инсайта, а у аудитории может возникнуть ощущение, что вы изобретаете велосипед. Однако если вы скажете, что пользователи относительно невосприимчивы к ценам от 5,30 долларов и выше, и что снижение этой пены на один доллар уве- личивает продажи на 1000 единиц, то вы привлечете их внимание. Идеи схожи, но во второй есть неожиданный момент, который возникает при количествен ной оценке событий. Более того, это призыв к действию, который должен стать центральным элементом последней части. Что делать сейчас? Этот раздел посвящен будущим шагам. Что должны предпринять другие со- трудники компании, чтобы реализовать эту ценность? Кого нужно подключить к этой задаче? Здесь вам нужно предложить конкретные дальнейшие шаги. Я ви- дел, как дата сайентисты стеснялись этого, потому что обычно они не принима- ют реальных решений. В примере с ценой, скорее всего, вы будете опираться на команду маркетоло- гов, которая ответст венна за разработку и продвижение стратегии скидок. Воз- можно, потребуется утвердить этот план в отделе финансов. Стоит также задей- ствовать и другие нужные вам команды. Последний рывок Пегги Клаус в своей книге «Софт для карьериста» (7/ге НагЛ Тги11г АЬои15о/5 8кНЬ) (Нагрет Вимпезь) утверждает, что долгосрочный успех на 75% зависит от мяг- ких навыков, а остальное — от технических знаний. Я не уверен, что это правда, но в целом я не могу не согласиться: дата-сайентисты вкладывают много време ни и усилий в достижение технического совершенства, но их карьера в большей степени зависит от гех мягких навыков, которым они часто не уделяют внимания. На последнем этапе наступает время переключит ься с образа ученого на роль продавца. На своем личном опыте я понял, что многие блестящие проекты про- валиваются из-за недостаточной подготовки на данном этапе. Краткое изложение содержания (Т1; ОК) Краткое изложение содержания, или ТЬ; ОК Иоо 1оп^; ЗМп’т геаб), — отличный инструмент для проверки вашего нарратива на предмет краткости и лаконично- сти. Он уже стал стандартом в технологических компаниях, и я тоже взял за пра- вило всегда начинат ь с него.
Многие руководители не станут тратить много времени на вашу работу, пока их внимание что-то не зацепит. И для этого необходимо написать хорошее крат- кое изложение. Рекомендации по написанию запоминающегося краткого изложения Некоторые люди предпочитают писать первый черновик краткого содержания перед созданием полноценного документа. Это помогает им убедиться в том, что ТЬ; ОК соответствует их нарративу’ и что все содержание согласовано с ним. По еле этого этапа они снова возвращаются к ТЬ; ИК и дорабатывают его. Однако я предпочитаю подход, при котором вы сначала записываете нарра тив (некоторые люди рисуют его от руки на бумаге), прорабатываете его содер- жание и только потом возвращаетесь и пишете краткое изложение. Для меня ТЬ; ПК — это последнее, что нужно написать, и я всегда сначала делаю набро- сок для нарратива. Эти два подхода могут показаться похожими, но краткое содержание — это выжимка уже из нарратива. Нарратиь — это общее представление истории, связывающие последовательность событий; ТЬ; Ь)К — это его версия, сжатая до сути. Я склонен структурировать краткое содержание так же, как и нарратив: «что, что дальше, что делат ь сейчас». Как и прежде, в разделе «Что» приводятся аргу менты, привлекающие внимание вашей аудитории, в разделе «Что дальше» — основные выводы и практические действия, а в разделе «Что делать сейчас» вы предлагаете последующие шаги. Есть один хороший совет — относиться к своему документу как к новостной статье и придумывать альтернативные заго- ловки. Отличные заголовки в науке о данных должны обла- дать теми же свойствами, о которых я говорил: быть простыми, заслуживающими доверия, запоминающимися и практически реализуемыми. Они будут заслуживать доверия, если вы не станете их приукрашивать. Наконец, все, что есть в вашем кратком содержании, должно быть дополнено слайдом. Если какие-то выводы были настолько важными, что попали в ТЬ; ЕЖ, вам лучше проиллюстрировать их сопроводительным материалом.
Пример создания краткого содержания для этой главы На рис. 7.2 показан типичный ТЬ; ЭК, который вам может встретиться. Текст за- громожден, поскольку я, конечно, старался включить в него каждую деталь сво- ей работы. В нем очень длинные предложения и достаточно мелкий шрифт, что- бы уместиться на странице. Текст, конечно, не читается. Он запоминающийся, но с негативной стороны. (версия 0) • В науке о данных стадия реализации важна, поскольку она позволяет нам донести стейкхолде- рам нашу ключевую идею ° Для этого нам нужно научиться писать сильные нарративы • В лучших нарративах рассказываемся история о бизнес-проблемах, наших открытиях и последу ющих шагах. 0 Они также должны весги к каким-либо действиям - это всегда должно быть нашим крите- рием успеха. • Необходимые свойства: (1) ясность и уместность (2) убедительность, (3) запоминаемость, (4) практическая применимость. 0 В этом документе мы даем практические рекомендации для получения этих свойств. • Есть два подхода для создания нарратива. ° выполнить нашу работу с данными и затем написать историю на основании наших открытий; ° начать с нарратива, доработать его и протестировать на актуальных данных, закончить шли- фовкой нарратива стадии реализации. • Мы склоняемся к использованию второго подхода нарратив (истории или гипотезы) всегда еле дует создавать перед началом проекта. ° Это также таран тирует, что в финале наш готовый к презентации нарратив будет вытекать по смыслу из нашей работы. • Это также помогает нам в работе с данными и уточняет бизнес возрос. • Мы можем следовать этапам «что, что дальше, что делать сейчас», о которых мы говорили ра нее. ° Что почему проблема актуальна для чашей компании. ° Что дальше: наши главные открытия и практическая применимость. 0 Что делать сейчас: какие действия требуются от организации для получения ценности. • Когда все сделано, мы готовы к последнему рывку. ° Нам нужно написать отличное краткое изложение, которое выделит наши ключевые о г кры тия в запоминающейся манере. • Оно также должно дате возможность любому читателю углубиться в содержание на ших заметок. ° В итоге «речь в лифте» должна стать кратким (2-3 минуты) изложением вашей работы Рисунок 7.2. Т1; версия О
Для текста на рис. 7.3 я применил некоторые описанные здесь рекомендации и убрал все лишнее: упростил и сократил предложения. При желании я мог бы увеличить размер шрифта. Я мог бы еще немного доработать текст, но понял, что лучше всего вернуться к наброскам и начать с нуля. Т1;ОВ (версия 1) • В науке э данных стадия реализации позволяет нам донести нашу ключевую идею. ° Для этого нам нужен сильный нарратив • В лучших нарративах рассказывается история о бизнес- проблемах, наших открытиях и последу- ющих шагах. ° Они также приводят к действьям - нашему критерию успеха. • Необходимые свойства: (1) ясность и уместность, (2) достоверность, (3) запоминаемость, (4) практическая применимость. 0 Здесь мы даем практические рекомендации для этого. • Два подхода для создания нарратива. ° выполнит ь нашу работу с данными и затем написать историю на основании наших открытии ° использовать итеративный подход, который начинается и заканчивается с нарратива. • Предпочтителен итеративный подход, поскольку напоминает научный метод ° Финальный нарратив эволюционирует из нашей начальной гипотезы. 0 Он дает направление для работы ° Сн уточняет би знес-вопрос при необходимости • Этапы ''что что дальше что делать сейчас» в нашем рабочем процессе — опора для стооител линга ° Что: бизнес-вопрос и актуальность. ° Что дальше, практически применимые инсаиты. ° Что делать сейчас последующие практические шаги и взаимозависимости. • Последний рывок. ° Краткое изложение и «речь в лифте» - отличные инструменты для опачивания ключевых от крыгий. Рисунок 7.3. ТЦ ИЯ, версия 1 На рис. 7.4 показаны результаты этой последней итерации. Начав с нуля, я смог сосредоточиться на ключевых идеях. Как вы видите, здесь я следовал структуре «что, что дальше, что делать сейчас». В кратком содержании для ре- ального выступления я бы выделил некоторые ключевые результаты, которые можно оценить количественно и применить на практике. Практика — это имен- но то, к чему я вас призываю.
Т1_;0К Создание нарративов в науке о данных (версия 2) • Сильные нарративы преследуют’ри цели: ° структурировать проект: ° фокусироваться на ключевых результатах с самого начала; 0 приводить к действиям. • Нарративы должны быть: ° простыми; о вызывающими доверие; о запоминающимися; 0 практически применимыми. • В обсуждении мы даем практическое руководство для достижения этого. • Наука о данных как сторителлинг: ° начните с нескольких гипотез; ° протестируйте и уточните их (данные); ° создайте нарратив на стадии презентации с ключевыми идеями; ° сделайте последний рывок. • Этот навык, как и любой другой, необходимо отработать на практике. Рисунок 7.4. ТЬ; ОК, версия 2 Как видите, я использую здесь маркированные списки. У этого подхода, как и у всего остального, у него есть свои плюсы и минусы. Из минусов это, без- условно, ограничение вашей креативности (представьте себе все, что вы може- те сделать на чистом листе бумаги). Из плюсов — вам приходится писать про- сто, ясно и упорядоченно. Можно сразу видеть, не получаются ли предложения слишком длинными (по возможности следует избегать предложений, состоя- щих из двух строк). Как я уже говорил, я не думаю, что презентации в стиле ТЕИ хорошо подхо- дят для науки о данных или бизнеса. Тем не менее, если у вас они хорошо полу- чаются и их стиль не противоречит культуре вашей компании, то вперед. Мар- кированные списки обычно хорошо работают в бизнес-среде. Искусство коротких презентаций Вот прием, которому я научился некоторое время назад, когда проводил презен- тацию перед своим менеджером: если кто-то начинает выступать и совершен- но очевидно, что в этом не хватает связного повествования, прервите его и по- просите представить «речь в лифте». В большинстве случаев вы ее не услышите.
Под «речью в лифте» поднимается 10-20-секундная презентация, которую вы бы провели для генерального директора, если бы случайно встретились в лифте. В такой ситуации ваша цель — убедительно презентовать свою работу! И здесь одна загвоздка, у вас есть время, пока вы добираетесь до своего этажа. После этого ваши возможности для общения заканчиваются. Такое случалось со мной всего раз или два, гак что «речь в лифте» я понимаю не буквально. Я скорее рассматриваю ее как один из инструментов для созда- ния нарратива. Хорошие нарративы должны легко сводиться к краткой презен- тации. Если у вас так не получается, скорее всего, ваша история не доработана, и нужна новая итерация. При работе над следующим проектом попробуйте сделать краткую презентацию до и после тою, как решите, что он за- вершен. Это будет вашей лакмусовой бумажкой. Презентация нарратива Ниже перечислены несколько полезных рекомендаций для стадии презентации. Убедитесь, что у вас есть четко сформулированный нарратив Если вы придерживались итеративного подхода и нарратив уже написан, вам просто нужно просто следовать порядку. Если нет, набросайте нарратив, пре жде чем начинать работу над презентацией или докладной запиской. Когда вы закончите, попросите кого-нибудь просмотреть ваши слайды и рассказать свою версию нарратива. Суть нарратива должна быть понятна всем, кто вни- магелоно прочитает ключевые идеи слайда. Если они их не распознали, вам нужно доработать презентацию. Между идеями должны быть четкие и есте- ственные переходы. Каждый слайд должен содержать четко выраженную мысль Если слайд не содержит четкого сообщения из вашего нарратива, удалите его. Всегда репетируете свое выступление Репетиции никогда не помешают, особенно если вы выступаете перед высшим руководством организации (а вы должны быть в этом заинтересованы). Бу- дет хорошо, если вы запишете свое выступление: это не только поможет вам откорректировать его продолжительность, но и выявит любые возможные причудливые жесты и манеры.
Тайм-менеджмент Перед презентацией вы должны уже понимать, сколько времени займет ваше выступление без остановок на вопросы, но лучше учесть это дополнительное время. Также помните, что своим выступлением управляете только вы, по- этому имеете право (любезно) отойти от вопросов, которые уводят в сторо- ну от ключевых идей. Оценивайте количественно, когда сможете, но не переусердствуйте Наука о данных — это область количественных оценок. Однако очень часто я вижу, как дата-сайентисты описывают свои результаты в качественных или ориентировочных терминах. Утверждение «плохой пользовательский опыт увеличивает отток» лучше дополнить цифрами: «Каждый дополнительный сбой подключения снижает показатель лояльности клиентов на 3 пп.». Тем не менее нужно не переусердствовать: если вы работаете с оценками, то вам будет не сложно округлить их до ближайшего целого числа. Основные выводы Ниже представлены основные выводы из этой главы Эффективные нарративы в науке о данных Эффективные нарративы — это последовательность событий, связанных сю- жетом с целью побуждения к действию. Принципы хороших нарративов Чтобы побуждать к действиям, нарративы должны быть четкими и уместными, заслуживающими доверия, запоминающимися и практически применимыми. Наука как сторителлинг Я предлагаю итеративный подход к созданию нарратива: начните с бизнес- проблемы; придумайте истории или гипотезы, которые решают проблему; итеративно протестируйте и уточните их с помощью данных и завершите этапом презентации. Конечная версия нарратива естественным образом вы- текает из первоначальных гипотез. Структура нарратива Возможно, вы возьмете в работу структуру сюжетной арки: завязки, разви- тия и развязки. Однако я обнаружил, что эффективнее следовать простой
и уместной сюжетной линии «что, что дальше, что делать сейчас». Они похо- жи, но для науки о данных я не вижу особого смысла в создании напряжен- ности или ощущения борьбы. Краткое изложение (ТЕ; ОК) и «речь в лифте» Эти отличные инструменты помогают добиться нужной степени упрощения и проверить, что у вас получилось действительно связное повествование. ТЬ; ПХ8 могут оказаться интригующим анонсом для руководителей высоко- го уровня, которые уделят время материалу, только если в нем будет что-то запоминающееся и практичное. С практикой приходит совершенство Потратьте достаточно времени на репетицию своего выступления. Если воз- можно, запишите себя. Дополнительная литература Есть много замечательных источников по теме нарративов и сторителлинга с ис- пользованием данных. Книга Коул Нассбаумер Нафлик «Данные: визуализируй, расскажи, используй. Сторителлинг в аналитике» (81огу1е1Нп% тГк Эта) (\У11еу) отлично подходит для развития навыков визуализации данных, а также содер- жит оченв хорошую главу о создании повествований. В этой главе я не рассма тривал визуализацию данных, но у дата-сайентистов это важнейший навык для создания истории. В главе 8 мы рассмотрим некоторые из этих навыков. Мно- жество хороших идей вы найдете в похожей книге «Эффективный сторител- линг в аналитике: как стимулировать изменения с помощью данных, повество- вания и визуализаций» (Е^есПуе ЭаГа 31огу(е1Ип%: Ном/ Го Вте СИап^е м/ИИ 1)аГа, ИаггаГКе апс! УииаЬ) Брента Дайкс (\УПеу). Я нашел очень полезным его обсу- ждение взаимосвязи между данными, визуализациями и повествованием. Книга «Проще говоря Как писать деловые письма, проводить презентации, общаться с коллегами и клиентами» (81тр1у ЗаД: Соттитса1т§ ВсГГег а1 УУогк апр ВеуопсГ) Джея Салливана (\МПеу) подчеркивает ценность простоты в пись- менно общении и не только. Его советы по написанию коротких предложений (менее 10 слов) очень действенны. Книга «Это было лучшее из предложений, это было худшее из предложений: ру- ководство для писателей по составлению убойных предложений» (И Жк 1ке Вез1 офЗеШепсез, И \Уаз Де УдогзГ о/ ЗепГепсез: А У^пГег'з СиДе Ю Сгаф[т$ КШег ЗепГепсез) Джун Касагранде (Теп Зрееб Ргезз) предназначена для писателей, но в ней есть
масса замечательных советов, как улучшить коммуникативные навыки. Она ак- центирует на том, что мы должны думать в первую очередь о читателе («чита- тель — король»), который должен стать Полярной звездой при создании пове- ствования. Книга «Ре$опа1е. Захвати аудиторию своей яркой историей» (Ке$опа1е: Ргезеп1 У($иа18(опе$ (На1 Тгапз/опп АисИепсес) Нэнси Дуарте (]оЬп Д471еу апд 8опк) — от- личный выбор, если вы хотите научиться искусству сгорителлинга с точки зре- ния дизайнера. Вы также найдете массу подробностей по этой теме в книге Чипа Хиз и Дэна Хиз «Сделано, чтобы прилипать. Почему одни идеи выживают, а дру- гие умирают» (Маде 1о 8Иск Маде То 8Иск: \Уку 8оте 1деа$ 8итуе апд Откегз Ше) (Капскнп Ноике). Шесть описанных ими принципов во многом перекликают- ся: простота, неожиданность, конкретность, достоверность, эмоции и истории. Книга «Горькая правда о 8орТ 8кИ1$: уроки на рабочем месте, которые умные люди хотели бы усвоить раньше» (7/те Нагд Тги1к АЬоиТ 8о/Т 8кШ$: \\'огкр1асе Геззопз 8таг1 Реор1е 147'5/? 1кеу’д Геагпед 8оопег) написанная Пегги Клаус, убеди- тельно доказывает необходимость развития своих мягких навыков. Дата-сайен тисты с самого начала уделяют внимание развитию своих технических знаний, пренебрегая гак называемыми мягкими навыками. А ведь ваша карьера в реша ющей степени зависит от последних. Что касается нарративов в научном методе, то статья Дэвида Гранди и Бар- ри Бикмора «Наука как сторителлинг» (8с1епсе а$ 81огу1еШп§9) более подробно рассказывает о сходстве между научным методом и рассказыванием историй. ИЦрз.//5сЬо1аг5агсЫуе.Ьуи.ес1и/Ьуи8д <уо153/1554/4/
ГЛАВА 8 Оа(ауь: выбираем диаграмму для передачи идеи В главе 7 мы рассмотрели некоторые эффективные методы создания и презен- тации убедительных нарративов в области науки о данных. Визуализация дан- ных ((1сйаУ1$) — это мощный инструмент для дополнения ваших повествований, а также самостоятельная область знаний. Следовательно, их следует выбирать в качестве инструментов коммуникации. Вам всегда стоит задать себе вопрос: помогает ли эта диаграмма донести нужную мне мысль? Если нет, то вам следу- ет вернуться в начало и найти подходящую диатрамму для выступления. В этой главе мы рассмотрим некоторые рекомендации, которые помогут вам улучшить навыки визуализации. Некоторые полезные и не очень методы визуализации данных За последние несколько десятилетий область визуализации данных претерпела значительные изменения Есть разные онлайн-справочники, каталоги и таксоно- мии, которые помогут вам найти подходящий тип диаграмм для вашего запро- са. Например, ресурсы Ле Эа1а УГзиайзайоп Са1а1о§ие10 или Тгогп ЭаГа (о Утх11. К сожалению, многие практики придерживаются стандартных вариантов, та ких как линейные графики и столбчатые диаграммы, часто используемые как взаимозаменяемые. В этой главе я рассмотрю менее известные типы графиков и расскажу о некоторых подводных камнях, которые часто встречаются у дата сайентистов Этот обзор ни в коем случае не исчерпывающий, поэтому в конце этой главы я приведу несколько полезных ресурсов, которые позволят получить более полное представление об этой области. 10 Йнр5://3а1ахт2са1а1о^ие.сот/ 11 йирзД/тлэуи'.ЗаГа-Го-зтг.сот/
Столбчатые диаграммы и линейные графики Давайте начнем с самою простого вопроса: когда следует использовать столбча- тые диаграммы и линейные графики? Обычно рекомендуется строить столбцы для категориальных данных и линии для непрерывных. Непрерывные данные чаще применяются в ситуации, когда у вас есть временные ряды, то есть после- довательность наблюдений с индексом времени (у(). Давайте проверим справед- ливость этой рекомендации. Помните, что диаграмма должна помогать вам донести мысль. Располагая категориальными данными, такими как средняя выручка на одного пользовате- ля по сегментам клиентов, вам будет выгодно подчеркнуть различия между сег- ментами. Более того, нет очевидного порядка для категорий: вы можете отсор- тировать их, чтобы лучше донести свою идею, а можете просто придерживаться алфавитного порядка. Столбчатые диаграммы — отличный инструмент для пе- редачи информации, так как высоту столбцов очень легко сравнивать. С помощью временных рядов обычно выделяют несколько свойств данных: — последовательный порядок, заданный относительно времени; — средний или усредненный уровень; — тенденция или темпы роста, — любая кривизна. Если для вас важны эти свойства данных, то будут уместны линейные гра- фики. На рисунках 8.1, 8.2 и 8.3 показаны столбцы и графики для категориальных данных и двух временных рядов (короткого и длинного). На первой диаграм- ме показаны кагегориальные данные, где столбцы позволяют легко сравнивать показатели по сегментам. На втором рисунке мы вггдим, что линейные графи- ки не очень подходят для визуализации различий между сегментами. Это про- исходит потому, что непрерывность линии создает искаженное представление о том, что сегменты каким-то образом связаны. Зрителю требуется приложить дополнительные усилия, чтобы понять визуализацию, а это может исказить вашу идею. Глядя на данные временных рядов, вы можете подумать, что столбцы здесь уместны, по крайней мере, если выборка достаточно короткая. Как только вы увеличиваете объем выборки, возникает ненужный беспорядок, и тогда стоит задуматься о другой визуализации. Обратите внимание, что линггя четко и быс- тро показывает вам тенденцию и уровень, не требуя лишних пикселей. Подроб- нее об этом позже, когда я буду обсуждать соотношение данных и чернил.
Столбчатая диаграмма для категориальных данных Потребительские сегменты Рисунок 8.1. Столбцы и графики для потребительских сегментов Линеиныи график для категориальных данных аЬсс!е?дЬ1] Потребительские сегменты Рисунок 8.2. Столбцы и графики для временных рядов Рисунок 8.8. Столбцы и графики для длительных временных рядов Диаграммы наклона (слоупграфы) Я узнал о слоупграфах ($1орергарИ), когда читал книгу Эдварда Тафти «Визуаль ное отображение количественной информации» (7/ге У1$иа11Эг8р1ау о/С^иапШабуе 1п/огтаИоп) (СгарЫсз Ртезз), но мне потребовалось время, чтобы осознать их по- лезность. Слоупграфы отлично подойдут, когда вам нужно показать тенденции для категориальных данных. Я бы сказал, что слоупграфы сочетают в себе луч- шее из столбчатых диаграмм и графиков, поскольку они позволяют сравнивать тенденции в разных сегментах.
На рисунке 8.4 показан пример слоупграфа. Линии наглядно показывают тен- денции для каждого сегмента, а визуализация позволяет легко их сравнивать. В этом примере у меня всего пять сегментов, поэтому правильно расставить над- писи несложно, но получить читаемую диаграмму с большим количеством сег- ментов может быть непросто. Однако существуют и другие полезные инстру менты, например, использование условных обозначений, различных цветов или стилей линий (таких как прерывистая линия, точки и тому подобное). Рисунок 8.4. Слоупграф, показывающий различия в тенденциях Каскадные диаграммы Каскадные диаграммы (рис. 8.5) очень часто используются стейкхолдерами биз- неса и когда-то были широко популяризированы компанией МсКтяеу. Идея здесь в том, чтобы разложить изменение метрики на сегменты или категории. Я использовал каскадные диаграммы в главе 3, поскольку они отлично визуали- зируют результаты декомпозиции. Будьте осторожны, если один из сегментов сильно выбивается из масштаба по своему размеру, что часто случается, когда вы визуализируете темпы роста,
и какая-то категория имеет очень маленькое начальное значение. Кроме того, помните, что этот тип диаграмм полезен в случае презентации декомпозиции. Сглаживание точечной диаграммы Когда вы хотите донести информацию о корреляции между двумя переменны- ми X и У, хорошо подойдут точечные диаграммы. К сожалению, при больших наборах данных весьма трудно отобразить эту взаимосвязь, даже если она су- ществует. Есть несколько альтернативных способов решения этой проблемы. Самое простое — создать диаграмму со случайной выборкой ваших данных. Обычно этого достаточно, поскольку в большинстве случаев полный набор данных из- быточен. В качестве еще одного варианта вы можете использовать диаграмму с шестиугольными ячейками12 13, которые на практике уменьшает размерность, окрашивая более плотное скопление шестиугольников Тот же принцип при- меним и к контурным графикам1’, но они требуют от вас небольшой предвари- тельной обработки. Кроме того, вы можете сгладить точечную диаграмму, добавив к рисун- ку плавную линию. Она является нелинейной функцией и обобщает данные, 12 ЬПр$://та1р1о111Ь.ог§/МаЫе/§а11егу/МаН8Нс8/йехЬ1П_<1ето.Н1:т1 13 йНр8://]акеуйр.^кИаЬ.1о/РуЛопПа1а8с1епсеНап<1Ьоок/04.04-<1еп8Иу-ап<1-соп1оиг-р1<>Г8.111гп1
помогая увидеть взаимосвязь, если таковая существует. Однако будьте осторож- ны. В визуализации данных есть важный принцип — стараться не изменять при- роду данных (или графическую целостность, как называет это Тафти), а методы сглаживания могут повлиять на восприятие данных зрителем На рис. 8.6 показаны три диаграммы. На первой используется весь набор дан- ных по 10 миллионам наблюдений. На второй показана достаточно небольшая случайная выборка из исходного набора данных. На третьей — исходные дан- ные и сглаженная кубическая диаграмма рассеяния. Всегда стоит показывать ис- ходные данные: это позволит зрителям самим решить, хорошо ли сглаживаюшая линия отражает взаимосвязь Рисунок 8.6. Точечная диаграмма для большого набора данных, смоделированного с использованием квадратичного процесса Графики распределения Распределения имеют решающее значение для дата-сайентистов, и всегда по- лезно построить график или вывести некоторые квантили вашей метрики еще до начала работы над проектом. Не стоит показывать распределения своим стейкхолдерам: они трудны для понимания и могут создать ненужную путаницу. Гистограммы — стандартный способ визуализации распределения. Это ча- стоты вст речаемости в отсортированных непересекающихся подмножествах об- ласти определения вашей метрики, или бинах. Графики оценки плотности ядра (Кете! бепзйу еМтта1еь14, КИЕ) дают сглаженную оценку распределения и зави- сят от двух ключевых параметров — ядра, или функции сглаживания, и поло- сы пропускания. На рис. 8.7 представлены гистограмма и график оценки плот- ности с Гауссовым ядром для смоделированных данных со смесью нормальных распределений. 14 кир5-//еп.мак1реЛа.ог§/^1к1/Кегпе1_Цеп811у_е8Цта(1ОП
Рисунок 8.7. Гистограмма и график КОЕ для смоделированных данных При построении графиков КИЕ будьте осторожны с масшта- бом. КРЕ — это сглаженные оценки для лежащего в основе распределения, которые гарантированно интегрируются в единицу, что лишает масштаб (оси V) смысла. Когда я строю КРЕ, я обычно убираю вертикальные надписи, гак как они могут создать путаницу. На рис. 8.7 я изменил масштаб оси, чтобы она была сравнима с осью на гистограмме. В общении со стейкхолдерами я редко использую гистограммы или КРЕ, по- скольку для презентации моей идеи в них обычно содержится избыточная ин формация. В большинстве случаев вам требуется всего несколько квантилей, которые можно представить с помощью других визуализаций, таких как стан- дартный Ооксплот15 (Ьох р!о( или «ящик с усами». — Прим. пер.). Единственное исключение — эго когда я хочу показать в распределении что-то важное для мо его выступления', например, когда в области метрики есть что-то, указывающее на аномальное поведение, как в ситуации с предотвращением мошенничества. Если вы хотите показать сдвиги в распределении, используйте боксплот. Ти- пичный сценарий — это когда вы хотите показать, что качество ваших продаж или клиентов изменилось, потому что, например, средний чек сделки со време нем вырос. Поскольку среднее значение выборки чувствительно к выбросам, вы, возможно, захотите показать причину такого изменения. На рис. 8.8 показаны два разных способа визуализации этих изменений. На диаграмме слева нарисован стандартный боксплот, а справа я просто решил построить линейные графики для минимума и максимума, а также для кванти лей 25%, 50% и 75%. Боксплот содержит гораздо больше информации, чем не- обходимо для донесения моей идеи, поэтому я решил внести два изменения 15 ЕПр$://еп.нтк1реШа ог§/улк1/Вох_р1о1
— указать только те данные, которые абсолютно необходимы (квантиль); — использовать линейный график в соответствии с рекомендациями, при- веденными в начале главы. Рисунок 8.8. Два варианта графиков для визуализации изменений в распределении Общие рекомендации Мы рассмотрели некоторые распространенные ошибки в визуализации данных. Теперь давайте перейдем к общим рекомендациям по дизайну и исполнению. Найдите подходящую визуализацию для вашей идеи Выбранный тип диаграммы может изменить восприятие данных вашей аудито- рией, поэтому ищите тот, который действительно будет передавать идею ваше го выступления. Например, хотите ли вы сравнить суммы между категориями? Изменение во времени? Пропорции? Неопределенность? В интернете вы найде- те несколько ресурсов, которые помогут вам донести свои идеи. Например, в тЬе Пата УтзиаПзаНоп Сата1о§ие1'’ вы найдете различные типы ди- аграмм, подходящие для вашей цели. И я еще раз подчеркну: главное — это передаваемая вами идея. Поэтому я всегда рекомендую попробовать несколько диаграмм, прежде чем на чем-то остановиться. Это занимает больше времени, но последний рывок имеет реша- ющее значение. На рис. 8.9 показан один график, который я отбросил при под- готовке этой I лавы. Мне показалось отличной идеей попробовать использовать боксплот и линейный графики одновременно, но результат оказался не так по- лезен для моей главной мысли — слишком много беспорядка. 16 Ипрь://<1аТау12са1а1о§ие.сот'5еагс11.Ь11п1
Рисунок 8.9. Визуализация, которая не помогает передать суть моей идеи Подбирайте цвета обдуманно Одна из распространенных ошибок —воспринимать цвет как декоративный эле • мент визуализации. Это верно для маркетинга, но для визуализации данных цве- та должны быть подобраны обдуманно, чтобы верно доносить идею. Например, мы используем столбчатые диаграммы, когда у нас есть одна ме- трика для всех категорий и мы хотим показать интересную информацию об од ном или нескольких сегментах. Хороший совет — выбрать один и только один цвет для всех столбцов. Я видел много презентаций по данным, в которых до- кладчик пытался улучшить диаграмму и раскрашивал каждый столбец в разные цвета. Сделайте шаг назад и подумайте о своих зрителях: будут ли они думать, что вы превосходно сочетаете цвета? Возможно, да, но многие люди на самом деле думают, что дополнительные цвета — это третья переменная, выделен- ная вами Если цвет передает абсолютно такую же информацию, что и надписи на горизонтальной оси, лучше выбрать только один цвет. Рисунок 8.10. Примеры с использованием цвета На рис. 8.10 показаны три примера. На первой диаграмме получилось как раз то, чего стоит избегать, ваши сегменты и цвета принадлежат одной категории.
На среднем графике эта избыточность устранена. На третьем графике показан пример, когда цвета помогаю! донести вашу идею: вы хотите, чтобы ваша ауди- тория обратила внимание на сегмент Ь с его ужасными результатами. Если цве- та недостаточно, вы можете добавить текстовые аннотации. Несколько размерностей на графике Другие декоративные элементы, такие как маркеры или стили линий, относятся к той же категории, что и предыдущий пример. Здесь работает тот же принцип: используем только один элемент во избежание избыточной информации и вве- дения аудитории в заблуждение. Однако вы можете добавить и друтие элементы, чтобы подчеркнуть допол нигельную информацию, важную для вашего сообщения. Отличный пример — пузырьковая диаграмма, она похожа на точечную диаграмму, где отображаются взаимосвязи между двумя переменными X и К но здесь вы добавляете третью переменную X, которая определяет диаметр круглого маркера, или пузырька. Пример показан на рис. 8.11. Пузырьковая диаграмма для X и V. радиус указывает на треъю переменную 7 Рисунок 8.11. Третья размерность на пузырьковом графике Стремитесь к достаточно большому значению ОаГачпк гаПо При обсуждении столбцов на рис. 8.3 я упомянул, чго вам следует избегать на- громождений; сами столбцы — избыточная информация. Эдвард Тафги выра- зил эту’ идею с помощью концепции «соотношения данных и чернил» (Да1а-1пк гаИо). Согласно его концепции, с1а1а-тк — это «визуализации, которую нельзя стереть». Соотношение данных и пикселей — это отношение количества чернил, потраченных на данные, ко всем чернилам на визуализации. Это соотношение уменьшается, когда включаете в график неинформативные объекты, и повыша- ется, когда вы отображаете действительно только данные и ничего лишнего.
Хотя Тафти отстаивает идею максимального значения этого соотношения, я рассматриваю (1а1а-тк га1ю скорее как Полярную звезду, чем как закон, вы- сеченный на камне. И действительно, есть исследования в области визуально- го восприятия, которые противоречат рекомендации Тафти17. Например, если мы добавим дополнительную информацию для привлечения внимания ауди- тории, как показано на самом правом графике на рис. 8.10, то уменьшим соот ношение, что по Тафти плохая практика. Вы можете судить сами, но я решил привлечь внимание аудитории к деталям, которые помогают мне донести свою точку зрения. Настройки: пользовательские или по умолчанию Чтобы повысить свою производительность, дата-сайентисты обычно использу- ют инструменты визуализации. Эти инструменты с настройками по умолчанию сокращают время подготовки графика, по обычно оставляют мало места для пользовательских настроек. Стремитесь к гибким инструментам, которые по- зволят вам легко настраивать диаграммы ь'л Я обычно склоняюсь к использованию своих настроек. Воз- л* вращение к основам через такой инструмент, как Р\1Ьоп МаГр1о1ЬЬ; он допускает очень большую степень настройки и даст вам больше возможностей создать подходящую диа грамму. Поначалу его освоение может быть сложным, но че- рез некоторое время вы сможете создавать практически лю- бую диаграмму без особых усилий. С самого начала определите размер шрифта Это может показаться банальным, но я очень часто сталкиваюсь с такой ошиб- кой в презентациях дата-сайен тистов. Выбирайте достаточно крупные размеры шрифта для своих диаграмм и всегда проверяйте, чтобы каждая надпись была читаемой. И всегда указывайте заголовок и надписи для вертикальных и гори зонтальных осей. Стремитесь к созданию понятных и читабельных графиков. 17 См., например, МсСог^ап и др., СгарИ Везщп: ТНе Оа1а-1пк НаИо ап<1 Ехрег( Взегз («Графический дизайн: соотношение Вага Гпк и опытные пользовате- ли»), в материалах 16-й Международной совместной конференции по теории и применению компьютерного зрения, визуализации и компьютерной графики (У181СКАРР), 3 (2021): 188-194.
Если вы пользуетесь МаТрГотНЬ РуСЬоп, то полезно будет настроить тсРататп®18. Например, чтобы мой размер шрифаа но умолчанию всегда был достаточно большим, я добавляю некое напоминание в начало моего блокнота или скрипта сразу после импорта необходимых модулей: а зе1 р1оШпд рагспе1ег$ /гор (7>е Ьедхгтпд ГопТ = { ''ГагтИу'; ' попозрасе', 'метдЬг 'погР1а1 , ’зтге : 14} ахез = {'СтОегтге' '1аЬе1.51ге' } Идите = {'Ндзтге':( , ), 'аиТо1ауоиТ': Ттие} гаТрТоНгЬ гс( ^опС', **Гоп1) паТрХотНЬ гс( ахез', **ахез) тагрТогНЬ . гс( Идите , **Ндиге) Если вы считаете, что эти новые параметры по умолчанию не сработают для конкретного графика, просто впишите нужные. Интерактивные или нет Интерактивные графики приобрели немалую популярность, сначала благодаря разработке библиотек )ата8спр1, таких как П3.}819, а теперь благодаря их доступ- ности в Ру+Ьоп и К. Вы можете найти в РиЬоп несколько инструментов, позво ляющих сделать ваши диаграммы интерактивными; среди них наиболее попу- лярны Р1о11у20, 8еаЬогп21 и Акап22. В статичных диаграммах (например, приведенных в этой главе) общение с ау- диторией идет в одном направлении — от создателя к аудитории. Во многих слу- чаях это неудобно, поскольку зрители не могут самостоятельно просматривать данные. Интерактивные диаграммы помогают преодолеть этот разрыв. Однако для большинства случаев они просто избыточны. Рекомендуется ис- пользовать их только тогда, когда вашей аудитории будет полезно пересмотреть 18 Ьнр!,://п1а1р1о1:11Ь.ог§/8иЫе/и5ег5/ехр1а1п/си51от121п^.Ь(:т1 19 Ьпр8://с13В.ог§/ 20 Ьпръ://р1о11у.сот/ 21 НнрОЛеаЬогп.рускСа.ог^' 22 Нйр8://ака1г-\’17дпЬиЬ.ю/
данные. В других случаях используйте статичные графики с их четким изложе- нием идеи. Простота и понятность В главе 7 я объяснял необходимость создания простых нарративов, но для ви- зуализации данных это еще более актуально. Ваша цель — донести свою идею, а сложные графики неоправданно затрудняют ее понимание для вашей аудито- рии. Ьолее того, если вы проводит е живую презентацию, очень вероятно, что вам зададут вопросы, которые отвлекут вас от основной идеи. Начните с пояснений к диаграмме Распространенная ошибка —предполагать, что аудитория поймет диаграмму сра- зу, и приступать к объяснению отображенных на ней основных идей можно с са- мого начала. На самом деле вам следует первым целом уточнить диаграмму: про- говорите. что находится на вертикальной и горизонтальной осях, выберите одну часть диаграммы (например, маркер, линию или столбик) и объясните ее. Как толь ко вы убедитесь, что диаграмма понятна, можете рассказать о своей главной идее. Основные выводы Ниже представлены основные выводы из этой главы. Цель визуализации данных Визуализации должны помогать вам доносить ключевую идею. Прежде чем показать диаграмму, убедитесь, что она отображает идею, которую нужно до- нести; в противном с лучае удалите ее. Типы диаграмм Выберите тип, который лучше всею подходит для вашего выступления. Столб- цы хороши для сравнения метрик по категориям. Графики лучше использо- вать, когда ваша метрика непрерывна или у вас есть временные ряды. Срав- ните и сделайте обдуманный выбор. Общие рекомендации Стремитесь к простой визуализации и избегайте нагромождений. Выби- райте цвета с умом и всегда следите за тем, чтобы шрифт на диаграмме был
читаемым. Убедитесь, что ваши оси подписаны и их надписи понятны. Вклю- чайте единицы измерения, если цифры требуют пояснений. Избегайте инте- рактивных диаграмм без крайней необходимости. Дополнительная литература Одна из наиболее цитируемых книг по визуализации данных — «Визуальное отображение количественной информации» (ТИе У1зиа1 О1зр1ау о/ ЦиапШаНуе 1п/огтаНоп) Эдварда Тафти (СгарЫсь Ргезз). Помимо других тем автор подроб но рассматривает здесь соотношение данных и чернил. Наряду с Джоном Тьюки и Уильямом Кливлендом, Тафти считается одним из ведущих экспертов в этой области. Для энтузиастов визуализации данных обязательна к прочтению книга «Грам матика графики» (Тке Сгаттаг о/ Сгаркгсз) Лиланда Уилкинсона ($рпп§ег). По- пулярная библиотека ^р/от для языка К была вдохновлена идеями Уилкинсона; она оказала глубокое влияние на профессию и другие широко используемые би- блиотеки и инструменты визуализации. Исторический обзор визуализации данных можно найти в работе Майк- ла Френдли «Краткая история визуализации данных» (А Впе/ Шз1огу ор №а1а У1зиаИгаНоп), опубликованной в книге НапФЬоок ор Ла1а УгзиаИхаИоп23 24 (8рпп§ег). Есть много замечательных современных ресурсов по этой теме. Я насто- ятельно рекомендую книгу Клаус Уилке «Основы визуализации данных. Посо бие по эффективной и убедительной подаче информации» (Рипс1атеп1а1$ ор'Эа1а УгзиаИгаНоп: А Рптег оп Макт% 1п/огтаНуе апс1 СотреПт^ Ргдигез) (.0 КеШу). У Джейка Вандерпласа в руководстве «Руководство по Ру1коп в дата сайенс» (Ру(доп Г)а1а Зсгепсе НапФЬоокр (О’КеШу) есть несколько замечательных приме- ров по обсуждаемым здесь гемам, которые помогут вам разобраться в тонкостях Ма<р1оШЬ. Весь его код находится на СгйНиЬ В книге Кеннеди Эллиотта «39 исследований человеческого восприятия за 30 минут» (39 81шИез АЬои1 Нитап РегсерНоп т 30 Мти1ез2*) рассматрива- ются некоторые данные о том, как разные визуализации влияют на восприятие объекта и какова их относительная эффективность для донесения главных идей. 23 НКр‘;://4УеЬ.агсЫуе.ог§/иеЬ/20240415215113/ЬН:р8://с11е8еегх.151.р8и.е<1и/Лоситеп1?гер1с1=ге р1&1уре=рШ&с1о1=7Г5еа1018578аа516са829Ь42сс2а8Гсс103е763 24 Ьцр8://теи1ит.сот/(§1кеппе111ош39-81:и(11е8 •аЬоиГ-Ьитап-регсерИоп-т-ЗО-ттсНея- 4728Е9е31а73
ЧАСТЬ II Машинное обучение

ГЛАВА 9 Моделирование и бутстрап Выбор методов из инструментария дата-сайентиста в решающей степени за висит от характера данных, с которыми он работает. Данные наблюдений воз- никают в ходе обычного, повседневного, делового взаимодействия в любой компании. А экспериментальные данные получают в хорошо продуманных экс- периментах, например, при проведении А/В-теста. Этот тип данных чаще всего используется для установления причинно-следственной связи или оценки ин крементальности рычага (глава 15). Третий тип данных — смоделированные, или синтетические — менее изве- стен и возникает, когда пользователь запускает процесс генерации данных (<1а1а $епегаИп$ргосезз, ЭСР). Это можно сделать либо путем опоры на обоснованные предположения, либо путем обучения генеративной модели на основе набора данных. В этой главе я буду рассказывать только про первый тип, но в конце по- рекомендую источники, если вас заинтересуют остальные. Моделирование — отличный инструмент для дата-сайентистов по несколь- ким причинам. Понимание алгоритма Ни один алгоритм не работает одинаково хорошо во всех наборах данных. Моделирование позволяет выделить различные аспекты процесса генерации данных и понять чувствительность алгоритма к изменениям. Обычно это де- лается с помошью моделирования методом Монте-Карло (МС). Бутстрэп Во многих случаях вам необходимо определить точность оценки, не делая до- пущений о распределении, которые упрощают вычисления. Бутстрэп — это разновидность моделирования, которое будет полезным в таких случаях. Оптимизация рычагов В некоторых случаях вам необходимо смоделировать систему, чтобы понят ь и опт имизировать воздействие определенных рычагов. Тема не затрагивает- ся в этой главе, но в конце приведены некоторые источники. Прежде чем углубиться в эти темы, давайте начнем с основ моделирования.
Основы моделирования Процесс генерации данных четко определяет взаимосвязи между входными дан- ными, шумом и выходными данными в моделируемом наборе данных. Возьмем в качестве примера следующий ВОР: У = «0 + «Л + «2*2 + xI,x2-^(о. х; е ~ Л' го, о2) Здесь мы видим, что набор данных состоит из одного выходного признака (у) и двух входных признаков (х;, х_). Выходной признак — линейная функция при- знаков и шума. Включена вся информация, необходимая для моделирования на- бора данных, поэтому В(ЗР задан полностью. Чт обы создать данные, выполните следующие действия. 7. Настройте некоторые параметры. Выберите значения для ад, а2, ко- вариационной матрицы 2 х 2 X и дисперсии остаточного или чистого шума о2. 2. Черпайте из распределений. Здесь я предположил, что входные призна- ки подчиняются многомерному нормальному распределению с нулевым средним, а остатки независимо выбираются из нормального распределе- ния с нулевым средним. 3. Вычислите выходной признак. Как только все входные данные будут по- лучены, вы сможете вычислить выходной признаку. Второй шаг — суть моделирования, поэтому давайте сначала обсудим его. Компьютеры не могут моделировать истинно случайные числа. Но есть способы генерировать псевдослучайные независимые величины из распределений, кото- рые обладают некоторыми желательными свойствами в условиях чистой неопре- деленности. В Руйтоп модуль гапбот25 включает в себя несколько генераторов псевдослучайных чисел, которые можно легко использовать. Однако давайте сделаем шаг назад и попытаемся понять, как работают эти генераторы псевдослучайных чисел. А пока я опишу метод выборки с обратным преобразованием. Предположим, вы можете вывести однородное случайное число и ~ (7(0, 1) и хотите сделать это из распределения с помощью известной кумулятивной функции распределения (сити1аИсе (ИзГпЬиИоп/ипсИоп, СГ)Р) Р (х) = РгоЬ(Х < х). 25 Ьнр$://питру.ог§/Зос/зТаЫе/гебегепсе/гапЗот; тЗех.Ыт!
Важно отметить, что вы также можете вычислить обратную функцию распреде- ления. Последовательность вычислений следующая (рис. 9.1). 1. Сгенерируйте К независимых случайных величин ~ V (0, 1). 2. Для каждого п найдите хк = это независимые случайные вели- чины из желаемого распределения. Рисунок 9.1. Выборка с обратным преобразованием В следующем фрагменте кода показано, как вычислить обратную функцию распределения для логистической случайной переменной. Каждое однородное случайное число20 передается в качестве артумента, и затем вам остается 1 олько вычислить обратную функцию распределения с учетом некоторых параметров местоположения и масштаба: дсГ 1од15Т1с_сд1_1ПУег5е(у, пи, зт.дпа): II II II Не1игп г/?е тлиег^е о/ ббе СОР о/ а 1од1збгс гапбот \/сгбао1е 1ирибз: у. /1оа1: пипЬег Ьебиееп в апд 1 пи: 1осаИоп рагапебег збдяа: $сс1е рагапеСег Яебигпз: х: ббе хпъегзе о/ Г(у; пи, згдла) 26 26 Ьггр5.//питруог§/с1ос/81аЫе/ге(7егепсе/гапс1от/^епега1ес1/питру.гапс1огп.ипЦогт.И1т1
тпуег5е_сс1Т = пи + 5тдта’по.1од(у/( -у)) ге1игп гпуег5е_ссИ На рис. 9.2 показан график «квантиль-квантиль» ((^-(2 р!о1), сравнивающий генератор случайных чисел логистическою распределения в Хиптру27 и мою соб- ственную реализацию с использованием только что описанной выборки с обрат- ным преобразованием для трех разных размеров выборки. Графики «квантиль- квантиль» отлично подходят для визуального сравнения двух распределений. Это делается путем сравнения соответствующих квантилей для распределений по горизонтальной и вертикальной осям: равные распределения должны иметь одинаковые квантили, создавая график, лежащий на диагонали в 45 градусов (пунктирный), и вы отслеживаете любые отклонения от этого идеального сце- нария. Вы можете видеть, что по мере увеличения объема выборки генератор случайных чисел логистического распределения в Хигпру и моя собственная ре- ализация становятся все ближе. Рисунок 9,2.1\титру и мой собственный генератор случайных чисел из логистического распределения для разных размеров выборки Еще один важный момент связан с начальными числами (зеесГ) генераторов случайных чисел. Псевдослучайные числа генерируются с помощью динамиче- ского процесса, такого какх( =$х ,—,х1к,х0). Начальные числа ($ее<1) — это на- чальное значение последовательности, и когда у вас есть процесс (и ею параме тры), вы всегда можете воспроизвести полную последовательность. На практике 27 ЬКрз://питру ог§, <1ос,'81аЫе/ геГегепсе/гапдот/§епегаТес1/питру.гап<1от.1о^1 Мтс.Ьтш!
начальные числа используются для воспроизведения. В коде из этой главы вы увидите, что я всегда устанавливаю начальное число, чтобы результаты не ме- нялись при повторном запуске кода. Моделирование линейной модели и линейной регрессии Линейная модель — это простейший метод, который полезен и в машинном об- учении (тасЫпе 1еагпт§, МЬ). И сейчас я напишу следующую модель: у = 2 + 3.5х - 5х + € х , х, ~ ,\Т(О, <йа§| 3, 10)) €~М0, 1) Обратите внимание, что признаки не зависят от нормального распределения (ковариационная матрица имеет диагональный вид, а жирным шрифтом выде- лены векторы или матрицы) и что остатки соответствуют стандартному нор- мальному распределению. Теперь вы готовы к запуску моделирования по методу Монте-Карло СМС). Типичное моделирование состоит из следующих этапов. 1. Зафиксируйте параметры, начальные числа и объем выборки (X). Это га- рантирует проведение одного-единственного МС-эксперимент а. 2. Определите, что вы хотите получить. Как правило, вы хотите прове- рить производительность алгоритма МТ по сравнению с истинным ЭСР, например, путем вычисления смещения. 3. Зафиксируйте количество моделирований (М), оцените и сохраните па- раметры. Для каждого эксперимента смоделируйте и обучите модель, а также вычислите метрику, определенную на предыдущем шаге. В слу- чае смещения мы получили бы что-то вроде: Смещение^, 9) - Е(0) - 9 Где д — истинный интересующий нас параметр (заданный на шаге 1), У — оценка, полученная из МЬ-модели, а математическое ожидание обыч- но заменяется выборочным средним значением по моделированиям М. На рис. 9.3 показаны результаты МС-моцелирования с тремя сотнями экс- периментов для линейной модели, определенной и параметризованной ранее. Расчетные параметры для каждого эксперимента сохраняются, и на трафике ?. Моделирование и бутстрэп / 111
отображаются выборочное среднее и 95% доверительные интервалы, а также истинные параметры, 95% доверительные интервалы рассчитываются непо- средственно по результатам моделирования путем нахождения квантилей 2,5 % и 97,5 % в М экспериментах Это типовое моделирование, в котором соблюдаются все допущения обыч- ного метода наименьших квадратов, или МНК (огсИпату 1еаз1 «диатез, 018). По- этому неудивительно, что линейная регрессия отлично справляется с оценкой истинных параметров. Рисунок 9,3. Результаты МС-эксперимента с линейной регрессией Чтобы проверить, не сместились ли оценки МНК, я попробую кое-что более интересное. Что происходит, когда изменяется отношение сигнал/шум? Интуитивно понятно, что отношение сигнал/шум ($1$па1-1о-по1$е га1ю, 8№К) показывает отношение объема информации, предоставляемой моделью (сиг- нал), к информации, получаемой из необъясненной части модели (шум/ В це- лом, чем более информативные признаки вы включаете, тем выше 81ЧК для ва шей модели прогнозирования. На основе первого моделирования вы можете легко контролировать 8>Ж, из- менив остаточную дисперсию а2 и сохранив дисперсию входных признаков фикси- рованной. На рис. 9.4 показаны результаты нового МС-моделирования с теми же параметрами, что и раньше, за исключением остаточной дисперсии, которая те перь в тысячу раз больше. Вы можете визуально убедиться в том, что метод наименьших квадратов остается объективным в том смысле, что среднее значение оценок очень близко к истинным параметрам. Но из-за более низкого 8 К'К оценки теперь менее точны
(увеличены доверительные интервалы). Этот симптом обычно появляется, ког- да ваш 8МК. недостаточно высок. Выборочное среднее и 95% ДИ при моделировании по методу Монте Карло Среднее ДИ Истина — — Константа х! х? Рисунок 9.4. Линейная регрессия и уменьшение ЗКВ. Важность 5КК (соотношения сигнал/шум) 851К. — это очень полезная концепция, с которой должны был ь знакомы все дата-сайентисты. Не так давно я оценивал для компании прирост выручки от нового продукта (В). Задача была особенно важной, поскольку продукт В мог оказывать каннибализационный эффект на старый продукт (А) в том смысле, что клиенты не приносили больше доходов за счет использования В, а ско- рее заменяли им продукт А, так что общая выручка оставалась неизменной. Это был непростой проект, пот ому что моя команда уже пыталась оценить инкрементапьность продукта и получила противоречивые результаты (иног- да положительные, иногда незначительные). Я решил использовать один из методов, описанный в главе 15, и снова обнаружил положительный, но ста- тистически незначимый эффект. Причина крылась в 851 ГС: выручка от про- дукта В была все еще очень мала по сравнению с естественной дисперсией бо- лее высоких доходов от продукта А. Осознать это было полезно: даже если инкрементальный эффект и существовал, его нельзя было бы обнаружить, пока продукт В не начал бы масштабироваться быстрее! Если бы я понял это раньше, то смог бы сэкономить массу времени, усилий и избавить компанию от разочарования.
Что такое графики частичной зависимости? Несмотря на невысокую прогнозную эффективность, линейная регрессия по- прежнему хороша с точки зрения интерпретируемости Чтобы убеди гься в этом, возьмем простую линейную модель, описанную выше: у = а0 -г а х1 + а2х2 + е Поскольку предполагается, что остатки имеют нулевое среднее, при вычисле- нии условного ожидания и частичных производных вы получаете: ЭЖу|Х)_ дх а>' К Здесь показано, что каждый параметр можно интерпретировать как предель- ный эффект (таг$1па! еф/есГ) соответствующего признака на ожидаемый результат (обусловливающее все остальное). Иными словами, в линейном мире изменение признака на одну единицу связано с изменением результата на а. единиц. Благода- ря этому МНК становится потенциально полезным с точки зрения сторителлинга. Графики частичной зависимости (рагНсй бсрепбепсер1о1$, РП-графики) — ана- лог нелинейных моделей, таких как случайный лес или регрессия с градиентным бустингом: у =фх{, х2) где/ — нелинейная функция, которую вы хотели бы изучить. Вы можете легко рассчитать РВ-графпк для признака/ выполнив следую- щие действия2". 1. Обучите модель. Обучите модель, используя тренировочную выборку, и сохраните объект модели. 2. Вычислите средние значения признаков. Вычислите средние значения для К признаков х = (х ,... х ). Поскольку выборка случайна, не важно, ис- пользуете ли вы тестовуто или обучающую выборку. 3. Создайте линейную сетку для /-го признака х. Задайте размер сетки С и создайте сетку’ в виде ^пс!(х ) = (х , х ...., х ), где индексы 0 и С исполь- зуются для обозначения минимального и максимального значений при- знака в вашей выборке28 29. 28 Хотя я нахожу этот метод вполне удобным, он не является стандартным способом вы- числения РР-графика. В главе 13 я обсудим это подробнее. 29 В качестве альтернативы вы можете обрезать выбросы и установить экстремумы на уров- не некоторых выбранных квантилей. Код в репозитории допускает эту настройку, что очень полезно па практике.
4. Вычислите матрицу сетки средних значений. Матрица X. имеет линей- ную сетку для х в соответствующем столбце и средние значения для всех остальных признаков в других столбцах: х1х1-ха-^к СхК 5. Сделайте прогноз. С помощью обученной модели сделайте прогноз по ма- трице средних значений. Он даст вам РВ-график для признака /: РВР(х.) =/(Х.) Обратите внимание, что графики частичных производных и частичных за- висимостей отвечают на весьма похожий вопрос: каково прогнозируемое из- менение результата, если разрешено изменять только один признак? При ра- боте с нелинейными функциями вам нужно зафиксировать значения для всего остального (обычно это выборочное среднее значение, но вы можете выбрать иное). Частичная производная фокусируется на изменениях, в то время как РВ- I рафик отображает весь прогнозируемый результат с учетом признаков, кото- рые могут варьироваться. Псевдокод, который я вам показал, хорошо работает для непрерывных при знаков. С категориальными признаками вам нужно быть осторожным с «сет- кой»: вместо линейной сетки вы просто создаете массив возможных значений, например {0,1} для фиктивной переменной. В остальном все то же самое, но бо- лее наглядной здесь будет столбчатая диаграмма, описанная в главе 8. Теперь я буду использовать свою первую модель, чтобы сравнить результаты линейной регрессии, градиентного бустинга для регрессии’0 (§гаЛеп1 Ьоозйп^ ге$ге88гоп, СВК) в 8сгк11-1еагп и регрессии по методу случайного леса30 31 (КЕК). Эго полезный ориентир: ожидается, что нелинейные алгоритмы будут более эффек- тивными при выявлении нелинейностей, — но будут ли они так же хороши, ког- да истинная базовая модель линейна? На рис. 9.5 показаны истинные тренды и расчетные РВ-графики для СВК и КЕК, где мы использовали параметр тахйпит с!ер1Н = I, определяющий макси- мальную высоту каждого дерева в обоих алгоритмах. В данном случае этот вы- бор вполне обоснован, поскольку модель линейна по параметрам и признакам; отдельное дерево не смогло бы изучить ВС-график, но это ограничение менее 30 Ьйрч://8С1к1Г-1еат.ог§)'ДаЫе/т<к1и1е5'§епега1е<1/!.к1еат.еп':етЫе.Сга<11еп1Воо511п§Ке§гемог.И1т1 31 Ьир5://8С1к14-1еагп.ог§/»ГаЫе/то<1и1е8/§епегаГе<1лк1еагп.еп5етЫе.КапЛотРоге81Ке§1ел5ог.111т1
важно для ансамблей. Все остальные метапараметры установлены в ЗстктНеагп на значениях по умолчанию. Интересно отметить, что готовый 6ВЧ отлично справляется с восстановле- нием истинных параметров для обоих признаков. К.БВ. неплохо справляется с х, но не с хг Рисунок 9.5. РЭ-графики для регрессии СВР и КРК (максимальная глубина = 1) Рисунок 9.6. РВР для регрессии СВ и КР (тах. с1ер11г = 7) На рис. 9.6 показаны результаты для тахилит <1ер1И = 7, а все остальное уста новлено на значения по умолчанию, как и раньше. СВК снова работает хоро- шо, и с дополнительной допустимой нелинейностью КРК также может оцепить
истинные параметры. Интересно, что при тахштшп бер(Ь > 3 начинает восста- навливаться правильная форма РЭР для х[ (результаты приведены в репозито- рии32 для этой главы). Что же здесь происходит? Это моделирование имеет два параметра, которые одновременно придают больший вес второму признаку д „ Во-первых, оно было получено на основе нор- мального распределения с более высокой дисперсией (о = 10 > 3 = о ]), и во-вто- рых, соответствующий параметр был также больше по абсолютному значению. Это означает, что одно изменение стандартного отклонения в х2 оказывает боль- шее влияние на у, чем соот ветствующее изменение в х . В результате КЕК чаще вы - бирает второй признак при первом и единственном разбиении каждого дерева. На рис. 9.7 показаны результаты, когда я меняю значения дисперсий моде- лируемых признаков, а все остальное остается прежним. Вы можете видеть, что КРК теперь лучше справляется с оценкой истинного эффекта от первого при- знака и относительно плохо (но не так ужасно, как раньше) для второго призна- ка. Поскольку параметры не были изменены (только дисперсия в полученных распределениях), х2 по-прежнему получает достаточный вес при первом раз- биении каждого дерева в ансамбле, чтобы алгоритм мог уловить часть истин- ного эффекта. Рисунок 9.7. РЭ-график при включении дисперсии признаков (максимальная глубина = 1) Возникает вопрос, есть ли другой метапараметр, который можно оптими- зировать, чтобы уменьшить сдвиг в этой оценке КРК. Как уже упоминалось, 32 кир8://§ДЬиЬ.сот/с1уаи§11ап79/<1а1а-8С1епсе-Ьагс1-раг18-со<1е
проблема, по-видимому, в том, что х2 присваивается больший вес, поэтому в конечном итоге он выбирается для первого разбиения в дереве (и для лю- бых дальнейших разбиений при увеличении максимальной глубины). Вы може ге продолжить, изменив параметр по умолчанию пах_^еа1иге5, который зада- ет количество случайно выбранных признаков, разрешенных для конкуренции в каждом разделении. Значение по умолчанию — общее количество признаков (в данном примере два), поэтому х всегда проигрывает. Но если вы оставите один признак, то благодаря случайности выбора вы заставляете ансамбль иног- да давать ему «свободный проход». На рис. 9.8 показаны результаты внесения этого изменения. Рисунок 9.8. РО-графики по алгоритму случайного леса (тах. бер1к = 1 и тах. /еа1иге$ = 1) Смещение вследствие пропущенных переменных В линейной регрессии, когда дата-сайентист не включает один признак, кото- рый должен быть охвачен и который коррелирует с любым другим включенным признаком, происходит смешение вследствие пропущенной переменной (отШеб уапаЫе Ыаз). Это приводит к смещенным оценкам параметров и, следовательно, к неоптимальной предсказательной эффективности. Чтобы объяснить, как работает смещение, давайте вернемся к простой ли- нейной модели с двумя признаками, представленной в начале главы. Но теперь предположим, что дата-сайентист использует только первый признак и оценки: у = А + Ах, + п Истинный ненаблюдаемый коэффициент для включенной переменной равен а(, поэтому, сравнивая его с коэффициентом из неправильно заданной модели (/?), вы можете показать, что: А = “1 + «2 СО1'(Х.,Х,) Уаг(х) Смещение
И когда эти два признака не коррелируют, появляется смещение. Ьолее того, знак смещения зависит ог знака а х Со\’(х„ х^. Давайте начнем с моделирования того же ПОР, что и раньше, но исключим х . Я сделаю это для сетки коэффициентов корреляции, поскольку они ограни чены интервалом [-1,1] и с ними легче работать. Напомним, что истинный па раметр равен а, = -5, поэтому знак смещения будет отрицательным по отноше- нию к знаку корреляции: 8§п(В1Д5) = -8^п(Соу(х1,х2)) Чтобы смоделировать х,, х2 ~ Х(0, Кр)), вы можете упростить параметриза- цию, используя единичную дисперсию, чтобы: ад=(р 1) Для запуска моделирования выполните следующие действия. 1. Зафиксируйте параметр корреляции р из сетки. 2. Смоделируйте Г)6Р с учетом этого параметра корреляции. 3. Для каждого эксперимента по методу Монте-Карло произведите оценку параметров, исключая второй признак. 4. Вычислите смещение во всех экспериментах МС. 5. Повторите то же самое для всех остальных элементов сетки. Рисунок 9.9. Смещение как функция параметра корреляции На рис. 9.9 показаны результаты моделирования методом Монте-Карло с раз- личными параметрами корреляции. Заслуживают внимания четыре результата.
— Смещение равно нулю, если признаки не коррелируют. — Смещение отрицательно по отношению к параметру корреляции. — При единичном коэффициенте корреляции смещение равно параметру исключенного признака. — Для константы нет смещения (по определению она не коррелирует с про- пущенной переменной). Давайте окончательно сформулируем последний вывод: если вы собираетесь использовать линейную регрессию, хорошенько подумайте о том, какие именно признаки вам нужно включить'. Вот почему всегда рекомендуется включать не- которые контрольные переменные, даже если у вас есть только слабые гипотезы о лежащем в основе причинно-следственном механизме (например, использо- вание географических макетов поможет вам уменьшить степень смещения про- пущенных переменных с признаками, которые варьируются на этом уровне). Тем не менее в наши дни почти ник го не использует МН К, за исключени ем вводных курсов, учебников или при оценке причинно-следственных связей (глава 15). Возникает вопрос, страдают ли от этой проблемы и более предсказа- тельные алгоритмы. Независимые признаки — Меапз --- С1 015 Рисунок 9.10. Смещение в МН К и СВР для независимых и коррелированных признаков Чтобы ответить на этот вопрос, давайте проведем МС-эксперимент и вычи- слим смещение по методу наименьших квадратов (МНК) и градиентного бустин- га для регрессии (СВР). Но сначала мне нужно найти способ оценить параме- тры с помощью (лВВ, которые были бы сопоставимы с параметрами в линейном процессе генерации данных (ВСР). Это можно легко сделать с помощью РЭ-гра- фика (рис. 9.5). ]. Постройте график частичной зависимости для х,. 2. Запустите линейную регрессиюрс1р = у0 + у1СпД(х ) + (. 3. Используйте расчетный параметр наклона у! для вычисления смещения.
На рис. 9.10 показано моделирование смещения для случая независимых (ле- вый график) и коррелированных (правый график) признаков для МНК и СВК без оптимизации по метапараметрам. Как и ожидалось, при наличии независимых признаков смещение неотличимо от нуля (см. доверительные интервалы). При по- ложительной корреляции признаков смещение отрицательно и статистически от- личается от нуля; это справедливо как для МНК, так и для СВН. Результаты обес- кураживают: вы не можете устранить проблему с данными с помощью алгоритма. Как правило, не стоит ожидать, что алгоритм устранит пробле- му с вашими данными. Есть надежные алгоритмы, но ни один из них не сверхнадежен. Моделирование задач классификации Как вы, возможно, помните, в задачах классификации переменная выходного признака категориальная, а не непрерывная Эти вопросы часто возникают в на- уке о данных. К наиболее типичным ситуациям относятся: прогнозирование от- тока клиентов (две категории: был ли отток пользователей или нет); проблемы, при которых клиенту необходимо принять или отклонить предложение, напри- мер, при перекрестных и дополнительных продажах или любой другой марке- тинговой кампании; прогнозирование мошенничества и многие другие Модели скрытых переменных Один из стандартных способов создания моделей биномиальной классифика- ции — использование скрытых переменных’3. Переменная считается скрытой, если ее нельзя наблюдать непосредственно, но она влияет на наблюдаемый ре- зультат. Это определение станет более понятным после изучения следующего процесса генерации данных: г = а0 + + а2х? + € ’О 1Гг < 0 У= 1 11 И г > 0 € ~ Ьо§18Нс(д, з) х^-МО.Х) 33 Чтобы смоделировать мультиномиальную логистическую модель, вам необходимо ис- пользовать другой метод, который учитывает некоторые свойства таких моделей.
Скрытая переменная — г, и она подчиняется простой линейной модели с ло- гистическими помехами. Вы наблюдаете только биномиальную переменную у, которая зависит от знака скрытой переменной. Выбор распределения помех поможет вам смоделировать модели с более или менее сбалансированными результатами. Симметричные распределения, такие как гауссово или логистическое, дают сбалансированные результаты, но вам сто- ит использовать асимметричное распределение, если хотите сфокусировать мо- делирование на «несбалансированности» данных (вы также можете вручную выбрать различные пороговые значения, не меняя распределение, и получить тот же результат). Одно из важных отличий от моделей линейной регрессии заключается в том, что обычно параметры в ВОР для скрытой переменной не поддаются идентифи кации, то есть не могут быть оценены напрямую; оценить можно только норма- лизованные версии параметров. Чтобы убедиться в этом, обратите внимание, что: РгоЬ(у = 1) = РгоЬ(х'а + > 0) = РгоЬ(- 6 < х'а) *РгоЬ(-—<—) = Р(х'а/0р) где Р — это СВР для логистического распределения, и я использовал тот факт, что логистическая функция плотности вероятности (РВР) симметрична По- следнее уравнение показывает, что истинные параметры неотличимы от нор- мализованных параметров а/о В ходе моделирования я приведу оба набора па- раметров, чтобы подчеркнуть этот факт. Предельные эффекты в классификационных моделях измеряют влияние бес- конечно малого изменения одного признака на интересующую вас вероятность. В линейной регрессии это был просто коэффициент, соответствующий каждо- му признаку, но, поскольку СВР нелинейны по параметрам, расчет для класси- фикационных моделей не так прост. Поскольку производной от СВР является РВР, после применения правила цепочки для дифференцирования вы получаете: ЭРгоЬ(у=1) =((х>аЧ к е*а , = —-----------------; ак (1 + <.>' ‘)2 Обратите внимание, как проявляется нелинейность: чтобы рассчитать пре- дельный эффект одного признака, вам необходимо оценить у(х'а). Как и в слу- чае с РВР, стандартная практика заключается в использовании выборочных средних признаков для вычисления скалярного произведения с оцененными
параметрами. Знак предельного эффекта зависит только от знака истинных па- раметров, что всегда желательное свойство. Сравнение различных алгоритмов Теперь я проведу моделирование по методу Монте-Карло, чтобы сравнить ре- зультаты трех разных моделей. Линейная вероятностная модель Запустите МНК на наблюдаемых бинарных результатах и признаках. Я не де- лаю поправку на гетероскедастичност ь с помощью взвешенного метода на- именьших квадратов; это стандартная практика, когда вы хотите построить доверительные интервалы (но это не влияет на смещение)34. Логистическая модель Стандартная логистическая регрессия35. Я привожу как оценочные параме гры, так и предельные эффекты, полученные из последнего уравнения. Классификатор градиентного бустинга Из библиотеки 8С1кй-1еагп36. Чтобы сделать его сопоставимым, я вычисляю наклон Р1) графика. Параметры для моделирования следующие: (а0, а,, а2) = (2, 3.5, -5) = а22 = 5 = 1 <Т12 = а21=^ = 0 сг= (х2 п2)/3 « 3.28 (а0/яе, а,/<те.) ~ (1.1, 1.9, -2.8) В последней строке показаны истинные нормализованные параметры, кото- рые будут служить ориентиром. Результаты представлены на рис. 9.11. Из этого моделирования можно сделать два основных вывода: 34 Ключевое допущение в МНК — ошибки имеют одинаковую дисперсию (гомоскедасти- ческую). Напротив, гетероскедастические ошибки имеют разные параметры дисперсии, и тогда МНК перестает быть оптимальным методом в точном смысле этого слова. Взве- шенные наименьшие квадраты — альтернатива МНК, когда можно оценить форму гете- роскедас гичности. 35 Ьйр 8: Из с! к 11 - 1еагп.ог§/5таЫе/то(1'а1е5/§епега1е<1/зНеагп 1теаг_ то 8е1.1 о§1 зисКе^геззюп Нт! 36 Ьир5://8С1кй-1еат.ог§,8ГаЫе/тос1и1ез/ртега1:е<15к1еат.еп8етЫе.<Зга<11еп1Воо511л§С1а551йег.Ь1т]
Истинные параметры не определены По сравнению с истинными параметрами в ВСт-грасЬике оценочные параме- тры из логистической регрессии не учитываются, поскольку их невозможно идентифицировать. Однако оценки очень близки к нормализованным пара- метрам, как и ожидалось, сравните оценки (1.0, 1.8, -2.6) с истинными нор- мализованными параметрами, полученными ранее. Эти три метода позволяют оценить правильные предельные эффекты Теоретические предельные эффекты ог логистической регрессии (РИГ, умно- женный на коэффициент), коэффициенты из линейной вероятностной моде ли и наклон РВ трафика от градиентного бустинга согласуются. Рисунок 9.11. Классификационное моделирование: сравнение оиснок -ыводы из классификационного моделирования Если вы используете градиентный бустинг или классификатор на осно- ве случайного леса, то можно с помощью РВ-графиков начать открывать «черный ящик». В некоторых случаях удобно напрямую применять линей- ную регрессию к бинарным исходам (линейная вероятностная модель): оцененные параметры можно интерпретировать как предельные эффек- ты на вероятность. Будьте осторожны с доверительными интервалами и предсказанными значениями: для получения хороших С1 необходимо использовать взвешенный метод наименьших квадратов или надежного оценщика, а предсказанные значения не должны быть ограничены еди- ничным интервалом (так что вы можете получить вероятности с отрица- тельным значением или больше единицы).
Бутстрэп Моделирование методом Монте-Карло в основном выполняется через создание наборов данных путем задания процесса генерации данных (ПРО). Бутстрэп, наоборот, генерирует выборки из текущего набора данных и в основном исполь- зуется для количественного измерения дисперсии оценки. К примерам оценок, которые релевантны в науке о данных, относятся РО-графики (и предельные эф фекты), точность и полнота (гесаП) и т. д. Поскольку они зависят от имеющейся у вас выборки, всегда будут некоторые отклонения в выборке, которые интерес- но оценить количественно. Чтобы описать, как работает бутстрэп. предположим, что количество наблю- дений в вашей выборке равно К Ваша оценка — это функция от данных вашей выборки, поэтому: ё = д({у,х.у^ Псевдокод для бутстрэпа 1. Установите количество выборок для бутстрэпа (В). 2. Для каждой выборки Ь = 1,..., В: а. Выберите рандом но, с заменой, строк из вашего набора данных. Ь. Рассчитайте и сохраните свою оценку, учитывая эту выборку бут стрэпа: 3. Рассчитайте дисперсию или доверительный интервал, используя В оце нок. Например, вы можете рассчитать стандартное отклонение следую- щим образом: ' в-1 Обычно мы используем этот подход, когда нужно визуализировать долю истинно положительных результатов (1гие розШуе га(е, ТРК) после разделения вашей выборки на равные части, такие как децили (см. главу 6). Для классифи- кационных моделей естественно ожидать, что прогнозные оценки (всоге) ин- формативны относительно фактического наступления события. Это означает, что ТРК. должна быт ь неубывающей функцией от оценки (чем выше оценки, тем выше доля). Приведем конкретный пример. Предположим, вы обучили модель оттока, предсказывающую, прекратит ли клиент делать покупки в следующем месяце
или нет. Вы делаете прогноз для двух клиентов и получаете оценки $ = 0,8 и 8, = 0,5. В идеале они должны были бы представлять реальные вероятности, но в большинстве случаев оценки и вероятности не соответствуют друг другу, поэтому нужна некоторая калибровка. Но даже если эти оценки нельзя интер- претировать как вероятности, было бы здорово, если бы они верно определяли направление, то есть что у первого клиента больше шансов на отгок. ТРЧ для квинтилей и 95 % 0 квинтили Рисунок 9.12. Бутстрэп для доли истинно положительных примеров из классификационной модели Визуализация ТРК по частям позволяет вам увидеть, информативна ли ваша модель в этом смысле. Но тут есть одна за(воздка! Из-за выборочной дисперсии
монотонность действительно зависит от желаемой степени детализации. Вы мо- жете увидеть этот принцип на рис. 9.12, где показана ТРЙ. для квинтилей, деци- лей и 20 тайлового разбиения и 95% доверительных интервалов в бутстрапе. Вы можете видеть, что монотонность сохраняется, когда я использую квинтили и децили. Но что произойдет, если вы решите увеличить степень детализации до 20 равных частей'' Если бы вы не построили диаграмму доверительных ин- тервалов, вы бы пришли к выводу, что с вашей моделью что-то не так (см. груп- пы 11, ] 5 и 19). Но все дело в выборочной дисперсии: как только вы примете ее во внимание, вы сможете с уверенностью заключить, что эти группы статисти- чески не отличаются от своих соседей. Если у вас есть опыт работы со статистикой, вы можете подумать, что бут- стрэп в этом примере излишне сложен, ведь вам нужно просто рассчитать па- раметрическую дисперсию ТРК. для каждой части, которая соответствует бино- миальному распределению (для децилей дисперсия может быть рассчитана как 7'7/10 х ТРИ х (1 — ТРИ )). И также вы можете рассчитать параметрические до- верительные интервалы. Вы правы — бутстрэп наиболее полезен, когда: — вы хотите рассчитать дисперсию, не делая допущений о распределении (то есть непарамстрическую оценку); — вычислить дисперсию аналитически сложно или требует больших вычи- сли тельных затрат. Основные выводы Ниже представлены основные выводы из этой главы. Ни один алгоритм не работает одинаково хорошо во всех наборах данных Поскольку реальные данные несовершенны, вам может потребоваться прове- рить, правильно ли работает алгоритм в смоделированном примере. Алгоритмы не устранят проблемы с данными Крайне важно знать ограничения каждого алгоритма обучения. Ьолее того, если у вас возникли проблемы с вашими данными, не ждите, что алгоритм их исправит. Моделирование как инструмент для понимания недостатков алгоритма В этой главе я представил несколько примеров, в которых моделирование по- зволяет получить представление о плюсах и минусах различных алгоритмов.
Другие примеры можно найти в репозитории37 для этой главы (выбросы и пропущенные значения). Графики частичных зависимостей — отличные инструменты для вскрытия «черного ящика» многих МГ-алгоритмов Чтобы продемонстрировать возможности моделирования, я вычислил РП- графики и сравнил их с параметрами линейной регрессии и классификации. Бутстрэп помогает количественно оценить точность ваших оценок Бутстрэп похож на моделирование методом Монте-Карло в том смысле, что вы извлекаете повюряющиеся выборки — не из смоделированных РСР, а из вашего набора данных, — и на основе эгой информации выводите неко- торые статистические свойства. Дополнительная литература Область моделирования обширна, и в этой главе мы едва коснулись самых ос- новных принципов. Моделирование — важный инструмент в байесовской ста- тистике и генеративных МБ-моделях. О первой вы можете прочитать в книге Эн дрю Гельмана и др. «Байесовский анализ данных» (Вауез1ап Оа(а Апа1у$и), 3-е изд. (СИаршап апб НаП/СКС Ргезз). Отличный источник для второй темы — книга Ке- вина Мерфи «Вероятностное машинное обучение. Введение» (МасМпе Ьеагтпу: А РгоЬаЫИзИс Регзресбуе) (МП Ргезз). У автора также вышли две обновленные ре- дакции этой книги; я их еще не просматривал, но они должны быть отличными. Книга «Статистические методы Монте-Карло» (Моп1е Саг1о 81аИ$Нса1 Мебюбз) Кристиана Роберта и Джорджа Казеллы (8рпп§ег) — это классический справочник по обширной и сложной области моделирования методом Монте- Карло и методам расчета на основе распределений. Обратите внимание, что эта книга предназначена для технически подкованных читателей. О бутстрэпе вы можете найти более подробную информацию в книге «Основы статистического обучения; интеллектуальный анализ данных, логический вы вод и прогнозирование» (ТИе Е1степ($ о/51аН$Нса1 Геагтп§; Па1а Мтмц, 1п/егепсе, апб Рге.1Исгюп), 2-е изд., Тревор Хасти и др. (8рпп§ег, а также доступна онлайн на веб-странице автора). Здесь вы также сможете почитать о некоторых мето- дах, используемых для линейной и логистической регрессии. 37 ксЩь://й11ЬаЬ.сот/<Каи§11ап79/с1аТа-5С1епсе-Ьап1-рагГ5-со<1е
Книга «Практическая генерация синтетических данных» (РгасИса1 8уп(1геНс Г)а1а СепегаНоп) от Халеда Эль Эмама и др. (О КеШу) содержит некоторую по- лезную информацию о моделировании синтетических данных. Как я упоминал в начале главы, вы можете моделировать данные, делая предположения о про- цессах генерации данных, лежащих в основе набора данных, — или обучить мо дель на реальных данных, которые можно использовать для создания синтети- ческих наборов. В этой книге приведены некоторые практические рекомендации о том, как это сделать. Смещение пропущенной переменной и недостаток идентификации в логи- стической регрессии — довольно стандартные результаты, о которых можно по- читать в любом учебнике по эконометрике. Например, в книге «Эконометриче- ский анализ» (ЕсопотеМс Апа1у$й) Уильяма Грина, 8-е изд. (Реагзоп). В кни!е Апа1уНса1 ЗкИЬ/огА! аги! Эа1а Заепсе (0'К.еШу) я рассказываю об ис- пользовании моделирования для оптимизации рычагов Книга Скотта Пейд- жа «Модельное мышление. Как анализировать сложные явления с помощью ма- тематических моделей» (ТИе Мос!с1 ТЫпкег: }У1гаГ Той Нее! ю Кпом ю Маке Ла1а \\тогкрог Той) (Вале Воокз) — хороший справочник по этой теме. Смотрите так же книгу «Стохастическое моделирование» (81осказ11с 8йпи1аНоп) Брайана Ри пли (М’Иеу).
ГЛАВА 10 Линейная регрессия: возвращаемся к основам Линейная регрессия (МНК38) — это первый алгоритм машинного обучения, который изучают большинство дага-сайентистов. Однако с появлением более мощных нелинейных альтернатив, таких как регрессия с градиентным бустин- гом, к нему обращаются скорее из интеллектуального любопытства. Из-за этого многие специалисты не знают различных свойств МНК, которые помогают луч- ше разобраться в алгоритмах обучения. В этой главе мы рассмотрим некоторые из этих важных свойств и подчеркнем их значение. Что определяет коэффициент? Давайте начнем с самого простого условия, где у нас есть один признак: У = «о + а, хг + е Как вы помните из типичной функциональной формы линии, первый пара- метр — это константа, или пересечение (т1егсер1), а второй — это наклон (з1оре). Поскольку остатки равны нулевому среднему, взяв частные производные, вы можете увидеть, что: ЭЛуО Эх, а„ = Е(у)- а,Е(х,) Как обсуждалось в главе 9, первое уравнение весьма полезно с точки зре- ния интерпретируемости: оно гласит, что изменение признака на одну единицу приводит к изменению результата в среднем на а единиц. Однако, как я сейчас 38 МНК расшифровывается как «метод наименьших квадратов!/ (огЛпагу 1еа8Г ьдиагеь). Это стандартный метод обучения через линейную регрессию. Для удобства я рассматриваю их как эквивалентные, но имейте в виду, что существуют и другие функции потерь, ко- торые можно здесь использовать.
покажу, вы должны быть осторожны и не полагаться на существование здесь причинно-следственных связей. Подставив формулу результата в ковариацию, вы также можете показать, что: а = Соу(у, Ж,) 1 Уаг(х) С двумя переменными наклон зависит от ковариации между результатом и признаком, а также от дисперсии признака. Поскольку корреляция — это не причинно-следственная связь, не стоит сразу интерпретировать ее как при- чинную. Ненулевая ковариация может быть вызвана различными факторами. Прямая причинно следственная связь Случай, когда интерпретация напрашивается сама собой (х -> у). Обратная причинно-следственная связь х} «-у, поскольку ковариация симметрична по аргументам. Конфаундер Конфаундер (сопфоипЛег) — это любая третья переменная, которая влияет на х и на у, никак не связанные между собой (рис. 10.1). Рисунок 10.1. Конфаундеры Оценки, полученные на основе линейной регрессии, предо- ставляют информацию о степени корреляции между призна- ком и результатом, и их можно интерпретировать как причин- но следственные связи только в специфичных случаях (см. главу 15). Это также относится к другим МЬ алгоритмам, та ким как градиентный бустинг или случайный лес. Более общий результат применим к множественной регрессии (то есть к рег рессии с несколькими ковариациями): а = Согфух^ к Уаг(хк)
где хк — остаток от регрессии признака к на все остальные признаки (-к): х = хк - X в к -к -к Для двумерной линейной модели фрагмент кода в примере 10.1 показывает, что линейная регрессия и более простая формула ковариации численно согла- суются. Пример 10.1. Проверка согласованности МНК и формулы двумерной ковариации беГ соори1е_а1рЬа_1<:еа1(ус1Г, хсИ): "’"'Сотрисе а1р/1а изгпд саг-сог /огпиТа апд Нпеаг гедгеззсоп /ог гЬе зичрТе сазе о/ у = а + Ь х 1при1:з: у<1/, ха/: да1а/гапез ыНЬ оиСсопе апв /еа1иге ОисриСз: ЕзНлаСес! сое//1с1епРз /гоп 1ис пеЪЬодз: Соц() /огпи1а апд Нпеаг гедгеззсоп н и и # Озгпд согагхапсе /огни 1а са!_та1 = уйГ.соруО саГ_таГ[ х ] = хёГ[ ’хГ ] # сопсоСепоСе [у/х] зо I сап те 1;I^е.соV() пеСЬод усу = саГ_га1:. соу( ) соу_ху = усу[ у'].Тос[’х ] уаг_х = усу[ <’].1.ос[ х'] Ре1:а_усу = соу_ху/уаг_х А изтгд Нпеаг гедгеззгоп гед = ГгпеагРедге5Егоп(1:т.Г:_т.г|Гегсер1:=Тгие).Г1.г(хс11, усН.уаЬиез На(:геп()) ЬеТа_гед = гед .сое^б] ге1:игп ое1а_усу, ЬеГа_гед # соприте апд рг{п1 Ь_усу, Ь_гед = сопри1:е_а1рпа_11:еаГ(у<й:=у<11:, хй(:=ХаГ[[1 х11 ]]) СесслаГз = 10 ргт.пГ(Г’А1рЬа усу ГогоиТа = {Ь_усу.гоип^(<1ес1ла15”бес1та1з)} > ргтпГС^’А1рЬа 015 {Ь_гед гоипс1(аес1.п1а15=<1ест("а15)]1) А1рпа усу ^огпиТа = 3.531180168, А1рНа 01.5 = 3.531180168
В случае более чем одного признака вы можете использовать представленную ниже функцию, чтобы проверить, согласуется ли более общая формула ковари- ации с МНК. Обратите внимание, что сначала я вычисляю остатки от регрессии признака к по всем остальным признакам: оеГ соР1риТе_а1рЬа_п_Геа1:5(ус1Г, ха?, пане_уаг): II И II Сотрите Ппеаг гедгезИоп сое//т.С1еп15 Ьу: 1. ОгШодопаПесПоп (Соу /огяи1а) 2. 01.5 Iпри 15: уд/, хдр: дс?а/гте5 иПЬ ои?сопе апд реакигез паяе_уаг: $1г1пд: папе о/ /еаСиге уои л>ап1 1о сояри?е 0и?ри?5: Сое/ргсгеп? рог папе_уаг тхпд ооСЛ пегЬодз II и И # Рип гедгеззгоп о/ папе_иаг оп а11 осНег /еа?игез апд заие гезгдиаН со15_ехс_х - пр.аггау(И,5Г(5ег(хсЮсо'1и1ппО - 5ет([тапе_уаг]))) пек_х = лсВ:[со15_ехс_х] пеь_у = хд^[папе_уаг] гед_х = ИпеагйедгеззёопОЛтЛСлеН-Х, пеи_у.уаТоев Ма1Теп()) ге$1с15_х = пел_у - гед_х.ргесИсТ(пе«_х) # Ра$5 ге51с1иа15 Го Соу /огпи1а саГ_па1 = удГ,сору() саг_па1['х'] = ге5хс15_х усу = саТ_та1.соу() соу_ху = усу['у ].1ос['х'] уаг_х = усу['х ].1ос[ х'] ЬеГа_УСУ = соу_ху/уаг_х # изгпд Ппеаг гедгезНоп гед = 1ЛпеагЯедге55\оп() .^ЧтСхйГ, удОуаТаег.ПаТГег.О) аП-ЬеТаз гед.сое^_ гх_уаг = пр.^ЬсеСхдГ.соТиопз == пале_уаг) оеТа_гед = а11._Ье1:аз[т.х_уаг][Я] гегигп Ьета_усу, Ьета_гед Более общая формула ковариации приводит к важному результату, доказан- ному теоремой Фриша — Во — Ловелла.
Теорема Фриша — Во — Ловелла Теорема Фриша — Во — Ловелла (Рп8сЬ-АУапрЬ-Ьолге11 Шеогет) — это важный результат, который помогает лучше понять внутреннюю работу линейной рег- рессии. По сути, она говорит о том, что вы можете интерпретировать оценки МНК как очищенные, то есть как результаты после исключения любых других зависимостей между признаками. Предположим, что вы: проводите регрессию продаж на одного клиента, где независимые переменные — это цена, которую он заплатил, и фиктивные пере- менные штата. Если стейкхолдер спросит вас, можно ли объяснить ценовой ко- эффициент различиями в ценообразовании по штатам, вы можете использовать теорему Фриша — Во — Ловелла, чтобы убедительно доказать, что это чистые эффекты. Ценовой эффект уже очищен от любых различий в ценообразовании между штатами (вы уже устраняли различия в штатах). Для объяснения теоремы я снова буду использовать более простую линейную модель с двумя признаками, однако теорема применима и в более общем случае с произвольным количеством регрессоров: У = а0 + «,^1 + Л2Х2 + С Теорема Фриша — Во — Ловелла утверждает, что вы можете оценить кон- кретный коэффициент, скажем, а . с помощью двухэтапных вычислений. 1. Исключите влияние х,. а. Выполните регрессию у на х, и сохраните остатки: у}. Ь. Выполните регрессию х, на х, и сохраните остатки: х{. 2. Проведите регрессию по остаткам. а. Выполните регрессию^ нах . Наклон — это оценка, равная а . Первый этап устраняет влияние любого другого регрессора на результат и интересующий признак. На втором этапе выполняется регрессия с двумя пе- ременными по этим остаткам. Поскольку мы уже исключили эффект от х2, оста- ется только интересующее нас влияние. В примере 10.2 показаны результаты создания линейной модели с тремя при- знаками, где я оцениваю каждый коэффициент с помощью метода исключения влияния из модели по теореме Фриша — Во — Ловелла и простой линейной рег- рессии. Для сравнения я использую фрагмент кода из примера 10.2.
Пример 10.2. Проверка применимости теоремы Фриша — Во — Ловелла 4еГ сНеск_Ги(у<ЗГ, хс1Г, уагпаое, уегззоп = 'гезгйиаГз ): II II II Спеск СЬе ЕггрсЬ-ЫсидЬ СЬеогет: Меспоа 1: ыо-зСер гедгезхгопз оп рагЫаПеФоаС гедгезИопз МеСЬод 2: опе-зсер гедгесИоп 1приС$: уар, хдр; ааСаргатез ^ПЬ У апа X гесрессНе1у уаг_пане: $Сг1пд: папе ор реаСиге м ыапС Со арр1у сЬе ГЫ рог »ег51оп: зсггпд: [‘гв51аиа1з’, ’аггесс'] сап Ье изед Со СезС ЬосН сохагСапсе рогги1ар ргезепсе<1 1п Спе спарСег ’ге^Саиа!;’: Соь(СПс1е{у}, Н1с1е{х}) ‘сНгесС’: <^(у, С\1де{х}) II II II # МЕТНОО 1: См-пер гедгеззгопр поза = удГ 5Ьаре[0] со!5_ехс_к = пр аггау(И8<:(5е1(хбГ,со1итп5) - зе^([уаг_папе]))) х_к «И[со1'_ехс_к] # гед 1: гед_у = 1ЛпеагКедге55'1оп().1Ч1:(х_к, удГ^аТиез.^Ха^^епС)) геь_ук = удТ.*а1.ие5.Т1аПеп() - гед_у рге<Ис1(х_к) # гед 2: пе^_у = хсИ^аТ-Папе] гед_х = И.пеагкедге55гоп() 1Ч1(х_к, пеы_у.уа1.ие5.1г1а1:1:сп()) ге5_хк = пеи_у.уа1ие5.Г1.а1геп() - гед_х ргедт.с1(х_к) гез_хк = гез_хк гезЬаре((поЬз,1)) # гед 3: г€ уег5гоп=='гезгйиаТз': гед_гез = (ЛпеагКедгеьзгопО ^И:(ге5_хк, гез_ук) е15е: гед_гез = ЬгпеагР.едге5Ь1оп() /ГтЛ(ге5._хк, у<Я.уа1се2.М.а1:1:еп()) соеГ_Гн = гед_гез.соеГ_[0] # МЕТнОО 2: 0С5 <ПгесПу гед 1_1пеагКедге551оп() .Н1:(х<Я, уй^ .уа1.иез .^ТаГГепО) сое^_а11 = гед.сое<-_ 1х_уаг = пр. и/йеге(х<1^ ,со1итп5 == иаг_пане)[~] [0] соеГ_о15 = сое<г_а1'1['1х_7аг] ге!игп соеГ_Гы, сое^_о1з
со1з_1:о_гпс1.иде = 5е1(ХдЕ.со1.ипп5)-зе1:([ хО' ]) аесттэТз- 5 рг1п1:(' РгГпГтпд Где гезиТсз Ггоо 015 апд ЕН Гко-зЬер пебЬодз \п' 'Уегзгоп = гезтдиа1з ) Гог со1 1.П [ <1 , 'х2 , 'хЗ а, Ь = сПеск_6м(удЕ, хдГ=ХдГ[со1з_1о_1пс1.иде], уаг_пгпе=со1, уег5гоп= гезсдиаГз') рггпГ(Г {со!}: ЕЫ Гио-зТерз {а гсипс1(с1ест.1т1а1.5=0есГпа1.5)} 01.5 = {Ь. гоипсКйес’.таН-дест.та!',)} ) РггпГт.пд гНе гези1.1з Г г от 015 апд ЕН Гмо-зГер теТПодз Уегзтоп = гезтдиаТз х1: ЕН Гио-зГерз = 3.66436, 01.5 = 3.66436 х2: ЕН Ьго-зГерз = -1.8564, 015 = -1.8564 хЗ: ЕН Гмо-зсерз = 2.95345, 01.5 = 2.95345 Возвращаясь к формуле ковариации, которую мы рассмотрели ранее, теоре- ма Фрита — Во подразумевает, что: = Соу(д, х) Уаг(х):) где, как и прежде, хк обозначает остатки от регрессии признака к по всем дру- гим признакам, а к обозначает остатки от регрессии результата по тому же на- бору признаков. Скрипт на Ру1Ьоп позволяет вам проверить, что обе версии общей формулы ковариации даю г одинаковые результаты (используя аргумент уегБтоп). Важное свойство МНК — оцененные остатки ортогональны регрессорам (или любой функции регрессоров); этот процесс также известен как ортогона- лизация. Вы можете использовать этот факт, чтобы показать, что две формулы ковариации эквивалентны. Важно отметить, что ортогонализация для интересующего признака долж- на выполняться всегда. Если вы ортогонализируете исключительно результат у, формула ковариации больше не действительна, если только признаки уже не ор- тогональны друг друг}’: Соу{уе х,) \аг(хк)
Чем полезна теорема Фриша — Во — Ловелла? Я представил несколько версий результатов ортогонализации, так что стоит ожидать, что она будет релевантной. Главный вывод заключается в следующем. Вы можете интерпретировать каждый коэффициент линейной регрессии как чистый эффект каждого признака после очистки его от влияния любого дру- гого признака. Ниже описан один из типичных сценариев, в котором такая интерпретация имеет большое значение. х, ~ Дг(0, о*) Х2=^+ЛХ1 + е У = “о + «Л + «2*2 + '7 В этом случае х; оказывает прямое и косвенное влияние на у. Примером мо гут быть фиктивные переменные вашего штата или географического положения. Они, как правило, оказывают прямое и косвенное воздействие Когда вы интер- претируете коэффициент х,, было бы полезно считать ею «чистым» от каких- либо различий по штатам, поскольку вы уже контролируете эту переменную. На рис. 10.2 показаны истинный параметр, оценка МНК и график частичной зависимости (РН-график) регрессии через градиентный бустинг (СВК) для мо- делирования предыдущего процесса генерации данных. Благодаря теореме Фри ша — Во — Ловелла вы знаете, что МНК считает чистые эффекты правильно. Градиентный бустинг хорошо работает для х., но хуже для хг Рисунок 10 2. МНК и градиентный бустинг с прямыми и косвенными эффектами
Чтобы понять, что происходит, вспомните, как рассчитываются РЕ)-графи- ки: фиксируется один признак в выборочном среднем, создается таблица для интересующего признака и сделается прогноз. Когда вы фиксируете л ото- бражает комбинацию прямых и косвенных эффектов, и алгоритм не знает, как их разделить. Это только подтверждает идею о том, что МНК великолепен для интерпретации, но, чтобы добиться производительности хотя бы как у относи- тельно стандартного (лВК с нелинейными моделями, потребуется немало усилий. Конфаундеры После рассмотрения теоремы Фриша — Во — Ловелла я хочу вернуться к про- блеме конфаундеров (рис. 10.1). Предположим, что конфаундер (и’) влияет на две никак не связанные переменные: х = а.с + ту + у = а + В и, + 6 7 у ГУ У € не ' У С, € Л и' ? у где символ 11 обозначает статистическую независимость. Используя формулу ко- вариации для коэффициента наклона в регрессии у по х, становится очевидным, почему МНК показывает ложные результаты: Сог(у,х) Уаг(х) ~ р-УагМ + Уйг(€ ) Что будет, если сначала устранить этот общий фактор? Как указывает тео рема Фриша — Во, именно это делает линейная регрессия, поэтому вы можете безопасно выполнить регрессию: у = яп + я,х. + а,те + € Если вы включите общий фактор и’, МНК эффективно исключит ею влияние из матрицы. На рис. 10.3 показаны результаты оценки двумерной ложной рег- рессии (левый график) и вариант с исключенным влиянием, куда также входит третий фактор, как в предыдущем уравнении (правый график). Я также вклю- чаю сюда 95% доверительные интервалы. Без устранения конфаундера вы бы пришли к выводу, что х и у действитель но коррелируют (доверительный интервал отличен от нуля). Но как только мы исключаем IV, он становится единственным релевантным (статистически значи мым) фактором.
Ложнаяре'рессия Исключение конфаундера Рисунок 10.3. Теорема Фриша — Во и исключение конфаундеров (оценка и 95% С1) Этот результат очень полезен во многих ситуациях. Например, при анали- зе временных рядов довольно часто используются стационарные относитель но тренда39 переменные, которые можно смоделировать следующим образом: = + ев У21 = а2+ /?? + €,_ Благодаря теореме Фриша — Во — Ловелла вы уже знаете, почему они на- зываются стационарными по тренду: когда вы устраняете временной тренд (I выше), вы очищаете переменные от его влияния и получаете стационарные временные ряды40. Предположим, вы проводите рецессию одной переменной на другую: Л< = бо + 01У11 + < Если вы не устраните общий тренд, в конечном итоге вы сделаете неверный вывод о том, что они взаимосвязаны. На рис. 10.4 показаны результаты регрес сии, полученные в результате моделирования двух стационарных по тренду про цессов АЩ1), которые не связаны между собой по своей структуре41. На графи ке показаны расчетные значения интерсепта (константа) и тренда для второй переменной (у2), а также 95% доверительные интервалы. 39 Ь11р5://еплУ1к1ре21а.ог§/ мчкь'Тгеп<1-81а11опагу_ргосе88 40 Если обобщить, то временной ряд является стационарным, когда его распределение ве- роятностей не меняется во времени. Слабая стационарность относится только к первым двум моментам, а сильная стационарность требует, чтобы совместное распределение было постоянным. Среднее значение для трендовой переменной изменяется, поэтому она не может быть стационарной (если только она не является стационарной относи- тельно тренда). 41 АК( 1) обозначает процесс авторегрессии первого порядка.
Рисунок 10.4. МНК для ложной регрессии временных рядов Ложная корреляция с временными рядами наблюдается до- вольно часто: они чаще всего отображают временной тренд. Поскольку он может выступать в роли конфаундера, всегда рекомендуется для контроля включать линейный временной тренд. Так вы устраните любые помехи, которые могут воз- никнуть из-за этого потенциального конфаундера. Дополнительные переменные В главе 9 описано смешение вследствие пропущенной переменной. Оно показы- вает. что исключение переменной, которая должна была быть включена, приво- дит к смещенным оценкам МНК и, следовательно, снижает эффективность про- гнозирования Это верно и для других алгоритмов машинного обучения (МЬ). Что произойдет, если вместо пропуска важных переменных вы включите в модель дополнительные нерелевантные признаки7 Одно из приятных свойств МНК — то, что включение неинформативных признаков не приводит к смеще- нию и влияет только на дисперсию оценок. На рис. 10.5 представлены средние значения и 90% доверительные интервалы для каждого оцененного параметра, полученные в результате моделирования методом Монте-Карло, где: — только один признак информативный (х , с истинным коэффициентом а, = 3); — при обучении модели включаются еще четыре неинформативных конт- рольных признака; — обучаются две модели: МНК и готовая регрессия по градиентному бус- тингу.
Оба алгоритма работают корректно по двум направлениям: они способны правильно оценить истинный параметр и отбросить неинформативные пере- менные. Дополнительные переменные: МНК Дополнительные переменные бустинг Х1 х2 хЗ х4 х5 х! х2 хЗ х4 х5 Рисунок 10.5. Включение неинформативных контрольных признаков Однако будьте осторожны с алгоритмами ансамблевого обучения: они, как правило, довольно чувствительны к включению неинформативных признаков, если они сильно коррелируют с реальными базовыми переменными. Это мож- но отследить с помощью ловушки фиктивной переменной. Обычно такая ситуа- ция возникает при использовании моделей с фиктивной переменной, например. у = а., + а.х + а,1), + € 1 сиьТотег 18 1еЙ-Ьапс1еД ' Ю Д сиьТотег 18 г^Ьт-ЬапЛеб В МНК ловушка фиктивной переменной возникает, когда вы включаете ин- герсепт и фиктивные переменные для всех доступных категорий. В этом при- мере вы можете включить только одну фиктивную переменную для левши или правши, но не обе, поскольку матрица попарных произведений Х’Х не обратима (и, следовательно, оценки МНК не существуют). Решение — постоянное исклю чение фиктивной переменной для эталонной категории; в данном примере это категория правшей. Данное вычислительное ограничение не работает для ансамблевых алгорит- мов, таких как случайные леса или градиентный бустинг, но поскольку фик- тивные переменные, такие как Г> и О = 1- О. идеально коррелируют, вполне ожидаемо, что обе они занимают очень высокие позиции в рейтинге важно сти признака. Поскольку они предоставляют точно такую же информацию, производительность алгоритма не улучшается при включении обеих перемен- ных. Такое полезное наблюдение возникает, когда вы начинаете понимать ра- боту МНК.
Избегайте ловушки фиктивных переменных В методе наименьших квадратов ловушка фиктивных переменных возни- кает, когда вы включаете в модель интерсепт и фиктивные переменные для всех категорий одной категориальной переменной. В этом случае оценку МНК нельзя вычислить Если вы используете ансамблевое обучение, у вас нет этого вычисли- тельного ограничения, однако эти избыточные признаки не предоставля- ют никакой дополнительной информации и не улучшают прогнозную эф- фективность модели. Ключевая роль дисперсии в М1 Согласно фундаментальному принципу машинного обучения, для идентифика- ции параметров алгоритмом, то есть для обучения выявлять корреляции, необ- ходима вариативность как в признаках, так и в целевой переменной (опСсоте). Вы можете увидеть это непосредственно в формулировке ковариации, представ ленной в начале: если х или у постоянны, ковариация равна нулю, и, следова- тельно, МНК не может выявить параметр. Более того, если х константен, знаме натель равен нулю, и, следовательно, параметр не существует, то мы имеем дело с ловушкой фиктивной переменной. Если вы хотите объяснить различия в целевой переменной, вам необходимы различия во входных данных. Это справед- ливо для любого алгоритма МЕ. Возможно, вы помните, что в МНК оценки коэффициентов и ковариацион- ной матрицы равны: 13 = (XX) 'XX Уаг(/3) = У(ХХ) 1 где 52 — оценка дисперсии остатков по выборке, а X., — матрица признаков, включающая векторы тех, которые соотносятся с интерсептом. Из этих уравнений вытекают два вывода Условия для идентификации Не может быть идеальной корреляции между признаками (идеальной му ль гиколлинеарности), чтобы матрица перекрестных результатов (сгозь-ргобисТ
таГпх) (XX) была положительно определенной (имела полный ранг или была обратимой). Дисперсия оценок Чем больше корреляция между признаками, тем выше дисперсия оценок. Первая часть довольно простая, однако вторая требует некоторых матема- тических манипуляций, чтобы выявить общий случай множественной регрес- сии. В репозитории42 к этой главе я привожу моделирование, которое проверяет это условие в случае множественной регрессии. Для простой двумерной регрес- сии несложно показать, что дисперсия оценки обратно пропорциональна выбо- рочной дисперсии признака. Таким образом, использование ковариаций с боль- шими различиями информативнее, поскольку это повышает точность оценок43. На рис. 10.6 показаны средние значения и 95% доверительные интервалы для оценок МНК и градиентного бустинга после моделирования двумерного линейного 1)СР, где Уаг(хД увеличивается по сетке. Как уже обсуждалось, для МНК дисперсия оценки уменьшается по мере того, как ковариата демонстри- рует большую вариабельность. Примечательно, что это верно и для градиенгно- го бустинга. Рисунок 10.6. Дисперсия оценки для МНК и градиентного бустинга Этот принцип довольно часто применяется в работе дата-сайентистов. Пред- ставьте, что вы выполняете следующую регрессию: у, = а + уги) + 6 1 тГ сизГотег г Цуев т зСаГе 5 О,= 0 ошелмгзе г = среднее для г по выборке штата, где проживает / 42 И1Гр5://у11киЪ.сот/^аи^11ап79,'<1а1а-8С1епсе-}1агс1-раг18-соЛе 43 Если у вас есть две переменные, то Уаг^) = Уаг(остаток) /Уаг(х).
Если у обозначает продажи на одного покупателя, аг — общий семейный доход, то эта модель говорит о том, что продажи варьируются в разных штатах (фиктивные переменные) и что существует независимый эффект, при котором более богатые штаты покупают больше (в зависимости от среднего дохода в ка- ждом штате). Ваши предположения могут быть верны, однако из-за присутствия здесь иде- альной мультиколлинеарности вы не сможете обучить эту модель с помощью МИК. Другими словами, фиктивные переменные и средние выборки по штатам по любой доступной метрике предоставляют совершенно одинаковую информа- цию. И это справедливо для любого МЬ-алгоритма! Фиктивные переменные и агрегаты на групповом уровне Если вы включили фиктивные переменные для контроля вариации на групповом уровне, то включать агрегаты для любых других признаков на том же уровне не нужно: они дадут точно такую же вариацию. Например, если вы включили фиктивные переменные для штатов и у вас возникает искушение добавить средние семейные доходы и меди- анные цены по штату, то, как бы по-разному они ни звучали, они будут нести точно такой же объем информации. Чтобы проверить это, я смоделировал простую модель, используя только что рассмотренный процесс генерации данных. Я включил в него три штата (и, сле- довательно, две фиктивные переменные, чтобы избежать ловушки фиктивных переменных), полученные из мульт иноминального распределения (код можно найти в репозитории44)- Пример 10.3 показывает, что матрица признаков дей- ствительно имеет низкий ранг, что указывает на наличие строгой мультикол линеарности. Пример 10.3. Фиктивные переменные по штатам: эффект снижения среднего значения по штатам # ЗЬош 1Ьа1 X 15 пог. риИ со!ит гопк (апд 1ди5, ыоп’1 Ье гпуегНЫе) ргт.пГ(б'Со1игт5 об х {Хаб.соТиопз.уаТиеБ) ) гапк_х = I А.па1г-1х_гапк(Хс1б) пеаг5 = хдб.5Ьаре[ ] ргбпбСб'/ Капк = {галк_х}, ГоСаТ соТиппх = {пуагз) ) 44 Епр8://§11ЬиЬхот/Йуаир11ап79/ДаГа-5с1епсе-Ьаг<1-раП5-со<1е
# ^Ьс1 ЬаррепБ I? не Агор {Не леапз? Х_пп = хдГ[[со1 Гог со1 го ХдГ.соСитпв И соИ= леаг_; ]] гапк_хпп = 1А.гпаХг1х_гаг|к(Х_пР1) пуаг5_пгч = х_пп.5Ьаре[ ] рггп'(:(€'Х_[-пеапг]: Рапк = {гапк_хпп}, ^о-Ьа! соТиппв = {п7аг$_пп}') Со1итп5 оГ х = [ Х01 хГ 01 02' 'пеап_з ] X: Рапк = 4, Го1а1 соТиптв = 5 Х_[-|чегп?]- Рапк = 4, СоГа! соТишпз = 4 Чтобы проверить, что этот подход работает для более общих нелинейных ал- горитмов, я провел моделирование этой же модели методом Монте Карло (МС), обучив ее с помощью градиентного бустинга (без оптимизации по метапараме- грам), и рассчитал среднеквадратичную ошибку (теап зциагеб еггог, М8Е) для тестовой выборки, используя полный набор признаков и дальнейшее удаление избыточного среднего значения признака (теап). На рис. 10.7 показано сред- нее значение М8Е, а также 90% доверительные интервалы для М8Е. Вы можете убедиться, что предсказательная эффективность практически не меняется, как и следовало ожидать, если дополнительная переменная не предос тавляет допол- нительной информации. Включение/исключение агрегатов на групповом уровне Включены Исключены Рисунок 10.7. Результаты моделирования методом Монте-Карло для градиентного бустинга
Пример: обнаружение мошенничества Чтобы продемонстрировать силу этого подхода, давайте рассмотрим при мер с высокими ставками. Если нам нужно создать МЬ-модель для обна ружения мошенничества, какие признаки следует в нее включить? Далее я описываю одну из возможных логик, которая применима в общем случае. Поскольку мошенники не хотят быть пойманными, они стараются вы- глядеть как обычные потребители. Однако они, в отличие от вас, обычно не знают распределение метрик. Предположим, у вас есть некая метрика х, например сумма или номер транзакции. Один из способов преобразовать ее, чтобы помочь алгоритму обнаружить аномалию, — создать отношение признака к некоторому эталонному показателю, например, 95-му квантилю: х х = - погт X После такого преобразования, если значение х превышает выбранный квантиль, результат будет больше единицы. И тогда мы вправе предпола гагь, что алгоритм сможет обнаруживать паттерны, указывающие на мо- шенничество. У вас могут возникнуть сомнения в этой логике, поскольку норма- лизованный признак содержит абсолютно такую же информацию, что и исходный. В репозитории с кодом для этого кейса есть моделирование методом Монте-Карло, с помощью которого можно убедиться, что это действительно так. Основные выводы Ниже представлены основные выводы из этой главы Зачем изучать линейную регрессию? Если вы поймете, как работает линейная регрессия, то вам будет легче сделать некоторые важные выводы, которые в целом применимы к другим нелиней- ным алгоритмам, таким как случайные леса или бустинг. Корреляция — это не причинно-следственная связь Как правило, алгоритмы машинного обучения предоставляют информацию только о корреляции признаков и целевой переменной. Линейная регрессия дает отчетливый результат, который должен послужить вам ориентиром при рассмотрении других алгоритмов обучения.
Теорема Фриша — Во — Ловелла Это важный подход ь линейной регрессии, который гласит, что оценки мо- гут быть интерпретированы как чистый эффект после устранения осталь- ных ковариат. Теорема Фриша — Во — Ловелла и конфаундер Благодаря теореме Фприша — Во вы можете контролировать конфаундеры, просто включив их в свой набор функций. Один из распространенных при- меров — анализ временных рядов, где всегда полезно контролировать детер- минированный тренд. Это защищает ьас от получения ложных результатов, когда результаты и признаки демонстрируют некоторую тенденцию. Нерелевантные переменные При линейной регрессии можно с уверенностью включать неинформатив- ные контрольные переменные. Алгоритмы ансамблевою обучения могут быть чувствительны к нерелевантным переменным, если они в достаточной степени коррелируют с информативными признаками. Ваши оценки не бу- дут искажаться, но этот подход может привести вас к выводу, что некото- рая переменная обладает прогнозной силой, — хотя на самом деле это не так. Ловушка фиктивной переменной В линейную регрессию всегда рекомендуется включать интерсет (констан- ту). Если вы берете фиктивные переменные, вы всегда должны исключать одну категорию, которая будет служить опорным значением или эталоном. Например, если вы включаете фиктивную переменную для женского пола, то категория мужского пола будет служить опорным значением для интер претации Ловушка с фиктивной переменной в ансамблевом обучении Ничто не запрещает вам включать фиктивные переменные для всех катего- рий в таких алгоритмах, как случайный лес или градиентный бустинг. Но вы ничего от этого не выигрываете: эти переменные не дают никакой дополни- тельной информации, которая могла бы улучшить прогнозные способности вашей модели. Для машинного обучения принципиально важна дисперсия Без достаточной вариации в признаках ваш алгоритм не сможет изучить за- данный процесс генерации данных. Это справедливо для линейной регрес- сии и общих алгоритмов машинного обучения.
Дополнительная литература Линейная регрессия описана в большинстве учебников по статистике, машин- ному обучению и эконометрике. 1 [ревосходные объяснения вы найдете в кни- ге Тревора Хасти и др. «Основы статистического обучения: интеллектуальный анализ данных, логический вывод и прогнозирование» (Иге Е1етеп1з о/81аИзНса1 Ееагтп§: Иа1аМтт^, 1п{егепсе, апЛ РгесНсНоп), 2-е изд. (8рг1п§ег). Автор расска- зывает о регрессии путем последовательной ортогонализации, что тесно связа- но с теоремой Фриша — Во. В главе 3 книги «В основном безобидная эконометрика: компаньон эмпири- ка» (Моз(1у Нагпйезз ЕсопотеМсз: Ап ЕтртсгзЕз Сотрапюп) Джошуа Ангриста и Йорна-Штеффена Пишке (РгшсеТоп (ЗшмегзИу Ргезз) вы найдете весьма деталь- ное описание основ линейной регрессии, а также вывод представленных фор- мул ковариации. Эта книга будет полезной, если вы хотите углубить свое пони- мание регрессии. Теорема Фриша — Во — Ловелла описана в большинстве учебников по эко- нометрике. Вы можете ознакомиться с книгой «Эконометрический анализ» (ЕсопотеМс Апа1уз1з) Уильяма Грина, 8 е изд. (Реагзоп).
ГЛАВА 11 Утечка данных В научной статье «Утечка в интеллектуальном анализе данных: формулировка, обнаружение и предотвращение» (1еака§е т Иа1а Мтт§: Рогти1аИоп, Ое1есНоп, апб АуогДапсе) Шахар Кауфман и др. (2012) включает утечку данных в список 10 наиболее распространенных проблем в науке о данных. Мой опыт показывает, что эта проблема должна занимать более высокое место, и я уверен, что вы с ней наверняка уже сталкивались, если обучали достаточно много реальных моделей. Эта глава посвящена теме утечки данных, некоторым ее симптомам и тому, что можно с этим сделать. Что такое утечка данных? Как следует из названия, утечка данных — это ситуация, когда часть данных, используемых для обучения модели, становится недоступна при развертыва нии модели в продакшне, что приводит к неудовлетворительной предсказатель ной эффективности на последнем этапе. Это обычно происходит, когда вы учи те модель: — используя данные или метаданные, недоступные на этапе прогнозирова- ния; — которые коррелируют с результатом для вашего прогноза; — что дает нереально высокую предсказательную эффективность в тестовой выборке. Последний пункт объясняет, почему утечка данных вызывает беспокойст- во и разочарование у дага-сайентистов: когда вы обучаете модель в отсутс гвие дрейфа данных и модели, вы ожидаете, что предсказательную эффективность те- стовой выборки можно будет перенести в реальный .мир после развертывания модели в продакшне. Этого не произойдет, если у вас будет утечка данных, что принесет вам (стейкхолдерам и компании) сильное разочарование. Для пояснения этого определения давайте рассмотрим несколько примеров.
Целевая переменная — это тоже признак Это очень простой пример, но он служит в качестве ориентира для более реали- стичных случаев. Если вы обучите модель у=/(у)> вы получите идеальную производительность на этапе обучения, но, разумеется, не сможете сделать прогноз при развертывании модели в продакшне (поскольку целевая переменная по определению недоступна на момент прогнозирования). Функция целевой переменной — сама по себе признак Более реалистичный пример — это когда один из признаков зависит от целевой переменной. Предположим, вы хотите спрогнозировать выручку в следующем месяце и, используя декомпозицию Р х Э (см. главу 2), включаете цену за еди- ницу продукции (выручка/продажи) в качестве признака. Во многих случаях цены за единицу продукции рассчитываются заранее, а вы уже получаете таб- лицу с ценами, не зная толком, как они вычислялись. Важность управления данными Пример, где признак сам является функцией от целевой переменной, под- черкивает важность управления данными для науки о данных и, в част- ности, для машинного обучения. Наличие хорошо документированных пайплайнов, тщательного отслеживания происхождения данных и четких определений переменных исключительно важно для любой компаний, ра- ботающей с данными. Управление данными может быть затрат ным для орт анизации, но вы- годы от его раннего внедрения окупают эти затраты. Плохие контрольные переменные Как описано в главе 10, включать признаки, которые помогут контролировать источники вариаций, целесообразно, даже если у вас нет убедительной гипотезы о лежащем в их основе причинно-следственном механизме. Это верно в общем случае, кроме ситуации, когда вы включаете в модель нерелевантные контроль- ные переменные (Ьас1 соп(го1$), которые сами являются целевыми переменными (оШсоптез), зависящими от функций.
Возьмем в качестве примера следующие процессы генерации данных: Л =/(х1.,) + е, Вы можете подумать, что контроль переменной г при обучении модели иро- гнозированию у поможет вам устранить некоторые эффекты. К сожалению, по- скольку переменная г не будет доступна на момент прогноза и она коррелирует су, вы получите в итоге неочевидный пример утечки данных. Обратите внимание, что утечка здесь возникает как из-за использования ин формации, которой не было на момент прогнозирования, так и из-за плохих контрольных переменных. Если г дает достаточную автокорреляцию во време- ни, то даже при контроле на ее лаговое значение (г(_;) модель все равно будет показывать завышенную предсказательную эффективность. Неправильная маркировка временной метки Предположим, вы хотите измерить количество активных пользователей за опре- деленный месяц. Ниже представлен типичный запрос для получения требуемой метрики. 5Е1.ЕСТ 0АТЕ_ТЙ1Ж( гюпГЬ , ригсЬэ5е_1ь) А5 попСЬ_р, ГОЦМТ(ОТ$Т1ЙСТ си51опег_та) А5 таи ГйОМ П|у_(:ас^_1аЫ.е СРООР ВУ 1 ОкОЕР ВУ 1; Таким образом, вы присвоили этим клиентам временные метки начала меся ца. что для многих задач может быть вполне оправданным подходом. Альтерна тивно вы могли бы проставить временную метку конца периода, что тоже подо- шло бы для других задач. Однако если вы ошибочно полагаете, что метрика была измерена до момен та, указанного в вашей временной метке, го выбор маркировки может привести к утечке данных (то есть по факту вы бы использовали информацию из будуще- го для прогнозирования прошлого). Это распространенная проблема, с которой приходится сталкиваться на практике.
Объединение данных с несовместимыми временными интервалами Предположим, вы хотите спрогнозировать отток клиентов, используя модель: РгоЫсИигп) =/Г4ка1е81 пит. ргоНисй) Здесь мы опираемся на две гипотезы. — Клиенты, кот орые снизили свои продажи в предыдущем периоде, с боль- шей вероятностью уйдут (они явно сигнализируют о снижении своей во- влеченности). — Клиенты, использующие больше продуктов, более тесно связаны с компа- нией — и, следовательно, менее склонны к оттоку Одна из возможных причин утечки возникает в том случае, когда второй при знак содержит информацию из будущего. Тогда клиент, который будет использо- вать хотя бы один продукт в следующем месяце, не мог попасть в отток. Это мо- жет произойти, если вы запрашиваете свои данные с помощью следующего кода: Н1ТН за1ез А5 ( - ^иодиегу ыИЬ 1п/о /ог еасЬ си$1опег, 5а1ез апд де11а 5а1е$, - - изгпд Иле н1пс!ок 1 ), ргооз А5 ( - зиЬдиегу шИЬ пипЬег о/ ргодисН рег сиИолег из1пд Иле ы1пс1он 2 ) 5Е1ЕСТ за1ез.*, ргодз* ГНОМ за!ез ЬЕГТ ЗО1И ргодз Он 5а1е5.сизСопег_1с1 = ргойз.си51опег_1с1 АИО заТез.полЬЬ = ргойз ,топ1:11 Проблема возникает, когда дата-сайент ист небрежно фильтрует данные в ка- ждом подзапросе. Утечка другой информации В предыдущих примерах речь шла об утечке данных либо из признака, либо из- за самого результата. В определении выше я также упомянул утечку метадан ных. Следующий пример поможет прояснить, что это значит. Во многих задачах
машинного обучения данные обычно преобразуют, стандартизируя их следую- щим образом: у - теап(у) Предположим, вы стандартизируете свою обучающую выборку, используя моменты из полного набора данных, который, конечно же, включае г в себя и те- стовую выборку. Бывают случаи, когда эти просочившиеся моменты предостав- ляют дополнительную информацию, которая не будет доступна в продакшне. Позже в этой главе я приведу пример этого типа утечки. Обнаружение утечки данных Если ваша модель показывает неоправданно высокую предсказательную эффек- тивность, вы должны заподозрить утечку данных. Не так давно дата-сайентист из моей команды представил результаты работы с классификационной моделью, у которой показатель АИС (агеа побег [Не сигсе) равнялся 1! Возможно, вы пом- ните, что значение АЪ'С колеблется от 0 до 1, где 1 означает, что у вас идеальный прогноз. Это было явно подозрительно, если не сказать больше. Такие крайние случаи получения идеального прогноза встречаются довольно редко. При работе с классификацией я начинаю подозревать неладное, когда по- лучаю значение АЕТС > 0,8. Но не стоит воспринимать это как истину, высечен- ную в камне. Это скорее личная эвристика, которую я счел полезной и информа- тивной для решения проблем в своей работе45 46. В отношении регрессии подобную эвристику сложно применить, поскольку наиболее распространенный показа- тель производительности — среднеквадратичная ошибка — ограничен снизу ну- лем и на самом деле зависит от масштаба вашего результата4'’. В конечном итоге, лучший способ обнаружить утечку — это сравнить про изводительность реальной модели и тестового образца. Если вторая значитель- но выше и вы можете исключить дрейф модели или данных, то вам следует по искать источники утечки данных. П Используйте знания — как свои, так и экспертов в вашей ор- ганизации — о проблемах моделирования, чтобы определять Ь. подозрительный уровень высокой предсказательной эффек ЧОНР тивности. Во многих случаях обнаружение утечки данных 45 Не забывайте, что АБС чувствителен к несбалансированным результатам. Поэтому к моей эвристике следует отнестись, мягко говоря, скептически. 46 Альтернатива — использовать коэффициент детерминации, или К2, который также дол- жен не превышать единицу.
происходит только тогда, когда вы развертываете модель в продакшне и получаете производительность ниже, чем в те- стовом образце. Чтобы продемонстрировать повышение производительности при утечке данных, я провел моделирование методом Монте-Карло (МС) для двух приме- ров, описанных ранее. На рис. 11.1 показано влияние включения нерелевантной контрольной переменной: я обучаю модели с утечкой данных и без нее, а на тра- фике показаны средние значения и 90% доверительные интервалы для модели- рования МС. Среднеквадратичная ошибка (М8Е) при утечке составляет около четверти от значения, получаемого без учета нерелевантной контрольной пере- менной. С помощью кода в репозитории47 48 вы можете проверить, что, если плохая контрольная переменная не зависит от результата, утечки данных не происходит и модели имеют одинаковую производительность. Вы также можете настроить степень автокорреляции, чтобы убедиться, что даже датированные иерелевант ные контрольные переменные могут привести к утечке. Утечка данных при нерелевантных контрольных переменных Рисунок 11.1. Утечка данных при нерелевантных контрольных переменных Во втором примере я покажу, как плохая стандартизация и утечка момен- тов могут повлиять на производительность. На рис. 11.2 представлены средние значения М8Е, а также 90% доверительные интервалы, полученные в результа- те моделирования методом Монте-Карло с использованием следующего ПСР4*: х1 ~ АК(1) с трендом У, =/(х<) + е, 47 ЬЦр8://§ПЬиЬ сот/<1уаи§Ьап79/^ага-8С1епсе-Нагс1 рагСч собе/ЫоЬ/таш/сЫ 1_Да1а_1еака^е. 1рупЬ 48 Процесс АЯ( 1) — это временной ряд с авторегрессионной составляющей первого поряд ка. Подробнее об этом в главе 10.
Я использую первую половину выборки для обучения, а вторую — для тести- рования модели. Для условия «утечка» я стандартизирую признак и результат, используя среднее значение всего набора данных и стандарт ное отклонение; для условия «отсутствиеутечки» я использую моменты для каждой соответствую- щей выборки (обучающей и тестовой). Как и прежде, здесь четко прослеживает- ся, как утечка данных искусственно повышает производительность. Неправильное масштабирование Рисунок 11.2. Утечка данных из-за неправильного масштабирования (М8Е) Какова логика такого рода проблем с утечкой? Я решил включить временной тренд, чтобы среднее и стандартное отклонение от полного набора данных ин- формировали алгоритм во время обучения о том, что результат и признак уве- личиваются. Это даст дополнительную информацию, которая будет недоступна при развертывании модели. В отсутствие тренда утечка исчезает, в чем поможет убедиться код в репозитории. Полное разделение Прежде чем двигаться дальше, я хочу обсудить тему полного и квазиполного раз- деления. В классификационных моделях из-за этого явления вы можете полу- чить необычно высокое значение АЪТС, что может быть признаком утечки дан- ных, но не обязательно. Полное разделение возникает в контексте линейной классификации (например, логистической регрессии), когда линейная комбинация признаков идеально пред- сказывает результату. В подобных случаях функция минимальных потерь (часто это отрицательная логарифмическая функция правдоподобия) не существует. Обыч- но это происходит в нескольких ситуациях: набор данных невелик, вы работаете с несбалансированными данными или использовали непрерывную переменную
и пороговое значение для создания категориального результата и включения пере- менной в качестве признака. В последнем случае происходит утечка данных. Квазиполное разделение возникает, когда линейная комбинация признаков идеально предсказывает подмножество ваших наблюдений. Это гораздо более распространенное явление; оно может произойти, когда вы включаете одну или несколько фиктивных переменных, которые все вместе создают подмножест- во наблюдений, дающих идеальный прогноз. В этом случае вам, возможно, по- требуется проверить, есть ли утечка данных. Например, может существовать бизнес-правило, которое гласит, чго перекрестные продажи могут быть предло- жены только тем клиентам, которые проживают в данном штате и имеют мини- мальный период пользования. Если вы включите фиктивные переменные пери- ода пользования и штага, то получите квазиполное разделение и утечку данных. Боевые шрамы от квазиполного разделения Несколько лет назад дата-сайенгист из моей команды представлял резуль таты классификационной модели, разработанной для повышения эффек- тивности кампании перекрестных продаж. Учитывая его выбор призна- ков, я счел предсказательную эффективность неоправданно высокой, хотя она не была таковой. Когда я попросил его рассказать все подробнее, мы обнаружили, что са- мой важной переменной с точки зрения предсказательной эффективности была фиктивная переменная штата, которая не имела никакого смысла для данной задачи (в продукте не было ничего, что делало бы ею более подходя- щим для клиентов в этом штате). Обсудив результаты с отделом продаж, мы быстро поняли, что в прошлом квартале кампании перекрестных продаж были нацелены только на клиентов из этого штата. На самом деле отдел про- даж менял геот рафию присутствия, чтобы конкуренты не могли их иденти- фицировать. Поскольку дата-сайентист включил данные за последние два квартала, фиктивная переменная штата создала квазиполное разделение. Многие люди не спешат называть это утечкой данных, поскольку фик- тивная переменная штата все-таки будет доступна во время прогноза. Они утверждают, что это, скорее всего, случай дрейфа модели, посколь- ку часть ПОР может меняться со временем. Я предпочитаю называть это утечкой метаданных, которой можно легко избежать, исключив фиктив- ные переменные по штату, поскольку ЭСР на самом деле не меняется. (Факторы, определяющие, примет клиент предложение или отклонит его, остаются неизменными при условии, что предложение ему поступило. Но предложение ему поступить должно!)
Давайте смоделируем ситуацию, когда это происходит, используя подход со скрытой переменной, как описано в главе 9. Процесс генерации данных вы- глядит следующим образом: хр*2-М0,1) г = а0 + ах1 + а2х2 + 6 У=1гго 1 Гог г гап(1.8е1есГес1 Дот {/: у; = 1} мтгЬ ргоЬаЬПИу р 31 0 огЬегуЛзе где 1 — это индикаторная переменная, которая принимает значение 1, когда выполняется условие для нижнего индекса, и 0 в противном случае. Идея проста: истинный ПОР — это биномиальная модель скрытой перемен- ной с двумя ковариатами, но я создаю третий признак, используемый во время обучения, путем случайного выбора без замены из наблюдений су, = 1. Таким образом, я могу моделировать различные степени разделения, включая случай полного разделения и его отсутствия (р = 1 ир = 0 соответственно). Как обыч- но, я обучаю логистическую регрессию и классификатор градиентного бустин- га, без оптимизации по мегапараметрам. Я провел моделирование по методу Монте-Карло. На рис. 11.3 показано увели- чение медианы АЪТС для тестируемой выборки во всех экспериментах, где я срав- ниваю все данные относительно случая отсутствия разделения. Вы можете видегь, что разделение приводит к увеличению А11С на 10-15% по сравнению с исходным уровнем, в зависимости от тог о, использую ли я логистическую регрессию 1 гли СВС. Рисунок 11.3. Увеличение АУС при квазиполном разделении Урок здесь заключается в том, что при классификации разделение увеличи- вает АИС, и это может указывать на утечку данных, которую необходимо допол- нительно проверить.
Метод скользящего окна (АЛЛпдохлл пд Ме11юс1о!оду) Здесь я опишу метод скользящего окна, который должен помочь снизить веро- ятность утечки данных в вашей модели. Как было описано ранее, утечка данных может произойти по многим причинам, поэтому этот метод не стопроцентно надежный. Тем не менее я обнаружил, что он помогает вам привести в порядок процесс обучения модели и снижает некоторые из наиболее очевидных рисков утечки данных. В качестве отправной точки я разделяю процесс обучения на два этана. Этап обучения Этап, на котором вы обучаете модель, разделяя выборку на обучающую, те- стовую и т. д. Этап оиенивания После того как модель обучена и развернута в продакшне, ее используют для оценки (8сопп§) выборки. Это может быть единоразовый прогноз, например: при оценивании онлайн, в режиме реального времени или по более крупной выборке. Об этом легко забыть, по в машинном обучении (МЬ) доминирует этап оцен- ки. Он настолько важен, что всю главу 12 я посвящаю обсуждению некоторых необходимых свойств и процессов, которые настраивают для безупречного вы- полнения этого этапа. А пока просто помните, что именно на этом этапе созда- ется наибольшая ценность. И поскольку он должен стать вашей Полярной звез- дой, ему следует отдать высший приоритет. В МЬ этап оценки (8сопп§ 8(а§е) играет ведущую роль, поэтому все остальное должно быт ь настроено таким образом, чтобы мак- симально повысить качество и своевременность его прогнозов. На рис. 11.4 показано, как работает метод скользящего окна. От- правная точка — этап оценки (нижняя временная шкала). Предположим, вы хо тите сделат ь прогноз в момент времени Г. Этот период времени служит для того, чтобы разделить мир на два окна. Окно прогнозирования Обычно вас интересует прогнозирование события или случайной величи ны, связанной с каким-либо событием. Для этого вам нужно настроить окно
прогнозирования наступления этого события (1^ I + Р]. Например, вы хоти- те спрогнозировать, будет ли отток клиентов в ближайшие 30 дней. Или же вы хотите спрогнозировать выручку вашей компании в течение первого кварта- ла текущего года. Кроме того, вы можете спрогнозировать, оценит ли клиент книгу или фильм в течение двух недель после их прочтения или просмотра. Окно наблюдения Как только вы определите временной горизонт для вашего прогноза, вам нужно задать глубину исторических данных [г - О, (Название окна проис- ходит от того факта, что эту и только эту информацию мы наблюдаем во вре- мя оценивания. Обратите внимание, что окно прогнозирования специально открыто слева: это помогает предотвратить утечку данных, поскольку явным образом отделяет то, что вам известно на моменг про1нозирования. Обучение („-Р-0 <ГР Г. Окно наблюдение (размер = 0) Окно прогнозирования (размер = Р) Оценка 1г+Р Рисунок 11.4. Метод скользящего окна Чтобы лучше разобраться в этом подходе, давайте обратимся к примеру. Я хочу обучить модель, которая предсказывает для каждого клиента вероят- ность оттока в течение следующего месяца. Поскольку этап оценки самый важ- ный, предположим, я хочу оценить всех активных пользователей на сегодняшний день (^). По определению окно прогнозирования начинается с завтрашнего дня и заканчивается через месяц. На этом этапе у меня должна быть возможность оценить, ушел кто-либо из клиентов или остался. Чтобы сделать этот прогноз, я буду использовать информацию за последние три месяца — это будет моим ок- ном наблюдения. Любые изменения признаков ограничены этим периодом вре- мени. Например, я мог)’ полагать, что важен самый недавний период, поэтому я рассчитаю соотношение еженедельных взаимодействий четыре недели назад и одну неделю назад. Если это соотношение больше единицы, значит, вовлечен- ность увеличилась за последний месяц.
Выбор длины окна Возможно, вам интересно, кто выбирает длину окон наблюдения и прогнозиро вания и какие соображения принимаются во внимание. В таблице 11.1 приведе- ны некоторые основные критерии, которые необходимо учитывать при выборе длины обоих окон. Таблица 11.1. Критерии для выборе, длины окна ; ПрОГНОЗ (Р) Наблюдение (0) _ Владелец Бизнес — дата сайентист Дата -сайентист Предсказательная Достоверное ть краткосрочного Относительный вес отдаленного эффективность и долгосрочною прогнозирования прошлого Данные Доступные вам исторические Доступные вам исторические данные данные Продолжительность окна наблюдения дата-сайентист выбирает в первую очередь на основе предсказательной эффективности модели. Например, явля ется ли недавнее прошлое более полезным для прогноза? Окно прогнозирова- ния в первую очередь выбирается с учетом бизнес-соображений, касающихся своевременности принятия решения, и ответственность за него в основном ле- жит на стейкхолдерах бизнеса. Важно понимать, что более длительные окна прогнозирования обычно менее рискованны, то есть в них труднее ошибиться (например, сравните прогнозиро- вание существования общего искусственного интеллекта в течение следующей тысячи лет и в ближайшие два года). Но короткие временные горизонты тоже могут оказаться достоверными при подробной степени детализации ваших дан ных (например, при прогнозе оттока клиентов в течение следующих 10 минут, когда у вас есть только ежедневные данные). Наконец, длина окна прогнозирования влияет на выбор длины окна наблю- дения. Если финансовый директор попросит меня спрогнозировать выручку на ближайшие пять лет, то я могу использовать либо короткие окна наблюдения и динамические прогнозы (где прогнозы используются последовательно в каче- стве признаков), либо достаточно большое окно наблюдения, чтобы сделать та- кой героический прогноз. Этап обучения отражает этап оценки После выделения окон на этапе оценки вы будете готовы к настройке и опреде- лению этапа обучения. Как вы, наверное, догадались из рис. 11.4, этап обучения
всегда должен отражать то, что происходит на предыдущем этапе оценки; окна наблюдения и прогнозирования на этапе обучения точно соответствуют окнам на этапе оценки, то есть отраничены ими. Например, вполне обычная задача, когда вам нужно обучить модель на самых свежих данных в вашем распоряжении Поскольку вам потребуется Р периодов времени для оценки вашего прогноза и О периодов для создания ваших призна- ков, то вам нужно установить [г, - Р — О, ' — Р] в качестве обучающего окна на- блюдения, а (г - Р, у] в качестве обучающего окна прогнозирования Формальное определение этих окон помотает вам навести порядок и реали- стично оценить возможности модели. С одной стороны, это тарантирует, что для будущих прогнозов используются только исторические данные, что предо- твращает частые проблемы с утечкой. Вы можете наблюдать это в следующих уравнениях; Оценка: у. Р\1 Обучение: ; Г - Р-0,1 I р р Р Встраиваем скользящие окна в код Когда окна определены, вы можете встроить их в свой код с помощью пример- но фрагмента ниже: цпрог! йаТеП не Угон ДаТеитП. । еХаОлеаеИа 1нрог1 геТаТлеейеТЛа деб чиегу_с1а(:а(1еп_оЬ';: т.пГ, 1.еп_рге: гпГ): Н II II РипсИоп 1о диегу 1Ье Раю еп/огапд (Ье сЬосеп а^е игпс/ои;. Рединге; а соппесС-'.оп ю Тбе сатрапу’; аассйозе Агдз: 1еп_с1>5 (1п1): ЬепдСЬ 1п топРЬ; /ог оЬзегиаИоп нт.пс!он (0). 1еп_рге (т-ПС): ЬепдсЬ 1п тоШЬз /ог ргедхсИоп шт.пс1ош (Р). РеРигпг: в/: Рапда; Ои^аРюте ыИЬ нага /ог 1гат.т.пд гЛе поае1. II II II # ;ес Ме Ите цаг1ай1е5 1ос1ау = с1аГеГ1те. ОаТеМпеЛодауО
5азе_1:1пе = босау - ге1а6туес1е1.1:а("1от1П15 = 1еп_рге) # 1_р - Р 1пг1_1<гче = Ьаье_Г1те - ге1а(Л7ес1е1'1а(г1СпГНь = 1еп_о0з) епб-Мте = Ьа5е_Н|ле + ге1аН7еде1Та(попбб5 = 1ел_рге) т.п1Л_51г = тпгС_Няе.зЕгНгиеЕ '%У-%р ) Ьа5е_з1г = Ьазе_11пе зЕгНтпеС %У %п Еа ) епд_зГг = епс1_Г1Г1е абгРбтоеС %У-%г Чб ) # рггпТ То сЬеск ТРаТ ТЫпдз паке зелзе рггп^С^'ОЬзегуаИоп итогом (0={1еп_оЬ5}): [{1птЛ_51:г}, {Ьазе_5Т:г})') ргт.п1:(Р РгесНсНоп ю~пдо<* (Р г1ер_рге}): [{Ьаье_51г}, {епд_51:г}] ) # сгеаТе рое г у пу_яиегу = Г" 5ЕЕЕСТ 511М(СА5Е 'лНЕ1М бабе >= {1п11_б1г} АМО йабе < {Ьазе_зГг} ТНЕИ х_пеГг1с Е15Е 0 ЕНО) А5 пу_ЕеаТиге, 51)М(СА5Е ЫНЕМ дабе >= '{Ьа5е_51г}' АМО дабе <= '{епс1_5^г}' ТНЕМ у_пебггс Е15Е О ЕМО) А5 пу_оибсопе РВОМ иу_баЫе Г( II II рг1пУ(пу-Чиегу) # соппесТ То РаТаОаье опа Огтпд 1п тпе с!аТа # ыИ1 тагом ап еггог оТпсе тЬе петЬоа доезп’Т ех1$Т дР = соппес1_Ео_даЕаЬазе(п1у_чиегу, сопп_рагапеГег5) гекигп с1^ Подводя итог, можно сказать, что метод скользящего окна помогает вам со- блюдать базовое требование: для прогнозирования будущего можно использо- вать только данные из прошлого. Однако все еще могут быть другие причины утечки данных. Утечка данных: что делать сейчас? Как только вы обнаружите источник утечки, вам необходимо устранить его и пе- реобучить модель. Й одних случаях это довольно просто сделать но в других по- требуются время и значительные усилия. Ниже вы найдете список того, что мож- но предпринять для выявления источника утечки.
Проверьте временные окна Убедитесь, что вы всегда используете данные из прошлою для прогнозирова- ния будущего. Это можно сделать, соблюдая описанный выше строгий про- цесс создания временных окон. Проверяйте все выполненные преобразования данных и придерживайтесь реко- мендаций Лучше пользоваться конвейерами в 5с1кй-1еагп*9 или аналогичными инстру- ментами, чтобы гарантировать, что преобразования выполняются с исполь- зованием правильных наборов данных и что нет никаких утечек моментов или метаданных. Убедитесь, что вы досконально знаете бизнес-процессы, лежащие в основе созда- ния данных Чем больше вы знаете об этих процессах, тем легче выявить потенциальные источники утечки или квазиполного разделения при работе с классифика- ционными моделями. Итеративно удаляйте признаки Проводите на регулярной основе диагностическую проверку для выявления наиболее прогнозных признаков (в некоторых алгоритмах вы можете делать эго с учетом важности признака30). В сочетании с вашим пониманием бизнеса эго поможет вовремя заметить несоответствия Вы также можете попробо- вать итеративно удалить наиболее важные признаки и проследить, сильно ли изменится предсказательная эффективность на каждой итерации. Основные выводы Ниже представлены основные выводы из этой главы. Почему не стоит допускать утечку данных? При развертывании модели в продакшне утечка данных дает заниженную предсказательную эффективность по сравнению с ожидаемой по результатам 45 * * 45 йпр.<,://5С1к11-1еагп.ог^/!ЛаЫе/П1оЦи1е8/репега1ей/8к1еагп.р1ре1те.Р|’ре1те.Ь1т1 ” Иирз:/ту.'и-.ка^1е.сот/соЛе/ка811пПзку/1ор1С-5-еп5етЫе8-раг(-3-Геа1:иге-1трогТапсе/ поГеЬоок
тестовой выборки. Это приводит к разочарованию среди коллег и даже мо- жет подорвать к вам доверие со стороны стейкхолдеров. Выявление утечки Типичный признак утечки — необычно высокая предсказательная эффектив- ность вашей тестируемой выборки. Вы должны полагаться на свои знания проблемы и опыт работы компании с этими моделями. Всегда рекомендует- ся представлять свои результаты более опытным дата-сайентистам, а также обсуждать их со стейкхолдерами бизнеса. Если вы подозреваете утечку дан- ных, вам необходимо начать аудит своей модели. Что нужно проверить, если вы подозреваете утечку данных Проверьте, соблюдаете ли вы строгий процесс создания временных окон, который гарантирует, что вы предсказываете будущее на основе прошлого, а не наоборот. Также проверьте, нет ли у вас каких-либо преобразований дан- ных, при которых возможна утечка моментов или метаданных. В МВ этап оценки — самый важный Лакмусовая бумажка для модели МЕ — ее эффективность в нродакшне. Именно на ней вы должны сосредоточить все свое время и усилия. Дополнительная литература На мой взгляд, в большинстве опубликованных книг можно найти весьма по- верхностные описания проблемы утечки данных (многие упоминают об этом лишь вскользь). В интернете вы можете найти несколько полезных заметок, на пример: комментарий Кристофера Хефеле об утечке данных на соревнованиях по машинному обучению 1СМЕ 2013 \\Ъа1е СЬаПеп^е4 или пост51 52 Прерны Син- гх «Утечка данных в машинном обучении: как ее можно обнаружить и мини мизироватъ риск» (1)а(а Веака^е т МасШпе Веагп1п$ Ном> И Сап Ве Эе1ес(ес1 апб Мттгге 1ке Вг$к). Книга Кауфман и др. «Утечка в интеллектуальном анализе данных: воз никновение, обнаружение и предотвращение» (АСМ ТгапзасНопз оп Кпоибеб^е Огзсоуегу/гот &а1а 6, № 4,2012), — обязательна к прочтению для всех, кто хочет 51 Ь(1р5://\уу,’улка^§1е .сот/сотре11Ноп8/111е-1ст1-2013-«Ьа1е-с11а11еп{;е-пв111- иЪак-гейих/ н-п1еир8/5\уе<11811-с11еГ-1ке-1еака§е-апс1-1юн--11--\уа8-йхе<1#25839 52 1Шр5://1о\уэгс154а1а5с1епсе.сот/с1а1а-1еака$е-т-п1ас1ппе-1еагп1Пй-йоИ'11-сап- Ье-ЛеГесГеЛ- агн1-го1гпт17е-1Ье-п5к-8еЕ4еЗа97562
разобраться в этой теме. Авторы выделяют два типа утечек данных: происходя- щие от признака и от обучающих примеров. Я решил немного отойти от этой классификации. Что касается проблемы полного и квазиполного разделения, то классический источник здесь — статья А. Альберта и Дж. А. Андерсона «О существовании оце- нок максимального правдоподобия в моделях логистической регрессии» (Оп (Не ЕхШепсе о/Махгтит 1лкеНкоо<1 ЕзНта1ез /и То§1зИс Яе$геззюп Мо<1с1з) (ВютеТпка 71, № 1, 1984); это классика. Академическое изложение материала вы найдете в главе 11 книги Р. Дэвидсона и Дж. Г. Мак-Киннона «Теория и методы экономе- трики» (Есопоте(пс Тксогу ап<2 Ме1дос1з) (ОхТогб Пшуегзйу Ргезз). Проблема нерелевантных контрольных переменных хорошо известна в ли- тературе по причинному выводу и причинно-следственному машинному об- учению. Насколько мне известно, термин впервые появился в книге Ангриста и Пишке «В основном безобидная эконометрика» (Моз(1у Нагт1езз Есопоте1псз) (Ргшсе1оп Пшуегзку Ргезз). Ьолее свежее и систематизированное исследова- ние можно найти в работе Карлоса Чинелли и др. «Ускоренный курс по хороше- му и плохому контролю» (А СгазИ Соигзе т Соос1 апд ВаЛ Соп1го1$) (8ос1о1о§1са1 МеЛобх апб КезеагсЬ, 2022). В этой главе я использовал довольно свободное определение нерелевантной контрольной переменной (Ьаб соп1го1).
ГЛАВА 12 Вывод модели в Продакшн Как говорилось в главе 11, в машинном обучении (МЬ) самое важное место за- нимает этап оценки, поскольку именно он создает всю ценность. Для освоения всех связанных с ним тонкостей весьма важно вводить новые специализирован- ные должности, такие как инженер по МЬ и МЬОрь. Однако многим компаниям по-прежнему не хватает таких специалистов, из-за чего эта работа становится частью обязанностей дата-сайентиста. Эта глава дает общий обзор готовых к продакшну моделей, предназначен- ных специально для дата сайен гнетов. В конце главы я приведу несколько ссы- лок на источники, которые помогут вам глубже разобраться в этой относитель- но новой теме. Что означает «готовность к продакшну»? В своей книге «Проектирование систем машинного обучения» (Г)ез1$’пту МасНте Ьеатту $уз!етз: Ап НегаНуе Ргосезз /ог Ргос1исНоп-Кеа(1у АррИсаНопз) (О’КеШу) Чип Хьюен утверждает, что процесс вывода модели машинного обучения в Про- дакшн, или внедрения в эксплуатацию, включает в себя «развертывание, мони- торинг и поддержку». Итак, давайте сформулируем рабочее определение: вы- вод модели в продакшн — это развертывание, мониторинг и поддержка модели в рабочем состоянии. Оценка Потребитель Рисунок 12.1. Категории готовых к продакшну моделей
Более прямое определение таково: модель готова к продакшну, когда она на строена для использования конечным пользователем, будь то человек или систе- ма. Под использованием я подразумеваю получение прогнозных оценок, которое может происходить в автономном режиме или онлайн, может быть выполнено человеком или другой системой/сервисом (рис. 12.1). Пакетная оценка (ВаТсН 5соге$) (автономно) Пакетная оценка — это, как правило, создание прогноза для группы строк в таб- лице (будь то клиенты, пользователи, продукты или любой другой объект) по на- бору столбцов или признаков. Эти оценки сохраняются в таблице для последу- ющего использования. Пакетная оценка очень распространена, когда: — предсказательная эффективность не сильно улучшается при наличии са- мых свежих данных; — вам не нужно принимать решение по основе самых свежих данных; — у вас нет технических средств, инфраструктуры или квалифицированных специалистов, чтобы развернуть модель для использования в режиме ре- ального времени. Например, если вы хотите спрогнозировать отток клиентов в течение следу ющего месяца, наличие подробных сведений об их взаимодействиях за послед- нюю минуту не должно существенно улучшить качество прогнозов. Это делает пакетную оценку подходящим методом для ввода модели в продакшн. В таблице 12.1 показан пример сохранения оценок в таблице. Обратите вни- мание, что для детализации таблицы используется сич1:опег_1д х 1т.пе51:атр, что позволяет вам хранить историю всех прогнозов по клиентам. Таблица 12.1. Пример таблицы с пакетными оценками СиЦотегШ 5соге 1 0.72 2022-10-С1 1 0.79 2022-11-01 2 0 28 2022-10-01 2 0.22 2022-11-01
Рисунок 12.2. Оценки МЬ как часть хранилища данных Такая запись довольно удобна для пользователей-людей, поскольку для из- влечения данных можно использовать простой ЗС^Ь-запрос к аналитической базе данных. Более того, если вы сделаете ее частью своей модели данных (ска- жем, своего хранилища данных), ее можно использовать для создания более сложных запросов по необходимости. На рис. 12.2 показана упрощенная схема такого процесса. Здесь вы найдете две таблицы5’ фактов, в одной из которых по- казана оценка одной конкретной модели МБ, а в другой — показатели бизнеса (например, продажи), и несколько таблиц измерений53 54. Связи между таблицами фактов и измерений означают, что они мозут быть объединены с помощью пер- вичных или вторичных ключей. Создание слоя оценки как части вашего храни- лища данных может облегчить его использование, поскольку позволяет легко объединять и заполнять таблицы. Клиенты Рисунок 12.3. Конвейер для системного использования оценок Схема выше также может работать для системы или сервиса, если задерж- ка не играет ключевой роли. Обычно ее используют, когда на основании оцен ки запускается коммуникацию с вашими клиентами (например, в кампании по удержанию или перекрестным продажам). Конвейер сначала запрашивает 53 ЬПр3://еп.у.1к1рес11а.ог§/\У1кЪ Рас(_ 1аЫе 54 ЬНр$://еп.\У1к1рес11а.ог§,'\\’1к1/О1теп5Юп_(с1а1а_1л'агеЬ.ои5е)#В)теп51Оп_1аЫе
базу данных, возможно, отфильтровывая самые недавние оценки, и затем эти Ю клиентов отправляются в коммуникационное приложение, которое отправ- ляет электронные письма или 8М8 (рис. 12.3). Объекты модели реального времени Модели реального времени обычно хранятся не в виде таблиц, а скорее в виде се- риализованных объектов, которые можно использовать в режиме онлайн по мере поступления новых данных. На рис. 12.4 показано, как работает этот процесс: ваши модели находятся в хранилище (тобе! 81оге), например в 83 или более спе- циализированном инструменте, таком как МЫ1о\у55 или А\У8 5а§еМакег56. Важно, что эти объекты могут быть использованы другой службой, которая берет самые последние данные для одного конкретною примера (например, кли епта или транзакции) и создает единую прогнозную оценку. Как показано на ди- аграмме, часто вектор признака для одного примера включает в себя как данные в реальном времени, так и пакетные данные. Важно отметить, что вектор дол- жен точно соответствовать тому, что вы использовали при обучении модели. Рисунок 12.4. Пример онлайн-оценивания Из этой диаграммы зы уже можете видеть сложности, возникающие при онлайн-оценивании. Архитектура данных Ваша модел ь данных должна позвол ять запрашивать данные в режиме реаль - пого времени и пакетные данные, поэтому в конечном итоге вам может по надобиться что-то вроде лямбда- или каппа-архитектуры (1атЬба ог карра). 55 11Пр5://т1Яо'Л.ог§/ 56 11Нр5://а1У8.атагоп.сот/ги/8а§етакег/
Функция как услуга (РипсНоп аз а 8етсе, Раа8) Ваш дизайн также должен позволять использовать данные и обьект моде- ли «на лету», для чего обычно прибегают к Еаа8 с поставщиками облачных вычислений и архитектуры микросервисов Как только вы выведете оценку, она будет использована другой службой, которая, например, выводит реше- ние на основе оценки и бизнес-правила Дрейф данных и модели Согласно одному из подходов, машинное обучение заключается в том. что вы пытаетесь обучить процесс генерации данных (ЦСР) для получения целевой пе- ременной, имея в распоряжении некоторый набор данных. Когда все выполнено правильно, вы можете делать прогнозы на основе аналогичных данных Истинный ПСР : у =/( IV) Изучение ВОР . [у, Л}, =>/() Первое уравнение обозначает истинный БСР, который связывает целевую переменную с набором истинных базовых ковариаг (И7). Второе уравнение по- казывает процесс обучения этого ОСР с использованием данных, доступных в данный момент времени, включая целевую переменную (у) и признаки (X). Обратите внимание, что набор признаков не обязательно должен совпадать с истинными базовыми ковариатами. Поскольку оценка играет самую важную роль, вы должны тщательно следить за качеством прогнозов в любой ситуации. Производительность модели может изменяться со временем по двум основным причинам — дрейф данных или мо- дели. Когда совместное распределение ваших данных меняется во времени, воз- никает дрейф данных. При изменении базового Г)СР происходит дрейф модели. Если вы не будете периодически переобучать свою модель, дрейф данных или модели приведет к снижению предсказательной эффективности. Поэтому вам следует проводить надлежащий мониторинг вашего производственного конвей ера, а также периодическое переобучение. Многим людям вначале трудно понять, что такое дрейф модели, поэтому я объясню этот термин на двух примерах. Предположим, вы хотите повторить эксперимент Галилея с наклонной башней: вы бросаете теннисный мяч с вы- бранной высоты, чтобы измерить время до момента его удара о землю. Вы со- бираете данные о высоте и времени и оцениваете линейную регрессию следу- ющим образом: х = а0 + аф + аф2 + €
Истинный ВНР определяется законами физики, в частности силой притяже- ния. Поэтому он будет отличаться в зависимости от того, проводите ли вы экс- перимент на Марсе или на Земле. Другой пример, более близкий к бизнесу, связан с модой и влиятельными людьми. Боюсь, что я слишком упрощаю, но позвольте мне предположить, что вероятность покупки вашего продукта каким-либо клиентом г зависит от цены и других факторов (Миф; РгоЬфигсЬазе, = Тгие) = #(р, МиГГ) Это ПСР для клиента г, о котором я не знаю, но готов поспорить, что он мо жет измениться, если вдруг Чонгук (южнокорейский певец, автор песен и му- зыкальный продюсер. — Прим, пер.) начнет продвигать продукт в социальных сетях. В частности, для клиентов из сегмента, где любят корейскую поп-музыку и следят за ним, я бы ожидал увидеть более низкую неновую чувствительность. Для старого ПСР#() произошел бы дрейф к какому-либо^ (). Поучительная история о дрейфе модели; 2П1ош ОНег$ В 2021 юду торговая площадка недвижимости 2л11ом' понесла убытки в размере более 500 миллионов долларов в одном из самых известных слу- чаев дрейфа модели Чтобы понять, что произошло, представьте, что у вас есть хорошая модель прогнозирования цен на недвижимость. Вы можете покупать объекты, если предсказываете, что их цена вырастет, и получать прибыль за счет разницы в цене (купить дешево, продать дорого). 211] охм ОЙ'етз был продуктом, который пытался делать именно это. Сна- чала все шло отлично и компания масштабировала продукт, но в какой- то момент модель начала дрейфовать, и ее прогнозы перестали быть точ- ными. В итоге компания оказалась владельцем объектов, которые можно было продать только в убыток. Если бы ХШотс отслеживала и переобуча- ла свою модель, у нее был бы шанс изучить новый процесс генерации дан ных и принимать верные решения о покупке. Основные этапы любого конвейера в продакшне На рис. 12.5 показаны наиболее необходимые этапы, которые должны входить в большинство конвейеров машинного обучения. В соответствии с рекомен дацией из главы 11, для этапов оценивания и обучения выполняются разные
задачи, но у них есть несколько общих шагов. Обратите внимание, что я исполь зую более светлый оттенок серого для обозначения этапов, на которых вы со- храняете метаданные для мониторинга. Ниже я опишу каждый этап более под- робно. Рисунок 12.5. Универсальные конвейеры продакшна Получение и преобразование данных Как следует из названий, этап деб_ба!а() создает соединение и запрашивает источник данных; эти данные необработанные, поэтому этап 1гап5(:огт_с1аба() применяет предопределенный в памяти набор преобразований к некоторым или всем столбцам вашей таблицы. Обычно первый метод выполняется на 80Ь, а второй можно запустить с помощью РуГЬоп (или 8рагк). Сейчас я разделил эти два этапа, однако в зависимости от характера задачи может оказаться целесообразным объединить их в один этап. Давайте рассмо трим плюсы и минусы такого модульного разделения. Деление на модули — как правило, хорошая практика: оно позволяет упро стить и ускорить отладку, управление данными и моделями. Однако оно может привести к вычислительным затратам или ограничениям, которые лучше избе- жать путем передачи обеих операций механизму запросов. Это особенно акту- ально, поскольку механизмы запросов обычно оптимизированы и обеспечены ресурсами для обработки больших наборов данных, тогда как у вас может ока- заться меньше мощностей для преобразования небольшого полмножества дей- ствительно необходимых данных. Хотя отлично подходит для запроса табличных данных, он может быть недостаточно гибким для проведения сложных преобразований, которые легче выполнить с помощью РпЬоп или 8ратк.
Кроме того, разделение позволяет провести прицельный и полностью неза- висимый этап трансформации. Это важно, поскольку проектирование призна- ков57 играет решающую роль в разработке эффективных моделей МЬ. Следо- вательно, разделение на модули позволяет более тщательно документировать и анализировать основные преобразования вашей модели. Наконец, разбивать каждый этап на независимые модули полезно: это уско- ряет проверку кода и, следовательно, сокращает циклы развертывания. Если у вас недостаточно памяти для выполнения некоторых преобразований, но механизм запросов способен выполнять некоторые вычисления с большим объемом памяти, иногда рекомендуется перенести некоторые или все преобразования на этап запроса. Можно с уверенностью предположить, что эти этапы общие для конвейеров обучения и оценки. Это объясняет, почему я решил использовать в схеме в каче стве названий функции. Если вы используете метод скользящего окна, описан ный в главе 11, то метод деб_ба1;а() можно легко параметризовать для запроса данных за заданный промежуток времени. Выходные данные для этапа Ргап5<:сгт_с1аСа() в конвейере обучения — это конечные массивы, необходимые для обучения вашей модели. Для контролиру- емого обучения это выглядело бы примерно так: ^гапз<:о"т_<1а1а(де1:_г1ага(0а1а)) => у, х Что касается данных для оценки, то это всего лишь массив признаков X. Проверка достоверности данных Это первый этап мониторинга для каждого конвейера. Он используется для хра нения метаданных и оповещения о наличии дрейфа данных. Его можно разде- лить на два подэтапа. 1. Расчет и хранение статистики. Вычислите набор предопределенных статистических данных по распределению результатов и признаков и со- храните их в таблице. 2. Проверьте наличие дрейфа дачных. Учитывая только что сохраненную те- кущую и историческую статистику, запустите тест, чтобы определить, яв ляются ли изменения чистым шумом или сигналом. Результатом должно быть предупреждение или его отсутствие. 57 йПр5://еп.\с1к1реЛ1а.ог§/и'11о/Беагиге_ епрпеепп^
В таблице 12.2 показан пример таблицы, в которой хранятся метаданные о распределении для всех моделей компании. В этой таблице можно хранить де- цили результатов и признаков для всех моделей, а также для этапов обучения и оценки; через применение фильтров ее легко использовать для составления от- четов, тестирования и мониторинга. Таблица 12.2. Пример таблицы с децилями 1 Модель Этап Метрика Дециль Ценность Отметка времени 1 отток обучение результат сП 100 2022-10-01 результат результат ЛО 1850 2022-1С-01 отток обучение признак 1 (11 -0.5 2022-10-01 признак 1 признак 1 оЮ 1.9 2022-10-01 В этом примере я решил сохранить децили для каждой переменной! в наборе данных, поскольку они содержат довольно мною информации из соответству- ющих распределений. Для тестирования есть множество альтернатив. Если у вас достат очно исто рии и вы хотите следовать традиционной проверке гипотез, вы можете выпол нить регрессию для каждой метрики и дециля (<2 ), например: с! — ос -*- В / + С т, I т ' т т, I где I, как признак обозначает временной тренд: если значение р для /' ниже же- лаемого порогового уровня (10 %, 5 %, 1 %), вы можете отклонить нулевое гипо тезу о том, что параметр равен 0, что свидетельствует о дрейфе метрики т. В качестве альтернативы вы можете использовать непараметрический тест, который описан в главе 9. Там вычисляются верхние и нижние квантили в исто- рических распределениях и проверяется, находится ли новое наблюдение в пре делах этого доверительного интервала (например, для вычисления 95% довери- тельных интервалов вы вычисляете Некот орые люди предпочитают запускать тесты Колмогорова — Смирнова58; при этом вам нужно сохранить другой набор метаданных, но логика та же. 58 И1р8://еп.у<1к1рес11а.огц/тк1/Ко1.-т1о§огоу%Е2 %80 %9Э8гшгпоу_1ея1
Что бы вы ни решили использовать, я рекомендую делать это максимально просто. Часто все, что вам нужно, — это даш- борд, который отображает эти метаданные и позволяет на- страивать простые оповещения о происходящих изменениях Когда вы выпускаете модель в продакшн, часто лучше при- держиваться принципа «чем проще, тем лучше». Этапы обучения и оценки Как только ваши данные для обучения готовы, вы можете приступить к формаль- ному процессу опушения. В ходе него обычно выполняются следующие действия. 1. Разделение выборки на обушающие, тестовые и проверочные подвыборки. 2. Оптимизация метапараметров и сведение к минимуму функции потерь. Результат этапа бга1п_тсбе1() — объект модели, который может быть ис- пользован для прогнозирования: Сга’.п_поае1.(1:гапз<:О1 ш_с1а(:а(др1_<1а1а(0а1а))) => / () Метод эсоге_с!а1а() тоже использует некоторые признаки х для прогноза или оценки: 5Соге_да1а(Сгапз1:огт_с1а1:а(дег_с1ага(0а1а)), ^()) => 5 Как упоминалось ранее, эта оценка может быть сохранена в таблице для ав тономного использования или передана другому сервису для работы в режиме онлайн Проверка модели и оценок Прежде чем двигаться дальше, стоит еще раз сохранить некоторые метаданные, которые помогут создавать оповещения о дрейфе модели или данных. На этом этапе я хогел бы создать те же метаданные в ча1Аба1:е_даба(), но с переда- чей оценок тестовой выборки (уа1г<1а^е_гтобе1()) или фактических оценок (уа11ба1:е_,5соге$()). Если вы пойдет е по этому пути, вы будете использовать предыдущий метод повторно, но при этом по этапам и конвейерам просто пере- дадите другой набор данных; все остальное уже предусмотрено (например, об- новление таблицы метаданных и оповещения). Обратите внимание, что для работы в режиме онлайн вам необходимо со брать достаточно данных для проверки, но логика, по сути, будет та же.
Развертывание модели и оценок Как следует из названий, цель этих этапов — сохранение модели и оценок. Для конвейера общения вам нужно будет сериализовать объект модели и сохранить его, используя какое-либо постоянное хранилище (например, диск, 53 Ьискет и т. и.). Внедрение правильных соглашений по именованию59 и управлению вер сиями60 поможет систематизировать учет моделей. Тема сериализации моделей важна и носит технический характер, поэтому в конце этой главы я приведу дополнительные ссылки на литературу. Использование оценок зависит от режима работы с моделью — автономном или онлайн. При оценивании в автономном режиме вы просто записываете ре- зультаты в таблицу, которая будет доступна для использования. При оценива- нии онлайн вы должны не только сделать оценку доступной для использования другим сервисом, но и сохранить ее в таблице. Основные выводы Ниже представлены основные выводы из этой главы. Оценивание — важнейший этап. Вывод вашей модели в продакшн должен быть самой приоритетной задачей, поскольку только рабочие модели могут со- здавать ценность для организации. Что такое готовность к продакшну? Модель является рабочей, когда она готова к использованию. Поскольку в большинстве случаев к модели будут обращаться в разные периоды време- ни, необходимо создать процесс, гарантирующий стабильную предсказатель- ную эффективность модели. Дрейф модели и данных Дрейф модели происходит, когда процесс генерации данных для вашего ре- зультата изменяется. Дрейф данных относится к изменениям в распределе- нии ваших результатов и признаков. Если их нс обрабатывать, дрейф данных и модели со временем приведет к снижению предсказательной эффективно- сти. Лучший способ избежать дрейфа — это периодически переобучать свои модели. 59 Ьир8://у18иа1§1(:.геа<11Ъе<1ос5.1о/еп/1агеМ/ра§е5/пат1п$_сопуепНоп.Ьйп1 60 ИПрзУ/зетуег.огу/
Конвейеры для продакшна Рекомендуется разработать минимальную структуру для ваших конвейеров продакшна. Здесь я предлагаю создать модульные и раздельные конвейеры обучения и оценки, в которых некоторые методы или этапы будут общими. Крайне важно, чтобы вы включили этапы создания и хранения метаданных, которые будут оповещать вас о появлении дрейфа в модели или данных. Выбирайте простые решения Развертывание в продакшне представляет собой сложную последователь ность шагов, поэтому рекомендуется делать каждый из них как можно бо- лее простым. Ненужная сложность может в конечном итоге усугубиться, что очень затруднит поиск источника проблемы, когда она возникнет (а она обя загельно возникнет). Дополнительная литература Книга эксперта Чипа Хьюена «Проектирование систем машинного обучения» великолепна и содержит много важных технических деталей, опущенных в этой главе. Настоятельно рекомендую. Я нашел очень полезной книгу Валлиаппы Лакшманана и др. «Машинное об- учение. Паттерны проектирования» (МаМпе 1еагтп$ Ое$1§п РаНегпз: 8о1иНопз 1о Соттоп СИаИепдез /н Иа1а Ргерагабоп, Мос1е1 ВиИсИп%, апб МЬОрз) (О'КетПу). Авторы собрали различные методы проектирования в МЬ, которые можно при- менять повсеместно. Поскольку книга написана тремя инженерами Соо§1е, вы обнаружите, что их примеры в значительной степени опираются на инфраструк- туру Соо§1е, поэтому часто бывает неочевидно, как применять их при работе с другими поставщиками облачных услуг. Но если вы сумеете абстрагироваться от этих тонкостей, то книга будет полезной. В заметке Куртиса Пайкса «5различных способов сохранить вашу модель ма- шинного обучения» (5 Офегеп1 \Уауз 1о 8аVе Уоиг МасИте Реагтп#Мо(1е16') описы- ваются различные способы сериализации вашей МЬ-модели В статье Лу и др. «Обучение и дрейф концепции: обзор» (Ьеагпт%ипбег Сопсер! Ип]т. А Реу1ек) (апрель 2020 год, агХту61 62) представлен всесторонний обзор кон- цептуального дрейфа, который иногда охватывает дрейф данных и моделей. 61 Ь11р8://1о^агс15Йа1а5С1епсе.сот/5-<11гТегеп1-И’ауз-го-5ауе-уоиг тасЫпеЛеацнг.у-тойе!- Ь7996489<1433/ 62 Ьггр8://агх1У.ог§/р<117201)4.05785
О дрейфе, который произошел в компании 2Шом', вы можете прочитать в ста- тье Джона Шварца «2Шо\е навсегда прекращает перепродажу домов, поскольку это может привести к потере более 550 миллионов долларов, увольнению чет- верти персонала»63 в Магке1\Ча1ск (ноябрь 2021 года) или в статье Анупама Датты «Опасности дрейфа ИИ-модеди: уроки, которые следует извлечь из опыта ком- пании 2Нкж»м (ТИе А1 }оигпа1, декабрь 2021 года). 63 Ипр8://\\элэу.тагке1ка1сЬ.согп/Могу/2Шо\у-1о-81ор-Я1рр1п§-Ьоте8-Гог-роос1-а8-к-!,1:апЙ8-1о- 1о8е-то1е-1Ьап-550-гт11юп-\\т11-1ау-о(Г-а-диаг1ег-о1;-81а1Г-11635885027 04 Ьир3://а1)оигп.сот/111е-<1ап$егь-оЕ-а1-тос1е1-с1пЙ-1е88ОП8-(о Ье-1еагг.е<1 Ггот-1Ье-са8е-оГ- 2111о^'-ойег8/
ГЛАВА 13 Сторителлинг в машинном обучении В главе 7 я утверждал, что дата-сайен гисты должны совершенствовать свой на- вык сторителлинта. Это справедливо в целом, но особенно — в отношении ма- шинного обучения. В этой главе вы познакомитесь с основными аспектами сторителлинга в МБ, начиная с проектирования признаков и заканчивая проблемой интерпретиру- емости Целостный взгляд на сторителлинг в М1 Сторителлинг в МЬ исходит из двух взаимосвязанных, но разных ролей (рис. 13.1). Более известная из них — роль продавца, где вам необходимо взаи- модействовать с аудиторией, возможно, для привлечения или поддержания за ингересованности стейкхолдеров. Это обычно происходит после того, как вы разработали модель. Менее известная роль — роль ученого, где вам нужно най- ти гипотезы, которые будут направлять вас на протяжении всего процесса раз- работки модели. Роль ученого Роль продавца Рисунок 13.1. Сторителлинг в МЬ
Поскольку первую роль бы берете на себя после разработки модели, я назы- ваю сторителлинг на этом этапе ех роз1 (после); роль ученого в основном исполь- зуется до (ех ап1е) и во время (т1ег(т) процесса обучения модели. Ех а пГе и т1епт сторителлинг Сторителлинг ех апте состоит из четырех основных этапов: определение про- блемы, выдвижение гипотез, проектирование признаков и обучение модели (рис. 13.2). Обычно этапы идут в этой последовательности, однако между ними существует обратная связь, поэтому нередко, обучив первую модель, вы итера- тивно дорабатываете признаки, гипотезу или даже саму проблему. Рисунок 13.2. Сторителлинг ех ап1е Первый шаг — всегда определение проблемы: что вы хотите предсказать и почему7 Это лучше сделать как можно раньше и совместно со стейкхолдера ми, чтобы .заручиться их поддержкой: без нее большинство многообещающих МЬ-проектов терпят неудачу. Как я писал в главе 12, модель хороша только в том случае, если она была вы ведена в продакшн. Вывод в продакшн — дорогостоящее мероприятие не только с точки зрения затрат времени и усилий, но и с позиции любого альтернативно го проекта, над которым вы могли бы работать (альтернативные издержки). По этому всегда полезно задать себе вопрос: действительно ли для этого проекта необходимо внедрение МЬ? Не попадайтесь на удочку, занимаясь МЬ только по- тому, что это модно или весело: вашей целью всегда должно быть создание мак- симальной ценности, а МЬ — это всего лишь еще один инструмент в арсенале. Наконец, при определении проблемы продумайте ответы на вопросы — Как будет использоваться эта модель? — Какие рычаги можно задействовать, используя прогнозы модели? — Каким образом это повышает эффективность принятия решений в вашей компании?
Продуманные ответы будут полезны в написании бизнес-обоснования для разработки модели МЬ, что повысит вероятность успеха. Есть общее правило: чем раньше вы подключите стейкхолде- ров к обсуждению проблемы, тем лучше. Это поможет с само- го начала заручиться их поддержкой. Также убедитесь, что М1_ подходит для решения поставленной задачи: ее развертыва- ние, мониторинг и сопровождение требуют больших затрат, и у вас должно быть для нее хорошее бизнес-обоснование. Создание гипотез Когда вы четко определили проблему, наступает время примерить роль ученого и начать выдвигать гипотезы. Каждая гипотеза — это история о движущих си- лах вашего прогноза; именно поэтому мы можем сказать, что ученые занимают- ся сторителлингом. Хорошо продуманные истории повышают предсказательную эффективность вашей модели. На этом этапе есть два ключевых вопроса: что я предсказываю и какие фак- торы влияют на прогноз? На рис. 13.3 показан общий обзор задач прогнозиро- вания и их взаимосвязи с имеющимися в вашем распоряжении рычагами. Пони- мание рычагов влияния имеет решающее значение для того, чтобы М1.-модель создавала ценность (глава 1). Рисунок 13.3. Последовательность «рычаг — поведение — метрики» Отсюда следует, что большинство задач прогнозирования относятся к одной из нижеперечисленных категорий. Метрики, на которые влияет поведение человека Во многих случаях интересующая вас метрика зависит от того, как ваши кли енты действуют. Например, нажмут ли мои пользователи на баннер? Будут ли они приобретать продукт по базовой цене? Уйдут ли они в следующем меся- це? Сколько времени они проведут на торговой площадке?
Метрики, на которые влияет поведение систем Метрики также зависят от того, как работают ваши системы Один из на- иболее известных примеров — оптимизация центров обработки данных и, в частности, решение проблемы воздушного охлаждения. Другой при- мер — прогнозирование времени загрузки вашей веб-страницы, которое, как было установлено, напрямую влияет на метрики оттока. Метрики конечного потребления Во многих случаях вас интересуют только совокупные метрики конечного по- требления, такие как выручка. Часто это справедливо для дата-сайентисгов, работающих непосредственно в сфере финансового планирования и анали- за (РР&А). Многие дата-сайент исты сталкиваются с трудностями при со- здании и проектировании прогнозных признаков. Общая ре- комендация: всегда начинайте с того, чтобы записать и обсу- дить с другими список гипотез для задачи прогнозирования. Только после этого следует приступать к проектированию признаков. Не забудьте записать свои ар^менты в пользу пра- вильности гипотезы. Только с вескими доводами вы сможете проверить свою логику и улучшить исходную историю. Вот некоторые общие рекомендации для составления гипотез по задаче. Хорошо изучите проблему Секретный ингредиент создания по-настоящему эффективных МЬ-моде- лей — глубокие предметные знания. Будьте любопытны Это одна из определяющих черт дата-сайентиста как специалиста. Бросьте вызов существующему положению вещей Не бойтесь бросить вызов сложившемуся положению вещей. Другими сло- вами, ставьте под сомнение свои собственные гипотезы и проводите новую итерацию (будьте внимательны к любым признакам предвзятости с вашей стороны). А теперь давайте перейдем к более конкретным рекомендациям о том, как подойти к поиску и формулированию ваших гипотез.
Прогнозирование поведения человека При прогнозировании человеческого поведения полезно всегда помнить, что люди делают то, что они хотят и могут делать. Возможно, вы хотите поехать в Италию, но если не можете себе этою позволить (по деньгам или по времени), то поездка не состоится. Предпочтения и доступность ресурсов имеют первосте- пенное значение при прогнозировании поведения человека, и понимание этого может значительно помочь вам в создании гипотез по вашей задаче. Бросьте вызов существующему положению вещей: уроки с передовой Не так давно дата-сайентист из моей команды работала над прогнозной моделью для кампании по кросс-продажам относительно нового продук- та, у которого были проблемы с популярностью и масштабированием. Его ценностное предложение было довольно слабым, поэтому понять, какие клиенты будут готовы покупать его и использовать, было очень сложно (а значит, столь же сложно было построить модель, которая бы это пред сказывала!). Я работал вместе с ней, и после тщательного анализа самого продукта, его ценности и нашей клиентской базы мы пришли к выводу: пока про- дукт не будет серьезно переработан, мы не достигнем соответствия рынку. На то, чтобы убедить в этом стейкхолдеров, у нас ушел почти год, и в не- которые моменты они были недовольны нами. Чтобы понять мотивы, вам придется по-настоящему' глубоко разобраться в своем продукте. Зачем кому-то понадобилось его покупать? Что такое цен- ностное предложение? Какие клиенты были бы готовы заплатить за него? Еще один прием — задействовать свою эмпатию к клиентам. Спросите себя, что бы вы сделали на их месте? Конечно, лучше, ко! да вам проще поставить себя на их место (мне было бы действительно трудно поставить себя на место влия тельного человека или профессионального боксера). Этот прием может хорошо сработать, но имейте в виду, что вы можете быть нетипичным клиентом, поэто му давайте перейдем к следующему методу. С самого начала стремитесь понять и смоделировать своего средпестати стического потребителя. Прежде всего вы должны правильно оценить первич- ные эффекты; это означает, что моделирование средней единицы анализа по- зволит вам значительно повысить эффективность прогнозирования. Я видел, как многие дата-сайентисты начинали выдвигать гипотезы о пограничных сце- нариях, которые окажут незначительное влияние на обшую предсказательную
эффективность Пограничные случаи интересны и важны, но для прогнозиро- вания почти всегда лучше начинать со среднестатистических. Прогнозирование поведения системы Некоторые описанные выше подходы также применимы к прогнозированию по ведения системы. Основное отличие заключается в том, что, поскольку у систем нет целей и разумности, вы можете ограничиться пониманием технических уз- ких мест. Вам необходимо изучить технические особенности вашей системы. Чем боль- ше вы будете знать о физических О1раничениях, тем легче вам будет выдвигать гипот езы. Прогнозирование метрик конечного потребления Метрики конечного потребления одновременно сложнее и проще прогнозиро- вать, чем отдельные показатели, которые определяются поведением человека или системы. Сложнее, потому что чем больше метрика удалена от основопола- гающих факторов влияния, тем слабее и расплывчатее становятся ваши гипо- тезы. Более того, возникает сложность с формированием историй об этих фак- торах влияния, которые к тому же могут накладываться друг на друга, создавая комплексную проблему более высокого уровня Однако во многих случаях вы можете опустить детали и использовать вре- менные и пространственные корреляции для создания признаков. В некотором смысле вы соглашаетесь с тем, что любые ваши версии будут опровергнуты про- стой структурой авторегрессии, которая распространена во временных рядах и пространственных моделях авторегрессии. Техника ГеаТиге Епдтееппд (генерация признаков) В целом, техника/еаШге еп§теепп§ (генерации признаков; предполагает прео- бразование гипотез в измеримые переменные, которые имеют достаточный сиг- нал, чтобы помочь вашему алгоритму изучить процесс генерации данных. Реко- мендуется разделить этот процесс на несколько этапов, как показано на рис. 13.4. Рисунок 13.4. Процесс генерации признаков
Ниже перечислены этапы генерации признаков Создание набора идеальных признаков Первый шаг — вывести из ваших гипотез идеальные признаки, которые по- зволят точно все измерить. Этот шаг важен, гак как позволяет создать точку отсчета для второго этапа. Примером может служить роль, которую играет интенциональность в раннем оттоке (клиенты, которые попробовали продукт один раз и ушли). Одна из гипотез заключается в том, что эти клиенты на самом деле не соби- рались использовать продукт (они просто пробовали его, продажа была сти- мулирована, имел место обман покупателей и т. д.). Было бы здорово, если бы у вас была возможность спросить их и получить правдивый ответ, верно? Но, к сожалению, это нереально и недостижимо Поиск реалистичных признаков, приблизительно соответствующих идеальным Если вы понимаете, что идеальный набор признаков недоступен, вам нужно найти хорошие замещающие признаки, то есть коррелирующие с идеальны- ми. Во многих случаях степень корреляции может быть очень низкой, и вам придется довольствоваться включением контрольных переменных с очень слабым соответствием первоначальной гипотезе. Пример последнего — влияние культуры на предпочтения и, следователь- но, на вероятность приобрести тот или иной продукт. Например, культурные различия могут объяснять, почему пользователи в разных странах принима- ют или отклоняют файлы соокте в браузере (люди из некоторых стран могут с осторожностью относиться к обмену этой информацией). Измерить культу- ру непросто. Но если вы подозреваете, что вариации на уровне стран возни- кают по большей части из-за культурных различий, то вам нужно включить фиктивные переменные по странам. Получится относительно слабый набор признаков, поскольку он будет представлять любой признак этого уровня (например, различия в нормативно правовой среде), а не только культур- ное влияние. Преобразование признаков В этом процессе происходит извлечение максимального сигнала из ваших признаков путем применения к ним серии преобразований. Обратите вни- мание, что я немного отклоняюсь от литературы, поскольку в большинстве учебников генерацию признаков соотносят только с этим этапом. Здесь мы проводим преобразования, такие как масштабирование, би- наризация и однократное кодирование (опе-Ьо1 епсосЬп^), вычисление
пропущенных значений, взаимодействие признаков и тому подобное. В кон- це этой главы я привожу несколько ссылок на литературу, в которой вы най- дете широкий спектр доступных преобразований. Важно отметить, что преобразования зависят от ваших данных и вы- бранного вами алгоритма. Например, при использовании деревьев класси- фикации и регрессии вам, возможно, не придется самостоятельно устранять выбросы — алгоритм сделает это за вас. Аналогично, при использовании в целом нелинейных алгоритмов, таких как деревья и ансамбли на их основе, вам не нужно включать мультипликативные взаимодействия. Пример: прогнозирование продаж Предположим, вы хотите прогнозировать объем продаж в определенной географической зоне (^). В таком случае модель обычно используется для предсказания времени, когда необходимо направлять торговый персонал в локации с наибольшим потенциалом продаж. Я возьму прием из главы 2, чтобы получить более четкие гипотезы: за1ез 8а1ез - ТАМ х / = ТАМ х РтоЬ(ипй за1е ши) « х ТАМ « 6 Это уравнение показывает, что общий объем продаж в точке § должен равняться общему объему целевого рынка (1о1а1 аТбгеззаЫе шагке(, ТАМ), умноженному на вероятность совершения продажи в этой локации. Сделав это, я могу уже не строить гипотезы непосредственно о коли- честве продаж в каждом месте Я сосредоточусь на историях, которые по- могут мне спрогнозировать общий объем целевого рынка (ТАМ), а также на тех, которые объяснят, почему компания совершает продажу. Послед- няя связана с поведенческими факторами, а первая является агрегиро- ванной метрикой. Чтобы смоделировать ТАМ, мне нужно сначала понять, кто мои це- левые клиенты, а затем найти объяснение, почему они концентрируются в определенных местах. Например, чтобы спрогнозировать ТАМ для этой книги, я буду оценивать количество дата-сайентистов в данном регионе. Одна из возможных версий — они находятся там, где нужны компаниям. Я могу дополнить эту версию предположениями, что важно учесть: раз мер компании (из-за объема данных, необходимого для экономического обоснования найма дата-сайентиста, а также потому, что эти специалисты дорого стоят, и только достаточно крупные организации могут нанят ь их); отраслевая структура (.более капиталоемкие отрасли могут иметь боль ше генерируемых автоматизированными системами данных, чем более
трудоемкие отрасли с большим количеством ручных процессов; из-за дав- ления со стороны регулирующих органов; из-за различий в концентрации рынка); численность населения и возрастное распределение {поскольку от- расль относительно новая, ю молодые, но не слишком, люди охотнее ин- вестируют в изучение сложного технического предмета, такого как наука о данных). Эти гипотезы определяют, какой тип данных мне нужно искать для задачи прогнозирования. Чтобы смоделировать вероятность совершения продажи, должны быть люди, которые хотят и могут позволить себе приобрести продукт (спрос), и продукт, доступный им в этих местах (предложение). Идеальные при- знаки для моделирования спроса — потребительские предпочтения в от- ношении продукта, а также доход семьи. Предпочтения, как правило, трудно измерить, но их можно определить приблизительно по предыду щим продажам компании в каждом регионе или по поведению при поиске в интернете (например, по (лоо§1е Тгепбв или данным от аналогичных по- ставщиков). Данные о предложении получить проще — мне должно быть известно, присутствуют ли компания и се конкуренты в разных локациях. Сторителлинг ех ро5Г: открываем черный ящик Задача сторителлинга ех роз! заключается главным образом в понимании того, почему ваша модель делает прогнозы именно так, каковы наиболее прогнозные признаки и как они соотносятся с прогнозами. Вот два основных момента, ко торые вам нужно донести до своей аудитории — Модель дает прирост предсказательной точности, то есть ошибка прогно зирования ниже, чем у первоначального варианта. — Эта модель дает логичные результаты. Хорошая практика — обсуждение гипотез, способов их моделирования и согласованности с результатами. Вообще говоря, модель поддается интерпретации, если вы можете понять, что лежит в основе ее прогнозов. Локальная интерпретируемость направлена на пони- мание конкретных прогнозов, например, почему считается, что у клиента высокая вероят нос гь дефолта по кредиту. Глобальная интерг грет ируемость дает общее пони- мание того, как признаки влияют на результаты. Эта тема заслуживает того, чтобы посвятить ей целую книгу, но в этой главе я могу остановиться только на наиболее практических вопросах. В частности, я расскажу о методах получения глобальной интерпретируемости, поскольку считаю, что они пригодятся вам для сторителлинга.
Прежде чем открыть черный ящик, убедитесь, что вата мо- дель обладает достаточной предсказательной эффективно- стью и что утечки данных не произошло. Вам придется потра- тить достаточно много времени и усилий на сторителлинг ех роь1, поэтому лучше начать с хорошей модели прогнозирова- ния. Кроме того, рассказывая о метриках эффективности, ста- райтесь, чтобы они были как можно более понятны вашей аудитории. Общие метрики, такие как среднеквадратичная ошибка (гооС теап <^иаге еттот, КМ8Е) или площадь под кри- вой (АСС), могут быть непонятны стейкхолдерам бизнеса. Как правило, стоит приложить усилия, чтобы представить их в виде конкретных бизнес- результатов. Например, если вы по- лучаете КМ8Е на 5% ниже, почему это выгодно для бизнеса? Компромисс между интерпретируемостью и эффективностью Считается, что идеальный алгоритм МЬ одновременно и эффективный, и ин- терпретируемый. К сожалению, между интерпретируемостью и прогнозной эф (Ьективностью обычно есть компромисс: вам придется мириться с неполным по- ниманием внутренней работы алгоритма, но при этом вы добьетесь меньшей ошибки прогнозирования (рис. 13.5). Интерпре1ируемогь *•, Линейные модели и деревоя Нелинейные модели Эффективность Рисунок 13.5. Компромисс между интерпретируемостью и эффективностью На одном конце спектра у вас линейные модели, которые, как правило, счи- таются хорошо поддающимися интерпретации, но обладают низкой прогноз- ной эффективностью. К ним относятся линейные и логистические регрессии,
а также нелинейные алгоритмы обучения, такие как классификация и деревья регрессии. На другом конце спектра находятся более гибкие и, как правило, силь- но нелинейные модели, такие как глубокие нейронные сети, древовидные ансам бли и методы опорных векторов. Эти алгоритмы обычно известны как «черные ящики». А наша цель — открыть черный ящик и лучше понять, что происходит. Не всегда очевидно, что результаты нужно интерпретировать, поэтому да- вайте кратко обсудим, почему это лучше сделать. Принятие и одобрение Многим людям необходимо понять, почему делается то или иное предсказа- ние, чтобы признать его достоверным и тем самым принять на вооружение. Обычно это происходит в компаниях, не знакомых с МЬ-подходом, где реше- ния часто принимаются по наитию, прикрываясь видимостью работы с дан- ными. Возможно, стейкхолдерам будет легче принять ваши результаты и под- держать проект, если ьам удастся раскрыть для них «черный ящик». Низкая эффективность прогнозирования в реальных условиях Открытие «черного ящика» — один из наиболее эффективных способов об- наружения и устранения таких проблем, как утечка данных (глава 11). Этические и нормативные требования В некоторых отраслях есть требования, согласно которым компании долж ны объяснить, почему был сделан тот или иной прогноз. Например, в США65 «Закон о равных возможностях» дает право любому лицу запрашивать при- чины отказа в предоставлении кредита. Аналогичное требование предъявля- ется «Общим регламентом ЕС» по защите персональных данных. Даже если от вас этого не требует законодательство, вы можете проверить, открыв «чер ный ящик», соответствуют ли прогнозы и последующие решения минималь- ным этическим стандартам. Линейная регрессия: ориентир в работе Линейная регрессия служит полезным ориентиром для интерпретируемости (см. также главу 10). Рассмотрим следующую простую модель; У = а0 + а,Х, +а2Х2 + е Делая предположения о строгой линейности лежащего в основе процесса ге- нерации данных, вы сразу же получаете: 65 Н[Ср5://а1гссоп11пе.сот/с811/рарег8/уо110/с<,1(101516.рЛ
Направленность эффекта Знак каждого коэффициента показывает, положительно или отрицательно признак связан с результатом после учета всех остальных признаков. Сила эффекта Каждый коэффициент интерпретируется как изменение результата, свя- занное с изменением каждого признака на одну единицу, при этом осталь ные признаки остаются фиксированными. Важно отметить, что никакая причинно-следственная интерпретация не может быть сделана без дополни- тельных предположений. Локальная интерпретируемость Исходя из первых двух пунктов, вы можете сказать, почему был сделан тот или иной отдельный прогноз. Некоторые дата-сайентисты ошибочно интерпретируют абсолютную величи- ну коэффициентов как показатель их относительной важности. Чтобы понизь, почему это не работает, давайте рассмотрим следующую модель, в которой вы- ручка выражена в виде функции от численности торгового персонала и затрат на платный маркетинг (уеагсИ еп&пе тагкеНпр, 8ЕМ): гемепие = 100 + 1000 х Кит. за1ез ехеез + 0 5 х 8Р.М зрепб Это говорит о том, что в среднем и при неизменности других факторов: — каждый дополнительный руководитель отдела продаж увеличивает вы ручку на 1000 долларов; — каждый дополнительный доллар, потраченный на 8ЕМ (например, на ре кламу в (лоо$1е, Вт$ или ЕасеЬоок*6), увеличивает выручку на 50 центов. У вас может возникнуть соблазн сделать вывод, что в отношении выручки важ- нее увеличить численность торговою персонала, чем расходы на платный маркетинг. К сожалению, эго сравнение яблок и апельсинов, поскольку каждый признак измеря ется в разных единицах. Ниже показан прием для приведения показателей к одним единицам измерения путем регрессии по стандартизированным признакам: У = Ро + ^Х1+^Х2 + >1 г - теап(г) , „ где г =---------для любой переменной г. 51а(г) 66 Принадлежит организации Ме1а, которая признана экстремистской и запрещена на тер- ритории РФ. — Прим, ред
Обратите внимание, что коэффициенты регрессии для стандартизирован- ных переменных, как правило, отличаются от таковых в исходной модели (отсю- да и разные греческие буквы) — и, следовательно, имеют различную интерпре- тацию: стандартизируя все признаки, вы измеряете все в единицах стандартных отклонений (лучше использовать термин «безразмерных»), то есть сравниваете «яблоки с яблоками». Затем вы можете предположить, например, что х важнее х? поскольку дополнительное стандартное отклонение в х; увеличивает выруч- ку больше, чем в х2. Хитрость здесь в том, чтобы найти способ преобразовать исходные единицы измерения в общие (в данном случае в стандартные отклонения). Однако другие единицы измерения здесь тоже подошли бы. Например, представьте, что каждый дополнительный руководитель отдела продаж обходится в среднем в 5001) дол- ларов в месяц. Поскольку расходы на маркетинг уже выражены в долларах, вы делаете вывод, что в среднем каждый дополнительный доллар, потраченный на: — руководителя отдела продаж, увеличивает выручку на 20 центов; — платный маркетинг, дает увеличение выручки на 50 центов. Хотя этот подход также работает, гораздо более распространенный метод по- иска общей единицы измерения для всех признаков — стандартизация. Обрати- те внимание, что теперь вы можете осмысленно ранжировать признаки. Рисунок 13.6. Регрессия по линейным и стандартизированным признакам На рис. 13.6 показаны расчетные коэффициенты, а также 95 % доверитель- ные интервалы для смоделированной линейной модели с двумя признаками с нулевым средним и нормальным распределением (х;, х,)> как и в предыду- щих уравнениях. Признаки г}, г2, г3 — дополнительные переменные, коррели- рующие с х„ но в остальном они не связаны с результатом. Важно отметить, что я установил истинные параметры а = а, = 1 и Уаг(х ) = 1, Уаг(х= 5. И это дает два эффекта:
— увеличивает отношение сигнал/шум для второго признака, что делает его более информативным; — увеличивает истинный коэффициент67: = у5а . Проведя стандартизацию обоих признаков, мы видим, что второй из них бо- лее важен, как описано ранее. Благодаря доверительным интервалам вы также можете сделать вывод, что последние три признака неинформативны. Альтер- натива статистическому подходу — использование регуляризации как, напри мер. в регрессии Лассо. Важность признака Часто возникает необходимость ранжировать признаки по какому-либо объек- тивному критерию важности. Это полезно как для ех апте, так и для ех розг сто- рителлинга. Работая над сторителлинго.м ех роз1, вы можете сказать: «Мы об- наружили, что время совершения транзакции — самый важный предиктор мошенничества», — и это поможет выгодно презентовать вашу модель, а так- же потенциально даст отличные инсайты для вас и ваших слушателей (см. так- же главу 7). Что касается сторителлинга ех ап1е, то способ ранжирования функций по важности будет полезен при итеративной проработке ваших гипотез или ге- нерации признаков, а также поможет лучше понять проблему. Если у вас есть хорошо продуманные гипотезы, но результаты выглядят сомнительными, то ве- роятно, что вы допустили программную ошибку при генерации признаков или произошла утечка данных. Выше я использовал стандартизированные признаки в линейной регрессии, чтобы получить один из возможных вариантов такого ранжирования по важ ности. Стандартизированная важность признака в линейной регрессии Признак х важнее признака г, если увеличение х на одно стандартное откло- нение дает большее изменением результата (по абсолютному значению). Согласно другому подходу, важность можно определить по количеству ин- формации, которую дает каждый признак для решения данной прогнозной за- дачи. Интуитивно понятно, что, чем выше информационная составляющая признака (для данного результата), тем меньше ошибка прогнозирования при 67 Лет ко показать, что при линейной регрессии масштабирование признака с х на кх изме- няет истинным коэффициент с а на а/к.
включении этою признака. Для этого подхода есть две наиболее часто исполь- зуемые метрики. Важность признаков, основанная на критерии неоднородности (1тригИу-Ьазе<1 /еаШге гтроПапсе) Признак х более важен, чем г, с точки зрения неоднородности узлов, если относительное улучшение ошибки прогнозирования в узлах, где х был вы- бран в качестве переменной разделения, больше, чем соответствующее уве- личение для г. Важность после перестановки (Регти1аНоп 1трог1апсе) Признак х более важен, чем признак г, если при использовании метода регтпи1а1юп ппроНапсе относительная потеря производительности при пе- рестановке значений х больше, чем для г. Обратите внимание, важность признака, основанная на критерии неодно- родности68, работает только для алгоритмов машинного обучения на основе де- ревьев. При каждом разбиении узла по признаку улучшение производительно- сти сохраняется, поэтому в конце вы можете рассчитать долю улучшений для всех признаков в общем улучшении. Для ансамблей это значение будет средним по всем деревьям. Что касается метода регтшапоп ттроггапсе69, то он работает с любым алго- ритмом МЬ, поскольку7 вы просто перетасовываете значения каждого признака (несколько раз, как при бутстрэпе) и вычисляете потерю производительности. Интуитивно понятно, что для важных признаков фактический порядок имеет большее значение, поэтому перестановка значений должна привести к большей потере производительности. На рис. 13.7 показана важность признаков по методу репшНаНоп штроНапсе и по критерию неоднородности для все того же смоделированного набора дан- ных, который был обработан с помощью градиентною бустинга (без оптими- зации по мегапараметрам), с 95%-ным доверительным интервалом. Довери тельные интервалы для регти1аНоп 1троггапсе» вычисляются параметрически (предполагая нормальность) с использованием средних значений и стандарт- ных отклонений в 8С1кп-1еагп Я получаю аналогичные интервалы для признаков по критерию неоднородности с помощью бутсгрэпа (см. главу 9). 68 ИПр8://5С1к11-1еагп.ог§/81аЫе/гпо(1и1е8/еп8етЫе Ь^т]#гаг.<1оп1-Еоге51-{еа1:иге-1трог1апсе 69 ЬгГр8://8с1кН-1еагп,ог§/8гаЫе,'то<1и1е8/регти1абоп_1трог1апсе.Ь|т1»регти1аГ1оп Ш1рог1апсе
Рисунок 13.7. Важность признака для смоделированной модели при использовании бутстрэпа Тепловые карты Тепловые карты очень просты в вычислении и обычно достаточно хорошо ви- зуально отображают корреляцию между каждым признаком и прогнозируемым результатом. Они наглядно показывают, например, если х увеличивается, то у падает. Поскольку многие гипотезы говорят о направлении закономерностей, полезно сначала быстро проверить, соблюдаются ли они на практике. Расчет за- ключается в следующем. 1. Разделите предсказанный результат (регрессия) или вероятность (клас- сификация) на децили или любой другой квантиль. 2. Для каждого признака х и дециля б вычислите среднее значение по всем единицам в этой группе: а а. Цифры могут быть представлены в виде таблицы с децилями в столбцах и признаками в строках. Обычно рекомендуется упорядочивать признаки по степени важности, чтобы в первую очередь сосредоточиться на наиболее ре- левантных. На рис. 13.8 показана тепловая карта для линейной регрессии, обученной на предыдущем примере, где признаки уже были отсортированы по важности. Просто анализируя оттенки цвета для каждого признака (ряда), вы можете лег ко выделить любые закономерности или их отсутствие. Например, х положительно коррелирует с результатом, как и ожидалось, по- скольку истинный коэффициент в моделировании равен 1. У объектов анализа в нижнем дециле средний показатель составляет 3,58 единицы, и он монотонно увеличивается в среднем до 4,23 единицы для верхнего дециля.
Пример тепловсй касты х2 1— -3,24 -2,37 -1,55 -0,81 -0,21 0,57 1,31 1Л5 по важное X -0,83 -0,23 -0,47 -0,02 -0,18 0,34 -0,35 -6,19 редепены м -0,94 0,04 -0,30 -1,43 0,73 -1,55 1,05 -1,16 0,8 6,21 5 нэ 23 х: п? гг 0,38 6,35 0,52 -0,43 -0,65 0,04 6,1 -0,13 в, и О- = 22 -1,13 0,29 1,0 6,52 -0,36 6,26 0,01 -0,36 6,8 0,16 <11 42 аз <14 <15 сГб 47 Децили прогнозируемых значений 48 69 аю Рисунок 13.8. Тепловая карта признака (для предыдущего примера) Проверка строки для х показывает основной недостаток тепловых карт- они отображают только двумерные корреляции. Истинная корреляция положитель- на (о, - 1), но тепловая карта не показывает эту монотонность. Чтобы понять почему, обратите внимание, что х и х2 коррелируют отрицательно (рис. 13.9). Однако большая дисперсия второго признака придает ему большую прогнозную силу и, следовательно, больший вес при окончательном упорядочении прогно- зируемого результата (и децилей). Эти два факта нарушают монотонность, ко торая ожидалась для второго признака. Рисунок 13.9. х2 и х1 отрицательно коррелируют
Графики частичной зависимости С помощью графиков частичной зависимости (РП-графики) вы предсказыва- ете результат или вероятность, изменяя только один признак за раз, при этом фиксируя все остальные Этот подход весьма привлекателен из-за своей схоже- сти с тем, что вы получаете при включении частичных производных в линей- ной регрессии. В главе 9 я использовал нижеописанный метод для расчета РП-графиков, ко- торый очень точно отражает эту интуицию. Сначала вы вычисляете средние зна- чения для всех признаков, затем создаете линейную сетку размером С для при знака, который вы хотите смоделировать, и собираете все в матрицу вида: х х - х - х С х К 12 О/ л Далее через эту матрицу вы создаете прогноз на вашей обученной модели: РОР<»(х.) =/(Х.) Этот метод быстрый и интуитивно понятный: он позволяет легко смодели ровать влияние взаимодействий между признаками. Однако со статистической точки зрения он не совсем корректный, поскольку среднее значение функции обычно отличается от той, которая вычисляется на основе средних значений входных данных (если только ваша модель не линейная). Главное преимущество в том, что для этого требуется только одна оценка обученной модели. Правильный способ, а также метод в 8С1кД-1еагп70 для вычисления РЭ-графи- ка требует Лтоценок (обьем выборки) обученной модели для каждого значения % в сетке. Затем они усредняются, чтобы получить: Р1)Р'2>(х = $) = I /(х ..., х, х ,.... х .) -IV / = 1 Взаимодействия можно легко смоделировать, изменяя несколько признаков за раз. На практике эти два метода часто дают схожие результаты, но на самом деле это зависит от распределения признаков и реального ненаблюдаемого про- цесса генерации данных. Прежде чем двигаться дальше, обратите внимание, что в этом последнем вычислении вы должны получить прогноз для каждой строки в вашем наборе данных. С графиком индивидуального условного ожидания (шЛуй/мй/ сопсНПопа! ехрес1аНоп, 1СЕ) вы визуально отображаете эти эффекты для каждой единицы 70 Нир5://5С11а1-1еагп.ог^/51аЫе/то<1111е5/рагНа1 _<1ереп<1епсе 111т1
анализа, что делает этот метод инструментом локальной интерпретируемости, в отличие от РВ-графиков71. Давайте смоделируем нелинейную модель, чтобы увидеть оба метода в дей- ствии, с помощью следующего процесса генерации данных: у = х + 2х: - 2хрс. - х2, + € х} ~ Сншша(8Ьаре = 1, 8са1е = 1) х2~Л'(0, 1) е~мо,5) Я использую гамма-распределение для первого признака, чтобы подчеркнуть эффект, который могут иметь выбросы при применении любого из этих методов. На рис. 13.10 показаны расчетные и истинные значения РВ-графиков с ис- пользованием обоих методов. РВ-график для первого признака хорошо отра- жают форму истинной взаимосвязи, но эти два метода начинают расходиться друг с другом при больших значениях х. Это ожидаемо, поскольку выборочное среднее чувствительно к выбросам, поэтому при первом методе вы в конечном итоге используете среднее значение единицы анализа с относительно большим первым признаком. При использовании второго метода это не так заметно, по- скольку индивидуальные прогнозы усредняются, и в данном конкретном при- мере функциональная форма сглаживает влияние выбросов. Рисунок 13.10. РИ-графики по двум методам для смоделированных данных Хотя РВ-графики великолепны, они смещены из-за коррелированных при- знаков. Например, если х, и х положительно коррелируют, то оба признака бу- дут иметь маленькое или большое значение одновременно. Однако с РВ-гра- фиком есть риск нереалистичного сочетания малого значения для х (из сетки) и большого для второго признака. 71 В реализации из репозитория кода применяются методы 1СЕ и РРР.
Чтобы убедиться в этом на практике, я смоделировал модифицированную версию предыдущей нелинейной модели: у = х + 2х2 - 2хус2 -х\ + € Х1,Х2 ~Л’(0, Др)) е ~ мо, 5), где признаки теперь взяты из многомерного нормального распределения с кова- риационной матрицей, индексированной параметром корреляции. На рис. 13.11 показаны расчетные и истинные РВ-графики для некоррелированных (р = 0) и (р = 0,9) коррелированных признаков, где вы можете легко убедиться, что РВ- графики смещаются, когда признаки коррелируют. Рисунок 13.11. РЭ-графики с коррелированными и некоррелированными признаками Накопленные локальные эффекты Накопленные локальные эффекты (ассити1а1еН 1оса1 е$ес1$, АЬЕ) — это относи- тельно новый метод, который устраняет недостатки РВ-графиков при обработ- ке коррелированных признаков. Он также требует меньших вычислительных за- трат, поскольку количество оценок обученной функции меньше’2. 72 На момент написания этой книги были доступны два пакета РуТЙоп, которые вычисля- ют АЬЕ: АЬЕРугЬоп и аКЫ. Вы можете найти в репозитории кода мою собственную реа- лизацию для случая непрерывных признаков и отсутствия взаимодействий.
Как уже обсуждалось, проблема с РП-графиками возникает из-за риска вво- да нереалистичных значений признака, учитывая его корреляцию с остальны- ми, что в конечном итоге приводит к смещению оценок. Как и прежде, вы начи- наете с создания сетки для любого исследуемого признака к. АЬЕ справляется с этим за счет трех шагов. Фокус на локальных эффектах Для заданного значения в сетке # выберите только те единицы анализа (1) в ваших данных, для которых значение признака находится в окрестности этой точки (Г; % — д < х < $ + <5). При наличии коррелирующих признаков все эти элементы должны иметь относительно согласованные значения для всех остальных переменных. Вычисление наклона функции В пределах этой окрестности вы вычисляете наклон для каждой единицы ана- лиза, а затем они усредняются. Суммирование этих эффектов Для визуализации все эти эффекты суммируются, что позволяет перейти от локального уровня окрест ности в сетке к глобальному диапазону признака. Рисунок 13.12. АЬЕ для тех же смоделированных данных (90% С1) Второй шаг довольно важен: вместо того чтобы просто вычислять функцию в одной точке сетки, вы фактически вычисляете наклон функции в интервале.
В противном случае вы можете перепутать эффекты интересующего вас призна- ка и других сильно коррелированных признаков. На рис. 13.12 показан АБЕ для смоделированного набора данных, который использовался ранее, а также 90% доверительные интервалы из бугстрэпа Благодаря некоррелированным признакам (первый ряд) АБЕ отлично справ- ляется с восстановлением истинных эффектов. Для коррелированных призна- ков (второй ряд) истинный эффект от второго признака восстанавливается правильно, но некоторые части для первого признака по-прежнему отобра- жают некоторое смещение; тем не менее АБЕ по-прежнему работает лучше, чем РИ график. Основные выводы Ниже представлены основные выводы из этой главы. Целостный сторителлинг в МЪ В области машинного обучения вы обычно обращаетесь к сторителлингу по • еле того, как разработали свою модель и встретились со стейкхолдерами. Це- лостный подход, представленный в этой главе, поддерживает идею, согласно которой вы в роли ученого пишете и итеративно прорабатываете истории, помогающие вам создать хорошую прогнозную модель, а затем переключае тесь на более традиционную роль продавца. Сторителлинг ех ап(е Сторителлинг ех ап1е начинается с создания историй или гипотез о том, что управляет результатом, который вы хотите предсказать. Затем они преобра зуюгся в признаки в ходе многоэтапной их генерации. Сторителлинг ехроз1 Сторителлинг ех роя помогает вам понять и интерпретировать прогнозы мо дели. Такие методы, как тепловые кар1ы, графики частичной зависимости и накопленные локальные эффекты, должны помочь вам рассказать историю о том, как различные признаки влияют на результат. Благодаря определению важности признаков вы можете их ранжировать. Разбейте сторителлинг на этапы По крайней мере вначале полезно структурировать свой инструментарий сторителлинга. Это касается как ех аШе, так и ех роз! подготовки.
Дополнительная литература В книге Апа1уИса18кИ1$/ог А1 ап<1 Иа1а Зсгепсе я рассказываю про эффекты пер- вого и второго порядка. Книга Рольфа Добелли «Искусство ясно мыслить» (ТИе Ап о/11гткт§ С1еаг1у) (Нагрет) будет полезна, если вы хотите получше разобраться в предубеждениях и эвристиках, свойственных человеческому поведению. Эти знания значительно обогатят набор гипотез для решения вашей конкретной проблемы. По методу генерации признаков, если рассматривать его с точки зрения пре- образования данных, есть несколько исчерпывающих источников. Вы може те ознакомиться с книгами Элис Чжен и Аманды Казари «Машинное обучение: Конструирование признаков» (Реа1иге Епутеегту/ог МасИте Ееагпт%) (О’КеШу), Синана Оздемира «Генерация признаков» (РеаГиге Еп$теепп$ Вооксатр) (Маптпд), Соледад Галли РуХЬоп «Кулинарная книга по генерации признаков на Ру1коп» (Реа1иге Епутеегтр СоокЬоок) 2-е изд. (Раск! РиЬИзЫпд) или серией постов73 в блоге Винга Пуна «Конструирование признаков для машинного об- учения». Для рис. 13.5 я брал за основу рис. 2.7 из книги «Введение в статистиче- ское обучение с примерами на языке В» (Ап 1п1гобисИоп 1о 81аНзИса1 Ееагтпр уиНк АррНсагюпз т К), 2-е изд., Гарег Джеймс и др. (8рпп§.ег), которая доступна в ин тернете74. Эта книга настоятельно рекомендуется тем, кто больше заинтересован в понимании сути, а не технических деталей. Что касается интерпретируемости в МЬ, я настоятельно рекомендую кни- гу Кристофа Мольнара «Интерпретируемое машинное обучение: руководство по объяснению моделей черного ящика» (1п1егрге1аЫс МасЫпе Ьеагтпу: А Ошдерог МактрВ1аск Вох Мос1е1$ Ехр1атаЫе) (доступна в интернете75, независимо опубли- кована в 2023 году). Тревор Хасти и др. в книге «Основы статистического об- учения: интеллектуальный анализ данных, логический вывод и прогнозирование» (ТНе ЫетепИ о/$1аН$Нса1 Ьеагтпр: Иа1а Мтп%, 1п/егепсе, апб РгесИсИоп), 2-е изд. (8рпп§ег), подробно обсуждает важность функций и интерпретируемость для различных алгоритмов (в частности, разделы 10.13 и 15.13.2). Наконец, Майкл Манн и Дэвид Питман дают очень полный и актуальный обзор различных мето- дов в своей книге «Объяснимый ИИ для практиков: разработка и внедрение объ яснимых МЕ-решений» (Ехр1атаЫе А1 ]ог РгасНИопеп: Иезцргтрапб 1тр1етепИп% Ехр1атаЫе МЬ 8о1иНопз) (О’КеШу). 73 Н1фл://1о(7агекЛа1а5С1епсе с<>т/Ка1иге-еп§1г.еег1п^ Гог-гпасЬ1пс-1еагшп^-а8003ссИес1е6/ 74 ЬЦр$://\у«су.51аГ1еагтг1§.сот/ 75 ЬПр8://сйп81ор11т.§11ЬиЬ.1о/1п1егрге1аЫе-т1-Ьаок/
С методом АГЕ вы можете подробнее ознакомиться в оригинальной статье Дэниела У. Апли и Цзинью Чжу «Визуализация эффектов переменных-предик- торов в моделях „черных ящиках" с обучением с учителем» (УкиаИхт^ 1ке ЕффеМз офРгесНс1ог УанаЫез т В1аск Вох 8ирет$ес1 I еагпту Мос1е1У) (август 2019 года, из- влечена из агХгу76). Книга Мольнара об АГЕ весьма хороша, но в этой статье вы найдете больше подробностей об этом не совсем понятном алгоритме 76 Ьйр5://агх1у.ог§/р<1(71612.08468
ГЛАВАМ От прогнозирования к принятию решений Согласно опросу77, проведенному МсК1П5еу, в 2022 году 50% организаций- респондентов внедрили искусственный интеллект (ИИ) или машинное обуче- ние (МЬ). Это в 2,5 раза больше, чем в 2017 году, но все еще ниже пика 2019 года (58%). Если искусственный интеллект — это новая электроэнергия78, а данные — новая нефть79, то почему его внедрение замедлилось до появления больших язы- ковых моделей (ЬЬМ), таких как СЬаЮРТ и Ваги?80 Хотя первопричины могут быть разными, очевидно одно: большинству орга- низаций еше предстоит добиться положительной отдачи от инвестиций81 (КО1). В исследовании ЕхрапсИпрАГз 1трас1 \\7ИИ ОгуатгаИопа1 Ееаггипд82 («Раааирение влияния ИИ с помощью обучения в организации») Сэм Рэнсботэм и его коллеги утверждают, чго только «10% компаний получают значительную финансовую выгоду от технологий искусственного интеллекта». Откуда берется такая рентабельность инвестиций? По своей сути алгоритмы МЬ — это механизмы прогнозирования, и логично, что главная польза от них заключается в улучшении процесса принятия решений. В этой главе мы рас- смотрим некоторые аспекты того, как прогнозирование помогает усовершенст- вовать принимаемые решения. Попутно я представлю несколько практических методов, которые помогут вам перейти от прогнозирования к более эффектив ному принятию решений. 77 Ь(1р5://туилу.тскт8еу.сот/сараЫПг1е8/диап1итЫаск/оиг-1п.ч§НГ5/1:11е-51а1е-оГ-а1- т 2022-апс1-а-Ьа11'-<1еса<1е т геутету 78 ЬПр8://\еи^.§8Ь.ьипГог(1.е<1и/1П51§1115/ап<1ге\у-п§-\у11у-а1-пето-е1ес1г1С1(у 79 1шр8://\у\\лу.ЕогЬе8.сот/соипсИ8/ЕогЬе81ес11соипс11/2019/11/15/с1аи-18-1Ье- пе^у-ой-агк!- гНаГз -а ^ооЛ -1Ь 1гщ/ ?81геат1пйех=0 80 Можно даже задаться вопросом, действительно ли ЬЬМ существенно изменят тенден- цию внедрения? Я считаю, что основные причины не изменятся по крайней мере до тех пор, пока машины не получат общий искусственный интеллект (АС1). Но мы обсудим эту тему в главе 17. 81 Ьнря://итуу’.р\ус.сот/и8/еп/1есЬ -ейесйа! - апа1у11с8/аПтйс1а1-т(е)1щепсе гоьйГт! 82 й(1р8://51оаг.геу1ету.тй.ейи/рго)ес15/ехрапй1п§-а18-1трас{-мгйЬ-ог|щп1га11опа1-1еагтп§/
Анализ процесса принятия решений Алгоритмы прогнозирования пытаются обойти неопределенность, и это чрез- вычайно важно для улучшения наших возможностей в принятии решений. На- пример, я могу попытаться предсказать завтрашнюю погоду в своем родном го- роде просто ради удовольствия. Однако прогнозирование само по себе облегчает и улучшает нашу способность принимать более эффективные решения в усло- виях неопределенности. Найти варианты применения этому нетрудно, и разные люди и организации будут готовы платить за эту информацию (фермеры, ор танизаторы вечеринок, телекоммуникационная индустрия, правительственные учреждения, такие как НАСА, и т. д.). На рис. 14.1 схематично показана роль, которую в процессе принятия ре- шений играет неопределенность. Если двигаться вправо, то, как только не- определенность устранена, появляется результат, который влияет на неко- торые важные для вас метрики. Этот результат зависит от набора рычагов (действий) в вашем распоряжении и их взаимосвязи с исходной неопреде- ленностью. Например, вы не знаете, будет ли сегодня дождь (неопределен- ность), но беспокоитесь, будет ли вам комфортно и сухо (результаты). Вы можете решить, брать с собой зонт или нет (рычаги). Естественно, если бу- дет дождь, вам лучше взять с собой зонт (вы будете в сухости), но если это- го не произойдет, логично его оставить (вам будет удобнее, так как не при- дется носить его с собой). Рисунок 14.1. Решения в условиях неопределенности В таблице 14.1 я собрал несколько распространенных примеров использова- ния МЬ, где подчеркиваю роль принятия решений и неопределенности, а также некот орые возможные результаты. Давайте рассмотрим первую строку — случай
обработки требований83 по медицинскому страхованию. Получив новую заявку, вы должны проверить ее вручную или одобрить платеж, убедившись в ее закон- ности. Незаконные претензии неоправданно увеличивают расходы страховщи- ка, по процессы рассмотрения часто довольно сложны и требуют значительно- го количества времени и усилий. Если бы вы могли правильно прогнозировать, вы могли бы снизить погрешность прогноза и свои затраты, а также повысить удовлетворенность клиентов. Таблица 14,1. Примеры использования Мк Категория Пример использования Решение Неопределен ность Исход Сервисные Обработка Автоматическая Законный случай Сокращение ручной обра- операции претензий оплата или про- верка вручную или нет ботки (затрат), повыше- ние удовлетворенности клиентов, снижение уров- ня мошенничества. Сервисные Укомплектование Нанять или рало- Численность пер- Более высокая удовлет операции штата цировать сонала зависит от спроса воренность клиентов, бо- лее низкие неиспользуе- мые ресурса, (затраты) Сервисные опе Проактивная Звонить или Возникнет ли Повышайте удовлетво- рации поддержка кли- ентов не звонить клиенту у клиента про- блема,- которую я могу решить ревность и снижайте от- ток клиентов Оптимизация Прогнозирование Управление Заласы зависят Более высокие продажи цепочки поставок спроса запасами от спроса и более низкие амортиза- ционные расходы Выявление мошенничества Предотвраще- ние оспаривания сделки Одобрить или отклонить транзакцию Законная или нет Снижение затрат, связан- ных с мошенничеством, и повышение удовлетво- ренности клиентов Маркетинг Генерация лидов Звонить или не звонись по- тенциальному клиенту Будут ли они покупать или нет Более высокая эйектив ность продаж Продукты Рекомендатель- Порекомендуйте Будут они поку- Более высокая вовлечен- на основе М1 нал система А или Б пать или нет ность, меньшии опок клиентов 83 Ьпръо'.'итуту.тскТпзеу.сот/тпПизГпез/Иеакксаге/оиг-тпзтзГщ/агИйстаЫпТеШ^епсе-т-Иеайй Гпзигапсе-зтагГ-скгтх тападетепГ-ийГй-яеИ-каггпп^-зоЙякаге
Если сосредоточиться сначала на решениях и готовых результаты, а только потом на инструментах МЪ, то вы сможете значительно развить культуру рабо- ты с данными в вашей организации. Обдумывание решений и рычагов — отличный способ найти новые варианты использования МЬ на рабочем месте Ниже описаны этапы этого процесса. 1. Определите ключевые решения, принятые стейкхолдерами (а также соответствующие метрики и рычаги). 2. Сформулируйте роль неопределенности. 3. Разработайте бизнес-обоснование для создания МЕ-реше ния. Простые правила принятия решений с помощью интеллектуального определения пороговых значений (5пггаг1ТНге5Ко1сНпд) В отличие от регрессии, в классификационной модели вы естественным обра зом получаете простые правила принятия решений в виде порогового значения. Я опишу случай биномиальной модели (два результата), но этот же принцип можно применить и к более общему полиноминальному случаю. Типичный сце- нарий выглядит примерно так: Цо(т) = А Ирг > т В 1Г р1 < т Здесь — прогнозируемая оценка вероятности для единицы /, ат- выбран- ный вами порог. Правило активирует действие А, если оценка достаточно ве- лика, и действие В в противоположном случае. Точно такую же логику вы мо- жете применить при замене прогнозируемой вероятности на прогнозируемый непрерывный результат. Однако упрощенная структура, присущая классифика- ции, позволяет вам учитывать при анализе стоимость различных ошибок про- гнозирования. В двух словах все сводится к глубокому пониманию ложноположительных и отрицательных результатов, В биномиальной модели результаты обычно обо- значаются как положительные (1) или отрицательные (0). Как только у вас бу- дет прогнозируемая оценка вероятности и пороговое значение, единицы ана- лиза с более высокой (более низкой) вероятностью будут прогнозироваться как
положительные (отрицательные). Смотрите матрицу несоответствий в табли- це 14.2. Таблица 14.2. Типичная матрица несоответствий 1 Фактические/прогнозируемые Л/(г) Р(т) М ТМ ГР р ЕМ ТР Строки и столбцы в матрице несоответствий обозначают фактические и про- гнозируемые метки соответственно. Как уже упоминалось, прогнозируемые ре- зультаты зависят от выбранного порогового значения (т). Таким образом, вы можете классифицировать каждый экземпляр в вашей выборке как истинно от- рицательный (ТМ), истинно положительный (ГР), ложноотрицательный (РАО или ложноположительный (ТР) в зависимости от тою, соответствует ли пред- сказанная метка истинной метке или нет. Ячейки в матрице обозначают коли- чество случаев в каждой катеюрии. Точность и полнота (ргеазюп а пс! гесаП) Две распространенные метрики эффективности в задачах классификации — точность и полнота: 7Р Ргеозюп 2’р рр Обе метрики можно рассматривать как долю истинно положительных ре- зультатов, но каждая из них учитывает свою область84. Точность отвечает на во- прос: из всего, что я назвал положительным, какой процент был положитель- ным на самом деле? А полнота отвечает на вопрос: какой процент из всего, что на самом деле является положительным, я предсказал правильной Когда вы ана- лизируете точность, вы фокусируетесь на стоимости ложноположительного ре- зультата, а в полноте важна стоимость ложноотрицательного. На рис. 14.2 показаны кривые точности и полноты для трех альтернативных моделей, обученных на моделируемой линейной модели с латентной перемен- ной для получения сбалансированного результата. В первом столбце показан классификатор, который присваивает оценку вероятности путем составления м Обратите внимание, что в литературе по машинному обучению под полнотой (гесаП) обычно понимается доля истинных положительных результатов Цгие розШуе гаге).
случайных однородных чисел в единичном интервале; этот рандомный класси фнкатор будет служить базовой линией. В среднем столбце отображаются точ- ность и полнота, полученные в результате логистической регрессии. В послед- нем столбце преднамеренно изменяются прогнозируемые классы, чтобы создать обратную оценку вероятности, где более высокая оценка связана с более низкой частот ой страховых случаев. Вы можете легко увидеть несколько закономерн» >стей: точность всегда начинает- ся с доли положи тельных слу чаев в вашей выборке и может быть относительно пря- мой (рандомный классификатор), увеличивающейся или уменьшающейся. Как пра- вило, вы получаете увеличение точности, поскольку большинство моделей обычно превосходят случайные классификаторы и по крайней мере в некоторой степени информативны в отношении результата, который вы хотите предсказать. Хотя те- оретически это возможно, от рицательный наклон точности крайне маловероятен. Точность ведет себя более предсказуемо в том смысле, что она всегда начина- ется с единицы, а затем уменьшается до нуля, и меняется только кривизна. Хоро шая вогнутая функция (средний график) обычно ожидаема, и это также связано с тем фактом, что в адекватных классификационных моделях оценки информа тивны для определения вероятности наступления события Рисунок 14.2. Точность и полнота для различных моделей Пример: генерация лидов Возьмем для примера кампанию по привлечению лидов, в которой вы оцени- ваете потенциальных клиентов, чтобы предсказать, с какими из них состоится продажа. Ваши данные состоят из успешных ($а!е) и неуспешных (по «а!е) кон- тактов для исторической выборки лидов, которую ранее использовала команда телемаркетинга.
Рассмотрим простое правило принятия решения о контакте с клиентом, если прогнозируемая вероятность превышает пороговое значение. ГМ — это лиц, который принес бы продажу, если был бы отправлен для обработки в марке- тинговую команду, а ЕР — лид, который неверно был отправлен для контакта, поскольку в итоге не принес продажу. Стоимость ложноотрицательного резуль- тата — упущенная выручка от продажи, а стоимость ложноположительното ре- зультата — любые ресурсы, потраченные на обработку лида (например, если почасовая зарплата менеджера по телемаркетингу составляет х долларов, а об- работка каждого лида занимает к минут, то каждый ложноположительный ре зультаг обходится в кХ/61) долларов). Простое правило определения порогового объема работает следующим обра зом: отдел продаж сообщает вам, с каким объемом (V) они могут справиться за каждый период (день или неделю), а вы отправляете им V топ-лидов по рас четной вероятности. Вполне логично, что, фиксируя объем, Во1 также устанавли ваете пороговое значение для вашего правила принятия решений. Давайте рассмотрим упрощенную воронку привлечения лидов (см. также главу 2), чтобы понять последствия применения такого правила. 8а1еь = 8а1ез СаПёа х (Т) СаИеб т -=--з— х Ьеааз Ьеааь 4 - (2) ( = Сопу. ЕЯГ(т) х Са11 КаТе(ЕТЕ) х Ьеабз(т) Точность Общий объем продаж зависит от эффективности конверсии (1), количест- ва звонков (2) и объема лидов (3). Обратите внимание, что эффективность кон версии и объем лидов зависят от выбранного вами порога: в идеальном случае эффективность конверсии равна точности вашей модели, а количество лидов зависит от распределения оценок. Однако количество звонков зависит от коли- чества сотрудников в пересчете на полную ставку (ГТЕ) или от их общего числа: достаточно большой от дел продаж сможет обзвонить каждого потенциального клиента в выборке. Из этого видно, почему и при каких условиях правило объема может быть применимо. Сортируя лидов в порядке убывания по степени вероятности и об ращаясь только к лидам в верхних стоках, вы улучшаете эффективность кон- версии (поскольку точность — возрастающая функция в прогнозных класси- фикационных моделях). При этом нам важно, чтобы в команде телемаркетинга не было простоя: если вы отправите больше, чем они могут обработать в теку- щем временном интервале, то они не свяжутся с лидам с более низкими оценка- ми; если вы отправите меньше, торговые агенты будут простаивать.
На рис. 14.3 показана зависимость произведения (1) и (3) от порогового зна- чения, установленного для гой же моделируемой выборки и тех же трех моделей, использованных ранее85. Двигаясь справа налево, вы можете видеть, что сниже- ние порога всегда лучше с точки зрения общего объема продаж. Поэтому прави ло объема обычно хорошо работает для команд телемаркетин1 а. Рисунок 14..3. Оптимизация общего объема продаж Возможно, этот рисунок вас запутает, поскольку вы можете подумать, что вам надо установить пороговое значение равным нулю (звонить каждому оце- ненному лиду), а не просто следовать правилу объема. Другими словами, сто- ит ли отделу продаж нанимать ровно столько сотрудников, чтобы добиться максимальной скорости звонков и при этом успеть обработать все лиды? Ответ отрицательный: если оценка информативна, го у лидов с более низкими про- гнозируемыми показателями также меньше шансов на конверсию, поэтому сто- имость дополнительных сотрудников будет больше, чем (сомнительная) выгода от дополнительной продажи. Правило объема предполагает, что размер коман- ды фиксирован, а мы оптимизируем обзвоны для достижения наибольшей точ- ности и объема продаж при данном количестве сотрудников. Оптимизация матрицы несоответствий Случай генерации лидов несколько нетипичен, поскольку вы фактически при- сваиваете ложноотрицательным результатам нулевой вес и фокусируетесь 85 Объем выборки был нормализован до 100, и результаты были сбалансированы, так что истинно положительных случаев было всего -50.
только на оптимизации точности. Но для большинства задач это не так (и даже при генерации лидов есть основания учитывать ложнопозитинные результа- ты при установлении порога). Чтобы убедиться в этом, рассмотрим случай мо- шенничества, когда по любой входящей транзакции вам нужно предсказать, бу- дет ли она мошеннической или нет. Типичное правило принятия решений блокирует транзакцию при достаточно высокой оценке ее вероятности. Ложноположительные результаты обычно при- водят клиентов в бешенство (снижение удовлетворенности клиентов и увеличе- ние оттока). И наоборот, ложный отрицательный результат приводит к прямым издержкам мошенничества. Это противоречие ставит перед вами нетривиаль- ную задачу по оптимизации порогового значения. Общая идея состоит в том, чтобы найти пороговое значение, которое мини- мизирует ожидаемые затраты из-за неверных прогнозов; как вариант, вы може- те выбрать пороговое значение для максимизации ожидаемой прибыли, если ре- шите учитывать значение, полученное на основе правильных прогнозов. Задачу можно выразить следующим образом: Л(Соз1)(т) = -Р?р(т)срр + Р№(т)с^ Е(Ргойг)(т) = Ртр(г)Ь1р + Ртк(т)Ьтк - {Ргр(т)с№ + РгМсгф где Р ср Ь обозначают вероятность истинного или ложного положительного или отрицательного результата (х) и связанные с ним затраты или выгоды соот- ветственно. Вероятности оцениваются с использованием частот в матрице не- соответствий как Р = пД>п и зависят от выбранного порогового значения8ъ. Рисунок 14,4. Симметричные графики ожидаемых затрат и выгоды На рис. 14.4 показаны оценки по выборке с использованием того же смоде- лированного набора данных, что и ранее; важно отметить, чго я предполагаю 86 Хотя это верно для расчета выгоды, вы можете использовать условные вероятности, по- скольку будете учитывать ошибку в прогнозировании для расчета затрат Выбранный порот не меняется, поскольку это равносильно изменению масштаба целевой функции.
симметричный случай, когда все затраты и выгоды имеют одинаковое значе- ние (нормализованное к единице). На нем вы можете видеть, что оптимальный порог для оптимизации затрат (слева) и прибыли (справа) составляет -0,5, как и ожидалось в модели со сбалансированными результатами и симметричной структурой затрат/выгод. На рис. 14.5 показан эффект удвоения стоимости ложноположительных и от- рицательных результатов при оптимальном пороговом значении. Логически можно предположить, что чем выше затраты на ложноположительный резуль тат, тем выше должен быть порог, поскольку вы даете большее значение точно сти модели. С другой стороны, более высокая стоимость ложною срабатывания снижает оптимальный порог, поскольку вы придаете большее значение полно- те (гесаП). Пооог (Г) ---- Симметричные ----2х ГР затраты 2х РИ затраты Рисунок 14.5. Асимметричные ожидаемые затраты Вы можете использовать этот метод для поиска подходящих пороговых зна- чений, которые позволят использовать вашу классификационную модель как правило принятия решений. Этот процесс включает в себя следующие этапы. 1. Подготовьте классификатор с хорошей предсказательной эффективно стью. 2. Для минимизации затрат установите подходящие величины зат рат при ошибках прогнозирования. Согласно задаче, вам нужны только относи- тельные затраты (например, стоимость пожноотрицатепъного резуль тата в три раза выше, чем ложноположительного; так вы сможете нор- мализовать все относительно одного результата). 3. Аналогичный подход применим и к максимизации прибыли. 4. Вычисления можно проводить для разных пороговых значений и опти- мизировать.
Основные выводы Ниже представлены основные выводы из эт ой 1лавы. Если вы хотите добиться положительного Р.О1 от своей работы с данными, край- не важное значение играет переход от прогнозирования к принятию решений Машинное обучение — это набор алгоритмов прогнозирования, которые мо- гут значительно улучшить возможности вашей организации по принятию ре- шений. Пороговые правила принятия решений широко распространены в машинном об- учении Многие регрессионные и классификационные модели позволяют пользовать- ся простыми правилами принятия решений, которые запускают действия, если прогнозируемый результат больше, равен или ниже заданного порого- вого значения. Правила принятия решений в классификационных моделях Благодаря простой структуре результатов классификационные модели по зволяют использовать правила принятия решений, которые можно лег- ко оптимизировать. Один из таких путей оптимизации учитывает затраты и выгоды от различных результатов прогнозирования (истинных и ложно- положительных результатов или отрицательных). Я показал, как создается простое правило определения порогового значения для объема, когда вас ин- тересует только точность вашей модели или, в более сложном случае, когда важны ложные положительные и отрицательные результаты. Дополнительная литература В моей книге Апа1уИса1 $кН1$/ог А1 апй Иаш Зссепсе (О КеШу) подробно рассма- триваются многие темы этой главы. Однако я не привожу там практическую за- дачу оптимизации порога, описанную здесь. Авторы Аджай Агравал и др. в книге «От предвидения к власти. Как ИИ- прогнозирование трансформирует экономику и как использовать его силу в сво их целях» {Росмег апб РгесНсНоп: Иге Онгирйсе Есопопйсз о/ АгНфсла! 1пте11ц>епсе) (Нагуагб Визшезз К.еу1еи/ Ргезз) убедительно доказывают, что возможности ИИ и М1, для трансформации экономики зависят от их способности повысить нашу эффективность принятия решений.
Инкрементальность: святой Грааль науки о данных? В своих прошлых работах я утверждал, что инкрементальность — это святой Грааль науки о данных. Это утверждение в большей степени опирается на ги- потезу, которой я придерживался: наука о данных создает ценность, улучшая возможности компании по принятию решений. В этой главе тема раскрывает- ся подробнее, и, что важнее, я описываю здесь несколько приемов, которые по- могут сформировать базовое понимание, полезное при дальнейшем изучении. Как обычно, тема заслуживает рассмотрения в отдельной книге, поэтому в кон- це главы я приведу несколько ссылок. Что такое инкрементальность Инкрементальность — это просто другое название причинно-следственного вывода, используемого в аналитике принятия решений. Если вы помните из рис. 14.1, типичное решение включает в себя действие, или рычаг, и результат, который зависит от лежащей в его основе неопределенности. Если использова ние рычага улучшает результат, то при условии, что вы можете изолировать лю- бые другие причины этого, вы вправе сказать (с некоторой степенью уверенно сти), что оно было инкрементальным. В литературе такое использование рычага также называют «лечением» (1геа1теп1) — термином из классической медицин- ской литературы о контролируемых экспериментах, когда некоторые пациенты получают лечение, а оставшаяся контрольная группа — плацебо. Причинно-следст венная связь обычно выявляется при помоши «контрфак- тов» (отсутствие вмешательства. — Прим. пер.). В отличие от фактов — того, что мы наблюдаем, — контрфакты пытаются дать ответ на вопрос: что, если бы я действовал по-другому7. Вы можете сказать, что действие оказывает причинно- следственное влияние на результат, если результат уникален по сравнению со всеми возможными конгрфактическими сценариями.
Например, представьте, что при нажатии на бинарный рычаг вы можете вы- полнить только два действия, А и В (например, снизить цену или нет), после чего наблюдаете результат У (выручка). В конечном итоге вы предоставляете скидку всем своим клиентам и наблюдаете, что выручка увеличилась. Была ли скидка инкрементальной для выручки? Другими словами, является ли этот эф фект причинно-следственным? Чтобы найти ответ, вам нужно оценить доход в контрфактических сценариях, где все факторы фиксированы и вы не предо- ставляете скидку. Разница в этих потенциальных результатах и есть причинно- следственный эффект скидки37. Измеряя инкрементальноегь количественно, вы сможете определить и вы брать действия, которые направят компанию по пути развития. Здесь больше задействована предписывающая аналитика, а не ее описательные и прогнозные разделы. Большинство дага-сайентистов, работающих в области машинного об- учения (МЬ), сосредоточены исключительно на прогнозировании и практически не уделяют времени изучению причинно-следственных связей. Поэтому у вас может возникнуть вопрос: действительно ли это важный навык для изучения? И прежде чем перейти к практической части, я докажу, что это гак. Понимание причинно-следственных связей помогает улучшить прогнозирование Даже если вы как дата-сайентист ограничиваетесь прогнозированием, вы долж- ны разобраться в причинно-следственных связях хотя бы в общем смысле. Как говорилось в главе 13, для генерации хороших прогнозных признаков вам необ- ходимо обладать некоторыми базовыми причинно-следственными представле- ниями о результатах, которые вы хотите предсказать. Это видно из определения контролируемого обучения: у=Дх;,х2,--) С учетом вариаций ваших признаков и результатов {х;, у} задача состоит в том, чтобы изучить процесс генерации данных (/()). Но это предполагает, что причинно- следственная связь направлена от признаков к результату. Процесс генерации при знаков начинается с формулировки причинных гипотез, например: «более высокое значение признака к увеличивает результат, потому что...». Более того, на пред- сказательную эффективность вашей модели может негативно повлиять включе- ние признаков, которые ложно коррелируют с результатом, как описано в главе 10. 87 Кратко отмечу, что в этом примере есть альтернативные контрфакты, которые могли бы объяснить увеличение дохода. Очень распространенный из них — пик сезонных распро даж, когда клиенты просто охотнее тратят больше на ваш продукт.
Способность человека осмыслять причины На момент написания этой книги СРТ-4 и аналогичные большие языковые мо- дели (ИМ) заставили нас переосмыслить роль человека во многих областях. Да- та-сайентисты уже слышали об этих рисках после появления автоматизирован ного машинного обучения86. Однако эти технологии могут повысить вашу производительность, если вы позволите машинам взять на себя все, что можно автоматизировать, и посвяти- те свои уникальные человеческие способности задачам более высокого уровня. Даже с учетом самых последних достижений можно с уверенностью предска- зать, что на данный момент люди уникально приспособлены к тому, чтобы рас- суждать о причинах через обращение к конгрфакгам и строить модели того, как устроен мир Эта тема подробно рассматривается в главе 17. Усовершенствование процесса принятия решений Кроме этого, есть вопрос о том, как вы создаете ценность для своей организации. Как я уже неоднократно говорил, дата-сайентисты обладают уникальными на- выками, позволяющими усовершенствовать процесс принятия решений в ком- пании. Если следовать этой логике, то инкременгальность — это святой Грааль, и не затрагивать причинно-следственные связи здесь невозможно. Однако вам необходимо переосмыслить свою роль дата-сайентиста и расши- рить ее, добавив к простому прогнозированию навык повышать эффективность принятия решений (где прогнозирование играет важную, но второстепенную роль). Типичный сценарий — запуск новой функции или нового продукта. Когда вы запускаете новую функцию, у вас должен быть результат или метрика, кото- рые вы пытаетесь оптимизировать. Например, вас может интересовать вовле- ченность клиентов, измеряемая временем активности или частотой посещения страницы. Если вы сможете показать, что функция оказала влияние на эту ме- трику, то порекомендуете расширить ее использование или дополнить. Одна- ко если вы обнаружите, что она неинкрементальна, или, что еще хуже, метрика ухудшилась, лучшим решением будет откатить функцию назад. Запуск новых продуктов сопровождается еще более интересной концеп- цией — каннибализацией. Например, когда Арр1е* 89 решила выпустить гРЬопе, продажи гРоб значительно упали, то есть они были каннибализированы. *’ 1тир5://еп.цтк1рес11а.ог§/г\тк1/АиГота1еЦ_тасЫпе_1еагп111^ 89 1гНрз:'/мгу.ту.Ьи51пе5в1П51с1ег.сот?'арр1е-1ро<1-сапп1Ьа11га11оп-2012-10
Аналогичным образом стриминговый бизнес КеИКх90 в конечном итоге вытес- нил и каннибализировал изначальную услугу онлайн-проката ВУВ. Последний пример, несколько отличающийся о г других, — ЗсагЬискь91, который, от крыв но- вую кофейню, может каннибализировать продажи в соседних кафе. Во всех этих случаях оценка инкрементальнбсти для нового продукта или магазинов может оказать большое влияние на показатели прибыли и убытка компании, а также на возможности принятия решений. Конфаундеры и коллайдеры В главе 10 упоминались конфаундеры (сопГбип бег) и плохие контрольные пере- менные в качестве примеров того, как при линейной регрессии все может пой- ти не так, как надо. Освоение этих понятий также имеет ключевое практическое значение при работе с причинно-следственными связями. Мы сейчас подроб- нее разберем эти концепции, и я выделю несколько мест, на которые вам следу- ет обратить внимание при анализе инкрементальности. Очень полезный инструмент для понимания причинно-следственной свя- зи — направленные ациклические графы (<Игес1е<1 асусНс §гарЬ, ОАО). Граф — это набор узлов и связей между ними. В нашем случае узлы представляют переменные, а связи — причинно-следственные связи. Когда связи интерпрети- руются в определенном, направлении, граф становится направленным. Напри- мер, если х — причина для у. то будет направленная связь х -> у. Слово ацикличе- ский исключает существование циклов; если х -г у, то не может быть х <- у. Это значит, что причинно-следственные связи однопаправленны. Джуда Перл, спе- циалист по информатике и лауреат премии Тьюринга за работу над байесовски- ми сетями, разработал и популяризировал метод причинно-следственного ана- лиза с использованием ВАС. Вопрос в том, сможете ли вы идентифицировать конкретный причинно-следственный эффект для имеющихся данных и ВАС. Идентификация отличается от оценки, для вычисления которой в выборке ис- пользуются статистические методы92. 90 йПр5://агМесйтса.согп/(;а<1§еГ8/2009/01А1геапш1§-У1Цео-сапп1Ьа1121п§-<1у<1-геп1а15-8а}5- петЕгх/ 91 ЬПр8://и'ут.1пуе81оре(11а.сот/пе^’8/81агЬиск8-81оге8-аге-йпа11у-сапп1Ьа1121П§-еасЬ-о1Ьег- Ьгп о -До 1л'П^га<1е5/ 92 Метод с использованием ВАС популярен среди специалистов по информатике и эпиде- миологов, а подход потенциальных исходов — среди ст атистиков и экономистов. О нем я подробнее расскажу в дальнейшем.
На рис. 15.1 показаны ВАС для простейших случаев наличия конфаундера и коллайдера, где нет причинно-следственной связи между хи у. ВАС слева по- казывает, что есть две причинно-следственные связи (с -»х, с -> у), поэтому с яв- ляется общей причиной как для х, так и для у. Справа также есть две причинно- следственные связи (с «- х, с <- у), и здесь с — это общий эффект. Конфаундер Путь от л ку X <—с —*у Коллайдер Путь от/ку X --* I --у Рисунок 15.1. ОАО с конфаундером и коллайдером: отсутствие причинно-следственной связи Искажение конфаундера возникает, когда две предположительно несвя занные переменные (х, у) имеют общую причину (с). Если вы проведете рег- рессию у по х, не контролируя с, вы обнаружите, что они ложно коррелируют. Если конфаундер обнаружен, то вам нужно наложить на него условие, и тогда причинно-следственная связь, если она есть, будет выявлена. Проблема возни- кает с ненаблюдаемыми конфаундерами, поскольку вы не можете их контролиро- вать по определению. В этом случае определить причинно-следственную связь, если она есть, не получится. Коллайдер — это общий эффект двух переменных и типичный пример пло- хой контрольной переменной в том смысле, что его включение в вашу регрессию приведет к искажению оценок. Если вы запустите регрессию у по х и выполните контроль для с, вы обнаружите ложную связь, которой не существует. Чтобы разобраться в этом, я смоделирую следующие процессы генерации данных для конфаундера (обратите внимание, что причинно-следственная связь между хиу отсутствует): с-Л/0,1) е ~мо, 1) е ~ мо, 2) х = 10 + 0,5с + €х у = -2 + Зс + € у
Аналогичны процессы генерации данных для коллайдера (опять же, причинно-следственной связи между х и у не г): 6 - МО, 1) С - МО, 2) 6 - МО, 0,1) х = 10 + 6 у = -2 + 6 7 у с =5 - 2х + Юу + 6 Затем я запускаю моделирование методом Монте- Карло, где оцениваю линей- ные регрессииу нах с учетом и без учета с. На рис. 15.2 я привожу оценку коэф- фициента для признака х с 95 % доверительными интервалами. Рисунок 15.2. Смещение из-за конфаундера и коллайдера (оценка параметров и 95% доверительный интервал) В случае влияния конфаундера отсутствие контроля для с создает статисти- чески значимую ложную корреляцию, которая неверно указывает на то, что х и у связаны (что еще хуже, вы можете прийти к выводу, что х — причина для у). Примечательно, что эта корреляция исчезает, как только вы включаете в рег- рессию конфаундер, и это приводит к правильному выводу о несуществующей связи. С коллайдером происходит обратное: поскольку эго плохой контроль, исклю- чение его из регрессии позволяет оценить статистически незначимое влияние х на у. Если вы ошибочно полагаете, что с стоит включить в качестве призна- ка, то придете к выводу, что причинно-следственная связь существует, хотя это не так. Оба этих искажения широко распространены на практике и, к сожалению, их появление в значительной степени зависит от вашей причинно-следственной модели. Иными словами, прежде чем пытаться оценить причинно-следственную связь, вы должны разработать модель ЮАС) для вашего результата. Только после
этого вы сможете решить, достаточно ли у вас данных для выявления данного причинно-следственного эффекта. В частности, вы должны контролировать лю- бые конфа)тгдеры и убедиться, что вы не включаете коллайдеры (и иногда эти два соображения вступают в противоречие друг с другом, поскольку перемен- ная может быть конфаундером и коллайдером одновременно). Этот процесс часто называют критерием обходного пути (диск боог сгИегюну с конфаундерами вы должны закрывать все обходные пути, контролируя их, а в случае коллайдеров все наоборот. В противном случае вы открываете эти ла зейки и не можете определить причинно-следственную связь93. Однако здесь возникает еще одна практическая проблема, которая связана с прокси-конфаундерами. Как уже упоминалось, ненаблюдаемые конфаундеры препятствуют выявлению причинно-следственной связи, поэтому у вас может возникнуть соблазн использовать прокси-переменные, которые в некоторой сте- пени коррелируют с конфаундерами. Появляется надежда, что вы все еще сможе- те оценить причинно-следственную связь, используя эти далекие от оптималь- ных заменители. К сожалению, ответ неутешителен: степень смещения сильно зависит от силы корреляции. На рис. 15.3 показана эта ситуация для модели- рования по методу Монте-Карло в случае наличия конфаундера и истинного причинно-следственного эффекта х на у94. 4- «Д V । Д Коэффициент корреляции Рисунок 15.3. Смещение конфаундера с коррелированными прокси 93 Отметим, что критерий Ьаск-боог (обходной путь) также включает условие не контроли ровать переменные-потомки лечения (то есть переменные, влияющие на результат). 54 ОСР, по сути, такой же, как и раньше, но я внес два изменения: я изображаю с прокси ~ МО, Др)), чтобы учесть различные коэффициенты корреляции между истинным не- наблюдаемым конфаундером (с) и наблюдаемым прокси, и я моделирую результат как у = «2 + Зс - 2х + у, так что существует причинно-следственная связь от х к у.
Смещение выборки Смещение выборки ($е1есНоп Ыаз) — очень важное понятие для причинно- следственного анализа, но в разных научных школах термин имеет разные смы- слы95. Для статистиков и экономистов оно связано с отбором в группу лечения, а для специалистов в области информатики — с отбором после лечения, из-за чего выборка респондентов меняется: первое является своего рода искажением конфаундера, а второе приводит к совершенно иному ПАС (больше связанному с искажением в отношении выживаемости, как обсуждалось в главе 6). В этом разделе я расскажу о первом из них (отбор в группу лечения), который обычно рассматривается в литерат уре о потенциальных исходах. И сейчас я познаком- лю вас с этим обозначением96. Идея потенциальных исходов тесно связана с контрфактами. Рассмотрим случай бинарного лечения (О), где каждая единица / либо получает его (0 = 1), либо нет (О = 0). С каждым уровнем лечения связан уникальный потенци альный исход, обозначаемый У или Уо., обозначающий получение или непо- лучение лечения соответственно. Для каждой единицы мы наблюдаем один и только один из этих потенциальных исходов, обозначаемый У; другой по- тенциальный исход — контрфакт, поэтому вы его не наблюдаете. Связь меж- ду наблюдаемым и потенциальным исходами может быть обобщена следую- щим образом: „(^0 = 1 1 Уо/ ДИ = О Это выражение можно записать иначе: У = Уо> + (Т^. - У0г)О Тогда оно доволь но точно соответствует структуре линейной регрессии исхода для фиктивной переменной лечения и интерсепта (т!егсер1). Проблему причинно следственной связи с точки зрения потенциальных ис- ходов можно рассматривать как проблему отсутствия данных. В таблице 15.1 показан один пример, где каждая строка обозначает клиента Вы наблюдае- те только за У и О, из которых вы можете сразу же определить потенциаль- ные исходы, используя описанную выше логику. Если бы мы могли наблюдать за каждым контрфактическим исходом, мы смогли бы оценить причинно- следственную связь. 95 Ьнр5://йзрй.Иагеаг<1.ес1и/ргой1е/тщие1-йегпап/ 96 Важно проводить различие между типами смещения выборки. Как я покажу далее, ран- домизация исключает возможность отбора в группу лечения, но не решает проблему от- бора после лечения.
Таблица 15.1. Потенциальные исходы и недостающие данные V ТО У1 1 6,28 6,28 ИаИ 0 2 8.05 8,05 ^а^ 0 18 8,70 Ма1м 8.70 1 7 8,9С ма^1 8.9С 1 0 9,23 9,23 ЫаМ 0 16 9,44 ЫаЬ 9,44 1 В качесз ве примера предположим, что я хочу оценить, приведет ли к увеличе иию продаж книги предоставление репозитория на СйНиЬ с сопроводительным кодом. Моя интуиция подсказывает, что знание о наличии доступного кода уве личивает вероятность покупки либо потому, что потенциальные клиенты счи- тают книгу более качественной, либо потому, что они знают — с помощью кода легче обучаться. Я бы хотел количественно оценить эффект, поскольку создание репозитория кода обходится дорого. Я напишу об этом посетителям моей веб страницы, которые попадают в выборку (О = 1), и открою им доступ; для осталь- ных я сделаю это сообшение недоступным (!) =0). Исход — двоичная перемен- ная, обозначающая продажу (У = 1) или отсутствие продажи (У = 0). Для каждой единицы /, У, — У, — это причинно-следственный эффект от- крытия доступа к коду. Поскольку для каждой единицы наблюдается только один эффект, нам необходимо оцепить его. используя выборку получивших и не по- лучивших лечение. Один из простых способов сделать это — вычислить наблю- даемую разницу в средних значениях (оЪзегуес! (Иффегепсе т теанз): Е( У |О = 1) — Е(У.|Т>. = 0). На практике вы заменяете математические ожидания выборочными средними, в результате чего получается Ув; = 1 — Уп. = 0, чт0 и объясняет, почему я называю эту величину наблюдаемой. Плохая новость — наблюдаемая разница не позволяет оценить причинно- следственный эффект при наличии смещения выборки: Б(У|О = 1) - Е(У|р = 0) = Е(УП. - У0,|П = 1) + Е(У„,|О = 1) - Е(У0,.|Г = 0) '-----------т---------- --------г-------1 1-----------1----------- Наблюдаемая разница АТТ (случайный эффект) Смещение выборки в средних значениях Эта декомпозиция весьма удобна: она показывает, что при наличии смещения выборки наблюдаемая разница в средних значениях будет отклоняться от инте- ресующего причинно следственного эффекта, обычно обозначаемого средним эффектом лечения у прошедших лечение (асега^е 1геаТтеп1 ерфес! он (Не 1геа1еф АТТ). АТТ отвечает на следующий вопрос: при рассмотрении только тех, кто
получил лечение, какова ожидаемая разница в фактических исходах и теми ис- ходами, которые мы имели бы, если бы не давали им лечение? Второй резуль тат контрфактический, поэтому разница показывает причинно следственный эффект. Третий член уравнения представляет собой смещение выборки и пока- зывает, почему наблюдаемая разница в средних значениях может отличаться от причинно следственного эффекта. Чтобы объяснить смысл этого, я восполь- зуюсь следующими обозначениями: 8е1ес1юп В1аз = В(У0||П = 1) - В(У0.|Г = 0) Возвращаясь к примеру, давайте рассмотрим репозиторий кода как дорого стоящий для компании (в данном случае, для меня) рычаг, который может быть назначен всем или выборочно. На рис. 15.4 показаны два типа смещений выбор- ки. При положительной (отрицательной) выборке причинно следственный эф- фект обычно переоценивается (недооценивается). Рисунок 15.4. Положительный и отрицательный отбор Давайте начнем с положительного отбора, который произойдет, если я от- правлю сообщение тем, у кого уже больше шансов приобрести книгу. Однако вероятность продажи изначально выше для тех, кто получает репозиторий, не- зависимо от инкрементальности рычага. Это означает, что А > В, что переоцени ваег причинно-следственный эффект. Аналогичная аргументация показывает, что при отрицательном отборе А < В и причинно-следственный эффект недо- оцениваются Смещение выборки широко распространено в данных наблюдений. Либо вы (или кто-то из компании) выбрали участников «для лечения», либо клиен- ты сами выбрали себя Пример с репозиторием кода обычно характерен для
первого, по самостоятельный выбор также очень распространен. В главе 4 я опи- сал концепцию неблагоприятного отбора (аск’егзе зексНоп), при котором наи- более рискованные клиенты (с точки зрения невозможности погасить кредит) также более охотно принимают предложение Неблагоприятный отбор — рас- пространенный пример самостоятельного выбора. Детальное понимание смещения выборки в вашем конкрет- ном случае поможет значительно глубже изучить причинно следственные связи и оценить их. При анализе инкременталь пости каждый раз спрашивайте себя, возможно ли здесь какое-либо смещение выборки. Это означает, что вы должны тщательно продумать механизм выбора в «группу лечения», которое вы анализируете. К счастью, проверка на смещение выборки концептуально проста: возьмите набор переменных X, измеряемых до лечения (рге1геа1тгп1 уапаЫез), и вычислите разницу между ними в группах лечения и контроля. Переменные до лечения — это те, которые могут повлиять на отбор в группу лечения В главе 6 показа- но, как можно использовать прирост (/(Д), но по статистическим соображениям чаще используется разность в средних значениях, а не соотношение (поскольку это позволит применить стандартный г-критерий). Рисунок 15.5. Смещение выборки и конфаундеры На рис. 15.5 показан пример ПАС, который можно использовать для моде- лирования смещения выборки. Есть два набора переменных до лечения (2 , ..., 2,, X), которые влияют на отбор в группу лечения (Е>). Исход (У) зависит от ле- чения и X. Обратите внимание, чго X — конфаундер и что переменные 7 не со- здают смещения, если вы контролируете лечение. Эти другие переменные до ле- чения могут отличаться в группах лечения и контроля, но эти различия не дают смещения выборки.
Допущение об отсутствии смещения Пришло время ввести основное допущение, необходимое для выявления при- чинно-следственных связей. Это допущение имеет разные названия, такие как отсутствие смещения (ипсоп/оипбебпе$з), игнорируемость, условная взаимозаме- няемость. выбор на основе наблюдаемых объектов и условная независимость. Это предположение означает, что потенциальные исходы и выбор в груп- пу лечения статистически независимы и обусловлены набором наблюдаемых контрольных переменных: Это важнейшее допущение имеет две альтернативные интерпретации; одну — с точки зрения лица, принимающего решения (владельца механизма от- бора), а другую — с точки зрения дата-сайентиста. Если рассматривать ситуацию с точки зрения лица, принимающего решение, помните, что выбор в группу лечения может быть сделан либо клиентом (само стоятельный выбор), либо владельцем лечения (вами или кем либо из вашей компании). Это предположение не допускает, чтобы лицо, принимающее реше- ние, учитывало потенциальные исходы. Например, при обсуждении положительного и отрицательного отбора я был владельцем механизма отбора, и он явно определялся тем, хотел ли я стимули- ровать потенциальных клиентов, которые с большей или меньшей вероятностью совершат покупку естественным путем. Это то же самое, что сказать, что выбор зависел от потенциальных исходов-, если У = 0, покупатель не купит книгу без доступа к репозиторию, поэтому я, возможно, захочу' стимулировать его (отри- цательный выбор). Аналогичное обоснование применимо и к положительному отбору. Оба этих случая могут привести к нарушению принципа отсутствия сме- щения (ипсопЩипбебпезз). С точки зрения дата-сайентиста вам необходимо заранее знать все важные переменные, которые в принципе могут повлиять на механизм отбора (затем вы можете контролировать их и добиться условной независимости). Я надеюсь, вы понимаете, почему причинно-следственный вывод так сложен: вам нужно не только знать правильную модель для вашего результата (ПАС), но п наблю- дать все соответствующие переменные. Последнее объясняет, почему это допу- щение также называется отбором наблюдаемых величин (8е1есбоп оп оЬзетуаЫез). Любые ненаблюдаемые конфаундеры приведут к смещению выборки. При на ли чии данных наблюдений оба условия очень трудно выполнимы, что подводит нас к проведению к А/В тестирования
Преодоление смещения выборки: рандомизация Рандомизированные контролируемые исследования (РКП), или А/В-тестиро- вание (более распространенный термин в корпоративном жаргоне) — квин- тэссенция метода оценки причинно-следственных связей. Причина в том, что здесь изначально соблюдается предположение об отсутствии смещения (ипсоп(оипл1ебпе88): отбор в группу лечения зависит только от результ ата псев- дослучайного выбора, что по определению делает его независимым от потенци- альных исходов. Давайте посмотрим, как это работает на практике. Сначала вам нужно опре- делить долю обработанных в выборке (р), которая в большинстве А/В-тестов обычно устанавливается равной половине. Затем вы осуществляете выборку из равномерного распределения (п) и определяете отбор по следующему пра- вилу: П = I 1 Ии >р О й и < р Представленный ниже фрагмент кода осуществляет этот механизм случайно- го выбора. Пользователь предоставляет общий объем вьтборки (п_^ота1), долю получивших лечение (бгас_1геа!еб) и начальное значение для генератора слу- чайных чисел, которое позволяет выполнить последующую репликацию. Резуль тат — логический массив, который будет указывать, отобрана ли каждая едини- ца в выборке (Тгие) или нет (Еа1зе). де"Р гапдор1!ге_5апр!е(п_ТоТа1, ТгаС-Т^еаТеО, зеео): "ЕипсТТоп То Стпс! а гап^опТгес! запрТе" пр. гапсот.5еей(5еес1) ипт.1:_с1гаи = пр гапйоо гапд(п_Тога!) Ьоо!_ТгеаТ = ипт.Е_сйак >= Егас_ТгеаТеи геТигп Ьоо!_ТгеаТ Как уже упоминалось, отсутствие смещения (ипсоп/ои<1е<1пе!з) также называ- ют (условной) взаимозаменяемостью. В приведенном примере, если бы я произ- вел рандомизированный отбор в группу лечения, благодаря взаимозаменяемо- сти я бы ожидал, что доля тех, кто купит книгу органически, будет одинаковой в группе лечения и контроля. На любые инкрементальные продажи в одной группе должен влиять исключительно предоставленный мной рычаг. В этом и за- ключается красота А/В тестов.
При рандомизации вы должны убедиться, что выполняется предположение о стабильной единиц и значениях лечения (&1аЫе шй 1геагтепГ уа!ие азвитрбоп, 8ЪТТ\А). 8ЕТТУА предъявляет два требования: (1) лечение одинаково для всех пользователей, которые его получают (например, при испытаниях лекарст- венных препаратов все пациенты должны получать одинако- вую эквивалентную дозу), и (п) нет какого-либо воздействия между единицами. Поэтому потенциальный результат для ка- ждой группы не зависит от лечения в других группах. Второе требование часто нарушается на онлайн- площадках, например на ЕЛаег, ЕуЙ97 или А1гЬпЬ. Предполо- жим, вы хотите проверить, увеличивает ли выручку стиму- лирование спроса через скидки98. Лечение (скидка) может сократить доступное предложение для контрольной группы, из-за чего появляется внешний фактор, который влияет на их потенциальные исходы. В этих случаях лучше использовать рандомизацию по блокам, когда выборка сначала разбивает- ся на взаимоисключающие кластеры, а лечение рандомизиру- ется по кластерам, а не по единицам. Мэтчинг Каким бы замечательным ни было А/В-тестирование, оно не всегда может быть вам доступно, особенно если лечение дорого стоит. Например, предположим, что вы работаете в телекоммуникационной компании, которая хочет знать, уве- личит ли ее выручку установка антенны (со всеми необходимыми компонен- тами). Вы можете разработать схему А/В-тестирования, в которой вы будете рандомно устанавливать новые антенны в разных географических точках. Эта методика позволит вам оценить их инкрементальность при достаточно боль шом размере выборки. Излишне говорить, что проведение такого теста просто слишком затратно. Есть несколько методов, которые позволят вам оценить причинно-следст- венный эффект с помощью данных наблюдений, но все они зависят от соблюде- ния допущения об отсутствии конфаундеров Здесь я хочу вкратце упомянуть 97 Ы1р8://еп§.1уЙ.сот/ехрег1теп1а11оп-Гп-а-г1<1е5Ьаг1пд-тагке1р1асе Ь39<1Ь027а66е? §1=3251 <1416е7Ь4 98 На рынках есть спрос и предложение. Примерами спроса могут служить пассажиры в райдшеринге или гости АйЬпЬ.
метод мэтчинга (и мэгчинг по склонности к лечению, ргорепэИу эсоге та(скт%): он очень наглядно демонстрирует интуицию, стоящую за отбором по наблюда емым признакам. Этот метод показывает, как можно попытаться воспроизвес- ти рандомизацию, находя подходящие единицы наблюдения для контрольной группы. Один из принципов рандомизации заключается в том, что группы печения и контроля ех ап1е равны. То есть если вы случайным образом выберете по од- ному участнику из каждой группы и сравните их с любым набором переменных (X), они должны быть практически одинаковыми. Естественный вопрос — мо- жем ли мы создать валидную контрольную группу ехро$1, чтобы применить от бор по наблюдаемым параметрам. И именно это поможет нам сделать мэтчинг. Алгоритм мэтчинга работает следующим образом. 1. Предложите ОАО для исхода и убедитесь, что отбор по наблюдаемым па раметрам верен. На практике это означает, что у вас есть обоснованная причинно-следственная модель для механизма отбора, и вы можете на- блюдать все признаки перед отбором в группу лечения X. 2. Повторите цикл по всем обработанным единицам. а. Найдите подходящие индивидуальные контрольные группы. Для ка- ждой единицы 1 найдите группу из т единиц, которая наиболее близ ка к 1 с точки зрения х. Обозначьте ее через С(1). т — это метапараметр, контролирующий соотношение «смещение-дисперсия»: большинство людей используют т = 1, что потенциально приводит к низкому сме- щению, но большой дисперсии. Вы можете увеличить это число и по- играть с соотношением. Ь. Вычислите средний исход для контрольной группы. Как только у вас бу- дет контрольная группа для единицы (ипп) «, вы сможете вычислить средний исход у0) = (1/т)1?еоду,- с. Рассчитайте средний эффект лечения для единицы I. Вычислите раз- ницу б. = у. - у0.. 3. Рассчитайте средний эффект лечения для подвергшихся лечению. АТТ — это среднее значение по всем пг индивидуальным эффектам лечения для единиц в группе лечения (.№,): АТТ = — У д Я надеюсь, вам понравится простота и интуитивность алгоритма мэгчин- га. Суть метода в том, что каждую единицу из тестовой труппы сравнивают с наиболее схожей контрольной группой с учетом любого конфаундера. При
использовании непрерывных признаков все. что вам нужно сделать, это вычи- слить евклидово расстояние между / и всеми необработанными единицами /: б = V X. (х.. - х)2 1) 1К }К/ Что произойдет, если у вас будут смешанные данные, в которых признаки мо- гут быть непрерывными или категориальными? В принципе, вы можете приме- нить достаточно общую функцию расстояния". Но есть альтернативный и очень важный результат, известный как теорема о показателе склонности (РгорепзИу 8соге Ткеогет, Р8Т). На ней мы остановимся подробнее. Показатель склонности (ргорешИу зеоге) — это вероятность того, что дан- ная единица получит лечение, и это обусловлено некоторыми ковариациями или контрольными показателями: р{Х) = РгоЬ(Р. = 1|Х.) Р8Т утверждает, что если отсутствие смещения выполняет ся при условии фиксации признаков X, го оно также сохраняется и при условиир(Х). Важность этого в основном играет роль для вычислений: если вы уже сделали решающий шаг, предположив условною независимость при X, то вы можете использовать показатель склонности для мэтчинга обработанных и необработанных единиц. Показатель склонности можно оценить с помощью вашего любимого алгорит- ма классификации, такого как градиентный бустинг, случайный, лесной или ло- гистический классификаторы, которые по умолчанию работают со смешанны- ми данными. а Помните, что отсутствие смещения — это предположение, ко- торое невозможно проверить с помощью какого-либо задан- ного набора данных. Вы начинаете с И АС, который фиксиру- ет ваши предположения о любых зависимостях между лечением, исходом и любыми другими соответствующими контрольными переменными. Все последующие вычисления зависят от этого важнейшего предположения. По этой причине всегда полезно обсудить и задокументи- ровать свои основные предположения (ваш ПАС) со своими коллегами, дага-сайентистами и другими. Во многих случаях стейкхолдеры бизнеса могут предоставить ценную информа- цию о том, что влияет на механизм отбора. 99 Например, см. заметку Каспера Кубары «Правильный способ обработки данных смешан ного типа. Самые современные метрики расстояния» (7йе Ргорег \\'ау о/НапсИту Мгхес1- Туре Г)а(а. 81а1е-о/-1Ие-АгЮч- 1апсе Ме1г1С5)
Давайте мы обобщим алгоритм мэтчинга, пропуская общие шаги. 1 Обучите алгоритм классификации для оценки вероятности получения лечения. Используя выборку получивших и не получивших лечение еди- ниц, оцените р(Х). 2. Сопоставьте обработанные единицы, используя показатель склонности. Для каждой получившей лечение единицы / вычислите абсолютную раз- ность в показателях склонности со всеми необработанными единицами: б=|р(Х,)-р(Х)| 3. Выберите контрольную группу, используя отсортированные различия. Отсортируйте все различия по возрастанию и определите верхнюю т в контрольную группу СИ). Каким бы интуитивно простым ни был мэтчинг (и мэтчинг по склонности к лечению), он требует больших вычислительных затрат, поскольку вам прихо- дится перебирать каждую единицу, получившую лечение, а затем для каждой из них — каждую необработанную единицу и каждый признак. В итоге вы по- лучаете сложность О(п) х я х к), обозначена заглавной буквой О. В репозито- рии100 с кодом вы найдете две версии алгоритма: одна использует циклы, а вто- рая — возможности библиотек К’и тру и Рапбаь, чго существенно сокращает время выполнения. Мэтчинг Показатель склон ноете (6ВСI Показатель склонности (логистеческая) --- Истинный эффект I II 12 3 123 123 Размер контроля (т) Размер контроля (т) Размер контроля (лт) Рисунок 15.6. Результаты методов мэтчинга и мэтчинга по склонности к лечению Чтобы увидеть эти два алгоритма на практике, я смоделировал модель, ана- логичную описанной ранее, с двумя конфаундерами, влияющими на вероят- ность отбора и исход, где истинный эффект лечения равен двум101. Для пока- зателя склонности я использую два альтернативных алгоритма: стандартный 100 И[1р5://§1[ИпЬ.сот/с1хаи^Ь.ап79/с1а(а-8С1епсе Наг<1 -рагГь-сойе 101 Детали вычислений можно найти в репозитории кода.
градиентный бустинг (^гасИеп! Ьоо8Пп§ с1а88гЯег, СВС) и логистическую рег- рессию. Я устанавливаю 95% доверительные интервалы для каждой оценки. На рис. 15.6 показаны результаты, где горизонтальная ось каждой диаграммы по- казывает, что происходит, когда вы играете с размером контрольной группы (т). Все методы правильно оценивают истинный причинно-следственный эф фект, но метод мэтчинга через СВС несколько занижает его (истинная оцен- ка все еще находится в пределах 95% доверительных интервалов). Увеличение размера отдельных контрольных групп, по видимому, не оказывает влияния ни на смещение, ни на дисперсию — как для простого мэтчинга, так и мэтчин- га по склонности к лечению на основе логистической регрессии. Но это немного уменьшает доверительные интервалы для СВС. Машинное обучение и причинно-следственный вывод Несмотря на впечатляющее развитие области машинного обучения за последние несколько лет, можно с уверенностью сказать, что, помимо А/В-тестов, которые регулярно проводятся во многих организациях, есть и причинно следственный вывод (саи$а1 т/егепсе), не получивший пока широкого распространения. В этом разделе я попытаюсь кратко изложить некоторые из самых последних разрабо- ток, которые связывают эти две области знаний. Репозитории с открытым ИСХОДНЫМ кодом Подобно тому, как появление библиотек с открытым исходным кодом для ма- шинного обучения снизило порог входа для специалистов, несколько новых проектов пытаются сделать то же самое для причинно-следственного анализа. Исследовательская команда по методу причинно-следственных связей из М1сто8о<1 разработала несколько проектов, в том числе ЕсопМЬ102, Алпа103 и ПоАУЪу104. Как объясняют105 авторы БоУЛту, их цель состоит в том, чтобы: — обеспечить фреймворк для моделирования с помощью причинно-следст- венных графов (ПАС); — сочетать лучшее из подходов И АС и потенциальных исходов; 102 Ьнр$://'К'\<ту.руг<ку.ог^/ ЕсопМ 1 /зрес/5рес.Ьгт1 103 Ь1гр8://$11йиЬ.сот/т1сго8ОЙ/рго)ес1-а7иа 104 Ьпр<;://у(ггулу.руг\Ьу.ог^/Цог\’Ьу/у0.9.1/1пс1ех.Ь1т1 105 Ьцр8://чут.руууку.огяМоту1гу/у0.9.1/и5ег_|Щ1<1е/т1го.Ь1т1
— -'автоматически [тестировать] обоснованность допущений, если это воз- можно, и [оценивать] устойчивость оценки к нарушениям». Последняя цель наиболее привлекательна для специалистов; имея данные по лечению, исходам и т. д„ а также причинно-следственную модель, вы можете получить достаточно информации о том, есть ли у вас идентификация и диапа- зон правдоподобных оценок. Как и следовало ожидать, автоматизация лежит в основе исследовательской программы, возглавляемой Джуда Перлом и другими специалистами в области компьютерных наук. ЕсопМГ — это библиотека РуЙтоп, предназначенная для использования са- мых современных методов МЬ для оценки причинно-следственных связей. Как следует из названия, представленные методы находятся «на стыке эконометри- ки и [МЬ]». Вы можете найти несколько самых современных методов, которые используют допущение об отсутствии смещения, например двойное машинное обучение, двойное надежное обучение и оценки на основе лесов. Я подробнее расскажу об этом позже. Агиа — это библиотека, которая использует самые современные методы МГ для улучшения процесса принятия решений. Задача делится на два независимых этапа — «следующий лучший вопрос» и «следующее лучшее действие». Первый связан с тем, какие данные необходимо собрать для принятия более обоснован- ных решений, и включает проблемы, связанные с вычислением пропущенных значений, а также с тем, насколько информативны различные переменные для данной проблемы. Второй использует причинно-следственный вывод для выбо- ра оптимальных действий для четко определенных целевых функций. Саш>а1МЬ10° — еще одна библиотека РуТЬоп, созданная ЪтЬег. Она включает в себя несколько основанных на МЬ методов оценки причинно-следственных связей для ирИЙ-моделирования, таких как деревья и мета-обучение. Аналогич- ная библиотека—руНЙ106 107. Чтобы разобраться в ирНЙ-моделировании108, представьте, что вы обучаете классификатор перекрестных продаж, который будет предсказывать, кто из ва- ших клиентов приобретет данный продукт компании. После обучения вы можете построить график распределения оценок, как показано на рис. 15.7, где я разде- лил всех оцененных клиентов на три группы. Группа А — это клиенты с вы- сокой вероятностью совершения покупки Покупатели из группы В с меньшей 106 Ьйр5://саиьа1гп1.геа<1й1е<1ос8.ю/еп/1аге8К:пйех.Ь1т1 107 ]11Тр8://ру]1Й.геай1Ьейос8.1о/еп/1а(е8К 106 Инр8://млумг.ирИЙ гпо3е1т$.сот/еп/у0.3.2/и8ег^щМе/тггоЛисГюп/сотраг^оп.Щт!
вероятностью совершат покупку, а из группы С вероятность совершения покуп ки крайне мала. На каких клиентов вы должны ориентироваться в своей кампании? Многие люди выбирают целевую группу А, — но эти клиенты, скорее всего, совершат по- купку органически, поэтому вы можете использовать этот дорогостоящий сти- мул для привлечения других клиентов. С другой стороны, группа С настолько маловероятна, что стимулирование будет непомерно дорогостоящим. Исходя из этого, группа В — лучший кандидат для привлечения внимания. Распределение оценок Рисунок 15.7. Распределение оценок вероятности перекрестных продаж Цель ирНЙ-моделирования — формализовать эту интуитивную концепцию, используя информацию о лечении и контрольных группах для оценки инкре- ментальности лечения. Двойное машинное обучение Алгоритмы М1_ хороши, когда нужно изучить общий процесс генерации данных, такого каку =/(Х). При использовании ЮАС для описания причинно-следствен- ной модели не упоминается функциональная форма связей, а только их суще- ствование. Традиционно причинно-следственные эффекты оцениваются с ис пользованием линейной регрессии из-за ее простоты и прозрачности. Двойное машинное обучение (йоиЫе птасЫпе 1еагпт§, Г)МЬ) и аналогичные методы на правлены на использование повышенной прогнозной способности и гибкости нелинейных алгоритмов для оценки причинно-следственного эффект а. Чтобы увидеть, как МЕ может улучшить оценку причинно-следственного эф- фекта, воспользуемся следующей частично линейной моделью: у - 00 + ^Х) + и О = И{Х) + V
Как обычно, результат зависит от лечения и некоторых признаков, а лечение также зависит от набора признаков (чтобы создать конфаунлер или смешение выборки). Функции # и /1, возможно, нелинейны, эффект лечения определяет- ся через 3, тогда как и, г — независимые шумовые члены. Обратите внимание, что нелинейность может проявляться только для конфаундеров, но при этом им не разрешается взаимодействовать с лечением. Идея оценщика двойного машинного обучения — использовать возможности нелинейных алгоритмов (таких как случайный лес или градиентный бустинг) для изучения каждой из этих функций и опенки эффекта лечения. Не вдаваясь в под- робности, отметим, что этот процесс включает в себя две важнейшие концепции. Ортогонализация Как описано в главе 10, ортогонализация — это частичное исключение влияния ковариат X на исход и лечение. Вы используете выбранный гиб- кий алгоритм и регрессируете остатки, чтобы получить оценку причинно- следственного эффекта. Разделение выборки Выборка рандомно делится на две равные части, одна из которых использу- ется для обучения, а другая — для оценки. Это необходимо для того, чтобы избежать смещения из-за переобучения и сохранить некоторые желательные свойства большой выборки. Алгоритм работает следующим образом. 1. Разделите выборку рандомно на две половины: к - 1, 2. 2. Используя выборку /, обучите свой алгоритм на 5, как для ^(), так и для й(). 3. Используя единицы / в выборке т * /, оцените остатки: V = П - МХ) 4. Рассчитайте оценочную функцию’05: "т < 6 5 109 Обратите внимание, что это выражение не совсем го, что вы получили бы из процедуры Фриша — Во — Ловелла для регрессии на частичных остатках. Оно ближе к оценщику метода инструментальных переменных (см. ссылки в конце этой главы) . Создатели двой- но! о машинного обучения представляют друг ой оценщик, который более точно следует логике Фриша — Во — Ловелла (смотрите их раздел 4).
5 Усредните оценки по каждой подвыборке: 0 = 0.5 х(ё(5?5т) +0(5^5,)) В репозитории110 кода вы можете найти реализацию и результаты моделиро- вания с использованием линейных и нелинейных процессов генерации данных. Здесь я просто хотел показать подход, где машинное обучение, предоставив бо- лее мощные и общие алгоритмы прогнозирования, повлияло на причинно-след- ственный вывод. Основные выводы Ниже представлены основные выводы из этой главы. Что такое инкрементальность? Инкрементальность — это причинно-следственный вывод, позволяющий оценить, улучшила ли смена рычага бизнес-результат. Почему мы должны учитывать инкрементальность (версия 0)? Если исходить из предположения, что наука о данных создает ценность, пре- доставляя нам возможность принять лучшее решение, то инкрементальность важна тем, что показывает, какие решения заслуживают вложений, а от ка- ких следует отказаться. Почему мы должны учитывать инкрементальность (версия 1)? Даже если улучшение процесса принятия решений — не главный приори- тет для вас или вашей команды, глубокое понимание причинно-следствен ных связей должно помочь вам повысить предсказательную эффективность ваших моделей МЬ. Методы причинно-следственной связи Вообще говоря, есть два альтернативных (и взаимодополняющих) подхода к выявлению и оценке причинно-следственных связей: ЛАС и метод потен- циальных исходов. Первый использует преимущества графов (и <1о-са1си1и8), чтобы найти условия для идентификации. Второй преобразует это в проблему недостающих данных и механизмов отбора, поскольку в любой момент време- ни для каждой единицы может наблюдаться только один потенциальный исход. 10 Ьир8://§11ЬиЬ.сош/с1уаи§Ьап79/с1а1а-8С1епсе-11аг<1-раг1з-со<]е
Конфаундеры и коллайдеры Конфаундеры — это общие причины, а коллайдеры — это общие эффекты для лечения и исходов Отсутствие учета конфаундера открывает обходной путь (бэкдор) и приводит к смещенным оценкам причинно-следственной связи. Тогда как коллайдер — пример плохого контроля в том смысле, что включение его в качестве признака в вашу модель (или, в более общем плане, обусдавливание на нем) также откроет обходной путь и создаст смещение. Смещение выборки Для статистиков и экономистов смещение выборки — один из видов смеще- ния конфаундера, который может возникать при отборе в группу лечения. Для эпидемиологов и специалистов в области компьютерных наук это по- нятие относится к отбору после проведения лечения. Рандомизация в форме РКИ или А/В-тестов решает первое, но не второе. Рандомизация и мэтчинг Рандомизируя отбор в группу лечения, вы эффективно устраняете смещение выборки (в группу лечения). Это объясняет, почему А.'В- тесты стали отрасле- вым стандартом и всегда используются при наличии такой возможности. Су- ществует множество методов на основе данных наблюдений, которые можно использовать для оценки причинно-следственных эффектов, но все они осно- ваны на достоверности допущения об отсутствии конфаундеров. В этой гла- ве мы затронули только тему мэтчинга и мэтчинга по склонности к лечению. Дополнительная литература В своей книге Апа1уИса18кШ$ рог А1 апб Иа1а &лепсе я подробно обсуждаю важ ность инкрементальности и причинно-следственной связи для предписывающей науки о данных. Аналогичную точку зрения можно найти в работе Аджая Агра вала и др. «Искусственный интеллект на службе бизнеса» (РгесИсНоп МасЫпез: Иге 8гтр1е Есопопйсз о/АгИргсга11п1е1Н%епс*) (Нагеагб Визгпезз Ре\те\е Ргезз) и более све- жей книге «От предвидения к власти. Как ИИ-прогнозирование трансформиру- ет экономику и как использовать его силу в своих целях» (Рогнег апб РгесНсНоп: Иге ЕНзгирИуе Есопопйсз о/Агирйла!1п1е1Н§епаг) (Нагуагб Визгпезз Кехзеи’ Ргезз). Базовую информацию о причинно -следственном выводе можно найти в гла- ве 9 «Анализ данных с использованием регрессии и многоуровневых/иерархических моделей» (Иага Апа1узк И$т& КецгезНоп ат! Ми1И1еуе1/1Иегагс1йса1 МоМ$) Эндрю Гелмана и Дженнифер Хилл (СатЬпб^е СГпгуегзйу Ргезз).
Если вас интересует метод РАО для определения причинно -следственных связей, то вводную информацию можно найти в книге Джуда Перла и Даны Мак- кензи «Думай „почему?". Причина и следствие как ключ к мышлению» (ТИе Воок о/\ТИу: ТИе Ыесе Зсгепсе о/Саизе ат! ЕДес?) (Ваяк Воокз). Более технические зна- ния можно почерпнуть в книге Перла «Причинно-следственная связь: модели, рассуждения и логический вывод» (Саиза1Ну: Мос1е1$, Кеа$опт$ ат! 1п/егепсе) 2-е изд. (СатЬгйф’е Сшуегвйу Ргевз). Первая кни[а будет интересна, если вы сначала хотите получить некоторое общее представление по теме, а вторая даст вам бо- лее глубокие знания о РАС и Ло-исчислениях. Для идентификации принципи- альное значение имеют критерии Ьаск- и Ггоп1 боог. Экономисты и статистики отстаивают метод потенциальных исходов. «В основ- ном безобидная эконометрика: компаньон эмпирика» (МозВу Нагт!езз Есопо- те!г!сз: Ап ЕгпртазН Сотратоп) Джошуа Ангриста и Йорна-Штеффена Пиш- ке (РппсеГоп ЕГшуегвйу Ргезз) — отличная книга, если вам интересно разобраться в смещении выборки и многих аспектах линейной регрессии в сравнении с други- ми методами, такими как сопоставление оценщиков (таСсЫпу еьйтаГогв), которые мы рассмотрели в этой главе. Также вы можете найти полное изложение метода инструментальных переменных, который обсуждается в сноске об оценке РМЬ. Книга «Причинно-следственный вывод для статистики, социальных и био- медицинских наук. Введение» (Саиза! ВДегепсерог 81аНзНсз, 8ос!а1, ат! ВютесИса! Ваепсез: Ап МгобисНоп) Гвидо Имбенса и Дональда Рубина (СатЬпб^е СтсегмГу Ргезз) даег всестороннее введение в предмет с опорой на метод потенциальных исходов, также известный как причинно-следственная модель Рубина (именно Дональд Рубин изначально формализовал и разработал эту теорию). Это отлич ный литературный источник, если вы хотите понять роль, которую играют ме- ханизмы отбора. Здесь также очень подробно обсуждается 8ЪТТ\ТА. В последние годы несколько авторов пытались использовать преимущества обоих подходов. Что касается экономики, то в книгах Скотта Каннингема «Причин- но-следственный анализ: АИхСаре» (Саиза! 1п/егепсе: ТИеМ!х1аре“') (Уа1е йтуепйу Ргезз) и Ника Хантинг гон-Кляйн «В поисках эффекта. Планирование эксперимен тов и причинный вывод в статистике» (ТИе Ефес!: Ап 1п1гос!ис1юп ю КезеагсИ Е)ем§п ат! СаизаИГу111 112') (СЬартап апб На11/СКС) обсуждаются несколько методов иденти- фикации и опенки, а также дается четкое вводное объяснение по ИАС. Хотя Мигель Эрнан и Джеймс Робинс пользуются большим уважением сре- ди авторов книг по ПАС, в их работе «Причинно следственный вывод: что, если» (Саиза! 1прегепсе: ХСИаГ Д) (СКС Ргезз) метод потенциальных исходов используется 111 Ьир8://1П1х1аре .5сиптп§.сот/ 112 Ьг1р8://гйеейёс1Ьоок.пег/1п<1ех.Ь1т1
для объяснения причинно-следственных связей и контрфактов, а также для по- лучения многих важных результатов с использованием ПАС. Гвидо Имбенс, который в 2021 году разделил Нобелевскую премию по эконо- мике113 с Дэвидом Кардом и Джошуа Ангристом, участвовал в нескольких дискус- сиях с Джудой Перлом об относительной полезности обоих подходов. Вы може- те ознакомиться с его мнением и обзором в «Подходах к причинно-следственной связи с потенциальным результатом и направленным ациклическим графом: ак- туальность для эмпирической практики в экономике» (рабочий документ114,2020). Возможно, вам также будет интересно прочитать ответ Джуда Перла. Кроме того, если вам любопытно, как развивались эти различные философ ские школы и каковы были их взгляды, вы можете почитать об этом в огкры том специальном выпуске115 журнала ОЬьегуаНоп 81иЛеь 8, № 2 (2022). В нем приведены интервью с Джуда Перлом, Джеймсом Хекманом (еще одним лауре- атом Нобелевской премии по экономике) и Джеймсом Робинсом (эпидемиоло- гом, который руководил исследованиями причинно следственных связей с по мощью структурного моделирования), в которых они делятся своими взглядами на предмет и различные подходы. Авторы Карлос Чинелли и др в своей работе «Ускоренный курс по хорошим и плохим контролям» (СгазИ Соигзе т Соог/ апс! Веи! Соп(го1з) (Социологические методы и исследования, 2022, доступны онлайн116), всесторонне рассматривают проблему плохих контрольных переменных. Элиас Барейпбойм и др. в своей статье «Преодоление смещения выборки в причинно-следственных и статистических выводах» (Кесохепп^/гот 8е1есГюп В1аз т Саиза1 апй 81аИзИса11п/егепсе) (Материалы конференции ААА1 по искус- ственному интеллекту 28, № 1,2014, также доступны онлайн'17) обсуждают сме щение выборки с точки зрения отбора после лечения. По этой геме вы также можете прочитать статью Мигеля Эрнана, где он обсуждает различные виды сме- щения118, а также работу Луизы X. Смит «Механизмы отбора и их последствия: понимание и устранение смещения выборки» (8е1есИоп МесИашзтз апс! ТИегг Сопзециепсез: ПпбегзСапбт^ апс! АсШгеззт% 8е1есНоп Вгаз) (Сиггеп! ЕрМепио1о§у КерогС, 7, 2020, также доступна онлайн119). 113 ИНр5://\\т\пу.поЬе1рп2е.01§/рпге5/есопот1С вс1епсе$/2021/ьиттагу/ 114 Кпрь://агх1у.ог^/р<1Г/1907.07271 115 Ь| ф$://ти5е.)Ьи.е<1и/ь5ие;4888.5 11ь ЬПр5://саг1о5С)пе111.сот/й1е5/С1пе111%20е1%20а1%20(2020)%20-%20А%20Сга5Ь%20 Соиг5е%201п%20Стоо<1%20ап<1%20Ва<1%20Соп1го18.р<1Г 117 ЬПр8://Йр.с8.ис1а.е<1и/риЬ/81а1_8ег/г425.рЛ 11,1 ЬПр8://Ь8рИ.йагуагс1.е<1и/ргой1е/гт$ие1- Иегпап/ 119 Ьпр5://\уу|^-.1ош8а118П111Ь.сот/риЫ1саНоп8/8тк1120208е1ес(1оп.р<1Г
В книге «Доверительное А/В-тестирование. Практическое руководство по контролируемым экспериментам» (Тги$№оНку ОпИпе Соп1гоИес! Ехреггтсп(з) (СатЬпД^е ЕГтуегзйу Ргезз) Рона Кохави и др. обсуждаются многие важные темы, связанные с разработкой А/В-гесгов. включая проблему нарушения ана- лиза или правила $Г)ТУА. Вы также можете ознакомиться со статьей Питера Аронова и др. «Побочные эффекты в экспериментальных данных» (ЗрШоуег ЕДёс1з т Ехрептеп1а1 Иа1а) в сборнике под ред. Дж. Друкман и Д. Грин «Достиже- ния в экспериментальной политической науке» (АсДапсез т ЕхрептеШа1 РойИса! Заепсе) (СатЬпбде Стсегзйу Ргезз, агХгу120). Книга Ма геуса Фейкура «Причинно-следственный анализ на РуДтоп» (Саиза! 1п/егепсе ш Ру(коп) (О’КеШу) содержит обзор многих тем, обсуждаемых здесь в рамках целой книги. Вы также можете ознакомиться с онлайн-версией его к ни ги «Причинно-следственные выводы для смелых и правдивых» (Саиза! 1пГегепсе Гог Д1е Вгауе апб Тгие121). Про ирНЙ-моделирование вы можете прочитать в заметке Шелби Темпл «СрПД- моделирование: краткое введение» (ЕТрНЙ МоДе1ш§: А Ошск 1п1гоДисДоп122) (ТоигагДз ЛаГа Зстепсе, июнь 2020). Этой теме посвящена глава 7 книги Эрика Сигела «Прогнозная аналитика: способность предсказывать, кто кликнет, ку- пит, соврет или умрет» (РгесИсНуе Апа1уИа: Нге Рошег 1о РгесИс! УДю У/И1 СИск, Виу, Ые, ог П:е) (ДУйеу) в изложении для широкой публики. В работе Жана Каддура и др. «Каузальное машинное обучение: обзор и от- крытые проблемы» (Саиза! МасИте беагшпу: А Зиггеу апб Ореп РгоЫетз) (2022, агХту) вы найдете помимо МГ и причинно-следственной связи актуальное резю- ме многих важных тем, которые не обсуждались в этой главе. Если вы хотите узнать больше о двойном машинном обучении, ознакомьтесь с оригинальной статьей Виктора Черножукова и его соавторов «Двойное машин- ное обучение для обработки и структурных параметров» (йоиЫе/Г>еЫа$ес1 Маскте Ееагптд/ог Тгеа(теп( ап<1 $1гис1ига1 Рагате1сг$) (Есопотетпсз )оигпа!, 21, № 1,2018). Я также нашел полезными конспекты лекций123 Криса Фелтона и заметку1’* Ар- тура Таррелла «Эконометрика в РуДтоп, часть 1 — Двойное машинное обучение» (Есопоте1псз т Ру11юп Раг11— ЛоиЫе Маскте Ееагтп$) Там же вы найдете ссылки на пакеты РуДюп и К125. Пакет ЕсопМЕ126 также содержит методы для оценки !)МЬ. 120 Еир5://агх1У.ог^/р<й72001.05444 121 ЬПр8://та±еи5Гасиге рДшЬло/ругЬоп -саизаКТу-йагкГЬоок/кпсИпд ра§е.Ьгт1 122 Ьирз:/Дон'агВ8<1а1а8С1епсе.сот/а-цшск-ир11Й-гпо<1е1т§-:п1гос1ис11оп-6е14с1е32Ые0 123 Ь11р8://8ЙеЬиНс1ег.рппсе1оп.еЛи/ 12,1 йирь://аеГигге11.соп1/Ыо^/ро818/есопоте1пс8-1п-р)1Ьоп-раг11-т1/ 125 Ьир8://До;8.<1оиЫет1.огр/51аЫе/|пДех.Н1:т1 126 ИирзУ/и'УТУ.руууйу.оц’/ЕсопМЬАрес/ебЦгпаПоп/ йпй.Ьггт
ГЛАВА 16 А/В-тесты В главе 15 мы обсудили, насколько важна рандомизация для оценки причинно- следственных связей, особенно когда этот метод доступен дата-сайентисту. Пре- имущества этого подхода используются в А/В тестах, чтобы повысить эффек- тивность принятия решений в компании в рамках локальной оптимизации. В этой главе описываются А/В тесты, которые должны помочь вам разо- браться во многих тонкостях этой относит ельно простой процедуры и повы- сить эффективность принятия решений. Что такое А/В-тест? В своей простейшей форме А/В-тест — это метод оценки того, какой из двух ва риантов лучше с точки зрения заданной метрики. А обозначает вариант по умол- чанию, или текущий, а В -- экспериментальный для сравнения. В более сложных тестах задействуются несколько вариантов одновременно и выявляется лучший из них. Используя формулировки из главы 15, единицы (ипй), получившие А или В, называются контрольной и экспериментальной группами соот ветственно. Из этого описания вы можете видеть, что в каждом А/В-тесте несколько со- ставляющих. Метрики Поскольку А/В-тесты лежат в основе улучшения процесса принятия реше- ний, их разработка всегда должна начинаться с выбора правильной метри- ки. Методы, описанные в главе 2, должны помочь вам найти подходящую метрику для теста, который вы хотите провести Я обозначу эту метрику для результата как У Рычаги или альтернативы Как только метрика выбрана, вам нужно подумать о рычагах, которые ока- зывают на нее самое непосредственное влияние. Распространенная ошиб- ка — начать с альтернативы (скажем, фонового цвета кнопки на вашей
веб-странице или в приложении) и попытаться провести реверс-инжиниринг для некоторой метрики. Я много раз сталкивался с этим на практике, и это почти всегда приводит к потере времени, разочарованию команды и неубе- дительным результатам. Рандомизированный отбор Вы всегда должны отбирать тех, кто получает доступ к какому либо варианту. А/В-гесты также называются рандомизированными контролируемыми иены таниями, поскольку по замыслу отбор пользователей в группы для экспери мента является случайным, и это устраняет любые конфаундеры или смеще- ние выборки. Критерии принятия решения Каждая единица (шан) 1, участвующая в эксперименте, имеет соответствующий исход, обозначаемый У. В конце эксперимента вы собираете данные по этой ме трике для единиц в обеих группах, и ваша задача — определить, превосходит ли новая альт ернат ива базовый вариант или нет. Есть несколько способов решения этой задачи, но наиболее распространен- ный — сравнение средних значений выборки для обеих групп. Основная труд- ность здесь заключается в т ом, ч то вам нужно отделить сигнал от шума. Сигнал Исход (У) Шум Исход (И Рисунок 16.1. Разделение шума и сигналов На рис 16.1 показаны два типичных сценария. На каждом графике отобража- ются показатели исходов для каждой единицы в группах эксперимента и конт- роля (вертикальные линии), а также средние значения выборки (треугольники). Слева представлен сценарий с чистым шумом, в котором распределение исходов
для эксперимента и контроля одинаково, но, если бы вы просто сравнили сред- ние значения, вы бы пришли к выводу, что рычаг В был лучше. На рисунке спра- ва обработка (1геа1теп1) сдвинула распределение вправо, что привело к реаль- ному расхождению между средними исходами Статистические тесты позволяют вам форма лизировать свои интуитивные представления. Обычно нулевую гипотезу противопоставляют эксперименталь- ной и вычисляют I -статистику с известным распределением. Обозначим через У , к € {А, В} среднее выборочное значение для единиц в группе Ср ^=4- у. Наиболее распространенный критерий, используемый в А/В-тестах, такой: сохраняйте рычаг к, если У, - У > 0 и разница статистически значима. В соответствии с этим критерием все, что вам нужно сделать, — это выпол- нить стандартный 1-тест, который сравнивает нулевую гипотезу (отсутствие эф фекта) с экспериментальной. Обозначим разницу в средних исходах через = —. Двусторонний статистический тест следующий: Ни: = 0 Н :*0 Но обозначает нулевую гипотезу о том, что разница в результатах отсутству- ет. Ваша цель — отклонить эту гипотезу, имея некоторую степень уверенности, если ее нет, вы сохраняете базовый рычаг А (или нет, поскольку они неотличи мы с точки зрения этой конкретной метрики). Рисунок 16.2. Принятие решения о том, сохраняете ли вы экспериментальный вариант На рис. 16.2 показано, как это делается на практике. Здесь изображено теорети- ческое распределение для вашей 1-статистики при нулевой гипотезе об отсутствии эффекта (обратите внимание, что оно центрировано на 0), которое обычно прини- мается за (-распределение Сл ьюдента. Вы вычисляете свою г статистику, и, если она
попадае] в закрашенную область (зону отклонения), вы можете отклонить нулевою гипотезу пр11 уровне значимости а, который обычно ус танавливается на 5 % или 1 %. На графике это закрашенная область, и она достаточно маленькая. Давайте здесь остановимся, чтобы интерпретировать эти вычисления. Вы бирая достаточно низкий уровень значимости, вы. по сути, утверждаете: «Если нулевая гипотеза была бы верна, то наблюдать такое большое значение 1-ста- тистики было бы практически невозможно, поэтому моя нулевая гипотеза, возможно, ошибочна». Иными словами, события, крайне маловероятные при справедливости нулевой гипотезы, рассматриваются как основание для ее от- клонения. Например, если вы выберете уровень значимости 1 %, вы должны на блюдать (-статистику, которая попадает в область отклонения 1 из 100 раз. Но вы получили это в своем эксперименте! Либо вам очень не повезло, либо ваша ну левая гипотеза была неверной. Вы выбираете второе предположение, не надеясь на удачу, и отвергаете нулевую гипотезу. Давай ге рассмотрим пример, используя только 10 наблюдений из набора дан ных на левой панели на рис. 16.1 (см. таблицу 16.1). Таблица 16.1. Исход для первых 10 единиц I № Контроль Лечение 0 0,62 0.82 1 1,07 0,23 2 0,56 2,47 3 -0,61 0,54 4 2,63 1,12 5 0,17 -0,40 6 0,94 -1,12 7 1,44 2.60 8 2.25 1,39 9 1,42 0.84 Среднее 1.05 0,84 Для этих 10 единиц разница в средних исходах сос гав.ляе г 0 = 0,84 - 1,05 = -0,21. Чтобы вычислить 1-статистику, нам сначала нужна дисперсия разницы: \2= .1 =(у.-уА)Жк-1) * 1 е с, 1 * * к 2 2 Г«г(0) = У«г(Ув) + Уаг У4 = = 0,224 0 С-зТаС = , = -0,44
Достаточно ли велика эта 1-стагистика, чтобы отклонить нулевую гипотезу об отсутствии эффекта? Мы можем использовать таблицу с критическими зна- чениями или, как вариант, напрямую вычислить значение р (число степеней сво- боды равно IV + X -2)127: р уа!ие - 2(1 - Р(|1-з1а1 |)) - 0,67 При нулевой гипотезе существует вероятность в 67%, что значение р будет как минимум таким же экстремальным: п люс/минус 0,44. Поскольку этот пока- затель достаточно немаленький (обычно < 5 ?4>), вы не можете отвергнуть нуле- вую гипотезу о том, что это чистый шум. Следуя логике принятия решения, вы оставляете базовый вариант. Вы можете использовать линейную регрессию, чтобы полу- чить точно такой же результат. Для этого запустите регрес- сию: т=а + еэ + е После вычисления У вы можете использовать значение р, которое многие пакеты рассчитывают заранее. Обратите вни- мание, что 5С1кк-1еагп'28 не вычисляет значенияр, но вы може- те воспользоваться зШзтоДек129. В репозитории кода130 я по- кажу вам, как рассчитать это вручную, используя зШзтоДе! и метод Ыез! из 8стРу131. Помимо простоты, линейная регрессия также позволяет включать другие контрольные переменные (признаки), кото рые могут давать меньшие доверительные интервалы. Я при- веду ссылки на литературу в конце этой главы. Минимальные обнаруживаемые эффекты Я надеюсь, что убедил вас в том, что этот критерий принятия решения довольно легко реализовать, используя следующий трехэтапный процесс: 127 Г обозначает кумулятивную функцию распределения для {-распределения. 128 кйр5:/Лс1к11-1еагп.ог$/51аЫе/гпо<1и1е5'§епега1е<1/8к1еа1п.1теаг_1Г1ос1е1.1лпеа1Ве§геьыоп.1Шп1 129 ЬКр8://мпумг.81а1ьто4е18.ог§/81аЫе,’герге581оп.111т] 130 Ь(Тр5://еЛНиЬ.сот/с1уаирЬап79,'<1аи-8аег1се-Ьагс1-рг.г15-сос1е 131 Ьнр8://4ос8.8С1ру.ог§/с1ос/8С1ру/ге/ёгепсе/§епега1е<1/8С1ру.8{а18.ие5Т_1пс1.Н{т1
1. установите уровень значимости (скажем, 5 %); 2. вычислите 1-статистику и значение р; 3. отклоните нулевую гипотезу об отсутствии эффекта, если значение р ниже уровня значимости. Я обсуждал аналогичные решения на основе пороговых значений в главе 14, где ложные положительные и отрицательные результаты возникали естествен- ным образом. Оказывается, ложные положительные и отрицательные результа- ты также играют важную роль при разработке А/В-тесгов. В этом контексте ложноположительный результат возникает, если вы оши бочно делаете вывод о наличии эффекта от эксперимента, а ложноотрицатель ный — если вы ошибочно делаете вывод об отсутствии эффекта. Как уже говорилось, уровень значимости контролирует вероятность лож неположительного результата. Когда вы отклоняете нулевую гипотезу {поло- жительное, потому что вы говорите, что эффект есть), вероятность того, что вы допустили ошибку, определяется уровнем значимости (а). С другой сторо- ны, статистическая мощность позволяет контролировать вероятность ложно- отрицательного результата и имеет решающее значение для планирования экс- периментов. На рис. 16.3 показаны два распределения: слева распределение центрирова но на 0, допуская, что эффекта нет (в - 0). Справа я построил распределение для допущения, что существует положительный эффект (О’ > 0). Ко второму рас- пределению мы обратимся при обсуждении ложноотрицательных результатов. Рисунок 16.3. Ложные положительные и отрицательные результаты Для данного уровня значимости заштрихованная область РР обозначает ве- роятность ложноположительного результата, когда вы неправильно отклоняе те нулевую гипотезу, тем самым делая вывод о наличии эффекта, хотя на самом деле его нет. Теперь предположим, что вы пришли к выводу, что эффекта нет. Это происходит в случае, когда ваша 1-статистика оказывается левее критического
значения I 132. При ложноотрицательном результате истинное распределение должно быть примерно таким, как показано справа, а заштрихованная область Е^ обозначает вероятность ложноотрицательного результата для этого распре- деления. Минимальный обнаруживаемый эффект (тМтит бе(ес1аЫе еффес1, МОЕ) — это минимальный эффект эксперимента, который вы можете обнаружить при заданном уровне значимости и статистической мощности. Он определяется по следующей формуле, где Л' = X к Лтв — общий объем выборки в эксперимен- те, Р = — доля обработанных единиц, и, как и ранее, 1к — критические зна- чения из {-распределения133: МОЕ = {фа + Почему МОЕ так важен? Даже если истинный эффект существует, коз да он меньше, чем МОЕ, вы сможете оценить его, но он будет казаться статистически незначимым. На практике это означает, что вы проводите тест и приходите к вы- воду, что лечение не дало инкрементального эффекта. Вопрос в том, является ли это истинным или ложным от рицательным результатом. В тестах с недостаточ- ной мощностью вы не сможете сказать, какой именно вариант верен. Следовательно, ваша цель при разработке А/В теста — добиться как можно более низкого МНЕ. Небольшие МОЕ гарантируют, что по замыслу вы сможе- те найти одинаково малые сигналы (истинный эффект) среди всех имеющихся у вас зашумленных данных. Рисунок 16.4. Взаимосвязь между МОЕ, дисперсией и размером выборки 132 Нижний индекс теперь равен а вместо а/2, потому' что сейчас я рассматриваю односто- ронний тест. 133 Вы можете найти вывод здесь: Ипр5://§йЬиЬ.сот/11уаи§11ап79/апа1у11са18кй15Ьоок/ЫоЬ/ та81ег/)ируГег_по1еЬоок8/аррепс11Х.1рупЬ
На рис. 16.4 показана взаимосвязь между МНЕ, размером выборки и диспер- сией исходов. При фиксированной дисперсии увеличение объема выборки в ва- шем эксперименте снижает МНЕ. Другими словами, чем масштабнее экспери- мент, тем пунше для оценки небольших эффектов Теперь определите объем выборки и проведите вертикальную линию поперек различных кривых на рисунке. Чем более зашумлены ваши данные (чем выше дисперсия), гем выше МНЕ. Так что при работе с зашумленными данными вам нужны более объемные выборки для получения сопоставимых МНЕ. Давайте выделим ключевые моменты этого раздела. — Следует разрабатывать тесты с маленьким МНЕ. — Для этого вам нужно провести более масштабные по обь- ему выборки эксперименты. Как бы просто это ни звучало, имейте в виду, что разра- ботка более масштабных экспериментов может повлиять на рабочие процессы в вашей организации. Часто приходит- ся приостанавливать любые контакты с участниками теста на несколько месяцев, поэтому у крупных экспериментов есть и обратная сторона. Мы обсудим это позже, когда я буду го ворить об управлении экспериментами. В примере 16.1 показано, как можно вычислить МНЕ в РуДюп. Чтобы най ти критические значения для ^-распределения, пользователь должен указать статистический размер (значимость) и мощность (или использовать значения по умолчанию). Количество степеней свободы обычно зависит от размера ва- шей выборки; здесь я устанавливаю его равным п - 1, но для достаточно объем- ной выборки коррекция не требуется. Чтобы найти критические значения, используете функцию, обратную функ- ции кумулятивного распределения (сити1аиуе сНзМЬииоп Гипсйоп, СРГ). В 8с1Ру вы можете использовать метод ветру. зЕаДз. 1:. ррР(). Поскольку я хочу полу- чить критическое значение в правом конце распределения для р, мне нужно вы- честь уровень значимости из единицы. Такая же логика работает и для второго критического значения (1. .), которое теперь находится на левом конце распре- деления.
Пример 16.1. Скрипт на Ру1коп для вычисления МОЕ йеГ сотриСе_пде(ьатр1е_5гге, чаг_ои1:сопе, 8<ге=0.05| ро!«ег = 0.85); № Редгеел о/ ргеейоп: и$иа11у а рипсИап ор яптр1е з(.ге <1оГ = 5атр1е_51ге - 1 1_а1рЬа = БгагБ.Р рр1"( -вгге, йоЕ) ЕошЬеТа = зТаТз.1. ррГ(рсыег, доЕ) р = 0.5 деп - 5аг'1р'1е_5т.ге,р*( р) МОЕ = (1_а1.рЬа + Е_окЬе1а)*пр.5дгг(уаг_ои1:со1’1е/с1ег1) ге6игп МОЕ Во многих случаях вам нужен не МОЕ, а минимальный объем выборки, со ответствующий желаемому МОЕ: он поможет вам выбрать правильный мас- штаб вашего эксперимента. К счастью, вы можете инвертировать функцию и вычислить объем выборки как функцию ог всего остального; обратите вни- мание, что теперь вам нужно включить МОЕ Пример 16.2 показывает, как это сделать. Пример 16.2. Скрипт на Рувюп для вычисления минимального объема выборки РеЕ сотриЕе_5ап'Э1(- $1ге(тс1е, еаг_оиЕсоре, даТазЕге, 05, роиег = .85): # с'аТа_5гге 15 (7>е пиорее ор зиЬдесСз и5ес! Со соприСе <7>е уаггопсе ор # {Ьс оиСсопе ^аг_оиСсопе} доГ = йаСа_5Ое - Т_а1рЬа - зЕаСз С.ррН -512е, со?) С_опЬеТа = 5Са15.Т ррЕ(рохег, РоЕ) 5ит_-с = 1_а1рНа + Е_огЬе1а р = 0.5 5апр1е_51?е = уаг_оиТсоте/(р*(1-р))’(5ит_Е**?/тРе**/) геЕигп 5аир1.е_5Ое Теперь я расскаж) о выборе остальных параметров. Выбор значений для статистической мощности, уровня и Р Обычно вы выбираете а - 0,05 и р = 0,15. Конечно, лучше, чтобы оба параме- тра были как можно меньше, но для фиксированного МОЕ вам придется вы- брать один из них. На практике обычно приходится выбирать между вероят- ностями ложного положительного и ложного отрицательного результатов (см. рис. 16.5). Разрабатывая свой эксперимент, вы можете учесть это и посмотреть,
что для вас важнее. Просто не забывайте верно интерпретировать эти значе- ния: 5% — это вероятность ложноотрицательного результата при нулевой ги- потезе и 15% — вероятность чожноположительного результата при альтерна- тивной гипотезе. Рисунок 16.5. МИЕ, уровень значимости и мощность Чтобы определить долю единиц из группы эксперимента (Р), обратите вни- мание, что при прочих равных условиях МНЕ минимизируется при Р = 0,5; это значение становится разумным выбором. На практике это означает, что группы эксперимента и контроля имеют одинаковый размер. Оценка дисперсии исходов Последний необходимый параметр — это дисперсия исходов (Уаг(У)). Во мно- гих случаях вы можете оценить ее по имеющимся у вас данным. Например, если ваш исход — средняя выручка с одного пользователя, вы можете сделать рандомную выборку клиентов в своей базе данных и оценить дисперсию меж- ду ними. Есть еще один прием, когда за исход принимается двоичная переменная, — например, коэффициент конверсии. Например, если цель вашего эксперимен та — выяснить, повышает ли новая функция скорость конверсии, то каждый отдельный исход равен У. 6 {О, 1}, в зависимости от того, закончится ли он про- дажей или нет. Вы можете смоделировать это как испыт ание Бернулли с вероят - ностью с], где вы знаете, что дисперсия равна Уаг(У) = д(1 - ц). Вы можете исполь- зовать среднее значение коэффициента конверсии по предыдущим кампаниям и заменить его на ц в уравнении, чтобы получить оценку Наконец, вы всегда можете сначала запустить А/А тест. Как следует из на звания, пользователям в обеих группах предлагается базовый вариант А. Затем вы можете использовать результаты этого эксперимента для оценки дисперсии и исхода.
Моделирование Давайте проведем несколько моделирований, чтобы убедиться, что все эти кон- цепции понятны. Я буду использовать следующий простой процесс генерации данных для обоих моделирований: 6 ~ Лт(0, <г) 73 - ВегпоиШ(р = 0.5) у= 1О + 0Р+6 В первом моделировании используется д - 0,5, о2 = 3, так что истинный эф- фект невелик (по сравнению с зашумленными данными). При втором модели- ровании остаточная дисперсия остается прежней, но теперь истинного эффекта нет (0 = 0, ст2 = 3). Объем выборки для каждого моделирования — 500. Для первого моделирования я рассчитал минимальный объем выборки, ко торый позволяет мне обнаружить истинный эффект (Д1(МПЕ = 0,5) = Ы* - 346). Затем я создал сетку объемов выборок в диапазоне от 50 % до 150 % от эт ого раз- мера, и для каждого объема выборки я извлек с возвращением из общей выбор- ки 300 подвыборок данного размера. Для каждого из них я оцениваю линейную регрессию, которая включает в себя интерсет и фиктивную переменную, и от- мечаю положительный (отрицательный) результат всякий раз, когда значение р для фиктивной переменной ниже (выше) уровня значимости в 5 %, как я бы сде- лал, если бы эксперимент был реальным. Наконец, я вычисляю истинно положи- тельные и ложноотрицательные показатели, усредняя значения флагов. Рисунок 16.6. Доля истинно положительных и ложноотрицательных результатов: = 0,5 На рис. 16.6 показаны доли истинно положительных (ТРК) и ложноотри- цательных (Р\'К)) результатов для первою моделирования, а также мощность для расчета минимального объема выборки. Как и следовало ожидать, ТРК
увеличивав сся, а ЕНК уменьшается при увеличении объема выборки: более мас- штабные эксперименты дают меньше ошибок прогнозирования. Наиболее важный вывод здесь — обе линии пересекают соответствующие пороговые значения |? = 15%, когда объем выборки равен минимальному раз- меру, который я получил с помощью формулы МОЕ. Повторюсь, это означает, что даже если ваш эксперимент дал эффект, при недостаточном объеме выборки вы отбросите его как статистически незначимый. Что является достаточным объемом в моделировании? Объем выборки, который позволяет мне определить истинный эффект. Это демонстрирует всю прелесть формулы МОЕ и, надеюсь, помотает понять лежащу ю в ее основе логику. На рис. 16.7 показаны результаты второго моделирования, в котором эффект отсутствует в = 0. Я следую тому же критерию принятия решения: если значение р меньше (больше) 5%, я помечаю результат как ложноположительный (истин- но отрицательный). Этот рисунок должен помочь вам лучше понять уровни зна- чимости и значенияр. Здесь вы ошибочно делаете вывод о том, что эксперимент дал эффект, примерно в 5 % случаев. Рисунок 16.7. Доля ложноположительных и истинно отрицательных результатов: = 0 Пример: коэффициенты конверсии (сопуегзюп гаТеь) Давайте рассмотрим более реалистичный пример, чтобы лучше разобраться в этой теме. Вам нужно разработать А/В-гест, чтобы увидеть, может ли другая формулировка для автоматизированных рассылок по электронной почте улуч- шить текущий базовый коэффициент конверсии (КК) в 4%. На рис. 16.8 показан коэффициент конверсии (базовый уровень + МОЕ), ко- торый вы смогли бы установить, если бы использовали выборку в тысячу, мил- лион или миллиард пользователей. При тестировании 1 тысячи клиентов вы
сможете обнаружить инкрементальные изменения только после увеличения конверсии на 3,3 п. п. Например, у вас не получится выявить очень успешный тест, в котором новое сообщение приводит к конверсии в 5,5 %! Если у вас есть доступ только к выборке размером ] тыс. клиентов, рекомендуется не запускать тест: в этом случае у вас получится обнаружить только нереально высокий ин- крементальный эффект. Если у вас есть доступ к 1 млн клиентов, МНЕ будет равен 0,001, и вы сможе- те обнаружить любой коэффициент конверсии, превышающий 4,1 %. Это звучит довольно многообещающе, однако объем выборки может оказаться непомер но большим для проведения эксперимента. Наконец, если у вас будет доступен 1 миллиард клиентов, минимальный коэффициент конверсии, который вы мо- жете определить, составит 4,003% (МНЕ = 3,3е - 5). Следовательно, благода ря большим размерам выборки у вас действительно получится отделить шум от сигнала. Рисунок 16.8. Коэффициент конверсии и МОЕ Не забывайте, что МНЕ относится к инкрементальному изме- нению метрики после обработки, что следует из определения случайной переменной, на основе которой вы делаете вывод: Как показано в примере, после того как вы определите МГ)Е. вы можете найти для обработки соответствующую ми- нимальную обнаруживаемую метрику (пшшпшп <1е1ес1аЫе теГпс), которая будет следующей: Минимальная обнаруживаемая метрика = К + МДЕ Основа
Выбор значения для МОЕ Я надеюсь, что уже убедил вас в правдивости следующих выводов. — При планировании экспериментов необходимо учитывать статистиче скую мощность и значимость факторов, влияющих на объем вашей бы борки. — При проведении экспериментов с недостаточной мощностью вы можете в конечном итоге прийти к выводу, что альтернативный рычаг не дал эф- фекта, хотя на самом деле проблема может заключаться в недостаточном объеме выборки. — Сначала вам нужно установить МРЕ, чтобы определить минимальный объем выборки для вашего эксперимента. Итак, как вы выбираете значение для МРЕ? Важно учесть, что статистиче- ская значимость отличается от бизнес-значимости Вернемся к предыдущему примеру. Даже если вам удалось включить в свой эксперимент 1 миллиард клиентов (половина из них в группе контроля, а по ловина — в группе эксперимента), будет ли этот тест полезен для бизнеса? Ка кую выгоду принесет бизнесу’ возможность обнаружить увеличение показате- ля на З.Зе - 5? Для большинства компаний это ничего не принесет, так что даже если статистические требования соблюдены, с точки зрения бизнеса продолжать эксперимент не имеет смысла134. Следуя этим рассуждениям, вы можете установить вместе со стейкхолдерами реалистичный МРЕ. Например, для них может иметь смысл найти вариант с ко эффипиентом конверсии выше 4,1 %, поэтому' вы должны подготовиться к раз- работке теста для 1 миллиона клиентов. Если у вас в наличии всего 10 тысяч, вы должны обсудить с ними, что вы можете обнаружить коэффициент конверсии только выше 5% (МНЕ = 0,01). Если всех устраивает такая оценка (увеличение на 25 % по сравнению с исходным уровнем), имеет смысл провести эксперимент. Часто стейкхолдер не знает ответа на этот вопрос. Если у вас есть доступ к предыдущему опыту, используйте эти инкрементальные изменения (или сред- нее значение) в качестве МРЕ для реверс-инжиниринга объема вашей выборки. В противном случае подключите свои знания в области бизнеса, чтобы предло- жить разумное решение. 1?4 Конечно, если у вашей компании в запасе один миллиард клиентов, такое незначительное увеличение коэффициента конверсии может принести существенный доход, но не для этого примера.
Бэклог гипотез А/В-тесты настолько хороши и информативны, насколько хороши тестируемые гипотезы. Раньше я работал в компании, где разработчики постоянно проводи ли плохо продуманные эксперименты. Однако отсутствие статистической досто- верности не сильно их тревожило. Большинство этих экспериментов опиралось на плохо обоснованные гипотезы. Наличие бэклога гипотез — один из важнейших аспектов развития культу- ры экспериментирования внутри компании. В идеале это должен быть ранжиро- ванный список гипотез, которые команда хочет протестировать, а также соответ- ствующая метрика и артументы, подтверждающие эффект. Сейчас мы обсудим эти составляющие. Метрики Надеюсь, вы не удивитесь, что я начинаю с метрик. Четко определенная метри ка — основной фактор успешности эксперимента. Как обсуждалось в главе 2, хорошие метрики должны быть актуальными, своевременными, действенными и поддаваться измерению. В А/В-тестах чем ближе метрика к рычагу, тем лучше, и это обычно можно наблюдать, когда она одновременно действенная и релевантная. Здесь я имею в виду, что рычаг влияет на метрику напрямую, а не через цепочки эффектов. По этой причине самые популярные КР1 — не лучшие метрики для разработки теста. Как вы догадываетесь, найти правильную метрику для вашего А/В теста поможет их декомпозиция Гипотеза Хорошие гипотезы как минимум должны основываться на причинно-следственных связях: вы четко указываете, как и почему рычаг влияет на выбранный показатель. Вопрос «Как?» относится к направленности эффекта; например, гипотеза «если мы снизим цену на 1 %, вероятность того, что клиент совершит покуп- ку, возрастет» четко указывает на го, что коэффициент конверсии увеличится за счет ценовой скидки. В этой гипотезе все еще отсутствует объяснение «поче- му», то есть понимание механизма, лежащего в основе этого эффекта. Вопрос «Почему?» имеет решающее значение для оценки достоверности гипотезы, а так же его используют для ранжирования. Прекрасные гипотезы также сопряжены с риском, но не с точки зрения ком пании, а скорее с точки зрения разработчика тестов. Сравните следующие два
утверждения, которые могут легко подтвердить гипотезу о скидке на цену: «[тест важен, потому что] коэффициент конверсии увеличится», и «[тест важен, потому что] коэффициент конверсии увеличится на 1,2 п. п.». Пер- вый просто задает направление, а второй количественно оценивает ожида- емое воздействие. Количественная оценка предоставляет важную информа- цию, которая может быть использована для ранжирования альтернативных гипотез. Ранжирование Важно понимать, что для любой организации проведение экспериментов об- ходится дорого. С одной стороны, есть прямые затраты, такие как время, уси- лия и другие ресурсы. И даже при каждом взаимодействии со своими клиента- ми их восприятие компании может меняться, что может привести к оттоку или, по крайней мере, к снижению эффективности в будущем (например, клиенты помечают вас как спам и становятся недоступными). С другой стороны, суще- ствуют также издержки упущенной выгоды, которую могли бы принести потен- циально более информативные тесты. Л Когда вы учитываете затраты на запуск тестов, ранжирование гипотез становится особенно важным для определения их Й приоритетности. Полезно делиться бэклогом гипотез в своей организации, чтобы разные команды могли принять участие и обсудить ранжирование и другую важную информацию. Управление экспериментами Если вы сделаете тестирование неотъемлемой частью своей стратегии, основан ной на данных, наступит момент, когда необходимо будет внедрить и формали- зовать систему управления. Как и в случае с управлением данными, я склонен придерживаться более прагматичной позиции, когда вы не пытаетесь выполнить исчерпывающий набор задач, а ставите перед собой минималистичный набор целей (которые на самом деле выполнимы). Вот некоторые цели, которые могут быть важны для вашей организации. Подотчетность У экспериментов должен быть четко определенный владелец (обычно коман- да), ответственный за результаты, будь то ожидаемые или пет, теста.
Безопасность бизнеса Следует предусмотреть разумные меры предосторожности, гарантирующие, что ни один эксперимент команды не окажет существенного влияния на биз- нес. Согласно этим мерам, вы должны остановить эксперимент, если один или несколько КР1 превысят предопределенные пороговые значения. Клиента и человекоориентированность Эксперименты, влияющие на поведение людей, независимо от того, клиенты они или нет, должны соответствовать некоторым минимальным этическим стандартам, которые хорошо согласуются с ценностями компании. Эффективность на глобальном и локальном уровнях Когда одновременно проводится несколько экспериментов, необходимо га- рантировать. что группы эксперимента и контроля из разных тестов не пере- секутся. Также может появиться необходимость разработать политику в от- ношении периодов карантина, или отдыха, чтобы не влиять на глобальную эффективность бизнес-операций и других тестов. Инкрементальность знаний Результаты А/В-тесгов — ключевые факторы улучшения процесса принятия решений, поэтому они должны пополнять и обогащать базу знаний, куда за- носятся как успешные, так и неудачные примеры. Воспроизводимость и репродуцируемость Любая документация и код, используемые для разработки и анализа резуль- татов экспериментов, должны храниться в общекорпоративном хранилище для последующего воспроизведения Безопасность Набор технологий, используемых для проведения масштабных эксперимен- тов, должен соответствовать политике безопасности и конфиденциальности данных компании. Прозрачность и мониторинг Результаты должны быть максимально доступны и своевременны.
Основные выводы Ниже представлены основные выводы из этой главы. А/В тесты — это мощные методы, позволяющие улучшить возможности орга низации по принятию решений Вы можете применять А/В тесты для локальной оптимизации основных ме- трик вашей организации. Тесты должны быть разработаны так, чтобы достичь желаемой статисти- ческой мощности А/В-тесгы должны быть разработаны с учетом вероятности ложноположи- тельною или ложноотрицательного результата. Статистическая значимость контролирует первое, а мощность — второе. Эксперименты с недостаточной мощностью могут привести к тому, что вы неправильно оцените истинный эффект эксперимента из-за слишком маленького объема выборки. Количественная оценка минимального обнаруживаемого эффекта (МОЕ) экспе- римента должна помочь вам разработать тесты с хорошей статистической мощностью Расчет МОЕ прост и показывает вам наименьший инкрементальный эффект, который вам нужно оценить при заданном уровне значимости и мощности, объеме выборки и дисперсии рассматриваемого результата. Для заданного МОЕ вы можете рассчитать минимальный объем выборки, используя ту же формулу. Управление экспериментом По мере того как ваша ор1 анизация становится более зрелой и количество одновременно выполняемых тестов увеличивается, вам необходимо создать структуру’ управления, которая позволит достичь минимальные желаемые цели. Я привел несколько примеров целей, которые могли бы подойти вашей организации. Дополнительная литература Книги Говарда Блума «Основная аналитика рандомизированных экспериментов для социальных исследований» (ТИе Соге Апа1уНсз о/Капботйссб ЕхреппипК/ог 8осш1 ЯсзеагсИ) ("Иге 8АСЕ НапбЬоок оЕЗоста! КезеагсЬ МеТЬобз, 2008, доступна
онлайн) или «Минимально обнаруживаемые эффекты; простой способ сооб- щить о статистической эффективности экспериментальных проектов» (Мттшт Пе1ес1аЫе Е$ес1з: А 8тр1е \\'ау 1о Керог! Ле 81аИ$Иса1 Ромег о/Ехрег(теп1а1 Г>ез1$пз) (Еуа1иаНоп Кеу1е\у, 19 (5), доступна онлайн) должны помочь более глубоко разо- браться с формулой МЭЕ. Вы также можете ознакомиться с моими заметками в приложении в книге Апа!уНса18кШз/огА1 ап<1 Оа1а Ваепсе. Во второй части книги Гвидо Имбенса и Дональда Рубина «Причинно след ственный вывод для статистики, социальных и биомедицинских наук. Введе- ние» (Саи$а11п/егепсе/ог 81аИзИсз, 8оаа1, апй Вюте(Нса1 Заепсез: Ап 1п1го^исИоп) (СатЬпсфе Ншуегайу Ргезз, 2015) подробно рассматриваются многие различные аспекты статистического вывода с использованием рандомизации (А/В-тестов), такие как вывод на основе моделей (байесовский), точные р-значения по Фише- ру и повторные выборки Неймана. Однако обратите внимание, что они не затра гивают вопросы проектирования. Книга Рона Кохави, Дианы Ган и Я Сюя «Доверительное А/В-тестирование. Практическое руководство по контролируемым экспериментам» (Тгиз1могЛу ОпИпе СотгоИеДЕхрегппешз А РгасИса! Сшбе 1о А/В Те$1т%) (СатЬг)сфе Ншуегзйу Ргезз, 2020 год) подробно описаны многие сложности, с которыми вы можете столкнуться при разработке и проведении масштабных онлайн тестов. Значи- тельно более краткую и сжатую версию можно найти в книге Рона Кохави и Род- жера Лонгботэма «Контролируемые эксперименты и А/В тесты онлайн» (ОпИпе Соп1го11ес1 ЕхрептеШз апбА/В Тез1з) в издании Д. Пхунга, Г. И. Уэбба и К. Самму- та «Энциклопедия машинного обучения и науки о данных» (Епсус1оресИа о/МасИте Ееагпт§ апй Эа(а 8с1епсе) ($рпп§ег, доступна онлайн). В работе Николаса Ларсена и др. «Статистические проблемы в онлайн- контролируемых экспериментах: обзор методологии А/В тестирования» (81аИ$Иса1 С1га11еп§ез гп ОпИпе Соп(го11ес1 Ехрептешз: А Лег/еи’ рУ А/В Те$Нп$ МеЛобо1ору) (агХху135, 2022) вы найдете свежий обзор по похожим темам. На- пример, здесь мы не касались гетерогенных эффектов лечения или нарушения ЗЪ’ТУА. Рекомендую также книгу Шона Эллиса и Моргана Врауна «Взрывной рост. Как современные быстрорастущие компании совершают успешный прорыв» (Наскт% СгомЛ. Ном Тобау'з ГазтезЕСгомту; Сотратез От Вгеакои1 Зиссезз) (Сиггепсу, 2017), я нашел ее полезной для разработки и реализации успешного бэклога гипотез. Хотя авторы сосредоточились исключительно на темах, связан- ных с ростом, их подход можно легко обобщить 135 йПр5://агх1У.ог§/ рсК/2212.11366
Большие языковые модели и наука о данных в работе Согласно одному исследованию136, из-за достижений в области искусственно- го интеллекта (ИИ) в мае 2023 года в США было потеряно почти четыре тыся- чи рабочих мест, что составляет 5% от всех потерянных рабочих мест за этот месяц. В другом отчете137 глобального инвестиционного банка говорится, что ИИ может заменить 25 % всех рабочих мест, а ОрепА!, один из основных игро- ков в этой области, считает138, что почти 19% всех профессий подвержены зна- чительному влиянию, если судить по доле задач, на которые может повлиять ИИ. Некоторые аналитики139 утверждают, что даже наука о данных подверже- на этому влиянию. Итак, как большие языковые модели (1аг^е 1ап$иа§е тобе1, ЬЪМ), такие как СРТ-4, Ра1М2 или ].1ата 2, изменят практику науки о данных? Будет ли все еще важно разобраться в тех сложных моментах, которые мы разбирали в этой книге или где-либо еще, для вашего профессионального развития и карьерно- го роста? Эта глава сильно отличается от предыдущих, поскольку я не буду объяснять здесь какие-либо методы, а скорее порассуждаю о потенциальном кратко- и сред- несрочном влиянии ИИ на практику работы с данными. Мы также обсудим, смо- жет ли содержание этой книги выдержать испытание временем в условиях ны- нешнего влияния ИИ. 136 Иир5://от5с^с1пслурсп§1перок'егес1.сот'’К'р-соп(еп1/ир1оа35/2023/0б/ТЬе-С11а11еп^ег- КероП-Мау23.р<1Г 137 Ь11р8://т\'И’\у.кеу4Ыг.й/и'р-соп1еп1/ир1оаЙ8/2023/03/С1оЬа1 Есопот1С5-Апа1у51_ ТЪе- РоГепНаИу Ьаг§е ЕГЕесГя-оГАгНйаа! 1п1е111§епсе-оп Есопот1с-СгоиД1т-Вп§§8_Кос1пат.рс11' 138 Ьир8://орепа1.сот/1П(1ех/§р15-аге-§р18/ 139 Ьпр8://текзу.Ьи81пе881П81с1ег.сот/с11а^р1-1оЬ8-а1 г18к-гер1асетеп1-аг11йс1а1-т(еШ}<епсе-а1- 1аЬог-1геп<18 2023 02?г=МХ&1 К=Т#1есй -]оЬ8-со<1ег8-сотри1ег-рго§гаттег8-5ОЙл\’аге-еп^- 1пеег8-с1ага-апа1уг>Г8-1
Текущее состояние ИИ Искусственный интеллект — это обширная область, которая охватывает множе- ство различных техник, методов и подходов, но обычно связана с использованием очень больших нейронных сетей и наборов данных. За последние несколько лет темпы прогресса в области распознавания изображений и обработки естественно- го языка существенно возросли. Именно вторая тема после появления последних версий ЬЬМ на базе ТгапзЕогтег, таких как СРТ4 от Орел А1140 и Уаг<1141 от (Зоо§1е, вызвала ажиотаж и беспокойство по поводу их влияния на рынки труда. ЬЬМ отлично справляются с задачами по обработке естественного языка, включая понимание и генерацию текста, обобщение, перевод, классификацию и генерацию кода. Интересно, что после достижения определенного размера моделей, возникало неожиданное поведение Например, обучение на нескольких примерах, которое позволяет модели осваивать новые задачи уже через значи- тельно меньшее число наблюдений, и логическая цепочки рассуждений, благода ря которой модель ищет решение, разбивая аргументацию на этапы, В широко обсуждаемой статье о влиянии ЕЬМ на рынок труда Тайна Элун- ду и соавторы (2023) рассматривают конкретные задачи, выполняемые предста- вителями различных профессий, и классифицируют их на три группы в зависи мости от степени экспозиции для повышения производительности с помощью ИИ (без экспозиции, прямая экспозиция или экспозиция ИИ-инструментам)142. Среди многих других интересных результатов они показывают, что некоторые навыки в большей степени подвержены влиянию ИИ. Из этой статьи на рис. 17.1 показана корреляция между базовыми навыками и экспозицией143. Как видите, программирование имеет самую сильную положительную корреляцию с экспо- зицией, а наука — наиболее отрицательную. Это говорит о том, что профессии, которые в значительной степени зависят от этих навыков, в большей или мень- шей степени подвержены воздействию соответственно. Что это значит для науки о данных? Анализируя только базовые навыки, вы можете предположить, чго некоторые из них сильно подвержены влиянию — в первую очередь программирование — и другие меньше (например, наука и критическое мышление). Но на самом деле это зависит от того, что, по вашему 140 Ьнр8://орепа1.сот/ги КЪ7т<1ех/§р1-4/ 141 Ьпр5://Ыо^.^оо^1е/1ппоуаИоп-апй-а1/ргос1исГ8/§о<>^1е-Ьагс1- ирйа1е8-1о-2023/ 142 Ссиласно их определению «экспозиция (ехровиге) — это показатель того, сократят ли Ы.М или системы, работающие на базе ЬЬМ, время, необходимое человеку для выполне- ния конкретной (подробной рабочей операции) задачи как минимум на 50 процентов». 14? На графике я усредняю три оценки, которые они приводят в своей таблице 5, то есть в общих чертах передаю их выводы о том, что некоторые навыки более подвержены влиянию ЕЬМ.
мнению, делает дата-сайентист. Правда в том, что дата-сайентисты в разных ком- паниях выполняют широкий спектр задач, а не только связанные с машинным обучением (М1.) и программированием. Рисунок 17.1. Навыки положительно и отрицательно коррелируют с экспозицией (средние значения из таблицы 5 в статье Элунду и соавторов, 2023) Чем занимаются дата-сайентисты? Чтобы лучше понять уровень влияния современного ИИ на науку о данных, да- вайте рассмотрим конкретные задачи, выполняемые на рабочем месте специа- листа. Для этого мы обратимся к списку задач в О*Ке1, который обычно исполь- зуется в подобных анализах; он не идеален и, безусловно, неполон, но все же это полезный ориентир. Каждая задача будет оцениваться по четырем основным навыкам, задейство ванным в науке о данных: знание бизнеса, МЬ и статистики, программирование и мягкие навыки. Моя единственная цель — дать правильную в целом оценку, поэтому я возьму три уровня (низкий, средний и высокий) с числовым кодом 0,1 и 3 соответственно и обозначу их нижним индексом для х. Например, я присваиваю задаче «анализ, манипулирования или обработ- ки больших массивов данных с помощью статистического программного
обеспечения» высокую, низкую, высокую и низкую оценки в отношении знаний в области бизнеса, МЬ, программирования и мягких навыков соответственно. На мой взгляд, для анализа требуется глубокое знание бизнеса, но в остальном эта задача в значительной степени зависит от программирования. Такую же оцен- ку я провожу для всех задач. Для оценки экспозиции я выполняю два действия. 1. Оценка каждой задачи по четырем основным навыкам. 2. Вычисление экспозиции для каждой задачи с помощью следующего урав- нения: Базовые навыки I------------1-------------! Ехрозиге = 0.2 • х. + 0.8 хм + 1 • х„ - 0.2 х. - (0.2 х„ х.. +• 0.2 • хи • х„) г В МЕ Р 8 ' В МЕ В Р' I— -------,-----------1 Аналитические навыки В основе этой формулы заложены следующие логика и предположения — Ы_М могут освоить все базовые навыки — по крайней мере, в какой-то степени. С точки зрения экспозиции, я ранжирую их как 8оЙ < Визшезз < МЬ < Рго$гапитнп§, отсюда и весовые коэффициенты в линейной ча- сти. Этот порядок отражает мнение о том, что по крайней мере в кратко- срочной перспективе программирование больше подвержено экспозиции, чем МЬ, которое еще более подвержено этому воздействию, чем бизнес- знания, и далее — чем мягкие навыки. — Я считаю, что задачи МТ и программирования, связанные со знанием биз- неса, требуют аналитических навыков и критического мышления, которые будет сложнее развивать до тех пор, пока не появится общий искусствен- ный интеллект (АС!) или интеллект на уровне человека. Поэтому я включаю коэффициенты взаимодействия, которые снижают показатель экспозиции. Важность мягких навыков заслуживает дальнейшего обсуждения: я считаю, что они останутся чрезвычайно необходимыми для общения между людьми. Но как бы фантастично это ни звучало, довольно легко представить себе ситу- ацию в будущем, когда ИИ полностью заменит одного из участников общения, а мягкие навыки станут уже не так важны Результаты представлены в таблице 17.1. Из 15 задач, перечисленных на веб- сайте О*Не1, 40% относятся к навыкам с высокой экспозицией, 20% — со сред- ней и 40% — с низкой. Если посмотреть на показатели для конкретных задач, то он, на мой взгляд, выглядит в целом корректным, и, как и ожидалось, задачи
программирования и МЬ более подвержены воздействию, но потребность в ана- литических навыках снижает их общую экспозицию. Каждая из шести задач с низкой экспозицией в значительной степени зави- сит от бизнес-знаний, аналитических или мягких навыков. Аналитические на- выки сильно снижают оценку всех тех навыков, в которых дата-сайентист фор- мулирует или предлагает решения. С другой стороны, задачи, которые я оцениваю как подверженные высокой экспозиции, легче автоматизировать при текущем уровне развития ИИ. На дан- ный момент для выполнения некоторых из них все еще требуется опытный спе- циалист, но в ближайшем будущем это может измениться. Таблица 17.1. Задачи дата-сайентиста и экспозиция 1 Задачи Экспозиция Проводить устные или письменные презентации результатов математического моделиро- вания и анализа данных для руководства или других конечных пользователей Низкая Рекомендовать решения, основанные на данных, стейкхолдерам Низкая Выявлять бизнес-проблемы или цели управления, которые можно решить с помощью ана- лиза данных Низкая Находить решения бизнес-задач, таких как составление бюджета, подбор персонала и мар- Низкая кетинг, используя результаты анализа данных Предлагать решения в области инженерии, науки и других областях, используя математи- ческие теории и методы Низкая Читать научные статьи, материалы конференций или другие источники исследований, что- бы познакомиться с новыми аналитическими тенденциями и технологиями Низкая Применять алгоритмы выбора признаков к моделям, предсказывающим интересующие результаты, такие как продажи, текучка и здравоохранение Средняя Анализировать, подготавливать или обрабатывать большие массивы данных с помощью статистического программного обеспечения Средняя Разрабатывать исследования, опросы мнений или другие инструменты для сбора данных Средняя Очищать и обрабатывать исходные данные с помощью программного обеспечения для Высокая статистического анализа Определять взаимосвязи, тенденции или любые факторы, которые могут повлиять на ре- Высокая зультаты исследования Тестировать, проверять и изменять модели, чтобы обеспечить точное прогнозирование Высокая интересующих результатов Применять методы выборки для формирования групп исследования или использовать ме- тоды полного учета Высокая Сравнивать модели с помощью статистических метрик эффективности, таких как функции потерь или доля объясняемой дисперсии Высокая Писать новые функции или приложения на языках программирования для проведения Высокая анализа
Эволюция должностных обязанностей дата-сайентистов Если мы возьмем в качестве должностных обязанностей дата-сайентистов спи- сок из основных 15 задач и предположим, что прогнозы об экспозиции в целом верны, то становится очевидно, что наука о данных должна будет эволюциони- ровать по мере дальнейшего внедрения в компаниях более мощного ИИ. Что касается программирования, по всей видимости, существует консен- сус о том, что текущий уровень развития ИИ существенно повышает продук- тивность разработчика. Такие инструменты, как СйНиЬ СорПо!144 и Вагб145, становятся стандартом, и есть все основания полагать, что дата-сайентисты и дата-инженеры тоже смогут их освоить. Некоторые даже говорили о деся- тикратном повышении146 производительности, и недавний опрос147 показал, что более 90% разработчиков уже используют ИИ для повышения произво дительности. Однако текущее состояние ЕЕМ для работы требует присутствия эксперта- человека, который будет как подсказывать и направлять ИИ к желаемому от- вету, так и устранять некоторые возможные ошибки и галлюцинации148. Кро- ме того, в отличие большинства задач исключительно по разработке ПО, для программирования с использованием данных необходимо, чтобы результаты имели смысл с точки зрения бизнеса, и сейчас для этого все еще необходим эксперт. Но стоит задаться вопросом: смогут ли в не столь отдаленном будущем стейк- холдеры бизнеса напрямую взаимодействовать с ИИ, делая профессию дата-сай- енгиста абсолютно излишней? Например, во многих компаниях дата-сайентисты берут бизнес-требования от стейкхолдеров и кодируют необходимые запросы на 8(Л. для создания отче- тов или дашбордов. Это одна из задач, большую часть которой, по моему мне- нию, может выполнять ИИ, поэтому в будущем она может исчезнуть из описа- ния должностных обязанностей дата сайентистов. Итак, как будут выглядеть должностные обязанности дата-сайентистов в бу дущем? Пока общий ИИ не разработан (в противном случае каждую профессию 144 йир8://^йЬаЬ.Ыо^/а1-ап<1-т1/^епега11Уе-а1/йоту-сотраП1е8-аге-Ьоо811п^-ргойисиу11}-\уИЬ- $епега11Уе-ап 145 Ькр5://Ыо§.§оо§1ейппоуа1юп-апс1-а1/рго<1ис18/сос1е-\у1411-Ьаг<1/ 146 Йпр$://х.сот/раи1§,'81а1и8/16682б6280187580418 147 1Шр8://т\’М’М'.гес11С1гс1е.т/2023/06/14,'оуег-90-оГ-йеуе1орег8-и8е-а11оо18-а1-туогк вип-еу 148 ЬПр8://\умчу.ип11е.а1ЛуЬа1-аге-11т-11а11ис1паТюп8-саи5е8 ейпса! сопсет-ргетепНоп/
пришлось бы переформулировать), мне кажется, что есть два альтернативных долгосрочных сценария149. — Бизнес-стейкхолдеры без технического образования начинают принимать решения на основе данных и учатся получать ответы из данных, а также аналитически и научно подходить к решению своих бизнес-проблем — Дата-сайентисты становятся опытными в бизнесе и аналитике и учатся принимать бизнес-решения на основе фактических данных. В первом случае профессия дага-сайентиста исчезает, и люди без техниче ского образования активно учатся и приобретают навыки, необходимые для взаимодействия с ИИ и поиска ответов на бизнес-вопросы на основе данных (вспомните предыдущий пример с 80Б). В этом случае ИИ усиливает способно- сти человека, подкованного в бизнесе. Во втором сценарии уже стейкхолдеры бизнеса становятся ненужными, а дата- сайентист использует ИИ для выполнения технических задач и опирается на свои уникальные аналитические навыки и знания о бизнесе. Какой сценарий развития событий наиболее вероятен, если таковой во- обще существует? Я думаю, что это зависит от того, какой навык приобрести дороже: умение работать с данными (и научно подходить к бизнес-вопросам) или умение разбираться в бизнесе. Исходя из моего опыта и наблюдений за предыдущее десятилетие, когда принятию решения на основе данных уде- лялось много внимания, нетехнические бизнесмены не особенно старались освоить эти навыки. Но и дата-сайентисты не слишком стали разбираться в бизнесе. Возможно, перемены произойдут, когда на карту будет поставле- но выживание. Практический пример: А/В-теаирование Я объясню некоторые из этих прогнозов и предположений на примере А/В-те- стирования. По сути, для проведения А/В-тестирования необходимо обладать двумя типами навыков. Деловые Формулировка и ранжирование бэклога гипотез для тестирования, а также метрик результата для оценки эксперимента. 149 Честно говоря, из-за быстрого темпа развития действительно трудно предсказать, когда произойдут эти изменения.
Технические Разработка эксперимента; рандомизация и обеспечение того, чтобы предпо- ложения для выявления причинно-следственных связей с большой вероят- ностью были выполнены; а также измерение воздействия. Я предполагаю, что в большинстве компаний в настоящее время обязанности в этой области почти полностью разделены между дата-сайентистами и стейк- холдерами бизнеса. Если не рассматривать 1 % случаев, когда требуются узкоспе- циализированные, передовые знания в области проектирования и оценки экс- периментов, я предполагаю, что большая часть технических деталей может быть в значительной степени автоматизирована с помощью современных технологий (1.ЕМ может просто выполнять роль помощника). На мой взгляд, по-настояще- му сложная часть (не передового) А/В-тестирования — это поиск хороших ме- трик и гипотез для тестирования. Люди, используя инструменты ИИ, должны быть в состоянии обработать большинство тестов, запускаемых в компаниях. Благодаря обширному масси- ву обучающих данных для 1ЬМ, я также вижу, как люди применяют ИИ при со- здании гипотез. Однако я считаю, что роль ИИ без глубоких знаний о том, как устроен мир и бизнес, а также о лежащих в их основе причинно-следственных механизмах, не является здесь критически важной. Безусловно, я не вижу, чтобы ИИ полностью самостоятельно управлял техни ческой стороной. Этим процессом будет руководить знающий человек. Вопрос в том, кто это будет и как будет называться его роль. Практический пример: очистка данных Дата-сайентисты трагят немало времени на очистку и преобразование данных, чтобы сделать их пригодными для более ценных задач. И снова я предположу, что самая простая часть очистки данных — это сам процесс, когда мы исполь- зуем $С)Ь или любой другой язык программирования, такой как РуДюп или В., как эго обычно делается сегодня. Самая сложная часть — принимать решения, которые зависят от важней- ших бизнес-ноу-хау. Типичный пример — следует ли преобразовывать нулевые значения в нули или не г. Ответ заключается в том, что в некоторых случаях это действительно имеет смысл, а в других — нет. И это зависит от условий ведения бизнеса. Другой пример — качество данных, когда вы понимаете, что все пра- вильно, потому что эго имеет смысл с точки зрения бизнеса. Может ли бизнес-стейкхолдер без технического образования заняться эти- ми решениями, имея в помощниках ИИ, который помогает в простых вопросах?
Я думаю, что да, но для этого может потребоваться некоторая переподготов- ка или как минимум какие-то хорошо документированные процессы Нетрудно представить, что в будущем эти внутренние учебные пособия можно будет ис- пользовать при обучении ИИ-агентов компании. Практический пример: машинное обучение А как насчет машинного обучения? В качестве отправной точки дата-сайен- тист решает, какую технологию следует использовать в конкретной ситуации. Я предполагаю, что при нынешнем уровне ЬЬМ искусственный интеллект может легко помочь технически неподкованным стейкхоледрам принять это решение (потому что в интернете много дискуссий о том, когда и что делать, и эти дан- ные используются для обучения современного семейства Ы.М). Иными словами, я не вижу, чтобы у людей было сравнительное преимущество при принятии та- кого решения. Если отбросить 1 % ситуаций, когда требуются узкоспециализи- рованные специалисты, все, что вам нужно, — это учебник, который дата-сайен- тисгы сегодня изучают на рабочем месте. Тем не менее крайне важно понимать, почему один инструмент лучше другого, и Ы.М все еще далеки от достижения такого уровня интеллекта. Лучшие дата-сайентисты сегодня специализируются на технических деталях каждого алгоритма прогнозирования и используют эти знания для точной на- стройки моделей, делая их более производительными. Например, очень легко обучить готовый классификатор на основе градиентного бусгинга, но сложнее определить, какие метапараметры следует оптимизировать, чтобы повысить эф фективность прогнозирования. Однако автоматизированные фреймворки МБ, которые могут выполнить эту задачу, уже существуют. Вот почему я больше не считаю, что это ключевой навык, который дает дата-сайентистам конкурент- ное преимущество перед ИИ. Более того, БЕМ может или будет использоваться для того, чтобы предложить альтернативный курс действий при необходимо сти (опять же, благодаря запоминанию/извлечению информации из обучающих данных). Итак, какие же задачи в МБ сложны, и в их решении люди имеют явное кон- курентное преимущество перед Ы М? Я полагаю, что это выдвижение гипотез о лежащих в основе причинно-следственных механизмах, объясняющих, поче- му набор признаков предсказывает тот или иной результат. Здесь слово «наука» в описании профессиональной области имеет решающее значение и в будущем может дать дата-сайентистам некоторое преимущество перед бизнесменами, не имеющими технического образования
ШИ и эта книга В этой книге представлены методы, которые призваны помочь вам стать бо- лее продуктивным дата-сайентистом. Естественно, некоторые из этих методов в большей или меньшей степени могут выполняться с помощью ИИ, в зависи- мости от сочетания необходимых для этого базовых навыков. В таблице 17.2 я привожу свою субъективную оценку экспозиции для каждой главы, используя ту же методологию, что и раньше. Опять же, моя цель — выбрать лишь верное направление размышлений, и результаты кажутся мне разумными. Главы первой части в большей степени ориентированы на знания в области биз- неса и мягкие навыки, и менее — на навыки программирования и знания МЬ или статистики, поэтому оценка экспозиции здесь меньше. Во второй части я больше уделяю внимания МЬ и статистике, отсюда и более высокий уровень экспозиции. Таблица 17.2. [лавы книги отсортированы по экспозиции I Глава Основная тема Экспозиция 1. Что дальше Как оценить вклад вашей команды Низкая 7. Нарративы Как писать нарративы до и после создания проекта Низкая 6. Лиф’ы Методика позволяющая увидеть различия между группами Низкая 2. Разработка метрик Найдите лучшие метрики для принятия мер Низкая 3 Декомпозиция роста Понимать что происходит с бизнесом Низкая 4.2x2 дизайн Упрощение для понимания сложных проблем Низкая 5 Бизнес-кеисы Как измерить влияние конкретных проектов Низкая 8 Визуализация данных Извлекайте знания и презентуйте ключевые сообщения с по мощью визуализации данных Средняя 15, Инкрементальность Понимать основы причинно-следственной связи Средняя 16. А/В -тесты Разработка экспериментов Средняя 10 Линейная регрессия Укрепите свою интуицию в понимании того, как оаботают ал горитмы МБ Средняя 13. Сторителлинг Сторителлинг для создания признаков и интерпретации ре- зультатов Высокая 14. Прогнозы для приня- тия решений Принятие решения на основе машинною обучения Высокая 9. Моделирование и бут- страп Инструменты для более глубокого понимания алгоритмов М1 Высокая 11. Утечка данных Выявление и устранение утечки данных Высокая 12. Вывод моделей в про дакшн Минимальный фреймворк для вывода ь продакшн Высокая
О чем это говорит? Давайте представим, что задачи либо не подвергаются экспозиции, либо подвержены полной экспозиции', первое означает, что Ы.М здесь бесполезны, а второе — что ИИ могут выполнять задачи самостоятельно. Боль- шинство задач в разных профессиях находятся где-то посередине, но давайте пока оставим это в стороне. В этом мире крайностей вам следует инвестиро- вать в навыки для задач первого типа, поскольку они дадут вам преимущество перед ЬЬМ. Основная мысль здесь заключается в гом, что некоторые навыки, описанные в книге, стоят того, чтобы потратить на их развитие больше времени и усилий, учитывая текущие возможности ЬЬМ. Обратите внимание: я не говорю, что вам не следует прилагать усилия, чтобы стать отличным программистом или экспер- том в области М1. или статистики. Однако появление ЫМ сделало менее ценным для вас как дата-сайентиста как минимум навык программирования. Что каса ется МЬ и статистики, то пока еще слишком рано что-либо говорить. К моим прогнозам, конечно, следует отнестись с осторожностью, но я дей- ствительно считаю, что будущее науки о данных может пойти по пути, на кото- ром в краткосрочной перспективе производительность дата-сайентиста будет повышаться только за счет возможностей БЕМ генерировать высококачествен- ный код при участии компетентных людей Долгосрочная перспектива гораздо более неопределенна, и вполне вероятно, что работа с данными полностью из- менится или даже прекратит свое существование. Основные выводы Ниже представлены основные выводы из этой главы. С появлением Ы.М работа меняется Скорее всего, 2023 год запомнится как первый год, когда ИИ начал оказывать ощутимое влияние на рабочую силу и рынки труда. Прямо сейчас, когда мы говорим об этом, наука о данных подвергается влиянию Как и в случае с разработчиками ПО, ИИ оказывает непосредственное влия- ние на производительность программирования при работе с данными. Однако многие другие распространенные задачи дата-сайентистов также под вержены экспозиции для ИИ Я проанализировал 15 задач, перечисленных О’Не1, и обнаружил, что при- мерно для 40% из них уровень экспозиции высокий, а для 20% — средний.
Для задач, в которых больше задействовано программирование, экспозиция более высокая, но я предполагаю, что машинное обучение и статистика также будут затронуты в среднесрочной перспективе. Допускаю, что бизнес-знания и мягкие навыки имеют низкую экспозицию. Изменения в должностной инструкции дата-сайентиста Я предполагаю, чго в ближайшем будущем работа с данными изменится, и тогда меньше значения будет придаваться навыкам программирования и МБ, а больше — аналитическим навыкам, причинно-следственным связям и знанию бизнеса. Дополнительная литература Предлагаемые материалы по этой теме, скорее всего, очень быстро устареют, учитывая скорость развития этой области. Тем не менее вот несколько статей, которые помогли мне лучше понять состояние дел в этой области. В статье Тайны Элунду и др. «ОРТ — это (ЗРТ: первый взгляд на потенциал влияния больших языковых моделей на рынок труда» (СРТз аге СРТ$:Ап Еаг1у Ьоок а1 (Не ЬаЬог Магке11трас( Ро1епНа1 о/Ьаг$е Ьап$иа$е Мос1е!$) (март 2023 года, ар- хив агХгу150) представлены оценки влияния ИИ на различные профессии В этой книге я не пользуюсь методологией авторов по количественной оценке экспози ции для науки о данных, поэтому эту статью, безусловно, стоит прочитать, если вам интересно поразмышлять над альтернативными сценариями. Статья Себастьена Бубек и др. «Искры общего искусственного интеллек- та: ранние эксперименты с СРТ-4» (8рагкз о/АгН/йла! Сепега! 1п(еШ$епсе: Еаг1у Ехрептеп(з т(И СРТ-4) (апрель 2023 года, архив агХгу151) положила начало ин- тересной дискуссии о том, близки ли мы к достижению общего ИИ. Авторы ут- верждают, чго в будущем это семейство ББМ, скорее всего, будет обозначено как первичный общий ИИ !рго(о-АС1}. Обратите внимание, что многие ведущие ис- следователи, в первую очередь Ян Лекун152, считают, что модели авторегрессии не смогут эволюционировать в общий ИИ. Статья Али Борджи «Категориальный архив сбоев СИаЮРТ» (А Са1е$опса1 АгсИгуе о/ СИаЮРТ РаИигез) апрель 2023 года, архив агХгу153) постоянно обнов 150 Ьйрв:// агх1У.ог§/аЬь/2303.10130 151 ЬПр»://агх1У.ог§/аЬ8/2303.12712 152 11Нрь://х.сот/у1есип/Ма1и5/1622183529558806529?1ап§=еп 153 Ьггр8://агх1У.ог{уаЬ8/2302.03494
ляется и показывает, как при текущем состоянии ИИ все может пойти напере- косяк. В статье Грегуара Миалона и др. «Дополненные языковые модели: обзор» (Аи^- теп1ес1 Ьап^иа^е МоДеЬ: А Зигуеу) (февраль 2023 года, архив агХ1У]54) авторы пи- шут о том, что даже если ЬЬМ не достигли общего уровня интеллекта человека, есть способы улучшить их способность рассуждать или использовать внешние инструменты, что позволит им охватывать еще более широкий спектр задач. В следующих двух статьях обсуждаются новые возможности 1_1_М по мере роста их размера. Джейсон Вэй и др. "Новые возможности больших языковых моделей» (Етег$еп1 АЫИНез о/ Ьаг$е Еап$ш1%е Мос1е1з') (октябрь 2022 года, архив агХгу154 155). Райлан Шеффер и др «Являются ли новые возможности больших языковых моделей миражом?» (Аге Етег^еШ АЫННез о/Ьаг§е Еапуиа^е Мос1е1$ а дНга^е?) (май 2023 года, архив агХту156). 154 ЬКрз://агх1У.ог^/аЬ8/2302.07842 155 Ьйр5://агх1У.ог§/аЬ8/2206.07682 156 Ьпр8://агх1У.огу/рс102304.15004
Об авторе Дэниел Воган в настоящее время работ ает дата-сайентистом на фрилансе, прак- тикующим специалистом и стратегом в области машинного обучения и ИИ. Он автор книги Апа1уИса1 8кШ$ /о г А1 ат! Эа1а $с1епсе («Аналитические павы ки для искусственного интеллекта и науки о данных») (О’КеШу, 2020). Дэниел обладает более чем 15 летним опытом разработки моделей машинного обуче- ния и более чем 8-летним опытом руководства командами дага-сайентистов. Его профессиональные интересы — поиск способов создания ценности для компа- нии с помощью науки о данных и развитие молодых талантов. Он защитил до- кторскую диссертацию по экономике в Нью-Йоркском университете (201]). В свободное время он любит бегать, выгуливать своих собак по Мехико, читать и заниматься музыкой.
Колофон Животное на обложке книги Па1а Наепсе: ТИе Нап! Раг($ — это рыбка данио-рерио (Папю гепо). Данио-рерио — это пресноводная рыба семейства карповых родом из Южной Азии. Она получила свое название из-за пяти горизонтальных синих полос по бокам, которые тянутся до конца хвостового оперения. У самцов меж- ду синими есть золотые полоски, а у самок — серебряные. В дикой природе рыб- ки данио-рерио обычно достигают 4 см в длину и живут два-три года. Как пра- вило, они обитают на мелководье, в том числе в ручьях, прудах и рисовых полях. Рыбки данио-рерио — популярные аквариумные рыбки, потому что поми- мо их яркой окраски они просты в уходе и разведении. Мальки вылупляются из яиц через два-три дня, а через три-четыре месяца достигают зрелости. Они также популярны в научных исследованиях в качестве модельных организмов позвоночных, отчасти потому, что за развитием их прозрачных яиц и мальков легко наблюдать. Из-за их многочисленности в естественной среде обитания рыбки данио счи- таются видом, вызывающим наименьшее опасение. Многие животные, изобра- женные на обложках О’КеШу, находятся под угрозой исчезновения; все они важ ны для мира.
Алфавитный указатель ЗЦ-физика, система, см. также: Физика А/В-тестирование бэклог гипотез, 254 влияние Ы,М, 266 дополнительная литература, 257 компоненты, 240 критерии принятия решения, 241 управление, 255 А/В-тестирование, 226 АЬЕ (накопленные локальные эффекты), 198 Агиа, 232 Ла1а-тк гаНо, 100 ЕсопМЬ, 231 Е<1к (меню), см. Меню Ес1п ех роз!, сторителлинг, 187 важность признака, 192 интерпретируемость и эффективность, 188 линейная регрессия как ориентир, 189 накопленные локальные эффекты, 198 тепловые карты, 194 Ггее1оок, см. Свободный взгляд 6аптеОЬ(ес( (меню), см. Меню СатеОЬ)ес1 НРВ, см. Цвета с высоким динамическим диапазоном (НОВ.) 1РК, см. Рендеринг с низким динамическим диапазоном (Е1Ж) РВК (РЬуЦсаНу Вазеб Кепбегшд), см. Физически корректный рендеринг(РВР) Роз1-ргосезз1П§, пакет, см. Пакет постобработки з)п^1е1оп, см. Класс-одиночка 81егр, см. Сферическая линейная интерполяция 1Л, см. Пользовательский интерфейс автоматизированное машинное обучение, 216 автомат состояний, см. Машина состояний агретаты на групповом уровне, 144 агрегирование, 56, 68 безубыточность, 61 бизнес-кейс предотвращение мошенничества, 64 принципы создания, 61 приобретение внешних наборов данных, 65 приоритизация проектов, 66 проактивная стратегия удержания, 62 боксплот, 97 большие языковые модели влияние на рынок труда, 260 дополнительная литература, 270 текущее состояние, 260 эволюция должностных обязанностей дата-сайент иста, 264 машинное обучение, 267 очистка данных, 266 экспозиция задач дата- сайентиста, 268 бутстрэп, 125 бэклог гипотез, 254
важность признака после перестановки, 193 важность признака, ранжирование, 192 важность признаков, основанная на критерии неоднородности, 193 визуализация данных дополнительная литература, 104 разновидности каскадные диаграммы, 94 линейные графики, 92 распределение, 96 столбчатые диаграммы, 92 точечные диаграммы, 95 рекомендации интерактивные или нет, 102 пользовательские или по умолчанию, 101 размерности на графике, 100 размер шрифта, 101 соответствие идее, 98 цвет, 99 с1а1а 4пк гаНо, 100 ясность, 76, 103 влияние ИМ на рынок труда, 260 временная метка, маркировка (утечка данных), 151 временные интервалы (утечка данных), 152 выборка с обратным преобразованием, 108 выбор на основе наблюдаемых объектов, 225 выгодное соответствие (ргой!аЫе й1), 55 генерация псевдослучайных величин, 108 генерация случайных чисел, 108 гистограммы, 96 гонки, см. Автомобиль готовность к продакшну дополнительная литература, 177 модели в реальном времени, 169 пакетная оценка, 167 градиентный бустинг для регрессии (СВР), 115 график индивидуального условного ожидания ИСЕ), 196 графики оценки плотности ядра, КОЕ, 96 графики частичной зависимости, 114 график \«квантиль-квантиль\» (0-6) р1от), 110 данные наблюдений, 107 данные С1, см. Глобальное освещение, данные движение, см. также: Анимация двойное машинное обучение, 233 двумерная линейная модель, 132 декомпозиция метрик мультипликативная, 42 дисперсия в линейной регрессии, 142 доля истинно положительных результатов (1гие роьйгуе га(е, ТРЕ), 69, 125 дополнительная литература визуализация данных, 104 готовность к продакшну, 177 ИИ и ЬЬМ, 270 моделирование, 128 нарратив. 89 прирост (1гЙ), 73 сторителлинг, 89 А/В тестирование, 257 достоверность данных в нарративах, 78 достоверность с позиции бизнеса, 78 игнорируемое^, 225 импортеры, см. Скрипты импорта ин крементальность в машинном обучении двойное, 233 открытый исходный код, 231
допущение об отсутствии смешения, 225 мэтчинг, 227 мэтчинг по склонности к лечению, 228 определение, 214 рандомизация, 226 смещение выборки (зе1ес11оп Ыав), 221 интерактивные графики, 102 интерпретируемость модели, 187 и ее эффективность, 188 ориентир, линейная регрессия, 189 искусственный интеллект, см. ИИ текущее состояние, 260 эволюция должностных обязанностей, 264 очистка данных, 266 каннибализация, 216 кастомизация визуализации данных, 102 ковариация, 131, 142 контролируемое обучение, 215 контрфакты, 214 конфаундеры, 138 корреляция результатов, 57 коэффициент в линейной модели, 1 30 кредитная организация, пример (матрица 2x2), 57 критерии принятия решения (А/В- тестирование, 241 критерий обходного пути, 220 линейная регрессия в Л/В-тестировании, 245 дисперсия, 142 конфаундеры, 138 коэффициент, 130 моделирование, 111 ориентир, 189 теорема Фриша — Во — Ловелла, 134 линейная регрессия как ориет ир в работе, 189 линейные графики, 92 ложноотрицательный результат А/В-тестирование, 245 ложно! голожит ельный результа т А/В-тестирование, 245 маржинальный анализ, 67 маркетинговые кампании, пример использования (прирост), 72 матрица 2x2 одобрение кредита, 57 приоритеты в рабочем процессе, 58 тестирование модели и рычага, 53 матрица несоответствий, 207,210 машина, см. Автомобиль метаданные, утечка, 152 метод наименьших квадратов дисперсия, 142 конфаундеры, 138 коэффициент, 130 теорема Фриша — Во — Ловелла, 134 метод случайного леса (ВТК.), 115 метрики ь А/В-гестировании, 240 декомпозиция мультипликативная, 42 точность и полнота, 207 множественная регрессия, 131 моделирование генерация псевдослучайных величин, 108 г рафики частичной зависи мост и, 114 задач классификации, 121 линейная модель, 111 скрыт ых переменных, 121 сравнение моделей, 123 цель, 108 моделирование данных, 108 моделирование задач классификации, 121
модели скрытых переменных., 121 модель классификации (прирост), 69 модель/рычаг, тестирование (матрица 2x2), 53 Монте-Карло, моделирование, см. Моделирование мэтчинг, алгоритм, 227 мягкие навыки, 262 Накопленные локальные эффекты, АЬЕ, 198 направленные ациклические графы (ПАС), 217 нарратив, 74 дополнительная литература, 89 рекомендации для презент ации, 87 характеристики, 74 нарративы наука о данных как сторитсллинг, 79 настройки по умолчанию в визуализации данных, 101 наука о данных должностные обязанности эвлолюция, 264 создание ценности определение, 21 сгори гел лин г, 79 упрощения, 50 начальные числа (зееф), генерация псевдослучайных чисел, 110 неблагоприятный отбор, 57, 224 неправильная маркировка временной метки (утечка данных), 151 нулевая гипотеза в А/В тестировании, 242 обнаружение мошенничества, пример (линейная регрессия), 146 обнаружение утечки данных , 153 окно наблюдения, 159 окно прогнозирования, 158 онлайн-оцени ванне, 169 опросы, доля ответивших (прирост), 72 ортогонализация, 136,234 отдача от инвестиций (КО1), 203 открытый исходный код, 231 отношение сигнал/шум (з1^па1-1о-по1зе гаНо, 8ЫВ.), 112 отрицательная выборка, 223 отрицательный прирост, 68 очистка данных, практический пример, 266 пакетная оценка, 167 переменные, измеряемые до лечения, 224 плохие контрольные переменные, 150 подзапросы временных интервалов (утечка данных), 152 пожизненная ценность клиента, ЬТУ, 55 полнота, 207 положительная выборка, 223 положительный прирост, 68 пороговые значения оптимизация матрицы несоответсвий, 210 точность и полнота, 207 постобработка, см. Эффекты постобработки предельный эффект (таг^ша! еФесТ), 114,122 предотвращение мошенничества, 64 предположение о стабильной единиц и значениях лечения, 8ЦТУА, 227 презентация нарратива, 87 принятие решений неопределенность, 201 оптимизация матрицы несоответствий, 210 точность и полнота, 207 принятие решения А/В-тестирование, см. А/В- тестирование
приобретение внешних наборов данных, 65 приоритезация проектов бизнес кейс, 66 матрица 2x2, 58 прирост(ПА) варианты использования, 72 дополнительная литература, 73 модель классификации, 69 определение, 68 свободный выбор, 70 смещение по выживаемости, 70 причинно-следственный вывод, 214 двойное машинное обучение, 233 открытый исходный код, 231 проактивная стратегия удержания, 62 проверка данных (в конвейере готовности к продакшну), 175 модели и оценок, 175 прокси-конфаундеры, 220 простота в науке о данных, 50 процесс генерации данных, ВСР, 108 развертывание модели и оценок, 176 разделение выборки, 234 размерности на графике, 100 размер шрифта в визуализации данных, 101 рандомизация, 226 ранжирование гипотез, 255 по важности признака, 192 распределение, графики, 96 реальное время, модели, 169 рост, декомпозиция мультипликативная, 42 рычаги в А/В-тестировании, 240 рычаг/модель, тестирование (матрица 2x2), 53 свободный выбор, прирост, 70 сглаживание точечной диаграммы, 95 сигнал в А/В-тестировании, 241 смещение выборки, 221 смещение по выживаемости, прирост, 70 сравнение различных алгоритмов, 123 статистическая значимость и бизнес- значимость, 253 стационарные временные ряды, ] 39 столбчатые диаграммы, 92 сторителлинг в машинном обучении роль, 179 ехрозЦ 187 и наука о данных, 79 рекомендации для презентации, 87 дополнительная литература, 89 характеристики, 74 стратегия удержания клиентов, пример, 62 теорема о показателе склонности (Ргорепвйу 8соге '(Ьеотет), 229 теорема Фриша — Во — Ловелла, 134 тепловые карты, 194 техническая достоверность в нарративах, 78 точность, 207 управление А/В-тестированием, 255 условная взаимозаменяемость, 225, 226 условная независимость, 225 утечка данных выявление источника, 162 метаданные, 152 метод скользящего окна, 158 обнаружение, 153 ошибочные временные интервалы, 152 плохие контрольные переменные, 150
цвета в визуализации данных. 99 черные ящики, 189 чистая прибыль, 61 шум в А/В- тестировании, 241 экспериментальные данные, 107 этап обучения (модели), 158, 160 готовность модели к продакшну, 175 получение и преобразование данных, 172 проверка данных, 173 этап оценки готовность модели к продакшну, 175 получение и преобразование данных, 172 проверка данных, 173 этап §е!_с1аГа() (модель готова к продакшну), 172 этап 8соге_<1а1а(), 175 этап 1гаш_тобе1(), 175 этап 1гап81бгт_бага(), 172 эффективность модели и ее интерпретируемость, 188 эффект растворения, см. Растворение, эффект эффект <1иск1п§, см. Приглушение, эффект ясность в визуализации данных, 76,103 в нарративах, 75
Гарретт "ролемунд К ДЛЯ ОАТА5С1ЕМСЕ Импорт, упорядочивание, преобразование, ьизуализация и моделирование данных Это практическое руководство по освоению языка программирования Р для нау- ки о данных. Начинающие специалисты по Эаса 5с1епсе освоят наиболее важные инструменты Р и смогут эффективно работать с данными. Что вы узнаете: • как работать с данными с помощью Р и Р51ис1 го; • как импортировать, преобразовыва-ь и визуализировать данные: • как представлять результаты анализа: • как получать данные из электронных таблиц, баз данных и веб-сайтов. Основные направления: • визуализация данных (создание графиков для изучения данных и представле- ния результатов); • преобразование данных (типы переменных и инструменты для работы с ними); • импорт данных (получение данных в форме, удобной для анализа); • прог раммирование на Р. (инструменты для более эффективного и простого ре- шения задач); • взаимодействие (интеграция текста, кода и результатов с помощью Оиагсо) Упражнения в книге помогут закрепить полученные знания. Гарретт ГРОЛ ЕМУ НД — статистик, преподаватель и директор по обу- чению в РобД Асадету. Ач гор книги «НапОз-Оп Рго§гатт1П8 ллСН К» (О КеИ1у) и один из первых участни- ков Пдууегзе ОАЕШУ Р для 0а1:а 8оепсе О’РЕШУ’ Импорт, упорядочивание, преобразование, визуализация и моделирование данных Хэдли Уикхэм Мойн нетинкая-Рэндел Гаррет Гролемунд 05*00* 1гке(па1опа1 риЫ|$Ь>п8
Анна Дальстрем СТОРИТЕЛЛИНГ В ДИЗАЙНЕ Как создавать яркие истории Приемы кино и литературы в дизайне проекта Е ы узнаете,как; • анатомия истерии влияет на дизайн; • традиционные инструменты сторителлинга соотносятся с аспектами дизайна, • повествование привлекает внимание и побуждает к действию; • сторителлинг используется для продвижения и продаж. Реагирование на истории и умение рассказывать их — это часть того, что делает нас людьми. Почему стоит прочитать? • Поймете, как сторителлинг улучшает дизайн • Получите инструменты для создания увлекательных презентаций. • Используете силу историй для достижения бизнес целей. Анна ДАЛЬСТРЕМ — шведский ОХ дизайнер, живущая в Лондоне. Имеет степень магистра компьютер- ных наук и дело эго администриро- вания Копенгагенской школы бизнеса. Является основательницей школы иХ-дизайна ОХ Р!ка. .... I ..ч О’ЯЕ11_1.Г Сторителлинг § в дизайне Как создавать
Киран Дейл ВИЗУАЛИЗАЦИЯ ДАННЫХ С ПОМОЩЬЮ РУТНОМ И МУА5СК1РТ Анализ и преобразование данных Полный цикл: от сырых данных — к интерактивному представлению в браузере Эта книга — практическое руководство по созданию цепочки инструментов для веб визуализации данных Используя Ругбоп и 1 ауа5спр1, вы научитесь собирать, очищать, анализировать и превращать данные в динамичные визуализации, до- ступные в браузере, — локально или через интернет Эы узнаете, как: • Получить необходимые данные из открытых источников с помощью зеб АР1 РериезЕз, Зсгару, ВеаииЕи1 5оир • Очистить и обработать данные с использованием мощных библиотек Ру1Ноп в экосистеме ИитРу • Доставить информацию в браузер, задействуя Р1азк и КЕ5Т(:и1 АРI. • Приобрести стойкие навыки веб-разработки (НТМ1_, С58Д5), чтобы разместить диаграммы и графики н интернете. • Уверенно работать в ееб-среде, представляя информацию просто и наглядно. Киран ДЕЙЛ — специалист по визуа- лизации данных, разработчик и энту- зиаст в области машинного обучения. Работает над проектами, объединя- ющими современные технологии и обработку данных, сочетая инженер- ный подход с визуальной выразитело- ностью. Визуализация данных с помощью РуШоп и Ца7а8спр1:
Чарити Мейджорс, Лиз Фонг-Джонс и Джордж Миранда ОБЕСПЕЧЕНИЕ НАБЛЮДАЕМОСТИ ПО Как достичь безупречной работы системы Наблюдаемость — ключевой фактор в создании, изменении и понимании про- граммного обеспечения. Она помогав-1- быстрее и увереннее доставлять код, вы- являть аномалии и улучшать пользовательский опыт. Объясняем ценность наблю- даемости и показываем, как применять ее в разработке, даем рекомендации по переходу с устаревших инструментов. Что ьы узнаете. • Применение наблюдаемости в управлении ПО • Ценность в разработке сложных облачных систем Влияние на все этапы жизненного цикла ПО • Использование наблюдаемости разными командами Инструментирование кода для облегчения отладки • Написание качественно' о кода для отладки и обслуживания • Анализ данных для устранения проблем Чарити МЕЙДЖОРС — соучредитель и технический директор НопеусошЬ, соавтор книги «Базы данных. Ин- жиниринг надежности» (ЭаСаЬазе ге1|аЬ| 1лГу еп§теепп§). Ранее работала системным инженером и техническим руководителем в Рагзе, Ылаеп Баб и др компаниях Лиз ФОНГ-ДЖОНС — девелопер ад- вокат и 5КЕ-инженер с опытом рабо- ты более 17 лет. Сейчас она работает адвокатом 5РЕ и сообщества наблю даемости в НопеусстЬ Джордж МИРАНДА — о прошлом си- стемный инженер, а сейчас продукто- вый маркетолог и СТМ-руко?сдитель НопеусотЬ. До этого более 15 лет работал над созданием масштабно1х распределенных систем в финансо- вой и игровой индустрии. О*ЯЕ11_1У’ О’РЕИХУ' $ е о 3 Обеспечение наблюдаемости ПО Как достичь безупречной работы системы Чарити Мейджорс, Лиз Фонг-Джонс рцЬЬзЬшз и Джордж Миранда а I I
Дональд Фармер, Джим Хорбери ВСТРОЕННАЯ АНАЛИТИКА Как интегрировать анализ в бизнес-процессы Данные для роста эффективности и новых возможностей. В условиях растущего объема данных и усиливающейся конкуренции аналитика становится ключевым инструментом для повышения качества цифровых продук- тов Эта книга показывает, как выстроить системный подход к аналитике, сделать ее частью бизнес-логики и инструментом, который приносит реальную ценность Внутри: • принципы проектирования программ со встроенной аналитикой, • архитектурные и технические решения для реализации функций; практические кейсы с «разбором полетов»; • подходы к управлению и масштабированию аналитики. Дональд ФАРМЕР - международно признанный эксперт пс данным и ана- литике с более чем 30-летним опы- том. Руководил командами в М|сгоьо?Г и О1|к. Специализируется на стратеги- ях данных,инновациях и построении продуктов нового поколения. Джим ХОРБЕРИ — эксперт по ин- теграции аналитики в программные решения. Имеет богатый практиче- ский опыт в разработке приложений со встроенными аналитическими функциями и оптимизации пользова- тельского ч-пыта О'КЕШУ Встроенная аналитика Как интегрировать анализ в бизнсс-пооиессы ш(егпа1: оп=1 риЫ1$К|п§ Джим Хорбери
Яда Пруксачаткун, Мэтью Макатир, Субхабрата Маджумдар МАШИННОЕ ОБУЧЕНИЕ Как построить надежные модели ИИ В этом руководстве по созданию безопасных и надежных моделей машинно! с об- учения рассматриваются есе решения - от стандартных до самых современных. Издание станет незаменимой базой знаний для разработчиков, стремящихся вы- пускать качественные приложения в условиях непредсказуемой среды. Что внутри: • методы объяснения моделей машинного обучения и их результатов заинтересо- ванным сторонам; • выявление и устранение проблем с честностью и конфиденциальностью в ма- шинном обучении; • разработка надежных систем, защищенных от вредоносных атак; • важные системные аспекты, включая управление задолженностью по трастам и выявление препятствий для машин. Книга обобщает передовой опыт и помогает превратить сложные теории ь прак- тические инструменты для создания систем машинного обучения. Вы сможете по- строить м здель, которая будет отвечать актуальным требованиям не только циф- рового, но и реального мира Яда ПРУКСАЧАТКУН — специалист по машинному обучению в компании 1пйпИи5. Занималась прикладными исследованиями в Агпагоп, возглавляла пер’ ый М1_Р- проект в медицине в стартапе А8АРР Изучала методы трансферного обучения в КНР в ма- гистратуре Нью Йоркского университета. Мэтью МАКАТИР — специалист по машинному обу-ению в Роггп1с бабз. Основа"'ель компании 5сиЬе 1_аЬз, которая ведет более 1 <0 МЬ-проектов Занимался вероятностным программированием в команде ТепзогИол в Соо^е, сотрудничал с исследовательской компанией (Зепега11у IпбеШ^епк: по разработке универсального ИИ. Субхабрата МАДЖУМДАР — специа- лист по машинному обучению в ТУчоГсН, Создал базу знаний об ошибках систем ма - шинного обучения А1 Уц1пегаЫ1И:у ОасаЬазе, основал НКО В 1а$ Виссапеегз, которая зани- мается аудитом предвзятости алгоритмов Получил степень магистра статистики и кандидата наук в Университете Миннесоты к О’КЕШУ I Машинное | обучение Как построить надежные модели искусственного интеллекта Яда Пруксачаткун Мэтью Макотир рХ"п'а°8п11 Субхаората Маджумдар
Майкл Хаузенблас КАК ОСВОИТЬ СОВРЕМЕННЫЙ ЫМОХ Полный справочник: от нсзичка до профессионала Структурированный подход к использованию 1_тих а разработке и рабочих про цессах Книга будет полезна разработчикам, архитекторам программного обеспечения и 5РЕ-инженерам. Что вы узнаете: • как использовать 1_тих не только для администрирования, но и как современ- ную рабочую среду; о критически важных компонентах 1_тих: ядре, терминальном мультиплексоре, оболочках и сценариях командной оболочки; • о принципах контроля доступа и роли файловых систем; • об управлении зависимостями приложений и о контейнерах; • : работе с сетевым стеком и инструментами Ыпих, включая Г)\$, • о современных средствах мониторинга операционных систем; • о принципах межпроцессного взаимодействия и некоторых аспектах безопас- ности. Майкл ХАУЗЕНБЛАС — специалист по наблюдаемости и облачным техно логиям с опытом в сфере разработки данных, представитель С1оиб Ыабуе в СИСЕ. Работает в АУУ5, бо'вшей Реб НаГ, занимается стартапами и при- кладными исследованиями О‘Е?Е11_1_У ОНЕ1ИЛ" Как освоить современный Ыпих Полный справочник: от новичка до профессионала Майкл Хаузенблас
Джош Голдберг ИЗУЧАЕМ ТУРЕ5СШРТ Улучшайте навыки веб-разработки с современным ТуреЗспрЕ покорил мир ,1ауа5спр1. Согласно результатам опросов разрабогчикоа программного обеспечения, ТуреЗспрЬ стремительно набирает популярность во всем мире и широко используется программистами в разнО|х странах в качестве эффективного инструмента создания массивных веб-прилсжений Но что такое ТуреЗспрЕ? Как он работает и зачем вообще нужен? Как начать его исгользовать? Из этой книги бы узнаете: • в чем преимущества ТуреЗспрЬ и как устроена его система типов поверх «ва- нильного» аЗсп рг; • как задавато системе типов ТуреЗспрТ аннотации, используемые только на этапе разработки; • как ТуреЗспр!: анализирует и понимает код, чтобы помочь расширить уже ис- пользуемые вами паттерны разработки, • как эффективно использовать множестве параметров конфигурации ТуреЗспр1, чтобы настроить компилятор под нужды вашей команды и проекта, • как ТуреЗспрг помогает работать с массивами, классами, функциями, объектами и другими важными встроенными конструкциями 1ауаЗспр. Джош ГОЛДБЕРГ — мейнтейнео про ектов с открытым исходным кодом и консультант по разработке ПО, кото- рый участвует в развитии ТуреЗспрГ и связанных с ним инструментов (ТурезспрТ-еа[|пб и ТуреЗТаТ). Джош работал ведущим гЬрэнтенд-разра- богчиком в команде веб-платфор мы компании Ссс1есэс1ету, где стал инициатором внедрения ТуреЗспрТ и участвовал в создании обучающего курса Ьеагп ТуреЗспрг О'КЕИСТ О'ЯЕ11_1У Изучаем Туре$спр1 Улучшайте навыки веб разработки с современным зауаЗспрГ
Агылшын т1Л1нен аударма / Перевод с английского «Астана иностранная пресса О’НЕНЕУ. КНИГИ ПС ПРОГРАММИРОВАНИЮ Дэниел Воган ОАТА 5С1ЕМСЕ. ЛУЧШИЕ ПРАКТИКИ Бас. редактор / Главный редактор Ыскакбаи Рабига Басуг-а 28 04 2026 к,ол койылды / Подписано в печать 28.04.2026. Пгшщг 70*100 ’/16- К,агазы офсегпк Офсетпк басылыс / Формат 70т 100 Бумага офсетная Печать офсетная. Шартгы баспа табагы 23 33 Тараль-мы 1500 дана I апсырыс № 3426/ Усл печ л. 23,33. Тираж 1500 экз. Заказ № 3426 Тауар белг юг / Товарный знак- -Амапа 1п1ета1юпа1 РиЫ|вИ|пд~ Сапасы женгнде мына мекемеге хабарласыныз / С претензиями по качеству обращаться: «Астана иностранная пресса" ЖШС К,Р Алматы к-Аль-Фараби дане., 19/1, “Нурлы-1ау-БС ЗБблогы 12офис. ТОО -Астана иностранная пресса РК. г Алматы пр Али-Фараби. 19/1, БЦ, «Нурлы-Тау», блок ЗБ помещение 12. Телефон: +7(771) 276-41-09 Е-таП: 1П(о®а81апариЫ|51т1пд.кг Кетерме сауда беЛ1М1 / Отдел оптовых продаж Алматык. Атю-Фараби дащ., 19/1. “Нурлы-1 ау» БО ЗБ блоты, 12 офис. г Алма+ы, пр. АЛ|.-ФараОи 19/1 БЦ «Нурлы-Тау» блокЗЬ помещением Е-та|1:1п(о@амапариЫ1вИ(пд.кх Тауар барлык сапа жене каутс1зд|к стандарттарына саи / Товар соответствует всем стандартам качес"на и безопасности Сертификация карает ырылмаган / Сертификация не предусмотрена Сактау мер31м! шектелмеген / Срок годности не ограничен 0нд|рущ| ел: К,азакстан Страна-изготовитель: Казахстан Казакстан Республикасындагы дистрибьютор: «РДЦ-Алматы»ЖШС / Дистрибьютор в Республике Казахстан: ТСО «РДЦ-Алматы» Алматы к Домбровский кешес!, 3“а», литер Б. офис 1. Тел.: 8 (727) 251-59-90/91/92 г. Алматы, ул Домбровского, 3«а», литер Б, офис 1 Тел 8(727) 251 59-90/91/92 К,азастан Реопубликасьнда-’ы Дистрибьютор интернет-дукен! / Интернет ма1 азин дис*рибьк ггора в РК хл™.роок24 кт «ИПК» ААК, Ульяновск баспа уйы баспасында басылды 432980 Ульяновск облысь,, Ульяновск, Гончаров кешес! 14 Отпечатано в типографии АО “Первая Образцовая типография-, филиал «УЛЬЯНОВСКИЙ ДОМ ПЕЧАТИ». 432980 Россия г. Ульяновск ул. Гончарова 14 Г5ВН 978-601-12 7679 5 । пЬегпа Ьюпа1 ри оН зН । п§
О'ВЕИСГ □а!а Зс1епсе. Лучшие практики Уникальное практическое руководст во содержащее методы и передовые практики, не так часто встречающиеся в традиционном подходе к обучению науке о данных. Автор делится проверенными приемами и техниками, позволяющими создавать реальные проекты анализа данных, обладающие значимой ценностью Книга охватывает широкий спектр практических вопросов, включая разработку новых функций моделей машинного обучения и глубокую декомпозицию роста, чтобы найти основные причины изменений в метриках. Основные темы • Искусстт о построения сильных аргументов и презентаций работы. • Получение инструментов для успешной разработки аналитических проекте-: • Улучшение понимания принципов управления и организации процесс-, в сфере данных. • Создание эффективных бизнес-кейсов. Книга будет отличным помощником как для начинающих специалистов, стремящихся стат ь профессионалами высокого уровня, так и для опытных датэ-сайентистов желающих углубить свои знания и повысить эффективность работы. «Эга книга - не про- сто инструкция, это переводчик с языка цифр на язык бизнеса и жизни. Каждая стоа- ница учит мыслить иначе, видеть за цифрой реальный результат а не просто таблицу. Подходит для тех, кто создает и дорабатыва ет новые решения, кто строит будущее своими руками,Лаконично емко и без воды» Никита Злобин, операционный директор АТО Еогтуагс1|П2 Дэниел ВОГАН — доктор экономических наук, получивший степень в Нью- Йоркском университете в 2011 году, руководитель отдела данных в СНр. Более 15 лет разрабатывает модели машинного обучения и более 8 лет управляет командами по работе с данными. Страстно увлечен созданием реальной ценности с помощью Оага 5с1впсе и развитием молодых талантов. 18ВК 978-601 12 7679-5 1 п Еегпа (:, опа I риЫ|5к1т§