BIG DATA. Вся технология в одной книге - Вайгенд Андреас


Андреас Вайгенд

Big Data

Вся технология в одной книге

Andreas Weigend

Data for the People

© Andreas Weigend, 2017

This edition published by arrangement with Levine Greenberg Rostan Literary Agency and Synopsis Literary Agency

Серия «Top Business Awards»

© Богданов С., перевод на русский язык, 2018

© Оформление. ООО «Издательство «Эксмо», 2018

* * *

Посвящается п., ф. и с.

Пролог

Когда зафиксировано все

Информация как таковая становится самой значительной отраслью экономики, и базы данных знают о каждом конкретном человеке больше, чем известно ему самому. Чем больше информации о каждом из нас попадает в базы данных, тем в меньшей степени мы существуем[1].

Маршалл Маклюэн

В 1949 году мой отец, в ту пору двадцатитрехлетний молодой человек, получил место учителя в Восточной Германии. Приехав в город, где ему предстояло работать, папа решил, что ему очень повезло: прямо на вокзале он встретил человека, который тоже искал себе жилье и соседа по комнате. Они нашли себе квартиру, но буквально через пару дней сосед исчез. Папа был озадачен. Спустя несколько дней он был уже не на шутку обеспокоен.

Как-то утром, когда он готовил себе завтрак, в дверь постучали. Папа обрадовался – он решил, что сосед вернулся! Но, открыв дверь, увидел каких-то незнакомых людей. Они сообщили, что ему присуждена премия за успехи в деле народного образования. Премию будут вручать в торжественной обстановке, а их прислали, чтобы сопроводить его на церемонию. Папа не слишком поверил сказанному – уж больно угрюмо выглядели эти мужчины в одинаковых плащах. Но выбора у него не было. Когда его затолкали в ожидавшую на улице машину, он с ужасом обнаружил, что ее дверцы не открываются изнутри. Его арестовали советские власти.

Отца обвинили в шпионаже в пользу американцев. Основанием для обвинения послужило его знание английского языка. Ни семья, ни знакомые не знали, где он. Для них он исчез с лица земли. Его бросили в камеру-одиночку тюрьмы, где он протомился следующие шесть лет. Он так никогда и не узнал ни причины своего ареста, ни причины своего освобождения.

Доступ к личной информации человека – реальная угроза его безопасности, поскольку эти данные могут быть использованы ему во вред. В моих глазах этот риск выглядит особенно очевидным и пугающим, в частности, потому, что я знаю, как собирали и использовали личную информацию против моего отца.

Лет через десять после распада ГДР я попросил дать мне возможность ознакомиться с информацией, которую Министерство госбезопасности, Штази, собирало о моем отце до и после его тюремного заключения. Я был далеко не единственным – с момента падения Берлинской стены с просьбами предоставить доступ к досье Штази на себя или на своих близких обратились почти три миллиона человек[2]. К сожалению, в письме от комиссии по архивам Штази сообщалось, что все материалы, касающиеся моего отца, утрачены.

Но в конверте с письмом обнаружилось кое-что еще – фотокопия обложки досье Штази на меня самого. Я был поражен. Штази вела досье на меня? Я же был просто студентом-физиком. Тем не менее агенты госбезопасности начали собирать информацию обо мне еще в 1979 году, когда я был подростком, а датой последнего обновления значился 1987 год, когда я уже переехал в Штаты. От досье осталась только обложка, и я вряд ли когда-нибудь узнаю, что именно собрала на меня Штази, зачем это было нужно и как использовалось, если использовалось вообще.

Во времена Штази получение информации о «гражданине, представляющем оперативный интерес», было непростым делом. Сначала нужно было собрать данные – организовать слежку, фотографирование, перлюстрацию почты, опрос знакомых и прослушку в доме. Затем все полученные данные скрупулезно анализировались. Работы было столько, что к моменту краха ГДР один процент всех граждан, занятых в народном хозяйстве, являлись штатными сотрудниками госбезопасности. Но для сбора информации Штази требовались еще большие ресурсы[3]. По данным германского федерального правительства, негласными осведомителями властей являлись примерно 200 000 жителей ГДР[4].

Сегодня собирать данные стало намного проще. Вспомним лишь несколько из наиболее известных примеров. После многомесячных протестов и судебных разбирательств борцам за тайну личной жизни удалось одержать небольшую и неполную победу в деле об упрощенном порядке предоставления Агентству национальной безопасности (АНБ) информации о частных телефонных разговорах[5]. Тем не менее лишь очень немногие решили отказаться от услуг мобильной связи, хотя совершенно очевидно, что метаданные телефонных звонков могут быть доступны АНБ – и не только ему. Так, женщину – торгового агента из Калифорнии уволили с работы за то, что она удалила со своего смартфона приложение, позволявшее менеджеру отслеживать ее местонахождение как в рабочее, так и в нерабочее время[6]. Когда стало известно, что Facebook тщательно исследует распространение настроений пользователей, поднялся шум по поводу «манипулирования» чувствами[7]. Однако на популярности сети это практически не сказалось, и она продолжила эксперименты с данными пользователей без их предварительного согласия по той простой причине, что это крайне необходимо для дизайна платформы. А в 2015 году аффилированная с торговым гигантом Alibaba компания Ant Financial запустила в Китае пилотную версию сервиса Sesame Credit, рассчитывающего рейтинг кредитоспособности частного лица на основе анализа его покупок – как если бы выдачу кредитов американцам одобряли на основе истории их покупок в Amazon[8]. Этот рейтинг моментально стали использовать и в других сферах, в том числе в качестве опции профайла на самом популярном китайском сайте знакомств[9]. Признаков массового отказа от мобильных телефонов, электронных адресов, навигаторов, аккаунтов в социальных сетях, покупок в интернет-магазинах и прочих цифровых услуг не наблюдается. Ведь все эти технологии сильно упрощают жизнь.

Обложка досье Штази

Шок, испытанный при виде досье Штази на себя, мог бы превратить меня в фанатичного ревнителя тайны личной информации. Отнюдь. На самом деле записи Штази – пустяк по сравнению с тем количеством информации о себе, которую я добровольно предоставляю всем желающим изо дня в день.

С 2006 года я публикую на своем личном сайте план всех своих выступлений и лекций, а также всех авиаперелетов, вплоть до номера забронированного в салоне места[10]. Я делаю это, поскольку считаю, что реальная польза от предоставленной о себе информации выше, чем связанные с этим риски. Эта информация создает возможности для получения и оптимизации знаний. Главное – обеспечить, чтобы интересы тех, кто использует эту информацию, не противоречили нашим собственным.

Как можно этого достичь? Через понимание того, какая информация доступна (и наверняка будет доступна в будущем) и как эта информация анализируется и используется компаниями. При всем уважении к Маршаллу Маклюэну я считаю, что чем больше личной информации о нас накапливается в базах данных компаний, тем в большей степени мы существуем и тем больше узнаем о самих себе. Реальная проблема в том, чтобы сделать компании, собирающие личные данные, прозрачными для нас в той же степени, в какой мы прозрачны для них, и обеспечить себе право голоса в вопросах использования этих данных. В этой книге рассказывается о том, как достичь этих целей.

Введение

Революция социальных данных

Как можно заставить информацию приносить пользу людям?

Всякая революция начиналась с мысли одного человека; а когда та же мысль овладевала другими людьми, она становилась главенствующей для своего времени[11].

Ральф Уолдо Эмерсон

В 6.45 утра меня будит сигнал будильника в моем мобильном телефоне. Я бодро перемещаюсь вместе с телефоном на кухню, чтобы начать день с просмотра электронной почты и ленты уведомлений в Facebook. GPS-приемник реагирует на мои перемещения на несколько метров на север и на восток, которые записываются в память телефона. Я наливаю себе кофе и начинаю вести себя более активно. При этом акселерометр телефона отслеживает, насколько быстро я двигаюсь, а барометр фиксирует мой подъем вверх по лестнице. Поскольку на моем телефоне установлены приложения Google, все эти данные попадают в базы этой поисковой системы.

Позавтракав, я отправляюсь на работу в Стэнфордский университет. Энергосбытовая компания установила в моем доме «умный» счетчик, который фиксирует снижение потребления электричества по мере того, как я выключаю свет и отключаю зарядные устройства моих гаджетов. Когда я открываю двери гаража, счетчик отмечает расход электричества, характерный именно для этого события. Поэтому к моменту, когда я выезжаю на улицу, у моей энергосбытовой компании достаточно информации для того, чтобы понять, что я не дома. А когда сигнал телефона переходит к другой вышке сотовой радиосвязи, это понимает и мой мобильный оператор.

Камера, установленная на углу, сфотографирует номерной знак моего автомобиля в случае, если я проеду на красный. Но сегодня я веду себя паинькой, поэтому появления в почте квитанции со штрафом не предвидится. Тем не менее по пути мой номерной знак попадет под камеры наблюдения еще не раз. Некоторые из этих камер принадлежат районным властям, другие – частным компаниям, анализирующим данные для выявления закономерностей в перемещениях. Результаты их анализа – продукт, который покупают полицейские управления, девелоперы и прочие заинтересованные лица.

Приехав в Стэнфорд, я оплачиваю парковку с помощью приложения EasyPark в моем телефоне. Деньги автоматически списываются с моего счета, а факультет и банк теперь знают, что я приехал в университет ровно в 9.03 утра. Когда телефон перестает перемещаться вместе с машиной, Google решает, что это место парковки, и записывает координаты, на случай, если я вдруг забуду, где оставил машину. А еще пора свериться с приложением страховой компании Metromile, которое считывает данные о моей поездке с бортового компьютера автомобиля. Оно мгновенно сообщает, что расход бензина сегодня был ниже (один галлон на девятнадцать миль) и поездка обошлась мне в 2 доллара 5 центов.

После занятий я планирую повстречаться с одним новым знакомым из Сан-Франциско. Виртуально мы уже встречались, комментируя в Facebook пост одного общего приятеля, и у нас обнаружилась общность точек зрения на затронутую тему. Оказалось, что у нас больше тридцати общих знакомых в Facebook – более чем достаточная причина для личного знакомства.

Google Maps прогнозирует, что я окажусь на месте к 19.12, и, как обычно, этот прогноз оказывается точным плюс-минус пара минут. Оказывается, что квартира моего нового знакомого расположена прямо над магазинчиком, который торгует табачными изделиями и разнообразными принадлежностями для употребления марихуаны. GPS-приемнику моего телефона разница между магазином и квартирой, расположенной выше, непонятна, и с точки зрения Google и моего провайдера мой день увенчался посещением хэдшопа. Я понимаю это по рекламе, которую показывает мне Google, когда просматриваю прогноз погоды на завтра перед отходом ко сну.

Революция в использовании социальных данных идет полным ходом.

Дашь на дашь

Схожие социальные данные ежедневно создают более чем миллиард людей. Социальные данные – это информация о вас, например о ваших перемещениях, поведении и интересах, а также об отношениях, связывающих вас с другими людьми, местами, товарами и даже идеологиями[12]. Некоторые из этих данных предаются огласке сознательно и добровольно, например, когда вы авторизовались в Google Maps и вводите свой маршрут; другие – не столь осознанно, а в качестве неотъемлемой составляющей пользования интернетом и мобильными устройствами. Понятно, что в некоторых случаях предоставление информации является необходимым условием получения услуги: Google не сможет проложить лучший маршрут, если вы не сообщите системе, где находитесь и куда хотите попасть. В других случаях вы сами рады поделиться информацией – например, когда лайкаете пост знакомого в Facebook или даете одобрительный отзыв о работе коллеги в LinkedIn просто потому, что хотите оказать им поддержку.

Социальные данные могут отличаться исключительной точностью, например указывать ваше местонахождение с точностью до метра, но часто бывают отрывочными и недостаточно полными. Например, пока я не зарегистрируюсь в приложении, которое считывает показания моего «умного» электросчетчика (допустим, по дороге в аэропорт, чтобы убедиться, что я действительно выключил весь свет в доме), энергосбытовая компания знает, что меня нет дома, но не более того. Этот касающийся меня показатель с равным успехом может оказаться и полезным, и бесполезным. Так, во время моего визита к знакомому в Сан-Франциско широта и долгота моего местонахождения были отражены точно, а предположения о том, что я делал тем вечером, оказались совершенно неверными. При всем своем правдоподобии вывод Google оказался всего лишь поверхностной интерпретацией. Отрывочные данные обычно оказываются недостаточными, сопряженными с риском ошибки, а иногда и умышленно сфальсифицированными[13].

В целом же объем социальных данных (пассивных и активных, обязательных и произвольных, точных и приблизительных) растет в геометрической прогрессии: он удваивается каждые восемнадцать месяцев. Через пять лет объем социальных данных возрастет примерно десятикратно, или на порядок, а через десять лет он увеличится примерно в 100 раз. Другими словами, сейчас за один день фиксируется столько же данных, сколько в течение всего 2000 года. А при сохранении существующих темпов роста в 2020 году мы будем создавать такой же объем данных менее чем за час.

Очень важно понимать, что «социальные данные» – отнюдь не просто очередное модное наукообразное словосочетание применительно к социальным медиа. Многие платформы социальных сетей создавались в целях широкого охвата массовой аудитории. Социальные данные становятся все более демократичными и доступными: информацией о себе, своей компании, своих успехах и своей точке зрения можно добровольно делиться в Twitter или в Facebook. Но люди оставляют намного большее количество глубоких цифровых следов на куда более обширной территории. Ваши поиски в Google, ваши покупки в Amazon, ваши звонки по скайпу, каждомоментное местонахождение вашего телефона – все эти и многие другие источники позволяют создать уникальный портрет вашей личности.

Далее, социальные данные – это не только вы сами. Характер ваших коммуникаций с родными, знакомыми и коллегами представляет собой информацию о прочности ваших связей с ними. Вы пополняете картину социальных данных и в ходе разовых контактов с совершенно незнакомыми людьми – так происходит, например, когда вы вводите тэги в Инстаграме или оставляете отзыв на какой-то товар. Создавая аккаунт на сайте аренды жилья Airbnb, вы подтверждаете свою личность не только официальными паспортными данными, но и профайлом в Facebook. Фиксация социальных данных предусмотрена и в домах с «умными» кондиционерами, и в автомобилях с навигационными системами, а также на рабочих местах с программными средствами коллективного пользования. Эти данные начинают аккумулироваться в учебных аудиториях и кабинетах врачей. По мере того как мобильные телефоны обрастают все большим количеством датчиков и приложений, отслеживающих ваше поведение дома, в магазине и на работе, становится все менее возможным контролировать распространение информации не только о своем обычном образе жизни, но и о своих сокровенных желаниях. Специалисты по обработке и анализу данных превращаются в детективов и художников, способных создавать все более и более точные образы личности на основе оставленных цифровых следов.

Дальше