Неизведанная территория. Как «большие данные» помогают раскрывать тайны прошлого и предсказывать бу - Эйден Эрец, читать онлайн бесплатно (полностью) 5 стр.

Однако, как мы уже видели, мир слов далек от нормального – распределение в нем соответствует вполне определенному, но кажущемуся на первый взгляд странным математическому принципу. В наши дни ученые называют такое поведение степенными законами[54]. Удивительно, но как только Ципф обнаружил свой первый степенной закон в языке, то начал тут же находить и другие его проявления.

Например, Ципф обнаружил, что степенным законам следуют показатели богатства и доходов. Если бы ваш рост был пропорционален величине вашего банковского счета, а среднее американское домохозяйство имело рост около 170 см, то рост Билла Гейтса оказался бы больше, чем расстояние от Земли до Луны[55]. Величина статей в Encyclopedia Britannica также следует степенному закону, как и тираж газет. Ученые, следовавшие по стопам Ципфа, обнаружили тысячи других примеров: размер городов, частотность определенных фамилий, количество жертв в ходе военных действий, продолжительность аплодисментов после спектакля, популярность людей в Facebook и Twitter, объем пищи, потребляемой животными, трафик на веб-сайтах, доля белков в наших клетках, количество клеток различных типов в наших телах, распространенность тех или иных биологических видов в наших экосистемах и даже размер дырок в швейцарском сыре. Степенному закону следует даже продолжительность отключений электричества (хотя в данном случае, возможно, нам стоит назвать это «законом отсутствия энергии»).

Хотя работа Ципфа была настоящим прорывом, причины выявленного им закона остаются тайной. Сам Ципф верил, что такая закономерность объясняется практической эффективностью подобного распределения. Другие исследователи указывали на то, что большому объекту несложно стать еще больше. Этот процесс можно описать формулой «богатым проще богатеть». С математической точки зрения было показано, что процесс, описываемый словами «богатым проще богатеть», может проявляться в огромной массе степенных законов. Например, знакомство с одними людьми помогает знакомиться с новыми, поэтому изначально популярные люди, следуя выявленной Ципфом закономерности, становятся еще более популярными. Города, уже ставшие крупными, могут показаться привлекательными для тех, кто подумывает о переезде, что демонстрирует степенной закон размера города. Вот вам еще один пример – доказано, что обезьяны, печатающие на компьютере случайным образом, могут создавать «слова» (символы, разделенные пробелами) и количество этих слов также следует степенному закону[56].

Существует немало конкурирующих между собой объяснений любого конкретного распределения, следующего степенному закону. К сожалению, не исключено, что это изобилие объяснений отражает тот факт, что ученые не знают, что происходит на самом деле.

Тем не менее вне зависимости от причины возникновения степенные законы четко описывают огромный диапазон природных и социальных явлений. Ципф, преподаватель немецкого языка, воспользовавшись невероятной любовью Хенли к «Улиссу», начал революцию, последствия которой в значительной мере трансформировали измерения в социальных науках и щупальца которой дотянулись до биологии, физики и даже математики. Теперь нормально то, что выявил Ципф.

Не слишком ли много Ципфа

Закон Ципфа был всего лишь пробным камнем, необходимым нам для начала поиска языковых окаменелостей. Почти все в языке следует закону Ципфа – существительные, глаголы, прилагательные, наречия, начинающиеся на букву m, слова для описания профессий, слова, рифмующиеся со словом «рифма», и так далее. Так что если вы натыкаетесь на что-то, не соответствующее универсальному принципу Ципфа, можно смело считать, что что-то тут не то. Подобно куску белого камня, который находят в ходе экспедиции на особенно многообещающем месте, языковое явление, не следующее степенному закону, может оказаться настоящей окаменелостью в эволюции нашего языка.

Именно здесь нужно снова задать тот «детский» вопрос, который в свое время привлек наше внимание: «Почему мы говорим drove, а не drived?»

Drove – одно из английских слов, называемых неправильными глаголами[57]. Эти неправильные глаголы – очень странная вещь. Если бы они следовали закону Ципфа, как и все остальные классы слов, то можно было бы ожидать, что они редки. На практике же почти все неправильные глаголы встречаются довольно часто. Хотя к неправильным относится лишь около 3% глаголов, на практике именно они используются чаще других. Проще говоря, неправильные глаголы представляют собой явное и серьезное отклонение от закона Ципфа. Именно их мы и искали, как будто рядом со скелетом тираннозавра кто-то поставил статистические указатели.

Что же представляют собой эти так называемые неправильные глаголы, что они сделали с законом Ципфа и что это значит с точки зрения эволюции языка?

Избранные, гордые и сильные

На первый взгляд, в спряжении английских глаголов нет ничего сложного. Все, что требуется вам для образования прошедшего времени английского глагола, – это добавить к нему – ed: глагол jump («прыгать») превращается в jumped («прыгал»). Этому простому правилу следуют сотни тысяч глаголов. И даже если в языке появляется новый глагол, он будет спрягаться так же. Может быть, я никогда не слышал о действии, называемом flamboozing («алкоголеподжигание»), но я знаю, что если вы решили flambooze («алкоголеподжигать») вчера, то вчера вы flamboozed («алкоголеподжигали»).

Исключением – к немалому огорчению людей, изучающих английский, – выступают неправильные глаголы типа know («знать»). Даже не прочитав это предложение, вы уже знали (knew), что мы не скажем knowed. К этим тремстам неправильным глаголам – которые лингвисты иногда называют «сильными», – относятся десять наиболее часто встречающихся глаголов в английском языке: be/was («быть, был»), have/had («иметь/имел»), do/did («делать/делал»), say/said («говорить/сказал»), go/went («идти/пошел»), get/got («получить/получил»), make/ made («делать/сделал»), know/knew («знать/знал»), see/saw («видеть/видел»), think/thought («думать/думал»). Они встречаются настолько часто, что глагол, который вы собираетесь употребить, с вероятностью 50% будет неправильным.

Откуда возникли неправильные глаголы? Это длинная история. Примерно от 6 до 15 тысяч лет назад активно использовался язык, известный современным ученым как праиндоевропейский. Из этого языка произошли многие современные языки, в том числе английский, французский, испанский, итальянский, немецкий, греческий, чешский, персидский, санскрит, урду, хинди и сотни других. В праиндоевропейском языке было явление, известное ученым как аблаут, при котором одно слово превращалось в другое, близкое, с помощью замены гласных по определенным правилам[58]. В современном английском языке аблаут можно заметить как раз среди неправильных глаголов.

Вот вам пример: сегодня я пою (sing), вчера я пел (sang), песня была спета (sung). Аналогичным образом: сегодня я звоню (ring), вчера я звонил (rang), телефон прозвонил (rung). И еще один: сегодня я застреваю (stick), вчера я застревал (stuck). Сегодня я копаю (dig), вчера я копал (dug). Отмирая, правила спряжения оставляют после себя окаменелости, которые мы называем неправильными глаголами.

Но если это так, то какой же грамматический астероид уничтожил эти древние правила, оставив нам лишь высохшие кости неправильных глаголов?

Этим астероидом был так называемый дентальный суффикс, имеющий в современном английском языке форму – ed[59]. Применение – ed для обозначения прошедшего времени началось еще в прагерманском языке, на котором говорили в Скандинавии в 500–250 гг. до н. э. Прагерманский был предком всех современных германских языков, включая английский, немецкий, голландский и множество других. Будучи наследником праиндоевропейского языка[60], прагерманский унаследовал у него старую схему для спряжения глаголов на основе аблаута. И чаще всего с ее применением не возникало никаких проблем. Однако время от времени в языке появлялись новые глаголы, и некоторые из них просто не укладывались в старую схему аблаута. Поэтому люди, говорившие на прагерманском, изобрели кое-что новое – теперь образовывать прошедшее время этих молодых, не склонных к конформизму глаголов можно было, добавляя к ним в конце – ed. В прагерманском языке правильные глаголы были скорее исключениями.

Но так было недолго. Использование дентального суффикса для обозначения прошедшего времени оказалось невероятно успешным изобретением, которое получило широкое распространение. Подобно любой другой революционной технологии, новое правило стало понемногу распространяться и применяться лишь в отношении отдельных забавно звучащих глаголов, с которыми не мог справиться аблаут. Однако раз начавшись, этот процесс уже не остановился. Простой и запоминающийся дентальный суффикс начал привлекать все больше приверженцев, поскольку все чаще изменения касались глаголов, прежде использовавших аблаут.

Таким образом, к моменту создания классического староанглийского текста «Беовульф» (примерно 1200 лет назад) более трех четвертей английских глаголов изменялись по новому правилу. После того как у старого аблаута иссякли силы, новое правило с суффиксом – ed стало его повсюду вытеснять. В течение следующей тысячи лет исчезло огромное количество неправильных форм глаголов. Тысячу лет назад я мог бы holp (от глагола help – «помогать») вам. А вот вчера моя помощь вам описывалась бы словом helped.

Сегодняшние лингвисты, глядя на этот процесс в исторической ретроспективе, объясняют его термином «выравнивание». Нужно отметить, что процесс продолжается и сейчас. Рассмотрим глагол thrive («процветать»). Около 80 лет назад заголовок в газете New York Times гласил: Gambling Halls Throve in Billy Busteed’s Day («Игровые залы процветали в день Билли Бастида»). А в 2009 году в разделе «Наука» той же газеты была опубликована статья под заголовком Some Mollusks Thrived After Mass Extinction («Некоторые моллюски процветают после массового уничтожения»). Форма глагола throve (в отличие от этих удачливых моллюсков) пала жертвой массового истребления аблаутов. И пути назад нет. Став правильными, глаголы почти никогда не превращаются в неправильные[61].

Подобно тремстам спартанцам в Фермопилах, английские неправильные глаголы – эти триста смелых – решительно устояли в безжалостной борьбе, начавшейся против них в 500 г. до н. э. Они вели бой каждый день, в каждом большом и малом городе, на каждой улице, где говорят по-английски. Они отрабатывали навыки выживания в течение 2500 лет. И поэтому они – это не просто исключения. Их можно считать оставшимися в живых счастливчиками.

И процесс, благодаря которому они выжили, мы как раз и намеревались изучить – процесс эволюции языка.

2005: Еще одна одиссея данных

Почему же некоторые неправильные глаголы умерли, а другим удалось выжить? Почему глаголу throve (от глагола thrive – «процветать») не удалось выжить, а глаголу drove (от глагола drive – «ехать») – удалось? [62]

У лингвистов уже есть несколько отличных идей относительно того, почему неправильные глаголы имеют столь высокую частотность. Они предположили, что чем меньше мы сталкиваемся с неправильным глаголом, тем сложнее его запомнить и тем проще забыть[63]. Вследствие чего редкие неправильные глаголы вроде throve исчезают быстрее, чем частые, вроде drove. Со временем неправильные глаголы с низкой частотой употребления полностью исчезали, а неправильные глаголы как группа становились более частыми.

Эта гипотеза показалась нам в высшей степени интересной, поскольку предполагала, что неправильные глаголы проходят через определенный процесс, аналогичный эволюции, путем естественного отбора[64]. Почему неправильные глаголы встречаются настолько часто, когда, в полном соответствии с законом Ципфа, во всех остальных лексических классах доминируют редкие слова? Потому что естественный отбор, в форме ненасытного правила – ed, обеспечивает простым неправильным глаголам эволюционное преимущество. Чем чаще глагол используется, тем выше его шансы на выживание.

Созданный Ципфом «компас» был на тот момент самым идеальным примером естественного отбора, действующего в человеческой культуре, с которым нам только доводилось сталкиваться. Компас Ципфа указал нам на увлекательную проблему: может ли сформироваться лингвистическое чутье при столь тщательном изучении материала? Это могло бы стать простой, но доходчивой иллюстрацией того, что человеческая культура способна развиваться путем естественного отбора. Теперь нам, как и Ципфу, требовалось лишь найти подтверждение.

Для помощи в поисках мы привлекли к работе двух невероятно талантливых старшекурсников Гарвардского колледжа, Джо Джексона и Тину Тан. В идеале мы надеялись, что Джо и Тина смогут прочитать все источники, когда-либо опубликованные на английском языке, и записать каждый пример неправильного глагола, с которым они сталкивались. Однако оба они сказали нам, что все же хотели бы поработать над своими дипломами (для нас как аспирантов это уже был пройденный и забытый этап). Для решения задачи нам пришлось импровизировать.

К счастью, Джо и Тина учли историю Ципфа, поэтому предложили альтернативный подход. Вместо того чтобы читать абсолютно все, почему бы не ограничиться учебниками по истории английской грамматики? Грамматические тексты, относящиеся, скажем, к средневековому английскому языку, наверняка касались бы вопроса неправильных глаголов и упоминали бы многие из них. Не исключено, что где-то можно было найти и список таких глаголов. Изучив в библиотеке каждый учебник, посвященный истории английского языка различных периодов, мы могли получить довольно точную картину того, какие глаголы считались неправильными и когда[65]. Учебники могли бы дать нам то же самое, что дало Ципфу проведенное Хенли исследование «Улисса».

Разумеется, сказать проще, чем сделать. Джо и Тина посвятили несколько месяцев кропотливой работе, читая учебники древнеанглийского языка (языка «Беовульфа», на котором говорили примерно в 800 г. н. э.) и средневекового английского (языка Чосера, на котором говорили начиная примерно с XII столетия). Они нашли 177 староанглийских неправильных глаголов, развитие каждого из которых они смогли проследить на протяжении тысячи и более лет. Получив такую картину, мы наконец увидели, как менялся язык.

В древнеанглийском языке все 177 глаголов изначально были неправильными. К началу Средневековья, через четыре столетия, выжило лишь 145 неправильных форм; остальные 32 были приведены в соответствие с новыми нормами. В современном английском языке неправильными остались лишь 98. Остальные 79 глаголов до сих пор присутствуют в языке, однако, подобно глаголу melt («таять»), они изменили форму. При этом был заметен довольно примечательный дисбаланс. Из 12 наиболее часто встречающихся глаголов в нашем списке ни один не стал правильным – им удалось на протяжении 12 столетий сопротивляться давлению со стороны правила – ed. Нарушение пропорций шло и с другой стороны. Из 12 наименее часто использовавшихся глаголов в списке 11 стали правильными, в том числе bide («пребывать») и wreak («причинять»). Единственным выжившим неправильным глаголом с низкой частотой оказался slink («красться») – глагол, который как раз четко описывает этот тихий процесс исчезновения[66].

Данные показали: на человеческую культуру влияло нечто похожее на естественный отбор, оставляя следы в мире глаголов. Частота употребления была серьезнейшим фактором выживания глаголов – именно она приводила к тому, что некоторые прежние формы глаголов умирали и мы начинали их оплакивать (mourn – mourned), а другие приспособились (fit – fit) выживать.

Выживание наиболее приспособленных

В биологии проще показать сам факт естественного отбора, чем измерить степень родства между определенными признаками и степенью эволюционной приспособленности (легко сказать, что на улице ветрено, но куда сложнее определить, насколько сильно дует ветер). Не имея возможности рассчитать степень приспосабливаемости, мы можем лишь предположить, какие изменения будут успешными с точки зрения эволюции, но мы совершенно не представляем себе, сколько времени потребуется, чтобы эти изменения произошли.

Неизведанная территория. Как «большие данные» помогают раскрывать тайны прошлого и предсказывать бу - Эйден Эрец 5 стр.

Меню