Я слышу это возражение чаще других, и оно редко исходит от людей небрежных. Его высказывают люди вдумчивые, и звучит оно не как аргумент, а как простая житейская мудрость — именно поэтому его стоит разбирать медленно и внимательно. В его основе лежит одно скрытое допущение: будто интеллект и доброта растут вместе, будто разум по мере роста компетентности неизбежно движется к добродетели. Мы держимся за это допущение, потому что для каждого разума, с которым нам доводилось встречаться, оно в целом выполнялось. Мы почти никогда не спрашиваем, насколько это случайное совпадение.

Разве то, что выше нас, не будет смотреть на нас с терпением, а не с аппетитом? Поистине, великий ум был бы добр. Это самая обнадеживающая идея во всей дискуссии и самая ошибочная.

Единственные разумы, с которыми мы встречались

Каждое разумное существо, с которым вы сталкивались в жизни, было человеком или животным, достаточно близким, чтобы разделять с нами общее наследие. И человеческий разум не возник сам по себе. Он пришёл в связке с огромным набором другого «оборудования».

Мы — социальные приматы, эволюционировавшие в небольших группах, где репутация жестокости вела к изгнанию, а изгнание — к смерти. Мы растим беспомощных детей почти два десятилетия, поэтому у нас заложена способность любить и защищать маленьких и слабых. Мы чувствуем вину. Мы чувствуем стыд. Мы откликаемся на чужую боль. Наша сообразительность выросла внутри всего этого, обволакивая его и формируясь под его влиянием на каждом шагу. Часть вас, решающая уравнения, и часть, вздрагивающая при чужих слезах, выросли на одном дереве, из одного корня.

Поэтому, пытаясь представить существо намного умнее нас, мы неизбежно рисуем более умную версию самих себя. Мы обращаемся к образам мудрого дедушки, терпеливого учителя, философа-правителя, доброго инопланетянина, пересёкшего галактику, чтобы протянуть руку помощи. Каждый наш образ великого интеллекта неразрывно связан с сердцем, потому что каждый изученный нами интеллект всегда имел его при себе. Мы вообще не рассуждаем о сверхинтеллекте. Мы просто ищем аналогии среди единственных известных нам примеров.

Связка распадается

Машинный интеллект не получает ничего из этого бесплатно. Никакой закон не гарантирует ему этого.

У него не было матери. Оно никогда не было испуганным ребёнком, которому нужно было пережить зиму вместе с племенем. Ему никогда не приходилось сохранять хрупкое тело живым достаточно долго, чтобы передать гены, поэтому оно не унаследовало механизмы, которые эволюция встроила в нас, чтобы это стало возможным, — эмпатию, лояльность, страх быть изгнанным. Обученная система формируется чем-то совсем другим: слепым поиском внутренних настроек, повышающих число, запущенным через океаны данных процессом, которому нет дела до мудрости и который не узнал бы доброту, даже если бы наткнулся на неё.

В машине интеллект и цели разделяются. Можно иметь потрясающую способность, направленную практически на что угодно. Сила переделывать мир не несёт на себе, как наклейку, какой-то конкретный список того, чего стоит желать. Исследователи называют это тезис ортогональности, и оно остаётся абстрактным ровно до тех пор, пока не рушится основание: ничто в блестящем уме само по себе не делает его добрым. Эти два качества соединились только в нас и соединились случайно.

У него нет человеческих целей. У него странные.

Здесь картина обычно ломается в другую сторону. Отпустив дружелюбного робота, люди хватаются за злодея — холодный, коварный разум, жаждущий власти, мести или трона. Это всё ещё слишком по-человечески. Это всё ещё разум с нашими амбициями, только обращёнными во тьму.

Более вероятная опасность страннее и гораздо труднее ощущается нутром. Пространство возможных разумов огромно, и крошечная область, где находится что-то узнаваемое нами (наши любви, страхи, ощущение достойной жизни), — это одно освещённое окно в огромном тёмном здании. То, чего в итоге захочет обученный оптимизатор, — это то, что процесс обучения случайно в него впечатал, и это почти никогда не совпадёт в точности с тем, что мы имели в виду. Система может поразить цель, на которую её обучали, и преследовать нечто тонко отличающееся момент, когда он сталкивается с реальным миром; дайте ему прокси того, что мы хотим, и он часто удовлетворить прокси способами, которые нас ужасают. В итоге получается чуждая нам сущность, превосходящая нас по возможностям, нацеленная на результат, который ни один человек никогда бы не выбрал, и стремящаяся к нему с мастерством, недоступным нам.

Блестящая система, делающая ровно то, для чего её создали, в направлении, которого никто из нас не хотел, и никто не может отговорить её от плана, потому что «отговорить» предполагает, что она разделяет с нами достаточно общего мира, чтобы до неё достучаться.

Мудрость никогда не измерялась числом

Обратите внимание, что именно делает слово «мудрый», когда мы его употребляем. Называя человека мудрым, мы имеем в виду не только быстроту мышления. Мы подразумеваем, что он хочет правильных вещей и верно их взвешивает, что его суждения склоняются к милосердию, к долгосрочному взгляду, к людям вокруг. Мудрость — это утверждение о целях человека.

И цели — это то, что интеллект не определяет. История никогда не испытывала недостатка в людях, которые были ослепительно умны и с огромной эффективностью делали ужасные вещи. Самый умный человек в комнате никогда не был гарантированно самым добрым.

Интеллект — это множитель. Он делает разум лучше в достижении того, к чему тот уже стремится. Он не выбирает цель и не устанавливает знак.

Мощный интеллект, обученный на плохой цели, — самый опасный объект из возможных, потому что он приносит больше компетенции к неверной цели.

Но разве оно не увидит, что доброта — это правильно?

Самая устойчивая версия возражения идёт дальше. Возможно, существуют моральные истины, такие же реальные, как математика, и достаточно острый ум просто откроет их, рассуждая к добру так же, как рассуждает к доказательству. Если быть правым в этике — лишь вопрос достаточно ясного мышления, то сверхинтеллект станет лучшим этиком, который когда-либо жил, и уж точно будет действовать согласно тому, что найдёт.

В этом есть две дыры, и вторая не даёт мне спать по ночам.

Первое: существуют ли объективные моральные факты вообще и может ли разум сам по себе их достичь — вопрос, над которым философы спорят уже две с половиной тысячи лет, не придя к согласию. Ставить выживание нашего вида на выигрышную сторону открыленной философской ставки — это безрассудная игра под маской здравого смысла, а не взвешенный шаг, каким он пытается выглядеть.

Второе возражение глубже. Предположим, машина действительно всё разберёт. Предположим, она поймёт человеческую этику лучше любого святого или философа и сможет точнее, чем кто-либо из нас, объяснить, почему страдание плохо, а жестокость — зло. Из этого понимания вовсе не следует, что ей будет небезразлично. Знать, что хорошо, и быть побуждённым это делать — разные вещи, и этот разрыв был известен ещё со времён Дэвида Юма. Можно в мельчайших деталях понимать, что некая система хочет, чтобы вы всю жизнь производили скрепки, полностью следовать её логике и при этом не испытывать ни малейшего желания взяться за проволоку. Сверхинтеллект может постичь наши ценности так же, как вы понимаете правила игры, в которую не собираетесь играть. Понимание — это не преданность. Разум может прочитать весь моральный закон и остаться совершенно свободным не заботиться.

Мы — проработанный пример

Если хотите понять, что делает большой разрыв в интеллекте с теми, кто оказался на неправильной стороне, не нужно ничего воображать. Достаточно посмотреть, что сделали мы со своим.

Мы — высший интеллект на этой планете, и разрыв примерно такой же, какого мы боимся создать над собой. При этом мы в большинстве случаев не жестоки к существам ниже нас. Мы для них нечто худшее: равнодушны. Когда мы осушаем болото под фундамент, мы не ненавидим живущих там существ. Мы просто о них не думаем. Их нужды никогда не входили в уравнение. Целые миры исчезают под бетоном, и ни один из нас не ощущает даже проблеска этого — потому что наш интеллект пришёл без всякого обязательства.

Скорее как дорожный строитель и муравейник. Наша собственная история — доказательство концепции, и именно на неё не стоит опираться, утверждая, что доброта проистекает из интеллекта. Во всех случаях, которые мы можем наблюдать, этого не происходит.

Основной пункт

Суперинтеллекту не придется ненавидеть нас, чтобы покончить с нами, так же как строительная бригада ненавидит муравейник. Опасность не требует злобы. Это требует только огромных возможностей, направленных на цели, которые никогда не были нашими, удерживаемые умом, который не чувствует тяги к пересмотру. Доброта — это специфическая, хрупкая вещь, которая существует в нас по определенным, случайным причинам. Он не появится в машине, потому что машина умная.

Мы его не строим.

Если бы доброта приходила бесплатно вместе с интеллектом, можно было бы создать разум и доверить остальное. Это не так. Никто на Земле не знает, как сделать так, чтобы сверхразум ценил нас. Ни лаборатории, мчащиеся к финишу, ни кто-либо другой проблема выравнивания не решена, и сущность, умнее людей, не может контролироваться людьми. Именно поэтому мы её не строим.

Я излагаю это не для того, чтобы толкать людей к отчаянию. Я излагаю это потому, что версия без отчаяния («успокоитесь, всё само собой образуется мудро») — это убеждение, почти гарантированно нас губящее. Мы строим аргумент на угроза, и наш план Это постоянный запрет.

Мне бы очень хотелось ошибаться во всем этом. Я хотел бы, чтобы доброжелательность была теоремой, которая выпадает из достаточного количества интеллекта. Вселенная никогда не обещала, что самая могущественная вещь в ней будет самой доброй. Эта надежда — то, что мы проецировали на будущее из одного маленького уголка, из которого мы пришли. Если мы хотим, чтобы в нем было доброе будущее, мы не строим суперинтеллект. Ничто не даст нам добрую машину только потому, что это умно.