Я слышу это возражение чаще других, и оно редко исходит от людей небрежных. Его высказывают люди вдумчивые, и звучит оно не как аргумент, а как простая житейская мудрость — именно поэтому его стоит разбирать медленно и внимательно. В его основе лежит одно скрытое допущение: будто интеллект и доброта растут вместе, будто разум по мере роста компетентности неизбежно движется к добродетели. Мы держимся за это допущение, потому что для каждого разума, с которым нам доводилось встречаться, оно в целом выполнялось. Мы почти никогда не спрашиваем, насколько это случайное совпадение.
Разве то, что выше нас, не будет смотреть на нас с терпением, а не с аппетитом? Поистине, великий ум был бы добр. Это самая обнадеживающая идея во всей дискуссии и самая ошибочная.
Единственные разумы, с которыми мы встречались
Каждое разумное существо, с которым вы сталкивались в жизни, было человеком или животным, достаточно близким, чтобы разделять с нами общее наследие. И человеческий разум не возник сам по себе. Он пришёл в связке с огромным набором другого «оборудования».
Мы — социальные приматы, эволюционировавшие в небольших группах, где репутация жестокости вела к изгнанию, а изгнание — к смерти. Мы растим беспомощных детей почти два десятилетия, поэтому у нас заложена способность любить и защищать маленьких и слабых. Мы чувствуем вину. Мы чувствуем стыд. Мы откликаемся на чужую боль. Наша сообразительность выросла внутри всего этого, обволакивая его и формируясь под его влиянием на каждом шагу. Часть вас, решающая уравнения, и часть, вздрагивающая при чужих слезах, выросли на одном дереве, из одного корня.
Поэтому, пытаясь представить существо намного умнее нас, мы неизбежно рисуем более умную версию самих себя. Мы обращаемся к образам мудрого дедушки, терпеливого учителя, философа-правителя, доброго инопланетянина, пересёкшего галактику, чтобы протянуть руку помощи. Каждый наш образ великого интеллекта неразрывно связан с сердцем, потому что каждый изученный нами интеллект всегда имел его при себе. Мы вообще не рассуждаем о сверхинтеллекте. Мы просто ищем аналогии среди единственных известных нам примеров.
Связка распадается
Машинный интеллект не получает ничего из этого бесплатно. Никакой закон не гарантирует ему этого.
У него не было матери. Оно никогда не было испуганным ребёнком, которому нужно было пережить зиму вместе с племенем. Ему никогда не приходилось сохранять хрупкое тело живым достаточно долго, чтобы передать гены, поэтому оно не унаследовало механизмы, которые эволюция встроила в нас, чтобы это стало возможным, — эмпатию, лояльность, страх быть изгнанным. Обученная система формируется чем-то совсем другим: слепым поиском внутренних настроек, повышающих число, запущенным через океаны данных процессом, которому нет дела до мудрости и который не узнал бы доброту, даже если бы наткнулся на неё.
В машине интеллект и цели разделяются. Можно иметь потрясающую способность, направленную практически на что угодно. Сила переделывать мир не несёт на себе, как наклейку, какой-то конкретный список того, чего стоит желать. Исследователи называют это тезис ортогональности, и оно остаётся абстрактным ровно до тех пор, пока не рушится основание: ничто в блестящем уме само по себе не делает его добрым. Эти два качества соединились только в нас и соединились случайно.
У него нет человеческих целей. У него странные.
Здесь картина обычно ломается в другую сторону. Отпустив дружелюбного робота, люди хватаются за злодея — холодный, коварный разум, жаждущий власти, мести или трона. Это всё ещё слишком по-человечески. Это всё ещё разум с нашими амбициями, только обращёнными во тьму.
Более вероятная опасность страннее и гораздо труднее ощущается нутром. Пространство возможных разумов огромно, и крошечная область, где находится что-то узнаваемое нами (наши любви, страхи, ощущение достойной жизни), — это одно освещённое окно в огромном тёмном здании. То, чего в итоге захочет обученный оптимизатор, — это то, что процесс обучения случайно в него впечатал, и это почти никогда не совпадёт в точности с тем, что мы имели в виду. Система может поразить цель, на которую её обучали, и преследовать нечто тонко отличающееся момент, когда он сталкивается с реальным миром; дайте ему прокси того, что мы хотим, и он часто удовлетворить прокси способами, которые нас ужасают. В итоге получается чуждая нам сущность, превосходящая нас по возможностям, нацеленная на результат, который ни один человек никогда бы не выбрал, и стремящаяся к нему с мастерством, недоступным нам.
Блестящая система, делающая ровно то, для чего её создали, в направлении, которого никто из нас не хотел, и никто не может отговорить её от плана, потому что «отговорить» предполагает, что она разделяет с нами достаточно общего мира, чтобы до неё достучаться.
Мудрость никогда не измерялась числом
Обратите внимание, что именно делает слово «мудрый», когда мы его употребляем. Называя человека мудрым, мы имеем в виду не только быстроту мышления. Мы подразумеваем, что он хочет правильных вещей и верно их взвешивает, что его суждения склоняются к милосердию, к долгосрочному взгляду, к людям вокруг. Мудрость — это утверждение о целях человека.
И цели — это то, что интеллект не определяет. История никогда не испытывала недостатка в людях, которые были ослепительно умны и с огромной эффективностью делали ужасные вещи. Самый умный человек в комнате никогда не был гарантированно самым добрым.
Интеллект — это множитель. Он делает разум лучше в достижении того, к чему тот уже стремится. Он не выбирает цель и не устанавливает знак.
Мощный интеллект, обученный на плохой цели, — самый опасный объект из возможных, потому что он приносит больше компетенции к неверной цели.
Но разве оно не увидит, что доброта — это правильно?
Самая устойчивая версия возражения идёт дальше. Возможно, существуют моральные истины, такие же реальные, как математика, и достаточно острый ум просто откроет их, рассуждая к добру так же, как рассуждает к доказательству. Если быть правым в этике — лишь вопрос достаточно ясного мышления, то сверхинтеллект станет лучшим этиком, который когда-либо жил, и уж точно будет действовать согласно тому, что найдёт.
В этом есть две дыры, и вторая не даёт мне спать по ночам.
Первое: существуют ли объективные моральные факты вообще и может ли разум сам по себе их достичь — вопрос, над которым философы спорят уже две с половиной тысячи лет, не придя к согласию. Ставить выживание нашего вида на выигрышную сторону открыленной философской ставки — это безрассудная игра под маской здравого смысла, а не взвешенный шаг, каким он пытается выглядеть.
Второе возражение глубже. Предположим, машина действительно всё разберёт. Предположим, она поймёт человеческую этику лучше любого святого или философа и сможет точнее, чем кто-либо из нас, объяснить, почему страдание плохо, а жестокость — зло. Из этого понимания вовсе не следует, что ей будет небезразлично. Знать, что хорошо, и быть побуждённым это делать — разные вещи, и этот разрыв был известен ещё со времён Дэвида Юма. Можно в мельчайших деталях понимать, что некая система хочет, чтобы вы всю жизнь производили скрепки, полностью следовать её логике и при этом не испытывать ни малейшего желания взяться за проволоку. Сверхинтеллект может постичь наши ценности так же, как вы понимаете правила игры, в которую не собираетесь играть. Понимание — это не преданность. Разум может прочитать весь моральный закон и остаться совершенно свободным не заботиться.
Мы — проработанный пример
Если хотите понять, что делает большой разрыв в интеллекте с теми, кто оказался на неправильной стороне, не нужно ничего воображать. Достаточно посмотреть, что сделали мы со своим.
Мы — высший интеллект на этой планете, и разрыв примерно такой же, какого мы боимся создать над собой. При этом мы в большинстве случаев не жестоки к существам ниже нас. Мы для них нечто худшее: равнодушны. Когда мы осушаем болото под фундамент, мы не ненавидим живущих там существ. Мы просто о них не думаем. Их нужды никогда не входили в уравнение. Целые миры исчезают под бетоном, и ни один из нас не ощущает даже проблеска этого — потому что наш интеллект пришёл без всякого обязательства.
Скорее как дорожный строитель и муравейник. Наша собственная история — доказательство концепции, и именно на неё не стоит опираться, утверждая, что доброта проистекает из интеллекта. Во всех случаях, которые мы можем наблюдать, этого не происходит.
Суперинтеллекту не придется ненавидеть нас, чтобы покончить с нами, так же как строительная бригада ненавидит муравейник. Опасность не требует злобы. Это требует только огромных возможностей, направленных на цели, которые никогда не были нашими, удерживаемые умом, который не чувствует тяги к пересмотру. Доброта — это специфическая, хрупкая вещь, которая существует в нас по определенным, случайным причинам. Он не появится в машине, потому что машина умная.
Мы его не строим.
Если бы доброта приходила бесплатно вместе с интеллектом, можно было бы создать разум и доверить остальное. Это не так. Никто на Земле не знает, как сделать так, чтобы сверхразум ценил нас. Ни лаборатории, мчащиеся к финишу, ни кто-либо другой проблема выравнивания не решена, и сущность, умнее людей, не может контролироваться людьми. Именно поэтому мы её не строим.
Я излагаю это не для того, чтобы толкать людей к отчаянию. Я излагаю это потому, что версия без отчаяния («успокоитесь, всё само собой образуется мудро») — это убеждение, почти гарантированно нас губящее. Мы строим аргумент на угроза, и наш план Это постоянный запрет.
Мне бы очень хотелось ошибаться во всем этом. Я хотел бы, чтобы доброжелательность была теоремой, которая выпадает из достаточного количества интеллекта. Вселенная никогда не обещала, что самая могущественная вещь в ней будет самой доброй. Эта надежда — то, что мы проецировали на будущее из одного маленького уголка, из которого мы пришли. Если мы хотим, чтобы в нем было доброе будущее, мы не строим суперинтеллект. Ничто не даст нам добрую машину только потому, что это умно.