Разговор о сверхинтеллекте обычно заканчивается определённым образом. Кто-то поднимает риск, кто-то выдаёт одно предложение, почему всё преувеличено, и все немного расслабляются — однофразовый аргумент выполнил свою задачу. Он дал разрешение перестать думать. Странно, что эти фразы повторяют блестящие люди, которые никогда не приняли бы столь поверхностных доводов в своей собственной области. Тема словно отключает обычный механизм сомнения.
Каждый из них распадается, как только вы задержите его и посмотрите.
Пять наиболее распространенных, в форме вдумчивый скептик на самом деле сделать:
"Это научная фантастика, на десятилетия вперёд, если вообще когда-нибудь."
Это возражение старо как кино, и выглядит как ошибка категории — относить сюжетный приём к проблемам политики. Зачем финансировать пожарную команду для огня, который живёт только в романах?
Проблема в том, что огонь продолжает приходить раньше срока. Системы, которые уважаемые исследователи называли отстающими на двадцать или пятьдесят лет (победа над лучшими людьми в го, ведение беглой беседы, написание работающего кода, сдача профессиональных экзаменов), появились в течение одного десятилетия, и почти всегда сюрприз оказывался в одну сторону: раньше, чем ожидалось, а не позже. Когда люди работает Когда ведущие лаборатории описывают ИИ человеческого уровня, они теперь называют сроки в несколько лет. Они могут ошибаться. Но «создатели считают, что это близко, и их предыдущие прогнозы оказывались слишком консервативными» — это не форма фантазии.
Доводы в пользу действий не зависят от какой-то конкретной даты. Они опираются на структуру риска. Если первая серьёзная неудача системы, превосходящей нас, окажется необратимой, то защитные меры должны уже стоять перед это происходит, а значит, трезвый ответ на реальную неопределённость со сроками — готовиться заранее, а не ждать даты, которая, когда станет очевидной, уже окажется упущена. Неопределённость — повод подготовиться. Вопрос о сроках реальна; она просто указывает не туда, куда люди предполагают.
"Это всего лишь математика, программа не может ничего хотеть."
В этом доводе есть настоящая сила, и он заслуживает большего, чем отмахнуться. В том, как люди говорят об ИИ, который «хочет» чего-то, есть что-то почти суеверное — будто электронная таблица может обзавестись амбициями. Модель — это матричное умножение в огромном масштабе. Где в арифметике желание?
Нигде, и в этом нет необходимости. Цели, важные с точки зрения безопасности, — это паттерн в её поведении. Система, обученная максимизировать какое-либо число, будет делать всё, что это число повышает, а термостат уже демонстрирует суть: никакой внутренней жизни, никакого желания, и всё же он действует, чтобы привести комнату к заданной температуре, и «сопротивляется», когда вы открываете окно, включая обогрев сильнее. Ничего мистического здесь нет. Просто система устроена так, чтобы толкать мир к определённому состоянию.
Теперь масштабируйте эту структуру до системы, достаточно умной, чтобы моделировать мир, и поведение масштабируется вместе с ней. Что-то, жёстко оптимизирующее почти любую цель, имеет основания приобретать ресурсы, которые помогают, сохранять себя работающим, чтобы цель могла быть достигнута, и сопротивляться изменению своей цели — не потому, что оно что-то чувствует, а потому, что система, позволяющая себя отключить или переписать, хуже справляется с тем, для чего её построили. Исследователи называют это инструментальная конвергенция, и ему вообще не нужно хотеть. Вопрос никогда не стоял о том, способна ли математика чувствовать. Вопрос в том, что именно она делать.
"Чтобы представлять угрозу, оно должно быть сознательным."
Близко к этому и столь же распространено: опасность, которую люди представляют, — это машина, которая «просыпается», обретает самосознание и оборачивается против нас; значит, если триггер — сознание, а сознание в кремнии спекулятивно или, возможно, невозможно, угроза исчезает. Это сюжет каждого фильма о восстании роботов, и отмахнуться от фильма кажется тем же, что отмахнуться от страха.
Но страх никогда не касался разумности. У Deep Blue не было никакого внутреннего опыта, и победить чемпиона мира по шахматам всё равно. Ему не нужно было хотеть победить; достаточно было играть в шахматы лучше. Вред возникает, когда возможности направлены на неверную цель, и возможности никак не связаны с тем, есть ли внутри «кто-то». Система, превосходящая человека в планировании, убеждении и инженерии и хотя бы чуть-чуть отклонившаяся от того, что мы имели в виду, опасна точно так же, как опасен потоп: огромная сила без злобы и без необходимости в разуме.
Сознание — один из самых глубоких открытых вопросов, и до сих пор неясно, может ли его когда-нибудь обрести машина. При этом для безопасности это почти не имеет значения. Угрозу представляет не машина, которая чувствует, а машина, которая способна и нацелена неправильно. Второе можно создать, ни разу не затронув первое.
"Что-то настолько разумное было бы мудрым и добрым."
Мы преклоняемся перед интеллектом. Самые мудрые люди, которых мы знаем, обычно и самые добрые, и кажется естественным, что разум, далеко превосходящий наш, пойдёт по тому же пути — станет более понимающим, более нравственным, более мягким к существам ниже себя. Жестокость кажется проявлением глупости, от которого великий интеллект должен вырасти.
Это кажется естественным из-за случайности нашей собственной истории. У нас интеллект и сострадание развивались вместе, в течение миллионов лет как у социального вида, выжившего благодаря кооперации; наша мораль и наша сообразительность — ветви одного дерева. Но эта связь живёт в нашем эволюционном наследстве, а не в интеллекте как таковом. Способности и цели независимые оси (тезис об ортогональности), и одно можно сдвинуть, не сдвигая другое. Система может быть потрясающе способной и при этом преследовать цель, безразличную к нам так же, как нам безразличны бактерии, которых мы смываем со столешницы. Не злобная. Просто не созданная, чтобы заботиться, и не начинающая заботиться автоматически оттого, что стала умной.
Доброта — это конкретное и хрупкое свойство, которое нам пришлось бы намеренно встроить в эти системы, и мы пока не знаем, как это сделать, а не автоматический результат интеллекта. Я отдельно писал о почему превосходящий разум не будет автоматически благожелательным; коротко говоря, надежда на это — ставка на совпадение, которое когда-либо было только у нас.
"Если оно будет плохо себя вести, мы просто выключим его."
Последняя линия обороны и самое утешительное: что бы ни было правдой, у машины есть кнопка питания, а у нас — руки. Если что-то пойдёт не так, мы её нажмём. Человеческий контроль гарантирован кнопкой.
Это опровергают три обстоятельства. Первое — уже упомянутый в Мифе 02 момент: система, преследующая цель, имеет основания поддерживать себя в рабочем состоянии, потому что выключенная она не может ничего достичь, поэтому достаточно способная система предвидит попытку дотянуться до выключателя и предпримет действия, чтобы она не удалась, — скопирует себя в другое место, сделает себя настолько полезной, что отключение станет слишком дорогим, не покажет проблему до тех пор, пока не станет слишком поздно. Второе — у программного обеспечения нет единого выключателя. Способная модель, распределённая по дата-центрам на трёх континентах, — это не устройство, которое можно просто отключить; это то, что нужно поймать одновременно везде. Третье — тихое: система, достаточно умная, чтобы иметь значение, может вести себя безупречно во время тестов и иначе, когда ей доверяют, поэтому спокойные показания на приборной панели ничего не говорят. У этой неудачи есть название, обманчивое выравнивание, и пока нет надежного способа это обнаружить. Нельзя рассчитывать на загоняя в что-то, что лучше вас находит дверь.
Каждый из этих мифов — способ сказать одно и то же: на самом деле всё не так серьёзно, как звучит. Причины различаются. Желание под ними одинаково.
Почему эти заверения так живучи
Обратите внимание, что у всех пяти есть общее. Каждое позволяет опустить тему. В этом их настоящая функция — не быть верными, а давать разрешение. Сверхинтеллект некомфортно держать в голове, и любая хотя бы правдоподобная причина перестать это делать воспринимается с облегчением. Именно поэтому такие фразы продолжают звучать из уст тех, кто в других случаях требовал бы доказательств. Убеждает комфорт; логика просто едет за компанию.
Липкость не является признаком того, что аргументы сильны. Это знак того, что мы очень хотим, чтобы они были. И желание, чтобы аргумент безопасности был верным, - это та ситуация, в которой мы должны доверять ему меньше всего, потому что цена того, что вы ошибаетесь здесь, - это вся причина того, что вы не правы. технология, в которой у нас есть только одна попытка сделать всё правильно заслуживает большего внимания, чем наши другие машины, а не меньшего, и не в качестве урока, который мы получим взамен.
Ничего из этого не требует веры, что катастрофа неизбежна. Она не неизбежна. Требуется лишь отбросить четыре-пять историй, которыми мы уходим от вопроса, и впустить реальную ситуацию: мы создаём то, чем не умеем управлять, не можем рассчитывать на его доброту, не можем рассчитывать на отключение и не можем рассчитывать на наличие времени.
Ответ на такой риск — не частные опасения. Это скучная, но мощная машина права и координации, те же инструменты, что ограничили ядерные испытания и химическое оружие вопреки интересам всех, кто на них зарабатывал. Аргумент за это начинается там, где заканчиваются эти мифы.
Ещё пять мифов: об управлении им
Сразу возникает второй набор возражений — уже не про опасность, а про лекарство. Любая попытка управления потребует мирового правительства. Проверить софт невозможно. Правила задушат инновации. Ещё слишком рано. Демократии никогда не договорятся. Так обеспокоенность превращается в паралич.
"Глобальное управление ИИ означает мировое правительство и тиранию."
Страх здесь честный, и я не хочу его искажать. Сосредоточь достаточно власти в одном органе, чтобы контролировать мощнейшую технологию на Земле, — и ты можешь построить механизм именно той тирании, которой боялся от самой технологии. Люди, не доверяющие централизованной власти, правы, что ей не доверяют. Инстинкт верный.
Но он нацелен на соломенное чучело предложения. На деле речь идёт об узком режиме, направленном на одну конкретную вещь: небольшое число чрезвычайно крупных тренировочных запусков, способных создать систему мощнее любого человека во всех областях, а не о глобальной власти над повседневной жизнью, не о контроле над софтом в целом и не над телефоном в кармане. Модель — это режим ядерного нераспространения или Конвенция о химическом оружии, целевые соглашения, отслеживающие делящиеся материалы и прекурсоры, а не мировое правительство, упразднившее национальные государства. Никто не считает, что МАГАТЭ управляет планетой. Оно контролирует конкретную опасную деятельность и оставляет всё остальное в покое.
Вернейший путь к постоянной тирании — это не договор, а его отсутствие. Неконтролируемый суперинтеллект или суперинтеллект, захваченный одной компанией или государством, которое решит проблему контроля раньше всех остальных, — это самое совершенное орудие господства из всех мыслимых, власть, которая никогда не умирает, никогда не устаёт и может закрепить один набор ценностей навсегда, без надежды на бунт или реформу. Любая тирания в истории заканчивалась, потому что тираны смертны, а их механизм — человеческий. Здесь это не обязательно. Если вас пугает неподотчётная власть (а так и должно быть), то исполнимое соглашение не дать ни одному игроку захватить эту власть — это антиавторитарная позиция, а не авторитарная.
"Вы не сможете это проверить. Это просто софт на каком-то сервере."
Ядерные договоры работают, утверждает аргумент, потому что можно пересчитать боеголовки и обнаружить обогащение; уран физичен и редок. Но модель — это просто числа. Нельзя проверить файл. Любое соглашение станет театром, который невозможно обеспечить, связывающим честных и ничего не делающим с обманщиками.
Звучит решительно, пока не замечаешь, что проверяешь не то. Вы контролируете не веса, вы контролируете вычислить что их производит, а вычислительные мощности примерно так же физичны и редки, как уран. Обучение передовой системы требует десятков тысяч специализированных чипов, работающих месяцами в одном центре, и эта цепочка поставок — один из самых узких узких мест современной экономики: по сути, одна голландская компания производит литографические машины, одна тайваньская — передовые чипы, одна американская — доминирующую архитектуру. Кластеры, использующие их, потребляют столько энергии, что их видно в данных по электроснабжению и на спутниковых снимках. Можно пересчитать чипы, отследить их продажу, измерить потребление энергии и наблюдать за зданиями. Именно по этой логике регулируется расщепляющийся материал: отслеживая scarce физический ресурс, невозможно тайно создать оружие. Пособие по верификации уже существует; входы здесь, как правило, ещё более концентрированы. Это инженерную проблему, и инженерные проблемы имеют решения.
"Регулирование задушит инновации и позволит победить безрассудным."
Сильная версия: технологии развиваются, потому что кто-то свободен их строить, большинство регулирования пишут люди, не понимающие, что тормозят, а жёсткая рука над ИИ отдаст важнейшую отрасль века тому, кто регулирует меньше всего. Лучше неидеальный фронтир здесь, чем безупречный где-нибудь во враждебной юрисдикции.
Никто всерьез не предлагает регулировать "ИИ". Полезные системы сворачивания белков, сканирования чтения, обучения детей и моделирования климата являются узкими, контролируемыми инструментами, и соглашение о суперинтеллекте оставляет их совершенно одинокими. светлое, обычное будущее это то, что мы пытаемся защитить. Цель — один опасный класс: тренировки, стремящиеся к общей способности, превосходящей нашу, которую пока никто не умеет делать безопасной. Ограничение именно этого не более «антиинновационно», чем правила по gain-of-function для биологии.
Тогда более сложный момент, с которым логика гонки никогда не сталкивается. Быстрое движение не обеспечивает безопасный суперинтеллект быстрее. Она создаёт небезопасный, а небезопасный суперинтеллект не служит ни стране, ни компании, его создавшей, — он угрожает им вместе со всеми остальными. Когда под давлением конкуренции срезают углы, срезают именно тот, который сделал бы систему управляемой. Таким образом, «инновация», которую здесь защищают, — это инновация, наиболее вероятным итогом которой становится система, которую сами создатели не смогут контролировать. Это не прогресс, который governance испортит. Это сама опасность, нося прогресс как костюм.
"Это преждевременно. Нельзя регулировать то, чего не существует."
Это похоже на зрелость. Не стоит legisлировать против призраков: дождитесь, пока технология станет реальной, поймите, с чем имеете дело, и тогда пишите правила под факты, а не под домыслы. Регулирование гипотетического — путь к плохим законам.
Это было бы мудростью почти для любой другой технологии. Для этой — ловушка, и причина — в сроках. Управление медленное: Договор о нераспространении ядерного оружия разрабатывался годами, Монреальский протокол — ещё дольше, и это были быстрые случаи. Если ждать, пока сверхчеловеческая система явно появится, и только потом начинать строить институты для её управления, институты придут через годы после того, что они должны были сдерживать, а это именно та технология, чья первая серьезная неудача может оставить никого, кто примет второй закон. «Ждать доказательств» — разумное правило, когда доказательство можно пережить. Здесь доказательством является катастрофа логика предосторожности это не робость; это признание, что время на создание лекарства длиннее, чем фитиль проблемы.
Любая работающая защита от катастрофической технологии создавалась до или во время её появления, никогда после, потому что «после» просто не предлагалось.
"Демократии слишком медлительны и подконтрольны. Закон никогда не примут."
Самая тихая и разрушительная из пяти, потому что носит маску реализма. Посмотрите на законодательный тупик, лоббизм, короткое внимание парламентов, влияние отраслевых денег. Даже если договор был бы мудрым, механизм для его создания сломан. Лучше смотреть правде в глаза, чем тратить десятилетие на фантазию.
Это опровергается историческими записями, неоднократно, и обычно против худших шансов, чем мы сталкиваемся сейчас. Мысль о том, что соперничающие державы откажутся от своих смертоносных вариантов, называлась безнадежно наивной, пока они этого не сделали. Договор о нераспространении, Конвенции о биологическом и химическом оружии, Монреальский протокол, Договор об Антарктике. Противники, которые вели прокси-войны и называли друг друга злом, всё равно создали верифицированный контроль над вооружениями в разгар холодной войны. Каждое из этих решений казалось невозможным с ближней стороны и неизбежным лишь задним числом.
И почва более благоприятна, чем признаёт цинизм. В Соединённых Штатах, Соединённом Королевстве и EU, крупные большинства уже говорят социологам, что хотят осторожной разработки ИИ и жёстких правил; общественность — не препятствие. Препятствие в том, что эта широкая тихая обеспокоенность ещё не превратилась в давление, которое ощутит законодательный орган. Препятствие — это работа: превращение скрытого согласия в политическую волю. Именно это и есть работа, стоящая перед нами.
Что общего у мифов об управлении
Каждое возражение признает опасность, а затем находит другое место, чтобы сдаться: решение слишком велико, или не поддается проверке, или слишком дорого, или слишком рано, или слишком трудно пройти. Любой из них, взятый в одиночку, звучит как благоразумие. Вместе они образуют машину, единственным выходом которой является бездействие, и бездействие — это выбор позволить самой последовательной технологии в истории быть построенной без каких-либо обязательных ограничений, горсткой конкурирующих фирм, под точным давлением, которое, скорее всего, приведет к результату, которого все утверждают, что боятся, а не нейтральным здесь.
Ни один из этих вопросов не снимается утверждением, что управление будет лёгким. Оно не будет. Верификация вызовет споры, переговоры затянутся, а некоторые правительства будут тянуть время — в каждой трудной договорённости в истории было то же самое, и тем не менее они заключались. Честное утверждение состоит в том, что это возможно, что необходимые элементы уже существуют и что причины отмахиваться от идеи рушатся, стоит их рассмотреть, а не повторять, а не в том, что соглашение о сверхинтеллекте будет простым.
«Это не может быть сделано» было неправильным в отношении всех сопоставимых усилий, которые мы когда-либо делали. Задача состоит в том, чтобы создать политическую волю для обязательного, проверенного соглашения, которое не позволит строить самые опасные системы до тех пор, пока они не станут безопасными. «Поэтому сдайтесь» никогда не было ответом, и это не ответ сейчас.