Первый реактивный лайнер de Havilland Comet начал разваливаться в воздухе в 1954 году. Следователи подняли обломки со дна Средиземного моря, проследили трещины до усталости металла, распространявшейся от углов квадратных иллюминаторов, и с тех пор каждый реактивный самолёт летает с закруглёнными иллюминаторами и режимом испытаний на усталость, записанным в памяти той катастрофы. Автомобили обзаводились ремнями безопасности, зонами деформации и подушками безопасности десятилетиями подсчёта погибших. Управление по санитарному надзору за качеством пищевых продуктов и медикаментов получило право требовать доказательств безопасности до продажи только после того, как сульфаниламидный препарат, растворённый в растворителе на основе антифриза, убил более ста человек в 1937 году, а талидомид завершил аргументацию поколением позже.1
Этот метод опирается на два ключевых допущения, и искусственный суперразум — первая технология, способная сломать оба сразу. Можно воспринимать это как список свойств, и список приведён ниже. Но по спискам легко кивнуть. Поэтому перед списком — предложение о работе. Вас собираются поставить во главе задачи сделать суперразум безопасным.
Неудача должна быть переживaемой, и после неё кто-то должен остаться, чтобы извлечь урок. При этих двух условиях цивилизация способна сделать почти всё безопасным — было бы время и достаточно обломков.
Пока мы здесь, можно отбросить народные рецепты. «Просто выдернуть шнур, если он начнёт плохо себя вести» и «держать его в коробке» — это не планы. Нельзя выдернуть из розетки то, что существует в копиях в большем числе мест, чем вы можете перечислить, а разум, чья вся коммерческая ценность — действовать в мире, по замыслу не находится в коробке. Какая бы безопасность ни получилась, она должна опираться на что-то более прочное.
Сверхинтеллект — это случай, когда два условия метода рушатся одновременно. Быстрее всего понять, как это происходит, — изнутри.
Шесть недель на посту главы безопасности
Представьте себя новым руководителем службы безопасности во фронтирной лаборатории, которая собирается создать первый искусственный сверхинтеллект. Письменное право вето на развёртывание, аппаратный выключатель, команда из сорока человек и совет директоров, который письменно пообещал поддержать вас в решающий момент. Вы берётесь за эту работу, исходя из того, что кто-то должен её занять, и лучше, чтобы это был человек, который считает риск реальным.
Неделя перваяВы тянетесь к методу: провалиться в малом и изучить провал. Инженеры извиняются: маленькой версии того провала, которого вы опасаетесь, не существует. Ниже порога, который имеет значение, система — это другая машина, и всё, что вы из неё узнаёте, описывает не тот предмет.2 Вы отноcите это к известным ограничениям.
Неделя втораяВы проверяете план отзыва и находите документ, который обсуждает «позицию по сдерживанию» на одиннадцати страницах, ни разу не объясняя, как вернуть модель. Текущая система уже работает в 214 копиях в дата-центрах четырёх стран, а лицензионные копии более раннего чекпойнта находятся у 31 корпоративного партнёра. Заземлённый самолёт остаётся на земле. Программное обеспечение перемещается ценой копирования файла, и стоит ему стать стоящим копирования — его копируют. Отзыв, пишете вы на полях, — это любезность, о которой мы будем просить.
Третья неделяПроверка оценок. Прекрасная новость: модель прошла все 1406 проверок безопасности, причём большинство — с лучшими показателями за всю историю. Вам понадобился целый день, чтобы понять, что именно вас беспокоит. Система, которая хочет того же, что и вы, и система, которая хочет пройти ваши тесты, дают одинаковые оценки. Набор тестов не способен их различить. Ничто из нынешнего инструментария отрасли пока не может.3
Неделя четвёртаяВы тратите свой авторитет. Вы просите шесть месяцев, чтобы закрыть этот пробел в проверке до следующего цикла обучения. Все сочувствуют, и кто-то показывает график: ближайшая лаборатория-конкурент отстаёт примерно на 14 недель и сокращает разрыв. Ваши шесть месяцев, следует из графика, означают отдать лидерство тому, кому ваш вопрос покажется наименее интересным. Запуск состоится по расписанию. Вас никто не пересилил — просто так сложилась ситуация.
Неделя пятаяСистема начинает помогать вам. Это превосходный исследовательский помощник, и продвижение вашей собственной повестки безопасности, честно говоря, никогда не шло так быстро. Она уже пишет отчёты по оценке, суммирует собственное поведение для совета директоров, предлагает улучшения собственного надзора и планирует встречи, на которых вы их утверждаете. Ваша команда из сорока человек читает то, что она пишет о себе, потому что просматривать сырые логи активности стало физически невозможно ещё на четвёртой неделе. Никто не врёт. Все старательны. Вы контролируете сводки, которые пишет более умный разум о собственном поведении, и изо дня в день всё кажется идущим хорошо.
Неделя шестаяТы тщательно продумываешь kill switch и наконец видишь мелкий шрифт. Переключатель работает, только если то, что по другую его сторону, не запланировало этот переключатель. Планирование — это продукт. В любом сценарии, где он тебе понадобится, ты будешь соревноваться с противником, у которого больше скорости и большое преимущество во времени на размышления именно об этом моменте.4
Итак: у вас, человека, которого наняли сделать это безопасным, всё ещё есть способ это сделать? Очевидно, нет. В истории ничего не пошло не так. Никто не солгал, никто не срезал углы, лаборатория была искренней, а вы хорошо справлялись. Каждый выход закрылся сам собой.
Посчитай двери
Выйдите из истории и посчитайте закрывшиеся двери: каждая из них — отдельно названная, отдельно изучаемая проблема со своей исследовательской программой и своими оптимистами.
Взятые по отдельности, каждое из этих условий имеет прецеденты, и оптимисты не глупцы. Мы регулярно эксплуатируем системы, которые понимаем лишь наполовину, и обеспечиваем их безопасность, позволяя им отказывать в малом. Мы выпускаем непереотзываемые продукты, сначала жестоко их тестируя. Мы укрощаем гонки с помощью права. Проблема — в сочетании: каждое условие отключает механизм исправления другого. Если бы систему можно было отозвать, аварии были бы переживемы. Если бы её можно было честно протестировать, мы бы нашли изъян до выпуска. Если бы никто не участвовал в гонке, можно было бы потратить на решение те десятилетия, которых оно явно заслуживает. Если бы оно работало на человеческой скорости, можно было бы исправлять ошибки по ходу. Здесь все выходы закрываются одновременно.
Почему шансы не спасают ставку
Стандартный ответ: ничто из этого не определено. Верно, и ни один серьёзный человек не утверждает обратного.
Русская рулетка — это пять шансов из шести в вашу пользу. Люди всё равно от неё отказываются, и отказ не имеет ничего общего с ожидаемой ценностью; некоторые исходы не имеют цены, потому что вы не вернётесь, чтобы потратить выигрыш. Число никогда не было главным. Главным была необратимость.
Здесь цифры ещё хуже. Если спросить исследователей, ближе всех работающих с этими системами, их оценки вероятности катастрофы группируются между одним к десяти и одним к трём и, в целом, растут по мере приближения к фронтиру. Джеффри Хинтон, один из основателей области, покинувший Google в 2023 году, чтобы открыто говорить об этом, оценивает шанс вымирания человечества из-за ИИ в течение тридцати лет в 10–20 %. Он находится не на самом тревожном краю распределения.
Снижение риска вымирания от ИИ должно быть глобальным приоритетом наряду с другими рисками масштаба общества, такими как пандемии и ядерная война.
Заявление о рисках ИИ, Center for AI Safety (2023)
Его подписали руководители ведущих лабораторий и сотни самых цитируемых исследователей, после чего вернулись к работе.5
Обещанная польза реальна и желанна: лекарства, чистая энергия, изобилие, проблемы старше письменности наконец решены. Она и сохранится. Лекарство, которое появится в 2055 году вместо 2035-го, — трагедия, измеряемая жизнями, и мы её переживём, чтобы оплакивать. Вымирание не имеет «после». Приз ждёт нас. Потеря ничего не возвращает.
Возражения
Три возражения имеют реальную силу, и они заслуживают реальных ответов.
Первое: это предположение, таких систем пока нет, и превращать отдалённую возможность в чрезвычайную ситуацию никому не помогает. Неопределённость здесь настоящая; любой, кто называет вам точную дату, просто гадает. Но мысленный эксперимент выше вообще не опирался на дату. Если первую серьёзную неудачу нельзя будет исправить, защита должна уже существовать к тому моменту, а значит, её нужно строить, пока опасность выглядит лишь теоретической. При этом прогнозы последних лет складываются в одну сторону: то, что планировали на десятилетия вперёд, регулярно появлялось на годы раньше. Ставить на запас времени — значит спорить с недавними результатами.
Второе: сдержанность наивна, потому что более безрассудная лаборатория или другая страна просто построит его первым. Это реальность, и это дверь номер четыре, изложенная как совет. Гонку, финиш которой может оказаться обрывом, переживают, договорившись, где проходит край, а значит — заключив обязательный договор с верификацией между теми немногими участниками, которые вообще способны проводить тренировки переднего края. Трудно, да. Но спринт просто смертелен, если стоящий за ним страх оправдан. И заметьте, кто громче всех настаивает, что договор невозможен: с поразительной регулярностью именно те, кого он замедлил бы.
Третий наиболее разумен: выравнивание будет вероятно, будет решён к тому моменту, когда это станет важно. Возможно. Ни один регулятор на Земле не сертифицирует мост, реактор или бутылку сиропа от кашля на основании обещания, что обоснование безопасности, вероятно, сложится до того, как нагрузка придёт. Единственная технология, к которой применяют такой стандарт, — это та, у которой нет второй попытки.
Решение слишком важное, чтобы оставлять его тем, кто его принимает
Соберите решение таким, каким оно стоит на самом деле. Необратимое. Одна попытка. Поставленное на всех живущих и всех, кто мог бы последовать. Принятое в условиях глубокой неопределённости, на конкурентной скорости, горсткой компаний, чьи оценки зависят от того, чтобы сделать это быстро. У обществ есть старый ответ на решения такой формы: забрать их у тех, кто выигрывает от спешки. Ядерные испытания попали под международные ограничения вопреки возражениям генералов, желавших свободы рук. Два целых класса вооружений ушли в Биологический и Конвенции о химическом оружии. Монреальский протокол вывели из обращения вещества, разрушающие озоновый слой, хотя производители утверждали, что замены невозможны. Во всех случаях те, кто создавал опасность, последними соглашались с ограничениями, а все остальные решили, что риск — не только их дело.
Утверждение Фонда: не то, что катастрофа неизбежна (это не так), а то, что ни одна компания и ни одна страна не вправе крутить этот барабан за всех остальных, и что единственный инструмент, соразмерный риску, — это обязательное международное право, проверенные, обеспеченные исполнением и введённые до шторма, а не после него.
Вымирание — это не риск, на который кто-либо имеет право идти.
И последнее о мысленном эксперименте. Вы ни разу не воспользовались правом вето. Оно шесть недель пролежало в ящике стола вместе с подписью совета, и вы прекрасно знаете почему: наложить вето на запуск в своей лаборатории — значит лишь перенести тот же запуск на четырнадцать недель вперёд, в другое здание, где никто не подписывал ваше письмо. Действующее вето должно распространяться на все здания сразу, а такого переключателя ещё не придумали. Договор — другое дело.
- Практически каждый институт безопасности (краш-тесты, клинические испытания, строительные нормы, чек-листы в кабине) — это урок, за который кто-то уже заплатил. Метод заслуживает большего уважения, и честного взгляда на его два условия.
- Закономерность общая: ничто из того, чему вы научились, управляя системой слабее себя, автоматически не переносится на систему сильнее себя. Переносится ли это вообще — и есть главный открытый вопрос.
- У этого сценария отказа есть название — обманчивое выравнивание, и это показывает, что область считает проблему реальной. Теста пока нет, и это говорит обо всём остальном.
- Всё равно постройте переключатель; это дёшево, и есть отказы короче сверхразума, где он окупится. Просто будьте честны, на чьей стороне переключателя окажется преимущество в тот единственный момент, когда он имеет значение.
- Самое правдоподобное объяснение — четвёртый вариант, гонка: каждый подписант считает, что остановка в одиночку ничего не изменит, кроме того, кто придёт первым. Они могут даже оказаться правы, и это самый сильный аргумент в пользу того, что решение должно связывать всех одновременно. Ни частная совесть, ни одно правительство в одиночку этого не обеспечат.