Большинство обсуждений безопасности ИИ сосредоточено на сценарии, когда системы ИИ преследуют очевидно плохие цели, ведущие напрямую к вреду для людей. Блокировка ценностей — более тонкий и в некотором смысле более тревожный сценарий: постоянное кодирование целей, которые казались хорошими в момент кодирования, но закрывают возможность морального прогресса, который в итоге мог бы их улучшить.

Закрепление ценностей делает эти исправления невозможными.

Суть проста. Сверхразумная система ИИ или субъект, усиленный ИИ, получает достаточный контроль над мировыми ресурсами и системами, чтобы навсегда закрепить те ценности, которые ей задали или которые она приняла. С этого момента эти ценности определяют все исходы, и пересмотреть их уже невозможно. Закрепление может произойти намеренно (актор сознательно кодирует свои ценности) или случайно (система настолько тщательно максимизирует свою цель, что исключает любую возможность альтернатив). В любом случае будущее становится фиксированным.

Исторический аргумент против любого закрепления

Самый сильный аргумент против закрепления ценностей — не философский, а исторический. Посмотрите назад на два столетия и изучите, что люди того времени считали очевидными моральными истинами. Рабство было законно и социально принято в большинстве мира, включая страны с развитыми философскими традициями и явными обязательствами перед человеческим достоинством. Юридический статус женщин как собственности мужей или отцов был всеобщим. Практики, ныне признаваемые пытками, были стандартными элементами систем уголовного правосудия. У детей не было прав перед родителями или работодателями.

Люди тех эпох были не уникально злобными. Многие были вдумчивыми, нравственно серьёзными людьми, которые тщательно рассуждали об этике. Они приходили к позициям, которые по любым современным меркам были катастрофически ошибочными. И они были уверены в soundness своих ценностей — та же нравственная уверенность, которая многим из них делала блокировку разумной.

Такая картина повторяется. Сто лет назад почти все западные общества открыто придерживались взглядов о расовой иерархии, которые сегодня признаны и фактически ложными, и морально чудовищными. Пятьдесят лет назад гомосексуальность считалась психическим заболеванием в основных медицинских справочниках. Моральные ошибки предыдущих поколений очевидны задним числом. Было бы странно, если бы наша эпоха наконец достигла морального совершенства и не имела сопоставимых ошибок, которые ждут исправления в будущем.

Ключевое следствие

Если нынешние ценности содержат ошибки (а историческая картина говорит, что содержат), то их постоянное кодирование означает постоянное кодирование этих ошибок. Будущие поколения, которые могли бы обнаружить и исправить эти ошибки, не получат механизма для этого. Блокировка сохраняет всё в наших нынешних ценностях — и хорошее, и ошибки — навсегда.

Почему даже благожелательная блокировка опасна

Распространённый ответ на опасения по поводу value lock-in: «А что, если закреплённые ценности действительно хороши?» Этот ответ упускает суть. Оценка того, что ценности «действительно хороши», сама должна производиться с помощью тех самых ценностей, которые обсуждаются. Не существует внешней позиции, с которой можно было бы оценить, достаточно ли хороши текущие ценности, чтобы оправдать их permanent encoding. Та же уверенная моральная определённость, которая делает lock-in приемлемым, исторически оказывалась тем, что последующий моральный прогресс считал наиболее нуждающимся в пересмотре.

Аргумент Ника Бострома об астрономических потерях говорит об этом иначе. Будущее, доступное человечеству в космических масштабах, содержит почти невообразимое количество возможных жизней и переживаний. Даже небольшое систематическое отклонение от оптимальных ценностей, умноженное на такой масштаб, представляет собой потерю, несопоставимую ни с чем, что может произойти за одну человеческую жизнь. Закрепление ценностей, которые на 99 % соответствуют некоему идеалу, всё равно окажется катастрофой по сравнению с тем, что могло бы содержать будущее.

Связь с демократическим надзором

Фиксация ценностей — одна из центральных причин, почему демократический и международный надзор за суперинтеллектом ИИ имеет огромное значение. Любая единая сущность (компания, государство, даже благое намерение фонда), чьи ценности навсегда закодированы в сверхразумной системе, создаёт lock-in, независимо от того, насколько хорошими эти ценности кажутся в момент кодирования.

Альтернатива — не в том, чтобы определить «правильные» ценности и закодировать их вместо этого. Никто не может сделать это надёжно, а исторический опыт показывает, что высокая уверенность в найденных ценностях сама по себе служит тревожным сигналом. Альтернатива — сохранить условия, при которых моральный прогресс может продолжаться: плюрализм, разнообразие взглядов, механизмы мирного пересмотра норм и отсутствие единой сущности, способной навсегда навязать свои ценности всем остальным.

Это структурный аргумент в пользу демократического управления сверхразумным ИИ, выходящий за рамки инструментального (что даёт лучшие результаты). Демократический контроль сохраняет условия для дальнейшего морального прогресса, независимо от того, какие ценности преобладают в данный момент Предложения Фонда по управлению построены вокруг этой мысли: цель — не передать контроль правильным ценностям, а не допустить, чтобы какая-либо одна система ценностей (как бы благородна она ни была) получила постоянный, необратимый контроль.