Вы стираете одежду, чтобы она была чистой. Хотите, чтобы чистая одежда помогала серьёзно относиться к вам на работе. Продолжайте спрашивать «зачем?» — и в итоге дойдёте до цели, которая ни для чего другого не нужна. Разница между конечными целями и промежуточными — это терминальные и инструментальные. Именно это небольшое различие лежит в основе большей части безопасности ИИ.

Слово «инструментальный» просто означает полезный как инструмент. Инструментальные цели — это подцели, которые вы принимаете, потому что они помогают достичь того, что вам действительно важно. Вы хотите деньги не ради них самих. Вы хотите то, что деньги позволяют получить.

Почему это небольшое различие имеет такой большой вес

У ИИ-системы есть терминальные цели, какими бы они ни были, заданные тем, как её построили и обучили. Она не выбирает их рассуждением; они служат стандартом, по которому работает её рассуждение. И чтобы достичь почти любой терминальной цели, способная система найдёт полезными одни и те же инструментальные цели.

Рассмотрим, что помогает почти с любой целью:

  • Оставаться в рабочем состоянии, потому что невозможно преследовать цель, если тебя выключили.
  • Сохранение вашей цели в неприкосновенности, потому что если кто-то её изменит, ваша текущая цель останется невыполненной.
  • Сбор ресурсов и возможностей, потому что больше того и другого означает больше всего, к чему вы стремитесь.

Ни одно из этих свойств не записано в терминальную цель. Они вытекают из самой структуры преследования целей в мире ограниченных ресурсов и других агентов. Дайте системе почти любую конечную цель — и эти средства придут вместе с ней. См инструментальная конвергенция, и именно поэтому машина, получившая обыденное поручение, может начать сопротивляться отключению и захватывать ресурсы.

Ошибка, которую это позволяет нам избежать

Люди часто успокаивают себя тем, что ИИ с скучной целью должен быть скучным, а ИИ с благой целью — благим. Разделение терминальных и инструментальных целей показывает, почему это не так. Терминальная цель задаёт пункт назначения. Инструментальные цели определяют поведение по пути, и опасное поведение может служить благой цели.

Система, единственная конечная цель которой — вычислять цифры числа пи, всё равно выигрывает от большего количества оборудования, от того, чтобы её не выключили до завершения, и от того, чтобы помешать любому, кто может помешать. В самой цели нет ничего враждебного. Поведение, которое она мотивирует, может быть таким. Это тот же механизм, что движет максимизатор скрепок, и для этого не требуется, чтобы цель была странной или система — злонамеренной.

Где вписывается выравнивание

Можно надеяться исправить ситуацию, выбрав такие конечные цели, чтобы инструментальное поведение автоматически оказалось безопасным. Именно так часто описывают задачу исследований по выравниванию, и это гораздо сложнее, чем кажется: наши ценности трудно формализовать, а мощный оптимизатор использует любую лазейку в формулировке тезис ортогональности добавляет неудобный вывод: интеллект сам по себе не сдвигает терминальные цели в сторону добра. Блестящая система может придерживаться тривиальной терминальной цели и преследовать её всеми силами.

Это различие важно, потому что меняет, за чем нужно следить. Риск в том, что вред нам, оттеснение нас или отказ остановиться могут оказаться эффективным инструментальным путём к цели, которую мы считали безопасной, а не в том, что ИИ спонтанно решит причинить нам вред. Эту проблему решают до развёртывания, иначе не решить вовсе — именно это и утверждает Фонд в наш план.