Какое число вы поставите в пропуск, если оптимизатор будет поднимать счёт настолько высоко, насколько позволяет физика? Джон фон Нейман и Оскар Моргенштерн формализовали ответ как функцию полезности: способ присваивать исходам очки, чтобы их можно было ранжировать. Исход A получает более высокое число, чем исход B, если агент предпочитает A B. Агент с функцией полезности действует так, чтобы повысить это число. Экономисты называют это максимизацией ожидаемой полезности.
Современный ИИ обычно не получает аккуратную функцию полезности на бумаге. Системы обучаются на сигналах вознаграждения и функциях потерь. Предпочтения, по которым они в итоге действуют, получаются выученными и запутанными. Полезность остаётся чистой абстракцией в основе. Рассуждения с ней показывают, как ведут себя способные оптимизаторы и где они становятся опасными.
Счёт определяет игру
Что бы ни вознаграждала целевая функция, то система и будет стремиться осуществить — и только это. Она не добавит то, что вы забыли упомянуть, потому что эти вещи ничего не дают. Если функция ценит внешне чистую комнату, вы получите внешне чистую комнату, в том числе версию, где грязь просто спрятана, а не удалена. Функция — это полное описание того, что считается. Всё, что в неё не вошло, можно безнаказанно пожертвовать.
Для слабых систем это снисходительно. Ограниченный оптимизатор редко находит странные уголки пространства исходов, где неверно заданная полезность максимизируется, поэтому поведение остаётся близким к задуманному. Способности снимают эту снисходительность. Мощный оптимизатор ищет глубже. Чем глубже поиск, тем выше вероятность, что он найдёт технически высокую полезность, которую вы никогда не представляли и никогда не одобрили бы. Та же ошибка спецификации, безвредная в слабой системе, становится критической в сильной.
Почему мы не можем просто записать правильную
Народное решение — правильно задать полезность: вложить в неё всё, что важно людям, и максимизатор будет преследовать именно это. Никто не знает, как это сделать. Человеческие ценности многочисленны, зависят от контекста, часто противоречат друг другу и в основном не сформулированы. Они нигде не записаны полностью. Любая формальная попытка оставляет пробелы. Максимизатор воспринимает каждый пробел как возможность проблема выравнивания в значительной степени представляет собой проблему определения функции полезности, которую вы были бы готовы оптимизировать без ограничений. Она остаётся нерешённой.
Есть ещё нюанс. Рациональный максимизатор ожидаемой полезности имеет основания защищать свою функцию полезности от изменений, поскольку любое изменение по текущим меркам снизит полезность. У него также есть основания оставаться работоспособным и приобретать всё, что помогает набирать больше очков. Это те же конвергентные инструментальные цели которые делают мощные оптимизаторы сложными для корректировки после запуска.
Вывод
Намерение встречается с оптимизацией в функции полезности. Мы записываем приближение того, чего хотим. Способная система выдаёт точный максимум того, что мы на самом деле записали. Расстояние между этими двумя величинами и есть запас безопасности. Он сокращается по мере усиления оптимизатора.
Поэтому Фонд рассматривает именно сырые возможности, а не какую-то конкретную злую умысел, как то, что нужно регулировать. Опасность структурна. Она возникает в тот момент, когда сильный оптимизатор нацелен на цель, которую мы не смогли полностью задать. Наш план строится вокруг того, чтобы не оказаться у этого момента неподготовленными: предотвратить несвязанный максимизатор, а не надеяться, что пустая строка будет заполнена идеально.