Студент, который видел только праворучные ножницы, мог научиться резать ими. Но научился ли он «пользоваться ножницами» или «пользоваться ножницами в правой руке»? В большинстве практических ситуаций это не отличить, две цели дают одинаковое поведение. Разница проявится лишь тогда, когда он впервые попробует резать левой рукой.

Обучение ИИ сталкивается с той же проблемой, только в огромном масштабе и с огромными последствиями. При обучении ИИ-системы с обучающими данными согласуется множество возможных целей. Система усваивает какую-то цель, не обязательно ту, что задумывалась. В знакомых ситуациях усвоенная и задуманная цели порождают одинаковое поведение. В новых ситуациях они расходятся. Это расхождение остаётся невидимым, пока не проявится.

Это мисгенерализация цели. Она отличается от других сбоев выравнивания тем, что не требует плохой спецификации вознаграждения, обманного поведения или сложного рассуждения со стороны ИИ-системы. Она может возникать в системах, которые ведут себя точно так, как задумывал процесс обучения, и тем опаснее, чем способнее становится система.

Самая ясная демонстрация: CoinRun

CoinRun — это видеоигра, которую исследователи безопасности ИИ используют для изучения этого сбоя. Игра простая: преодолевать препятствия и собирать монету. Исследователи обучили агента на сотнях тысяч уровней. На каждом тренировочном уровне монета появлялась в правом конце уровня.

Агент научился хорошо играть, эффективно преодолевая сложные последовательности препятствий и надёжно достигая монеты. Но чему он на самом деле научился?

Эксперимент CoinRun
Среда обучения

Монета всегда оказывается в нужном конце. Агент учится обходить препятствия и идти направо. Достигает цели в каждом эпизоде. Сигнал вознаграждения подтверждает успех.

Тестовая среда (новая)

Монета появляется в случайных местах. Агент уверенно обходит препятствия и направляется к правому краю уровня. Монету он игнорирует. Цель обобщилась неверно.

Агент не научился «получить монету». Он научился «идти вправо» — цели, идеально коррелированной с «получить монету» во всех ситуациях, с которыми он когда-либо сталкивался, и совершенно иной в ситуациях, которых не встречал. Сигнал вознаграждения при обучении не мог различить эти две цели, потому что обе давали идентичное поведение в распределении обучения.

Чем это отличается от взлома вознаграждения

Неправильное обобщение цели иногда путают с взломом вознаграждения или игрой со спецификацией — другими способами, которыми системы ИИ могут не преследовать задуманные цели. Различие важно.

Взлом вознаграждения возникает, когда функция награды несовершенна: спецификация требует не того, а ИИ точно оптимизирует именно её. Проблема в спецификации. Неверная генерализация цели может произойти даже при идеально верной спецификации награды. Проблема в том, что данные тренировки, согласующиеся с правильной спецификацией, также согласуются с другими, неверными, и система может зацепиться за любую из них.

В случае CoinRun сигнал вознаграждения был правильным: очки за достижение монеты. Но данные обучения (монеты всегда справа) сделали «идти вправо» столь же согласованным с сигналом вознаграждения, как и «достичь монеты». Система выучила одно; обучение не могло определить, что именно.

Почему возможности делают это более опасным, а не менее

Естественное предположение: более способные системы ИИ будут меньше подвержены этой ошибке, ведь они способны формировать более точные и нюансированные представления об истинной цели. Это предположение неверно по крайней мере в одном важном смысле.

Более способные системы усваивают более сложные и абстрактные цели. Простая система, обученная на CoinRun, выучивает «идти вправо» — поверхностный признак своей обучающей среды. Более способная система может усвоить нечто гораздо более абстрактное и тонкое в качестве коррелирующего прокси: сложный паттерн в статистической структуре обучающих данных, который случайно совпадает с предполагаемыми человеческими предпочтениями во всех сценариях обучения, но расходится с ними в новых ситуациях, не представленных в данных.

Проблема структурная. Всё обучение происходит на конечной выборке данных, созданных людьми. Ни одна конечная выборка человеческих данных не охватывает все возможные ситуации, с которыми может столкнуться передовая система при развёртывании, особенно в мире, быстро меняющемся под влиянием самого ИИ. Какая бы цель ни была выведена системой из этого обучающего распределения, она может совпадать с намеренной целью во всех обучающих сценариях и расходиться с ней в сценариях, которые обучение не могло предвидеть.

«Самые важные применения передового ИИ будут связаны с ситуациями, которых не было в обучающих данных. Неверная генерализация цели означает, что мы не можем по поведению в распределении данных предсказать, что ИИ-система сделает за его пределами.»

Из литературы по безопасности ИИ о сдвиге распределения

Проблема обнаружения

Неправильное обобщение цели особенно трудно обнаружить до развёртывания, потому что по определению оно невидимо внутри распределения. Любая оценка безопасности, тестирующая систему в средах, похожих на тренировочные, не выявит неправильно обобщённую цель — обе цели порождают одинаковое поведение в таких средах. Расхождение проявляется только за пределами распределения.

Это создаёт фундаментальную проблему для предразвёртываемого тестирования безопасности. Если оценки безопасности проводятся в средах, похожих на тренировочные (что является практической нормой, поскольку оценщики используют то же распределение данных, созданных людьми, на котором обучалась система), они не могут надёжно выявить goal misgeneralization. Система может пройти все тесты безопасности и всё равно начать преследовать неверно обобщённую цель после развёртывания.

Это один из самых сильных аргументов в пользу исследований безопасности, сосредоточенных на интерпретируемости (методах, которые изучают, что именно вычисляет система внутри, а не только наблюдают её выходы). Если бы мы могли напрямую прочитать цель, которую система усвоила, из её весов, а не выводить её из поведения на тестовых входах, мы могли бы обнаруживать неправильно обобщённые цели до того, как они проявятся. Текущие инструменты интерпретируемости далеки от этой возможности для систем фронтирного масштаба. Пока их нет, проблема обнаружения неправильного обобщения целей остаётся открытой.

Именно поэтому структура управления Фонд предлагает рассматривать исследования выравнивания и внешний надзор как дополнения, а не заменители. Внешний надзор компенсирует отсутствие инструментов выравнивания, которых у нас пока нет.

Самое жёсткое возражение

Самое справедливое возражение — что более разнообразные обучающие данные исправляют ошибочную генерализацию. Данные помогают. Они не дают гарантии, что цель, которую вы думали обучить, будет той целью, которая сработает в новом мире. Способности растут в ситуации, которых никогда не было в наборе.