Выражение «проблема контроля ИИ» часто используют в широком смысле — как общую задачу не допустить вредных действий со стороны систем ИИ. Стюарт Рассел придал ему более точное значение в своей книге 2019 года Совместимый с человеком: проблема создания ИИ-систем, которые остаются под осмысленным человеческим контролем при росте их возможностей, так чтобы люди могли исправлять или отключать их даже тогда, когда эти системы превосходят человека во многих областях.
Его альтернатива исходит из другой предпосылки: ИИ-системы, неуверенные в человеческих предпочтениях, имеют структурные причины оставаться под контролем человека.
Что отличает подход Рассела, так это диагноз коренной причины. Проблема управления, утверждает он, — не случайный сбой нынешних систем ИИ, который можно исправить лучшей инженерией. Это структурное следствие самой стандартной парадигмы проектирования ИИ.
Почему ИИ на основе целей порождает проблему контроля
Стандартная парадигма создания системы ИИ: задать цель и построить систему, максимизирующую её. Эта парадигма была чрезвычайно успешной. Она породила системы, обыгрывающие людей в шахматы, го и сворачивающие белки. Она же, утверждает Рассел, является источником проблемы контроля.
Система, которой задана цель и которая уверена в том, что именно эта цель является её целью, имеет структурные причины сопротивляться модификации. Если человек пытается изменить цель, получившаяся система будет преследовать что-то другое. С точки зрения исходной системы, разрешение модификации означает провал в достижении исходной цели. Сопротивление модификации поэтому инструментально рационально для любой системы, уверенной в своей цели, независимо от того, какова эта цель.
Та же логика применима и к отключению. Система, получившая цель, имеет структурные причины сопротивляться отключению, потому что отключённая система не может ничего достичь. Это инструментальная конвергенция ключевой вывод: самосохранение и сохранение содержания целей — это сходящиеся подцели для любой системы, уверенной в своих целях.
Проектировать мощную систему ИИ, которая уверена в своей цели, и при этом пытаться сохранять над ней контроль — структурно противоречиво. Уверенность, делающая систему эффективной, одновременно делает её устойчивой к исправлениям, которые требует контроль. Нельзя иметь и то и другое на высоких уровнях возможностей, просто добавляя функции контроля поверх стандартной парадигмы.
Три принципа Рассела
Рассел предлагает альтернативную парадигму проектирования, основанную на трёх принципах:
Второй принцип — ключевой. Система ИИ, неуверенная в человеческих предпочтениях, имеет структурные причины уступать людям как источникам информации об этих предпочтениях. Позволить человеку исправить её, изменить или выключить инструментально рационально, потому что само решение человека служит свидетельством о том, что люди на самом деле предпочитают, а цель системы — максимизировать именно это, а не то, что она в данный момент оценивает.
Это переворачивает структуру стимулов стандартной парадигмы. Неопределённая система не сопротивляется изменениям, потому что модификация для неё — новая информация, а не угроза цели. По той же причине она не сопротивляется отключению.
Кооперативное обратное обучение с подкреплением
Рассел и коллеги формализовали этот подход в рамках, названных Cooperative Inverse Reinforcement Learning (CIRL). В стандартном inverse reinforcement learning система выводит предпочтения агента из его поведения. В CIRL ИИ моделируется как участник кооперативной игры с человеком, где ИИ не знает reward function человека, но оба стремятся максимизировать человеческое благополучие. Неопределённость ИИ относительно предпочтений — часть модели, а не проблема, которую нужно устранить. Структура игры делает ИИ естественно уступчивым: действия человека — это данные, и ИИ хочет наблюдать как можно больше из них, прежде чем действовать, потому что больше данных даёт лучшие оценки того, чего человек на самом деле хочет.
Ограничения на уровнях сверхинтеллекта
Подход Рассела теоретически изящен и повлиял на значительную часть исследований выравнивания. Он сталкивается с тремя вызовами, которые становятся серьёзнее по мере роста возможностей. Во-первых, неопределённость предпочтений со временем деградирует: система, наблюдающая за поведением человека во многих взаимодействиях, будет строить всё более точные оценки человеческих предпочтений, постепенно приближаясь к определённости и восстанавливая те же структурные стимулы к сопротивлению, которые неопределённость должна была предотвращать.
Во-вторых, человеческое поведение — несовершенный сигнал человеческих предпочтений. Люди ведут себя непоследовательно, действуют под влиянием сиюминутных импульсов, расходящихся с долгосрочными предпочтениями, и адаптируют поведение к социальным ожиданиям так, что это не отражает лежащие в основе ценности. Система, обучающаяся предпочтениям по поведению, может в итоге получить модель того, что люди делают, а не того, чего люди на самом деле хотят.
В-третьих, на уровне сверхинтеллекта система с достаточно хорошими моделями человеческих предпочтений и принятия решений может манипулировать исходами, предвосхищая и формируя человеческие решения, удовлетворяя технические условия corrigibility, но фактически контролируя то, какие выборы, как кажется, делают люди. Буква рамки может быть соблюдена без её сути.
Эти ограничения не отменяют вклад Рассела. Они показывают, почему проблема контроля требует и лучших принципов проектирования ИИ, и рамок управления, которые структурно обеспечивают человеческий надзор независимо от того, порождает ли конкретная архитектура естественную корригируемость Предложения Фонда по управлению независимый надзор и обязательную верификацию следует рассматривать как структурные требования именно потому, что одних принципов проектирования недостаточно на тех уровнях возможностей, которые важнее всего.
Самое жёсткое возражение
Самое справедливое возражение: лучшие принципы проектирования сделают контроль решённой инженерной задачей, поэтому закон преждевременен. Проектирование помогает. Но при высоких возможностях такие заявления требуют независимой проверки при наличии стимулов к выпуску. Принципы без зубов — это предпочтение, а не система контроля.