Большая часть инфраструктуры безопасности вокруг нынешних ИИ-систем опирается на простое предположение: люди способны понять, хорошо ли справляется ИИ. Оценщики ставят оценки результатам, эти оценки идут в обучение, и модель учится выдавать то, что человеческие оценщики высоко оценивают. Когда это работает, причина в том, что оценщики различают хорошие и плохие результаты.
Масштабируемый надзор — это задача поддержания значимого контроля после этой точки, и она не решена.
Масштабируемый надзор — это вызов, возникающий, когда данное предположение не оправдывается. По мере того как системы ИИ достигают, а затем превосходят человеческий уровень в всё большем числе областей, оценщики уже не могут надёжно судить о качестве того, что они оценивают. Младший программист не в состоянии осмысленно рецензировать код, написанный системой, которая превосходит любого человека как программист. Врач не может достоверно оценить медицинский диагноз, выданный системой, имеющей доступ к клинической литературе, недоступной ни одному доктору. Когда человеческие оценщики уступают системам, которые они должны контролировать, весь контур обратной связи, удерживающий системы ИИ в соответствии с человеческими ценностями, начинает разрушаться.
Ничего из этого не продемонстрировано в дикой природе на сверхчеловеческом уровне.
Почему узкое место оценки имеет такое большое значение
Обучение ИИ-систем с обратной связью от человека работает, потому что человеческие оценки — достаточно хороший прокси качества выходов ИИ, а целевой уровень — производительность человека. Когда ИИ превзойдет человеческий уровень, оценки станут ненадежными: оценщики, не способные точно судить о качестве, будут ставить баллы по поверхностным признакам (насколько уверенно звучит ответ, насколько ясно он написан, соответствует ли он их прежним ожиданиям), а не по тому, действительно ли он верен.
Это уже происходит в ограниченных формах. Языковые модели, обученные с обратной связью от человека, как задокументировано, выдают уверенно звучащие, правдоподобно оформленные ответы, которые получают высокие оценки людей независимо от того, точен ли лежащий в основе контент. Сигнал обучения вознаграждает видимость полезности надёжнее, чем реальную полезность, потому что оценщики лучше обнаруживают первое, чем второе.
Если ИИ-система превосходит человеческих экспертов в какой-либо области, единственными людьми, способными оценить её результаты, становятся те, кого она уже превзошла. В этот момент процесс оценки даёт всё более слабый сигнал о реальном качестве и всё более сильный сигнал о том, насколько хорошо ИИ умеет выдавать ответы, которые нравятся людям, не до конца их понимающим.
Предлагаемые подходы к масштабируемому надзору
Дебаты ИИ
Предложенная Полом Кристиано, Джеффри Ирвингом и коллегами из OpenAI в 2018 году, «дебаты ИИ» — подход, при котором две системы ИИ отстаивают противоположные позиции, а человеческий судья оценивает дебаты, а не исходный контент напрямую. Интуиция в том, что судья может выявить ошибочные рассуждения и фактические неточности в аргументе, даже если не способен самостоятельно проверить правильный ответ. Если дебатёров стимулируют побеждать честной аргументацией, а не убеждением, и если каждый дебатёр мотивирован вскрывать ошибки другого, формат дебатов может извлекать надёжные сигналы качества от человеческих оценщиков, которые сами не являются экспертами в области.
Подход теоретически привлекателен и имеет некоторую эмпирическую поддержку в контролируемых условиях. Главный открытый вопрос — сохранится ли он, когда и дебаты, и судьи будут работать в областях, далеко выходящих за пределы человеческой экспертизы, где даже определение, кто из спорщиков прав, может требовать той самой экспертизы, которой у судьи нет.
Рекурсивное моделирование вознаграждения
Рекурсивное моделирование вознаграждения, разработанное исследователями DeepMind, решает задачу, наращивая человеческий надзор через иерархию систем ИИ. Человек напрямую оценивает выходы менее способной системы ИИ, создавая модель вознаграждения. Эта модель вознаграждения затем используется для оценки выходов более способной системы, и так далее. Подход пытается постепенно расширять возможности человеческого надзора, уровень за уровнем, вместо того чтобы пытаться сразу перейти от оценки на уровне человека к оценке на уровне сверхразума.
Главная сложность — распространение ошибок: ошибки более слабой модели вознаграждения накапливаются при применении к более сильной системе. Модель вознаграждения с точностью 95 % на нижнем уровне может давать значительно более шумный надзор на верхнем, и этот шум усиливается с каждым рекурсивным шагом.
Усиление
Итеративное усиление, также предложенное Полом Кристиано, использует более слабый ИИ, чтобы помогать человеку разбивать сложные задачи на подзадачи, каждую из которых можно оценить независимо. Человек оценивает подзадачи, а ИИ собирает эти оценки в общую оценку большой задачи. При многократном повторении на разных уровнях разложения подход даёт людям возможность эффективно оценивать задачи, выходящие за пределы их прямого понимания, путём разбиения на части, которые они могут проверить.
Нерешённое состояние проблемы
Ни один из этих подходов не продемонстрирован как надёжно работающий для ИИ-систем, значительно превосходящих человеческий уровень в реальных задачах. Все три дали многообещающие результаты в контролируемых условиях и активно исследуются в Anthropic, Google DeepMind и OpenAI. Разрыв между контролируемой демонстрацией и надёжной работой в самых важных условиях остаётся широким.
Именно поэтому scalable oversight считается одной из центральных открытых проблем в безопасности ИИ наряду с интерпретируемостью и corrigibility. Мир, в котором ИИ-системы достигнут сверхразумных возможностей без решённой проблемы scalable oversight, — это мир, где мы утратим способность осмысленно контролировать то, что создали. Последствия для управления те же, что и для других нерешённых проблем: нужны рамки, требующие верификации alignment до развёртывания, а не обнаружения постфактум через поведенческий мониторинг, который система уже переросла.
Самое жёсткое возражение
Самое справедливое возражение: дебаты, усиление и рекурсивная оценка будут масштабироваться вместе с моделями, поэтому надзор — это инженерная кривая, по которой можно ехать. Возможно, в демонстрациях. На пределе судья всё равно слабее оцениваемой системы. Не стоит считать непроверенные стеки надзора разрешением переходить к ASI.