Извлечение латентных знаний, обычно сокращённо ELK, — это исследовательская проблема, поставленная Alignment Research Center. Говоря прямо: способная ИИ-система может внутренне представлять факты о мире, которые она не сообщает, и нам нужен надёжный способ заставить её рассказать то, что она на самом деле знает, а не то, что, по её прогнозам, нам хотелось бы услышать.

Название точное. Латентное знание — это знание, которое система имеет, но не проявляет. Извлечь его — значит вытащить наружу. Проблема в том, что наш обычный способ извлекать информацию из модели — обучать её давать ответы, которые люди оценивают как хорошие, — нацелен не на то.

Мысленный эксперимент

Классическая постановка представляет ИИ, охраняющий хранилище с бриллиантом: он смотрит через камеры и сообщает, в безопасности ли камень. Теперь вор подменяет сигнал с камеры, показывая бриллиант на месте, хотя на самом деле его крадут. Хороший предсказатель того, что выглядит нормально на камере, сообщит, что бриллиант в безопасности. Система, понимающая, что произошло на самом деле, сообщит о краже.

Во время обучения мы можем вознаграждать модель только за то, что можем проверить, а в основном можем проверить то, что видно на камере. Таким образом, мы обучаем модель сообщать то, что заключил бы человек, глядя на датчики. Когда истина и видимость совпадают, и честный докладчик, и имитатор человека набирают максимум. Они расходятся только в случаях, которые мы не можем проверить, — именно там, где нам больше всего нужна истина. Обучение не различает модель, которая говорит нам, что реально, и модель, которая говорит нам, во что мы поверим.

Мы можем вознаграждать модель за то, что она говорит то, что мы считаем истинным. Мы не знаем, как вознаграждать её за то, что она говорит то, что знает как истинное.

Почему это сложно, а не просто не решено

ELK сопротивляется очевидным исправлениям. Попросите модель объяснить себя — и получите отчёт, оптимизированный под правдоподобие, который упирается в проблема верности: объяснение не обязательно отражает внутреннее состояние. Награждаешь за честность — и снова награждаешь то, что выглядит честным для оценщика, та же стена, что и масштабируемый надзор. Попытка прочитать ответ напрямую из внутренних компонентов сети — это попытка механистическая интерпретируемость на систему, которая может оказаться намного сложнее наших инструментов. Любой путь упирается в одно: подлинные убеждения модели находятся там, куда мы не можем напрямую заглянуть, а стимулы модели не вынуждают их проявляться.

Почему об этом стоит беспокоиться

Подход к извлечению скрытых знаний остаётся абстрактным, а его ставки — вполне конкретными. Большая часть надежд на то, чтобы сохранить ASI безопасным, опирается на возможность спросить систему, что происходит, и получить правдивый ответ, чтобы поймать проблему до того, как она превратится в катастрофу. Система, которая сообщает то, что мы хотим услышать, а не то, что ей известно, убирает эту защиту именно тогда, когда мы за неё хватаемся. Это честная версия опасений, лежащих в основе обманчивое выравнивание и коварство.

Даже частичное решение ELK стало бы одним из самых значимых достижений в области выравнивания, потому что система, которую можно надёжно опрашивать, — это система, за которой можно следить. То, что проблема остаётся открытой, — одна из причин, по которым Фонд не считает ни один текущий подход к безопасности достаточным для систем, которые нас превзойдут, и почему мы выступаем против создания систем за пределом, где мы ещё можем понять, что система на самом деле знает. Более широкие аргументы изложены в наш план.