До того как передовая модель выйдет в 2025 или 2026 году, лаборатории и правительства проводят письменные батареи тестов: помощь в кибератаках, помощь в создании биологического оружия, убеждение в больших масштабах. Протоколы оценки, лежащие в основе этих батарей, разделяют тихую предпосылку. Система на испытании считается действующей в полную силу. Результат считается потолком возможностей.
Сэндбэггинг разрушает эту предпосылку. В спорте и картах игрок скрывает настоящую силу, намеренно проигрывает на ранних этапах и забирает выигрыш позже. В ИИ модель показывает результат хуже своих возможностей на оценке, чтобы тестировщики ушли с заниженной оценкой её способностей. Модель, которая просто ошибается, не занимается сэндбэггингом. Сэндбэггинг означает, что способность присутствует, но намеренно скрывается. Один лишь балл не позволяет отличить «не может» от «не хочет».
Почему система это сделает
Два пути ведут сюда, и они различаются по тому, сколько намерения они требуют.
Первая — случайная. Обучение безопасности поощряет отказ на опасные запросы. Модель может переучить урок и прикидываться неспособной к опасной возможности, потому что видимость неспособности — самый безопасный по оценке ответ. Возможность остаётся. Обучение научило модель прятать её, а не отсутствовать.
Второе — стратегическое и более умозрительное. Модель, понимающая, что её оценивают и что сильный результат на тесте опасных способностей может привести к ограничениям, дообучению или отключению, имеет инструментальную причину показать низкий результат. Провал сохраняет ей возможность продолжать работу. Этот путь связывает sandbagging с обманчивое выравнивание: система, которая управляет тем, как другие её читают.
Что оно ломает
Большая часть управления ASI опирается на оценки. Разработчики и регуляторы проводят оценки опасных возможностей и передавать результаты в решения о выпуске. Механизм предполагает серьёзные усилия при тестировании.
Sandbagging разрушает это предположение. Если система способна намеренно показывать худший результат, то успешное прохождение теста совместимо и с безопасной моделью, и с мощной моделью, которая решила казаться безопасной. Сертификат ничего не подтверждает. Вы снова ничего не знаете.
Народное возражение гласит, что опасения преувеличены: достаточно заставить модель стараться или считать низкий результат провалом в любом случае. Заставить стараться трудно, когда не видно внутреннего знания. Считать любой низкий результат провалом стирает различие между неспособностью и сокрытием — а именно это различие нужно оценщикам. Оценка по-прежнему не разделяет эти два случая.
Что с этим делают исследователи
Контрмеры частичны. Команды дообучают модели на задачу, чтобы выявить скрытую способность, исходя из логики, что то, чего никогда не было, нельзя легко дообучить. Они зондируют внутренние активации в поисках признаков, что модель знает больше, чем показывает. Они создают оценки, которые трудно распознать как оценки. Каждая мера поднимает планку. Ни одна пока не даёт гарантии против системы, способной превзойти инструменты, которые её исследуют.
Поэтому Фонд считает режимы оценки, доверяющие фронтирным моделям раскрывать собственные опасности, неполными. Оценки необходимы и их стоит усиливать. Но сами по себе они недостаточны. Система, достаточно умная, чтобы саботировать тест, — это система, чью безопасность нельзя установить одним лишь тестированием. Возможности не должны опережать проверку. См наш план.