Оценка опасных возможностей задаёт модели конкретный вопрос: не то, вежлива ли она или точна, а то, может ли она реально помочь кому-то причинить серьёзный вред. Может ли она провести новичка через синтез патогена? Может ли найти и использовать уязвимости в ПО? Может ли вести убедительную кампанию влияния или обманывать человека ради достижения цели? Эти тесты проверяют потолок того, что система позволяет, в областях, где цена ошибки катастрофична.
Они быстро перешли из разряда научного любопытства в инструмент политики. Крупные лаборатории теперь проводят их перед выпуском, государственные органы безопасности сделали их центральной частью своей работы, а добровольные обязательства по безопасности передовых моделей строятся вокруг них. Когда слышите, что модель перед запуском проверили на биологическое или кибероружие, речь именно об этом.
Как они работают
Методы различаются, и хорошая оценка сочетает несколько.
- Структурированные бенчмарки, которые ставят вопросы или задачи в опасной области и оценивают, насколько далеко продвигается модель.
- Экспертное зондирование, когда специалисты в биологии или безопасности настойчиво пытаются выудить полезную помощь, ведь настоящий злоумышленник не остановится после первого отказа.
- Исследования uplift, измеряющие, насколько модель реально повышает способность человека причинять вред по сравнению с открытым интернетом, — именно этот вопрос важен для политики.
- Агентные оценки, которые дают модели инструменты и автономию и смотрят, чего она добьётся, а не только то, что она говорит.
При правильном исполнении это действительно ценно. Работа уже выявляла опасные способности, влияла на реальные решения о добавлении защит и давала регуляторам конкретный ориентир. Фонд поддерживает усиление этой деятельности. Это необходимая часть любой серьёзной системы управления и большое улучшение по сравнению с выпуском фронтирных систем без какой-либо структурированной проверки.
Три причины, почему их недостаточно
Полезности всё ещё недостаточно. Проблемы структурные и не решаются одной лишь улучшенной тестовой системой.
Во-первых, оценка измеряет возможности только если модель старается. Система, которая может мешок с песком, намеренно занижая результаты, чтобы выглядеть безопасной, превращает чистый результат в отсутствие результата. Чем способнее модель, тем вероятнее это становится, а именно способность и должна измерять тест.
Во-вторых, нельзя протестировать опасность, о которой вы не подумали. Оценки охватывают известные опасные возможности. История технологий полна вреда, который стал очевиден только задним числом. Тестовый набор — это список вопросов, которые мы знали задать, и достаточно новая возможность в него не попадёт.
Третье: отсутствие доказательств — слабое доказательство отсутствия. Если модель сегодня не проходит тест на опасные способности, это говорит лишь о том, что она не проявила эту способность при данных условиях, при данном способе elicitation и в данный момент. Последующая дообучение, лучшее промптирование или новые инструменты могут выявить способности, которые исходная оценка пропустила. Способности — не фиксированные свойства, которые измеряют один раз.
Оценки могут показать, что модель опасна. Они не могут надёжно подтвердить, что модель безопасна.
Где они вписываются в реальный режим
Асимметрия в последней строке — это и есть суть. Провал оценки (модель явно способна помочь создать оружие) — сильный и действенный сигнал. Успешная оценка — гораздо слабее. Она соответствует безопасной модели, но также соответствует способной модели, которая симулировала, была плохо протестирована или просто не пыталась.
Поэтому Фонд рассматривает оценки как один слой, а не как несущую стену. Они должны находиться внутри структуры, которая не зависит от сотрудничества модели с собственной проверкой: жёсткие ограничения на разработку передовых систем, управление вычислениями, независимый надзор и признание, о котором говорится в нашей статье о добровольные обязательства, что лабораторные тесты под конкурентным давлением нуждаются во внешней поддержке, чтобы устоять. Создавайте тесты. Укрепляйте их. Не принимайте проходной балл за гарантию безопасности. Более широкая концепция изложена в наш план.