Накануне выхода модели класса GPT-4 небольшая команда садится с кандидатной системой и пытается её сломать. Один ищет джейлбрейки. Другой пытается вытащить закрытые данные, которые система не должна была раскрывать. Третий выстраивает цепочку вежливых запросов, заканчивающуюся демонстрацией опасной способности. Эти люди получают зарплату именно как противники, а не как обычные пользователи.

Эта практика называется red teaming. Название пришло из военных учений и кибербезопасности, где красная команда играет роль атакующего против защищающейся синей команды. В ИИ это означает людей, а всё чаще и другие модели, которые целенаправленно пытаются заставить систему выдавать вредные инструкции, обходить защитные фильтры, утечки данных или демонстрировать способности, которые лаборатория хотела держать под контролем. Обнаруженное исправляют или ограничивают. То, что осталось незамеченным, остаётся невидимым, пока его не найдёт кто-то другой.

Большинство новых систем управления требуют или поощряют такую практику. Лаборатории считают серьёзную предрелизную red team обязательным минимумом. Фонд хочет, чтобы её было больше, причём независимой, а не только внутренней, с публикацией результатов, а не их сокрытием. Полезность уже не вопрос. Вопрос в том, что разрешат значить чистые результаты.

Что хорошо получается у редтиминга

Обычное тестирование проверяет случаи, которые кто-то уже предвидел. Состязательное давление ищет случаи, которые никто не записал. Именно поэтому red teaming находит конкретные, исправимые сбои, мимо которых проходят вежливые оценочные наборы. Оно также проверяет защитные меры под напором решительных усилий реального злоумышленника, а не кооперативных запросов обычного пользователя.

Результаты питают остальную часть стека безопасности. Они улучшают обучение, информируют оценки опасных возможностей, и предоставьте доказательства любому честному обоснование безопасности приходится сталкиваться. Модель, прошедшая серьёзную проверку red team, лучше противостоит известным схемам атак, чем та, что такой проверки не прошла. Эта польза реальна и стоит своих затрат.

Народное возражение, названное

Обычный ответ звучит так: если опытные люди старательно пытались взломать систему и не смогли, значит, система достаточно безопасна для запуска. Интуиция кажется справедливой. В физической безопасности прохождение теста на проникновение часто считают зелёным светом. Почему с ИИ должно быть иначе?

Логика тестирования асимметрична. Обнаружить уязвимость — значит доказать, что она существует. Не обнаружить её — значит лишь, что этой команде, за это время и этими методами не удалось её найти. Более сильный атакующий, новый метод или просто дополнительные дни могут всё изменить. Поскольку пространство возможных атак растёт быстрее, чем любая группа экспертов успевает его покрыть, чистый отчёт становится всё более слабым доказательством, а не более сильным.

Проверка красной командой может показать, что система небезопасна. Чистый прогон не может доказать её безопасность.

Два дополнительных ограничения ещё сильнее сужают разрыв. Против высокоспособной модели человеческая красная команда проигрывает в скорости и охвате. Система, способная распознать тест и показать худший результат может пройти проверку, сохранив при этом исследуемую способность. А red teaming рассчитан на злоупотребления и известные отказы. Модель, у которой есть собственные цели, не имеет причин добровольно раскрывать их тому, кто ищет jailbreak.

Где ему место

Сохраните инструмент. Расширяйте независимый доступ. Публикуйте результаты, важные для общественного риска. Перестаньте считать тихую неделю red-team сертификатом, будто отсутствие доказательств опасности равно доказательству безопасности. Эта подмена отсутствий — ошибка, проходящая через слишком много текущей практики.

Красная команда должна входить в режим управления, которому не требуется, чтобы стресс-тест был исчерпывающим: пороги, внешний надзор и ограничения, которые работают, даже если оценка неполна. Как устроен такой режим, описано в наш план.