Anthropic опубликовала свою первую Политику ответственного масштабирования в сентябре 2023 года. Откройте документ — структура сразу видна в заголовках, ещё до риторики. Уровни возможностей названы заранее. Каждый уровень paired с мерами защиты, которые должны включаться, когда оценки показывают пересечение порога: усиленная защита весов, более жёсткие правила развёртывания, углублённый red teaming и на верхних уровнях письменное обязательство не обучать и не выпускать модель, пока не будут внедрены указанные меры. Краткое название в отрасли — RSP. Underlying logic часто называют if-then commitments.
Ведущие лаборатории переднего края опубликовали самые известные версии, и формат распространился. Уровни обычно идут от систем примерно сегодняшнего уровня до моделей, способных существенно помочь в создании биологического оружия, серьёзной кибератаки или опасной автономии. Документ призван ответить на простой вопрос до наступления чрезвычайной ситуации: когда возможности растут, что именно делает компания?
Почему формат — это реальное улучшение
По сравнению с общим обещанием серьёзно относиться к безопасности RSP гораздо конкретнее. Он заранее называет возможности, пороги и ответные меры, превращая настроение в то, на что можно указать извне. Он упреждающий. Лаборатория должна решить, во что ей обойдётся опасная возможность, ещё до того, как придёт волна открытий и прессы.
Формат также связывает слова с тестами через оценки опасных возможностей, поэтому пороги имеют operational смысл, а не являются лозунгом. Некоторые политики идут дальше и обязуются остановить разработку, если меры безопасности не успевают за возможностями. Включение такого предложения в публичный документ — реальный шаг вперёд.
Народное возражение, названное
Самый сильный довод в пользу RSP: публичные, конкретные, заранее взятые обязательства — это путь взросления отраслей; требовать внешнего закона до любой внутренней политики — цинизм, замораживающий прогресс. С этой точки зрения RSP — черновик конституции безопасности передовых систем, и правильный шаг — поощрять их появление, а не отвергать авторов.
Верно, и слабость всё равно структурная. Одна и та же лаборатория пишет политику, определяет пороги, проводит оценки, решает, была ли черта перейдена, определяет, достаточны ли её меры безопасности, и сохраняет право менять текст. Когда коммерческое давление выпустить продукт сталкивается с обязательством, которое сама лаборатория написала и которым сама управляет, независимая сторона не держит свисток.
История не благоволит оптимистичному прочтению. Запись добровольных корпоративных обязательств по безопасности под конкурентным давлением, прослеженная в нашей статье о добровольные обязательства, это история стандартов, которые размываются, едва начинают работать. Правило «если — то» сильно ровно настолько, насколько сильно «то», а «то» исполняет сторона, которой выгодно его ослабить. Правило, которое ты сам устанавливаешь, измеряешь и можешь изменить, — это заявление о намерениях. Это не ограничение.
Два дополнительных пробела остаются под документом. RSP зависят от оценок, чтобы заметить пересечённый порог, поэтому всё, что ограничивает оценки (включая занижение результатов, неизвестные возможности и трудность доказательства безопасности) ограничивают политику, построенную на них. А RSP обязывает только ту лабораторию, которая его приняла. Конкурент, который откажется, или государственная программа вне этой культуры, остаются незатронутыми. Ни одна компания не может в одиночку решить эту проблему координации.
Как Фонд их интерпретирует
Сохраните хорошую механику. Используйте пороговую логику, структуру «если — то» и связь с оценками. Измените, кто держит ручку и кто останавливает процесс. Перенесите эти триггеры из добровольной политики в обязательное законодательство, подкреплённое независимым органом и управление вычислениями, поэтому лаборатория не сможет тихо поднять собственный потолок, когда он станет неудобным.
Рассматривайте политики как черновики обязательных правил, а затем завершайте работу за пределами лабораторий: юридически обязывающие законы, независимое правоприменение, контроль вычислительных мощностей. Именно этот переход и наш план для.