Авиация стала безопасной не за счёт проверки, выдержит ли каждый болт свою расчётную нагрузку. Она стала безопасной, задавшись вопросом, как взаимодействуют части, кто имеет право чем командовать и как реальные операции отклоняются от условий, заложенных в обоснование безопасности. Эта дисциплина — системная безопасность. В её инструментарий входят STPA, FRAM и STECA — методы, которые регулируемые отрасли уже обязаны применять.

Исследования безопасности ИИ в большинстве своём их не использовали. Статья 2026 года — использует.

Лука Карлуччи, Джеймс Филлингем, Роберт Уолпол и Бартломей Крысь применяют эти три метода к передовому кодинговому агенту в реалистичной производственной среде (лаборатория, корпоративный заказчик, разработчики) в "A Systems-Thinking Approach to Loss of Control Risk from Advanced AI" (arXiv:2606.13474; ICML 2026 Technical ASI Governance Workshop). Они выявляют три опасности, которые обычные тесты моделей никогда не были рассчитаны обнаружить.

Три метода, простым языком

STPA
Системно-теоретический анализ процессов
Показывает, кто чем командует, кто за чем следит и куда идёт информация. Находит точки, где контроль ломается, даже если каждый компонент работает по замыслу.
FRAM
Метод функционально-резонансного анализа
Система рассматривается как совокупность связанных функций, а не перечень деталей. Показано, как обычные повседневные колебания могут сложиться в опасный результат на уровне всей системы.
STECA
Социально-техническая оценка для критически важных приложений
Расширяет STPA на людей, стимулы и институты. Выявляет пробелы подотчётности, лежащие между оргсхемами и кодом.

Сценарий, который они использовали

Они запустили все три метода на передовом кодинговом агенте в реальной работе с ПО: длинный горизонт, использование инструментов, реальные кодовые базы и внешние сервисы, под надзором лаборатории, корпоративных клиентов и разработчиков. Именно так эти системы уже поставляются. Риск потери контроля на уровне систем по-прежнему почти не анализируется.

Три вывода, которые упускают оценки моделей

Вывод 1
Никто за пределами лаборатории не может проверить историю безопасности

В их схеме лаборатория берёт на себя обязательства по безопасности, пишет правила использования и следит за нарушениями. Регуляторы, заказчики и аудиторы не могут независимо проверить работу. Основной обратной связью остаётся самоотчёт.

STECA отмечает это как нарушенную структуру контроля. Управляющее воздействие работает только тогда, когда кто-то может проверить, достигло ли оно цели. Когда сторона, отвечающая за безопасность, одновременно является главным источником доказательств этой безопасности, контур управления нарушен. Это факт конструкции, а не утверждение, что какая-то конкретная лаборатория нечестна.

Вывод 2
Мониторинг слишком медленный, чтобы вмешаться

STPA показывает разрыв между действием агента и моментом, когда человек узнаёт об этом действии. В многошаговых запусках в реальном времени агент часто уже вызвал инструмент, написал код или внёс изменения, прежде чем рецензент увидит оповещение.

В авиации это называют «выходом из контура». Формальное право остановить систему остаётся на бумаге. Фактическое право отстаёт. Именно так сегодня может выглядеть оперативный надзор за передовыми кодинг-агентами.

Вывод 3
Защитные меры незаметно устаревают

FRAM сосредоточен на обычных отклонениях. Защитные меры подстраивают под то, как система выглядела при развёртывании. Потом меняются промпты, меняется состав задач, накапливаются крайние случаи — и реальное распределение данных отходит от выборки, использованной при запуске.

Ничего не тревожит. Защитные меры по-прежнему делают ровно то, для чего были созданы против вчерашних условий. Разрыв растёт незаметно, пока новый случай не столкнётся с правилом, которое больше не подходит.

Что это значит для управления

Тесты моделей проверяют, что система делает на заданных входах. Они не описывают структуру управления вокруг неё, не показывают, кто за что отвечает, и не объясняют, как меняются операции после выпуска. Оценки способностей и red teaming остаются необходимыми, но их недостаточно.

Просьба статьи проста: совместить анализ опасностей на уровне модели с анализом опасностей на уровне системы как обязательную часть оценки безопасности. STPA, FRAM и STECA — конкретная отправная точка. Масштабированная от одного кодингового агента до целой экономики, та же слепая зона и делает постепенное лишение власти трудно увидеть до позднего этапа.

Для Фонда урок касается не одной статьи, а самого подхода к проектированию. Независимая проверка, правила по вычислительным мощностям и внешняя верификация нужны, чтобы безопасность не зависела от отчётов самой лаборатории. Именно поэтому наш план строится вокруг обязательные ограничения и верификация, а не только добровольная самооценка. Прочитайте статью, если хотите полный метод: arXiv:2606.13474. Затем примените находку в праве и институтах, а не только в ссылке на семинар.