Большая часть исследований по безопасности ИИ задаёт один и тот же вопрос: как сделать эту модель безопаснее? Лучшее обучение, лучшее выравнивание, лучшая оценка. В вопрос уже встроено допущение, что более безопасная модель даст более безопасное поведение, когда окажется в реальной системе среди других агентов и пользователей.
Перестановка тех же четырёх агентов привела к колебанию уровня одобрения на 59 процентных пунктов.
«Позиция: безопасность и справедливость в агентном ИИ зависят от топологии взаимодействий, а не от масштаба модели или согласования» (arXiv:2605.01147), размещённая на arXiv 1 мая 2026 года авторами Танавом Сингхом Баджаджем, Нихилом Сингхом, Караном Анандом и Эйшкараном Сингхом, прямо оспаривает это предположение. Их вывод: в многоагентных ИИ-системах структура связей и взаимодействий агентов перевешивает свойства безопасности любой отдельной модели. Даже хорошо согласованные модели могут выдавать катастрофически небезопасные результаты исключительно из-за того, как система соединена.
Три режима отказа
Исследователи проверили многoагентные системы одобрения кредитов на 5760 синтетических заявках, используя модели от 3B до 70B параметров. Они выявили три разных режима отказа, каждый из которых не виден при стандартной оценке безопасности на уровне модели.
Упорядочение нестабильности
В последовательных конвейерах агентов именно порядок ролей определяет результат не меньше, чем качество рассуждений. Для моделей LLaMA-3B доля одобрений колебалась от 36,4 % до 95,4 % при 24 возможных порядках четырёх ролей — разброс в 59 процентных пунктов. Даже при масштабе 70B разброс составлял 21,7 процентного пункта (от 71,5 % до 93,2 %). Одни и те же модели, одна и та же задача, одни и те же приложения — совершенно разные результаты в зависимости от того, какой агент шёл первым.
Закономерность была устойчивой: когда первым шёл менеджер по рискам, уровень одобрения оказывался самым низким; когда первым шёл специалист по данным — самым высоким. Никакая работа по согласованию отдельных моделей не устраняет этот эффект, потому что он свойство последовательности конвейера, а не самих моделей.
Информационные каскады
В последовательных системах более поздние агенты следуют за более ранними, а не рассуждают независимо. Небольшие 3B-модели показывали примерно 90 % согласия между агентами при 20 % исправлении ошибок, что говорит о том, что они всё ещё проводили некоторую независимую оценку. При 70B и выше согласие между агентами выросло до более 99,9 %, а исправление ошибок упало ниже 0,1 %.
Обсуждение фактически прекратилось. Суждение первого агента прошло по всей цепочке без изменений, а остальные агенты лишь создавали видимость проверки, без всякого содержания. Более способные модели быстрее и полнее приходили к консенсусу, усиливая эту ошибку именно за счёт большей способности к coherentному согласию.
Функциональный коллапс
При параллельной топологии с агрегацией судей модели LLaMA-3B дали примерно 98 % общего одобрения по кредитным категориям, при этом заявители с низким кредитом одобрялись на 95 %, а с высоким — на 100 %. По метрикам демографического паритета это выглядит как справедливая, недискриминационная система. На практике система перестала дискриминировать вообще. Оценка риска превратилась в формальность, удовлетворяемую через indiscriminate одобрение, а не через equitable оценку.
Масштабирование возможностей модели усиливает сбои, связанные с топологией, а не ослабляет их. Более способные модели тратят больше вычислений на построение согласованного группового мнения и меньше — на независимую оценку. При масштабе 70B почти полное устранение независимого обсуждения означает, что многоагентная система функционирует как одноагентная с лишними шагами, не наследуя никаких преимуществ безопасности, которые должны были обеспечивать несколько независимых рецензентов.
Регуляторный разрыв, который возникает
Текущие фреймворки безопасности ИИ оценивают модели. Они анализируют выходы моделей, измеряют их согласованность и сертифицируют поведение. Архитектура взаимодействия, связывающая несколько моделей, полностью остаётся за рамками этой оценки.
Авторы статьи называют это фундаментальной проблемой и дают четыре конкретные рекомендации по управлению. Сертификация безопасности должна требовать топологических проверок по разным архитектурам. Бенчмарки должны явно указывать структуру взаимодействия, которая тестируется. Развёртывание должно требовать проверки архитектурной устойчивости перед выпуском. Раскрытие регуляторам должно включать документацию архитектур систем и продемонстрированной стабильности при изменениях топологии.
Основной аргумент: агентный ИИ нужно рассматривать как динамическую систему, а не набор согласованных компонентов. Топология взаимодействий — параметр безопасности, который текущие методы оценки не измеряют. Регуляторы и операторы проверяют не то.
Что это значит на практике
Сценарий одобрения кредита представляет широкий класс реальных развёртываний. Многоагентные системы ИИ уже используются в найме, медицинской сортировке, модерации контента, юридических исследованиях и финансовом комплаенсе. В большинстве этих контекстов отдельно сертифицированные или оценённые модели соединяются через архитектуры, не прошедшие сопоставимую проверку.
Колебание уровня одобрения кредитов на 59 процентных пунктов только от перестановки агентов указывает на похожие структурные неустойчивости в других высокорискованных конвейерных решениях. Автономная система медицинской сортировки с последовательной проверкой агентами столкнётся с нестабильностью порядка. Конвейер отбора кандидатов с параллельным голосованием агентов столкнётся с функциональным крахом. Структура конвейера — параметр безопасности, который текущие оценки просто не учитывают.
Структура — это параметр безопасности. Относитесь к проектированию конвейера так же, как к выбору модели: тестируйте его, регулируйте, когда ставки высоки, и не внедряйте мультиагентные системы в медицину или кредитование только на основе оценок модели. По более широкой проблеме контроля см наш план. Полная статья: arXiv:2605.01147.
Самое жёсткое возражение
Самое справедливое возражение: тщательный выбор модели всё равно важнее, а порядок в конвейере — второстепенная правка. Скачок на 59 пунктов от перестановки агентов — это не второстепенно. Структура — параметр безопасности первого порядка. Оценивайте топологию, а не только веса.