Когда чат-бот ошибается, обычно можно заметить и попросить заново. Когда ошибается автономный агент, ошибка может накапливаться через шаги, инструменты и память, прежде чем кто-то заметит. Этот разрыв объясняет, почему опрос об отказах агентов в мае 2026 года важен для всех, кто запускает агентов на реальных данных и деньгах.

Двенадцать исследователей под руководством Цзиньху Ци (включая Ирвина Кинга) опубликовали «Towards Trustworthy Agentic AI: A Comprehensive Survey of Safety, Robustness, Privacy, and System Security» (arXiv:2605.23989; Academia AI and Applications, 2026). В них разбирается, как отказывают агентные системы, какие существуют защиты и где остаются пробелы.

Что меняется, когда система действует, а не только отвечает

Обычная модель получает подсказку и выдаёт текст. Агент получает цель и действует: планирует, вызывает инструменты, сохраняет промежуточные результаты, выстраивает цепочки действий и адаптируется к обратной связи среды.

Такая архитектура порождает сбои, которые не ловят тесты по схеме «промпт — ответ». Один неудачный вызов инструмента может отравить все последующие шаги. Память может хранить ложное убеждение и продолжать действовать на его основе. Безобидные на вид шаги могут складываться во вред. Мир меняется по мере действий агента, и эти изменения влияют на следующее решение.

Безопасность и устойчивость

Здесь риск — это собственная траектория агента. Атаки — это не только подсказки пользователя. Вредоносный документ, который агент прочитает посреди задачи, может направить остаток запуска без ведома пользователя. Это инъекция подсказки из среды.

Сдвиг распределения опаснее для агентов, чем для чат-ботов. Чат-бот в незнакомой ситуации просто даёт худший ответ. Агент в той же ситуации совершает цепочку уверенных действий, и каждое из них может ухудшать положение.

Разрыв в метриках

Большинство бенчмарков для агентов до сих пор спрашивают лишь, выполнена ли задача. Гораздо реже спрашивают, соблюдались ли ограничения по ходу. Система может «успешно» справиться, нарушая правила в каждом запуске. Единый центр метрик в обзоре полезен именно тем, что отслеживает и результат, и процесс: успешность задачи, нарушения ограничений, неполные трассы, успешность атак.

Конфиденциальность и безопасность систем

Здесь противник контролирует часть среды. В обзоре описаны реальные сбои в открытых стеках агентов, а не только игрушечные атаки.

Долгосрочная память — проблема приватности, которой чат-боты в основном избегают. Агент, ведущий исследования в рамках одной сессии, может накапливать секреты, а потом утечку через вызовы инструментов или инъекцию. Отравление памяти (искажение сохранённого контекста для управления последующим поведением) не имеет чистого одношагового аналога.

Системы с несколькими агентами расширяют уязвимость. Один скомпрометированный агент может проталкивать вредоносный контент через обычные каналы взаимодействия. Фильтры, созданные для пользовательского ввода, по умолчанию могут доверять агентам-ровесникам.

Что до сих пор не решено

1
Саморазвивающиеся агенты. Системы, которые переписывают собственное поведение на основе опыта, могут утратить исходные свойства безопасности. Тесты фиксированных систем не покрывают движущуюся цель. Непрерывная верификация пока остаётся слабой.
2
Мониторинг во время работы. Большинство развёрнутых агентов не проверяют трассы выполнения на соответствие правилам безопасности в реальном времени. Разовые тесты перед выпуском не ловят дрейф между сессиями.
3
Полезная память без дырявого хранилища. Агентам нужен контекст, чтобы помогать. Большинство текущих дизайнов либо отбрасывают память (и теряют полезность), либо сохраняют память, которую легко эксплуатировать.

Народное возражение

Самое сильное возражение: это вчерашняя безопасность ПО под новым ярлыком — песочницы для инструментов, логи действий, отгрузка. Отчасти верно. Песочницы и логи важны. Смысл обзора в том, что агенты добавляют долгосрочное накопление, атаки из среды и доверие между агентами, которые обычные чек-листы безопасности приложений всё ещё недооценивают. Считать риск агентов «просто ещё одним API» — именно так команды пропускают всю картину.

Что делать с картой

Командам, уже запускающим агентов на клиентские данные, деньги или внешние инструменты, нужны метрики процессов, мониторинг во время работы и независимая проверка дизайна инструментов и памяти, а не только оценка перед выпуском, спрашивающая, выполнилась ли демонстрационная задача.

Для Фонда карты сбоев агентов — это ближнесрочный слой. Они не заменяют более крупную задачу. Миру, мчащемуся к искусственному суперинтеллекту, всё ещё нужно обязательные ограничения, правила вычислений и верификация так, чтобы способности не опережали контроль. Используйте обзор, чтобы укрепить агентов, которых вы развёртываете сейчас. Используйте договорной трек, чтобы конечное состояние не стало агентом, которого никто не сможет перекрыть. Полный текст: arXiv:2605.23989.