챗봇이 틀리면 보통 알아차리고 다시 물을 수 있다. 자율 에이전트가 틀리면 실수가 단계, 도구, 메모리를 거치며 누구도 보지 못한 채 쌓일 수 있다. 그 간극이 2026년 5월 에이전트 실패 조사가 실제 데이터와 돈으로 에이전트를 출시하는 누구에게나 중요한 이유다.

치후 치가 이끄는 열두 명의 연구자(어윈 킹 포함)가 발표한 "신뢰할 수 있는 에이전틱 AI를 향하여: 안전, 견고성, 프라이버시 및 시스템 보안에 관한 종합 조사" (arXiv:2605.23989; Academia AI and Applications, 2026). 그들은 에이전틱 시스템이 어떻게 실패하는지, 어떤 방어가 존재하는지, 아직 남아 있는 구멍이 어디인지 지도화합니다.

시스템이 답변뿐만 아니라 행동할 때 무엇이 달라지는가

표준 모델은 프롬프트를 받아 텍스트를 반환한다. 에이전트는 목표를 받아 실행한다. 계획을 세우고, 도구를 호출하고, 중간 결과를 저장하고, 행동을 연결하며, 환경이 반환하는 것에 적응한다.

그 설계는 프롬프트-응답 테스트가 놓치는 실패를 만듭니다. 하나의 잘못된 도구 호출이 이후 모든 단계를 오염시킬 수 있습니다. 기억은 잘못된 믿음을 저장하고 계속 따르게 할 수 있습니다. 무해해 보이는 단계들이 결합해 피해를 일으킬 수 있습니다. 세계는 에이전트가 행동함에 따라 변하고, 그 변화는 다음 결정을 먹입니다.

안전성과 견고성

여기서 위험은 에이전트 자신의 궤적이다. 공격은 사용자 프롬프트만이 아니다. 작업 중 읽는 악성 문서가 사용자가 모르는 사이에 나머지 실행을 조종할 수 있다. 환경으로부터의 프롬프트 인젝션이다.

분포 이동은 챗봇보다 에이전트에 더 치명적입니다. 챗봇은 낯선 사례를 만나면 더 나쁜 답을 내놓지만, 에이전트는 같은 상황에서 일련의 자신 있는 행동을 취하다가 매 단계 상황을 악화시킬 수 있습니다.

측정 지표의 격차

대부분의 에이전트 벤치마크는 과제가 완료되었는지만 묻습니다. 제약 조건이 도중에 유지되었는지를 묻는 경우는 훨씬 적습니다. 시스템은 규칙을 매번 위반하면서도 "성공"할 수 있습니다. 이 조사의 통합 지표 허브는 결과와 과정 모두를 추적하기 때문에 유용합니다. 과제 성공, 제약 위반, 불완전한 추적, 공격 성공률을 모두 기록합니다.

개인정보 보호와 시스템 보안

여기서 적대자는 환경의 일부를 통제합니다. 이 조사는 장난감 공격뿐 아니라 실제 오픈소스 에이전트 스택의 실패 사례를 기록합니다.

장기 기억은 대부분의 챗봇이 피하는 프라이버시 문제입니다. 세션 전반에 걸쳐 조사하는 에이전트는 비밀을 축적한 뒤 도구 호출이나 주입을 통해 유출할 수 있습니다. 기억 오염(저장된 맥락을 변조해 이후 행동을 조종)은 단일 턴에 해당하는 깔끔한 사례가 없습니다.

다중 에이전트 설정은 구멍을 넓힌다. 하나의 손상된 에이전트가 정상적인 동료 채널을 통해 쓰레기를 밀어넣을 수 있다. 사용자 입력용으로 설계된 필터는 기본적으로 동료 에이전트를 신뢰할 수 있다.

아직 해결되지 않은 것

1
자체 진화하는 에이전트. 경험으로부터 자신의 행동을 다시 쓰는 시스템은 원래의 안전 속성을 뒤로할 수 있습니다. 고정 시스템 테스트는 움직이는 표적을 다루지 못합니다. 지속적 검증은 여전히 미흡합니다.
2
실행 중 모니터링. 대부분의 배포된 에이전트는 안전 규칙에 대한 실행 흔적의 지속적인 확인이 부족합니다. 시점별 출시 테스트는 세션 간 드리프트를 잡아내지 못합니다.
3
새지 않는 금고 없는 유용한 기억. 에이전트는 도움을 주기 위해 맥락이 필요합니다. 현재 대부분의 설계는 기억을 버리거나(유용성 상실) 쉽게 악용될 수 있는 기억을 유지합니다.

민간의 반론

가장 강한 반론은 이것이 어제의 소프트웨어 보안에 새 딱지를 붙인 것에 불과하다는 것입니다. 도구를 샌드박스에 넣고, 행동을 기록하고, 배포하라는 것이죠. 부분적으로 맞습니다. 샌드박스와 로그는 중요합니다. 설문조사의 요점은 에이전트가 장기적 복합 효과, 환경에서 유래한 공격, 동료 신뢰를 추가하며, 일반 앱 보안 체크리스트가 이를 여전히 과소평가한다는 것입니다. 에이전트 위험을 "그저 또 다른 API"로 취급하는 것이 팀들이 스택을 놓치는 이유입니다.

그 지도로 무엇을 할 것인가

고객 데이터, 자금 또는 외부 도구에 에이전트를 이미 배치하고 있는 팀은 데모 과제가 완료되었는지 묻는 출시 평가뿐 아니라, 프로세스 지표, 런타임 모니터링, 도구 및 메모리 설계에 대한 독립 검토가 필요하다.

재단에게 에이전트 실패 지도는 단기 계층입니다. 더 큰 과제를 대체하지 않습니다. 인공 초지능을 향해 질주하는 세계는 여전히 더 큰 과제가 필요합니다 구속력 있는 한도, 연산 규칙, 검증 능력이 통제를 앞지르지 않도록 합니다. 지금 배포하는 에이전트를 강화하려면 설문을 사용하세요. 최종 상태가 누구도 제어할 수 없는 에이전트가 되지 않도록 조약 경로를 사용하세요. 전체 논문: arXiv:2605.23989.