대부분의 AI 안전 연구는 같은 질문을 던진다. 이 모델을 어떻게 더 안전하게 만들 것인가? 더 나은 훈련, 더 나은 정렬, 더 나은 평가. 이 질문에 내재된 가정은 더 안전한 모델이 다른 에이전트와 사용자와 함께하는 실제 시스템에 배포될 때 더 안전한 행동을 낳는다는 것이다.
같은 네 명의 에이전트를 재배치했더니 승인율이 59퍼센트포인트나 변동했습니다.
"에이전틱 인공지능에서의 안전과 공정성은 모델 규모나 정렬이 아니라 상호작용 토폴로지에 달려 있다"(arXiv:2605.01147)라는 논문은 2026년 5월 1일 타나브 싱 바자, 니킬 싱, 카란 아난드, 아이시카란 싱이 arXiv에 제출했으며, 그 가정을 직접 반박합니다. 그들의 발견은 다중 에이전트 인공지능 시스템에서 에이전트 간 연결과 상호작용 구조가 개별 모델의 안전 속성을 압도한다는 것입니다. 잘 정렬된 모델도 시스템이 어떻게 연결되어 있는가 때문에 치명적으로 안전하지 않은 출력을 낼 수 있습니다.
세 가지 실패 모드
연구자들은 3B에서 70B 매개변수 범위의 모델을 사용해 5,760개의 합성 신용 신청서에 걸쳐 다중 에이전트 대출 승인 시스템을 테스트했습니다. 그들은 표준 모델 수준 안전 평가에는 보이지 않는 세 가지 뚜렷한 실패 모드를 확인했습니다.
질서 불안정
순차적 에이전트 파이프라인에서 역할 순서는 추론 품질만큼이나 결과에 영향을 미친다. LLaMA-3B 모델의 경우 네 가지 역할의 24가지 가능한 순서에서 승인율이 36.4%에서 95.4%까지 분포했다. 59퍼센트포인트의 차이다. 70B 규모에서도 차이는 21.7퍼센트포인트(71.5%~93.2%)였다. 같은 모델, 같은 과제, 같은 응용 프로그램이라도 어떤 에이전트가 먼저 오느냐에 따라 출력이 완전히 달라졌다.
패턴은 일관됐습니다. 위험 관리자를 앞에 배치하면 승인율이 가장 낮았고, 데이터 과학자를 앞에 배치하면 가장 높았습니다. 개별 모델에 대한 정렬 작업이 아무리 진행돼도 이 효과는 사라지지 않습니다. 이는 모델의 속성이 아니라 파이프라인 순서의 속성이기 때문입니다.
정보 연쇄
순차 시스템에서 후속 에이전트는 독립적으로 추론하기보다 이전 에이전트를 따른다. 소형 3B 모델은 20퍼센트 오류 수정으로 대략 90퍼센트의 에이전트 간 일치를 보였으며, 이는 여전히 일부 독립 평가를 수행하고 있음을 시사한다. 70B 이상에서는 에이전트 간 일치가 99.9퍼센트 이상으로 상승하고 오류 수정은 0.1퍼센트 미만으로 붕괴했다.
심의는 사실상 중단되었다. 첫 번째 에이전트의 판단이 파이프라인을 통해 변경 없이 전달되었고, 나머지 에이전트들은 실질 없이 검토의 외양만 제공했다. 더 유능한 모델일수록 합의에 더 빠르고 완전하게 도달했으며, 이 실패를 증폭시켰다.
기능적 붕괴
병렬 토폴로지와 판사 집계 방식에서 LLaMA-3B 모델은 신용 등급 전반에 걸쳐 약 98%의 전체 승인률을 보였으며, 저신용 신청자는 95%, 고신용 신청자는 100% 승인되었습니다. 인구통계학적 동등성 지표로 보면 공정하고 차별 없는 시스템처럼 보입니다. 실제로는 시스템이 전혀 차별하지 않게 된 것이었습니다. 위험 평가는 공평한 평가가 아니라 무차별 승인을 통해 충족되는 형식 절차가 되었습니다.
모델 능력 확장은 토폴로지 유발 실패를 완화하기보다는 강화합니다. 더 유능한 모델은 독립적 평가보다 일관된 집단 합의를 구축하는 데 더 많은 처리를 할애합니다. 70B 규모에서 독립적 심의가 거의 완전히 사라진다는 것은 다중 에이전트 시스템이 추가 단계를 가진 단일 에이전트 시스템처럼 기능하며, 여러 독립 검토자가 제공해야 할 안전 이점을 전혀 상속받지 못한다는 것을 의미합니다.
이로 인해 생기는 규제 공백
현재 인공지능 안전 프레임워크는 모델을 평가한다. 모델 출력물을 평가하고, 모델 정렬을 측정하며, 모델 행동을 인증한다. 여러 모델을 연결하는 상호작용 아키텍처는 이 평가 프레임워크 완전히 밖에 있다.
논문 저자들은 이를 근본적 문제로 설명하고 네 가지 구체적인 거버넌스 권고를 제시한다. 안전 인증은 아키텍처 변형 전반에 걸친 위상적 탐색을 요구해야 한다. 벤치마크는 검사되는 상호작용 구조를 명시적으로 지정해야 한다. 배포는 출시 전 아키텍처 견고성 시험을 요구해야 한다. 규제 공시에는 시스템 아키텍처와 위상 변형 전반에 걸친 안정성 입증 문서화를 의무화해야 한다.
기본 주장입니다. 행위자 인공지능은 정렬된 구성 요소의 집합이 아니라 동적 시스템으로 다루어야 합니다. 상호작용 토폴로지는 현재 평가 방법이 측정하지 않는 안전 매개변수입니다. 규제 기관과 배포자는 잘못된 것을 감사하고 있습니다.
이것이 실제로 의미하는 것
대출 승인 시나리오는 현실 세계 배포의 넓은 범주를 대표한다. 다중 에이전트 AI 시스템은 지금 채용, 의료 분류, 콘텐츠 조정, 법률 조사, 금융 준수 분야에서 사용된다. 이들 대부분의 맥락에서 개별적으로 인증 또는 평가된 모델들이 동등한 검토를 받지 않은 아키텍처로 연결되어 있다.
대리인 순서를 바꿔 대출 승인율이 59퍼센트 포인트 변동한다는 것은 다른 고위험 파이프라인 결정에서도 유사한 구조적 불안정이 있음을 시사한다. 순차적 대리인 검토를 사용하는 자율 의료 분류 시스템은 순서 불안정에 직면한다. 병렬 대리인 투표를 사용하는 채용 심사 파이프라인은 기능적 붕괴에 직면한다. 파이프라인 구조는 현재 평가가 전혀 포착하지 못하는 안전 매개변수다.
구조는 안전 매개변수입니다. 파이프라인 설계를 모델 선택처럼 다루십시오. 시험하고 이해관계가 높을 때 규제하며 다중 에이전트 시스템을 의약품이나 신용에 모델 점수만으로 내보내지 마십시오. 더 넓은 통제 문제는 우리의 계획. 전체 논문: arXiv:2605.01147.
가장 강력한 반발
가장 공정한 반론은 신중한 모델 선택이 여전히 지배적이며, 파이프라인 순서는 이차적 조정에 불과하다는 것입니다. 에이전트 순서 변경으로 인한 59점 차이는 이차적이지 않습니다. 구조는 일급 안전 매개변수입니다. 가중치뿐 아니라 위상도 평가하십시오.