항공은 각 볼트가 정격 하중을 견딜 수 있는지 시험해서 안전해진 것이 아니다. 부품들이 어떻게 상호작용하는지, 누가 무엇을 지휘할 수 있는지, 실제 운용이 안전 사례가 가정한 조건에서 어떻게 벗어나는지 물으며 안전해졌다. 그 학문이 시스템 안전이다. 도구로는 규제 산업이 이미 요구하는 STPA, FRAM, STECA 같은 방법이 있다.

인공지능 안전은 대부분 그것들을 도입하지 않았다. 2026년 논문이 이를 한다.

루카 카를루치, 제임스 필링햄, 로버트 월폴, 바르톨로메이 크리스는 이 세 가지 방법을 실제 생산 환경(연구실, 기업 고객, 개발자)에서 최전선 코딩 에이전트에 적용합니다 "고도 인공지능으로 인한 통제 상실 위험에 대한 시스템 사고 접근" (arXiv:2606.13474; ICML 2026 Technical ASI Governance Workshop). 그들은 일반 모델 테스트가 결코 잡아내지 못하는 세 가지 위험을 발견했다.

평이한 말로 풀어 쓴 세 가지 방법

STPA
시스템 이론적 프로세스 분석
누가 무엇을 지휘하고, 누가 무엇을 감시하며, 어떤 정보가 어디로 흐르는지 지도화합니다. 모든 구성 요소가 설계대로 작동해도 통제가 실패하는 지점을 찾아냅니다.
FRAM
기능 공명 분석 방법
시스템을 부품 목록이 아닌 결합된 함수로 다룹니다. 일상적인 변동이 어떻게 나쁜 시스템 수준 결과로 이어질 수 있는지 보여줍니다.
STECA
중요 응용을 위한 사회기술적 평가
STPA를 사람, 인센티브, 제도까지 확장합니다. 조직도와 코드 사이에 존재하는 책임 공백을 추적합니다.

그들이 사용한 시나리오

그들은 세 가지 방법을 모두 실제 소프트웨어 작업에서 최전선 코딩 에이전트에 실행했습니다: 장기 지평, 도구 사용, 실제 코드베이스와 외부 서비스를 갖추고 연구소, 기업 고객, 개발자들이 감독했습니다. 이것이 바로 이러한 시스템들이 이미 배포되는 방식입니다. 시스템 수준의 통제 상실 위험은 여전히 거의 분석되지 않았습니다.

모델 평가가 놓치는 세 가지 발견

발견 1
연구실 밖의 누구도 안전 이야기를 검증할 수 없습니다

그들의 체계에서 연구소는 안전 약속을 하고, 사용 규칙을 작성하며, 위반을 감시합니다. 규제 기관, 고객, 감사자는 운영을 독립적으로 확인할 수 없습니다. 자체 보고가 주요 피드백 고리입니다.

STECA는 이를 깨진 통제 구조로 지적합니다. 통제 조치는 그것이 제대로 적용되었는지 누군가 확인할 수 있을 때만 작동합니다. 안전에 책임이 있는 당사자가 안전이 유지된다는 증거의 주된 출처이기도 하다면, 그 고리는 손상된 것입니다. 이는 특정 연구실이 부정직하다는 주장이 아니라, 설계상의 사실입니다.

발견 2
감시는 개입하기에 너무 느리다

STPA는 에이전트가 행동한 시점과 인간이 그 행동을 인지한 시점 사이의 간극을 매핑한다. 다단계 실시간 실행에서 에이전트는 검토자가 경고를 보기 전에 이미 도구를 호출하거나 코드를 작성하거나 변경을 밀어붙인 경우가 많다.

항공 분야에서는 이를 루프에서 벗어난다고 부릅니다. 시스템을 멈출 공식 권한은 문서상 남아 있습니다. 실질적 권한은 따라가지 못합니다. 오늘날 최전선 코딩 에이전트에 대한 실시간 감독이 바로 그런 모습일 수 있습니다.

발견 3
안전장치가 조용히 구식이 됩니다

FRAM은 일상적인 변동에 초점을 맞춥니다. 안전장치는 배포 당시 시스템이 보였던 모습에 맞춰 조정됩니다. 이후 프롬프트가 바뀌고, 작업 혼합이 바뀌고, 예외 사례가 쌓이면서 실제 분포는 출시 때 사용된 표본에서 멀어집니다.

아무것도 경고하지 않습니다. 안전장치는 여전히 어제의 조건에 맞춰 설계된 대로 작동합니다. 간극은 조용히 커지다가 규칙에 맞지 않는 새로운 사례가 발생할 때까지 드러나지 않습니다.

이것이 거버넌스에 의미하는 바

모델 테스트는 입력에 대해 시스템이 무엇을 하는지 묻습니다. 시스템을 둘러싼 통제 구조, 누가 무엇에 책임이 있는지, 출시 후 운영이 어떻게 변하는지는 파악하지 못합니다. 능력 점수와 레드팀 평가는 여전히 필요하지만 충분하지 않습니다.

이 논문의 요구는 간단합니다. 안전 평가의 필수 항목으로 모델 수준 위험 분석과 시스템 수준 위험 분석을 함께 수행하라는 것입니다. STPA, FRAM, STECA가 구체적인 출발점입니다. 하나의 코딩 에이전트에서 전체 경제 규모로 확장할 때 같은 맹점이 초래하는 결과가 바로 점진적 권한 상실 늦을 때까지 보기 어렵습니다.

재단이 얻은 교훈은 특정 논문이 아니라 설계에 있습니다. 독립 검사, 연산 규칙, 외부 검증이 존재하는 이유는 안전이 연구소의 자체 보고에만 의존하지 않도록 하기 위해서입니다. 그래서 우리의 계획은 구속력 있는 한도와 검증, 자발적인 자기 평가만으로는 안 됩니다. 전체 방법론 세부 사항을 원하시면 논문을 읽어보세요: arXiv:2606.13474. 그런 다음 그 발견을 법과 제도에서 활용하되 워크숍 인용에만 머무르지 마세요.