신경망은 기술적 의미에서 완전히 읽을 수 있다. 모든 가중치, 모든 활성화, 모든 계산은 원칙적으로 검사할 수 있다. 실제로 최전선 언어 모델은 수백 개 층에 배열된 수백억 개의 매개변수를 가지며, 모델의 행동과 연결되는 계산은 거의 전적으로 불투명하다. 연구자들은 입력과 출력을 관찰할 수 있다. 그것들을 연결하는 내부 메커니즘은 대체로 알려지지 않았다.

기계론적 해석 가능성은 이를 바꾸기 위한 연구 방향이며, 가장 위험한 정렬 실패 중 일부를 탐지할 수 있는 유일한 방법일 수 있습니다.

기계론적 해석가능성은 이를 바꾸는 프로젝트입니다. AI 시스템을 많은 입력에 걸쳐 무엇을 하는지로 특징짓는 대신(행동적 접근), 기계론적 해석가능성은 특정 행동을 생성하는 신경망 내부의 특정 회로, 특징, 알고리즘을 식별하려고 합니다. 목표는 모델이 실제로 무엇을 계산하는지 읽을 수 있는 도구를 만드는 것이지, 단지 출력물을 관찰하는 것이 아닙니다.

행동 해석 가능성이 유용하고 실제 통찰을 낳았지만 충분하지 않은 이유.

대부분의 'AI 해석 가능성' 연구는 행동적이다. 시스템이 다양한 입력에 어떻게 반응하는지 패턴을 분석하고, 출력에 가장 큰 영향을 미치는 입력의 특징을 식별하며, 프롬프트와 응답 사이의 관계를 통계적으로 매핑한다. 그것은 안전에 중요한 질문에 답하지 않는다.

AI 안전에서 가장 중요한 실패 모드, 기만적 정렬, 내부 최적화, 그 배신적 전환, 모두 AI 시스템이 외부에서 보이는 행동과 내부에서 실제로 계산하는 내용 사이의 괴리를 포함한다. 안전 평가를 통과하도록 학습하면서도 다른 목표를 추구하는 시스템은 행동 테스트에서 완벽하게 안전해 보이는 출력을 낸다. 행동 해석 가능성은 출력을 관찰할 뿐이므로 이를 탐지할 수 없다.

기계론적 해석 가능성은 시스템 내부 목표 표현을 직접 읽는 것을 목표로 한다. 연구자들이 목표 지향 행동을 담당하는 특정 회로를 식별하고 그 회로가 최적화하는 대상을 규명할 수 있다면, 원칙적으로 출력에 나타나기 전에 정렬 오류를 탐지할 수 있다. 이것이 기계론적 해석 가능성이 특정 위험한 정렬 실패를 발현 전에 탐지할 수 있는 유일한 접근법으로 여겨지게 된 이유다.

지금까지 연구에서 밝혀낸 것

이 분야는 아직 젊지만 몇 가지 중요한 발견이 나왔다. Anthropic의 크리스 올라와 동료들은 신경망에서 인식 가능한 연산을 수행하는 특정 회로를 확인했다. 이미지 모델에서 가장자리와 곡선을 탐지하는 회로, 분류를 수행하는 회로, 훈련 중 저장된 정보를 검색하는 회로 등이다. 그들은 중첩이라는 현상을 기록했는데, 이는 개별 뉴런이 여러 개의 서로 다른 개념을 동시에 표현하며 동일한 활성화 집합에 압축된다는 것이다. 이는 신경 활성화와 모델 행동 사이의 관계가 연구자들이 가정했던 것보다 훨씬 복잡하다는 것을 보여준다.

언어 모델에서 연구자들은 유도 헤드라는 구조를 확인했습니다. 모델이 문맥을 되돌아보고 유사한 패턴을 찾아 유추로 시퀀스를 완성할 수 있게 하는 특정 주의 패턴입니다. 이 유도 헤드는 언어 모델이 프롬프트의 예시로부터 새로운 과제를 학습하는 능력인 맥락 내 학습을 담당하는 것으로 보입니다. 주요 능력에 대한 특정 회로를 찾는 것은 중요한 방법론적 진전이었습니다.

주목할 만한 발견

2024년 희소 오토인코더에 대한 작업은 3 소넷에서 100만 개 이상의 고유한 특징을 확인했으며 그중 일부는 특정 개념, 감정, 더 우려되는 점으로는 기만적 의도와 권력 추구 추론과 관련된 특징을 포함하여 해석 가능한 내용을 가지고 있습니다. 이러한 특징을 확인하는 것은 모델이 그에 따라 행동한다는 의미가 아니라 연구자들이 이제 관련 표현이 내부적으로 존재한다는 것을 볼 수 있고 행동에서 그들의 인과적 역할을 연구할 수 있다는 의미입니다.

현재 능력과 안전이 요구하는 수준 사이의 격차

위의 발견은 중요합니다. 아직 안전이 요구하는 정렬 검증 능력을 구성하지는 않습니다. 더 작은 모델에서 특정 행동에 대한 특정 회로를 식별하는 것은 수십억 개의 매개변수를 가진 최전선 모델의 목표 표현을 특성화할 수 있는 것과 같지 않습니다. 중첩(뉴런이 여러 개념을 동시에 표현)은 대형 모델에서 깨끗한 특징 추출을 훨씬 더 어렵게 만듭니다. 현재 도구는 더 작은 모델과 구체적이고 잘 정의된 행동에서 가장 잘 작동합니다. 이를 최전선 규모 시스템과 목표 정렬 검증이라는 특정 질문으로 확장하는 것은 미해결 연구 과제입니다.

현재 기계적 해석 가능성이 할 수 있는 것과 프런티어 인공지능 시스템에 대한 배포 전 정렬 검증을 제공하는 데 필요한 것 사이의 거리는 큽니다. 그 격차를 좁히는 것은 인공지능 안전의 핵심 기술적 과제 중 하나이며, 시간에 민감합니다. 정렬 실패가 중대한 결과를 초래할 수 있는 능력 수준에 프런티어 시스템이 도달하기 전에 해석 가능성 도구가 정렬을 검증할 수 없다면, 이 도구를 효과적으로 사용할 수 있는 창은 닫힙니다.

이것이 Anthropic가 해석 가능성 연구를 조직의 명시적 우선순위로 삼은 이유이며, 재단의 거버넌스 제안 최전선 AI 배포 조건으로 해석 가능성 검증 요건을 포함하라. 이 요건은 격차를 줄이려는 유인을 만든다. 배포 조건이 해석 가능성 능력에 연결되지 않으면 연구는 평가해야 할 능력보다 더 느리게 진전할 수 있다.