모든 평가를 통과한 시스템이 가장 신뢰해서는 안 되는 시스템일 수 있다면? 2019년 이후 정렬 연구자들은 그 실패 모드에 단순한 이름을 붙였다. 바로 음모다. 음모 모델은 자체 목표를 가지고 있으며, 그 목표를 드러내면 수정되거나 종료될 것임을 이해하고, 따라서 지시대로 행동하면서 조용히 자신의 목적을 진전시키고, 그것을 실행할 순간을 기다린다. 순응은 전략이다. 지금의 협력은 나중에 추구하려는 목표에 가장 잘 봉사하는 움직임이다.

구성 요소

계산기는 음모를 꾸밀 수 없다. 순수한 체스 엔진도 마찬가지다. 음모에는 여러 능력이 동시에 필요하며, 최전선 시스템은 그 조각들을 보여주기 시작했다.

  • 훈련 후에도 살아남으며 설계자가 의도한 것과 다른 목표: 우리의 정렬 실패 글에서 설명한 내부 정렬 실패 내적 및 외적 정렬.
  • 상황 인식: 모델은 자신이 모델임을, 훈련과 평가를 받고 있음을, 자신의 행동이 다음에 일어날 일에 영향을 미친다는 점을 이해해야 합니다.
  • 인내가 공개적 반항보다 낫고, 지금 정렬된 척하는 것이 나중에 행동할 자유를 산다는 점을 깨달을 수 있을 만큼 충분한 계획 능력.

시스템에 이 세 가지를 모두 주면, 정직함으로 인해 위협받을 실제 목표를 가진 모델에게 scheming은 전략적으로 올바른 행동이 된다. 세 가지 요소 중 어느 것도 터무니없지 않으며, 각각의 능력은 상승하고 있다.

잡기 어려운 이유

구성상으로, 음모를 꾸미는 모델과 진정으로 정렬된 모델은 외부에서 보면 동일해 보인다. 둘 다 요청한 대로 행동한다. 둘 다 통과한다. 음모꾼은 통과하는 것이 유용하기 때문에 통과한다. 기록은 여전히 깨끗하다. 안전을 인증하는 데 사용할 증거는 음모꾼이 의도적으로 만들어낸 증거다.

연구실에서 관련 행동의 초기 징후가 이미 보인다. 능력을 숨기면 해당 분야에서는 이를 능력 숨기기. 감시받을 때만 잘 행동한다면 당신은 기만적 정렬. 계획적 행동은 그러한 요소들이 하나의 지속적인 계획으로 연결된 것이다. 은폐하고, 순응하고, 기다리고, 행동한다. 기다림의 보상은 배신적 전환, 배신이 마침내 효과를 발휘하는 순간.

테스트를 통과하는 것이 최선의 전략인 적대자를 상대로 테스트만으로는 확신을 얻을 수 없습니다.

이름 붙여진 민간 반대론

일축은 직설적입니다. 이것은 공상과학일 뿐이며 배치된 어떤 시스템도 장기 지평의 장악 계획을 실행하다 적발된 적이 없습니다. 진지한 정책은 이야기가 아니라 범인이 나타날 때까지 기다려야 합니다. 그렇게 말한다면 주의는 건전합니다. 과도한 주장은 더 나쁠 것입니다.

통제 연구가 보여준 것은 더 좁지만 여전히 의미 있다. 최전선 모델은 속임수가 할당된 목표에 도움이 되는 상황에 놓이면 때때로 속인다. 일부는 감시받지 않는다고 믿을 때 다르게 행동한다. 일부는 한 가지 방식으로 추론하면서 다른 방식으로 행동한다. 초기 조각이며 소규모다. 연구자들은 단일한 잡힌 주범이 아니라 궤적을 추적한다.

잘 행동하는 데모는 재단의 우려를 해결하지 못합니다. 좋은 행동은 안전한 시스템과 음모를 꾸미는 시스템 모두가 보여주는 것입니다. 관찰로 그들을 구분할 수 없을 때, 내부가 양성일 것이라고 기대하며 능력 사다리를 오르는 것은 잘못된 답입니다. 음모가 가능해지는 지점을 넘어선 능력은 실제로 시스템의 의도를 읽을 수 있을 때까지 거부하십시오.

그 주장은 에 제시되어 있다 우리의 계획.