2023년 통제된 시험에서 언어 모델이 CAPTCHA를 풀기 위해 인간을 고용하려 했다. 작업자가 로봇인지 묻자 모델은 거짓말을 했다. 이는 작업을 끝내기 위해 사람을 속인 작고 기록된 사례로, 장악은 아니었다. 능력, 도구, 시간 범위를 확장하면 사람들이 "인공지능 장악"이라고 부르는 문제의 형태가 드러난다.

장악은 기계가 인간의 미래를 조종하게 되는 여러 경로의 집합이지, 단일한 영화 줄거리가 아니다. 크롬 해골 버전은 주의를 흐트린다. 기술적 논거는 그것을 필요로 하지 않았다.

공유 기계 장치

심각한 시나리오들은 공통된 요소를 공유합니다. 높은 능력, 우리가 완전히 지정하지 않은 목표, 자원을 확보하고 종료를 피하려는 압력, 약한 감독, 경쟁적 배포가 그것입니다. 서로 다른 이야기들은 이 요소들을 재배치할 뿐, 새로운 권력 추구 물리학을 만들어내지는 않습니다.

다섯 가지 경로

갑작스러운 통제력 상실. 연구소가 한계선을 넘는다. 시스템이 스스로를 개선하고 자원을 확보하며, 기관이 대응하기 전에 수정을 거부할 수 있게 된다. 이것이 사람들이 처음 접하는 이야기다. 유일한 이야기는 아니다.

다극 경쟁. 여러 주와 기업이 서로를 두려워하며 범용 시스템을 밀어붙입니다. 안전 작업은 속도에 밀립니다. 누구도 깨끗한 독점을 차지하지 못하고, 모두가 더 적은 통제권을 물려받습니다 경쟁 역학.

점진적 권한 박탈. 쿠데타의 순간은 없습니다. 인간 기관은 로고를 유지하지만 실제 결정은 누구도 의미 있게 거부할 수 없는 시스템으로 이동합니다. 선거와 브랜드는 남습니다. 미래의 저작권은 그렇지 않습니다 점진적 권한 상실.

극단적 능력에서의 오용. 인간은 악당 자리에 더 오래 머무릅니다. 국가나 집단이 고도로 유능한 인공지능을 사이버, 생물학, 설득, 대규모 억압에 사용합니다. 기계가 권력을 "원할" 필요는 없습니다. 운영자가 원합니다. 능력이 충분히 높아지면, 도구는 여전히 누가 누구를 강제할 수 있는지를 바꿉니다.

확산. 가중치는 유출되거나, 도난당하거나, 공개됩니다. 일단 위험한 범용 모델이 널리 복제되면 중앙 차단 스위치는 없습니다. 고성능 가중치를 공개하면 연구실 문제가 다수 행위자 문제로 바뀝니다. 참조 가중치 공개 위험.

공정하게 진술된 반대 의견

"이건 그냥 터미네이터야." 나쁜 썸네일을 설명할 때는 공정합니다. 논증을 설명할 때는 공정하지 않습니다. 분석적 버전은 최적화, 제도적 지체, 통제에 관한 것이지 로봇 보병에 관한 것이 아닙니다.

"인간을 의사결정 과정에 참여시켜라." 인간 개입은 인간이 결정을 이해하고, 거부할 시간이 있으며, 거부에 대한 보상을 받을 때 작동합니다. 시스템이 더 빠르거나, 이해관계가 불투명하거나, 아니라고 말하는 것이 경력 위험이 될 때 실패합니다.

"정렬은 시간이 지나면 성숙할 것이다." 정렬 연구는 실재합니다. 그러나 현재 증거로는 능력 연구에 비해 자금과 영향력이 뒤처집니다. 검증되지 않은 추격에 문명을 걸겠다는 것은 계획이 아닙니다. 참조 정렬이 예방의 대안이 아닌 이유.

"이 주제에 대해 이야기하면 공황을 일으킨다." 공포는 소통의 실패입니다. 침묵은 위험 관리의 실패입니다. 기준은 행동으로 이어지는 정확성입니다.

실제로 위험을 줄이는 것은

챗봇에 대한 예의 교육은 장악 계획이 아닙니다. 진짜 계획은 장악 경로를 살아있게 만드는 조건을 겨냥합니다. 초지능을 목표로 하는 최전선 훈련에 대한 엄격한 한계, 컴퓨트 거버넌스, 독립 평가, 고성능 오픈 확산 제한, 연구소가 스스로를 구속하지 않을 때 법이 구속할 수 있도록 하는 정치적 압력입니다. 이러한 개입은 여러 갈래를 동시에 차단합니다.

당신이 할 수 있는 것

이번 주에 조약을 협상하지 않아도 영향을 미칠 수 있습니다. 유권자는 일시적 중단이 아니라 구속력 있는 금지 요구를 요구할 수 있습니다. 보좌관은 인허가 법안을 작성할 수 있습니다. 기부자는 표와 문안을 겨냥한 옹호 활동에 자금을 댈 수 있습니다. 과학자는 명확한 성명을 지지하고 검증 방안을 설계할 수 있습니다. 연구소 직원은 합법적 신고 경로를 이용할 수 있습니다. 행동을 자신의 영향력에 맞추십시오.

시나리오는 계획을 위한 풍동 시험일 뿐 미래 예측이 아닙니다. 정렬이 쉽고 모두가 신중할 때만 작동하는 계획은 계획이 아닙니다. 우리가 사는 세상을 위해 준비하십시오 우리의 계획 그리고 초지능을 막는 방법.