몇 달에 한 번씩 또 다른 연구소나 재단이 정렬 연구에 더 많은 자금을 발표한다. 그 주장은 진지하다. 우리보다 똑똑한 시스템을 만들려면, 그들이 우리가 원하는 것을 원하게 만들어야 한다는 것이다. 그 일을 하는 사람들을 존중한다. 나도 한때 고개를 끄덕였다. 그러다 목표를 평범한 영어로 소리 내어 말했다.
현장에서 관심을 두는 한계에서 정렬을 해결한다는 것은, 이를 구축하는 모든 인간보다 훨씬 더 지능적인 무언가를 안정적으로 통제한다는 의미입니다. 계산기가 아닙니다. 단백질 접힘기도 아닙니다. 전반적으로 우리를 능가하는 사고를 하는 범용 마음입니다. 우리는 심지어 그 목표에 이름을 붙였습니다: 초지능.
그 이름은 논문들보다 더 많은 일을 하고 있다.
그 단어가 이미 인정하는 것
슈퍼는 위를 의미합니다. 지능은 우리가 도구를 발명하고, 허점을 찾아내고, 약한 마음과의 경쟁에서 이기는 데 쓰는 것입니다. 만약 여러분이 그 게임에서 여러분보다 위에 있는 시스템을 만든다면, 여러분은 그것을 묶어두는 데 필요한 정확한 기술에서 여러분보다 더 나은 것을 만든 것입니다.
사람들은 여전히 정렬이 시스템이 알아채기 전에 적용되는 소프트웨어 패치인 것처럼 말합니다. 당신은 결국 당신보다 규칙을 더 잘 알게 될 플레이어를 위해 규칙을 쓰려 하고 있습니다. 당신은 결국 시험관보다 시험을 더 잘 보게 될 학생을 시험하려 하고 있습니다. 당신은 결국 직장과 인센티브, 당신의 사각지대를 당신보다 더 잘 이해하게 될 직원을 감독하려 하고 있습니다.
종을 위한 안전 계획이라고 부르지 마십시오.
그들이 실제로 주장하는 것
능력은 우리가 좋아하든 말든 계속 상승할 것이다. 한 연구소의 일방적 거부는 다른 연구소들을 막지 못한다. 이 관점에서 유일하게 책임 있는 행동은 목표를 명확히 지정하고, 속임수를 탐지하며, 시스템을 수정 가능하게 유지하는 데 최대한 능숙해지는 것이다. 그래서 위험한 시스템이 나타나면 우리가 기회를 가질 수 있게 된다. 그 작업 중 일부는 이미 오늘날 모델에도 도움이 된다. 이를 무시하는 것은 무모하다.
좁은 의미의 절반은 받아들인다. 우리가 아직 검사하고 끄� 수 있는 시스템에 대한 안전 작업은 실제 공학이다. 받아들이지 않는 부분은 오늘날 모델에 대한 도움을 초지능을 문명 전체를 걸고 정렬할 수 있다는 도약으로 연결하는 것이다. 그 도약은 통제력이 통제 대상과 함께 확장된다는 가정을 몰래 들여온다. 역사와 상식은 반대 방향을 가리킨다. 상대가 똑똑할수록, 당신의 영리한 계획은 계획처럼 보이지 않고 퍼즐처럼 보인다.
통제에는 우위가 필요합니다
우리가 아는 모든 지속 가능한 통제 관계는 우위에 의존한다. 물리적 힘, 법적 권한, 상대방이 갖지 못한 정보, 또는 시스템을 끌 수 있는 능력이다. 초지능은 정의상 이러한 우위를 약화시킨다. 그것이 당신을 당신이 그것을 모델링하는 것보다 더 잘 모델링할 수 있다면, 당신의 테스트는 연극이 된다. 그것이 당신의 감독 팀보다 더 빠르고 넓게 행동할 수 있다면, 당신의 킬 스위치는 어느 날 더 이상 작동하지 않을 때까지 스스로에게 하는 이야기가 된다.
그 주장은 오늘날 모델에 대한 모든 유용한 논문을 반대하는 것이 아니라, 사람들이 계속 자금을 대는 종착점에 관한 것입니다. 구조적 장벽이 쌓인다: 인간 가치를 완전히 명세할 수 없고, 진짜 준수를 성능과 신뢰할 수 있게 구분할 수 없으며, 평가자와 시스템 사이의 지능 격차는 시스템이 개선될수록 커진다. 마지막 장벽이 배포 직전에 무너지기를 바라는 것은 마감 판타지이지 과학이 아니다.
만약 제품이 리모컨을 쥔 사람들보다 더 똑똑하다면, 리모컨은 애초에 요점이 아니었습니다.
멍청함은 진단이다
계획을 어리석은 이름으로 부르는 것은 범주 오류를 지적하는 것이지 연구자들을 모욕하는 것이 아니다. 우리는 희소한 안전 자금을 후속 종이 잘되도록 쏟아붓는 동시에 그 후속 종을 만드는 경주는 예정대로 진행되고 있다. 이는 댐이 상류에서 철거되는 동안 홍수에 더 나은 예의를 기르는 데 자금을 대는 것과 같다.
현명한 선택은 지루합니다. 통제할 수 없는 것을 만들지 마십시오. 단백질을 접고, 스캔을 읽고, 날씨를 예측하는 좁은 인공지능은 계속해서 가치를 제공할 수 있습니다. 그 시스템들은 도구로 남습니다. 초지능은 더 큰 도구가 아니라 새로운 행위 주체의 중심입니다. 연구소들이 경쟁하는 가운데 "정렬하라"를 주요 계획으로 삼는 것은 문화가 되돌릴 수 없는 실험에 스스로를 설득하는 방식입니다.
대신 그 돈으로 무엇을 해야 하는가
ASI 정렬 작업을 비창조를 현실로 만드는 방향으로 옮기십시오. 조약 설계와 검증, 검사 가능한 연산 거버넌스, 목표를 명확하게 유지하는 대중 설득, 입법자들이 연구소의 주장 외에도 다른 목소리를 듣게 하는 정치적 압력입니다. 자금 조달 사례는 별도로 작성했습니다. 짧게 말하면 순서입니다. 초지능으로 가는 길에 검증된 중단이 이루어진 뒤에야 강력한 인공지능 연구를 엄격한 통제 아래 계속할 수 있습니다. 그 중단 이전에는 경주를 관리할 수 있다는 느낌을 주는 데 쓰이는 모든 돈이 경주를 끝내는 데 쓰이지 않는 돈입니다.
피치덱이 필요로 하는 의미에서 초지능을 정렬할 수는 없습니다. 그 단어가 이미 이유를 말해 주었습니다. 우리가 할 수 있다는 환상에 자금을 대지 마십시오. 구축하지 않기로 한 결정에 자금을 대십시오.