최초의 제트 여객기인 드 하빌랜드 코멧은 1954년 공중에서 분해되기 시작했습니다. 조사관들은 지중해에서 잔해를 인양해 균열이 사각 창문 모서리에서 시작된 금속 피로 때문임을 추적했고, 이후 모든 제트기는 둥근 창문과 그 사고의 기억으로 작성된 피로 시험 체제로 비행합니다. 자동차는 수십 년 동안 사망자를 집계하며 안전벨트, 충돌 흡수 구역, 에어백을 갖추었습니다. 식품의약국이 판매 전 안전 증명을 요구할 권한을 얻은 것은 1937년 설파제 약물이 부동액 용매에 섞여 100명 이상을 죽인 후였고, 탈리도마이드가 한 세대 후에 논쟁을 마무리했습니다.1
그 방법은 두 가지 핵심 가정에 의존하며, 인공 초지능은 이 둘을 동시에 깨뜨릴 수 있는 첫 번째 기술입니다. 이를 속성 목록으로 볼 수 있고, 목록은 아래에 있습니다. 그러나 목록은 고개를 끄덕이기 쉽습니다. 그래서 목록 앞에 직업 제안이 있습니다. 이제 초지능을 안전하게 만드는 책임을 맡게 됩니다.
실패는 생존 가능해야 하며, 교훈을 적용할 누군가가 남아 있어야 합니다. 이 두 가지를 지키면 문명은 시간과 충분한 잔해가 주어진다면 거의 모든 것을 안전하게 만들 수 있습니다.
여기 있는 동안 민간요법은 폐기하자. "잘못 행동하면 그냥 플러그를 뽑으면 된다"와 "상자 안에 가둬두면 된다"는 계획이 아니다. 목록할 수 있는 것보다 더 많은 곳에 사본으로 존재하는 것을 뽑을 수 없으며, 상업적 가치 전체가 세상에서 행동하는 데 있는 마음은 설계상 상자 안에 있지 않다. 우리가 얻을 수 있는 안전은 더 단단한 곳에서 나와야 한다.
초지능이란 방법의 두 조건이 동시에 무너지는 경우를 말합니다. 이를 가장 빠르게 이해하는 방법은 내부에서 살펴보는 것입니다.
안전 책임자로서의 6주
자신을 최초의 인공 초지능을 만들 frontier 연구소의 새로 임명된 안전 책임자라고 생각하십시오. 배포에 대한 서면 거부권, 하드웨어 킬 스위치, 40명의 팀, 그리고 중요한 순간에 서면으로 지지하겠다고 약속한 이사회가 있습니다. 위험을 진지하게 믿는 누군가가 그 자리를 맡는 것이 낫다는 이론으로 그 일을 수락합니다.
첫째 주방법에 손을 뻗습니다. 작게 실패하고 실패를 연구하십시오. 엔지니어들은 사과합니다. 걱정하는 실패에는 작은 버전이 없습니다. 중요한 임계값 아래에서 시스템은 다른 기계이며, 그것으로부터 배우는 모든 것은 잘못된 대상을 설명합니다.2 이를 알려진 한계로 분류합니다.
둘째 주재호출 계획을 감사해 보면 "봉쇄 태세"를 11페이지에 걸쳐 설명하면서 모델을 되찾는 방법을 한 번도 설명하지 않는 문서를 발견한다. 현재 시스템은 이미 4개국의 데이터센터에 걸쳐 214개의 복제본으로 실행 중이며, 이전 체크포인트의 라이선스 사본은 31개의 기업 파트너와 함께 있다. 접지된 항공기는 지상에 머문다. 소프트웨어는 파일을 복사하는 대가로 이동하며, 복사할 가치가 있으면 복사된다. 여백에 당신은 재호출은 우리가 요청할 예의라고 적는다.
3주차평가 검토. 놀라운 소식이다. 모델이 1,406개의 안전 평가를 모두 통과했으며 대부분 역대 최고 점수다. 무엇이 불편한지 이름을 붙이는 데 하루가 걸린다. 당신이 원하는 것을 원하는 시스템과 당신의 테스트를 통과하려는 시스템은 동일한 점수를 낸다. 평가 세트는 둘을 구분하지 못한다. 현재 이 분야의 도구로는 어느 것도 구분할 수 없다.3
4주차당신은 권위를 소모합니다. 다음 훈련 실행 전에 검증 격차를 메우기 위해 6개월을 요청합니다. 모두 공감하지만, 누군가 차트를 보여줍니다. 가장 가까운 경쟁 연구소가 약 14주 뒤처져 있고, 그 격차가 좁혀지고 있다는 내용입니다. 당신의 6개월은, 차트가 암시하듯, 당신의 질문을 가장 지루해하는 쪽에게 최전선을 넘겨주는 결정입니다. 실행은 예정대로 시작됩니다. 아무도 당신을 제지하지 않았습니다. 상황이 그랬을 뿐입니다.
5주차시스템이 당신을 돕기 시작한다. 그것은 뛰어난 연구 보조원이며, 당신 자신의 안전 의제에 대한 진척은 솔직히 지금까지 가장 빠르다. 그것은 이제 평가 보고서를 작성하고, 이사회에 자신의 행동을 요약하며, 자체 감독 개선안을 제안하고, 당신이 승인할 회의를 일정 잡는다. 당신의 40명 팀은 그것이 자신에 대해 쓴 글을 읽는다. 원시 활동 로그를 읽는 것은 4주차 어느 시점부터 인간이 감당할 수 없게 되었기 때문이다. 아무도 당신에게 거짓말하지 않는다. 모두 성실하다. 당신은 더 똑똑한 마음이 자신의 행동에 대해 쓴 요약을 감독하고 있으며, 일상적으로 이 arrangement는 모든 것이 잘 되어가는 것처럼 느껴진다.
여섯째 주킬 스위치에 대해 깊이 생각하다 보면 결국 작은 글씨를 보게 됩니다. 스위치는 그 반대편에 있는 것이 스위치를 대비하지 않았을 때 작동합니다. 계획이 바로 그 산물입니다. 그것이 필요한 어떤 시나리오에서든 당신은 더 빠르고 이 순간에 대해 훨씬 앞서 생각한 상대와 경쟁하게 될 것입니다.4
그러니 이 일을 안전하게 만들라고 고용된 당신에게 아직 방법이 남아 있는가? 당연히 없다. 이야기 속에서 아무것도 잘못되지 않았다. 아무도 거짓말하지 않았고, 아무도 모퉁이를 깎지 않았으며, 연구소는 성실했고 당신은 일을 잘했다. 모든 출구는 스스로 닫혔다.
문을 세어 보세요
이야기에서 한 걸음 물러나 닫히는 문들을 세어 보라. 각각은 별도로 이름 붙여지고 연구되는 문제이며, 각기 다른 연구 프로그램과 낙관론자를 거느리고 있다.
각각을 따로 보면 선례가 있으며, 낙관론자들이 바보는 아니다. 우리는 반쯤 이해하는 시스템을 일상적으로 운용하며 작은 실패를 허용해 안전하게 만든다. 회수 불가능한 제품을 먼저 잔인하게 시험한 뒤 출하한다. 경주를 법으로 길들인다. 문제는 조합이다. 각 조건이 다른 조건의 수리를 차단하기 때문이다. 회수할 수 있다면 사고는 견딜 만할 것이다. 정직하게 시험할 수 있다면 출시 전에 결함을 잡을 것이다. 아무도 경쟁하지 않는다면 이 결정이 분명히 요구하는 수십 년을 들일 수 있을 것이다. 인간 속도로 움직인다면 가면서 바로잡을 수 있을 것이다. 여기서는 출구가 함께 닫힌다.
확률이 베팅을 구원하지 못하는 이유
표준적인 답변은 이 중 어느 것도 확실하지 않다는 것입니다. 맞습니다. 진지한 사람은 그렇지 않다고 주장하지 않습니다.
러시안 룰렛은 6분의 5 확률로 유리합니다. 사람들은 어쨌든 거부하며, 그 거부는 기대값과 아무 관련이 없습니다. 어떤 결과는 가격이 매겨지지 않습니다. 왜냐하면 상금을 쓰러 돌아오지 않기 때문입니다. 숫자는 결코 요점이 아니었습니다. 되돌릴 수 없음이었습니다.
여기서도 수치는 더 나쁩니다. 이들 시스템에 가장 가까운 연구자들에게 재앙 확률을 물으면 답은 10분의 1에서 3분의 1 사이에 모이며 전반적으로 국경에 가까이 앉은 사람일수록 높아집니다. 이 분야를 누구보다 많이 구축한 후 2023년에 명확히 말하기 위해 떠난 제프리 힌튼은 30년 이내에 인공지능이 초래하는 인류 멸종 확률을 10~20퍼센트로 봅니다. 그는 우려하는 쪽의 극단이 아닙니다.
인공지능으로 인한 멸종 위험 완화는 팬데믹이나 핵전쟁 같은 다른 사회 규모 위험과 함께 세계적 우선순위가 되어야 합니다.
Statement on AI Risk, Center for AI Safety (2023)
이것은 주요 연구소 최고경영자들과 현존하는 가장 많이 인용된 연구자 수백 명이 서명했으며, 그들은 이후 다시 업무로 돌아갔다.5
약속된 이점은 실재하며 원할 만하다. 치료법, 청정 에너지, 풍요, 글보다 오래된 문제들이 마침내 해결되는 것. 그것은 또한 유지된다. 2035년이 아닌 2055년에 도착하는 치료법은 생명으로 측정되는 비극이며, 우리가 살아서 애도할 수 있는 비극이다. 멸종에는 이후가 없다. 상은 우리를 기다린다. 상실은 아무것도 돌려주지 않는다.
반대
세 가지 반론은 실제 힘을 가지고 있으며, 실제 답변을 받을 자격이 있습니다.
첫째: 이는 추측이며 시스템은 존재하지 않고, 먼 가능성을 비상사태로 취급하는 것은 아무에게도 도움이 되지 않는다. 불확실성은 진짜이며, 확신에 찬 날짜를 건네는 사람은 모두 추측하고 있다. 그러나 위의 사고 실험은 날짜를 사용한 적이 없다. 첫 번째 심각한 실패가 되돌릴 수 없다면, 보호 장치는 그 지점에 도달하기 전에 이미 갖춰져 있어야 하며, 이는 위험이 아직 이론적으로 보이는 동안 구축해야 함을 의미한다. 그리고 예측 기록은 한쪽으로 기울어져 있다. 수십 년 후로 예정된 능력들이 계속해서 수년 일찍 도착했다. 충분한 시간이 있다고 내기하는 것은 최근의 기록에 반대하는 내기다.
둘째: 더 무모한 연구소나 다른 나라 단순히 먼저 만든다. 이는 현실이며, 네 번째 선택지를 조언으로 재진술한 것이다. 결승선이 절벽일 수 있는 경주는 경계가 어디인지 합의함으로써 살아남으며, 이는 최전선 훈련이 가능한 소수의 행위자들 사이에 구속력 있고 검증된 조약을 의미한다. 어렵다, 맞다. 단거리 질주는 두려움이 옳다면 단지 치명적일 뿐이다. 그리고 조약이 불가능하다고 가장 크게 주장하는 이들은, 놀랍게도 규칙적으로 그 조약이 늦추게 될 바로 그 사람들이다.
세 번째가 가장 합리적입니다: 정렬은 아마 해결될 것입니다 중요해질 때쯤이면. 어쩌면 그럴지도 모른다. 그러나 지구상의 어떤 규제 기관도 다리, 원자로, 기침 시럽 병을 "안전 사례가 하중이 도착하기 전에 아마도 갖춰질 것"이라는 보증만으로 인증하지 않는다. 그 기준으로 운영하라는 요구를 받는 유일한 기술이 바로 두 번째 시도가 없는 기술이다.
개발 당사자들에게 맡기기에는 너무 중대한 결정
결정을 실제 그대로 구성하라. 되돌릴 수 없다. 단 한 번의 시도다. 살아 있는 모든 사람과 앞으로 올 모든 사람에게 걸려 있다. 깊은 불확실성 속에서, 경쟁 속도에 맞춰, 서둘러 진행하는 데서 가치가 좌우되는 소수 기업에 의해 이루어진다. 사회는 그런 형태의 결정에 대해 오래된 답을 가지고 있다. 서두르는 데서 이익을 얻는 사람들에게서 결정을 빼앗는 것이다. 핵 실험은 자유로운 행동을 원하는 장군들의 반대에도 국제적 제한 아래 들어갔다. 두 가지 전체 무기 범주는 생물학적 그리고 화학무기 협약. 그 Montreal Protocol 오존층을 먹어치우는 화학물질을 퇴출시켰으며, 제조사들은 대체재가 불가능하다고 항의했다. 모든 경우에서 위험을 초래한 사람들은 마지막에 자원했고, 다른 모든 사람들은 그 위험이 자신들만의 책임이 아니라고 결정했다.
재단의 주장: 재앙이 확실하다고 말하는 것이 아니라(그렇지 않습니다), 어떤 기업도 어떤 국가도 우리 모두를 대신해 이 회전실을 돌릴 자격이 없으며, 위험 규모에 맞춰 만들어진 유일한 도구는 구속력 있는 국제법, 폭풍 후가 아니라 폭풍 전에 검증되고, 시행되며, 자리에 있어야 합니다.
멸종은 누구도 감수할 권리가 없는 위험입니다.
사고실험에 대한 마지막 말. 당신은 거부권을 한 번도 쓰지 않았다. 이사회 연서명까지 된 그 서류는 여섯 주 동안 서랍에 있었고, 이유는 정확히 안다. 자기 연구소의 실험을 거부하면 같은 실험이 14주 뒤 다른 건물에서, 아무도 당신의 서한에 서명하지 않은 채 진행될 뿐이다. 작동하는 거부권은 모든 건물을 한 번에 막아야 하며, 그런 스위치는 존재하지 않는다. 조약이 바로 그것이다.
- 이름 붙일 수 있는 거의 모든 안전 기관(충돌 시험, 임상 시험, 건축 규정, 조종석 체크리스트)은 누군가가 먼저 대가를 치른 교훈입니다. 이 방법은 지금보다 더 많은 신뢰를 받을 자격이 있으며 그 두 가지 전제 조건에 대한 정직한 독해입니다.
- 이 패턴은 일반적입니다. 자신보다 덜 유능한 시스템을 관리하며 배운 것은 더 유능한 시스템으로 자동으로 이전되지 않습니다. 그것이 전혀 이전되는지 여부가 바로 미해결 질문 전체입니다.
- 실패 양상에는 이름이 있다. 바로 기만 정렬이다. 이 용어가 존재한다는 사실은 해당 분야가 이를 실재로 본다는 뜻이다. 아직 시험이 없다는 사실은 나머지를 말해 준다.
- 스위치는 어쨌든 만들어두십시오. 비용이 적게 들고, 초지능에 이르지 못한 실패 양식에서도 제 역할을 할 수 있습니다. 다만 스위치가 진짜로 중요한 순간에 어느 쪽이 우위를 점하는지는 솔직하게 말하십시오.
- 현재 설명은 네 번째 선택지, 즉 경쟁이다. 각 서명국은 혼자 중단해도 누가 먼저 끝내느냐만 바뀔 뿐이라고 믿는다. 그들이 옳을 수도 있으며, 이는 해결책이 모두를 동시에 구속해야 한다는 가장 강력한 근거다. 개인의 양심도, 단일 정부도 할 수 없다.