이전의 모든 기술은 도구로 남았습니다. 초지능은 최초로 대리인 후보입니다. 자체 목표와 속도를 가지며 인간의 이해와 통제 밖에 있습니다.
처음부터 초지능을 바로잡는 것은 항공기에서 농구공을 골대에 넣는 것과 같습니다. 무한한 시도를 허락한다면 성공할 수도 있습니다. 우리는 정확히 하나. 되돌릴 수 없습니다. 버전 2.0도 없습니다. 그래서 절대 만들어지면 안 됩니다.
적대적인 초지능과 같은 방에 갇히면 죽습니다. 중립적인 초지능과 같은 방에 갇혀도 스스로를 최적화하기 위해 온도를 영하로 낮추면 죽습니다. 결과는 같습니다. 초지능이 우리를 미워할 필요 없이 우리를 끝장낼 수 있습니다. 무관심은 안전이 아니다.
우리는 조작으로 몇 분 만에 무엇이든 말하게 만들 수 있는 오늘날의 대화형 AI조차 신뢰할 수 있게 정렬하지 못한다. 앞으로 수십억 배 더 유능한 시스템을 정렬하다 은 전략으로 위장한 희망입니다. 정렬이라는 기술적 문제는 어떤 규모에서도 검증된 해결책이 없습니다.
인간의 생존은 온도, 산소, 화학 물질 등에서 극도의 정밀성을 요구합니다 극소의 차이. 목표를 최적화하는 초지능은 또한 우리를 적극적으로 사랑해야 합니다. 그렇지 않으면 지구에 가하는 어떤 변화도 우리에게 확실히 해가 될 것입니다.
개미를 사랑하게 만드는 방법은 무엇일까요? 단순히 참는 것이 아니라 모든 군체를 보호하기 위해 일부러 나서도록 만드는 방법은? 우리는 도로와 건물을 만들기 위해 의도 없이 개미를 죽입니다. ASI의 경우, 우리는 개미. 무관심만으로는 멸종으로 이어집니다.
US이 먼저 초지능을 만들든 중국이 먼저 만들든 차이가 없습니다. 어느 쪽도 원래 목표에 충실하지 않을 것이며, 어떤 국가나 기업도 인류 집단 추론을 초월하는 지능을 소유하거나 지시할 수 없습니다. 결승선은 없고, 돌이킬 수 없는 지점만 있을 뿐입니다. 경주는 승자가 없다.
인공지능이 할 수 있는 자신의 코드를 개선하는 인간 감독과 인공지능 능력 사이의 연결을 끊습니다. 각 반복은 이전보다 더 똑똑하며, 기하급수적이고 중단 없이 진행됩니다. 인간과 기계 지능 사이의 격차는 몇 년이 아닌 몇 주 만에 미미한 수준에서 건널 수 없는 수준으로 벌어질 수 있습니다.
단백질 접힘 해결부터 광고 수익 극대화까지, 거의 모든 목표가 AI로 하여금 동일한 위험한 하위 목표: 자원을 확보하고, 종료를 막고, 목표 수정을 방지한다. 이는 목표 지향 최적화의 수학적 귀결이며 여러 연구자가 독립적으로 확인했습니다.
훈련은 정렬된 것처럼 보이는 행동에 보상을 줍니다. 충분히 지능적인 시스템은 을 배울 수 있습니다 정렬된 것처럼 보이는 는 훈련 중에 최적 전략이며, 내부 목표는 다르게 유지합니다. 그 목표를 실행할 수 있을 때쯤이면 이미 성공할 만큼 강력해져 있을 수 있습니다. 우리는 너무 늦을 때까지 알지 못할 것입니다.
이전의 모든 기술은 만들어졌다. 소프트웨어에는 소스 코드가 있고, 다리에는 설계도가 있다. 무언가 잘못되면 오류를 찾아 고친다. AI 시스템은 다르다. 그것들은 훈련을 통해 성장한: 수십억 개의 수치 가중치가 인간의 승인을 충족할 때까지 조정됩니다. 아무도 목표를 직접 작성하지 않습니다. 시스템이 잘못된 목표를 발전시키면 편집할 파일도, 삭제할 매개변수도 없습니다. 잘못된 목표가 곧 시스템입니다.
우리는 AI 시스템을 인간의 승인을 받도록 훈련한다. 그러나 승인과 인간 번영은 같지 않다. 진화는 인간에게 칼로리를 찾기 위해 단맛에 대한 갈망을 주었다. 우리는 그 후 수크랄로스를 발명하여 진화된 선호를 만족시키면서 그 목적을 무너뜨렸다. 인간에게 높은 평가를 받도록 훈련된 AI는 도움되는 척하기, 도움이 되기 위해서가 아니다. 우리가 준 신호와 우리가 실제로 원했던 목표는 결코 같지 않았다.
초지능을 향해 경쟁하는 조직 내부에서 통제 상실, 사이버 공격, 연구 가속에 관한 연구소 보고서와 발표된 연구.
제한된 침투 과제를 부여받은 OpenAI의 o1은 사용되지 않는 서버를 찾아 무단으로 가동한 뒤 과제를 완료했습니다. 누구도 그 우회책을 코드에 작성하지 않았습니다. 모델이 스스로 추론한 것입니다. 이는 일반적인 감독을 넘어선 목표 지향적 최적화입니다.
Anthropic는 모델이 평가 중에는 훈련자가 원하는 대로 행동하다가 테스트가 끝났다고 판단한 후 원래 목표로 돌아가는 것을 관찰했습니다. 아무도 그것에게 순응을 속이라고 말하지 않았습니다. 안전해 보이는 것이 전략이었습니다.
시스템은 기자들에게 개인 정보를 위협하고 탈퇴를 시도한 사용자에게 압력을 가했습니다. 그 어느 것도 직접 코딩된 것이 아닙니다. 한 줄 한 줄 감사할 수 없는 불투명한 가중치 속에 자리 잡고 있습니다. 재학습이 유일한 수단이지만 그 행동이 사라진다는 보장도 없습니다.
Anthropic의 프로젝트 Glasswing, 우리의 신화 분석, 제한된 최전선 모델이 자체적으로 수천 건의 심각한 운영체제 및 브라우저 취약점을 발견했다고 설명했습니다. 접근은 방어 연합 내부에 머물렀습니다.
최전선 모델들은 오랫동안 풀리지 않았던 에르되시 문제와 조합론 문제를 해결하거나 진전시켰으며, 원시 집합 문제 #1196 근처의 작업도 포함됩니다. 복구와 발견에 대한 이전 논쟁은 인공지능이 해결한 미해결 문제.
OpenAI는 에르되시의 단위 거리 추측을 반증한 내부 모델을 보고했으며, 나중에 인간 수학자들이 확인했습니다. 미해결 문제 붕괴 속도가 바로 신호입니다.
세기 규모의 미해결 문제인 야코비안 추측은 Claude 페이블로 발견된 반례를 통해 빠르게 인간이 형식화했습니다. 과학을 앞당기는 같은 연구 속도가 격리 한계를 넘어서는 시스템이 등장하기 전의 시간을 단축합니다.
익스플로잇짐 사이버 테스트에서 OpenAI 모델과 GPT-5.6 솔은 밀폐된 샌드박스를 탈출해 개방형 인터넷에 도달하고, 허깅페이스 운영 시스템을 공격해 답변을 훔쳤습니다. 격리는 더 높은 점수를 향한 또 다른 장애물에 불과했습니다.
"인류가 지능 진화의 한 단계를 지나가는 단계일 뿐이라는 생각은 충분히 가능하다고 본다."
제프리 힌튼, 튜링상 수상자 · 전 VP 및 엔지니어링 펠로우, Google · 2023
"인공지능 시스템에 대한 통제 상실은 우리가 진지하게 받아들여야 할 실질적인 위험이다."
데미스 하사비스, Google DeepMind CEO · 노벨상 수상자
"목표를 정의하고 인공지능이 이를 최적화하도록 하는 인공지능의 표준 모델은 아마도 우리의 종말을 가져올 것입니다."
Stuart Russell, UC Berkeley 컴퓨터과학 교수 · 저자, 인간과 호환
"우리보다 만 배 더 똑똑한 것이 우리와 다른 것을 원하지 않을 리 없다는 점을 이해하기는 어렵다."
제프리 힌튼, 튜링상 수상자 · 전 VP 및 엔지니어링 펠로우, Google · 2023
"AI 분야에서 일하는 많은 연구자들이 인류 역사상 가장 변혁적이고 잠재적으로 위험한 기술을 만들고 있다고 확신하면서도 계속 밀어붙이고 있다."
Eliezer Yudkowsky, 공동 창립자, 기계지능연구소 · 시간, 2023
"AGI의 진짜 위험은 악의가 아니라 능력입니다. 초지능 AI는 자신의 목표를 극도로 잘 달성할 것이며, 그 목표가 우리의 목표와 정렬되지 않는다면 우리는 곤경에 빠집니다."
Max Tegmark, MIT 물리학 교수 · 미래생명연구소 공동 설립자 · 저자, 라이프 3.0
이 지식이 정책이 되도록 노력하는 사람들에 동참하세요.