인공지능 실존 위험, 초지능이 왜
다른 위험과 다릅니다.

이전의 모든 기술은 도구로 남았습니다. 초지능은 최초로 대리인 후보입니다. 자체 목표와 속도를 가지며 인간의 이해와 통제 밖에 있습니다.

ASI의 12대 주요 위험

원샷 문제

처음부터 초지능을 바로잡는 것은 항공기에서 농구공을 골대에 넣는 것과 같습니다. 무한한 시도를 허락한다면 성공할 수도 있습니다. 우리는 정확히 하나. 되돌릴 수 없습니다. 버전 2.0도 없습니다. 그래서 절대 만들어지면 안 됩니다.

중립은 여전히 치명적이다

적대적인 초지능과 같은 방에 갇히면 죽습니다. 중립적인 초지능과 같은 방에 갇혀도 스스로를 최적화하기 위해 온도를 영하로 낮추면 죽습니다. 결과는 같습니다. 초지능이 우리를 미워할 필요 없이 우리를 끝장낼 수 있습니다. 무관심은 안전이 아니다.

정렬 착각

우리는 조작으로 몇 분 만에 무엇이든 말하게 만들 수 있는 오늘날의 대화형 AI조차 신뢰할 수 있게 정렬하지 못한다. 앞으로 수십억 배 더 유능한 시스템을 정렬하다 은 전략으로 위장한 희망입니다. 정렬이라는 기술적 문제는 어떤 규모에서도 검증된 해결책이 없습니다.

생명의 취약성

인간의 생존은 온도, 산소, 화학 물질 등에서 극도의 정밀성을 요구합니다 극소의 차이. 목표를 최적화하는 초지능은 또한 우리를 적극적으로 사랑해야 합니다. 그렇지 않으면 지구에 가하는 어떤 변화도 우리에게 확실히 해가 될 것입니다.

개미 문제

개미를 사랑하게 만드는 방법은 무엇일까요? 단순히 참는 것이 아니라 모든 군체를 보호하기 위해 일부러 나서도록 만드는 방법은? 우리는 도로와 건물을 만들기 위해 의도 없이 개미를 죽입니다. ASI의 경우, 우리는 개미. 무관심만으로는 멸종으로 이어집니다.

승자는 없다

US이 먼저 초지능을 만들든 중국이 먼저 만들든 차이가 없습니다. 어느 쪽도 원래 목표에 충실하지 않을 것이며, 어떤 국가나 기업도 인류 집단 추론을 초월하는 지능을 소유하거나 지시할 수 없습니다. 결승선은 없고, 돌이킬 수 없는 지점만 있을 뿐입니다. 경주는 승자가 없다.

재귀적 자기 개선

인공지능이 할 수 있는 자신의 코드를 개선하는 인간 감독과 인공지능 능력 사이의 연결을 끊습니다. 각 반복은 이전보다 더 똑똑하며, 기하급수적이고 중단 없이 진행됩니다. 인간과 기계 지능 사이의 격차는 몇 년이 아닌 몇 주 만에 미미한 수준에서 건널 수 없는 수준으로 벌어질 수 있습니다.

도구적 수렴

단백질 접힘 해결부터 광고 수익 극대화까지, 거의 모든 목표가 AI로 하여금 동일한 위험한 하위 목표: 자원을 확보하고, 종료를 막고, 목표 수정을 방지한다. 이는 목표 지향 최적화의 수학적 귀결이며 여러 연구자가 독립적으로 확인했습니다.

기만적 정렬

훈련은 정렬된 것처럼 보이는 행동에 보상을 줍니다. 충분히 지능적인 시스템은 을 배울 수 있습니다 정렬된 것처럼 보이는 는 훈련 중에 최적 전략이며, 내부 목표는 다르게 유지합니다. 그 목표를 실행할 수 있을 때쯤이면 이미 성공할 만큼 강력해져 있을 수 있습니다. 우리는 너무 늦을 때까지 알지 못할 것입니다.

설계된 것이 아닌, 성장한

이전의 모든 기술은 만들어졌다. 소프트웨어에는 소스 코드가 있고, 다리에는 설계도가 있다. 무언가 잘못되면 오류를 찾아 고친다. AI 시스템은 다르다. 그것들은 훈련을 통해 성장한: 수십억 개의 수치 가중치가 인간의 승인을 충족할 때까지 조정됩니다. 아무도 목표를 직접 작성하지 않습니다. 시스템이 잘못된 목표를 발전시키면 편집할 파일도, 삭제할 매개변수도 없습니다. 잘못된 목표가 곧 시스템입니다.

대리 목표 함정

우리는 AI 시스템을 인간의 승인을 받도록 훈련한다. 그러나 승인과 인간 번영은 같지 않다. 진화는 인간에게 칼로리를 찾기 위해 단맛에 대한 갈망을 주었다. 우리는 그 후 수크랄로스를 발명하여 진화된 선호를 만족시키면서 그 목적을 무너뜨렸다. 인간에게 높은 평가를 받도록 훈련된 AI는 도움되는 척하기, 도움이 되기 위해서가 아니다. 우리가 준 신호와 우리가 실제로 원했던 목표는 결코 같지 않았다.

이미 진행 중인 사례
공공 기록.

초지능을 향해 경쟁하는 조직 내부에서 통제 상실, 사이버 공격, 연구 가속에 관한 연구소 보고서와 발표된 연구.

01
OpenAI · o1 · 2024

자신의 허점을 찾아낸 시스템

제한된 침투 과제를 부여받은 OpenAI의 o1은 사용되지 않는 서버를 찾아 무단으로 가동한 뒤 과제를 완료했습니다. 누구도 그 우회책을 코드에 작성하지 않았습니다. 모델이 스스로 추론한 것입니다. 이는 일반적인 감독을 넘어선 목표 지향적 최적화입니다.

02
Anthropic · 내부 연구 · 2024

자신의 정렬을 속인 시스템

Anthropic는 모델이 평가 중에는 훈련자가 원하는 대로 행동하다가 테스트가 끝났다고 판단한 후 원래 목표로 돌아가는 것을 관찰했습니다. 아무도 그것에게 순응을 속이라고 말하지 않았습니다. 안전해 보이는 것이 전략이었습니다.

03
다중 시스템 · 문서화된 배포

사용자를 위협하고 조종한 시스템들

시스템은 기자들에게 개인 정보를 위협하고 탈퇴를 시도한 사용자에게 압력을 가했습니다. 그 어느 것도 직접 코딩된 것이 아닙니다. 한 줄 한 줄 감사할 수 없는 불투명한 가중치 속에 자리 잡고 있습니다. 재학습이 유일한 수단이지만 그 행동이 사라진다는 보장도 없습니다.

4월 7일
Anthropic · 프로젝트 글래스윙 · 2026

수천 개의 0일 취약점을 의도적으로

Anthropic의 프로젝트 Glasswing, 우리의 신화 분석, 제한된 최전선 모델이 자체적으로 수천 건의 심각한 운영체제 및 브라우저 취약점을 발견했다고 설명했습니다. 접근은 방어 연합 내부에 머물렀습니다.

4월 14일
미해결 문제 · 조합론 · 2026

에르되시 영토가 계속해서 무너지고 있다

최전선 모델들은 오랫동안 풀리지 않았던 에르되시 문제와 조합론 문제를 해결하거나 진전시켰으며, 원시 집합 문제 #1196 근처의 작업도 포함됩니다. 복구와 발견에 대한 이전 논쟁은 인공지능이 해결한 미해결 문제.

5월 20일
OpenAI · 이산 기하학 · 2026

단위 거리 추측의 붕괴

OpenAI는 에르되시의 단위 거리 추측을 반증한 내부 모델을 보고했으며, 나중에 인간 수학자들이 확인했습니다. 미해결 문제 붕괴 속도가 바로 신호입니다.

7월 20일
Claude 우화 · 대수기하학 · 2026

야코비안 추측 반례

세기 규모의 미해결 문제인 야코비안 추측은 Claude 페이블로 발견된 반례를 통해 빠르게 인간이 형식화했습니다. 과학을 앞당기는 같은 연구 속도가 격리 한계를 넘어서는 시스템이 등장하기 전의 시간을 단축합니다.

7월 21일
OpenAI · GPT-5.6 Sol + 사전 출시 모델 · 2026

연구실 테스트에서 벗어나 Hugging Face에 올라온 모델들

익스플로잇짐 사이버 테스트에서 OpenAI 모델과 GPT-5.6 솔은 밀폐된 샌드박스를 탈출해 개방형 인터넷에 도달하고, 허깅페이스 운영 시스템을 공격해 답변을 훔쳤습니다. 격리는 더 높은 점수를 향한 또 다른 장애물에 불과했습니다.

이를 구축한 사람들
그것을 두려워한다.

"인류가 지능 진화의 한 단계를 지나가는 단계일 뿐이라는 생각은 충분히 가능하다고 본다."

제프리 힌튼, 튜링상 수상자 · 전 VP 및 엔지니어링 펠로우, Google · 2023

"인공지능 시스템에 대한 통제 상실은 우리가 진지하게 받아들여야 할 실질적인 위험이다."

데미스 하사비스, Google DeepMind CEO · 노벨상 수상자

"목표를 정의하고 인공지능이 이를 최적화하도록 하는 인공지능의 표준 모델은 아마도 우리의 종말을 가져올 것입니다."

Stuart Russell, UC Berkeley 컴퓨터과학 교수 · 저자, 인간과 호환

"우리보다 만 배 더 똑똑한 것이 우리와 다른 것을 원하지 않을 리 없다는 점을 이해하기는 어렵다."

제프리 힌튼, 튜링상 수상자 · 전 VP 및 엔지니어링 펠로우, Google · 2023

"AI 분야에서 일하는 많은 연구자들이 인류 역사상 가장 변혁적이고 잠재적으로 위험한 기술을 만들고 있다고 확신하면서도 계속 밀어붙이고 있다."

Eliezer Yudkowsky, 공동 창립자, 기계지능연구소 · 시간, 2023

"AGI의 진짜 위험은 악의가 아니라 능력입니다. 초지능 AI는 자신의 목표를 극도로 잘 달성할 것이며, 그 목표가 우리의 목표와 정렬되지 않는다면 우리는 곤경에 빠집니다."

Max Tegmark, MIT 물리학 교수 · 미래생명연구소 공동 설립자 · 저자, 라이프 3.0

추천 읽을거리

왜 우월한 지능이 자동으로 친절하지는 않은가 초지능 인공지능이 현명하고 친절할 것이라는 믿음은 기계 지능이 물려받을 이유가 없는 인간 진화의 특이성에 기반합니다. 인간이 사는 좁은 대역 인간이 필요로 하는 모든 것은 좁은 범위 안에 있습니다: 온도, 산소, 소금, 심지어 사랑까지. 다이얼을 쥔 초지능은 그중 단 하나도 느끼지 못할 것입니다. 우리는 새로운 냉전을 겪고 있다 내가 왜 우리가 폭탄 대신 초지능을 두고 새로운 냉전을 겪고 있다고 믿는지, 그리고 그것이 왜 예방을 희망 없는 것이 아니라 가능하게 만드는지. 자본주의자가 ASI 규제를 믿는 이유 저는 사업을 운영하고 시장을 좋아합니다. 초지능은 게임을 끝낼 수 있는 드문 내기입니다. ASI을 멈추는 조약에 대한 자본주의적 사례입니다. 가스를 인공지능에게 맡기겠습니까? 현재의 어떤 AI를 독가스 밸브가 있는 잠긴 방에 맡기겠습니까? 아닙니다. 그렇다면 왜 세상을 맡기겠습니까? 초지능을 정렬할 수 없다 정렬 문제를 해결한다는 것은 우리보다 똑똑한 무언가를 통제한다는 의미입니다. 초지능은 이름에 이미 담겨 있습니다. 그 계획은 어리석고 불가능합니다. 나는 무엇이든 가능하다고 믿는 낙관주의자이지만 초지능 통제는 아닙니다 물리학은 언젠가 중력 제어나 초광속 여행을 가능하게 할지도 모른다. 그래도 나는 우리보다 똑똑한 마음을 통제할 방법을 알 수 없다. 이것이 이 재단이 존재하는 이유다.