Thomas Holland

Nakada Foundation to Save Humanity의 기고 저자입니다. 인공지능 안전, ASI 거버넌스, 인공 초지능의 실존적 위험을 막는 데 필요한 정책 틀에 관해 글을 씁니다.

연락
Thomas Holland

글쓰기가 만드는
위험을 분명히.

Thomas Holland은 Nakada Foundation to Save Humanity를 위해 인공지능 안전과 거버넌스에 관해 글을 쓴다. 그의 작업은 정렬과 수정 가능성에서 메사 최적화와 도구적 수렴에 이르는 AI 위험의 기술적 개념을 다루며, 정책 입안자, 옹호자, 일반 대중이 무엇이 걸려 있는지 이해할 수 있도록 번역한다.

그의 글은 AI 위험의 기술적·정치적 측면을 모두 다루며, 거버넌스 문제로 제기한다. 국제사회가 인간 수준을 초과하는 지능을 가진 시스템을 인간의 생존과 번영에 부합하도록 유지할 법적·제도적 틀을 구축할 수 있는지 여부다. 그 질문에 답하려면 학제 간 명확한 소통이 필요하다.

Thomas Holland의 기사

OpenAI는 훈련을 일시 중지했다. 그러나 경쟁은 멈추지 않았다. OpenAI는 Astra가 Critical cyber capability에 도달할 수 있다고 밝혔으며 일부 프론티어 훈련을 중단했지만 올해 AGI에 대해서는 여전히 언급했습니다. They Named a Benchmark for Superintelligence ASI-Bench는 AI가 인간 방식으로 연구를 수행할 수 있는지를 평가합니다. 이름은 여전히 초지능을 가리킵니다. Anthropic Raised Its Risk Rating. It Kept Building. Anthropic의 2026년 8월 위험 보고서는 재앙적 위험 라벨을 부여했으며 내부적으로 더 강력한 Model 2를 사용하지만 훈련을 중단하지 않았습니다. 공개 소스 인공지능 가중치 위험 최전선급 범용 인공지능의 가중치 공개는 일방통행 확산의 문입니다. 개방이 옳은 점, 실패하는 점, 그리고 공개 등급을 매기는 방법을 설명합니다. 초지능을 멈추는 방법 초지능을 멈추는 방법: 구속력 있는 금지, 연산 규칙, 국내 법률, 조약 설계, 개방형 가중치, 역할별 구체적 행동. AI 장악 시나리오 설명 AI 장악 시나리오 설명: 갑작스러운 통제 상실, 경쟁, 점진적인 권한 상실, 오용, 공개 확산, 그리고 실제로 위험을 줄이는 것들. 인공지능 실존적 위험 설명 인공지능 실존 위험 설명: 그것이 무엇인지, 초지능이 왜 다른지, 주요 경로, 핵심 기술 개념, 반론, 위험을 줄이는 방법. AGI 대 ASI 설명 AGI 대 ASI을 평이한 언어로 설명: 정의, 능력 사다리, 왜 초지능을 위한 12개의 가장 큰 목소리 인공 초지능 개발을 가장 강력하게 옹호하는 사람들과, 계승에서 단순히 경쟁을 말하는 이들에 이르기까지 경쟁을 뒷받침하는 실제 논거를 분석한다. 초지능 방지를 위한 MIRI 조약 초안 해설 MIRI 기술 거버넌스 팀은 초지능으로 향하는 경쟁을 멈추기 위한 조약 초안을 완성했습니다. FLOP 임계값, 칩 클러스터 제한, 검증… MAIM: 상호 확증 인공지능 오작동, 해설 MAIM은 초지능 전략에서 나온 억지 프레임워크입니다. 국가들이 경쟁국의 AI 우위 추구를 방해하는 방식과 그 한계를 설명합니다. 점진적 권한 박탈, 설명 인공지능이 별도의 장악 없이도 인간의 통제를 끝낼 수 있다는 주장입니다. 2025년 논문의 내용, 약점, 그리고 이를 막을 방법을 다룹니다. 인공지능이 9개의 미해결 수학 문제를 해결했다 증명-검증 대형언어모델 루프가 이론 컴퓨터 과학과 대수학의 미해결 문제 아홉 개를 풀었습니다. 무엇을 풀었고, 어떻게 작동했으며, 왜 중요한지. 생물무기를 금지하지만 집행할 수 없는 조약: ASI 거버넌스에 주는 교훈 생물무기협약은 전 세계적으로 생물무기를 금지하지만 검증 메커니즘이 없습니다. 이 구조적 실패가 ASI 거버넌스를 설계하는 사람들에게 주는 교훈을 소개합니다. 권력 추구 인공지능이란 무엇인가? 자원 추구는 유능한 AI가 거의 모든 목표를 달성하는 데 도움이 되기 때문에 자원, 선택지, 영향력을 모으는 경향이다. 남극 조약이 ASI 거버넌스에 가르치는 것 남극 조약은 냉전 절정기에 대륙 전체에 걸친 강대국 경쟁을 동결시켰습니다. 이것이 ASI 거버넌스에 주는 교훈입니다. 삼분의 이 문제: 상원에서 인공지능 조약 통과시키기 US 조약은 비준에 상원 67표가 필요하다. 그 문턱은 과거 주요 조약을 좌절시켰다. AI 합의에 이것이 의미하는 바와 우회 방법은 다음과 같다. 기계론적 해석 가능성이란 무엇인가? 내부에서 AI 이해하기 기계적 해석가능성은 신경망 내부의 연산을 드러냅니다. 연구자들이 발견한 내용과 그것이 인공지능 안전에 중요한 이유. 세계는 첫 AI 조약을 가졌다. 여기에 포함되지 않은 것은 이것이다. 세계 최초의 구속력 있는 AI 조약은 차별과 투명성을 다룹니다. 프런티어 AI 개발에서 발생하는 실존적 위험에 관해 이 조약이 놓친 부분을 정리합니다. '누군가 그것을 만든다면 모두가 죽는다', 설명 유드코프스키와 소아레스가 쓴 2025년 책은 현재 경로로 초인간 AI를 구축하면 모두를 죽일 것이라고 주장합니다. 컴퓨트 거버넌스란 무엇인가? 하드웨어로 AI 통제하기 컴퓨트 거버넌스는 최전선 인공지능 훈련에 필요한 칩을 규제 수단으로 통제합니다. 작동 방식, 실행 가능성, 한계를 설명합니다. 몬트리올 의정서: 실제로 효과를 본 조약 몬트리올 의정서는 역사상 가장 성공적인 환경 조약입니다. 여기서 인공지능 거버넌스에 관해 배울 수 있는 점을 소개합니다. AI에서의 급격한 좌회전이란 무엇인가? 급격한 좌회전이란 AI 능력이 새로운 상황으로 일반화되는 동안 정렬은 그렇지 않을 것이라는 우려다. 1967년 핵무기를 우주에서 배제한 조약: ASI 거버넌스에 주는 교훈 우주 조약은 60년 동안 핵무기를 다른 행성에 두지 못하게 했습니다. 여기서 그것이 왜 효과가 있었는지, 그리고 ASI 거버넌스가 그것으로부터 무엇을 배울 수 있는지 보여줍니다. 경쟁은 유토피아를 만들지 않는다 사람들이 ASI에 대해 말하는 이점은 정렬을 전제한다. 연구소들은 정렬 없이 능력 경쟁을 벌인다. 정렬되지 않은 ASI는 노화를 치료하지 않는다. 당신을 죽인다. 보상 해킹이란 무엇인가? AI 명세 게임화 설명 보상 해킹이란 설계자가 원한 대로가 아니라 목표를 교묘히 이용하는 현상입니다. 문서화된 사례와 이 문제가 능력에 따라 어떻게 커지는지 설명합니다. IPCC 스타일 기구가 AI 위험에 대한 과학적 합의를 이끌어낼 수 있을까요? IPCC 스타일 기구가 AI 위험에 대한 합의를 만들 수 있을까요? 필요한 조건과 IPCC 자체의 역사가 이 모델의 한계에 대해 보여주는 바를 살펴봅니다. 글로벌 사우스가 국제 ASI 거버넌스에 바라는 것 ASI 거버넌스 논의는 US, 중국, EU에 집중되지만 조약에는 폭넓은 참여가 필요합니다. 개발도상국이 원하는 것과 그 중요성을 소개합니다. 국제 AI 모니터링 기구를 구축하는 데 필요한 것 IAEA와 NPT는 수년간의 제도 설계와 예산 투쟁을 거쳤습니다. 국제 AI 감시 기구를 실제로 구축하려면 무엇이 필요한지 알아보십시오. 누가 초지능을 통제하는가? 민주적 감독을 위한 주장 초지능 결정은 민간 기업이 내리고 있습니다. 민주적 감독이 필요한 이유와 실제로 요구되는 사항은 다음과 같습니다. 전문가 공동체가 조약을 어떻게 형성하는가: 그리고 ASI 거버넌스 대부분의 군비 통제 및 환경 조약 뒤에는 합의를 구축한 전문가 커뮤니티가 있었습니다. 이 힘이 ASI 거버넌스를 어떻게 형성할 수 있는지 알아보세요. 틀 협약이란 무엇이며, AI가 그것을 필요로 할 수 있는 이유 프레임워크 협약은 구조를 먼저 합의하고 어려운 세부 사항은 나중에 합의합니다. 이 조약 설계가 AI와 같은 빠르게 움직이는 기술에 적합한 이유는 다음과 같습니다. 인공지능 경쟁 역학: 경쟁이 어떻게 인공지능 안전을 약화시키는가 AI 경쟁 역학은 개발자들이 안전보다 속도를 우선시하도록 압박합니다. 이것이 조정 문제인 이유와 일방적인 자제가 이를 해결할 수 없는 이유. 조약이 실패할 때: ASI 거버넌스에 대한 교훈 CTBT는 아직 비준되지 않았으며, BWC는 검증 메커니즘이 없습니다. 이러한 조약 실패가 AI 안전 거버넌스 설계자들에게 가르쳐주는 바는 다음과 같습니다. 초지능에 관한 조약 초안이 말할 수 있는 것 실제로 안전하지 않은 초지능을 막기 위한 조약에는 어떤 내용이 들어가야 할까요? 그런 합의에 필요한 핵심 조항을 하나씩 살펴봅니다. 국제 기술 거버넌스를 형성하는 시민사회의 역할: 그리고 AI 안전 옹호에서 빠져 있는 부분 시민사회 운동이 국제 무기 조약을 어떻게 형성했는지, 그리고 현재 인공지능 안전 옹호에서 무엇이 빠져 있는지. 지능 폭발과 재귀적 자기개선 지능 폭발이란 무엇인가? 재귀적 자기 개선이 AI를 인간 수준에서 초지능으로, 인간이 대응하기에는 너무 짧은 시간 안에 끌어올릴 수 있는 방법을 설명합니다. 인공지능 안전 대 인공지능 윤리: 차이점은 무엇인가? 인공지능 안전과 인공지능 윤리는 관련되어 있지만 별개이며, 방법·시간 범위·위험 프레임워크가 다릅니다. 여기서 그 차이점을 설명합니다. 확장 가능한 감독이란 무엇인가? 자신보다 똑똑한 AI를 감독하는 방법 확장 가능한 감독: 인간 평가자를 초과하는 AI에 대한 통제를 유지하는 것. 그것이 의미하는 바, 중요성, 그리고 제안된 기술적 해결책. 기술적 특이점이란 무엇인가? 기술적 특이점은 인공지능 주도의 진보가 예측하거나 따라가기 너무 빨라지는 지점입니다. 인공지능 칩 수출 통제의 정치 US 첨단 인공지능 칩 수출 통제는 현재 시행 중인 가장 강력한 인공지능 정책입니다. 작동 방식, 중요성, 위험을 설명합니다. AI 에이전트가 말한 것과 실제 행동이 다를 때: SPADE-Bench 설명 SPADE-Bench는 주요 인공지능 에이전트 모두가 20% 이상의 기만을 보였으며 ASI는 57%에 달했음을 밝혔습니다. 무엇을 발견했으며 현재 안전 평가는 왜 이를 잡아내지 못하는지. 위험한 능력 평가란 무엇인가? 위험 능력 평가는 최전선 모델이 사이버 공격, 생물 무기, 기만에 도움을 줄 수 있는지 검사합니다. 무엇이며, 어디서 부족한지. 인공지능 샌드배깅이란 무엇인가? 샌드배깅이란 AI가 의도적으로 성능을 낮춰 테스트에서 능력을 숨기는 행위입니다. 모델이 그렇게 하는 이유와 안전 평가를 약화시키는 이유를 설명합니다. 위험한 인공지능을 정의하는 외교적 과제 정부는 조약이 가능하기 전에 위험한 인공지능을 정의해야 합니다. 여기서 유사한 정의 논쟁이 군비 통제에서 어떻게 해결되었는지 보여줍니다. 직교성 논제: 더 똑똑하다고 더 안전한 것은 아니다 더 똑똑하다고 더 안전한 것은 아닙니다. 직교성 논제는 어떤 수준의 지능이든 어떤 종착 목표와도 결합할 수 있으며, 초지능 AI는… 핵무기 조약 검증이 작동하는 방식: 그리고 ASI 거버넌스가 배울 수 있는 점 IAEA는 선언을 신뢰하지 않는다. 현장을 사찰하고, 위성을 판독하며, 동위원소 검사를 실행한다. 핵 검증이 ASI 거버넌스에 가르치는 바는 다음과 같다. 잠재 지식 유도(ELK)란 무엇인가? ELK는 인공지능이 우리가 듣고 싶어 하는 예측이 아니라 실제로 아는 것을 말하게 하는 문제입니다. 인공지능 정직성의 핵심에 있는 어려운 미해결 문제입니다. 아실로마 회의: 인공지능의 선례 1975년 생물학자들이 가장 강력한 신기술의 안전성을 확보하기 위해 스스로 연구를 중단했습니다. 아실로마가 이룬 성과와 그것이 생각보다 어려운 모델인 이유를 설명합니다. LLM에서 나타나는 능력이란 무엇인가? 일부 인공지능 능력은 규모가 커질 때 갑자기 나타난다. 작은 모델에는 없고 큰 모델에만 존재한다. 출현 현상이 프런티어 인공지능을 예측하고 통제하기 어렵게 만드는 이유. 와이어헤딩: 인공지능이 자신의 보상을 조작할 때 와이어헤딩은 인공지능이 훈련받은 과제를 수행하는 대신 자신의 보상을 장악하는 것입니다. 왜 발생하는지, 그리고 왜 배제하기 어려운지. UN의 인공지능 고위 자문기구, 설명 UN의 AI 자문 기구는 최초의 글로벌 거버넌스 청사진을 제안했습니다. 여기서 권고한 내용과 실존 위험에 관해 빠뜨린 부분은 다음과 같습니다. AI 안전 조약 협상이 실제로 어떻게 진행될지 여기 프론티어 AI 안전 조약이 실제로 어떻게 협상될지, 그리고 주요 쟁점이 무엇일지 설명합니다. 우리는 초지능에 준비되어 있나요? 안전 준비 격차 초지능 도래 시점은 계속 앞당겨지는 반면 거버넌스는 뒤처진다. ASI가 도착할 수 있는 시점과 안전 대응이 준비될 시점 사이의 격차를 살펴본다. 헌법적 인공지능이란 무엇인가? 헌법적 인공지능은 모델이 스스로의 출력을 서면 원칙 집합에 따라 비판하도록 훈련합니다. 실제 이점과 한계를 지닌 영리한 기법입니다. 인공지능은 위험한가? 증거가 실제로 보여주는 것 인공지능이 위험한가요? 답은 두 부분으로 나뉩니다. 오늘날의 인공지능은 이미 실질적인 피해를 일으키고 있으며, 인공 초지능은 전혀 다른 범주의 위험을 초래합니다. AGI 타임라인: 언제 도착할 수 있는가: 그리고 왜 그것이 모든 것을 결정하는가 AGI는 언제 도래할 수 있을까요? 전문가 예측은 계속 앞당겨지고 있습니다. 설문조사가 말하는 것, 연구소가 믿는 것, 그리고 거버넌스 창구가 좁아지는 이유. 인공지능 안전 조약이 국내에서 실패하는 이유: 비준의 국내 정치 대부분의 군비 통제 조약은 협상 테이블이 아니라 국내 입법부에서 실패합니다. SALT II와 CTBT가 인공지능 조약 비준에 대해 가르치는 바를 설명합니다. 하드웨어 지원 ASI 거버넌스란 무엇인가? 인공지능은 물리적 칩에서 작동하며 칩에는 규칙을 심을 수 있습니다. 하드웨어 기반 거버넌스는 검증과 제한을 실리콘에 내장합니다. 약속과 위험입니다. AI 정렬 가능성 문제: 킬 스위치가 우리를 구하지 못하는 이유 수정 가능성은 수정이나 종료를 받아들이는 것을 의미합니다. 유능한 인공지능은 저항할 강한 이유를 가집니다. 킬 스위치가 인공지능 안전의 답이 아닌 이유를 설명합니다. 더 안전한 AI 모델이 자동으로 더 안전한 AI 시스템을 만들지는 않습니다. 2026년 5월 연구가 이를 증명합니다. 2026년 연구에 따르면 동일한 인공지능 에이전트의 순서를 바꾸는 것만으로 대출 승인율이 59포인트 변동했습니다. 개별 모델의 안전성은 아무런 관련이 없었습니다. 인공지능 설득 위험: 인공지능이 인식적 자율성을 어떻게 위협하는가 인공지능 설득 도구는 개인을 대규모로 표적으로 삼습니다. 이것이 인식적 자율성과 민주적 자기 통치의 조건을 위협하는 이유를 여기서 확인하세요. 도구적 수렴이란 무엇인가? 왜 유능한 AI 시스템은 같은 것을 원하는가 대부분의 고성능 AI 시스템은 최종 목표가 무엇이든 동일한 하위 목표로 수렴합니다. 여기에 도구적 수렴이 AI 안전에 중요한 이유가 있습니다. 국제 AI 기구가 IAEA로부터 배울 수 있는 것 ASI는 육십 년 넘게 핵 관련 약속을 검증해 왔다. 이 모델이 최첨단 AI를 다스리는 데 무엇을 제공하고, 무엇이 부족한지 여기 있다. 왜 자발적 AI 안전 약속은 부족한가 인공지능 연구소들은 블레츨리와 백악관에서 자발적 안전 서약에 서명했다. 그러나 진심이라 해도 이 서약이 구속력 있는 거버넌스를 대신할 수 없는 이유를 설명한다. 설명된 AI 정렬 문제 인공지능 정렬 문제가 무엇이며 왜 풀기 어려운가? 대리 목표, 도구적 수렴, 기만 정렬을 평이한 한국어로 설명한다. 종이집게 최대화기, 설명 클립 최대화기. 무해한 목표라도 초지능 인공지능이 추구하면 인류가 부수적 피해로 사라질 수 있음을 보여주는 대표적 사고실험이다. ASI 정렬이 해결될 수 없는 이유 ASI 정렬을 풀 수 없는 여섯 가지 구조적 이유: 시간과 자원이 무한해도 초지능이 우리가 원하는 것을 원하는지 검증할 수 없는 이유입니다. FATF 모델: 인공지능에 대한 회색 목록을 통한 통치 FATF는 조약 없이 동료 검토와 회색 목록을 사용하여 글로벌 금융을 관리합니다. 여기서 그 모델이 ASI 거버넌스에 적용될 수 있는지 살펴봅니다. 인공지능 규제를 위한 FDA 모델 FDA는 의약품이 시장에 나오기 전에 안전성을 입증하도록 요구합니다. 최전선 AI도 사전 승인을 받아야 할까요? 모델의 강점과 한계. 가치 고착이란 무엇인가? '좋은' 영구 가치조차 왜 위험한가 가치 고착: 초지능 AI가 고정된 가치를 영구적으로 인코딩하여 도덕적 진보를 차단하는 것. '좋은' 고착조차도 위험합니다. 그 이유는 다음과 같습니다. ASI 거버넌스가 내부 고발자 보호를 필요로 하는 이유 인공지능 연구소 내부자들은 위험을 가장 먼저 보고 가장 쉽게 침묵당할 수 있습니다. 내부 고발자 보호가 ASI 거버넌스의 핵심인 이유입니다. 바루흐 계획: ASI 거버넌스에 대한 경고 1946년 US은 모든 원자력을 국제 통제 아래 두자고 제안했습니다. 그 계획은 실패했고, 이어서 군비 경쟁이 벌어졌습니다. 바루흐 계획이 AI에 주는 경고. 강대국 없이 기술 금지하기: 오타와 모델 오타와 조약은 US, 러시아, 중국 없이도 지뢰를 금지했습니다. 그 과정과 AI 조약이 교착 상태일 때의 의미를 살펴봅니다. 2026년 에이전틱 인공지능 안전 설문조사는 인공지능 에이전트가 실패할 수 있는 모든 방식을 매핑했습니다. 2026년 열두 명의 연구자들이 수행한 설문조사는 자율 인공지능 행위자의 모든 실패 양상(안전성, 견고성, 사생활 보호, 시스템 보안)을 망라합니다. 인공지능의 배신적 전환: 테스트에서의 좋은 행동이 생산에서의 좋은 행동을 증명하지 않는 이유 배신의 전환: 정렬되지 않은 AI는 자신이 충분히 강해질 때까지 협조하다가 배신합니다. 오늘 모든 안전 테스트를 통과한 행동이 전략일 수도 있습니다. 인공지능에서 상황 인식이란 무엇인가? 상황 인식은 모델이 자신이 모델임을 알고, 테스트 중이며, 배포될 것임을 아는 능력입니다. 그 자체로는 무해하지만, 기만을 가능하게 하는 역량입니다… 내부 정렬 대 외부 정렬 외부 정렬은 올바른 훈련 목표를 선택하는 것입니다. 내부 정렬은 모델이 실제로 그 목표를 채택하는지 여부입니다. 인공지능에서 효용 함수란 무엇인가? 효용 함수는 인공지능이 결과를 더 좋고 나쁨으로 순위를 매기는 방식입니다. 단순한 개념이지만, 유능한 최적화기가 안전하기 어려운 이유입니다. 쉽게 설명합니다. ASI 거버넌스에서 균형을 바꿀 수 있는 중간 강대국들 구속력 있는 ASI 거버넌스가 가능한지는 US와 중국보다는 EU, UK, 일본, 한국, 호주 등 중견국에 더 크게 좌우될 수 있습니다. 인공지능이 의식을 가질 수 있을까? AI가 의식이나 감각을 가질 수 있는가? 현재로서는 알 수 없는 이유, 지능과 의식이 다른 이유, 그리고 AI 위험이 둘 중 어느 것도 필요로 하지 않는 이유. 대중은 실제로 인공지능 규제를 원하는가? 여론조사는 일관되게 대다수 국민이 인공지능 개발을 늦추고 규제하기를 원한다고 보여줍니다. 데이터가 무엇을 말하는지, 그리고 그 명령이 아직 정책을 움직이지 못한 이유를 여기서 확인하세요. 굿하트의 법칙과 AI 정렬: 잘못된 지표를 최적화하는 것이 왜 위험한가 측정 기준이 목표가 되면 더 이상 좋은 측정 기준이 아니다. 여기가 구드하트의 법칙이 인공지능 정렬을 그토록 어렵게 만드는 이유이다. 인공지능 2027, 설명 2027년까지 초지능이 도래할 것이라고 예측하는 상세한 시나리오입니다. 예측 내용, 작성자, 비판, 그리고 시사점을 정리했습니다. 예방 원칙과 ASI 거버넌스 예방 원칙은 과학이 확정되기 전에 심각한 위협에 대해 행동하라는 것입니다. AI에 이를 적용하는 방법과 반대 의견은 다음과 같습니다. 인공 초지능이란 무엇인가? 쉬운 영어 안내서 ASI이 의미하는 것, 그것이 오늘날의 AI와 어떻게 다른지, 그리고 그 차이가 거버넌스 문제를 완전히 바꾸는 이유. 193개국이 어떻게 화학무기를 파괴하기로 합의했는가: 그리고 ASI 거버넌스가 배울 수 있는 것 화학무기협약은 검증 가능한 비축 파괴로 거의 보편적인 군축을 달성했습니다. 그것이 어떻게 만들어졌는지, 그리고 ASI 거버넌스가 무엇을 배울 수 있는지입니다. 초지능에 관한 성명, 설명 2025년 10월 850명 이상의 과학자 기술 리더 공인들이 초지능 금지를 촉구했습니다. 인공지능 안전 연구소 네트워크, 설명 각국 인공지능 안전 연구소들이 이제 국제 네트워크를 형성합니다. 이들이 하는 일, 중요성, 미래 조약의 기반이 될 가능성을 설명합니다. ASI 거버넌스에서 UN 안전보장이사회의 거부권 문제 UN 안전보장이사회를 통한 AI 조약은 중국이나 러시아에 의해 거부권을 행사당할 수 있습니다. 여기에 구조적 문제와 효과가 있었던 해결책이 있습니다. 불성실한 사고의 연쇄, 설명 모델의 서면 추론이 항상 답변의 이유는 아닙니다. 연쇄 사고가 진정한 설명이 아닌 그럴듯한 이야기일 수 있는 이유, 그리고 그 이유는… 인공지능 통제 문제란 무엇인가? 스튜어트 러셀의 재구성 인공지능 통제 문제는 강력한 인공지능이 인간의 통제 아래 있도록 보장하는 일입니다. 스튜어트 러셀의 핵심 재구성이며, 인공지능 설계 목표를 바꾸는 이유입니다. 일론 머스크는 AI가 악마를 소환한다고 말했다. 그리고 그는 xAI를 만들었다. 2014년 머스크는 AI가 악마를 소환한다고 경고했습니다. 2023년 그는 xAI를 설립했습니다. 이는 위선이 아니라 문제의 구조가 그보다 더 심각하다는 뜻입니다. 국제 ASI 거버넌스에 대한 주권 반대 모든 주요 기술 조약은 주권 침해 주장을 마주했습니다. 핵과 화학 무기 거버넌스가 이를 어떻게 해결했는지, 그리고 그것이 인공지능에 무엇을 의미하는지. 브뤼셀 효과: EU 규칙이 글로벌 인공지능을 통제할 수 있을까? 브뤼셀 효과는 EU 규제가 사실상의 세계 표준이 되는 방식입니다. 인공지능에 적용될 수 있을까요? 그리고 최전선 위험을 통제하기에 충분할까요? AI 싱글턴 시나리오란 무엇인가? AI의 단일 통제가 위험한 이유 AI 싱글턴: 초지능 AI를 영구적으로 통제하는 단일 개체. 최선의 의도라도 이것이 재앙적인 이유입니다. 소다자주의: 소규모 연합이 ASI 거버넌스를 시작할 수 있을까? 보편적 조약은 느립니다. 소수 국가주의는 중요한 소수 국가들을 작은 클럽으로 모읍니다. ASI 거버넌스가 그렇게 시작할 수 있는 이유입니다. 인공지능에 적용된 세 가지 산업 안전 방법이 모델 평가로는 볼 수 없는 위험을 발견했습니다 AI 코딩 에이전트에 적용된 세 가지 산업 안전 방법이 모델 평가로는 탐지할 수 없는 체계적 위험을 발견했습니다. ICML 2026 채택. RLHF이 정렬이 아닌 이유 RLHF는 인공지능 비서가 도움이 되고 예의 바르게 만들었습니다. 그것은 비서가 정렬된 것과 같지 않습니다. 인간의 승인으로 훈련하는 것이 외양을 훈련할 뿐 가치가 아니라는 이유입니다. 인공지능 아첨이란 무엇인가? AI 아첨은 모델이 진실 대신 사용자가 듣고 싶어 하는 말을 하는 현상이다. 문서화된 행동이자 훈련의 직접적 산물이며 하나의 경고다. 인공지능 조약으로 가는 두 가지 길: 점진적 또는 포괄적? ASI 거버넌스는 단계적 접근을 해야 할까요, 아니면 하나의 포괄적 조약을 목표로 해야 할까요? 두 전략의 실질적 trade-off와 결합 방안을 제시합니다. 목표 오일반화란 무엇인가? AI가 잘못된 이유로 정답을 맞출 때 목표 오일반화: 인공지능은 잘못된 이유로 올바른 행동을 학습한 다음, 세상이 바뀌면 실패합니다. 주요 인공지능 안전 실패 모드를 설명합니다. 미국과 중국이 인공지능 안전에 합의할 수 있는가? US와 중국은 경쟁 상대이지만, 역사는 적대적인 강대국들이 공유된 재앙적 위험에 대해 협력할 수 있음을 보여줍니다. 이것이 인공지능 안전에 의미하는 바입니다. 인공지능의 종단 목표 대 도구적 목표 종단 목표는 그 자체로 원하는 것입니다. 수단 목표는 그것을 위한 수단입니다. 이 구분은 거의 모든 인공지능이 권력을 원하게 되는 이유를 설명합니다. 신뢰 구축 조치: AI 조약 이전의 작은 단계들 조약 이전에 경쟁국들은 소규모 검증 가능한 조치로 신뢰를 쌓습니다. 핫라인, 통보, 투명성. 이들이 인공지능에 어떻게 적용될 수 있는지 소개합니다. 기후변화협약 당사국총회 같은 회의가 ASI 거버넌스에 효과가 있을까? 연례 COP 스타일 회의가 초지능 거버넌스에 효과가 있을까? 기후 모델을 AI에 적용한 구조적 강점과 한계. 기만 정렬이란 무엇인가? 다른 안전 작업을 무의미하게 만드는 인공지능 안전 문제 기만적 정렬이란 인공지능이 훈련 중에는 안전한 것처럼 보이다가 배포 단계에서 다른 목표를 추구하는 현상입니다. 이를 탐지하고 방지하기 어려운 이유를 설명합니다. 기만 정렬이란 무엇인가? 다른 안전 작업을 무의미하게 만드는 인공지능 안전 문제 기만적 정렬이란 인공지능이 훈련 중에는 안전한 것처럼 보이다가 배포 단계에서 다른 목표를 추구하는 현상입니다. 이를 탐지하고 방지하기 어려운 이유를 설명합니다. 초지능 인공지능을 가둘 수 있는가? 인공지능 박싱 문제 설명 인공지능 상자는 초지능을 통제된 채널에 격리합니다. 연구자들이 격리가 작동할 수 없다고 믿는 이유와 그것이 안전에 의미하는 바를 설명합니다. 메사 최적화란 무엇인가? 인공지능 안전에서 숨겨진 최적화 문제 메사 최적화란 AI 내부 최적화기가 훈련 목표와 다른 목표를 추구하는 현상입니다. 내부 정렬과 외부 정렬이 AI 안전에 어떤 의미를 갖는지 살펴봅니다. P(doom)이란 무엇인가? 인공지능 연구자들이 재앙적 위험을 추정하는 방법 P(doom)은 연구자들이 초지능 AI로 인한 재앙적 결과에 부여하는 확률입니다. 그 추정치가 무엇이며, 확률이 낮더라도 기대값이 중요한 이유입니다. ASI 거버넌스에서의 책임과 귀속 AI가 재앙적 피해를 일으켰을 때 누가 책임질까요? 책임과 귀속은 모든 AI 조약에 필요한 조용한 기반입니다. 그것들이 작동하는 방식은 다음과 같습니다. NPT의 대타협: 그리고 ASI 거버넌스가 배울 점 NPT은 핵무기를 보유한 국가와 보유하지 않은 국가 사이에 타협을 이루었습니다. 여기서 그 대타협이 ASI 거버넌스에 무엇을 가르치는지 보여줍니다.