인공지능 안전 연구소는 국가 안보와 공공 안전에 대한 위험을 평가하고 최전선 인공지능에 대한 국가의 전문성을 구축하기 위해 설립된 정부 기구입니다. 첫 번째 물결은 2023년 국제 인공지능 정상회담을 중심으로 모였습니다. 연구소들은 이제 서울과 후속 회의에서 추진한 국제 네트워크를 통해 방법과 결과를 공유합니다.
여러 주요 수도가 이제 연구소나 이에 준하는 기관을 운영합니다. 그중 대부분은 여전히 위험한 모델을 보류하도록 명령할 수 없습니다.
이름에 대한 참고: 두 설립 기관은 개명되었다. UK 기구는 2025년 2월 인공지능보안연구소가 되었다. US 연구소는 현재 미국표준기술연구소 산하 인공지능표준혁신센터(CAISI)다. "인공지능 안전 연구소"는 여전히 표준 일반 용어이며, 이 안내서는 전체적으로 그 용어를 사용한다.
수년 동안 최전선 모델을 깊이 이해한 유일한 조직은 그것을 만드는 회사들이었다. 연구소는 정부 안에 독립적인 기술 역량을 두려는 시도로, 공공 당국이 개발자의 브리핑을 최종 결론으로 받아들이는 대신 시스템을 평가할 수 있게 한다.
그들이 실제로 하는 일
그들의 작업은 몇 가지 영역으로 군집화된다.
- 최첨단 모델을 때로는 공개 전에 사이버, 생물학, 자율성 같은 분야에서 위험한 능력을 테스트하며, 그 방법은 능력 평가.
- 위험을 잘 측정하는 것은 아직 해결되지 않은 연구 문제이지 확립된 절차가 아니므로 평가 과학 자체를 발전시킵니다.
- 정부에 조언하여 정책이 실제로 시스템을 검토한 사람들의 의견을 반영하도록 합니다.
- 국제적으로 조율하여 한 국가에서 테스트된 모델을 다른 곳에서 처음부터 다시 만들 필요가 없게 하고, 기준이 수렴하기 시작하게 합니다.
이는 실질적인 제도적 진전이다. 최전선 AI를 이해할 국가 역량을 구축하는 것은 이를 통치하기 위한 전제 조건이다. 평가할 수 없는 것은 규제할 수 없으며, 최근까지 정부는 대체로 그럴 수 없었다.
그들이 대부분 부족한 힘
대부분의 인공지능 안전 연구소는 테스트, 조언, 출판을 할 수 있습니다. 강제할 수 있는 곳은 거의 없습니다. 모델 접근은 종종 연구소 협력에 의존합니다. 결과는 대개 구속하기보다는 정보를 제공합니다. 대부분의 경우 연구소는 위험한 모델을 보류하라고 명령할 수 없습니다. 이 기관들은 위험을 보고 대응을 권고할 수 있습니다. 요구하는 경우는 거의 없습니다.
평가와 권한 사이의 그 격차가 구조적 한계입니다. 심각한 위험을 발견하고 조언만 할 수 있는 연구소는 상업적·경쟁적 압력에 맞서 행동하려는 정부의 의지에 따라 효과가 결정됩니다. 현재 구조의 대부분은 경고 시스템입니다. 경고 시스템은 권력을 가진 누군가가 경보에 응답할 때까지 안전장치가 아닙니다.
기술적 능력만 있으면 정치가 따라올 것이라는 민간의 반론이 있습니다. 권한 없는 능력은 정부가 나쁜 소식을 늦게 듣고 더 늦게 행동하게 만드는 길입니다. 강제 중단을 할 수 없는 시험은 거버넌스가 아니라 거버넌스를 위한 준비일 뿐입니다.
그들이 될 수 있는 것
인공지능 안전 연구소의 지속적인 가치는 이후 구속력 있는 체제를 위해 모으는 자산입니다. 독립적인 기술 역량, 공유 기준, 정부 간 국제 채널이 그것입니다. 그런 의미에서 이 연구소들은 재단이 주장하는 기구의 초기 형태입니다. 재단의 글 참조 국제 모니터링 기구 이것이 어디로 이어질 수 있는지 설명합니다 IPCC 모형 공유된 과학적 평가가 국제 정책을 뒷받침할 수 있음을 보여줍니다.
바뀌어야 할 것은 권한입니다. 평가는 집행과 연결되어야 합니다. 연구소의 승인을 배포 조건으로 만드는 국내 법을 통해서든, 검증된 결과에 실질적인 결과를 부여하는 국제 틀을 통해서든. 이 연구소들에 전문성에 걸맞은 권한을 부여하면, 진지한 거버넌스의 많은 기반이 이미 부분적으로 구축되어 있습니다. 그 전환은 우리의 계획: 법으로 초지능을 저지하고, 공공 평가 역량을 금지와 검증의 대체가 아닌 기반 시설로 삼습니다.