유럽연합은 2023년 9월 첫 번째 책임 있는 확장 정책을 발표했다. 문서를 열면 수사보다 제목에서 구조가 드러난다. 능력 수준이 미리 명명되어 있고, 각 수준마다 평가 결과가 선을 넘었다고 판단되면 작동하는 안전장치가 짝지어져 있다. 더 엄격한 가중치 보안, 더 엄격한 배포 규칙, 더 깊은 레드팀 검증, 상위 단계에서는 지정된 보호 장치가 마련될 때까지 훈련이나 배포를 하지 않겠다는 서면 약속이 포함된다. 업계에서 흔히 부르는 이름은 RSP이며, 기본 논리는 흔히 if-then 약속이라고 불린다.

선도적인 최전선 연구소들이 가장 잘 알려진 버전을 발표했고, 그 형식이 퍼졌습니다. 계층은 대체로 오늘날과 비슷한 시스템부터 생물무기, 심각한 사이버 공격 또는 위험한 자율성을 의미 있게 지원할 수 있는 모델까지 이어집니다. 이 문서는 비상사태 전에 간단한 질문에 답하기 위한 것입니다. 능력이 상승할 때, 회사는 정확히 무엇을 합니까?

왜 형식이 실제 개선인 이유

일반적인 안전을 진지하게 다지겠다는 약속과 비교해 RSP는 더 구체적입니다. 그것은 능력, 임계값, 대응을 미리 명명하여 분위기를 외부인이 가리킬 수 있는 것으로 바꿉니다. 그것은 예측적입니다. 연구소는 발견의 열기와 보도 주기가 함께 도착하기 전에 위험한 능력이 자신에게 어떤 비용을 치르게 할지 결정해야 합니다.

이 형식은 또한 단어를 테스트에 연결합니다 위험한 능력 평가, 따라서 문턱은 구호가 아니라 실제 운영 의미를 갖습니다. 일부 정책은 안전장치가 능력 향상을 따라가지 못하면 개발을 중단하겠다고 더 나아갑니다. 그 문장을 공개 문서에 넣는 것 자체가 실질적 진전입니다.

이름 붙여진 민간 반대론

RSP를 가장 강하게 옹호하는 주장은 다음과 같습니다. 공개적이고 구체적이며 사전에 약속된 규칙이 산업이 성숙하는 방식이며, 내부 정책이 있기 전에 외부 법을 요구하는 것은 진전을 멈추게 하는 냉소주의라는 것입니다. 이 관점에서 RSP는 최전선 안전의 헌법 초안이며, 저자를 비판하기보다는 더 많은 RSP를 장려하는 것이 올바른 움직임입니다.

사실이며, 그 약점은 여전히 구조적이다. 같은 연구소가 정책을 작성하고, 기준을 정하고, 평가를 수행하며, 선을 넘었는지 판단하고, 안전장치가 충분한지 결정하며, 본문을 수정할 권한까지 보유한다. 상업적 출시 압력이 연구소가 직접 만들고 운영하는 약속과 충돌할 때, 독립된 제3자는 경고를 할 권한이 없다.

역사는 낙관적인 해석을 선호하지 않습니다. 경쟁 압력 하에 자발적인 기업 안전 서약의 기록은, 우리 기사에서 추적한 바와 같이 자발적 약속, 는 물릴 때 약해지는 기준의 기록이다. if-then 규칙은 then만큼만 강하고, then은 그것을 약화시켜 이득을 보는 당사자가 집행한다. 스스로 정하고 측정하며 수정할 수 있는 규칙은 의도의 선언일 뿐 제약이 아니다.

문서 아래에 두 가지 추가 격차가 자리 잡고 있습니다. RSP는 임계값 초과를 알아차리기 위해 평가에 의존하므로 평가를 제한하는 모든 것(포함 능력 숨기기, 미지의 능력, 안전 증명의 어려움은 그에 기반한 정책을 제한한다. 그리고 RSP는 그것을 채택한 연구소만을 구속한다. 거부하는 경쟁자나 이 문화권 밖의 국가 프로그램은 영향을 받지 않는다. 단일 회사가 그 조정 문제를 혼자 해결할 수는 없다.

재단이 그것들을 읽는 방법

좋은 장치를 유지하라. 임계값 논리, if-then 구조, 평가와의 연결을 재사용하라. 누가 펜을 쥐고 누가 중단을 집행하는지를 바꿔라. 그 트리거를 자발적 정책에서 독립 기구와 연산 거버넌스, 따라서 연구소는 한도가 불편해지면 조용히 스스로 한도를 수정할 수 없습니다.

정책을 집행 가능한 규칙의 초안으로 취급한 다음, 연구실 밖에서 작업을 마무리하세요: 구속력 있는 법률, 독립적인 집행, 컴퓨트 통제. 그 전환이 바로 우리의 계획 를 위한.