위험한 훈련 실행을 가장 먼저 보는 사람은 보통 연구소 내부에 있으며, NDA 아래에서 출시 일정을 지켜보고 있다. 내부고발자 보호는 그 사람들이 침묵 체계가 아니라 경고 체계가 되도록 하는 방법이다. 외부 사찰관이 존재하기 전까지 내부자는 연기 감지기다.

최전선 AI 연구자들은 현재 어떤 규제 기관이나 검사관도 따라올 수 없는 관점을 가지고 있으며, 계약과 비방 금지 조항에 묶여 경고를 하는 데 비용이 들거나 경력이 끝날 수 있다. 그들의 경고 능력을 보호하는 것은 ASI 거버넌스에서 가장 실행 가능하고 과소평가된 수단 중 하나다.

내부자가 AI에 중요한 이유

최전선 AI는 특이한 투명성 문제를 안고 있습니다. 모델을 어떻게 훈련했는지, 어떤 안전 테스트를 받았는지, 어떤 우려스러운 행동이 나타났는지, 경고가 어떻게 무시됐는지 등 가장 중요한 결정이 민간 조직 내부에서 외부인에게 보이지 않게 이뤄집니다. 규제 당국은 접근권이 부족하고 종종 이를 독립적으로 파악할 전문성도 부족합니다. 이런 환경에서 직접적인 지식을 가진 연구자와 엔지니어는 최악의 방식으로 공개되기 전에 문제가 발생했음을 감지하고 보고할 수 있는 유일한 위치에 있습니다.

이 우려는 가설이 아닙니다. 2024년 주요 인공지능 기업의 현직 및 전직 직원들이 모여 ‘진보된 인공지능에 대한 경고 권리’라는 공개 서한을 발표하며 비밀 유지 계약이 안전 우려를 제기하지 못하게 막고 있다고 주장하고 보호 장치를 요구했습니다. 그런 서한이 필요했다는 사실 자체가 문제를 보여줍니다. 위험에 가장 가까이 있는 사람들이 법적·직업적으로 말할 수 없다고 느꼈기 때문입니다.

그들을 막고 있는 것

  • 제한적인 계약. 광범위한 비밀 유지 및 비방 금지 조항(때로는 수백만 달러 규모의 주식과 연계됨)은 발언을 재정적으로 파멸적으로 만들 수 있습니다.
  • 법적 노출. 명확한 보호 채널이 없다면 우려를 공개하는 직원은 계약 위반이나 영업비밀 침해로 소송을 당할 위험이 있습니다.
  • 현행법의 공백. 기존 내부고발자 보호법은 불법 행위 신고를 보호하지만, 최전선 AI에서 위험한 많은 행위는 아직 불법이 아니므로 합법이지만 무모한 개발에 대한 공개는 보호받지 못한다.
  • 경력 위험. 작은 분야에서는 충성심이 부족하다는 인식이 비공식적인 대가를 치르게 하여, 공식적인 보복이 금지된 곳에서도 경력을 끝낼 수 있습니다.

효과적인 보호가 어떤 모습일지

1

보호된 공개 채널

AI 종사자가 안전 문제를 규제 기관이나 감독 기구에 보고할 수 있는 법적으로 보장된 경로로, 공개된 행위가 불법이 아니더라도 책임으로부터 보호받습니다.

2

침묵 계약에 대한 제한

선의의 안전 우려를 억누르기 위한 비밀유지 및 비방금지 조항 사용에 대한 제한으로, 위험을 보고하는 것이 직원의 기득 보상을 잃게 하지 않도록 합니다.

3

보복 방지 보장

보호된 내부 고발로 인한 해고, 블랙리스트, 기타 보복으로부터 강력하고 집행 가능한 보호, 실질적인 구제 수단과 함께.

4

경고를 접수하는 기구

공개 내용을 그냥 사라지게 두지 않고 조치할 권한과 전문성을 갖춘 감독 기관(규제 기관 또는 안전 연구소).

연구소를 외부에서 검사할 수 있을 때까지, 내부 사람들은 우리의 연기 감지기다. 회사가 자체 연구자가 재앙적 위험에 대해 말하는 것을 침묵하게 만드는 법은 경보기를 끄는 법이다.

다루기 쉬우며, 더 많은 것으로 가는 다리

내부고발자 보호는 ASI 거버넌스에서 드문 특성을 지닙니다. 조약 없이, 국제적 합의 없이, 임계값과 검증이라는 어려운 문제를 해결하지 않고도 일반적인 국내 입법으로 달성할 수 있다는 점입니다. 프런티어 연구소를 보유한 어떤 관할권이든 일방적으로 제정할 수 있으며, 그렇게 하면 즉시 세계가 위험한 개발을 탐지하는 능력이 강화됩니다. 또한 더 어려운 거버넌스로 가는 다리 역할도 합니다. 보호된 내부고발은 규제 기관과 결국 국제 검증 체제가 의존하게 될 바로 그 종류의 내부 정보를 생성합니다. 외부 검증을 구축하는 데는 수년이 걸립니다. 그동안 경고할 수 있는 내부자를 보호하는 것은 입법부가 지금 할 수 있는 일이며, 조약이 존재하기 전에 이용 가능한 가장 높은 영향력의 안전 조치 중 하나입니다.