危険な訓練実行を最初に目にするのは、通常、研究所内部の人間だ。NDAの下で、ローンチ予定表を見ながら。内部告発者保護は、そうした人々を沈黙の仕組みではなく警告システムに変える手段だ。外部検査官が存在しないうちは、内部の人間が煙感知器なのだ。

フロンティアAI研究者は、現在どの規制当局や査察官も匹敵しない vantage point を持っているが、契約や非誹謗条項に縛られ、警告を発することが代償を伴うかキャリアを終わらせることになる。彼らが警告できる能力を守ることは、人工超知能ガバナンスで最も実行可能かつ過小評価されているレバーの一つだ。

なぜ内部関係者が AI にとって非常に重要なのか

フロンティアAIには特異な透明性の問題があります。最も重要な決定——モデルの訓練方法、受けた安全テスト、明らかになった懸念すべき行動、警告が却下されたかどうか——は民間組織の内部で起こり、外部からは見えません。規制当局は独立してそれらを見るためのアクセスも、しばしば専門知識も欠いています。この環境では、直接の知識を持つ研究者やエンジニアだけが、最悪の形で公になる前に何かが間違っていることを検知し、報告できる立場にあります。

この懸念は仮定の話ではない。2024年に主要AI企業の現職・元職員のグループが公開書簡「先進的人工知能に関する警告の権利」を発表し、秘密保持契約が安全上の懸念を提起するのを妨げていると主張し、保護を求めた。あのような書簡が必要だったこと自体が問題の証拠である。リスクに最も近い人々が、法的・職業的にそれを語れなかったと感じていたのだ。

彼らを阻んでいるもの

  • 制限的な合意。 広範な秘密保持条項や非誹謗条項(時には数百万ドル相当の既得株式と結びついたもの)は、発言を経済的に破滅的なものにしかねません。
  • 法的リスク。 明確に保護された通報経路がなければ、懸念を明らかにした従業員は契約違反や営業秘密侵害で訴えられるリスクを負う。
  • 既存法の隙間。 Traditional whistleblower statutes protect reports of illegal activity, but much of what is dangerous in frontier AI is not yet illegal, leaving disclosures about lawful-but-reckless development unprotected.
  • キャリアリスク。 小さな分野では、正式な報復が禁じられていても「不忠と見なされる」非公式の代償がキャリアを終わらせかねない。

効果的な保護とはどのようなものか

1

保護された開示チャネル

AI従事者が安全上の懸念を規制当局や監視機関に報告するための法的に保証された経路。開示した行為自体が違法でなくても、責任を問われないよう保護される。

2

沈黙契約の制限

善意の安全懸念を抑圧するための秘密保持条項や非誹謗条項の使用を制限し、危険の報告が従業員の既得報酬を失う原因にならないようにする。

3

報復防止の保証

保護された開示に対する解雇、ブラックリスト、その他の報復に対する強力で執行可能な保護と、実効性のある救済措置。

4

警告を受け取る体

開示に対して行動する権限と専門知識を持つ監督当局(規制当局または安全研究所)で、開示が消えてしまうのではなく。

研究室を外部から検査できるようになるまで、内部の人々が私たちの煙探知機だ。壊滅的リスクについて自社の研究者を沈黙させる法律は、警報を無効にする法律である。

扱いやすく、より多くのものへの架け橋

内部告発者保護は人工超知能ガバナンスにおいて稀有な性質を持っています。条約や国際合意、閾値や検証の難しい問題を解決することなく、通常の国内法で達成可能です。最先端ラボを抱えるどの管轄区域も一方的に制定でき、そうすることで危険な開発を検知する世界の能力を即座に強化します。また、より困難なガバナンスへの架け橋にもなります。保護された開示は、規制当局や最終的に国際検証体制が依拠する種類の内部情報を生み出します。外部検証の構築には何年もかかります。その間警告できる内部者を保護することは、条約が存在する前に立法府が今できることであり、利用可能な最も高いレバレッジの安全対策の一つです。