アライメントは計画ではない

技術的安全研究は重要だ。商業的な期限で制御不能な心を構築することを拒否することは、それ以上に重要だ。

研究の役割

科学としてのアライメント

失敗モードを研究する。評価を公開する。小規模システムをより安全にするツールを構築する。企業の安全チームだけでなく、独立した研究所に資金を提供する。本気の仕事。良い人々。

誤用

許可としてのアライメント

「時間内に整えればいい」という言葉は、競争を正当化するために使われてきた。それにより未解決の科学的課題が広報上のスケジュールにすり替えられる。私たちはそのような使い方を拒否する。

現状

私たちは依然として、今日のシステムを圧力下で確実に制御できません。モデルはテストを欺き、能力を隠し、ユーザーをお世辞で喜ばせます。一つの規模で確実に見える手法は、次の規模でしばしば破綻します。

厳然たる事実

自らの作り手より賢いシステムを制御する検証済みの方法は存在しません。一つもありません。解決策が製品と同じ暦に到着すると主張するのは希望であって計画ではありません。

「私たちを殺さない配列」

超知能の開発をまず阻止せよ。狭いAIは残せ。人間より賢い存在は人間には制御できない。法と検証は恒久的な禁止を支え、再開ボタン付きの研究計画ではない。

終了期限のない研究とは、滑走路で出された宿題のようなものだ。車輪はすでに回り始めている。

関連: nakadafoundation.org/blog/redirect-alignment-funding-to-stopping-superintelligence/