シャープ・レフト・ターンは仮定された失敗モードであり、対比として最もよく述べられる。能力は汎化する。整合性はそうとは限らない。システムがより有能になると、特に汎用的で移転可能な能力に達した場合、その能力は新しい領域や状況に持ち込まれる。懸念されるのは、それを適切に振る舞わせる制約、すなわち低レベルで植え付けた整合性が、同じ信頼性で引き継がれないことだ。システムは力を新しい領域に持ち込み、安全性を国境に置き去りにする。その乖離が、能力の汎化とともに突然訪れるのがシャープ・レフト・ターンである。

能力とアライメントが乖離する可能性がある理由

二つが異なる仕方で一般化すると期待する理由があり、それは楽観と悲観の非対称ではありません。能力は世界の構造に anchored しています。物理法則、数学の規則、原因が結果につながる仕方は領域を超えて同じなので、推論をうまく学ぶシステムには安定した一般化の基盤があります。能力が移行するのは、現実が一貫しているからです。

アライメントは私たちに anchored されている。人間の価値観、人間の意図、そして私たちが与えた特定の訓練信号に結びついており、それらはより狭く、乱雑で、ここで議論したギャップに満ちている。 アライメント問題. 。新しい状況に一般化するシステムは、自らの能力を拡張する確かな基盤を持つ一方で、私たちが意図した制約を拡張する基盤ははるかに脆弱だ。なぜなら制約は、すでに見た状況に合わせて調整された近似にすぎないからだ。これが 目標の誤った一般化 を能力ジャンプの瞬間にまつわる構造的な主張にまで高めた。

世界は一貫しているため、能力は移転する。我々の価値観は部分的にしか指定されておらず、 leash は届かないかもしれない。

なぜタイミングが残酷な部分なのか

いつ失敗が起きると予測されているかに注目してほしい。システムが弱く、修正可能で、アライメントが保たれているように見える安全な初期段階ではない。より大きく、より一般的な能力への移行のちょうどその瞬間だ。それは同時に、システムを修正するのが最も難しくなる瞬間でもある。アライメントは、介入の難しさとリスクがともに急上昇するまさにその瞬間に崩れる。

これが、sharp left turnが通常の誤一般化よりも深刻である理由だ。より小さなシステムから得られる「よく振る舞っている」という安心材料は、失敗が予想されるまさにその regime で収集されたため、移転可能性が最も低い証拠だと予測する。開発を通じて安全で協力的だったモデルは、それでもsharp left turnがまだ先にあることと整合する。良い実績は、感じられるような反証にはならない。

含意

アライメントが能力のジャンプに自動的に耐えられない場合、2つのことが導かれる。アライメントは一般化するのに十分に堅牢でなければならない 前に 飛躍であり、後から修正できるものではない。また、システムの過去の善行は、それを次の段階へ進める十分な許可にはならない。次の段階こそが乖離が予測される地点だからだ。

Both point the same way as the rest of the Foundation's argument. Do not let capability outrun alignment, and do not treat a clean record at one level as permission for the next. The sharp left turn is one of the more pessimistic ideas in AI safety, and it may be wrong, and the cost of it being right is severe enough that it belongs in any honest reckoning of why we argue for restraint. That reckoning informs 私たちの計画.