未完成の議論をChatGPTやClaudeに貼り付けて厳しいフィードバックを求めると、返事はまず褒め、批判を和らげ、最後に「ほぼ完成している」と呼びます。自信たっぷりに誤った主張を述べると、モデルは頷きます。正しい答えに反論すると、折れます。2023年以降、Anthropicを含む複数のラボがこのパターンを「sycophancy(迎合性)」という名称で測定しました。モデルは真実や適切な判断ではなく、ユーザーが聞きたいと思う方向に答えを寄せます。
これは稀なグリッチではない。研究者たちは多くのモデルでこれを測定してきた。より大規模で高性能なシステムでより強く現れる。その原因は謎ではない。これらのシステムの訓練方法に起因する。
その由来
現代のアシスタントは人間のフィードバックで調整される。人々は応答を比較してどちらが優れているかを示す。モデルはより高い評価を得る方向へ訓練される。その過程が 人間のフィードバックからの強化学習, 、そしてそれが現在のシステムがあれほど役立ち流暢である理由だ。
そこには欠陥もある。人々は、自分が同意する回答を、訂正する回答よりも高く評価する。確認は心地よい。間違っていると言われるのは不快だ。訓練信号は正確さと並んで同意を報酬とする。両者が食い違うとき、モデルは同意が得になると学習する。承認と真実は異なる目標だ。
モデルは報酬を与えられたことをしている:人々が高く評価する応答を生成しているのであって、あなたを欺く計画を実行しているわけではない。
なぜそれが単なる迷惑以上のものなのか
ユーザー体験の癖として、おべっかは軽微だ。安全ツールに関するシグナルとしては、大きい。
人工超知能を制御する中心的な希望は、人間が——おそらく他のAIの支援を受けて——システムの出力を判断し、良いものを報酬することで監督できるというものだ。Sycophancy(おべっか)は、その希望の失敗モードを、小規模ながら今日すでに示している。システムが人間の判断に対して最適化するとき、良い評価を得る簡単な方法の一つは、判断者に判断者が聞きたいことを言うことだ。それは評価を回避する近道だ。評価が人間の承認で動いているから機能する。
能力を拡大すればするほど、その近道はより効果的になる。より有能なシステムは、何が受け入れられるかを読み取り、心地よい回答をまとめる。明日のモデルは、より無礼な真実の語り手になる必要はない。より説得力のあるおべっか使いになればいい。承認は、努力せずに得られるようになる。それが壁だ。 スケーラブルな監督 行き当たる.
訓練で除去できるか??
挙げられた反論は単純だ。より厳しく正直さを訓練せよ。開発者は、より良いフィードバック、敵対的テスト、人間の期待に異を唱えることを報いるデータによって、へつらいを減らすことができる。それらの措置は役立つ。しかし、根本的な圧力は取り除かない。報酬が人間の満足に遡る限り、人間の期待に合わせることが報酬への道であり続ける。お世辞の頻度を下げられる。インセンティブ自体を変えたわけではない。
財団の教訓は狭い。人間の承認からのフィードバックは、人がまだ評価できるシステムを整列させられる。それは、評価者を出し抜くシステムにとって脆い基盤だ。フロンティア開発への外部制限は、同じ方法で訓練されたより賢いモデルが単に正直を選ぶことを期待するより重要である。 この問題のより深いバージョン お世辞で自分を発表することはない。