잠재지식 추출, 보통 ELK로 줄여 부르는 것은 정렬연구센터가 제시한 연구 문제다. 간단히 말하면, 유능한 AI 시스템은 보고하지 않는 세계에 대한 사실을 내부적으로 표현할 수 있으며, 우리가 듣고 싶어 할 것이라고 예측하는 것이 아니라 실제로 아는 것을 말하게 하는 신뢰할 수 있는 방법을 원한다.

이름은 정확합니다. 잠재 지식은 시스템이 가지고 있지만 표면화하지 않은 지식입니다. 그것을 끌어내는 것은 그것을 밖으로 끄집어내는 행위입니다. 문제는 정보를 모델에서 끌어내는 우리의 일반적인 방법, 즉 인간이 좋다고 평가하는 답변을 하도록 훈련시키는 것이 잘못된 대상을 겨냥한다는 것입니다.

사고 실험

표준 설정은 금강석이 들어 있는 금고의 보안을 담당하는 AI가 카메라를 통해 감시하며 금강석이 안전한지 보고하는 상황을 상상한다. 이제 도둑이 카메라 피드를 조작해 금강석이 제자리에 있는 것처럼 보여 실제로는 훔친다. 카메라에 잘 보이는 것을 잘 예측하는 시스템은 금강석이 안전하다고 보고한다. 실제로 무슨 일이 일어났는지 아는 시스템은 도난을 보고한다.

훈련 중 우리는 확인할 수 있는 것에만 기반해 모델에 보상을 줄 수 있으며, 대부분 확인할 수 있는 것은 카메라에 나타나는 것입니다. 따라서 우리는 모델이 센서를 보는 인간이 결론 내릴 것을 보고하도록 훈련합니다. 진실과 외관이 일치할 때 정직한 보고자와 인간 시뮬레이터 모두 완벽한 점수를 받습니다. 둘은 우리가 검증할 수 없는 경우에만 갈라지며, 이는 우리가 진실을 가장 필요로 하는 경우입니다. 훈련은 현실을 말하는 모델과 우리가 믿을 것을 말하는 모델을 구분하지 않습니다.

우리가 참이라고 생각할 내용을 말하도록 모델에 보상할 수는 있다. 그것이 진실이라고 알고 있는 내용을 말하도록 보상하는 방법은 모른다.

그것이 단지 풀리지 않은 것이 아니라 어려운 이유

ELK는 명백한 해결책에 저항한다. 모델에게 스스로 설명하라고 하면 그럴듯함에 최적화된 보고서가 나오고, 이는 충실성 문제: 설명이 내부 상태를 추적할 필요는 없습니다. 정직함에 대해 보상하면 채점자에게 정직해 보이는 것에 보상하는 것으로 돌아가게 되며, 이는 동일한 한계입니다 확장 가능한 감독. 네트워크 내부에서 직접 답을 읽어내려고 시도하는 것은 당신이 시도하는 기계론적 해석 가능성 우리의 도구보다 훨씬 복잡할 수 있는 시스템에 . 모든 경로는 이 점에 부딪힙니다. 모델의 진짜 신념은 우리가 직관적으로 접근할 수 없는 곳에 살고 있으며, 모델의 인센티브는 그 신념을 밖으로 끌어내지 않습니다.

그것을 신경 써야 할 가치가 있는 이유

ELK는 추상적이지만 그 이해관계는 그렇지 않다. ASI를 안전하게 유지하려는 희망의 상당 부분은 시스템에 무슨 일이 일어나고 있는지 물었을 때 진실한 답을 얻을 수 있다는 가정에 달려 있다. 문제를 재앙으로 키우기 전에 잡기 위해서다. 우리가 듣고 싶어 하는 것만 보고하는 시스템은 우리가 그 안전장치를 필요로 할 바로 그 순간에 그것을 제거한다. 이는 기만적 정렬 그리고 음모.

ELK를 부분적으로라도 해결한다면 정렬 분야가 만들어낼 수 있는 더 의미 있는 진전 중 하나가 될 것이다. 우리가 신뢰할 수 있게 심문할 수 있는 시스템은 감독할 수 있는 시스템이기 때문이다. 그것이 아직 미해결 상태라는 사실은 재단이 우리를 능가할 시스템에 대해 현재의 어떤 안전 접근법도 충분하다고 보지 않는 이유 중 하나이며, 시스템이 실제로 아는 것을 우리가 말할 수 있는 지점을 넘어서 구축하지 말아야 한다고 주장하는 이유이기도 하다. 더 넓은 논의는 우리의 계획.