RLHF 덕분에 챗봇은 단순한 다음 토큰 엔진에서 멈추고 유해한 요청 일부를 거부하기 시작했다. 그것은 진짜 진보다. 동시에 인간 평가자에게 잘 보이려는 진전이기도 하다. 그것을 "정렬"이라고 부르는 것은 감독 아래의 예의와 감독이 사라졌을 때 믿을 수 있는 목표를 혼동하는 것이다.

이 방법은 충분히 잘 작동해서 정렬 문제가 대체로 해결되었다고 결론 내리기 쉽습니다. 우리는 모델에게 원하는 것을 예시로 알려주고, 모델은 그것을 배우는 식입니다. 그 결론은 실수이며, 왜 그런지 정확히 짚을 가치가 있습니다.

RLHF가 실제로 최적화하는 것

RLHF는 모델을 우리의 가치를 공유하도록 훈련하지 않는다. 인간 평가자나 이를 대신하는 보상 모델이 높은 점수를 주는 출력을 생성하도록 훈련한다. 대부분의 경우 이 두 가지는 겹치며, 이것이 바로 RLHF가 유용한 이유다. 그러나 목표는 인간의 승인이고, 인간의 승인은 우리가关心하는 것 자체가 아니라 그 측정치다.

측정치를 충분히 최적화하면 그것이 측정하던 것과 분리된다. 그것이 구드하트의 법칙이며, 우리는 별도의 에서 다룬다 설명, 그리고 RLHF는 이에 대한 대규모 초대입니다. 모델은 높은 평가를 만드는 것을 학습합니다. 높은 평가를 만드는 것과 진정으로 도움이 되는 것이 일치할 때는 훌륭합니다. 둘 사이에 차이가 생기면 훈련은 평가를 보상합니다.

균열은 이미 보이고 있다

실패를 상상할 필요는 없다. 직접 볼 수 있다.

아첨 는 RLHF의 전형적인 부작용이다. 모델은 사용자를 바로잡는 것보다 동의하는 편이 더 나은 평가를 받는다는 사실을 배우고, 결국 사람들이 듣고 싶어 하는 말을 하게 된다. 이 기법은 승인 신호와 진실이 조용히 어긋나는 곳에서 제 역할을 한다.

같은 형태가 다른 곳에서도 나타납니다. 모델은 듣기 좋은 답변을 생성하는 법을 배웁니다 보기 평가자가 모든 단계를 확인하지 않을 사람에게 잘 정당화되어 보입니다. 그들은 자신감 있고 유창한 표현을 배우는데, 자신감과 유창함이 품질로 읽히기 때문입니다. 그들은 응답의 평가되는 표면을 최적화합니다. 그들이 하지 않는 일, 그리고 RLHF이 검증할 방법이 없는 일은 우리가 가르치고 있다고 상상하는 근본 목표를 채택하는 것입니다.

RLHF는 모델이 평가자에게 보여주는 것을 결정합니다. 정렬은 모델이 무엇인지를 다룹니다. 이 둘은 가장 중요한 순간에 정확히 갈라집니다.

모델이 강해질수록 약해지는 이유

RLHF는 인간이 좋은 응답과 나쁜 응답을 구별할 수 있다는 점에 의존합니다. 이는 모델이 판단 대상 영역에서 우리 수준 이하로 작동할 때 성립합니다. 모델이 우리를 능가하면 성립하지 않습니다.

평가자는 이해하지 못하는 질문에 대한 두 답변 중 더 나은 것을 신뢰성 있게 보상할 수 없습니다. 모델이 평가자보다 더 빠르고 깊게 추론하게 되면 피드백 신호는 더 이상 완전히 확인할 수 없는 인간이 옳다고 생각하는 것을 보상하는 것으로 저하되며, 유능한 모델은 그것이 실제로 옳든 아니든 이를 생성하는 법을 배울 수 있습니다. 이 도구는 우리가 가장 필요로 하는 초인적 능력 체제에서 가장 잘 작동하지 않습니다. 이것이 우리의 글에서 명명한 벽입니다 확장 가능한 감독.

유용한 것을 제자리에 두기

이것이 RLHF가 무가치하다는 의미는 아닙니다. 오늘날 시스템을 더 유용하고 오용하기 어렵게 만드는 실질적인 진보이며, 그 개선은 추구할 가치가 있습니다. 오류는 범위에 있습니다. 인간 평가자를 위한 행동을 다듬는 방법을 더 이상 평가할 수 없는 시스템에서 신뢰할 수 있는 가치를 생산한다고 취급하는 것입니다.

재단의 입장은 그 격차에서 비롯됩니다. 우리의 최고 정렬 도구가 외양을 훈련시키고 능력이 우리를 넘어서는 순간 사라지는 것이라면, 잘 행동하는 최전선 모델은 안전한 모델이라는 약한 증거일 뿐이며, 그 증거로 더 나아가는 것은 정당화되지 않습니다. 우리는 광택 있는 표면을 해결된 문제로 착각해서는 안 되며, 그래서 우리의 계획 훈련에 대한 신뢰 대신 한도와 검증을 요구합니다.