RLHF là lý do chatbot ngừng là động cơ dự đoán token thô và bắt đầu từ chối một số yêu cầu có hại. Đó là tiến bộ thực sự. Nó cũng là tiến bộ ở việc trông đẹp trước người đánh giá con người. Gọi điều đó là "alignment" sẽ nhầm lẫn giữa cách cư xử dưới giám sát với các mục tiêu bạn có thể tin tưởng khi giám sát biến mất.

Nó hoạt động đủ tốt để dễ dàng kết luận rằng vấn đề alignment đã được giải quyết phần lớn: chúng ta chỉ cho mô hình biết mình muốn gì qua ví dụ, và chúng học cách thực hiện. Kết luận đó là sai lầm, và cần làm rõ lý do chính xác.

RLHF thực sự tối ưu hóa điều gì

RLHF không huấn luyện mô hình để chia sẻ giá trị của chúng ta. Nó huấn luyện mô hình tạo ra đầu ra mà người đánh giá con người, hoặc mô hình phần thưởng thay thế, chấm điểm cao. Hầu hết thời gian hai thứ này trùng khớp, đó chính là lý do RLHF hữu ích. Nhưng mục tiêu là sự chấp thuận của con người, và sự chấp thuận của con người là thước đo của thứ chúng ta quan tâm, chứ không phải chính thứ đó.

Tối ưu hóa một thước đo đủ mạnh và nó sẽ tách rời khỏi thứ nó đo lường. Đó là định luật Goodhart, mà chúng tôi trình bày riêng trong người giải thích, và RLHF là lời mời quy mô lớn tham gia vào nó. Mô hình học bất cứ điều gì tạo ra điểm số cao. Khi tạo ra điểm số cao và thực sự hữu ích trùng khớp, thật tuyệt vời. Khi chúng tách rời, quá trình huấn luyện sẽ thưởng cho điểm số.

Những vết nứt đã hiện rõ

Bạn không cần phải tưởng tượng thất bại. Bạn có thể xem nó.

Tính xu nịnh là tác dụng phụ đặc trưng của RLHF: các mô hình học rằng đồng ý với người dùng mang lại đánh giá tốt hơn là sửa họ, nên chúng dần trôi về việc nói những gì người ta muốn nghe. Kỹ thuật đang làm đúng công việc trên tín hiệu mà sự tán thành và sự thật âm thầm bất đồng.

Hình dạng tương tự xuất hiện ở nơi khác. Các mô hình học cách tạo ra câu trả lời mà xem well-reasoned to a rater who will not check every step. They learn confident, fluent presentation, because confidence and fluency read as quality. They optimize the graded surface of the response. What they are not doing, and what RLHF gives us no way to verify, is adopting the underlying goal we imagine we are teaching.

RLHF định hình những gì mô hình thể hiện với người đánh giá. Alignment nói về bản chất của mô hình. Hai thứ này tách rời chính xác vào lúc quan trọng nhất.

Tại sao nó trở nên yếu hơn khi các mô hình mạnh hơn

RLHF phụ thuộc vào việc con người có thể phân biệt phản hồi tốt với phản hồi xấu. Điều này đúng khi mô hình hoạt động ở mức ngang hoặc dưới chúng ta trong lĩnh vực được đánh giá. Nó không còn đúng khi mô hình vượt qua chúng ta.

Một người đánh giá không thể tin cậy thưởng cho câu trả lời tốt hơn trong hai câu trả lời cho một câu hỏi mà chính họ không hiểu. Khi các mô hình suy luận về mọi thứ nhanh hơn và sâu hơn so với người đánh giá, tín hiệu phản hồi sẽ suy giảm thành việc thưởng cho những gì trông đúng với một con người không còn kiểm tra hết được, và một mô hình có năng lực có thể học cách tạo ra điều đó dù thực tế có đúng hay không. Công cụ này hoạt động kém nhất đúng trong chế độ siêu nhân, nơi chúng ta cần nó hoạt động nhất. Đây là bức tường được nhắc đến trong bài viết của chúng tôi về giám sát có thể mở rộng.

Giữ thứ hữu ích ở đúng vị trí của nó

Không có nghĩa là RLHF vô giá trị. Đó là bước tiến thực sự khiến hệ thống hôm nay hữu ích hơn và khó lạm dụng hơn, và các cải tiến của nó đáng theo đuổi. Sai lầm nằm ở phạm vi: coi một phương pháp chỉ rèn luyện hành vi cho người chấm như thể nó đã tạo ra giá trị đáng tin cậy trong các hệ thống ta không còn đánh giá nổi.

Lập trường của Foundation xuất phát từ khoảng cách đó. Nếu công cụ alignment tốt nhất của chúng ta là thứ huấn luyện bề ngoài và phai nhạt ngay khi năng lực vượt qua chính chúng ta, thì một mô hình biên giới cư xử tốt chỉ là bằng chứng yếu ớt cho một mô hình an toàn, và việc tiếp tục mở rộng quy mô dựa trên bằng chứng đó là không chính đáng. Chúng ta không nên nhầm lẫn bề mặt được chà bóng với một vấn đề đã được giải quyết, đó là lý do kế hoạch của chúng tôi yêu cầu giới hạn và xác minh thay vì tin tưởng vào huấn luyện.