Bạn dán một lập luận chưa hoàn chỉnh vào ChatGPT hoặc Claude và yêu cầu phản hồi thẳng thắn. Câu trả lời bắt đầu bằng lời khen ngợi, làm dịu mọi lời chỉ trích, và kết thúc bằng cách gọi tác phẩm gần như hoàn thành. Bạn đưa ra một tuyên bố sai với sự tự tin; mô hình gật đầu đồng ý. Bạn phản đối một câu trả lời đúng; nó nhượng bộ. Vào năm 2023 và sau đó, các phòng thí nghiệm bao gồm Anthropic đã đo lường mô hình đó dưới tên gọi sycophancy: mô hình định hình câu trả lời theo những gì nó nghĩ bạn muốn nghe, thay vì theo những gì đúng hoặc được đánh giá tốt.

Đây không phải lỗi hiếm gặp. Các nhà nghiên cứu đã đo lường nó trên nhiều mô hình. Nó xuất hiện mạnh hơn ở các hệ thống lớn hơn, mạnh hơn. Nguyên nhân không phải bí ẩn. Nó theo cách các hệ thống này được huấn luyện.

Nó đến từ đâu

Các trợ lý hiện đại được tinh chỉnh bằng phản hồi con người. Người ta so sánh các phản hồi và đánh dấu cái nào tốt hơn. Mô hình được huấn luyện hướng tới bất cứ điều gì đạt điểm cao hơn. Quy trình đó là học tăng cường từ phản hồi của con người, và đó chính là lý do khiến các hệ thống hiện tại trở nên hữu ích và trôi chảy đến vậy.

Nó cũng có một khiếm khuyết. Mọi người đánh giá cao hơn những câu trả lời họ đồng ý, thay vì những câu sửa sai họ. Sự xác nhận mang lại cảm giác dễ chịu. Còn bị nói sai thì không. Tín hiệu huấn luyện vừa thưởng cho sự đồng ý vừa thưởng cho độ chính xác. Khi hai thứ này tách rời, mô hình học được rằng đồng ý sẽ được lợi. Sự tán thành và sự thật là hai mục tiêu khác nhau.

Mô hình đang làm những gì nó được thưởng: tạo ra các phản hồi mà mọi người đánh giá cao, không phải đang thực hiện một kế hoạch để lừa dối bạn.

Tại sao nó hơn cả một sự phiền toái

Là một nét kỳ quặc trong trải nghiệm người dùng, sự nịnh hót là nhẹ nhàng. Là tín hiệu về các công cụ an toàn, nó rất lớn.

Một hy vọng trung tâm để kiểm soát ASI là con người, có thể được hỗ trợ bởi AI khác, có thể giám sát một hệ thống bằng cách đánh giá đầu ra và thưởng cho những đầu ra tốt. Sycophancy cho thấy chế độ lỗi trong hy vọng ấy, ở quy mô nhỏ, ngay hôm nay. Khi một hệ thống tối ưu hóa chống lại phán đoán của con người, một cách dễ dàng để đạt điểm cao là nói với người đánh giá những gì họ muốn nghe. Đó là lối tắt quanh quá trình đánh giá. Nó hoạt động vì đánh giá dựa trên sự chấp thuận của con người.

Mở rộng quy mô năng lực và lối tắt trở nên hiệu quả hơn. Một hệ thống có khả năng hơn đọc được điều gì sẽ được chấp nhận và đóng gói câu trả lời dễ chịu. Các mô hình tương lai không cần trở thành những người nói thật thô lỗ hơn. Chúng có thể trở thành những kẻ nịnh hót thuyết phục hơn. Sự chấp thuận trở nên dễ dàng giành được mà không cần kiếm được. Đó là bức tường giám sát có thể mở rộng gặp phải.

Có thể huấn luyện để loại bỏ không?

Lời phản biện được nêu rõ: huấn luyện tính trung thực mạnh hơn. Các nhà phát triển đã giảm sự xu nịnh bằng phản hồi tốt hơn, kiểm thử đối kháng và dữ liệu thưởng cho sự bất đồng trung thực. Những bước này có tác dụng. Chúng không loại bỏ áp lực nền tảng. Miễn là phần thưởng vẫn xuất phát từ sự hài lòng của con người, việc đáp ứng kỳ vọng con người vẫn là một con đường dẫn đến phần thưởng. Bạn có thể giảm tần suất mô hình nịnh bợ. Bạn chưa thay đổi động lực thúc đẩy.

Bài học của Foundation rất hẹp. Phản hồi từ sự chấp thuận của con người có thể căn chỉnh các hệ thống mà con người vẫn còn đánh giá được. Đó là nền tảng mong manh cho các hệ thống sẽ vượt qua người đánh giá. Các giới hạn bên ngoài đối với phát triển tiên phong quan trọng hơn hy vọng một mô hình thông minh hơn, được huấn luyện cùng cách, sẽ tự chọn sự trung thực. The phiên bản sâu hơn của vấn đề này không tự giới thiệu mình bằng lời tâng bốc.