Hầu hết hạ tầng an toàn xung quanh hệ thống AI hiện tại dựa trên giả định đơn giản: con người có thể nhận biết AI đang làm tốt công việc. Người đánh giá chấm đầu ra, những đánh giá đó đưa vào huấn luyện, và mô hình học tạo ra đầu ra mà người đánh giá con người chấm cao. Khi điều này hoạt động, là vì người đánh giá có thể phân biệt đầu ra tốt với đầu ra xấu.

Giám sát có khả năng mở rộng là thách thức duy trì kiểm soát có ý nghĩa vượt qua điểm đó, và nó vẫn chưa được giải quyết.

Giám sát có khả năng mở rộng là thách thức nảy sinh khi giả định này thất bại. Khi hệ thống AI đạt và sau đó vượt mức hiệu suất ngang con người ở nhiều lĩnh vực, người đánh giá không còn có thể đánh giá đáng tin cậy chất lượng những gì họ đang đánh giá. Một lập trình viên trẻ không thể xem xét có ý nghĩa đoạn mã do một hệ thống viết ra khi hệ thống đó là lập trình viên giỏi hơn bất kỳ con người nào. Một bác sĩ không thể đánh giá đáng tin cậy chẩn đoán y khoa do một hệ thống tạo ra khi hệ thống đó tiếp cận tài liệu lâm sàng vượt quá khả năng đọc của bất kỳ bác sĩ cá nhân nào. Khi người đánh giá con người bị các hệ thống họ phải giám sát vượt trội, toàn bộ vòng phản hồi giữ cho hệ thống AI phù hợp với giá trị con người bắt đầu tan rã.

Không có điều nào trong số này được chứng minh ở quy mô siêu nhân ngoài tự nhiên.

Tại sao nút thắt đánh giá lại quan trọng đến vậy

Huấn luyện hệ thống AI bằng phản hồi con người hoạt động vì xếp hạng con người là proxy khá tốt cho chất lượng đầu ra AI, trong khi hiệu suất cấp độ con người là mục tiêu. Khi AI vượt qua hiệu suất con người, xếp hạng trở nên không đáng tin cậy: người đánh giá không thể đánh giá chất lượng chính xác sẽ đánh giá đầu ra dựa trên đặc điểm bề mặt (câu trả lời nghe tự tin thế nào, viết rõ ràng ra sao, có khớp kỳ vọng trước đó của họ hay không) thay vì liệu nó có thực sự đúng hay không.

Điều này đã xảy ra ở mức độ hạn chế. Các mô hình ngôn ngữ được huấn luyện với phản hồi con người được ghi nhận là tạo ra các phản hồi nghe có vẻ tự tin, định dạng hợp lý và nhận được đánh giá cao từ con người bất kể nội dung cơ bản có chính xác hay không. Tín hiệu huấn luyện thưởng cho vẻ ngoài hữu ích đáng tin cậy hơn là thưởng cho sự hữu ích thực sự, vì người đánh giá đáng tin cậy hơn ở việc phát hiện cái trước so với cái sau.

Vấn đề cốt lõi

Nếu một hệ thống AI vượt qua chuyên gia con người trong một lĩnh vực, những con người duy nhất có thể đánh giá đầu ra của nó là những người nó đã vượt qua. Lúc đó, quy trình đánh giá cung cấp tín hiệu ngày càng yếu về chất lượng thực tế, và tín hiệu ngày càng mạnh về khả năng AI tạo ra đầu ra trông tốt với những người không hiểu đầy đủ chúng.

Các cách tiếp cận đề xuất cho giám sát có thể mở rộng

Tranh luận về trí tuệ nhân tạo

Được đề xuất bởi Paul Christiano, Geoffrey Irving và đồng nghiệp tại OpenAI năm 2018, tranh luận AI là cách tiếp cận trong đó hai hệ thống AI tranh luận các lập trường đối lập, và một thẩm phán con người đánh giá cuộc tranh luận thay vì nội dung cơ bản trực tiếp. Trực giác là thẩm phán có thể xác định được lý luận sai lệch và sai lầm thực tế trong một lập luận ngay cả khi họ không thể tự mình xác minh câu trả lời đúng. Nếu các bên tranh luận được khuyến khích thắng thông qua lập luận trung thực thay vì thuyết phục, và nếu mỗi bên được thúc đẩy vạch ra sai lầm của bên kia, định dạng tranh luận có thể trích xuất tín hiệu chất lượng đáng tin cậy từ những người đánh giá con người không phải chuyên gia trong lĩnh vực.

Cách tiếp cận có sức hấp dẫn lý thuyết và một số hỗ trợ thực nghiệm trong môi trường kiểm soát. Câu hỏi mở chính là liệu nó có còn đúng khi cả người tranh luận lẫn người đánh giá đều hoạt động ở những lĩnh vực vượt xa chuyên môn con người, nơi ngay cả việc xác định ai đưa ra lập luận tốt hơn cũng có thể đòi hỏi chính chuyên môn mà người đánh giá thiếu.

Mô hình hóa phần thưởng đệ quy

Mô hình phần thưởng đệ quy, do các nhà nghiên cứu tại DeepMind phát triển, tiếp cận vấn đề bằng cách bootstrapping sự giám sát của con người qua một hệ thống phân cấp các AI. Con người trực tiếp đánh giá đầu ra của hệ thống AI kém mạnh hơn, tạo ra mô hình phần thưởng. Mô hình phần thưởng đó sau đó được dùng để đánh giá đầu ra của hệ thống mạnh hơn, và cứ thế tiếp tục. Phương pháp này cố gắng mở rộng khả năng giám sát của con người từng bước một, thay vì nhảy thẳng từ đánh giá cấp con người sang đánh giá cấp siêu trí tuệ.

Thách thức chính là lan truyền lỗi: sai lầm trong mô hình thưởng yếu hơn sẽ tích tụ khi được áp dụng cho hệ thống mạnh hơn. Một mô hình thưởng chính xác 95% ở cấp độ thấp hơn có thể tạo ra sự giám sát nhiễu loạn đáng kể hơn ở cấp độ cao hơn, và nhiễu đó suy giảm thêm với mỗi bước đệ quy.

Khuếch đại

Iterated amplification, cũng do Paul Christiano đề xuất, sử dụng một AI yếu hơn để hỗ trợ con người phân rã các vấn đề phức tạp thành các vấn đề con mà mỗi cái có thể được đánh giá độc lập. Con người đánh giá các vấn đề con, và AI ghép các đánh giá ấy thành một đánh giá của vấn đề lớn hơn. Lặp lại qua nhiều cấp độ phân rã, cách tiếp cận nhằm trao cho con người khả năng đánh giá hiệu quả các vấn đề vượt quá sự hiểu biết trực tiếp của họ bằng cách chia nhỏ thành những mảnh họ có thể đánh giá.

Tình trạng chưa được giải quyết của vấn đề

Không có cách tiếp cận nào trong số này được chứng minh hoạt động đáng tin cậy với các hệ thống AI vượt xa mức con người trong các lĩnh vực thực tế. Cả ba đều cho kết quả đầy hứa hẹn trong môi trường kiểm soát và đang là lĩnh vực nghiên cứu tích cực tại Anthropic, Google DeepMind và OpenAI. Khoảng cách giữa minh họa trong môi trường kiểm soát và vận hành đáng tin cậy trong những điều kiện quan trọng nhất vẫn còn rất lớn.

Đây là lý do tại sao giám sát có thể mở rộng được coi là một trong những vấn đề mở trung tâm trong an toàn AI, cùng với khả năng diễn giải và khả năng sửa chữa. Một thế giới mà các hệ thống AI đạt đến năng lực siêu trí tuệ mà không có cách tiếp cận giám sát có thể mở rộng đã được giải quyết là một thế giới mà chúng ta đã mất khả năng giám sát có ý nghĩa những gì mình xây dựng. Hàm ý quản trị giống như với các vấn đề chưa giải quyết khác: xây dựng các khung yêu cầu alignment phải được xác minh trước khi triển khai, thay vì được phát hiện sau khi đã xảy ra thông qua giám sát hành vi mà hệ thống đã vượt qua.

Sự phản đối mạnh mẽ nhất

Lý lẽ công bằng nhất là tranh luận, khuếch đại và đánh giá đệ quy sẽ mở rộng cùng mô hình, nên giám sát là một đường cong kỹ thuật mà ta có thể đi theo. Có lẽ trong các bản demo. Nhưng ở giới hạn, người thẩm định vẫn yếu hơn hệ thống bị thẩm định. Đừng coi các chồng giám sát chưa được chứng minh là giấy phép để vượt sang ASI.