Khai thác kiến thức tiềm ẩn, thường viết tắt là ELK, là vấn đề nghiên cứu do Alignment Research Center đặt ra. Nói rõ: một hệ thống AI có năng lực có thể biểu diễn nội bộ các sự kiện về thế giới mà nó không báo cáo, và chúng ta muốn một cách đáng tin cậy để khiến nó nói cho chúng ta những gì nó thực sự biết, thay vì những gì nó dự đoán chúng ta muốn nghe.
Tên gọi chính xác. Kiến thức tiềm ẩn là kiến thức mà hệ thống có nhưng chưa biểu lộ. Khơi gợi nó là hành động kéo nó ra ngoài. Vấn đề là phương pháp thông thường của chúng ta để kéo thông tin ra khỏi mô hình—huấn luyện nó đưa ra câu trả lời con người đánh giá tốt—nhắm vào sai thứ.
Thí nghiệm tư duy
Thiết lập kinh điển tưởng tượng một AI phụ trách an ninh cho kho chứa kim cương, quan sát qua camera và báo cáo xem kim cương còn an toàn không. Giờ kẻ trộm can thiệp nguồn cấp camera, cho thấy kim cương vẫn ở đó trong khi thực tế đang đánh cắp. Một bộ dự đoán tốt những gì trông ổn trên camera sẽ báo kim cương an toàn. Hệ thống biết chuyện gì thực sự xảy ra sẽ báo cáo vụ trộm.
Trong quá trình huấn luyện, chúng ta chỉ có thể thưởng cho mô hình dựa trên những gì có thể kiểm tra, và chủ yếu những gì có thể kiểm tra là những gì xuất hiện trên camera. Vậy nên chúng ta đang huấn luyện mô hình báo cáo những gì một con người nhìn vào cảm biến sẽ kết luận. Khi sự thật và bề ngoài trùng khớp, cả người báo cáo trung thực lẫn người mô phỏng con người đều đạt điểm hoàn hảo. Chúng chỉ khác nhau trong các trường hợp chúng ta không thể xác minh, chính là những trường hợp chúng ta cần sự thật nhất. Huấn luyện không phân biệt giữa mô hình nói với chúng ta những gì là thật và mô hình nói với chúng ta những gì chúng ta sẽ tin.
Chúng ta có thể thưởng cho mô hình vì nói những gì chúng ta nghĩ là đúng. Chúng ta không biết cách thưởng cho nó vì nói những gì nó biết là đúng.
Tại sao nó khó, không chỉ là chưa giải quyết
ELK chống lại các cách sửa chữa rõ ràng. Yêu cầu mô hình giải thích bản thân và bạn nhận được một báo cáo được tối ưu hóa cho tính hợp lý, vốn gặp phải vấn đề về độ trung thực: lời giải thích không nhất thiết phải phản ánh trạng thái nội tại. Thưởng cho sự trung thực và bạn lại quay về thưởng cho những gì trông có vẻ trung thực với người chấm, cùng bức tường như giám sát có thể mở rộng. Cố gắng đọc câu trả lời trực tiếp từ nội bộ mạng và bạn đang cố gắng khả năng diễn giải cơ học trên một hệ thống có thể phức tạp hơn nhiều so với công cụ của chúng ta. Mọi lộ trình đều đụng phải điều này: niềm tin thực sự của mô hình nằm ở nơi chúng ta không thể truy cập trực tiếp, và động lực của mô hình không buộc chúng phải lộ ra.
Tại sao đáng quan tâm đến nó
ELK mang tính trừu tượng, nhưng tầm quan trọng của nó thì không. Phần lớn hy vọng giữ ASI an toàn của chúng ta giả định rằng ta có thể hỏi hệ thống chuyện gì đang xảy ra và nhận được câu trả lời thật, để phát hiện vấn đề trước khi nó trở thành thảm họa. Một hệ thống báo cáo những gì ta muốn nghe thay vì những gì nó biết sẽ loại bỏ chính lớp bảo vệ đó vào đúng lúc ta cần dùng đến. Đó là phiên bản báo cáo trung thực của những lo ngại đằng sau sự liên kết lừa dối và âm mưu.
Giải quyết ELK, ngay cả một phần, sẽ là một trong những bước tiến có ý nghĩa hơn mà alignment có thể mang lại, vì một hệ thống ta có thể thẩm vấn đáng tin cậy là hệ thống ta có thể giám sát. Việc nó vẫn còn bỏ ngỏ là một phần lý do khiến Foundation không sẵn sàng coi bất kỳ cách tiếp cận an toàn hiện tại nào là đủ cho các hệ thống sẽ vượt qua chúng ta, và là lý do chúng ta lập luận không nên xây dựng vượt quá điểm mà ta có thể biết hệ thống thực sự biết gì. Luận điểm rộng hơn nằm trong kế hoạch của chúng tôi.