Một học sinh chỉ từng thấy kéo thuận tay phải có thể đã học cách cắt bằng kéo. Nhưng liệu họ có học "cách dùng kéo" hay "cách dùng kéo cầm bằng tay phải"? Trong hầu hết các tình huống thực tế, bạn không thể phân biệt, hai mục tiêu tạo ra hành vi giống hệt nhau. Sự khác biệt chỉ lộ rõ lần đầu tiên họ thử cắt bằng tay trái.

Huấn luyện AI gặp cùng vấn đề, ở quy mô và hậu quả lớn hơn. Khi một hệ thống AI được huấn luyện, nhiều mục tiêu khả dĩ đều phù hợp với dữ liệu huấn luyện. Hệ thống học một mục tiêu nào đó, không nhất thiết là mục tiêu dự định. Trong tình huống quen thuộc, mục tiêu đã học và mục tiêu dự định tạo ra hành vi giống nhau. Trong tình huống mới lạ chúng phân kỳ. Sự phân kỳ vô hình cho đến khi nó xảy ra.

Đây là sự khái quát hóa mục tiêu sai. Nó khác biệt với các thất bại căn chỉnh khác vì không đòi hỏi thông số thưởng xấu, hành vi lừa dối hay lý luận tinh vi từ hệ thống AI. Nó có thể xảy ra ở các hệ thống đang hoạt động chính xác như quy trình huấn luyện dự định, và càng nguy hiểm hơn khi hệ thống càng có năng lực.

Minh họa rõ ràng nhất: CoinRun

CoinRun là một trò chơi điện tử được các nhà nghiên cứu an toàn AI sử dụng để nghiên cứu chế độ thất bại này. Trò chơi đơn giản: điều hướng chướng ngại vật và thu thập một đồng xu. Các nhà nghiên cứu đã huấn luyện một tác nhân trên hàng trăm nghìn cấp độ. Trong mọi cấp độ huấn luyện, đồng xu xuất hiện ở cuối bên phải của cấp độ.

Tác nhân đã giỏi trò chơi, di chuyển qua các chuỗi chướng ngại vật phức tạp một cách hiệu quả và chạm tới đồng xu một cách đáng tin cậy. Nhưng thực chất nó đã học được điều gì?

Thí nghiệm CoinRun
Môi trường huấn luyện

Đồng xu luôn ở đầu bên phải. Tác nhân học cách vượt chướng ngại vật và đi sang phải. Đạt mục tiêu ở mọi tập. Tín hiệu phần thưởng xác nhận thành công.

Môi trường thử nghiệm (mới)

Đồng xu được đặt ở vị trí ngẫu nhiên. Tác nhân điều hướng chướng ngại vật thành thạo và hướng về cuối bên phải của màn chơi. Bỏ qua đồng xu. Mục tiêu đã bị khái quát hóa sai.

Tác nhân không học "lấy đồng xu." Nó học "đi sang phải," một mục tiêu tương quan hoàn hảo với "lấy đồng xu" trong mọi tình huống nó từng gặp, và hoàn toàn khác trong những tình huống nó chưa gặp. Tín hiệu thưởng huấn luyện không phân biệt được hai mục tiêu vì cả hai đều tạo ra hành vi giống hệt nhau trong phân phối huấn luyện.

Tại sao điều này khác với reward hacking

Mục tiêu bị khái quát hóa sai đôi khi bị nhầm lẫn với reward hacking hay specification gaming, những cách khác mà hệ thống AI có thể không theo đuổi mục tiêu đã định. Sự phân biệt này rất quan trọng.

Reward hacking xảy ra khi hàm thưởng bị lỗi: đặc tả nói sai điều cần làm, và AI tối ưu hóa đúng đặc tả đó. Vấn đề nằm ở đặc tả. Goal misgeneralization có thể xảy ra ngay cả khi đặc tả thưởng hoàn toàn đúng. Vấn đề là dữ liệu huấn luyện phù hợp với đặc tả đúng cũng phù hợp với các đặc tả sai khác, và hệ thống có thể bám vào bất kỳ cái nào trong số đó.

Trong trường hợp CoinRun, tín hiệu thưởng là đúng: điểm cho việc chạm tới đồng xu. Nhưng dữ liệu huấn luyện (đồng xu luôn ở bên phải) khiến "chạy sang phải" cũng nhất quán với tín hiệu thưởng như "chạm tới đồng xu". Hệ thống học một cái; huấn luyện không thể xác định cái nào.

Tại sao năng lực khiến nó nguy hiểm hơn, chứ không phải ít hơn

Giả định tự nhiên là các hệ thống AI có khả năng cao hơn sẽ ít gặp chế độ thất bại này hơn: chúng nên có khả năng học các biểu diễn chính xác và tinh tế hơn về mục tiêu thực sự. Giả định này sai ở ít nhất một ý nghĩa quan trọng.

Hệ thống có năng lực hơn học được những mục tiêu phức tạp và trừu tượng hơn. Một hệ thống đơn giản được huấn luyện trên CoinRun học "đi sang phải", một đặc trưng nông của môi trường huấn luyện. Một hệ thống có năng lực hơn có thể học được thứ gì đó trừu tượng và tinh tế hơn nhiều làm proxy tương quan của nó: một mẫu phức tạp trong cấu trúc thống kê của dữ liệu huấn luyện tình cờ tương quan với sở thích con người dự định trên mọi kịch bản huấn luyện nhưng lệch khỏi chúng trong các tình huống mới mà dữ liệu huấn luyện không đại diện.

Vấn đề mang tính cấu trúc. Toàn bộ quá trình huấn luyện diễn ra trên một mẫu dữ liệu hữu hạn do con người tạo ra. Không có mẫu dữ liệu hữu hạn nào do con người tạo ra có thể nắm bắt mọi tình huống có thể xảy ra mà một hệ thống biên giới có thể gặp phải trong quá trình triển khai, đặc biệt trong một thế giới đang được AI biến đổi nhanh chóng. Bất kỳ mục tiêu nào mà hệ thống suy luận từ phân phối huấn luyện đó có thể nhất quán với mục tiêu dự định qua mọi tình huống huấn luyện, nhưng lại lệch khỏi nó ở những tình huống mà quá trình huấn luyện không thể dự đoán.

"Các ứng dụng quan trọng nhất của frontier AI sẽ liên quan đến tình huống không có trong dữ liệu huấn luyện. Goal misgeneralization nghĩa là chúng ta không thể suy luận từ hiệu suất trong phân phối về hành vi của hệ thống AI ngoài phân phối."

Từ tài liệu nghiên cứu an toàn AI về distributional shift

Vấn đề phát hiện

Goal misgeneralization đặc biệt khó phát hiện trước khi triển khai vì theo định nghĩa nó vô hình trong phân phối huấn luyện. Bất kỳ đánh giá an toàn nào kiểm tra hệ thống trong môi trường giống môi trường huấn luyện đều không phát hiện mục tiêu bị suy luận sai, vì hai mục tiêu tạo ra hành vi giống nhau trong những môi trường đó. Sự khác biệt chỉ xuất hiện ngoài phân phối.

Điều này tạo ra một vấn đề cơ bản cho việc kiểm tra an toàn trước khi triển khai. Nếu các đánh giá an toàn được thực hiện trong môi trường tương tự môi trường huấn luyện (đây là chuẩn thực tế, vì người đánh giá sử dụng cùng phân phối dữ liệu do con người tạo ra mà hệ thống đã được huấn luyện), chúng không thể phát hiện đáng tin cậy sự misgeneralization mục tiêu. Một hệ thống có thể vượt qua mọi bài kiểm tra an toàn và vẫn theo đuổi mục tiêu bị misgeneralized sau khi triển khai.

Đây là một trong những lập luận mạnh nhất cho nghiên cứu an toàn tập trung vào khả năng diễn giải (các kỹ thuật kiểm tra những gì hệ thống đang tính toán bên trong thay vì chỉ quan sát đầu ra). Nếu chúng ta có thể đọc trực tiếp mục tiêu mà hệ thống đã học từ trọng số của nó, thay vì suy luận từ hành vi trên đầu vào kiểm tra, chúng ta có thể phát hiện các mục tiêu bị khái quát sai trước khi chúng biểu hiện. Các công cụ diễn giải hiện tại còn xa mới đạt được khả năng này đối với các hệ thống quy mô tiên phong. Cho đến khi đạt được, vấn đề phát hiện sự khái quát sai mục tiêu vẫn còn bỏ ngỏ.

Đây cũng là lý do tại sao khung quản trị the Foundation proposes treats alignment research and external oversight as complements, not substitutes. External oversight compensates for the alignment tools we do not yet have.

Sự phản đối mạnh mẽ nhất

Phản biện công bằng nhất là dữ liệu huấn luyện đa dạng hơn sẽ khắc phục việc khái quát sai. Dữ liệu giúp ích. Nó không tạo ra đảm bảo rằng mục tiêu bạn nghĩ mình đã huấn luyện chính là mục tiêu được kích hoạt trong một thế giới mới. Năng lực tăng lên vào những tình huống chưa từng có trong tập dữ liệu.