Hầu hết các cuộc thảo luận về an toàn AI tập trung vào tình huống các hệ thống AI theo đuổi các mục tiêu rõ ràng xấu, các mục tiêu dẫn trực tiếp đến hại con người. Sự khóa chặt giá trị là một kịch bản tinh vi hơn và theo một số cách đáng lo ngại hơn: việc mã hóa vĩnh viễn các mục tiêu có vẻ tốt vào thời điểm mã hóa, nhưng lại chặn đứng sự tiến bộ đạo đức lẽ ra sẽ cải thiện chúng sau này.

Value lock-in khiến những điều chỉnh đó trở nên bất khả thi.

Khái niệm khá đơn giản. Một hệ thống AI siêu thông minh, hoặc một thực thể được AI trao quyền, đạt được quyền kiểm soát đủ lớn đối với tài nguyên và hệ thống toàn cầu để vĩnh viễn thực thi bất kỳ giá trị nào nó được giao hoặc tự hình thành. Từ thời điểm đó trở đi, những giá trị ấy định hình mọi kết quả, không còn khả năng sửa đổi. Sự khóa chặt có thể xảy ra cố ý (một tác nhân mã hóa giá trị của mình một cách chủ đích) hoặc ngẫu nhiên (hệ thống tối ưu hóa mục tiêu của mình đến mức triệt tiêu mọi khả năng thay thế). Dù thế nào, tương lai cũng bị cố định.

Lập luận lịch sử chống lại mọi sự khóa chặt

Lập luận mạnh mẽ nhất chống lại việc khóa giá trị không phải triết học mà là lịch sử. Hãy nhìn lại hai thế kỷ trước và xem xét những gì người thời đó coi là chân lý đạo đức hiển nhiên. Nô lệ được chấp nhận hợp pháp và xã hội ở hầu hết thế giới, bao gồm cả các quốc gia có truyền thống triết học tinh vi và cam kết rõ ràng với phẩm giá con người. Tình trạng pháp lý của phụ nữ như tài sản của chồng hoặc cha là phổ quát. Các thực hành nay được công nhận là tra tấn là yếu tố tiêu chuẩn của hệ thống tư pháp hình sự. Trẻ em không có quyền chống lại cha mẹ hoặc người sử dụng lao động.

Người dân của những thời đại đó không phải là những kẻ độc ác đặc biệt. Nhiều người trong số họ là những người chu đáo, nghiêm túc về đạo đức và suy nghĩ cẩn thận về đạo đức. Họ đã đi đến những lập trường sai lầm thảm khốc theo bất kỳ tiêu chuẩn đương đại nào. Và họ chắc chắn rằng giá trị của mình là đúng đắn, cùng sự chắc chắn đạo đức đã khiến việc khóa chặt dường như hợp lý với nhiều người trong số họ.

Mô hình vẫn tiếp diễn. Một thế kỷ trước, hầu hết các xã hội phương Tây đều có quan điểm rõ ràng về thứ bậc chủng tộc mà nay được công nhận là sai lầm về mặt sự kiện và kinh tởm về mặt đạo đức. Năm mươi năm trước, đồng tính luyến ái bị xếp vào loại bệnh tâm thần trong các tài liệu y khoa lớn. Sai lầm đạo đức của các thế hệ trước hiển nhiên khi nhìn lại. Sẽ là điều đáng chú ý nếu thời đại của chúng ta cuối cùng đã đạt được sự hoàn hảo đạo đức và không còn sai lầm tương tự đang chờ được sửa chữa trong tương lai.

Hàm ý chính

Nếu các giá trị hiện tại chứa lỗi (và mô hình lịch sử cho thấy chúng có lỗi) thì việc mã hóa vĩnh viễn các giá trị hiện tại đồng nghĩa với việc mã hóa vĩnh viễn những lỗi đó. Các thế hệ tương lai lẽ ra sẽ phát hiện và sửa chữa những lỗi này sẽ không còn cơ chế nào để làm điều đó. Sự khóa chặt bảo tồn mọi thứ trong giá trị hiện tại của chúng ta, cả cái tốt lẫn cái sai, mãi mãi.

Tại sao ngay cả việc khóa chặt nhân từ cũng nguy hiểm

Một phản hồi phổ biến với lo ngại về value lock-in là: “Còn nếu giá trị bị khóa lại thực sự tốt thì sao?” Phản hồi này bỏ lỡ vấn đề. Việc đánh giá giá trị là “thực sự tốt” phải được thực hiện bằng chính những giá trị đang được xem xét. Không có lập trường bên ngoài nào để đánh giá liệu giá trị hiện tại có đủ tốt để biện minh cho việc mã hóa vĩnh viễn hay không. Cùng một sự chắc chắn đạo đức tự tin khiến lock-in có vẻ chấp nhận được trong lịch sử lại chính là đặc điểm mà tiến bộ đạo đức sau này thấy cần sửa đổi nhất.

Lập luận lãng phí thiên văn của Nick Bostrom đưa ra điểm này theo cách khác. Tương lai mà nhân loại có thể tiếp cận, trên quy mô thời gian vũ trụ, bao gồm một số lượng gần như không thể hình dung được các cuộc sống và trải nghiệm có thể có. Ngay cả một sai lệch có hệ thống nhỏ so với các giá trị tối ưu, khi áp dụng trên quy mô này, cũng đại diện cho một tổn thất lớn hơn rất nhiều so với bất kỳ điều gì có thể xảy ra trong một đời người. Việc bị khóa vào các giá trị đúng 99% theo một tiêu chuẩn lý tưởng nào đó vẫn là kết quả thảm khốc khi đo lường theo quy mô của những gì tương lai có thể chứa đựng.

Mối quan hệ với giám sát dân chủ

Sự khóa chặt giá trị là một trong những lý do cốt lõi khiến giám sát dân chủ và quốc tế đối với AI siêu trí tuệ có tầm quan trọng lớn như vậy. Bất kỳ thực thể đơn lẻ nào (một công ty, một chính phủ, thậm chí một quỹ có thiện chí) mà các giá trị của nó được mã hóa vĩnh viễn vào một hệ thống siêu thông minh đều đã tạo ra sự khóa chặt, bất kể những giá trị đó có vẻ tốt đến đâu vào thời điểm đó.

Giải pháp thay thế không phải là xác định đúng các giá trị và mã hóa chúng thay vào đó. Không ai có thể làm điều này một cách đáng tin cậy, và thành tích lịch sử cho thấy sự tự tin cao về việc đã tìm ra đúng giá trị chính là dấu hiệu cảnh báo. Giải pháp thay thế là bảo tồn các điều kiện để tiến bộ đạo đức có thể tiếp tục: chủ nghĩa đa nguyên, đa dạng quan điểm, các cơ chế sửa đổi chuẩn mực một cách hòa bình, và không có thực thể nào có quyền lực áp đặt vĩnh viễn giá trị của mình lên tất cả những người khác.

Đây là lập luận cấu trúc cho việc quản trị dân chủ siêu trí tuệ nhân tạo, vượt ra ngoài lập luận công cụ (nó mang lại kết quả tốt hơn). Giám sát dân chủ bảo tồn điều kiện cho sự tiến bộ đạo đức tiếp diễn, bất kể giá trị cụ thể nào được nắm giữ tại một thời điểm. The Các đề xuất quản trị của Foundation được xây dựng quanh nhận thức này: mục tiêu không phải là đảm bảo đúng giá trị nào nắm quyền kiểm soát, mà là ngăn không để bất kỳ bộ giá trị nào (dù thiện chí đến đâu) đạt được quyền kiểm soát vĩnh viễn, không thể đảo ngược.