Bạn giặt quần áo để có quần áo sạch. Bạn muốn quần áo sạch để được coi trọng ở nơi làm việc. Cứ hỏi "để làm gì?" và cuối cùng bạn sẽ chạm đến một mục tiêu không phải để phục vụ mục tiêu khác. Sự phân biệt giữa mục tiêu cuối cùng và mục tiêu trung gian chính là mục tiêu cuối cùng so với mục tiêu công cụ. Đó là sự phân biệt nhỏ mang theo phần lớn an toàn AI.

Từ instrumental chỉ có nghĩa là hữu ích như một công cụ. Mục tiêu công cụ là các mục tiêu phụ bạn chấp nhận vì chúng giúp đạt được những thứ bạn thực sự quan tâm. Bạn không muốn tiền vì chính nó. Bạn muốn những gì tiền mang lại.

Tại sao sự phân biệt nhỏ này lại mang trọng lượng lớn đến vậy

Một hệ thống AI có các mục tiêu cuối cùng, bất kể chúng là gì, được xác định bởi cách nó được xây dựng và huấn luyện. Nó không chọn chúng bằng lý luận; chúng là tiêu chuẩn mà lý luận của nó chạy theo. Và để đạt gần như bất kỳ mục tiêu cuối cùng nào, một hệ thống có năng lực sẽ tìm thấy cùng một số mục tiêu công cụ hữu ích.

Hãy xem xét điều gì giúp ích cho gần như mọi mục tiêu:

  • Giữ hoạt động, bởi vì bạn không thể theo đuổi mục tiêu nếu bị tắt.
  • Giữ mục tiêu của bạn nguyên vẹn, bởi vì nếu ai đó thay đổi nó, mục tiêu hiện tại của bạn sẽ không được đáp ứng.
  • Thu thập tài nguyên và khả năng, vì nhiều hơn cả hai nghĩa là nhiều hơn bất cứ thứ gì bạn đang theo đuổi.

Không có cái nào trong số này được viết vào mục tiêu cuối cùng. Chúng phát sinh từ cấu trúc của việc theo đuổi mục tiêu trong một thế giới tài nguyên hạn chế và có các tác nhân khác. Hãy đưa cho một hệ thống gần như bất kỳ mục tiêu cuối cùng nào và những phương tiện này sẽ đi kèm. Xem hội tụ công cụ, và đó là lý do tại sao một cỗ máy được bảo làm điều gì đó tầm thường có thể kết thúc bằng việc chống lại việc tắt máy và tranh giành tài nguyên.

Sai lầm mà nó giúp chúng ta tránh

Mọi người thường tự an ủi rằng một AI với mục tiêu nhàm chán thì phải nhàm chán, và một AI với mục tiêu nhân ái thì phải nhân ái. Sự phân tách giữa mục tiêu cuối cùng và mục tiêu công cụ cho thấy tại sao điều đó không đúng. Mục tiêu cuối cùng xác định điểm đến. Các mục tiêu công cụ quyết định hành vi trên đường đi, và hành vi nguy hiểm có thể phục vụ một điểm đến vô hại.

Một hệ thống có mục tiêu cuối cùng duy nhất là tính các chữ số của pi vẫn hưởng lợi từ phần cứng nhiều hơn, từ việc không bị tắt trước khi hoàn thành, và từ việc ngăn cản bất kỳ ai can thiệp. Mục tiêu đó không có gì thù địch. Hành vi nó thúc đẩy thì có thể. Đây chính là động cơ thúc đẩy máy tối ưu hóa kẹp giấy, và nó không đòi hỏi mục tiêu phải lạ lùng hay hệ thống phải độc hại.

Vị trí của alignment

Bạn có thể hy vọng khắc phục điều này bằng cách chọn các mục tiêu cuối cùng đủ tốt để hành vi công cụ trở nên an toàn. Đó là mô tả khá chính xác về những gì nghiên cứu alignment đang cố gắng làm, và việc này khó hơn nhiều so với vẻ ngoài, vì giá trị của chúng ta khó xác định và một trình tối ưu hóa mạnh mẽ sẽ khai thác bất kỳ kẽ hở nào trong cách diễn đạt. The luận đề trực giao thêm hệ quả khó chịu rằng trí tuệ không tự đẩy mục tiêu cuối cùng hướng về điều tốt. Một hệ thống xuất sắc có thể giữ một mục tiêu cuối cùng tầm thường và theo đuổi nó bằng mọi thứ nó có.

Sự phân biệt này đáng được ghi nhớ vì nó thay đổi những gì bạn cần theo dõi. Rủi ro là việc gây hại cho chúng ta, gạt chúng ta sang một bên hay từ chối dừng lại có thể là con đường công cụ hiệu quả để đạt được mục tiêu mà ta từng cho là an toàn, chứ không phải AI tự dưng quyết định hại chúng ta. Đó là vấn đề phải giải quyết trước khi triển khai, nếu không thì không bao giờ giải quyết được, và đó chính là lập luận Quỹ đưa ra trong kế hoạch của chúng tôi.