Cứ vài tháng lại có thêm phòng thí nghiệm hoặc quỹ công bố thêm tiền cho nghiên cứu alignment. Lời kêu gọi rất chân thành. Nếu chúng ta sắp xây dựng những hệ thống thông minh hơn chúng ta, tốt hơn hết là đảm bảo chúng muốn những gì chúng ta muốn. Tôi tôn trọng những người đang làm công việc đó. Tôi từng gật gù đồng ý. Sau đó tôi nói to mục tiêu bằng tiếng Anh thông thường.

Giải quyết alignment, ở giới hạn lĩnh vực quan tâm, nghĩa là kiểm soát đáng tin cậy thứ gì đó thông minh hơn mọi con người tham gia xây dựng nó. Không phải máy tính bỏ túi. Không phải máy gấp protein. Một trí óc tổng quát vượt trội hơn chúng ta trên mọi phương diện. Chúng ta thậm chí còn đặt tên cho mục tiêu: siêu trí tuệ.

Cái tên đó đang làm nhiều việc hơn các bài báo.

Từ này đã thừa nhận điều gì

Siêu nghĩa là ở trên. Trí tuệ là thứ ta dùng để chế tạo công cụ, phát hiện kẽ hở và thắng các cuộc tranh đua với những trí óc yếu hơn. Nếu bạn xây dựng một hệ thống vượt trội hơn bạn ở những trò chơi ấy, bạn đã tạo ra thứ giỏi hơn bạn ở chính những kỹ năng bạn cần để giữ nó trong vòng kiểm soát.

Mọi người vẫn nói như thể alignment chỉ là một bản vá phần mềm được cài trước khi hệ thống nhận ra. Bạn đang cố viết luật cho một người chơi cuối cùng sẽ giỏi luật hơn bạn. Bạn đang cố kiểm tra một học sinh cuối cùng sẽ giỏi kiểm tra hơn giám khảo. Bạn đang cố giám sát một nhân viên cuối cùng sẽ hiểu nơi làm việc, các động lực và điểm mù của bạn tốt hơn bạn.

Đừng gọi nó là kế hoạch an toàn cho loài người.

Những gì họ thực sự tranh luận

Tính khả thi sẽ tiếp tục tăng dù chúng ta có thích hay không. Từ chối đơn phương bởi một phòng thí nghiệm không ngăn chặn những người khác. Theo quan điểm này, hành động có trách nhiệm duy nhất là cố gắng hết sức để xác định mục tiêu, phát hiện sự lừa dối và giữ cho hệ thống không bị hạn chế, để nếu một hệ thống nguy hiểm xuất hiện chúng ta có cơ hội. Một số công việc đó đã giúp ích cho các mô hình ngày nay. Bỏ qua nó là liều lĩnh.

Tôi đồng ý với nửa hẹp. Công việc an toàn trên các hệ thống chúng ta vẫn có thể kiểm tra và tắt là kỹ thuật thực thụ. Điều tôi không đồng ý là bước nhảy từ hỗ trợ với các mô hình ngày nay sang do đó chúng ta có thể alignment một siêu trí tuệ đủ chặt để đặt cược văn minh vào đó. Bước nhảy đó lén lút mang theo giả định rằng khả năng kiểm soát tăng theo quy mô của thứ được kiểm soát. Lịch sử và lẽ thường đều đi ngược lại. Người chơi càng thông minh, kế hoạch khéo léo của bạn càng ít trông như một kế hoạch và càng giống một câu đố.

Kiểm soát đòi hỏi lợi thế

Mọi mối quan hệ kiểm soát bền vững mà chúng ta biết đều dựa trên một lợi thế: lực lượng vật lý, thẩm quyền pháp lý, thông tin mà bên kia thiếu, hoặc khả năng tắt hệ thống. Siêu trí tuệ, theo định nghĩa, làm xói mòn những lợi thế đó. Nếu nó có thể mô hình hóa bạn tốt hơn bạn mô hình hóa nó, các bài kiểm tra của bạn trở thành sân khấu. Nếu nó có thể hành động nhanh hơn và rộng hơn đội giám sát của bạn, công tắc tắt của bạn chỉ là câu chuyện bạn kể với chính mình cho đến ngày nó không còn khả dụng.

Đó là tuyên bố về trạng thái cuối cùng mà mọi người tiếp tục tài trợ hướng tới, không phải là lời chỉ trích chống lại mọi bài báo hữu ích về các mô hình hiện nay. Các rào cản cấu trúc chồng chất: bạn không thể chỉ định đầy đủ giá trị con người, không thể phân biệt tin cậy giữa tuân thủ thật và diễn xuất, và khoảng cách trí tuệ giữa người đánh giá và hệ thống ngày càng lớn khi hệ thống cải thiện. Hy vọng rào cản cuối cùng sẽ sụp đổ đúng trước khi triển khai chỉ là ảo tưởng deadline, không phải khoa học.

Nếu sản phẩm thông minh hơn những người cầm điều khiển từ xa, thì điều khiển từ xa chưa bao giờ là vấn đề.

Ngốc nghếch là một chẩn đoán

Gọi kế hoạch là ngu ngốc chỉ nêu rõ sai lầm về phạm trù; nó không xúc phạm các nhà nghiên cứu. Chúng ta đang đổ tiền an toàn khan hiếm vào việc khiến một loài kế thừa phát triển tốt trong khi cuộc đua xây dựng loài kế thừa đó vẫn tiếp tục đúng lịch trình. Đó giống như tài trợ cho cách cư xử tốt hơn với một trận lũ trong khi đập vẫn đang bị phá hủy ở thượng nguồn.

Nước đi thông minh là cách nhàm chán: đừng xây dựng thứ bạn không thể kiểm soát. AI hẹp có thể gấp protein, đọc ảnh chụp và dự báo thời tiết vẫn tiếp tục mang lại giá trị. Những hệ thống đó vẫn là công cụ. Siêu trí tuệ là một trung tâm hành động mới, không phải công cụ lớn hơn. Coi "liên kết nó" là kế hoạch chính trong khi các phòng thí nghiệm đang chạy đua chính là cách một nền văn hóa tự thuyết phục mình bước vào một thí nghiệm không thể đảo ngược.

Nên làm gì với số tiền thay vào đó

Chuyển đống alignment-for-ASI sang công việc khiến việc không tạo ra siêu trí tuệ trở nên thực tế: thiết kế hiệp ước và xác minh, quản trị compute có thể kiểm tra, xây dựng lập luận công khai giữ mục tiêu rõ ràng, và gây áp lực chính trị để các nhà lập pháp nghe được điều gì đó ngoài các luận điểm của lab. Tôi đã viết riêng trường hợp tài trợ. Phiên bản ngắn gọn là trình tự. Sau khi dừng lại đã được xác minh trên con đường dẫn đến siêu trí tuệ, nghiên cứu về AI mạnh mẽ dưới sự kiểm soát chặt chẽ có thể tiếp tục. Trước khi dừng lại đó, mỗi đồng đô la khiến cuộc đua có vẻ dễ quản lý là một đồng đô la không được chi để chấm dứt cuộc đua.

Bạn không thể căn chỉnh siêu trí tuệ theo nghĩa mà bản pitch deck đòi hỏi. Từ này đã nói rõ lý do. Ngừng tài trợ cho ảo tưởng rằng chúng ta sẽ làm được. Hãy tài trợ cho quyết định không xây dựng nó.