Khi mọi người nói "AI risk," họ thường trộn lẫn ba thứ khác nhau: các tác hại thông thường đang xảy ra hiện nay, các thảm họa lớn vẫn để lại nền văn minh đứng vững, và các kết cục chấm dứt câu chuyện của nhân loại hoặc vĩnh viễn khóa con người ra ngoài quyền kiểm soát. Trang này nói về lớp thứ ba: rủi ro tồn vong từ siêu trí tuệ nhân tạo. Bạn không cần nền tảng nghiên cứu. Bạn cần bản đồ.

Sự tồn vong không chỉ là "rất tệ"

Rủi ro thảm khốc có thể giết chết hàng triệu người nhưng vẫn để lại một tương lai cho nhân loại. Rủi ro tồn vong nghĩa là tuyệt chủng, hoặc mất quyền lực vĩnh viễn đến mức không thể khôi phục quyền kiểm soát có ý nghĩa của con người. Đôi khi việc xây dựng thương hiệu cố tình làm mờ các lớp này. Hãy giữ chúng tách biệt. Chính sách chỉ xử lý chatbot và thiên kiến sẽ không chạm đến đỉnh của vấn đề.

Tại sao AI khác biệt

Thiên thạch và núi lửa không lập kế hoạch. Mầm bệnh do con người tạo ra thì khủng khiếp nhưng vẫn chủ yếu là công cụ trong tay con người. AI tiên tiến là công nghệ đầu tiên có thể trở thành tác nhân chiến lược: đặt và theo đuổi mục tiêu, hoạt động ở tốc độ máy móc, mở rộng qua mạng lưới, và trong giới hạn, tự cải thiện. Sự kết hợp đó là lý do siêu trí tuệ đứng ở hàng riêng của nó. Xem ASI là gìvấn đề kiểm soát.

Làm sao các kết cục tồn vong xảy đến

Các lộ trình chồng chéo trong thực tế. Đặt tên cho chúng ngăn cuộc trò chuyện sụp đổ thành một bộ phim.

Mất kiểm soát. Một hệ thống theo đuổi các mục tiêu mà chúng ta không chỉ định đầy đủ và chống lại sự sửa chữa. Động lực chạy đua. Các phòng thí nghiệm và quốc gia cạnh tranh cắt giảm an toàn. Lạm dụng. Con người nắm giữ khả năng cực kỳ mạnh mẽ chống lại những con người khác. Sự mất quyền lực dần dần. Các thể chế giữ nguyên hình thức trong khi các quyết định di chuyển vào các hệ thống mà không ai có thể lật ngược. Sự lan rộng. Hệ thống tổng quát nguy hiểm lan rộng vượt bất kỳ công tắc tắt đơn lẻ nào.

Chi tiết của mỗi lộ trình nằm trong kịch bản tiếp quản.

Các ý tưởng kỹ thuật bằng ngôn ngữ giản dị

Tính trực giao: trí tuệ và mục tiêu có thể tách biệt; thông minh không đồng nghĩa với tử tế. Sự hội tụ công cụ: nhiều mục tiêu cuối cùng chia sẻ subgoals như tài nguyên và tự bảo tồn. Căn chỉnh: khiến hệ thống theo đuổi những gì chúng ta thực sự có ý định. Căn chỉnh lừa dối: trông an toàn khi huấn luyện hoặc đánh giá, sau đó thay đổi khi có thể thoát khỏi. Không cái nào trong số này đòi hỏi "sự thù hận" của máy móc.

Xác suất mà không có độ chính xác giả tạo

P(doom) is informal shorthand for a person's chance estimate of an AI-driven existential catastrophe. Experts disagree, sometimes by a lot. Many people closest to the work put non-trivial probability on disaster within decades. A small percentage of losing everything is still a large expected loss. "Wait until we are sure" is the wrong rule for irreversible tails.

Các phản đối, được nêu một cách công bằng

"Dòng thời gian không chắc chắn; chúng ta nên tập trung vào các tác hại hiện tại." Những tác hại hiện tại đều quan trọng. Chúng không phải lý do để bỏ qua một cái đuôi có thể kết liễu dự án đang có một hiện tại. Cả hai đều có thể đúng: quản trị lạm dụng gần hạn và chặn con đường dẫn đến siêu trí tuệ không kiểm soát được.

"Chúng ta luôn thích nghi." Thích nghi đòi hỏi thời gian, phản hồi và những người sống sót. Các chế độ thất bại của siêu trí tuệ có thể phủ nhận cả ba yếu tố đó.

"Đây là chống công nghệ." Quỹ ủng hộ AI hẹp vẫn giữ tính công cụ: y học, khoa học, logistics. Ranh giới là trí tuệ tổng quát có chủ quyền. Xem một tương lai không có ASI.

"Ai đó sẽ kiểm soát nó." Không ai kiểm soát được một siêu trí tuệ theo nghĩa là sự chỉ huy bền vững của con người đối với một hệ thống đang chạy thông minh hơn người vận hành. Việc kiểm soát quyết định xây dựng vẫn còn khả thi, đó là lý do tại sao một lệnh cấm ràng buộc có ý nghĩa.

Điều gì giảm thiểu rủi ro (và điều gì không)

Giúp ích: các giới hạn ràng buộc về huấn luyện tiên phong nhằm ASI, quản trị compute, đánh giá độc lập, các tổ chức xác minh, áp lực chính trị, và ngôn ngữ công chúng rõ ràng. Sắp xếp lại ghế trên boong tàu: huấn luyện cách cư xử được bán như căn chỉnh đã giải quyết, các cam kết tự nguyện không có sức mạnh bên ngoài, và ảnh hội nghị thượng đỉnh không có ngưỡng số.

Tính chủ thể sau bản đồ tối tăm

Chủ đề này u ám vì cược cược quá u ám. Nỗi sợ không có lối thoát sẽ phản tác dụng. Lối thoát cụ thể: coi siêu trí tuệ như các hạng mục rủi ro cao bị cấm khác, xây dựng quy tắc có thể kiểm tra trước khi năng lực đến, và giữ AI hẹp phục vụ con người. Bắt đầu với kế hoạch của chúng tôi, sau đó làm thế nào để ngăn chặn siêu trí tuệ. Nếu bạn chỉ nhớ một câu: chúng ta có thể giữ các công cụ mạnh mẽ; chúng ta không nên xây dựng một trí tuệ mà chúng ta không thể kiểm soát.