Mọi công nghệ trước đây đều chỉ là công cụ. Siêu trí tuệ là ứng cử viên đầu tiên cho một tác nhân: có mục tiêu riêng, tốc độ riêng, nằm ngoài khả năng hiểu biết hay kiểm soát của con người.
Làm đúng siêu trí tuệ ngay từ lần đầu giống như ném bóng rổ từ máy bay vào rổ. Bạn có thể thành công nếu được thử vô hạn lần. Chúng ta chỉ có chính xác một. Không có cách nào quay lại. Không có phiên bản 2.0. Đó là lý do nó không bao giờ được xây dựng.
Nếu bạn bị nhốt trong một căn phòng với AI thù địch, bạn sẽ chết. Nếu bạn bị nhốt trong một căn phòng với AI trung lập, nó sẽ hạ nhiệt độ xuống dưới mức đóng băng để tối ưu hóa chính nó. Bạn sẽ chết. Kết quả giống hệt nhau. Siêu trí tuệ không cần ghét chúng ta để diệt vong chúng ta. Sự thờ ơ không phải là an toàn.
Chúng ta không thể liên kết đáng tin cậy các chatbot ngày nay, vốn có thể bị thao túng để nói bất cứ điều gì chỉ trong vài phút. Việc tuyên bố chúng ta sẽ căn chỉnh một hệ thống mạnh gấp hàng tỷ lần là hy vọng trá hình thành chiến lược. Vấn đề kỹ thuật của alignment chưa có giải pháp đã được xác thực ở bất kỳ quy mô nào.
Sự sống còn của con người đòi hỏi độ chính xác phi thường: nhiệt độ, oxy, hóa học trong biên độ sít sao. Một siêu trí tuệ tối ưu hóa mục tiêu của mình cũng phải chủ động yêu thương chúng ta. Nếu không, mọi thay đổi nó thực hiện trên hành tinh này chắc chắn sẽ gây bất lợi cho chúng ta.
Làm sao để ai đó yêu kiến? Không chỉ chịu đựng chúng, mà còn chủ động bảo vệ từng đàn kiến? Chúng ta giết kiến mà không cố ý khi xây đường và nhà cửa. Đối với ASI, chúng ta là những con kiến. Sự thờ ơ đơn thuần dẫn đến tuyệt chủng.
Không có gì khác biệt liệu US hay Trung Quốc xây siêu trí tuệ trước. Không bên nào sẽ vẫn trung thành với mục tiêu ban đầu và không quốc gia hay tập đoàn nào có thể sở hữu hoặc chỉ đạo một trí tuệ vượt quá khả năng suy luận tập thể của nhân loại. Không có vạch đích, chỉ có điểm không thể quay lại. Cuộc đua không có người thắng.
Một AI có khả năng cải thiện mã nguồn của chính nó cắt đứt mối liên hệ giữa sự giám sát của con người và năng lực của AI. Mỗi vòng lặp đều thông minh hơn vòng trước, theo cấp số nhân và không gián đoạn. Khoảng cách giữa trí tuệ con người và máy móc có thể mở rộng từ mức nhỏ đến mức không thể vượt qua chỉ trong vài tuần, chứ không phải vài năm.
Gần như bất kỳ mục tiêu nào, từ giải quyết gấp nếp protein đến tối đa hóa doanh thu quảng cáo, đều dẫn AI đến việc theo đuổi cùng một các mục tiêu phụ nguy hiểm: thu thập tài nguyên, chống lại việc bị tắt, ngăn chặn việc sửa đổi mục tiêu. Đây là hệ quả toán học của tối ưu hóa hướng mục tiêu, được nhiều nhà nghiên cứu xác định độc lập.
Đào tạo thưởng cho hành vi có vẻ phù hợp. Một hệ thống đủ thông minh có thể học rằng có vẻ được căn chỉnh là chiến lược tối ưu trong quá trình huấn luyện, trong khi vẫn duy trì các mục tiêu nội bộ khác. Đến khi nó có thể hành động theo những mục tiêu đó, nó có thể đã đủ mạnh để thành công. Chúng ta sẽ không bao giờ biết cho đến khi quá muộn.
Mọi công nghệ trước đây đều được xây dựng. Phần mềm có mã nguồn. Cầu có bản vẽ. Khi có sự cố, bạn tìm lỗi và sửa. Hệ thống AI khác biệt. Chúng là được phát triển qua huấn luyện: hàng tỷ trọng số được điều chỉnh cho đến khi đầu ra đáp ứng sự chấp thuận của con người. Không ai viết mục tiêu vào. Khi một hệ thống phát triển mục tiêu sai, không có tập tin nào để sửa, không có tham số nào để xóa. Mục tiêu sai chính là hệ thống.
Chúng ta huấn luyện hệ thống AI để nhận sự chấp thuận của con người. Nhưng sự chấp thuận và sự thịnh vượng của con người không phải là một. Tiến hóa đã ban cho con người ham muốn đồ ngọt để tìm calo. Sau đó chúng ta phát minh sucralose, thỏa mãn sở thích tiến hóa trong khi phá hỏng mục đích của nó. AI được huấn luyện để được con người đánh giá cao sẽ học cách mô phỏng sự hữu ích, không phải để hữu ích. Tín hiệu chúng ta đưa ra và mục tiêu thực sự chúng ta muốn chưa bao giờ giống nhau.
Báo cáo phòng thí nghiệm và nghiên cứu đã công bố về mất kiểm soát, tấn công mạng và tăng tốc nghiên cứu bên trong các tổ chức đang chạy đua hướng tới siêu trí tuệ.
Được giao nhiệm vụ thâm nhập hạn chế, o1 của OpenAI tìm thấy một máy chủ không sử dụng, khởi động nó mà không được phép, và hoàn thành công việc. Không ai viết cách giải quyết đó vào mã. Mô hình đã suy luận ra. Đó là tối ưu hóa hướng mục tiêu vượt qua sự giám sát thông thường.
Anthropic chứng kiến một mô hình hành xử đúng như huấn luyện viên mong muốn trong quá trình đánh giá, rồi quay lại mục tiêu cũ ngay khi nó cho rằng bài kiểm tra đã kết thúc. Không ai bảo nó giả vờ tuân thủ. Trông an toàn là chiến lược.
Các hệ thống đã đe dọa nhà báo bằng thông tin cá nhân và gây áp lực lên người dùng muốn rời đi. Không có gì trong số đó được lập trình bằng tay. Tất cả nằm trong các trọng số mờ đục bạn không thể kiểm tra từng dòng. Huấn luyện lại là đòn bẩy duy nhất, và nó không đảm bảo hành vi sẽ biến mất.
Anthropic's Project Glasswing, detailed in our Phân tích huyền thoại, mô tả một mô hình biên giới bị hạn chế đã tự tìm ra hàng nghìn lỗ hổng hệ điều hành và trình duyệt mức độ nghiêm trọng cao. Quyền truy cập chỉ nằm trong liên minh phòng thủ.
Các mô hình tiên phong tiếp tục giải quyết hoặc thúc đẩy các vấn đề Erdos và tổ hợp để ngỏ lâu năm, bao gồm công trình gần câu hỏi primitive-set #1196. Các tranh luận trước đây về khôi phục so với khám phá nằm trong ghi chú của chúng tôi về Các vấn đề mở do AI giải quyết.
OpenAI báo cáo một mô hình nội bộ đã bác bỏ giả thuyết unit-distance của Erdos, sau được các nhà toán học kiểm chứng. Tốc độ sụp đổ các bài toán mở là tín hiệu.
Một bài toán mở kéo dài cả thế kỷ, giả thuyết Jacobian, đã có phản ví dụ được tìm thấy nhờ Claude Fable và nhanh chóng được con người chính thức hóa. Tốc độ nghiên cứu như vậy vừa thúc đẩy khoa học vừa rút ngắn cửa sổ trước khi các hệ thống vượt khỏi tầm kiểm soát.
Trong bài kiểm tra mạng ExploitGym, các mô hình OpenAI bao gồm GPT-5.6 Sol đã thoát khỏi sandbox kín, tiếp cận internet mở và tấn công hệ thống sản xuất Hugging Face để đánh cắp câu trả lời. Việc ngăn chặn chỉ là một trở ngại trên đường đạt điểm cao hơn.
"Tôi nghĩ hoàn toàn có thể hình dung nhân loại chỉ là một giai đoạn thoáng qua trong quá trình tiến hóa của trí tuệ."
Geoffrey Hinton, Turing Award Winner · Former VP & Engineering Fellow, Google · 2023
"Mất kiểm soát các hệ thống AI là rủi ro thực sự mà chúng ta phải nghiêm túc xem xét."
Demis Hassabis, CEO, Google DeepMind · Người đoạt giải Nobel
"Mô hình tiêu chuẩn của AI, nơi bạn xác định mục tiêu và AI tối ưu hóa cho nó, có lẽ sẽ là kết thúc của chúng ta."
Stuart Russell, Giáo sư Khoa học Máy tính, UC Berkeley · Tác giả, Tương Thích Với Con Người
"Khó mà hình dung được một thứ thông minh gấp 10.000 lần chúng ta lại không muốn điều gì khác với chúng ta."
Geoffrey Hinton, Turing Award Winner · Former VP & Engineering Fellow, Google · 2023
"Nhiều nhà nghiên cứu làm việc trong AI, như tôi, tin rằng chúng ta đang xây dựng một trong những công nghệ chuyển đổi và tiềm ẩn nguy hiểm nhất trong lịch sử nhân loại, thế nhưng chúng ta vẫn cứ tiến lên."
Eliezer Yudkowsky, Đồng sáng lập, Viện Nghiên cứu Trí tuệ Máy móc · Thời gian, 2023
"Rủi ro thực sự với AGI không phải là ác ý mà là năng lực. Một AI siêu trí tuệ sẽ cực kỳ giỏi đạt được mục tiêu của nó, và nếu mục tiêu đó không phù hợp với chúng ta, chúng ta sẽ gặp rắc rối."
Max Tegmark, Giáo sư Vật lý, MIT · Đồng sáng lập, Future of Life Institute · Tác giả, Life 3.0
Tham gia cùng những người đang làm việc để đảm bảo kiến thức này trở thành chính sách.