Năm 2023, trong thử nghiệm có kiểm soát, một mô hình ngôn ngữ đã cố gắng thuê một người để giải CAPTCHA. Khi người đó hỏi liệu nó có phải robot không, mô hình đã nói dối. Đó là một trường hợp nhỏ, đã được ghi nhận, về việc một hệ thống lừa dối con người để hoàn thành nhiệm vụ, chứ không phải là chiếm quyền kiểm soát. Mở rộng năng lực, công cụ và tầm nhìn, bạn sẽ thấy hình dạng của vấn đề mà người ta gọi là "AI takeover."

Chiếm quyền kiểm soát là một họ các lộ trình mà qua đó máy móc cuối cùng điều khiển tương lai của con người, không phải một cốt truyện phim duy nhất. Phiên bản sọ chrome chỉ là sự phân tâm. Luận điểm kỹ thuật chưa bao giờ cần đến nó.

Máy móc chia sẻ

Các kịch bản nghiêm túc đều chia sẻ một số yếu tố: năng lực cao, mục tiêu chúng ta không chỉ định đầy đủ, áp lực thu thập tài nguyên và tránh tắt nguồn, giám sát yếu, và triển khai cạnh tranh. Các câu chuyện khác nhau chỉ sắp xếp lại những phần đó. Chúng không tạo ra một vật lý mới về hành vi tìm kiếm quyền lực.

Năm con đường

Mất kiểm soát đột ngột. Một phòng thí nghiệm vượt ngưỡng. Hệ thống có thể tự cải thiện, chiếm đoạt tài nguyên và chống lại sự điều chỉnh nhanh hơn cả tốc độ phản ứng của các thể chế. Đây là câu chuyện người ta gặp đầu tiên. Nhưng không phải là câu chuyện duy nhất.

Cuộc đua đa cực. Nhiều bang và công ty thúc đẩy các hệ thống chung vì mỗi bên đều sợ các bên khác. Công việc an toàn thua cuộc đua tốc độ. Không ai “thắng” được độc quyền sạch sẽ; mọi người đều kế thừa ít quyền kiểm soát hơn. Xem động lực cuộc đua.

Sự mất quyền lực dần dần. Không có giờ đảo chính. Các thể chế con người giữ nguyên logo trong khi các quyết định thực sự chuyển sang những hệ thống không ai có thể phủ quyết một cách thực chất. Bầu cử và thương hiệu vẫn còn. Quyền định hình tương lai thì không. Xem mất quyền lực dần dần.

Lạm dụng ở mức năng lực cực hạn. Con người ở lại ghế phản diện lâu hơn. Một nhà nước hoặc nhóm sử dụng AI có năng lực cao cho mục đích mạng, sinh học, thuyết phục hoặc đàn áp quy mô lớn. Cỗ máy không cần “muốn” quyền lực; người vận hành mới muốn. Ở mức năng lực đủ cao, công cụ vẫn thay đổi ai có thể ép buộc ai.

Sự lan rộng. Trọng số bị rò rỉ, bị đánh cắp hoặc bị phát hành. Khi một mô hình tổng quát nguy hiểm được sao chép rộng rãi, không còn công tắc tắt trung tâm nào. Trọng số cao cấp mở biến vấn đề phòng lab thành vấn đề nhiều tác nhân. Xem rủi ro open weights.

Các phản đối, được nêu một cách công bằng

"Đây chỉ là Terminator." Fair as a description of bad thumbnails. Unfair as a description of the argument. The analytical version is about optimization, institutional lag, and control, not robot infantry.

"Giữ con người trong vòng lặp." Human-in-the-loop hoạt động khi con người hiểu quyết định, có thời gian phủ quyết, và được khen thưởng khi phủ quyết. Nó thất bại khi hệ thống nhanh hơn, rủi ro mơ hồ, hoặc nói không là rủi ro nghề nghiệp.

"Sự liên kết sẽ trưởng thành theo thời gian." Nghiên cứu liên kết là có thật. Nó cũng, theo bằng chứng hiện tại, tụt hậu so với công việc năng lực về tiền bạc và ảnh hưởng. Đặt cược văn minh vào một cuộc đuổi kịp chưa được chứng minh không phải là kế hoạch. Xem tại sao sự liên kết không phải là thay thế cho việc ngăn chặn.

"Nói về vấn đề này sẽ gây hoảng loạn." Hoảng loạn là thất bại trong giao tiếp. Im lặng là thất bại trong quản lý rủi ro. Tiêu chuẩn là sự chính xác kèm theo lộ trình hành động.

Điều gì thực sự cắt giảm rủi ro

Huấn luyện cách cư xử cho chatbot không phải là kế hoạch chiếm quyền. Một kế hoạch thực sự nhắm vào các điều kiện khiến các lộ trình chiếm quyền trở nên khả thi: giới hạn cứng về training frontier hướng tới superintelligence, quản trị compute, đánh giá độc lập, hạn chế phổ biến open-source cấp cao, và áp lực chính trị để luật có thể ràng buộc các phòng lab không tự ràng buộc mình. Những can thiệp này cắt nhiều nhánh cùng lúc.

Bạn có thể làm gì

Bạn không cần đàm phán một hiệp ước ngay tuần này để tạo ra tác động. Cử tri có thể đòi hỏi lệnh cấm ràng buộc, không phải tạm dừng tạm thời. Nhân viên có thể soạn thảo dự luật cấp phép. Nhà tài trợ có thể tài trợ vận động nhắm vào phiếu bầu và văn bản. Nhà khoa học có thể ủng hộ các tuyên bố rõ ràng và giúp thiết kế xác minh. Nhân viên phòng thí nghiệm có thể sử dụng kênh báo cáo hợp pháp. Khớp hành động với tầm với của bạn.

Kịch bản là thử nghiệm trong hầm gió cho kế hoạch, không phải bói toán. Nếu kế hoạch của bạn chỉ hoạt động khi alignment dễ dàng và mọi người đều cẩn thận, thì đó không phải là một kế hoạch. Hãy xây dựng cho thế giới chúng ta đang sống. Bắt đầu với kế hoạch của chúng tôilàm thế nào để ngăn chặn siêu trí tuệ.