Mỗi năm thế giới chi một gia tài để làm cho các hệ thống AI có năng lực hơn, và chỉ một khoản lẻ tẻ để làm cho trạng thái cuối cùng có thể sống sót. Bên trong khoản lẻ tẻ đó còn có một sai lầm nữa: hầu hết tiền an toàn vẫn giả định siêu trí tuệ sẽ được xây dựng, và cố gắng làm cho kết quả đó "diễn ra tốt đẹp."
Hầu hết tiền bạc và uy tín vẫn đổ vào việc làm cho cuộc đua an toàn hơn, chứ không phải chấm dứt cuộc đua đến ASI.
Giả định đó chính là vấn đề. Nếu trí tuệ siêu nhân tạo là công nghệ chúng ta hiện chưa kiểm soát được, thì việc sử dụng hợp lý nguồn vốn an toàn khan hiếm là ngăn chặn nó được tạo ra, chứ không phải tài trợ cho một phiên bản "thân thiện hơn" của cùng cuộc đua.
Tiền làm gì hôm nay
An toàn AI, hiểu theo nghĩa rộng, chủ yếu dựa vào khoảng $190 triệu mỗi năm. Công việc năng lực chạy bằng hàng chục tỷ đô. Trong phần an toàn, phần lớn dành cho alignment kỹ thuật: thủ thuật giám sát tốt hơn, red teaming tốt hơn, cách huấn luyện mô hình nói đúng thứ dưới điều kiện kiểm tra tốt hơn. Một phần trong đó hữu ích cho hệ thống ngày nay. Hầu như không có gì là giải pháp đã chứng minh cho hệ thống thông minh hơn người kiểm tra nó.
Lĩnh vực này biết rõ điều đó. Các bài báo về deceptive alignment, goal misspecification và evaluation gaming không phải bí mật. Các lab công bố kết quả cho thấy mô hình mưu mô dưới áp lực. Phản ứng quá thường là xin thêm ngân sách alignment để lần chạy huấn luyện sau an toàn hơn. Các lần chạy huấn luyện vẫn tiếp tục đúng lịch.
Căn chỉnh sau sự kiện là một canh bạc mà chúng ta liên tục mất quyền thực hiện
Nghiên cứu alignment kỹ thuật không phải vô ích. Nếu thế giới từng thông qua một hiệp ước đóng băng cuộc chạy đua siêu trí tuệ, chúng ta sẽ cần mọi công cụ nghiêm túc có thể có cho các hệ thống đã tồn tại, và cho bất kỳ công việc sau này nào được thực hiện dưới sự kiểm soát chặt chẽ.
Tài trợ căn chỉnh như kế hoạch chính trong khi các phòng thí nghiệm mở rộng hướng tới siêu trí tuệ nhân tạo coi đích đến là cố định. Nó không cố định. Các đích đến loại này được chọn. Kho vũ khí hạt nhân, hóa học ozone và nhân bản người từng có những khoảnh khắc thế giới quyết định một số trạng thái cuối cùng không đáng chịu rủi ro còn lại. Siêu trí tuệ nhân tạo thuộc danh sách đó vĩnh viễn. Siêu trí tuệ nhân tạo không thể kiểm soát được.
Nghiên cứu alignment giả định quả bom sẽ được xây dựng là một ngân sách an ủi bên cạnh dây chuyền lắp ráp.
Tiền nên được dùng ở đâu thay vào đó
Chuyển hướng nguồn lực alignment-for-ASI sang các công việc khiến việc không tạo ra trở nên có thể thực thi:
- Thiết kế hiệp ước, xác minh, và quản trị sức mạnh tính toán cấp chip có thể được kiểm tra qua biên giới.
- Vận động công chúng giữ mục tiêu rõ ràng: ngăn siêu trí tuệ, không phải "làm chậm AI" như một tâm trạng mơ hồ.
- Hỗ trợ người tố cáo, minh bạch sự cố và đánh giá độc lập làm tăng chi phí của các bước nhảy khả năng thầm lặng.
- Tổ chức chính trị để các nhà lập pháp lắng nghe từ cử tri, không chỉ từ các nhóm vận động hành lang của phòng lab.
Danh sách đó kém hào nhoáng hơn một kỹ thuật huấn luyện mới. Nó cũng là danh sách duy nhất khớp với chế độ thất bại. Một siêu trí tuệ chỉ hơi giỏi hơn trong việc nghe có vẻ aligned vẫn là một siêu trí tuệ. Một thế giới từ chối xây dựng nó có một tương lai mà nghiên cứu alignment có thể tiếp tục mà không có đồng hồ dán vào rủi ro tuyệt chủng.
Lý lẽ phản đối từ bên trong phòng lab
"Nếu chúng ta không giải quyết alignment, người khác sẽ xây dựng nó không an toàn." Nghe có lý: các nhà nghiên cứu ở tuyến đầu thường tin sự hiện diện của họ chính là yếu tố an toàn. Đôi khi họ đúng với các bản phát hành mô hình hiện nay. Lập luận này sụp đổ khi đến giới hạn. Một cuộc đua mà mỗi đội cần thêm một bước nhảy khả năng để tài trợ công việc an toàn cho bước nhảy sau vẫn là cuộc đua, chỉ đeo thêm huy hiệu.
Sự kiềm chế đơn phương từ một phòng thí nghiệm không phải là điều được yêu cầu. Một hiệp ước quốc tế ràng buộc là yêu cầu, cùng loại công cụ đã dùng khi mối nguy là chung và động cơ phản bội là có thật. Tài trợ an toàn có thể hỗ trợ chính trị đó. Nó không nên thay thế cho chính trị đó.
Sau một hiệp ước, tiếp tục nếu bạn muốn
Không có gì ở đây nói rằng khoa học alignment phải kết thúc mãi mãi. Sau lệnh cấm ràng buộc, có thể kiểm chứng đối với siêu trí tuệ, nghiên cứu trên các hệ thống đã tồn tại có thể tiếp tục theo các quy tắc không coi tuyệt chủng loài người là chi phí thí nghiệm chấp nhận được. Siêu trí tuệ không thể bị con người kiểm soát. Trước khi lệnh cấm đó có hiệu lực, mỗi đồng đô la khiến cuộc đua có vẻ dễ quản lý là một đồng đô la không được chi để chấm dứt cuộc đua.
Chuyển tiền đi. Đặt nó vào phòng ngừa, luật pháp và xác minh. Để giấc mơ về một vị thần được căn chỉnh hoàn hảo trên kệ cho đến khi thế giới đồng ý không chế tạo một vị thần trong bóng tối. Để lập luận dài hơn với câu chuyện tài trợ của phe longtermist ở cường độ đầy đủ, xem Longtermism hiểu đúng về rủi ro.