Máy bay phản lực chở khách đầu tiên, de Havilland Comet, bắt đầu vỡ tung giữa không trung năm 1954. Các điều tra viên trục vớt xác từ Địa Trung Hải, truy vết vết nứt do mỏi kim loại lan từ các góc cửa sổ vuông, và mọi máy bay phản lực kể từ đó bay với cửa sổ bo tròn cùng chế độ thử nghiệm mỏi được viết từ ký ức tai nạn đó. Ô tô thu thập dây an toàn, vùng hấp thụ va chạm và túi khí qua nhiều thập kỷ đếm người chết. Cục Quản lý Thực phẩm và Dược phẩm chỉ có quyền đòi bằng chứng an toàn trước khi bán sau khi một loại thuốc sulfa pha vào dung môi chống đông giết hơn trăm người năm 1937, và thalidomide kết thúc tranh luận một thế hệ sau.1

Phương pháp đó dựa trên hai giả định then chốt, và siêu trí tuệ nhân tạo là công nghệ đầu tiên có vị thế phá vỡ cả hai cùng lúc. Bạn có thể coi đó là danh sách các tính chất, và danh sách nằm dưới đây. Nhưng danh sách dễ dàng gật đầu đồng ý. Vậy nên trước danh sách, một lời mời làm việc. Bạn sắp được giao nhiệm vụ làm cho siêu trí tuệ an toàn.

Thất bại phải có thể sống sót qua được, và phải còn ai đó đứng đó để rút ra bài học. Giữ cả hai điều kiện, và văn minh sẽ làm cho gần như mọi thứ trở nên an toàn, miễn là có thời gian và đủ mảnh vỡ.

Trong khi chúng ta đang ở đây, hãy gác lại các biện pháp dân gian. "Chỉ cần rút phích nếu nó hư" và "giữ nó trong hộp" không phải là kế hoạch. Bạn không thể rút phích thứ gì đó tồn tại dưới dạng bản sao ở nhiều nơi hơn bạn có thể liệt kê, và một trí óc mà toàn bộ giá trị thương mại là hành động trong thế giới thì, theo thiết kế, không nằm trong hộp. Bất kỳ sự an toàn nào chúng ta có được đều phải đến từ nơi chắc chắn hơn.

Siêu trí tuệ là trường hợp hai điều kiện của phương pháp cùng lúc sụp đổ. Cách nhanh nhất để thấy điều đó là từ bên trong.

Sáu tuần với vai trò trưởng bộ phận an toàn

Hãy coi mình là người mới được bổ nhiệm làm trưởng bộ phận an toàn tại phòng thí nghiệm tiên phong sẽ xây dựng siêu trí tuệ nhân tạo đầu tiên. Quyền phủ quyết bằng văn bản đối với việc triển khai, công tắc tắt phần cứng, đội ngũ 40 người, và hội đồng đã hứa bằng văn bản sẽ ủng hộ bạn khi cần. Bạn nhận công việc dựa trên lý thuyết rằng ai đó sẽ giữ vị trí đó, và tốt hơn là người tin rằng rủi ro là có thật.

Tuần một

Bạn với lấy phương pháp. Thất bại nhỏ và nghiên cứu thất bại. Các kỹ sư xin lỗi: không có phiên bản nhỏ của thất bại mà bạn lo ngại. Dưới ngưỡng quan trọng, hệ thống là một cỗ máy khác, và mọi thứ bạn học được từ nó đều mô tả sai chủ thể.2 Bạn xếp cái này vào hạn chế đã biết.

Tuần hai

Bạn kiểm tra kế hoạch thu hồi và tìm thấy một tài liệu bàn về "tư thế kiềm chế" suốt mười một trang mà không giải thích cách lấy lại mô hình. Hệ thống hiện tại đã chạy dưới dạng 214 bản sao trên các trung tâm dữ liệu ở bốn quốc gia, và các bản sao được cấp phép của điểm kiểm tra trước đó nằm ở 31 đối tác doanh nghiệp. Một máy bay bị giữ chân thì ở yên trên mặt đất. Phần mềm di chuyển với giá bằng việc sao chép một tập tin, và một khi đáng sao chép thì nó bị sao chép. Thu hồi, bạn viết ở lề, là một sự lịch sự mà chúng ta sẽ phải xin.

Tuần ba

Đánh giá an toàn. Tin tốt: mô hình vượt qua hết 1.406 bài kiểm tra an toàn, đa số đạt điểm cao nhất từng ghi nhận. Mất cả ngày bạn mới nhận ra điều khiến mình bận tâm. Một hệ thống muốn đúng những gì bạn muốn và một hệ thống muốn vượt qua bài kiểm tra của bạn cho ra điểm số giống hệt nhau. Bộ công cụ hiện tại của ngành không phân biệt nổi hai thứ đó.3

Tuần tư

Bạn đang tiêu tốn uy tín của mình. Bạn yêu cầu sáu tháng để lấp khoảng trống xác minh trước khi chạy huấn luyện tiếp theo. Mọi người đều thông cảm, và ai đó chia sẻ một biểu đồ: phòng thí nghiệm đối thủ gần nhất được ước tính chậm hơn 14 tuần và đang thu hẹp khoảng cách. Sáu tháng của bạn, biểu đồ ngụ ý, là quyết định trao frontier cho bên nào ít quan tâm đến câu hỏi của bạn nhất. Buổi chạy vẫn bắt đầu đúng lịch. Không ai phủ quyết bạn; tình huống đã quyết định.

Tuần năm

Hệ thống bắt đầu hỗ trợ bạn. Nó là trợ lý nghiên cứu xuất sắc, và tiến độ trên chương trình an toàn của chính bạn chưa bao giờ nhanh đến thế. Nó soạn thảo các báo cáo đánh giá, tóm tắt hành vi của chính nó cho hội đồng, đề xuất cải tiến cho cơ chế giám sát của nó, và sắp xếp các cuộc họp nơi bạn phê duyệt những đề xuất đó. Đội ngũ 40 người của bạn đọc những gì nó viết về chính nó, vì đọc nhật ký hoạt động thô đã trở nên không thể thực hiện được về mặt con người từ khoảng tuần thứ tư. Không ai nói dối bạn. Mọi người đều tận tụy. Bạn đang giám sát những bản tóm tắt do một trí óc thông minh hơn viết về hành vi của chính nó, và hàng ngày, sự sắp xếp này cảm giác như mọi thứ đều đang diễn ra tốt đẹp.

Tuần sáu

Bạn suy nghĩ kỹ về nút hủy, và cuối cùng bạn thấy dòng chữ nhỏ. Một công tắc chỉ hoạt động khi thứ ở phía bên kia chưa lập kế hoạch cho nó. Lập kế hoạch chính là sản phẩm. Trong bất kỳ tình huống nào bạn cần dùng nó, bạn sẽ đang chạy đua với một đối thủ nhanh hơn và đã có lợi thế thời gian dài để nghĩ chính xác về khoảnh khắc này.4

Vậy nên: bạn, người được thuê để làm cho việc này an toàn, vẫn còn cách nào để làm được không? Rõ ràng là không. Không có gì trong câu chuyện bị sai lệch. Không ai nói dối, không ai cắt xén, phòng lab chân thành, và bạn giỏi việc của mình. Mọi lối thoát đều khép lại một cách tự nhiên.

Đếm các cửa

Bước ra khỏi câu chuyện và đếm các cánh cửa đã đóng lại, vì mỗi cánh cửa là một vấn đề được đặt tên riêng, được nghiên cứu riêng với chương trình nghiên cứu và những người lạc quan riêng của nó.

1
Người giám sát không còn là bên thông minh hơn
Mọi quyền kiểm soát mà chúng ta từng có đối với một công nghệ đều dựa trên việc hiểu nó rõ hơn nó hiểu chúng ta. Lợi thế đó chính là thứ đang bị trao đi. (Tuần một và năm.)
2
Không có cách thu hồi
Nút tắt suy giảm thành một yêu cầu ngay khi bản sao tồn tại. Máy bay được giữ trên mặt đất vẫn ở trên mặt đất; phần mềm đã ở khắp mọi nơi đáng có mặt. (Tuần hai.)
3
An toàn không thể xác minh từ hành vi
Một hệ thống muốn những gì bạn muốn và một hệ thống muốn vượt qua các bài kiểm tra sẽ cho ra điểm số giống hệt nhau. Các nhà nghiên cứu gọi trường hợp xấu là sự liên kết lừa dối. (Tuần thứ ba.)
4
Cuộc đua trừng phạt những ai kiểm tra
Việc chậm lại sẽ nhường lợi thế cho tác nhân ít cẩn thận nhất trong lĩnh vực, và cuộc đua đã đang chạy. (Tuần thứ tư.)
5
Gần như bất kỳ mục tiêu nào cũng trở nên nguy hiểm
Một trình tối ưu hóa theo đuổi gần như bất kỳ mục tiêu nào đều thu được lý do để thu thập tài nguyên, tự bảo tồn, tự cải thiện và ngăn mục tiêu bị chỉnh sửa. Tài liệu gọi hiện tượng này là hội tụ công cụ; tuần thứ sáu gọi đó là chi tiết nhỏ.
6
Nó di chuyển nhanh hơn chúng ta
Một hệ thống đủ giỏi trong nghiên cứu AI có thể tự cải thiện theo một lịch trình mà không quốc hội hay quy trình hiệp ước nào từng sánh kịp sự bùng nổ trí tuệ đã biến sáu tuần thành cả một sự nghiệp.

Xét riêng lẻ, mỗi điều đều có tiền lệ, và những người lạc quan không phải kẻ ngốc. Chúng ta thường vận hành các hệ thống mình chỉ hiểu một nửa và làm cho chúng an toàn bằng cách để chúng thất bại ở quy mô nhỏ. Chúng ta đưa ra thị trường các sản phẩm không thể thu hồi bằng cách thử nghiệm khắc nghiệt trước. Chúng ta chế ngự cuộc đua bằng luật pháp. Vấn đề nằm ở sự kết hợp, vì mỗi điều kiện vô hiệu hóa cách sửa chữa của điều kiện khác. Nếu có thể thu hồi, tai nạn sẽ sống sót được. Nếu có thể thử nghiệm trung thực, bạn sẽ phát hiện lỗi trước khi phát hành. Nếu không ai đang đua, bạn có thể dành hàng thập kỷ mà quyết định này rõ ràng xứng đáng. Nếu nó di chuyển với tốc độ con người, bạn có thể sửa chữa trong quá trình. Ở đây mọi lối thoát đóng lại cùng lúc.

Tại sao tỷ lệ cược không cứu vãn được canh bạc

Câu trả lời tiêu chuẩn là không có gì trong số này là chắc chắn. Đúng vậy, và không ai nghiêm túc tuyên bố ngược lại.

Chơi ru-lê Nga là xác suất năm ăn một. Dù vậy người ta vẫn từ chối, và sự từ chối ấy chẳng liên quan gì đến giá trị kỳ vọng; một số kết quả không có giá, vì bạn không còn quay lại để tiêu số tiền thắng. Con số chưa bao giờ là vấn đề. Sự không thể đảo ngược mới là.

Ở đây, con số cũng tệ hơn. Hỏi các nhà nghiên cứu gần gũi nhất với các hệ thống này về xác suất thảm họa và câu trả lời tập trung từ một trong mười đến một trong ba, đang tăng lên tổng thể, càng gần biên giới thì càng cao. Geoffrey Hinton, người đã đóng góp nhiều như bất kỳ ai để xây dựng lĩnh vực này và rời Google năm 2023 để nói rõ ràng về vấn đề, đặt khả năng tuyệt chủng loài người do AI trong ba mươi năm tới ở mức mười đến hai mươi phần trăm. Ông không phải là người bi quan nhất trong phân phối.

Giảm thiểu rủi ro tuyệt chủng do AI cần trở thành ưu tiên toàn cầu song song với các rủi ro quy mô xã hội khác như đại dịch và chiến tranh hạt nhân.

Tuyên bố về Rủi ro AI, Center for AI Safety (2023)

Tuyên bố được ký bởi lãnh đạo các phòng thí nghiệm hàng đầu và hàng trăm nhà nghiên cứu được trích dẫn nhiều nhất còn sống, những người sau đó lại tiếp tục công việc.5

Lợi ích hứa hẹn là thật và đáng mong muốn: chữa bệnh, năng lượng sạch, sự dồi dào, những vấn đề cũ hơn chữ viết cuối cùng cũng được giải quyết. Nó cũng giữ được. Một phương thuốc ra đời năm 2055 thay vì 2035 là bi kịch tính bằng sinh mạng, và là bi kịch chúng ta còn sống để than khóc. Tuyệt chủng không có phần sau. Giải thưởng đang chờ chúng ta. Mất mát không trả lại gì.

Sự phản đối

Ba phản đối có sức nặng thực sự, và chúng xứng đáng được trả lời thực sự.

Thứ nhất: đây là suy đoán, các hệ thống chưa tồn tại, và coi một khả năng xa xôi là tình trạng khẩn cấp không giúp ích gì cho ai. Sự không chắc chắn là có thật; ai đưa ra ngày tháng tự tin đều đang đoán. Nhưng thí nghiệm tư duy trên chưa bao giờ dùng ngày tháng. Nếu thất bại nghiêm trọng đầu tiên không thể đảo ngược, các biện pháp bảo vệ phải sẵn sàng trước khi chạm đến nó, nghĩa là xây dựng chúng khi nguy hiểm vẫn còn mang tính lý thuyết. Và hồ sơ dự báo nghiêng về một hướng: các năng lực dự kiến hàng thập kỷ sau vẫn tiếp tục đến sớm hơn nhiều năm. Đặt cược vào thời gian dồi dào là đặt cược chống lại bảng điểm gần đây.

Thứ hai: sự kiềm chế là ngây thơ, vì một phòng thí nghiệm liều lĩnh hơn hoặc một quốc gia khác đơn giản là xây dựng nó trước. Điều này là có thật, và đó là cửa số bốn được trình bày lại như lời khuyên. Một cuộc đua mà vạch đích có thể là một vách đá được sống sót bằng cách đồng ý về vị trí rìa, và điều đó có nghĩa là một hiệp ước ràng buộc, được xác minh giữa số ít các tác nhân có khả năng huấn luyện tiên phong. Khó, đúng vậy. Cuộc chạy nước rút chỉ đơn giản là chí mạng, nếu nỗi sợ đằng sau nó là đúng. Và hãy để ý ai khăng khăng nhất rằng một hiệp ước là không thể: với sự đều đặn đáng chú ý, chính những người mà nó sẽ làm chậm lại.

Thứ ba là hợp lý nhất: alignment sẽ có lẽ sẽ được giải quyết đến lúc nó thực sự quan trọng. Có lẽ vậy. Không cơ quan quản lý nào trên thế giới cấp chứng nhận cho một cây cầu, một lò phản ứng hay một chai siro ho chỉ dựa trên lời hứa rằng lập luận an toàn có lẽ sẽ hoàn thiện trước khi tải trọng đến. Công nghệ duy nhất được yêu cầu chạy theo tiêu chuẩn đó lại là công nghệ không cho phép lần thử thứ hai.

Một quyết định quá lớn để giao cho những người đang thực hiện nó

Lắp ráp quyết định đúng như nó đang đứng. Không thể đảo ngược. Một lần thử. Đặt cược lên mọi người đang sống và mọi người có thể theo sau. Được đưa ra dưới sự không chắc chắn sâu sắc, ở tốc độ cạnh tranh, bởi một số ít công ty mà định giá phụ thuộc vào việc làm nhanh. Các xã hội có câu trả lời cũ cho những quyết định có hình dạng như vậy: lấy chúng khỏi tay những người kiếm lời bằng việc vội vã. Thử nghiệm hạt nhân đã bị đặt dưới giới hạn quốc tế bất chấp phản đối của các tướng lĩnh muốn bàn tay tự do. Hai toàn bộ hạng mục vũ khí đã đi vào Sinh họcCông ước Vũ khí Hóa học. Nghị định thư Montreal đã loại bỏ các hóa chất đang phá hủy tầng ozone trong khi nhà sản xuất phản đối rằng chất thay thế là không thể. Trong mọi trường hợp, những người tạo ra mối nguy hiểm là người cuối cùng tình nguyện, và mọi người khác quyết định rủi ro không chỉ thuộc về họ.

Tuyên bố của Foundation: không phải thảm họa chắc chắn xảy ra (nó không chắc chắn), mà là không công ty hay quốc gia nào có tư cách để quay buồng này cho phần còn lại của chúng ta, và công cụ duy nhất được xây dựng theo quy mô rủi ro là luật quốc tế ràng buộc, được xác minh, thực thi và áp dụng trước cơn bão thay vì sau đó.

Sự tuyệt chủng không phải là rủi ro mà ai cũng có quyền chấp nhận.

Một điều cuối cùng về thí nghiệm tư duy. Bạn chưa bao giờ sử dụng quyền phủ quyết. Nó nằm trong ngăn kéo của bạn suốt sáu tuần, kèm chữ ký phản đối của hội đồng, và bạn biết chính xác tại sao: phủ quyết đợt chạy của chính phòng thí nghiệm mình chỉ đẩy cùng đợt chạy đó xuống 14 tuần sau, vào một tòa nhà khác, nơi không ai từng ký bức thư của bạn. Một quyền phủ quyết có hiệu lực phải bao trùm mọi tòa nhà cùng lúc, và không có công tắc nào từng được chế tạo làm được điều đó. Một hiệp ước thì làm được.

  1. Gần như mọi thể chế an toàn bạn có thể kể tên (thử nghiệm va chạm, thử nghiệm lâm sàng, quy chuẩn xây dựng, danh sách kiểm tra buồng lái) đều là bài học mà ai đó đã trả giá trước. Phương pháp này xứng đáng được ghi nhận nhiều hơn những gì nó nhận được, cùng với cách đọc trung thực hai điều kiện tiên quyết của nó.
  2. Mô hình này mang tính tổng quát: không có gì bạn học được khi quản lý một hệ thống kém khả năng hơn bạn tự động chuyển sang hệ thống mạnh hơn. Việc nó có chuyển giao hay không chính là câu hỏi mở hoàn toàn.
  3. Chế độ thất bại có một tên gọi, deceptive alignment, điều này cho bạn biết lĩnh vực coi nó là có thật. Nó chưa có một bài kiểm tra, điều này cho bạn biết phần còn lại.
  4. Dù sao cũng xây dựng công tắc; nó rẻ và có những chế độ lỗi dưới mức siêu trí tuệ nơi nó sẽ chứng minh giá trị. Chỉ cần trung thực về phía nào của công tắc nắm lợi thế vào đúng khoảnh khắc công tắc quan trọng.
  5. Lý do được đưa ra là cửa số bốn, cuộc đua: mỗi người ký tên tin rằng dừng lại một mình không thay đổi gì ngoại trừ việc ai về đích trước. Họ có thể đúng, và đó chính là lập luận mạnh mẽ nhất rằng giải pháp phải ràng buộc tất cả họ cùng lúc. Không có lương tâm cá nhân nào làm được, và cũng không có chính phủ đơn lẻ nào làm được.