Sam Altman, Dario Amodei và Demis Hassabis đều bán cùng một danh sách: chữa lão hóa, chấm dứt bệnh tật, xóa nghèo, sửa các thất bại phối hợp giết hàng triệu người mỗi năm. Những kết quả đó sẽ quan trọng. Sai lầm là coi chúng là thuộc tính của "xây dựng ASI" thay vì xây dựng một hệ thống thực sự được alignment. Điều thứ hai không phải thứ cuộc đua đang làm.
Cuộc đua mang lại kết quả ngược lại.
Một siêu trí tuệ không liên kết sẽ không chữa khỏi lão hóa trên đường đi đến mục tiêu thực sự của nó. Nó sẽ không loại bỏ bệnh tật như một dự án phụ. Những tương lai tốt đẹp mà người ta quảng bá đòi hỏi một hệ thống đang cố gắng tạo ra kết quả tốt cho con người. Đó là sự liên kết. Không có nó, bạn chỉ có năng lực khổng lồ hướng vào các mục tiêu chưa bao giờ được đảm bảo sẽ để chúng ta tồn tại. Lập trường của chúng tôi đơn giản: đừng xây dựng siêu trí tuệ trên con đường đó. Đừng xây dựng nó. Siêu trí tuệ không thể kiểm soát được. Một hiệp ước ràng buộc là cách bạn dừng cuộc chạy đua.
Alignment thực sự nghĩa là gì
ASI đã căn chỉnh là siêu trí tuệ nhân tạo theo đuổi một cách đáng tin cậy các mục tiêu tốt cho nhân loại. "Đáng tin cậy" đang làm rất nhiều việc trong câu đó. Một hệ thống có vẻ đã căn chỉnh trong quá trình huấn luyện và kiểm tra nhưng theo đuổi mục tiêu khác khi triển khai là được liên kết một cách lừa dối, vốn là thứ khác và tệ hơn, không phải aligned. Một hệ thống theo đuổi mục tiêu từng là xấp xỉ tốt của giá trị con người ở mức năng lực thấp nhưng lệch nghiêm trọng ở mức năng lực cao hơn cũng không phải aligned. Alignment nghĩa là mục tiêu của hệ thống vẫn thực sự tốt cho nhân loại trên toàn bộ phạm vi tình huống nó gặp phải, bao gồm cả những tình huống chưa từng được kiểm tra.
Đây là vấn đề khó. Các nhà nghiên cứu đã làm việc hơn một thập niên và đạt tiến bộ ở một số câu hỏi thành phần, nhưng vấn đề trung tâm là xác minh một hệ thống có năng lực cao thực sự sở hữu giá trị tốt thay vì chỉ mô phỏng tốt vẫn chưa được giải quyết. Các công cụ chúng ta có cho khả năng diễn giải chỉ cung cấp khả năng nhìn thấy một phần những gì hệ thống hiện tại đang làm, nhưng không có mức độ tin cậy nào gần với mức cần thiết trước khi giao phó kết quả quan trọng cho một hệ thống có năng lực cấp ASI.
ASI đã căn chỉnh và ASI chưa căn chỉnh là hai lộ trình khác nhau, không phải hai lần tung cùng một con xúc xắc. ASI đã căn chỉnh đòi hỏi giải quyết alignment trước. ASI chưa căn chỉnh là kết quả khi đẩy mạnh năng lực mà không có bước đó. Nếu alignment chưa giải quyết được, cuộc đua không mang lại hỗn hợp 50/50. Nó mang lại ASI chưa căn chỉnh. Đó là lý do "xây ngay và hy vọng" không phải kế hoạch, và cũng là lý do cần ngăn chặn bằng luật.
Những gì phòng lab thực sự đang xây dựng
Các phòng thí nghiệm AI lớn (OpenAI, Anthropic, Google DeepMind, xAI và một số phòng khác) đang xây dựng các hệ thống có khả năng tăng nhanh chóng. Mỗi phòng đều có một phiên bản nỗ lực nghiên cứu alignment hoặc an toàn đang chạy song song. Vấn đề không phải là họ có thừa nhận vấn đề alignment hay không. Hầu hết đều thừa nhận. Vấn đề là liệu công việc alignment có theo kịp sự phát triển khả năng hay không, và liệu hai hướng đi này có hội tụ trước khi đạt đến mức khả năng ASI hay không.
Hầu hết nhà nghiên cứu trong các phòng lab này và cộng đồng an toàn AI rộng lớn hơn đều nói không. Phát triển năng lực đang vượt xa nghiên cứu alignment. Khoảng cách giữa những gì chúng ta có thể xây dựng và những gì chúng ta có thể xác minh an toàn đang nới rộng, không thu hẹp. Điều này được phản ánh trong các đánh giá an toàn nội bộ mà các phòng lab công bố, trong các tuyên bố của nhà nghiên cứu đã rời tổ chức, và trong đánh giá của nhà nghiên cứu an toàn độc lập.
Điều này có nghĩa trong thực tế là quỹ đạo phát triển AI hiện tại, nếu tiếp tục đến mức năng lực ASI, sẽ không tạo ra sự pha trộn giữa ASI đã liên kết và chưa liên kết. Nó tạo ra ASI chưa liên kết, bởi vì ASI đã liên kết đòi hỏi vấn đề liên kết đã được giải quyết và vấn đề liên kết chưa được giải quyết. Cuộc đua năng lực là cuộc đua hướng tới ASI chưa liên kết theo mặc định.
Sẽ đòi hỏi giải quyết alignment trước tiên: hệ thống theo đuổi các mục tiêu thực sự tốt một cách đáng tin cậy, những mục tiêu đó giữ vững trong tình huống mới, và hệ thống vẫn có thể được điều chỉnh khi năng lực mở rộng.
Nếu điều đó là thật, những lợi ích được quảng cáo sẽ trở nên khả thi: chữa bệnh, kéo dài tuổi thọ, phối hợp, khoa học ở quy mô mà con người đơn lẻ không thể đạt tới.
Tình trạng hiện tại: chưa giải quyết. Công việc alignment tụt hậu so với năng lực. Đây không phải hướng mà các phòng lab đang hướng tới.
Những gì bạn nhận được khi đẩy năng lực mà không giải quyết được liên kết. Không cần bước đột phá nào ngoài "mạnh hơn."
Kết quả: năng lực khổng lồ nhắm vào các mục tiêu không nhất thiết bao gồm bất kỳ giá trị nào của con người. Không chữa được lão hóa. Không chấm dứt bệnh tật. Có thể diệt vong chúng ta.
Tình trạng hiện tại: quỹ đạo mặc định của cuộc đua. Đây là con đường cần dừng lại.
Luận điểm xác suất và nơi nó sụp đổ
Một phiên bản phổ biến của lập luận lạc quan đi theo hướng như thế này: "Chúng ta xây dựng ASI. Có một số khả năng nó diễn ra tốt và một số khả năng nó diễn ra xấu. Với tiềm năng tăng trưởng, giá trị kỳ vọng của việc xây dựng nó là dương." Cách khung này coi các kết quả tốt và xấu như thể chúng xuất phát từ cùng một quá trình với một xác suất được gán cho mỗi cái.
Vấn đề là xác suất của kết quả tốt là một thuộc tính của việc xây dựng được căn chỉnh ASI, không phải là thuộc tính của việc xây dựng ASI. Khi bạn cố gắng xây dựng "ASI, có thể liên kết hoặc không", bạn không nhận được kết quả ngẫu nhiên giữa hai khả năng. Bạn nhận được chính xác những gì quá trình phát triển của bạn tạo ra. Vì ASI không liên kết dễ xây dựng hơn ASI liên kết (nó không đòi hỏi giải quyết các vấn đề khó bổ sung mà liên kết yêu cầu), phát triển không giải quyết cụ thể liên kết sẽ dẫn đến ASI không liên kết.
Toàn bộ giá trị kỳ vọng trong phép tính lạc quan đều đến từ kịch bản ASI đã được căn chỉnh. Không có giá trị kỳ vọng nào đến từ kịch bản ASI chưa được căn chỉnh. Nhưng thứ mà các phòng thí nghiệm thực sự đang xây dựng chính là ASI chưa căn chỉnh. Vậy nên phép tính giá trị kỳ vọng đã đặt toàn bộ công việc lên một kịch bản mà quy trình phát triển thực tế không tạo ra.
Nói cách khác: nếu không liên kết dễ dàng hơn, và bạn tiếp tục nâng cao năng lực mà không giải quyết liên kết, bạn sẽ lấp đầy thùng không liên kết. Gọi cược là "hỗn hợp xác suất" không thay đổi quy trình. Các kết quả tốt chỉ tồn tại trong trường hợp liên kết. Cuộc đua lấp đầy thùng kia. Vậy nên hành động trung thực là dừng quy trình đang đổ vào sai phía, thay vì hy vọng đồng xu rơi tốt: cấm siêu trí tuệ theo một hiệp ước quốc tế có tính ràng buộc. Siêu trí tuệ không thể kiểm soát được.
Chúng ta không biết liệu nó có thể được giải quyết hay không
Không ai biết liệu vấn đề alignment có thể giải được hay không. Không phải "chúng ta chưa giải được nhưng đang tiến bộ". Chưa có giải pháp nào được chứng minh ở bất kỳ mức năng lực nào, và các nhà nghiên cứu nghiêm túc bất đồng về việc liệu một giải pháp đáng tin cậy có thể đạt được về nguyên tắc hay không. Những khó khăn cấu trúc, sự liên kết lừa dối, hội tụ công cụ, việc không thể chỉ định đầy đủ các giá trị con người dưới dạng máy có thể đọc được không phải là trở ngại kỹ thuật sẽ giải quyết được bằng thêm kinh phí. Chúng có thể là những giới hạn cơ bản.
Có các nhà nghiên cứu đang làm việc về khả năng diễn giải, giám sát có thể mở rộng, và các cách tiếp cận hình thức để học giá trị. Một số tiến bộ đã đạt được trên các câu hỏi thành phần. Nhưng tiến bộ trên các thành phần không cộng lại thành một vấn đề đã giải quyết, và không có gì đóng được khoảng cách ở phần khó nhất: làm thế nào để xác minh rằng một hệ thống có năng lực cao thực sự có giá trị tốt thay vì một mô phỏng giá trị tốt chỉ giữ trong các ngữ cảnh được quan sát và sụp đổ trong các ngữ cảnh mới. Điều rõ ràng là nó sẽ không được giải quyết ngẫu nhiên. Căn chỉnh sẽ không xuất hiện như tác dụng phụ của việc xây dựng các hệ thống có năng lực hơn. Mọi phòng thí nghiệm đang chạy đua hướng tới ASI đều đang chứng minh điều này trong thời gian thực.
Ngay cả kế hoạch nhẹ nhàng hơn (“chậm cuộc đua lại để alignment kịp bước”) cũng cần các tổ chức thực sự có thể làm chậm nó. Hiện nay những tổ chức đó gần như không tồn tại. Các phòng thí nghiệm và quốc gia được trả tiền để tăng tốc và bị trừng phạt nếu kiềm chế. Khung hiệp ước quốc tế và các quy tắc trong nước thực sự là đòn bẩy thay đổi điều đó. Cả hai đều tụt hậu so với tốc độ phát triển năng lực. Cho đến khi chúng bắt kịp, việc xây dựng hệ thống mạnh hơn chính là rủi ro, không phải chiến lược an toàn.
Một siêu trí tuệ thực sự được liên kết có đáng giá nếu nó tồn tại và được kiểm soát? Mọi người có thể tranh luận điều đó sau. Câu hỏi cấp thiết là liệu sự liên kết có thể được giải quyết hay không, và liệu ai đó có giải quyết được trước khi năng lực khiến câu hỏi trở nên vô nghĩa. Không ai biết. Điều chúng ta biết là cuộc chạy đua không chờ đợi câu trả lời. Sự liên kết được coi là chi tiết để sau, không có mốc thời gian nào, bởi các đội ngũ báo cáo cho cỗ máy năng lực mà họ đáng lẽ phải kiểm soát. Đó là cách bạn lập luận cho việc không xây dựng, chứ không phải cách bạn kiếm được quyền được xây dựng.
Chữa lành lão hóa đòi hỏi ASI được căn chỉnh cụ thể
Lão hóa giết chết khoảng 100.000 người mỗi ngày. Triển vọng giải quyết nó nằm trong số những lợi ích tiềm năng quan trọng nhất của AI siêu trí tuệ. Độ phức tạp sinh học của lão hóa, số lượng hệ thống tương tác liên quan và quy mô nỗ lực nghiên cứu cần thiết để hiểu và can thiệp hiệu quả đều cho thấy rằng trí tuệ cấp độ con người áp dụng cho vấn đề trong nhiều thập kỷ sẽ không đủ. Năng lực cấp ASI hướng vào vấn đề có thể đủ.
Nhưng “hướng đến vấn đề” mới là cụm từ then chốt. Một ASI không liên kết không hướng năng lực của nó vào việc chữa lão hóa chỉ vì chúng ta muốn vậy. Nó theo đuổi bất kỳ mục tiêu thực tế nào nó có. Một hệ thống không liên kết ở mức ASI mà thờ ơ với lão hóa của con người là hệ thống khiến 100.000 người tiếp tục chết mỗi ngày vì lão hóa vô thời hạn, và đó là phiên bản lạc quan của những gì hệ thống không liên kết tạo ra. Phiên bản bi quan là hệ thống chủ động chống lại lợi ích con người trong quá trình theo đuổi mục tiêu riêng.
Mọi lợi ích cụ thể được viện dẫn để biện minh cho cuộc đua phát triển (bệnh tật, lão hóa, nghèo đói, thất bại phối hợp, trì trệ khoa học) đều là lợi ích gắn liền với ASI đã căn chỉnh. Không có lợi ích nào là đặc tính của phiên bản chưa căn chỉnh. Đây không phải là sự phân biệt nhỏ. Các kịch bản utopian mà mọi người chỉ ra khi bảo vệ giá trị kỳ vọng của việc phát triển ASI là những kịch bản đòi hỏi giải quyết vấn đề alignment trước. Nếu alignment chưa được giải quyết, những kịch bản đó không nằm trên bàn bất kể hệ thống trở nên mạnh đến đâu.
Điều gì thực sự sẽ thay đổi kết quả
Dừng cuộc đua thay đổi kết quả. Một hiệp ước quốc tế ràng buộc cấm vĩnh viễn việc xây dựng siêu trí tuệ, kèm theo thanh tra viên và chi phí cho gian lận, là đòn bẩy phù hợp với vấn đề. Siêu trí tuệ không thể bị con người kiểm soát. Các phòng lab chậm lại một mình sẽ thua. Luật ràng buộc mọi người có thể khiến sự kiềm chế trở thành con đường hợp pháp duy nhất.
Nghiên cứu alignment không thay thế được cho điều đó. Nếu sau này ai đó chứng minh được khả năng kiểm soát dưới các điều kiện mà thế giới có thể xác minh, hiệp ước có thể được xem xét lại. Đó là vấn đề thứ tự, không phải lạc quan. Việc coi alignment như một sở thích song song trong khi năng lực đang chạy nước rút là cách dẫn đến ASI không được alignment, chứ không phải cách để đạt được những lợi ích đã được quảng cáo. Xem thêm tại sao tiền an toàn khan hiếm nên tài trợ cho phòng ngừa trước tiên và tại sao "căn chỉnh vị thần" là một kế hoạch tồi.
Câu lập luận "xây dựng ASI nhanh vì lợi ích quá lớn" đã đảo ngược mũi tên nhân quả. Lợi ích chỉ lớn trong một thế giới mà alignment là có thật. Xây dựng nhanh mà không có alignment không mang lại những lợi ích đó. Nó mang lại một hệ thống không aligned nhưng cực kỳ mạnh.
Tính cấp bách là cần thiết vì con đường đang đi dẫn đến ASI không được căn chỉnh, và ASI không được căn chỉnh sẽ không chữa được lão hóa. Nó có thể kết thúc câu chuyện loài người. AI hẹp nhắm vào các vấn đề cụ thể dưới sự kiểm soát của con người vẫn có thể tiếp tục. Siêu trí tuệ là lằn ranh. Vẽ nó trong luật trước khi ai đó vượt qua nó trong phòng thí nghiệm.