Hàn Quốc và Vương quốc Anh đồng chủ trì Hội nghị thượng đỉnh AI Seoul, cuộc họp thứ hai trong loạt hội nghị bắt đầu tại Bletchley Park tháng 11 năm 2023. Chương trình nghị sự chia rõ ràng. Trên lộ trình doanh nghiệp, các nhà phát triển hàng đầu đưa ra cam kết an toàn công khai. Trên lộ trình chính phủ, các quốc gia đồng ý tăng cường hợp tác về khoa học đánh giá. Những gì mỗi lộ trình mang lại và những gì còn bỏ ngỏ vẫn là cách đọc rõ ràng nhất về vị trí của quản trị ASI năm 2024.

Cả hai đầu ra đều thật. Không cái nào là luật.

Các Cam Kết An Toàn AI Tiên Phong

Tài liệu tiêu đề là Frontier AI Safety Commitments, được ký bởi mười sáu công ty AI lớn, bao gồm các nhà phát triển từ Hoa Kỳ, Trung Quốc, Vương quốc Anh và UAE. Các công ty cam kết công bố các khuôn khổ an toàn mô tả cách họ đánh giá rủi ro từ các mô hình tiên phong; xác định ngưỡng rủi ro họ coi là không thể chấp nhận; và, quan trọng, không phát triển hoặc triển khai mô hình nếu những ngưỡng đó không thể giữ dưới đường đó, bao gồm cam kết rút lui khi các biện pháp giảm thiểu thất bại.

Sự thay đổi có ý nghĩa nằm ở nguyên tắc công khai. Các nhà phát triển hàng đầu đã tuyên bố công khai rằng một số năng lực quá nguy hiểm để triển khai, và họ sẽ xác định các lằn ranh đỏ rồi hành động theo đó. Ngành công nghiệp chuyển từ những cam kết mơ hồ sang các giới hạn được nêu rõ. Các giới hạn đó vẫn do chính họ tự định nghĩa.

Tại sao các cam kết tự nguyện là chưa đủ

  • Các công ty tự đặt ngưỡng của riêng mình. Mỗi nhà phát triển tự định nghĩa rủi ro không thể chấp nhận và cách đo lường nó. Không có tiêu chuẩn chung và không có cơ quan bên ngoài xác thực các định nghĩa.
  • Không có xác minh độc lập. Không có gì xác nhận rằng khuôn khổ an toàn nội bộ được tuân thủ, hay các đánh giá là trung thực. Việc tuân thủ chỉ dựa vào lời của nhà phát triển.
  • Không có thực thi. Vi phạm cam kết mang lại chi phí uy tín nhiều nhất. Các cam kết không phải là luật.
  • Chúng có thể được sửa đổi hoặc bỏ. Các cam kết tự nguyện dưới áp lực cạnh tranh có thể âm thầm suy yếu khi đối thủ chạy đua phía trước. Tự điều chỉnh là thứ mong manh như vậy.

Lý lẽ dân gian cho rằng yêu cầu các phòng thí nghiệm tự giám sát vẫn tốt hơn là không có gì. Đúng, nhưng chưa đủ. Một lời hứa mà người hứa có thể tự định nghĩa, đo lường và phá vỡ là một chỗ trống cho quản trị. Chỗ trống chỉ có ích nếu thứ gì đó cứng rắn hơn thay thế nó một cách có chủ đích.

Mạng lưới các viện an toàn

Kênh chính phủ tạo ra một kết quả có tiềm năng bền vững hơn: động lực hướng tới một mạng lưới quốc tế các viện an toàn AI. Dựa trên các cơ quan mới thành lập của Vương quốc Anh và Hoa Kỳ, các quốc gia đồng ý hợp tác về khoa học đánh giá mô hình tiên phong, chia sẻ phương pháp, thống nhất quy trình kiểm tra, và xây dựng năng lực kỹ thuật mà bất kỳ chế độ xác minh nào trong tương lai đều cần. Các cơ quan công lập thực sự có thể đánh giá mức độ nguy hiểm của một mô hình là sợi dây liên kết mà một hiệp ước cuối cùng đòi hỏi. Xem hướng dẫn của Foundation về một viện an toàn AI là gì.

Tuyên bố Seoul, được các chính phủ tham dự thông qua, tái khẳng định AI lấy con người làm trung tâm, an toàn và đáng tin cậy, cùng tiếp tục hợp tác quốc tế. Giống văn bản Bletchley, đây là tuyên bố định hướng chứ không phải tập hợp nghĩa vụ.

Mô hình và khoảng cách

Seoul phù hợp với mô hình đã biết trong quản trị các công nghệ nguy hiểm: thừa nhận, sau đó cam kết tự nguyện, rồi (nếu quá trình thành công) các quy tắc ràng buộc. Các cam kết doanh nghiệp và mạng lưới viện là giai đoạn thứ hai. Công việc còn dang dở là giai đoạn thứ ba: tiêu chuẩn chung, xác minh độc lập và nghĩa vụ pháp lý.

Các viện an toàn là cầu nối đầy hứa hẹn nhất, vì năng lực họ xây dựng chính là thứ mà một chế độ ràng buộc sẽ sử dụng. Rủi ro là quá trình thượng đỉnh dừng lại ở giai đoạn tự nguyện, thế giới hài lòng với lời cam kết vì cam kết dễ hơn hiệp ước, trong khi năng lực vẫn tiếp tục tiến bộ. Seoul đã làm rõ khoảng cách giữa cam kết và quản trị. Nhiệm vụ còn lại là thu hẹp khoảng cách đó. Vị thế của Nakada Foundation là thu hẹp nó đồng nghĩa với việc chuyển từ cam kết của công ty sang luật pháp quốc tế mang tính phòng ngừa trước khi các đường đỏ tự định nghĩa tan biến dưới áp lực cuộc đua. Đọc thêm: tại sao các cam kết an toàn AI tự nguyện thất bại khi là chiến lược duy nhất.