Viện An toàn AI là cơ quan nhà nước được thành lập để đánh giá các hệ thống AI tiên phong về rủi ro an ninh quốc gia và an toàn công cộng, đồng thời xây dựng chuyên môn của nhà nước về AI tiên phong. Làn sóng đầu tiên tập trung quanh hội nghị thượng đỉnh AI quốc tế 2023. Các viện hiện chia sẻ phương pháp và kết quả qua mạng lưới quốc tế mà Seoul và các cuộc họp tiếp theo thúc đẩy.

Một số thủ đô lớn hiện đang vận hành viện hoặc tổ chức tương đương. Hầu hết trong số họ vẫn chưa thể ra lệnh giữ lại một mô hình nguy hiểm.

Ghi chú về tên gọi: hai viện sáng lập đã được đổi tên. Cơ quan UK trở thành Viện An ninh AI vào tháng 2 năm 2025. Viện US hiện là Trung tâm Tiêu chuẩn và Đổi mới AI (CAISI) tại NIST. "Viện an toàn AI" vẫn là thuật ngữ chung chuẩn, và hướng dẫn này sử dụng nó xuyên suốt.

Trong nhiều năm, các tổ chức duy nhất hiểu sâu các mô hình tiên phong là các công ty đang xây dựng chúng. Một viện là nỗ lực đặt năng lực kỹ thuật độc lập vào bên trong chính phủ, để các cơ quan công quyền có thể đánh giá hệ thống thay vì chấp nhận bản tóm tắt của nhà phát triển như lời cuối cùng.

Những gì họ thực sự làm

Công việc của họ tập trung vào một số lĩnh vực.

  • Testing frontier models, đôi khi trước khi phát hành, để tìm các năng lực nguy hiểm trong các lĩnh vực như mạng, sinh học và tự hành, sử dụng các phương pháp đằng sau đánh giá năng lực.
  • Phát triển chính khoa học đánh giá, vì việc đo lường rủi ro này vẫn còn là vấn đề nghiên cứu mở, chưa phải quy trình đã định hình.
  • Tư vấn cho chính phủ, để chính sách được thông báo bởi những người thực sự đã kiểm tra các hệ thống.
  • Phối hợp quốc tế để một mô hình đã được kiểm tra ở một quốc gia không cần xây dựng lại từ đầu ở mọi nơi, và để các tiêu chuẩn bắt đầu hội tụ.

Đây là tiến bộ thể chế thực sự. Xây dựng năng lực nhà nước để hiểu AI biên giới là điều kiện tiên quyết để quản trị nó. Bạn không thể điều chỉnh những gì bạn không thể đánh giá, và cho đến gần đây chính phủ hầu như không thể làm được.

Sức mạnh mà họ hầu như thiếu

Hầu hết các Viện An toàn AI có thể kiểm tra, tư vấn và công bố. Ít cơ quan nào có thể ép buộc. Việc tiếp cận mô hình thường phụ thuộc vào sự hợp tác của phòng thí nghiệm. Các phát hiện thường chỉ mang tính thông tin chứ không ràng buộc. Trong hầu hết các trường hợp, một viện không thể ra lệnh giữ lại một mô hình nguy hiểm. Những cơ quan này có thể nhìn thấy rủi ro và đề xuất phản ứng. Họ hiếm khi được yêu cầu thực hiện điều đó.

Khoảng cách giữa đánh giá và thẩm quyền là giới hạn cấu trúc. Một viện phát hiện mối nguy nghiêm trọng mà chỉ có thể khuyên bảo thì chỉ hiệu quả bằng ý chí hành động của chính phủ trước áp lực thương mại và cạnh tranh. Phần lớn kiến trúc hiện nay là hệ thống cảnh báo. Hệ thống cảnh báo không phải biện pháp bảo vệ cho đến khi ai đó có quyền lực đáp lại tiếng chuông.

Quan điểm dân gian cho rằng năng lực kỹ thuật là đủ, và chính trị sẽ theo kịp. Năng lực mà không có thẩm quyền là cách chính phủ biết tin xấu muộn và hành động còn muộn hơn. Việc kiểm tra không thể buộc dừng lại chỉ là sự chuẩn bị cho quản trị, chứ không phải quản trị thực sự.

Những gì chúng có thể trở thành

Giá trị lâu dài của Viện An toàn AI là những gì họ tập hợp cho các chế độ ràng buộc sau này: năng lực kỹ thuật độc lập, tiêu chuẩn chung và kênh quốc tế giữa các chính phủ. Theo nghĩa đó họ là hình thức ban đầu của loại cơ quan mà Foundation lập luận. Bài viết của chúng tôi về một cơ quan giám sát quốc tế mô tả nơi điều này có thể dẫn đến. The IPCC mô hình cho thấy cách đánh giá khoa học chung có thể bảo đảm chính sách quốc tế.

Điều cần thay đổi là thẩm quyền. Đánh giá phải kết nối với thực thi, dù thông qua luật trong nước khiến sự phê chuẩn của viện trở thành điều kiện triển khai, hay thông qua khuôn khổ quốc tế trao cho các phát hiện đã xác minh hậu quả thực sự. Trao cho các viện này quyền lực tương xứng với chuyên môn, và phần lớn khung sườn của quản trị nghiêm túc đã được xây dựng một phần. Sự chuyển đổi đó là chủ đề của kế hoạch của chúng tôi: dừng siêu trí tuệ theo luật, với năng lực đánh giá công cộng như cơ sở hạ tầng, không phải là thay thế cho cấm đoán và xác minh.