Hầu hết nghiên cứu an toàn AI đều đặt cùng một câu hỏi: làm thế nào để khiến mô hình này an toàn hơn? Huấn luyện tốt hơn, liên kết tốt hơn, đánh giá tốt hơn. Giả định ngầm trong câu hỏi đó là một mô hình an toàn hơn sẽ tạo ra hành vi an toàn hơn khi được triển khai trong một hệ thống thực với các tác nhân và người dùng khác.
Việc sắp xếp lại bốn tác nhân giống nhau đã tạo ra sự thay đổi 59 điểm phần trăm trong tỷ lệ phê duyệt.
"Position: Safety and Fairness in Agentic AI Depend on Interaction Topology, Not on Model Scale or Alignment" (arXiv:2605.01147), gửi lên arXiv ngày 1 tháng 5 năm 2026 bởi Tanav Singh Bajaj, Nikhil Singh, Karan Anand và Eishkaran Singh, trực tiếp thách thức giả định đó. Phát hiện của họ: trong các hệ thống AI đa tác nhân, cấu trúc kết nối và tương tác giữa các tác nhân lấn át các đặc tính an toàn của bất kỳ mô hình cá nhân nào. Các mô hình được căn chỉnh tốt vẫn có thể tạo ra đầu ra cực kỳ không an toàn, chỉ vì cách hệ thống được kết nối với nhau.
Ba chế độ thất bại
Các nhà nghiên cứu đã thử nghiệm các hệ thống phê duyệt khoản vay đa tác nhân trên 5.760 đơn xin tín dụng tổng hợp bằng các mô hình từ 3B đến 70B tham số. Họ xác định được ba chế độ lỗi riêng biệt, mỗi chế độ không thể thấy được qua đánh giá an toàn ở mức mô hình tiêu chuẩn.
Sắp xếp sự bất ổn
Trong các pipeline tác nhân tuần tự, thứ tự vai trò quyết định kết quả ngang ngửa chất lượng suy luận. Với mô hình LLaMA-3B, tỷ lệ phê duyệt dao động từ 36,4% đến 95,4% qua 24 thứ tự có thể của bốn vai trò: chênh lệch 59 điểm phần trăm. Ngay cả ở quy mô 70B, chênh lệch vẫn là 21,7 điểm phần trăm (71,5% đến 93,2%). Cùng mô hình, cùng nhiệm vụ, cùng ứng dụng, nhưng đầu ra hoàn toàn khác nhau tùy theo tác nhân nào đi trước.
Mô hình nhất quán: đặt Risk Manager trước cho tỷ lệ phê duyệt thấp nhất; đặt Data Scientist trước cho tỷ lệ cao nhất. Không có lượng công việc alignment nào trên từng mô hình riêng lẻ loại bỏ hiệu ứng này, vì đó là tính chất của trình tự pipeline, không phải của các mô hình.
Chuỗi thông tin lan truyền
Trong các hệ thống tuần tự, các tác nhân sau tuân theo các tác nhân trước thay vì suy luận độc lập. Các mô hình 3B nhỏ cho thấy tỷ lệ đồng thuận giữa các tác nhân khoảng 90% với 20% sửa lỗi, cho thấy chúng vẫn thực hiện một số đánh giá độc lập. Ở mức 70B trở lên, tỷ lệ đồng thuận giữa các tác nhân tăng lên hơn 99,9%, trong khi tỷ lệ sửa lỗi giảm xuống dưới 0,1%.
Sự cân nhắc đã thực sự dừng lại. Phán đoán của tác nhân đầu tiên lan truyền qua đường ống mà không thay đổi, trong khi các tác nhân còn lại chỉ tạo ra vẻ ngoài của việc xem xét mà không có bất kỳ nội dung thực chất nào. Các mô hình mạnh hơn hình thành đồng thuận nhanh hơn và triệt để hơn, khuếch đại thất bại này chính vì khả năng đạt được sự đồng thuận mạch lạc lớn hơn của chúng.
Sụp đổ chức năng
Dưới topology song song với judge aggregation, các mô hình LLaMA-3B tạo ra tỷ lệ phê duyệt tổng thể khoảng 98% trên các bậc tín dụng, với người xin tín dụng thấp được phê duyệt 95% và người xin tín dụng cao được phê duyệt 100%. Theo các chỉ số demographic parity, điều này trông giống hệ thống công bằng, không phân biệt đối xử. Thực tế, hệ thống đã ngừng phân biệt đối xử hoàn toàn. Đánh giá rủi ro trở thành thủ tục hình thức được thỏa mãn qua phê duyệt bừa bãi thay vì đánh giá công bằng.
Việc mở rộng năng lực mô hình củng cố các lỗi do cấu trúc thay vì giảm bớt chúng. Các mô hình mạnh hơn dành nhiều xử lý hơn để xây dựng sự đồng thuận nhóm chặt chẽ và ít hơn cho đánh giá độc lập. Ở quy mô 70B, việc gần như triệt tiêu hoàn toàn sự cân nhắc độc lập nghĩa là hệ thống đa tác nhân hoạt động như một hệ thống tác nhân đơn với các bước thừa, không kế thừa lợi ích an toàn mà nhiều người đánh giá độc lập được cho là cung cấp.
Khoảng trống quy định mà điều này tạo ra
Các khung an toàn AI hiện tại đánh giá mô hình. Chúng đánh giá đầu ra mô hình, đo lường sự liên kết mô hình và chứng nhận hành vi mô hình. Kiến trúc tương tác kết nối nhiều mô hình nằm hoàn toàn ngoài khung đánh giá này.
Các tác giả của bài báo mô tả đây là một vấn đề cơ bản và đưa ra bốn khuyến nghị quản trị cụ thể. Chứng nhận an toàn phải yêu cầu quét tô-pô qua các biến thể kiến trúc. Các chuẩn mực phải chỉ rõ rõ ràng cấu trúc tương tác đang được kiểm tra. Triển khai phải yêu cầu kiểm tra độ mạnh kiến trúc trước khi phát hành. Công bố quy định phải bắt buộc tài liệu về kiến trúc hệ thống và độ ổn định đã chứng minh qua các biến thể tô-pô.
Lập luận cốt lõi: AI có tác nhân phải được coi là một hệ thống động, không phải tập hợp các thành phần đã căn chỉnh. Cấu trúc tương tác là tham số an toàn mà các phương pháp đánh giá hiện tại không đo lường. Các cơ quan quản lý và nhà triển khai đang kiểm toán sai thứ.
Điều này có nghĩa gì trong thực tế
Kịch bản phê duyệt khoản vay đại diện cho một lớp triển khai thực tế rộng lớn. Các hệ thống AI đa tác nhân hiện được sử dụng trong tuyển dụng, phân loại y tế, kiểm duyệt nội dung, nghiên cứu pháp lý và tuân thủ tài chính. Trong hầu hết các bối cảnh này, các mô hình được chứng nhận hoặc đánh giá riêng lẻ được kết nối qua các kiến trúc chưa nhận được sự giám sát tương đương.
Biến động 59 điểm phần trăm trong tỷ lệ phê duyệt khoản vay chỉ do thay đổi thứ tự tác nhân cho thấy sự bất ổn cấu trúc tương tự trong các quyết định đường ống rủi ro cao khác. Hệ thống phân loại y tế tự động sử dụng đánh giá tuần tự của tác nhân sẽ gặp bất ổn thứ tự. Đường ống sàng lọc tuyển dụng sử dụng bỏ phiếu song song của tác nhân sẽ gặp sụp đổ chức năng. Cấu trúc của đường ống là tham số an toàn mà đánh giá hiện tại hoàn toàn không nắm bắt.
Cấu trúc là một tham số an toàn. Đối xử với thiết kế pipeline như bạn đối xử với lựa chọn mô hình: kiểm tra nó, điều chỉnh khi cược cao, và đừng triển khai hệ thống đa tác nhân vào y tế hay tín dụng chỉ dựa trên điểm số mô hình. Đối với vấn đề kiểm soát rộng hơn, xem kế hoạch của chúng tôi. Bài báo đầy đủ: arXiv:2605.01147.
Sự phản đối mạnh mẽ nhất
Phản biện công bằng nhất là việc chọn mô hình cẩn thận vẫn chiếm ưu thế, và thứ tự đường ống chỉ là điều chỉnh thứ cấp. Một thay đổi 59 điểm từ việc sắp xếp lại tác nhân không phải thứ cấp. Cấu trúc là tham số an toàn hạng nhất. Chấm điểm cấu trúc, không chỉ trọng số.