Khi chatbot sai, bạn thường nhận ra và hỏi lại. Khi một tác nhân tự động sai, sai lầm có thể tích tụ qua nhiều bước, công cụ và bộ nhớ trước khi ai đó phát hiện. Khoảng cách đó là lý do một cuộc khảo sát về lỗi tác nhân vào tháng 5/2026 lại quan trọng với bất kỳ ai đang triển khai tác nhân trên dữ liệu và tiền thật.
Mười hai nhà nghiên cứu do Jinhu Qi dẫn dắt (bao gồm Irwin King) đã xuất bản "Towards Trustworthy Agentic AI: A Comprehensive Survey of Safety, Robustness, Privacy, and System Security" (arXiv:2605.23989; Academia AI and Applications, 2026). Họ phân tích cách các hệ thống tác nhân thất bại, những biện pháp bảo vệ hiện có, và những lỗ hổng vẫn còn tồn tại.
Điều gì thay đổi khi hệ thống hành động, không chỉ trả lời
Mô hình tiêu chuẩn nhận prompt rồi trả về văn bản. Agent nhận mục tiêu rồi chạy: lập kế hoạch, gọi công cụ, lưu kết quả trung gian, xâu chuỗi hành động và thích nghi với những gì môi trường trả về.
Thiết kế đó tạo ra các lỗi mà kiểm tra prompt-response bỏ sót. Một lệnh công cụ sai có thể làm hỏng mọi bước sau. Bộ nhớ có thể lưu trữ niềm tin sai và tiếp tục hành động theo nó. Các bước trông vô hại có thể kết hợp thành tác hại. Thế giới thay đổi khi tác nhân hành động, và những thay đổi đó nuôi dưỡng quyết định tiếp theo.
An toàn và độ bền vững
Ở đây rủi ro nằm ở quỹ đạo của chính tác nhân. Các cuộc tấn công không chỉ đến từ lời nhắc của người dùng. Một tài liệu độc hại mà tác nhân đọc giữa chừng nhiệm vụ có thể điều khiển phần còn lại của quá trình chạy mà người dùng không biết. Đó là prompt injection từ môi trường.
Distribution shift tệ hơn với tác nhân so với chatbot. Một chatbot gặp trường hợp lạ sẽ đưa ra câu trả lời kém hơn. Một tác nhân ở vị trí tương tự sẽ thực hiện chuỗi hành động tự tin có thể làm tình huống tệ hơn ở mỗi bước.
Hầu hết các benchmark tác nhân vẫn chỉ hỏi nhiệm vụ có hoàn thành hay không. Ít hơn nhiều benchmark hỏi các ràng buộc có được giữ trong suốt quá trình hay không. Một hệ thống có thể "thành công" trong khi vi phạm quy tắc ở mọi lần chạy. Trung tâm chỉ số thống nhất của khảo sát hữu ích vì nó theo dõi cả kết quả lẫn quá trình: thành công nhiệm vụ, vi phạm ràng buộc, dấu vết chưa hoàn chỉnh, tỷ lệ thành công tấn công.
Quyền riêng tư và an ninh hệ thống
. Ở đây đối thủ kiểm soát một phần môi trường. Khảo sát ghi nhận các lỗi thực tế trong các ngăn xếp tác nhân mã nguồn mở, không chỉ các cuộc tấn công mô phỏng.
Bộ nhớ dài hạn là vấn đề riêng tư mà chatbot hầu như tránh được. Một tác nhân nghiên cứu xuyên suốt phiên có thể tích lũy bí mật, rồi rò rỉ chúng qua lệnh công cụ hoặc tiêm nhiễm. Ngộ độc bộ nhớ (làm hỏng ngữ cảnh đã lưu để điều khiển hành vi sau này) không có tương đương sạch sẽ ở chế độ một lượt.
Thiết lập đa tác nhân làm lỗ hổng rộng hơn. Một tác nhân bị xâm phạm có thể đẩy nội dung rác qua các kênh ngang hàng thông thường. Bộ lọc dành cho đầu vào người dùng có thể mặc định tin tưởng các tác nhân ngang hàng.
Những gì vẫn chưa được giải quyết
Sự phản đối phổ biến
Phản biện mạnh nhất là đây chỉ là bảo mật phần mềm ngày xưa với nhãn mới: sandbox công cụ, ghi log hành động, rồi ship. Điều này đúng một phần. Sandbox và log rất quan trọng. Điểm của cuộc khảo sát là các tác nhân thêm vào khả năng tích lũy dài hạn, tấn công từ môi trường và niềm tin ngang hàng mà danh sách kiểm tra bảo mật ứng dụng thông thường vẫn đánh giá thấp. Xem rủi ro tác nhân chỉ là "một API nữa" là cách các đội bỏ lỡ toàn bộ ngăn xếp.
Nên làm gì với bản đồ
Các đội đã đưa tác nhân lên dữ liệu khách hàng, tiền bạc hoặc công cụ bên ngoài cần chỉ số quy trình, giám sát thời gian chạy và đánh giá độc lập về thiết kế công cụ và bộ nhớ, chứ không chỉ đánh giá phát hành hỏi liệu nhiệm vụ demo có hoàn thành hay không.
Đối với Foundation, bản đồ thất bại của tác nhân là lớp gần hạn. Chúng không thay thế công việc lớn hơn. Một thế giới đang chạy đua hướng tới trí tuệ siêu nhân tạo vẫn cần giới hạn ràng buộc, quy tắc tính toán và xác minh để năng lực không vượt trước kiểm soát. Sử dụng khảo sát để củng cố các tác nhân bạn triển khai ngay bây giờ. Sử dụng lộ trình hiệp ước để trạng thái cuối cùng không phải là một tác nhân không ai có thể phủ quyết. Bài báo đầy đủ: arXiv:2605.23989.