Kapag mali ang isang chatbot, karaniwang napapansin mo at maaaring tanungin ulit. Kapag mali ang isang autonomous agent, maaaring mag-stack ang pagkakamali sa mga hakbang, tools, at memory bago pa ito makita ng sinuman. Ang agwat na iyan ang dahilan kung bakit mahalaga ang survey noong Mayo 2026 tungkol sa agent failures para sa sinumang nagpapadala ng agents sa totoong data at pera.
Labindalawang mananaliksik na pinamunuan ni Jinhu Qi (kasama si Irwin King) ang naglathala ng "Towards Trustworthy Agentic AI: A Comprehensive Survey of Safety, Robustness, Privacy, and System Security" (arXiv:2605.23989; Academia AI and Applications, 2026). Ipinapakita nila kung paano nabibigo ang agentic systems, kung anong depensa ang umiiral, at kung saan pa may butas.
Ano ang nagbabago kapag kumikilos ang sistema, hindi lang sumasagot
Ang standard model ay tumatanggap ng prompt at nagbabalik ng text. Ang agent ay tumatanggap ng goal at tumatakbo: nagpaplano, tumatawag ng tools, nag-iimbak ng intermediate results, nag-uugnay ng mga aksyon, at umaangkop sa ibinabalik ng kapaligiran.
Ang disenyong iyan ang lumilikha ng mga pagkabigo na hindi nahuhuli ng prompt-response tests. Isang masamang tool call ay pwedeng magdulot ng lason sa lahat ng susunod na hakbang. Pwedeng mag-imbak ng maling paniniwala ang memory at patuloy na kumilos base doon. Pwedeng magsama-sama ang mga hakbang na mukhang hindi nakakapinsala at maging pinsala. Nagbabago ang mundo habang kumikilos ang agent, at ang mga pagbabagong iyon ang nagpapakain sa susunod na desisyon.
Kaligtasan at tibay
Dito ang panganib ay ang sariling trajectory ng ahente. Hindi lamang ang mga user prompt ang mga atake. Ang isang malisyosong dokumento na binabasa ng ahente sa gitna ng gawain ay maaaring magmaneho sa iba pang bahagi ng run nang hindi alam ng user. Iyan ay prompt injection mula sa kapaligiran.
Mas malala ang distribution shift para sa agents kaysa sa chatbots. Ang chatbot na tumama sa hindi pamilyar na case ay nagbibigay ng mas maling sagot. Ang agent sa parehong sitwasyon ay gumagawa ng sunod-sunod na tiyak na aksyon na lalong nagpapalala sa sitwasyon sa bawat hakbang.
Karamihan sa agent benchmarks ay nagtatanong pa rin kung natapos ang gawain. Mas kaunti ang nagtatanong kung nanatili ang mga hadlang sa daan. Maaaring "magtagumpay" ang isang system habang nilalabag ang mga patakaran sa bawat takbo. Kapaki-pakinabang ang unified metrics hub ng survey dahil sinusubaybayan nito ang parehong resulta at proseso: tagumpay sa gawain, paglabag sa hadlang, hindi kumpletong bakas, rate ng tagumpay ng pag-atake.
Privacy at seguridad ng sistema
Dito kontrolado ng kalaban ang bahagi ng kapaligiran. Ipinapakita ng survey ang tunay na pagkabigo sa open-source agent stacks, hindi lamang sa mga toy attack.
Ang long-running memory ay isang privacy problem na karaniwang iniiwasan ng chatbots. Ang agent na nagsasaliksik sa buong session ay makakapagtipon ng mga lihim, pagkatapos ay makakapag-leak sa pamamagitan ng tool calls o injection. Ang memory poisoning (corrupting stored context para i-steer ang later behavior) ay walang malinis na single-turn na katumbas.
Pinapalawak ng multi-agent setups ang butas. Isang compromised agent ay maaaring magpadala ng junk sa normal na peer channels. Maaaring default na magtiwala ang filters na ginawa para sa user input sa peer agents.
Ano pa ang hindi nalulutas
Ang karaniwang pagtutol
Ang pinakamalakas na pushback ay ito ay kahapon na software security na may bagong label: i-sandbox ang tools, i-log ang actions, i-ship. Bahagyang totoo. Mahalaga ang sandboxes at logs. Ang punto ng survey ay ang mga agents ay nagdadagdag ng long-horizon compounding, environment-sourced attacks, at peer trust na hindi pa rin binibigyang timbang ng ordinary app security checklists. Ang pagtrato sa agent risk bilang "just another API" ang dahilan kung bakit nalalampasan ng mga team ang stack.
Ano ang gagawin sa mapa
Kailangan ng mga team na naglalagay na ng agents sa customer data, pera, o external tools ng process metrics, runtime monitoring, at independent review ng tool at memory design, hindi lang release eval na nagtatanong kung natapos ang demo task.
Para sa Foundation, ang agent failure maps ay isang malapit na layer. Hindi nito pinapalitan ang mas malaking gawain. Isang mundong nagmamadali patungo sa artificial superintelligence ay kailangan pa rin ng binding limits, compute rules, at verification para hindi maunahan ng capability ang control. Gamitin ang survey para patibayin ang mga agent na dine-deploy mo ngayon. Gamitin ang treaty track para hindi maging end state ang isang agent na walang makakapigil. Buong papel: arXiv:2605.23989.