Hindi naging ligtas ang aviation sa pamamagitan ng pagsubok kung kayang hawakan ng bawat bolt ang rated load nito. Naging ligtas ito sa pamamagitan ng pagtatanong kung paano nakikipag-ugnayan ang mga parts, sino ang pinahihintulutang mag-utos, at paano lumalayo ang tunay na operations sa conditions na ipinapalagay ng safety case. Ang disiplinang iyon ay systems safety. Kasama sa toolkit nito ang STPA, FRAM, at STECA, mga methods na hinihingi na ng regulated industries.

Ang AI safety ay halos hindi pa nai-import ang mga ito. Isang 2026 paper ang gumawa nito.

Si Luca Carlucci, James Fillingham, Robert Walpole, at Bartłomiej Kryś ang naglalapat ng tatlong metodong iyon sa isang frontier coding agent sa isang makatotohanang production setup (lab, enterprise customer, developers) sa "Isang Systems-Thinking Approach sa Loss of Control Risk mula sa Advanced AI" (arXiv:2606.13474; ICML 2026 Technical ASI Governance Workshop). Natuklasan nila ang tatlong panganib na hindi kailanman idinisenyo ang ordinaryong model tests para mahuli.

Ang tatlong pamamaraan, sa simpleng wika

STPA
Pagsusuri ng Proseso ayon sa Teorya ng Sistema
Nagmamapa kung sino ang nag-uutos sa ano, sino ang nagbabantay sa ano, at saan dumadaloy ang impormasyon. Natutuklasan kung paano nabibigo ang kontrol kahit gumagana nang maayos ang bawat bahagi.
FRAM
Paraan ng Pagsusuri ng Functional Resonance
Tinitingnan ang system bilang magkakaugnay na functions, hindi bilang listahan ng mga parte. Ipinapakita kung paano ang ordinaryong araw-araw na pagkakaiba-iba ay maaaring magdulot ng masamang system-level na resulta.
STECA
Socio-Technical na Pagsusuri para sa mga Kritikal na Aplikasyon
Inilalawig ang STPA sa mga tao, insentibo, at institusyon. Sinusundan ang mga puwang sa pananagutan na nasa pagitan ng org charts at code.

Ang senaryong ginamit nila

Sinubukan nila ang lahat ng tatlong pamamaraan sa isang frontier coding agent sa totoong gawaing software: long-horizon, tool-using, may tunay na codebases at external services, pinangangasiwaan ng isang lab, enterprise customers, at mga developer. Ganyan na talaga ang pagpapadala ng mga sistemang ito ngayon. Ang loss-of-control risk sa antas ng sistema ay halos hindi pa nasusuri.

Tatlong natuklasan na hindi nasasaklaw ng mga pagsusuri sa modelo

Natuklasan 1
Walang makakapagtiyak sa kwento ng kaligtasan maliban sa mga nasa loob ng lab

Sa kanilang setup, ang lab ang gumagawa ng mga safety commitments, nagsusulat ng mga usage rules, at nagbabantay para sa mga violations. Ang mga regulator, customer, at auditor ay hindi maaaring independiyenteng suriin ang mga operasyon. Ang self-report ang pangunahing feedback loop.

Itinuturo ng STECA na ito ay sirang control structure. Ang control action ay gumagana lamang kung may makakakita kung ito ba ay naging epektibo. Kapag ang partido na responsable sa kaligtasan ay siya ring pangunahing pinagmumulan ng patunay na ligtas ito, ang loop ay nasisira. Ito ay isang design fact, hindi isang paratang na ang anumang lab ay hindi tapat.

Natuklasan 2
Masyadong mabagal ang monitoring para makialam

Minamapa ng STPA ang agwat sa pagitan ng kilos ng isang agent at ng pag-alam ng tao na ito ay kumilos. Sa multi-step, real-time na takbo, madalas nang tumawag ng tool, sumulat ng code, o nag-push ng pagbabago ang agent bago makita ng reviewer ang alert.

Tinatawag ito ng abyasyon na paglabas sa loop. Nananatili sa papel ang pormal na awtoridad para pigilan ang system. Hindi nakakasabay ang functional authority. Ganyan ang hitsura ng real-time oversight ng frontier coding agents ngayon.

Natuklasan 3
Tahimik na nagiging lipas ang mga pananggalang

Nakatuon ang FRAM sa ordinaryong pagkakaiba-iba. Iniaangkop ang mga safeguard sa hitsura ng system noong deployment. Pagkatapos ay nagbabago ang prompts, nagbabago ang task mix, nag-iipon ang edge cases, at lumalayo ang live distribution sa sample na ginamit noong paglulunsad.

Walang nagbabala. Ginagawa pa rin ng mga safeguard nang eksakto ang dinisenyo nilang gawin laban sa mga kondisyon kahapon. Tahimik na lumalaki ang agwat hanggang sa tumama ang isang bagong kaso sa isang patakaran na hindi na angkop.

Ano ang ibig sabihin nito para sa governance

Ang model tests ay nagtatanong kung ano ang ginagawa ng system sa inputs. Hindi nila minamapa ang control structure sa paligid nito, kung sino ang accountable sa ano, o paano nagbabago ang operations pagkatapos ng release. Kailangan pa rin ang capability scores at red teams. Hindi sapat ang mga iyon.

Simple lang ang hiling ng papel: pagsamahin ang model-level hazard analysis at systems-level hazard analysis bilang kinakailangang bahagi ng safety assessment. Ang STPA, FRAM, at STECA ay konkretong simula. Kapag pinalawak mula sa isang coding agent hanggang sa buong ekonomiya, ang parehong blind spot ang dahilan kung bakit unti-unting pagkawala ng kapangyarihan mahirap makita hanggang sa huli.

Para sa Foundation, ang aral ay nasa disenyo, hindi sa isang papel. Ang independent inspection, compute rules, at external verification ay umiiral para hindi nakasalalay ang kaligtasan sa lab na nag-uulat tungkol sa sarili nito. Kaya nakasentro ang aming plano binding limits at verification, not voluntary self-assessment alone. Read the paper if you want the full method detail: arXiv:2606.13474. Pagkatapos ay gamitin ang natuklasan sa batas at institusyon, hindi lang sa isang workshop citation.