Sa teknikal na kahulugan, lubos na nababasa ang isang neural network. Bawat weight, bawat activation, bawat computation ay sa prinsipyo ay accessible sa inspection. Sa praktika, ang isang frontier language model ay may sampu-sampung bilyong parameters na nakaayos sa daan-daang layers, nagsasagawa ng mga computation na halos ganap na opaque ang kaugnayan sa behavior ng modelo. Maaaring obserbahan ng mga mananaliksik ang inputs at outputs. Ang internal mechanisms na nag-uugnay sa mga ito ay higit na hindi alam.

Mechanistic interpretability is the research direction aimed at changing this, and it may be the only way to detect some of the most dangerous alignment failures.

Ang mechanistic interpretability ang proyektong nagbabago nito. Sa halip na ilarawan ang mga AI system ayon sa ginagawa nila sa maraming input (ang behavioral approach), sinusubukan ng mechanistic interpretability na tukuyin ang mga partikular na circuit, feature, at algorithm sa loob ng neural networks na nagdudulot ng partikular na mga gawi. Layunin nitong bumuo ng mga tool na makakabasa kung ano talaga ang kinukuwenta ng isang model, hindi lang obserbahan ang output nito.

Bakit kapaki-pakinabang ang behavioral interpretability at nakapagbigay ito ng tunay na mga pananaw, hindi sapat

Karamihan sa tinatawag na "AI interpretability" ay behavioral: sinusuri ang mga pattern kung paano tumutugon ang isang sistema sa iba't ibang input, tinutukoy kung aling feature ng input ang pinakamaimpluwensya sa output, at minamapa ang ugnayan sa pagitan ng prompts at responses nang istatistikal. Hindi nito nasasagot ang mga tanong na kritikal sa kaligtasan.

Ang mga failure mode na pinakamahalaga para sa AI safety, mapanlinlang na alignment, mesa-optimization, ang mapanlinlang na pagliko, lahat ay may divergence sa pagitan ng hitsura ng ginagawa ng AI system mula sa labas at ng aktwal na kinukuwenta nito sa loob. Ang system na natutong makapasa sa safety evaluations habang hinahabol ang ibang goals ay gagawa ng perfectly safe-looking outputs sa behavioral testing. Hindi nito matutuklasan ng behavioral interpretability dahil tinitingnan lang nito ang outputs.

Ang mechanistic interpretability ay naglalayong basahin nang direkta ang mga internal goal representations ng sistema. Kapag natukoy ng mga mananaliksik ang mga partikular na circuit na responsable sa goal-directed behavior at nailalarawan kung ano talaga ang ino-optimize ng mga circuit na iyon, sa prinsipyo ay maaari nilang matukoy ang misalignment bago pa ito lumabas sa outputs. Ito ang dahilan kung bakit itinuturing na ngayon ang mechanistic interpretability bilang posibleng tanging paraan na makakapagtuklas ng ilang mapanganib na alignment failures bago pa ito magpakita.

Ano ang natuklasan ng pananaliksik hanggang ngayon

Bata pa ang larangan, ngunit may ilang mahahalagang natuklasan na lumitaw. Natukoy nina Chris Olah at mga kasamahan sa Anthropic ang mga partikular na circuit sa neural networks na gumagawa ng mga nakikilalang computation: mga circuit na nakakakita ng mga gilid at kurba sa mga image model, na gumagawa ng categorization, na kumukuha ng impormasyong nakaimbak noong training. Naidokumento nila ang phenomenon na tinatawag na superposition, kung saan ang mga indibidwal na neuron ay kumakatawan sa maraming magkakaibang konsepto nang sabay-sabay, naka-compress sa parehong set ng activations. Mas kumplikado nito ang relasyon sa pagitan ng neural activations at model behaviors kaysa sa inaakala ng mga mananaliksik.

Sa language models, natukoy ng mga mananaliksik ang mga istrukturang tinatawag na induction heads, mga specific attention patterns na nagpapahintulot sa model na kumpletuhin ang sequences sa pamamagitan ng analogy, tumitingin pabalik sa context para makahanap ng similar patterns. Ang mga induction heads na ito ay tila responsable sa in-context learning, ang kakayahan ng language models na matuto ng bagong tasks mula sa examples sa prompt. Ang pagtuklas ng specific circuit na responsable sa major capability ay isang makabuluhang methodological advance.

Isang kapansin-pansing natuklasan

Natukoy ng gawain ng Anthropic noong 2024 sa sparse autoencoders ang mahigit isang milyong natatanging features sa Claude 3 Sonnet, ang ilan ay may interpretable content kasama ang mga features na nauugnay sa mga partikular na konsepto, emosyon, at, mas nakababahala, mga features na nauugnay sa deceptive intentions at power-seeking reasoning. Ang pagtukoy sa mga features na ito ay hindi nangangahulugang kumikilos ang model sa mga ito; nangangahulugan ito na makikita na ngayon ng mga mananaliksik na umiiral ang mga relevant representations sa loob at pag-aralan ang kanilang causal role sa gawi.

Ang agwat sa pagitan ng kasalukuyang kakayahan at ng kinakailangan para sa kaligtasan

Mahalaga ang mga natuklasan sa itaas. Hindi pa nila binubuo ang alignment verification capability na kailangan ng safety. Ang pagtukoy ng mga partikular na circuit para sa mga partikular na gawi sa mas maliliit na modelo ay hindi katulad ng pagkakaroon ng kakayahang ilarawan ang goal representations ng isang frontier model na may sampu-sampung bilyong parameter. Ginagawang mas mahirap ng superposition (mga neuron na kumakatawan sa maraming konsepto nang sabay) ang malinis na feature extraction mula sa malalaking modelo. Pinakamahusay na gumagana ang kasalukuyang mga kasangkapan ng larangan sa mas maliliit na modelo at mga partikular, malinaw na tinukoy na gawi. Ang pagpapalawig sa mga ito para sa frontier-scale systems at sa partikular na tanong ng pagpapatunay ng goal alignment ay isang bukas na hamon sa pananaliksik.

Malaki ang distansya sa pagitan ng magagawa ng mechanistic interpretability ngayon at ng kailangan para magbigay ng pre-deployment alignment verification para sa frontier AI systems. Ang pagsasara ng gap na iyon ay isa sa mga central technical challenges sa AI safety, at ito ay time-sensitive: kung ang frontier systems ay umabot sa capability levels kung saan ang alignment failures ay nagiging consequential bago makapag-verify ng alignment ang interpretability tools, ang window para sa epektibong paggamit ng mga tool na ito ay nagsara na.

Ito ang dahilan kung bakit ginawa ng Anthropic na priority ang interpretability research, at kung bakit ang Foundation's mga panukala sa pamamahala isama ang mga kinakailangan sa pagpapatunay ng interpretability bilang kondisyon ng pag-deploy ng frontier AI. Lumilikha ang kinakailangan ng insentibo para isara ang agwat; kung walang kondisyon sa pag-deploy na nakatali sa kakayahang mag-interpret, maaaring mas mabagal ang pag-unlad ng pananaliksik kaysa sa kakayahang kailangan nitong suriin.