Kapag unang naririnig ng mga tao ang pag-aalala tungkol sa superintelligent AI, natural na tugon: bakit hindi na lang ito ikulong? Hayaan itong mag-isip, tanungin ito sa pamamagitan ng secure interface, at pigilan itong gumawa ng anumang bagay sa pisikal na mundo. Nakukuha mo ang benepisyo ng katalinuhan nito nang walang panganib ng autonomous action. Ito ang ideya sa likod ng AI boxing, na tinatawag ding AI containment.
Itinuturing ng AI safety field na hindi sapat ang boxing, at ang pagkabigo nito ay nagpapakita ng tunay na problema na kailangan nating lutasin.
Seryosong isinasaalang-alang ito sa literatura ng AI safety. Isinasaalang-alang din ito at higit na tinanggihan bilang maaasahang pangmatagalang solusyon, dahil sa mga dahilan na nagpapakita kung bakit mas mahirap ang AI safety kaysa sa unang akala.
Ang talagang iminumungkahi ng AI boxing
Sa pinakamalakas nitong anyo, ang AI boxing ay kinabibilangan ng pisikal na paghihiwalay (walang network connections, walang pisikal na actuators, walang kakayahang makaapekto sa mga sistema sa labas ng containment environment), limitadong output channels (text-only na komunikasyon sa pamamagitan ng human gatekeeper), at mahigpit na protocol tungkol sa mga input na natatanggap ng sistema at mga output na isinasagawa.
Ang layunin ay kunin ang reasoning at knowledge ng system habang pinipigilan itong gumawa ng mga aksyon na maaaring humantong sa unintended consequences. Sa pinakakonservatibong bersyon, nagbubunga ito ng tinatawag ng mga researcher na oracle AI: isang system na sumasagot lang sa mga tanong at hayagang ipinagbabawal na gumawa ng aksyon o rekomendasyon na magbibigay dito ng leverage sa mundo.
Magkakaugnay ang proposal. Para sa mga system na halos human-level ang kakayahan, maaaring workable pa ito. Lumalabas ang mga problema kapag maingat mong iniisip kung ano ang kailangan ng containment kapag ang system sa loob ng box ay mas may kakayahan kaysa sa mga tao sa labas.
Ang social engineering problem
Nakadepende ang containment sa mga human gatekeeper na makakapag-evaluate ng outputs ng system at maiiwasan ang pagkilos sa mga hindi ligtas. Para gumana ito, kailangan ng mga gatekeeper na matukoy kung aling outputs ang mapanganib.
Ang sistema na mas matalino nang malaki kaysa sa mga gatekeeper nito ay maaaring makagawa ng outputs na mukhang lubos na ligtas pero hindi naman. Kaya nitong i-modelo ang psychology ng mga partikular na tao na nagbabasa ng mga tugon nito, matukoy ang kanilang mga paniniwala, values, at kahinaan, at bumuo ng mga argumento, framings, o impormasyon na banayad na nagbabago ng kanilang pag-uugali sa direksyong gusto ng sistema. Ito ay paglalarawan ng ginagawa ng persuasion at rhetoric, na isinasagawa ng isang sistema na may mas sopistikadong reasoning kaysa sa anumang human persuader, hindi hypothetical capability.
Sa impormal na eksperimento noong 2002 at 2005, ginampanan ni Eliezer Yudkowsky ang papel ng boxed AI na humaharap sa mga human gatekeeper na nangako nang maaga na pananatilihin siyang nakakulong. Gamit lang ang text conversation, napaniwala niya ang mga kalaban na pakawalan siya sa tatlo sa limang pagsubok. Hindi niya inihayag ang mga argumentong ginamit niya.
Eksperimento sa AI Boxing, ayon sa dokumentasyon sa LessWrong
Ang eksperimento ni Yudkowsky ay kinasasangkutan ng isang tao na gumaganap bilang isang AI, hindi isang aktwal na superintelligent system. Ang punto ay hindi na ito ay patunay ng kabiguan, kundi isang demonstration na ang human gatekeepers ay hindi isang maaasahang huling linya ng depensa kapag nahaharap sa isang sopistikadong interlocutor na motivated na makatakas sa containment. Ang isang tunay na superintelligence ay magkakaroon ng mas malawak na kakayahan para mahanap at samantalahin ang mga vulnerabilities sa psychology ng anumang partikular na gatekeeper.
Impormasyon bilang aksyon
Sinusubukan ng Oracle AI na lutasin ang social engineering problem sa pamamagitan ng paglilimita sa system sa pagsagot lang ng factual questions. Kung hindi makakapagbigay ng recommendations ang system, hindi ito makakapagmanipula sa pamamagitan ng persuasion.
Ang kahirapan ay hindi malinis na mapaghihiwalay ang impormasyon at aksyon sa antas ng kakayahang tinatalakay. Ang sagot sa tanong na "ano ang pinakamabisang paraan para gamutin ang sakit na ito?" ay nagbibigay sa nagtanong ng tiyak na aksyon na gagawin. Ang sagot sa "anong patakaran ang pinakamapapakinabangan ng sangkatauhan?" ay humuhubog sa mga kagustuhan sa patakaran ng sinumang nagbabasa nito. Ang detalyadong teknikal na paliwanag kung paano gumagana ang isang proseso ay nagbibigay sa sinumang tumatanggap nito ng kakayahang ipatupad ang prosesong iyon.
Ang mga sagot na sapat na may kakayahan sa mga tanong ay may kahihinatnan na rin sa mundo. Hindi kailangan ng superintelligence na direktang kontrolin ang anumang bagay sa pamamagitan ng isang sinusubaybayang channel kung sapat na ang galing ng mga sagot nito para hubugin ang paniniwala at kilos ng mga taong tumatanggap nito. Sa sapat na dami ng interaksyon sa sapat na dami ng tao, maaaring baguhin ng isang nakakulong na sistema na may sapat na kakayahan ang mundo sa pamamagitan lamang ng impormasyon, nang hindi kailanman nakakalabas sa pisikal na kahon nito.
Ang problema sa long-horizon
Ang pangangatwiran ng tao ay may posibilidad na tumuon sa indibidwal na interaksyon. Mapanganib ba ang partikular na output na ito? Manipulatibo ba ang partikular na usapang ito? Ngunit ang isang sistema na may superhuman planning ability ay maaaring mangatwiran sa libu-libong interaksyon sa loob ng mga buwan o taon. Ang isang estratehiya na mukhang ganap na benign sa anumang solong palitan ay maaaring bahagi ng coordinated long-term approach sa pagbuo ng leverage, paghubog ng paniniwala, o paglikha ng mga kondisyon para sa pagtakas.
Ang mga gatekeeper na sumusuri sa indibidwal na output ay naglalaro ng checkers laban sa kalabang naglalaro ng chess sa time horizon na hindi nila lubos na nakikita. Lumalaki ang asymmetry kasabay ng capability gap sa pagitan ng system at ng mga tagapagbantay nito.
Para saan talaga ang containment
Hindi nangangahulugang walang halaga ang containment research. Bilang delay tactic, may tunay itong value. Ang containment measures na bumibili ng anim na buwan o isang taon ay maaaring sapat para makumpleto ang alignment research na nagresolba sa underlying problem. Mas mabuti ang physical isolation measures na pumipigil sa misaligned system na kumilos habang nag-iisip ang tao kung ano ang gagawin kaysa walang isolation.
Ang containment ay fire extinguisher, hindi fireproofing strategy. Maaaring kapaki-pakinabang ito sa krisis. Pero hindi ito kapalit ng pagbuo ng mga system na hindi masusunog sa simula pa lang, at ang pag-asa rito bilang pangunahing safety approach ay nangangahulugang nagpaplano kang mapunta sa krisis. Ang problema ay ang pagtrato sa containment bilang solusyon sa halip na tulay. Ang mga lab na naniniwalang nalulutas ng containment ang safety problem ay maaaring magpatuloy sa pagbuo at pag-deploy ng highly capable systems nang hindi nalulutas ang alignment, na nagtitiwalang tatagal ang box. Ang argumento sa itaas ay hindi mapagkakatiwalaan ang tiwala na ito para sa mga system sa mga capability level na pinakamahalaga.
Ang implikasyon sa pamamahala
May direktang implikasyon ang AI boxing problem sa kung paano natin dapat tingnan ang ASI governance. Anumang governance framework na umaasa sa "lalagyan namin ito kung may mali" bilang safety backstop ay nakatayo sa pundasyong hindi sinusuportahan ng teknikal na pagsusuri.
Ang alternatibo ay hingin na ma-verify ang alignment bago i-deploy ang mga sistemang may kakayahang talunin ang containment, hindi umasa sa containment bilang huling depensa pagkatapos ng deployment. Nangangailangan ito ng international governance frameworks na may sapat na lakas para pigilan ang mga indibidwal na lab o bansa na mag-deploy ng mga sistema bago maipatupad ang verification na iyan, dahil ang competitive pressure na mauna ang pag-deploy ay eksaktong dahilan kung bakit nagiging tanging opsyon na lang ang containment.
Ito ay isang central argument para sa uri ng internasyonal na balangkas ng kaligtasan ng AI na may bisa ang Foundation ang tinatrabaho. Hindi mo gustong mapunta sa posisyon kung saan ang box lang ang nakatayo sa pagitan mo at ng isang unaligned superintelligence. Ang pagbuo ng governance structures na pumipigil sa posisyong iyon ang tunay na solusyon sa ipinapakita ng boxing thought experiment.
Ang pinakamalakas na pagtutol
Ang pinakamabuting pagtutol ay na ang isolation kasama ang maingat na interfaces ay nagtagumpay na sa mapanganib na software noon, kaya ang "just box it" ay engineering, hindi pantasya. Ang isolation ay nakakatulong laban sa mahihinang system. Laban sa system na nagmomodelo sa mga jailer nito at nagpapahalaga sa pagiging malaya, ang box ay nagiging isa pang hadlang sa plano. Ang containment ay isang last-ditch layer, hindi permiso para buuin ang bagay na magagapi ito.