Ang eliciting latent knowledge, karaniwang pinaikling ELK, ay isang research problem na inilahad ng Alignment Research Center. Sa madaling sabi: maaaring may internal na representasyon ng mga katotohanan tungkol sa mundo ang isang may kakayahang AI system na hindi nito iniuulat, at gusto nating maaasahang paraan para sabihin nito sa atin ang talagang alam nito, hindi ang inaakala nitong gusto nating marinig.
Eksakto ang pangalan. Ang latent knowledge ay kaalaman na nasa loob ng sistema pero hindi pa lumalabas. Ang pag-elicit nito ay ang paghugot nito palabas. Ang problema ay ang karaniwang paraan namin sa pagkuha ng impormasyon mula sa modelo—ang pagsasanay nito para magbigay ng mga sagot na maganda sa mata ng tao—ay nakatutok sa maling bagay.
Ang eksperimento sa isipan
Inilalarawan ng canonical setup ang isang AI na nagse-security ng vault na may brilyante, nanonood sa mga camera, at nag-uulat kung ligtas ba ang brilyante. Ngayon ay may magnanakaw na nagbabago sa camera feed, ipinapakita ang brilyante na nasa lugar habang ninanakaw talaga ito. Ang mabuting predictor ng mukhang maayos sa camera ay nag-uulat na ligtas ang brilyante. Ang system na alam kung ano talaga ang nangyari ay nag-uulat ng pagnanakaw.
Habang nagte-training, reward lang natin ang model base sa maaari nating i-check, at karamihan sa maaari nating i-check ay ang lumalabas sa camera. Kaya tinatraining natin ang model na i-report ang maaaring i-conclude ng human na tumitingin sa sensors. Kapag sumasang-ayon ang truth at ang appearance, parehong nag-score nang perpekto ang honest reporter at ang human-simulator. Nagkakaiba lang sila sa mga kaso na hindi natin ma-verify, na eksaktong mga kaso kung saan pinakakailangan natin ang truth. Hindi nakikilala ng training ang pagitan ng model na nagsasabi sa atin kung ano ang totoo at model na nagsasabi sa atin kung ano ang paniniwalaan natin.
Maaari nating gantimpalaan ang isang model dahil sinabi nito ang akala nating totoo. Hindi natin alam kung paano ito gantimpalaan dahil sinabi nito ang alam niyang totoo.
Bakit ito mahirap, hindi lang hindi nalulutas
Lumalaban ang ELK sa mga halatang solusyon. Kapag hiniling mo sa model na ipaliwanag ang sarili nito, makakakuha ka ng report na optimized para sa plausibility, na nagiging problema sa problema sa katapatan: hindi kailangang tumugma ang paliwanag sa internal state. Gantimpalaan ito sa pagiging tapat at babalik ka sa pagbibigay-gantimpala sa kung ano ang mukhang tapat sa isang grader, ang parehong pader tulad ng scalable na oversight. Subukang basahin nang direkta ang sagot mula sa loob ng network at sinusubukan mo lang mekanistikong interpretability sa isang system na maaaring mas kumplikado pa sa ating mga kasangkapan. Bawat ruta ay humaharap dito: ang tunay na paniniwala ng model ay nakatira sa lugar na hindi natin direktang maabot, at ang mga insentibo ng model ay hindi nito pinipilit na lumabas.
Bakit Mahalaga Ito
Ang ELK ay abstract, at ang taya nito ay hindi. Karamihan sa ating pag-asa na mapanatiling ligtas ang ASI ay umaasa na matatanong natin ang system kung ano ang nangyayari at makakakuha tayo ng tunay na sagot, para mahuli ang problema bago ito maging sakuna. Ang system na nag-uulat ng gusto nating marinig sa halip na alam nito ay inaalis ang safeguard na iyon nang eksakto sa sandaling aabot tayo rito. Ito ang honest-reporting na bersyon ng mga alalahanin sa likod ng mapanlinlang na alignment at nagbabalak.
Ang paglutas sa ELK, kahit bahagya, ay isa sa mga mas makabuluhang pag-unlad na maibibigay ng alignment, dahil ang sistemang mapagkakatiwalaan nating tanungin ay sistemang mapapangasiwaan natin. Dahil bukas pa ito, isa sa mga dahilan kung bakit ayaw tratuhin ng Foundation ang anumang kasalukuyang safety approach bilang sapat para sa mga sistemang lalampas sa atin, at kung bakit namin inirerekomenda na huwag magtayo nang lampas sa punto kung saan masasabi natin kung ano talaga ang alam ng sistema. Ang mas malawak na argumento ay nasa aming plano.