Patuloy na tinatanong ng mga tao kung ano ang hitsura ng "brain" ng isang AI. Isang spreadsheet na kasing laki ng lungsod, puno ng mga numero na walang makakabasa. Mas kaunti ang romansa sa larawang iyan kaysa sa glowing neural cartoon, at mas kapaki-pakinabang ito. Kung gusto mong malaman kung ano ang ginagawa natin, at bakit mahirap ang kontrol, simulan sa hardware at sa math, hindi sa metapora.
Isang weight file
Ang modernong frontier model ay isang file. Sa loob nito ay nakaupo ang sampu o daan-daang bilyong parameter, bawat isa ay numerong itinakda habang nagte-training. Ang mga numerong iyon ang "connections." Hiniram ng mga mananaliksik ang salitang neuron mula sa biology dekada na ang nakalipas dahil mukhang medyo katulad ng nerve cells na magkakabit ang mga unang diagram. Doon lang nagtatapos ang pagkakatulad.
Ang biological neuron ay isang buhay na selula na may kimika, oras, at kasaysayan sa loob ng katawang kumakain at natutulog. Ang model weight naman ay isang coefficient sa matrix multiply. Kapag pinagsama-sama ang sapat na multiplies at sinanay sa sapat na text at images, mahusay na nahuhulaan ng stack ang susunod na token para makapasa bilang usapan. Wala sa stack na iyan ang nag-iisip tungkol sa iyo. Wala rin itong gustong kumain ng tanghalian.
Kapag nag-publish ang mga lab ng model card, inilalarawan nila ang isang trained artifact: architecture, data mix, compute na ginamit, eval scores. Hindi nila inilalarawan ang isang isipan. Ang public language ay patuloy na nagsasabi ng "brain," dahil ang utak ang tanging intelligence na nakilala ng karamihan sa atin.
Ano ang makikita mo kung bubuksan mo ito
Buksan mo ang file at makakakuha ka ng layers. Ang early layers ay karaniwang kumukuha ng simple patterns (edges sa images, common word pairs sa text). Pinagsasama ng later layers ang mga pattern na iyon sa mga bagay na mukhang, mula sa labas, mga concepts. I-probe mo ang gitna ng isang malaking language model at makakahanap ka ng directions sa activation space na nag-iilaw para sa "French" o "inside a quote" o "this claim is false." Totoong istruktura iyon. Hindi rin ito isang mapa ng beliefs na makikilala ng isang tao.
Walang module na may label na "goals." Walang organ para sa "self." Mayroong landas mula sa input tokens patungo sa output tokens, hinuhubog ng anumang nagpababa sa training loss. Kung kumikilos ang model mamaya na parang may goal ito, ang ganoong behavior ay side effect lamang ng mahusay na pag-predict sa ilalim ng pressure.
Ang interpretability research ay ang pagtatangkang basahin pa rin ang bagay na ito. Totoo ang pag-unlad ngunit mabagal. Ang lubusang pagbasa ng frontier model tulad ng pagbabasa ng makina ng mekaniko ay hindi pa nasa talahanayan. Mahalaga ang agwat na ito para sa kaligtasan: hindi mo masasertipikahan ang hindi mo masusuri.
Bakit Nililigaw Tayo ng Brain Metaphor
Lumalaki ang utak sa loob ng hayop na namamatay kapag walang ingat. Matagal na panahon ang ginugol ng ebolusyon sa pagpaparusa sa mga agent na hindi pinansin ang sakit, social bonds, at ang malapit na hinaharap. Wala sa training signal na iyan ang nasa weight file bilang default. Puwedeng magsalita nang likas ang model tungkol sa empathy habang ino-optimize ang score na walang kinalaman sa pag-aalaga.
Mabagal at magastos din ang pagkopya ng utak. Ang isang trained model ay impormasyon lamang. Kopyahin ang file at mayroon ka nang bagong instance. Ilipat ito sa bagong data center at tatakbo ito. Mas malapit ito sa software kaysa sa isang tao, at sinisira nito ang lahat ng safety habit na itinayo natin sa paligid ng iisang katawan sa iisang silid.
Tawagin mo itong utak at hiniram mo lang ang ginhawa ng isang bagay na marupok, sosyal, at mortal. Ang artifact ay wala sa mga iyan.
Ano ang kinalaman nito sa superintelligence
Nagugulat na ng kasalukuyang mga sistema ang kanilang mga gumagawa sa mga kasanayang walang sinasadyang inilagay. Iyan ang ibig sabihin ng "emergent" sa larangang ito: kakayahang lumilitaw sa scale nang walang line item sa design doc. Kung lalo pang pinalaki ang scale, ikonekta ang tools at memory at ang open network, makakakuha ka ng mga agents na nagpupursigi ng mga layunin sa maraming hakbang. Hindi gaanong mahalaga kung mukhang tao ang "brain". Ang mahalaga ay kung ang isang sistema na mas may kakayahan kaysa sa atin, na hindi natin lubos na mabasa, ay mapapanatiling nakatuon sa human interests.
Hindi pa namin nalulutas iyan. Ang alignment research ay tapat tungkol sa kahirapan ng problema. Habang hindi pa ito nalulutas, ang pagbuo patungo sa artificial superintelligence ay hindi simpleng walang saysay na pag-usisa. Maglo-load ito ng weight file na maaaring isang araw ay higitan ang kakayahan ng mga taong may hawak ng delete key.
Kaya kapag may nagtanong kung ano ang hitsura ng utak ng AI, sagutin nang diretso. Parang math sa industrial scale, nakaupo sa mga chips sa loob ng isang nakakandadong gusali, at patuloy na umuunlad bawat taon. Isipin mo ang isang makina na minamadali nating gawing mas matalino kaysa sa mga operator nito, nang walang patunay na kayang ituwid, hindi isang bungo na puno ng iniisip. aming plano ay itigil ang karerang iyan sa superintelligence hanggang sa may patunay.