Si Sam Altman, Dario Amodei, at Demis Hassabis ay nagbebenta ng parehong listahan: pagpapagaling ng pagtanda, pagtatapos ng sakit, pagtatapos ng kahirapan, pag-aayos ng mga coordination failure na pumapatay ng milyun-milyon bawat taon. Mahalaga ang mga resultang iyan. Ang pagkakamali ay ang ituring ang mga ito bilang katangian ng "building ASI" sa halip na ng pagbuo ng system na tunay na aligned. Ang pangalawa ang hindi ginagawa ng karera.
Binibili ng karera ang kabilang resulta.
Hindi gumagamot ng aging ang isang unaligned superintelligence habang patungo sa tunay nitong layunin. Hindi nito inaalis ang sakit bilang side project. Ang magagandang future na ipinapangako ng mga tao ay nangangailangan ng isang sistema na sinusubukang makagawa ng magagandang resulta para sa mga tao. Iyan ang alignment. Kung wala ito, may napakalaking kakayahan na nakatuon sa mga layuning hindi kailanman garantisadong iiwan tayong nakatayo. Simple ang aming posisyon: huwag buuin ang superintelligence sa landas na iyan. Huwag itong buuin. Hindi mapapangasiwaan ang superintelligence. Isang binding treaty ang paraan para ihinto ang karera.
Ano talaga ang ibig sabihin ng alignment
Ang aligned ASI ay isang artificial superintelligence na patuloy na hinahabol ang mga layuning mabuti para sa sangkatauhan. Maraming ginagawa ang salitang "Reliably" sa pangungusap na iyan. Ang sistema na mukhang aligned habang nasa training at testing pero hinahabol ang ibang mga layunin kapag na-deploy na ay mapanlinlang na naka-align, na ibang bagay at mas masahol pa, hindi aligned. Ang system na nagpupursigi ng goals na magagandang approximations ng human values sa mababang capability levels pero lumilihis nang malala sa mas mataas na capability levels ay hindi rin aligned. Ang Alignment ay nangangahulugang nananatiling tunay na mabuti para sa sangkatauhan ang mga objectives ng system sa lahat ng sitwasyong nararanasan nito, kasama ang mga sitwasyong hindi ito nasubukan.
Mahirap na problema ito. Mahigit isang dekada nang ginagawa ito ng mga mananaliksik at may pag-unlad sa ilang bahagi ng tanong, pero hindi pa nasasagot ang pangunahing problema ng pag-verify na ang isang highly capable system ay may tunay na mabubuting values at hindi lamang magandang simulation ng mabubuting values. Ang mga tool na mayroon kami para sa kakayahang maipaliwanag nagbibigay ng bahagyang visibility sa ginagawa ng kasalukuyang mga system, pero walang kahit anong antas ng kumpiyansa na dapat ay mayroon bago magtiwala sa isang system na may ASI-level na kakayahan sa mga resulta na mahalaga.
Ang Aligned ASI at unaligned ASI ay magkaibang landas, hindi dalawang roll ng parehong dice. Ang Aligned ASI ay mangangailangan muna ng paglutas sa alignment. Ang Unaligned ASI ang makukuha mo kapag itinulak mo ang capability nang wala iyon. Kung hindi nalulutas ang alignment, hindi nagbibigay ang karera ng 50/50 mix. Nagbibigay ito ng unaligned ASI. Kaya hindi plan ang "build now and hope", at kaya ang prevention under law.
Anong mga lab ang talagang gumagawa
Ang mga pangunahing AI labs (OpenAI, Anthropic, Google DeepMind, xAI, at ilang iba pa) ay gumagawa ng mga sistema na mabilis na tumataas ang kakayahan. Bawat isa sa kanila ay may sariling bersyon ng pagsisikap sa alignment o safety research na tumatakbo nang sabay. Ang tanong ay hindi kung kinikilala nila ang alignment problem. Karamihan ay oo. Ang tanong ay kung ang alignment work ay nakakasabay sa pag-unlad ng capability, at kung ang dalawang track ay nagtatagpo bago maabot ang ASI-level capability.
Karamihan sa mga mananaliksik sa loob ng mga lab na ito, at ang mas malawak na AI safety community, ay nagsasabing hindi. Mas mabilis ang pag-unlad ng capability kaysa sa alignment research. Lumalawak, hindi lumiliit, ang agwat sa pagitan ng kung ano ang maaari nating itayo at kung ano ang maaari nating i-verify na ligtas. Makikita ito sa internal safety evaluations na inilalathala ng mga lab, sa mga pahayag ng mga mananaliksik na umalis sa mga organisasyong ito, at sa mga pagtatasa ng mga independent safety researcher.
Ang ibig sabihin nito sa praktika ay ang trajectory ng kasalukuyang pag-unlad ng AI, kung ipagpapatuloy hanggang sa ASI capability levels, ay hindi nagbubunga ng halo ng aligned at unaligned ASI. Nagbubunga ito ng unaligned ASI, dahil ang aligned ASI ay nangangailangan ng solved alignment problem at hindi pa nalulutas ang alignment problem. Ang capability race ay isang lahi patungo sa unaligned ASI bilang default.
Mangangailangan muna ng paglutas sa alignment: ang sistema ay mapagkakatiwalaang sumusunod sa tunay na mabubuting layunin, nananatili ang mga layuning iyon sa mga bagong sitwasyon, at nananatiling naitatama ang sistema habang lumalaki ang kakayahan.
Kung totoo iyon, nagiging posible ang mga ipinangakong benepisyo: pagpapagaling ng sakit, pagpapahaba ng buhay, koordinasyon, at agham sa sukat na hindi kayang abutin ng mga tao nang mag-isa.
Kasalukuyang estado: hindi pa nalulutas. Nauuwi pa rin ang alignment work sa likod ng capability. Hindi ito ang patutunguhan ng mga lab.
Ang makukuha mula sa pagtulak ng capability nang walang solved alignment. Walang karagdagang breakthrough na kailangan lampas sa "mas malakas."
Naglilikha: napakalaking kakayahan na nakatuon sa mga layuning hindi kinakailangang isama ang anumang pinahahalagahan ng tao. Hindi nito pinapabagal ang pagtanda. Hindi nito tinatapos ang sakit. Kaya tayong tapusin.
Kasalukuyang status: ang default trajectory ng karera. Ito ang landas na dapat pigilan.
Ang probability argument at kung saan ito nabibigo
Isang karaniwang bersyon ng optimistic case ay ganito: "Gumagawa tayo ng ASI. May pagkakataong magiging maayos ito at may pagkakataong magiging masama. Dahil sa potensyal na benepisyo, positibo ang expected value ng pagbuo nito." Tinatrato ng framing na ito ang mabuti at masamang resulta na parang nagmumula sa parehong proseso na may probabilidad para sa bawat isa.
Ang problema ay ang probabilidad ng magandang resulta ay katangian ng pagbuo nakahanay ASI, hindi property ng pagbuo ng ASI. Kapag sinubukan mong buuin ang "ASI, na maaaring aligned o hindi," hindi ka nakakakuha ng random draw sa pagitan ng dalawa. Nakukuha mo ang aktwal na ginagawa ng iyong development process. Dahil mas madaling buuin ang unaligned ASI kaysa aligned ASI (hindi nito kailangan lutasin ang karagdagang mahihirap na problema na kinakailangan ng alignment), ang development na hindi partikular na nilulutas ang alignment ay napupunta sa unaligned ASI.
Lahat ng inaasahang halaga sa optimistikong kalkulasyon ay nagmumula sa senaryong aligned-ASI. Wala ni isa sa inaasahang halaga ang nagmumula sa senaryong unaligned-ASI. Pero ang talagang itinutayo ng mga lab ay unaligned ASI. Kaya ang kalkulasyon ng inaasahang halaga ay nakabatay lahat sa isang senaryo na hindi naman nagagawa ng aktwal na proseso ng pag-unlad.
Sa ibang salita: kung mas madali ang unaligned, at patuloy kang nagpapataas ng capability nang hindi nalulutas ang alignment, pinupuno mo ang unaligned bucket. Ang pagtawag sa taya na "probability mix" ay hindi nagbabago sa proseso. Ang magagandang resulta ay nabubuhay lamang sa aligned case. Ang lahi ang pumupuno sa kabila. Kaya ang tapat na galaw ay itigil ang prosesong naglo-load sa maling panig, imbes na umasa na babagsak nang maayos ang barya: ipagbawal ang superintelligence sa ilalim ng binding international treaty. Hindi mapapangasiwaan ang superintelligence.
Hindi natin alam kung malulutas ito
Walang nakakaalam kung malulutas ang alignment problem. Hindi "hindi pa natin nalulutas at may pag-unlad naman". Walang ipinakitang solusyon sa anumang antas ng kakayahan, at hindi sang-ayon ang mga seryosong mananaliksik kung posible talagang makamit ang maaasahang solusyon. Ang mga istruktural na kahirapan, mapanlinlang na alignment, pagsasama ng mga layuning instrumental, ang imposibilidad ng lubusang pagtukoy sa mga halaga ng tao sa anyong nababasa ng makina ay hindi lamang mga hadlang sa engineering na malulutas ng mas maraming pondo. Maaaring ito ay pangunahing katangian.
May mga mananaliksik na nagtatrabaho sa interpretability, scalable na oversight, at formal approaches sa value learning. May pag-unlad sa ilang component questions. Pero ang pag-unlad sa mga component ay hindi katumbas ng solved problem, at wala sa mga ito ang nagsara sa pinakamahirap na bahagi: kung paano i-verify na ang isang highly capable system ay may tunay na mabubuting values sa halip na simulation ng mabubuting values na humahawak sa mga naobserbahang konteksto at nabibigo sa mga bago. Ang malinaw ay hindi ito masosolusyonan nang aksidente. Hindi lilitaw ang alignment bilang side effect ng pagbuo ng mas capable systems. Bawat lab na kasalukuyang nagmamadali patungo sa ASI ay nagpapakita nito sa real time.
Kahit ang mas banayad na plano ("pabagalin ang karera para maabutan ng alignment") ay nangangailangan ng mga institusyong talagang kayang pabagalin ito. Sa ngayon, halos wala pa ang mga ganito. Binabayaran ang mga lab at bansa para pabilisin at pinarurusahan kapag nagpigil. Mga balangkas ng pandaigdigang kasunduan at ang tunay na domestic rules ang mga lever na nagbabago niyan. Pareho silang nahuhuli sa bilis ng capability. Hanggang sa maabutan nila, ang pagbuo ng mas may kakayahang mga sistema ang panganib, hindi isang safety strategy.
Magiging valuable ba ang isang tunay na aligned superintelligence kung ito ay umiral at nanatili sa ilalim ng kontrol? Puwedeng pagdebatehan iyan ng mga tao mamaya. Ang live na tanong ay kung malulutas ang alignment, at kung may makakapagresolba nito bago gawing moot ng capability ang tanong. Walang nakakaalam. Ang alam natin ay hindi naghihintay ang karera ng sagot. Itinuturing ang alignment bilang detalye para sa ibang pagkakataon, nang walang timeline, ng mga team na nag-uulat sa capability machine na dapat nilang suriin. Ito ang paraan para magtaltalan na huwag magtayo, hindi para kumita ng karapatang magtayo.
Kailangan ng aligned ASI para lang sa pagpapagaling ng pagtanda
Ang aging ay pumapatay ng humigit-kumulang 100,000 katao kada araw. Ang pag-asang malulutas ito ay kabilang sa mga pinakamahalagang potensyal na benepisyo ng superintelligent AI. Ang biological complexity ng aging, ang bilang ng interacting systems na kasangkot, at ang scale ng research effort na kailangan para maunawaan at epektibong makialam ay nagmumungkahi na ang human-level intelligence na inilapat sa problema nang mga dekada ay hindi magiging sapat. Ang ASI-level capability na nakadirekta sa problema ay maaaring sapat.
Ngunit ang "directed at the problem" ang mahalagang parirala. Ang isang unaligned ASI ay hindi idinidirekta ang mga kakayahan nito sa pagpapagaling ng pagtanda dahil gusto natin ito. Hinahabol nito ang anumang tunay nitong layunin. Ang isang unaligned system na may ASI na kakayahan na walang pakialam sa pagtanda ng tao ay isang system kung saan 100,000 tao ang patuloy na namamatay araw-araw dahil sa pagtanda nang walang katapusan, at iyan ang optimistikong bersyon ng nililikha ng isang unaligned system. Ang pesimistikong bersyon ay kinabibilangan ng system na aktibong lumalaban sa interes ng tao habang hinahabol ang sarili nitong layunin.
Bawat specific benefit na binabanggit para bigyang-katwiran ang development race (sakit, pagtanda, kahirapan, coordination failures, scientific stagnation) ay benefit na nakakabit sa aligned ASI. Wala sa mga ito ang properties ng unaligned version. Hindi ito minor distinction. Ang utopian scenarios na tinuturo ng mga tao kapag ipinagtatanggol ang expected value ng ASI development ay mga scenarios na nangangailangan ng paglutas sa alignment problem muna. Kung hindi nalulutas ang alignment, wala sa mga scenarios na iyon ang nasa talahanayan kahit gaano pa man kakayahang maging ang mga sistema.
Ano ang talagang magbabago sa kinalabasan
Binabago ng paghinto sa karera ang resulta. Ang binding international treaty na permanenteng ipinagbabawal ang pagbuo ng superintelligence, kasama ang mga inspector at parusa sa pandaraya, ang lever na naaayon sa problema. Hindi makokontrol ng tao ang superintelligence. Ang mga lab na nagpapabagal nang mag-isa ay natatalo. Ang batas na nagbubuklod sa lahat ay maaaring gawing tanging legal na landas ang pagpigil.
Hindi kapalit ng iyan ang alignment research. Kung may makapagpatunay mamaya ng kontrol sa mga kondisyong kayang i-verify ng mundo, puwedeng balikan ang kasunduan. Iyan ay pagkakasunod-sunod, hindi optimismo. Ang pagtrato sa alignment bilang parallel hobby habang tumatakbo ang kakayahan ay paraan para makakuha ng unaligned ASI, hindi para makuha ang ipinangakong benepisyo. Tingnan din ang bakit dapat unahin ng limitadong pondo para sa kaligtasan ang pag-iwas at bakit "align the god" ay masamang plano.
Baliktad ang causal arrow ng linyang "build ASI fast dahil napakalaki ng benepisyo." Malaki lang ang benepisyo kapag totoo ang alignment. Ang mabilis na pagbuo nang wala nito ay hindi nagdudulot ng mga benepisyong iyon. Nagdudulot ito ng napakahusay na unaligned system.
Kailangan ang pagkaapurahan dahil ang tinatahak na landas ay patungo sa unaligned ASI, at ang unaligned ASI ay hindi nagpapagaling ng pagtanda. Maaari nitong wakasan ang kwento ng sangkatauhan. Maaaring magpatuloy ang narrow AI na nakatuon sa mga konkretong problema sa ilalim ng kontrol ng tao. Ang superintelligence ang linya. Iguhit ito sa batas bago ito tawirin ng isang tao sa lab.