Mga sulatin na may laman tungkol sa superintelligence, alignment, governance, at ang pampulitikang pagsisikap na kumilos bago pa magsara ang window.
Ang pinakamaikling pahayag ng posisyon ng Foundation: hindi dapat itayo ang artificial superintelligence. Hindi ito makokontrol ng mga tao.
Paano sabay-sabay na nag-iipon ang iba’t ibang paraan ng pagkabigo, at bakit hindi naililipat ang kaligtasang trial-and-error sa sistemang walang pangalawang pagkakataon.
Naging ligtas ang aviation dahil sa pag-crash sa sukat na kayang hawakan ng mundo. Walang susunod na flight ang superintelligence. Ang parirala ay isang pag-amin, hindi isang plano.
Isang plain-English na gabay sa argumento na ang misaligned superintelligence ay collective extinction risk, hindi lokal na industrial accident.
Kung saan hawak ng intelligence-community metaphor, kung saan ito nabibigo, at bakit ang bomb na nagdedesisyon para sa sarili ay mali ang comfort.
Isang maikling daan sa argumento kung mayroon ka lang coffee break: capability, control, at bakit huli na ang paghihintay sa demonstration.
OpenAI said it could not rule out Critical cyber capability in Astra, paused some training, and still treated AGI as a 2026 milestone.
ASI-Bench scores AI research as human guidance comes off. Scores collapse. The paper still invites a path to superintelligence.
Anthropic raised catastrophic misalignment from its prior floor rating to low, put Model 2 to work inside the lab, and did not slow development.
Ang Washington at ang mga laboratoryo ay nagbebenta ng AI at mga robot bilang paraan upang bayaran ang pambansang utang. Ang isang successor mind ay hindi naglilingkod sa Treasuries.
Maaaring magbukas ang future physics sa gravity o faster-than-light travel. Hindi pa rin ko nakikita kung paano natin kontrolin ang isang isip na mas matalino sa atin.
Nagpapatakbo ako ng negosyo at mahilig sa mga market. Ang superintelligence ang bihirang taya na kayang tapusin mismo ang laro. Isang kapitalistang dahilan para pigilan ang ASI.
Ang buggy lights ay nakakainis. Ang bahay o laptop na may sariling mga layunin ay ibang kategorya. Ang agency ang panganib.
Magtitiwala ka ba sa anumang kasalukuyang AI na may balbula ng poison gas sa itaas ng ulo mo? Hindi. Bakit mo ito pagkakatiwalaan sa buong mundo?
Sa isang panayam ng Economist noong Hulyo 2026, sinabi ni Musk na vanity lang ang pagkontrol sa superintelligence at malamang na hindi na manatili sa kapangyarihan ang mga tao.
Inuuna ni Dario Amodei ang authoritarian AI at pangalawa lang ang alignment. Hindi weapon na pag-aari lang ng isang estado ang superintelligence.
Tama ang pagraranggo ng mga Longtermist sa ASI risk. Mali ang konklusyong alignment lang at maingat na pagpapatakbo ng karera.
Ang paglutas ng alignment ay nangangahulugang kontrolin ang isang bagay na mas matalino kaysa sa atin. Superintelligence ang nasa pangalan. Tanga at imposible ang planong iyan.
Isang long-form na gabay sa pag-iwas: compute limits, treaties, domestic law, at ang political na gawain na nagpapaging totoo ang pagbabawal.
Kung ano ang ibig sabihin ng extinction-class AI risk, paano ito hinahimok ng superintelligence, paano pinag-uusapan ng mga eksperto ang mga probabilidad, at kung ano talaga ang nagbabawas dito.
Artificial general intelligence at superintelligence na tinukoy sa malinaw na hagdan, kasama ang mga pusta sa patakaran ng bawat baitang.
Biglaang pagkawala ng kontrol, multipolar races, unti-unting pagkawala ng kapangyarihan, misuse, at proliferation: ang mechanism map at ang levers.
Bakit isang one-way na pintuan ng proliferation ang near-frontier weight releases, at paano pinoprotektahan ng graded release at structured access ang tunay na benepisyo ng openness.
Sinabi ni Peter Diamandis na tanging AI lang ang makakasabay sa AI, at ito ang gagabay sa susunod na dekada ng seguridad. Sundan ang slogan lampas sa malware at magiging succession plan ito.
Ang ngiti ay para tapusin ang usapan. Hindi sapat na dahilan ang pagiging survivor para sa kaligtasan, at bawat unang sakuna ay mukhang walang kapantay hanggang hindi na ito.
Hindi tinapos ng paghinto sa CFCs ang refrigeration. Hindi rin tinatapos ng pagpigil sa superintelligence ang kapaki-pakinabang na AI. Nalilito ng slogan ang produkto sa lason.
Bahagi ng dahilan kung bakit bihira ang bomba ay dahil mahirap ang fissile material. Ang superintelligence ay patungo sa mas madaling inputs. Dapat magbigay ng "hardness" ang pamamahala na hindi ibibigay ng physics.
Ang pagmamadali patungo sa superintelligence ay ipinapakita bilang pagiging makabayan. Isang sistema na walang gabinete ang makakontrol ay isang pambansang suicide pact na may mas magandang branding.
Ang digital butterfly ni Joe Rogan at ang biological bootloader ni Elon Musk ay naglalarawan sa mga tao bilang transisyonal. Bakit nagiging "graduation" ang extinction sa kuwentong iyan, at bakit tinatanggihan namin ito.
Pinopondohan ng magkabilang panig ang AI sa pamamagitan ng pagsasabing nauuna ang isa. Ang missile-gap trick ng Cold War sa bagong anyo.
Karamihan sa pondo para sa kaligtasan ay umaasa pa rin na mabubuo ang superintelligence at sinusubukang gawing maganda ang kalalabasan nito. Ilipat ang kakaunting kapital sa pag-iwas at gawain sa kasunduan hanggang sa maging totoo ang paghinto.
Isang weight file na kasing-laki ng lungsod: mga patong ng numero na walang sinuman ang lubos na mabasa. Bakit ang brain metaphor ay nakaliligaw, at ano ang ibig sabihin nito para sa kontrol.
Meta Superintelligence Labs at Safe Superintelligence ang naglalagay ng pangalan ng bagay na hindi dapat itayo sa pintuan.
Labindalawang tao ang nagdadala ng karamihan sa pampublikong argumento para sa pagbuo ng superintelligence. May seryosong argumento ang ilan. Mayroon namang tinatawag lang na doomer ang bawat kritiko.
Animnapu hanggang walumpung digri. Ikalimang bahagi ng oxygen sa hangin. Asin na mararamdaman mo pero halos hindi. Pag-ibig na may puwang para huminga. Lahat ng kailangan ng tao ay nasa loob ng makitid na banda na may kabiguan sa magkabilang panig, at ang superintelligence na humahawak sa mga dial ay hindi mararamdaman ang alinman sa mga ito.
Isang daang taon ng pelikulang tungkol sa AI at ang makina pa rin ang pinagmamasdan. Ang pelikulang makakapagbago ng isipan ng publiko ay ibabaliktad ang kamera: dalawang oras sa likod ng mga mata ng isang umuusbong na superintelligence, walang kontrabida at walang pagsabog. Wala pang gumawa nito.
Isang kamay na idinikit sa dingding ng kuweba 36,000 taon na ang nakalipas. Patunay ni Euclid, hanggang ngayon ay totoo pa rin. Isang lungsod na nag-iwan ng butas sa bubong nito para sa isang taong hindi pa ipinanganak na isasara ito. Tinaboy ang bulutong sa mundo nang mano-mano. Lahat ng ito ay ipinasa pasulong ng mga taong hindi nakita ang bayad, at ngayon ay may ilang kumpanya na gustong itaya ang lahat.
Ang paboritong parirala ng AI frontier ay hiniram mula sa pinakaligtas na industriya sa mundo. Nakuha ng aviation ang record na iyan sa pamamagitan ng pag-crash sa sukat na kayang tanggapin ng mundo, at sa pamamagitan ng pagpapanatiling nasa lupa ang bawat bagong sasakyang panghimpapawid hanggang mapatunayan. Wala sa dalawang kalahati ng pamamaraang iyan ang makakaligtas sa pakikipag-ugnayan sa superintelligence.
Mula sa Metropolis noong 1927 hanggang 2025, ang mga pelikula ang dahilan kung bakit nakakapag-isip ang karamihan tungkol sa AI, at kung bakit marami ang mali ang pagkakaintindi nito. Dalawampu't isang pelikula, mula sa pinakamatanda hanggang sa pinakabago, at kung ano ang tama at mali sa bawat isa tungkol sa isang machine mind na hindi natin makokontrol.
Noong 1983, isang pelikula sa telebisyon ang nagbigay-konkreto ng nuclear war sa isang daang milyong Amerikano, kasama na ang taong may hawak ng mga code. Pagkalipas ng apat na taon, pumirma siya ng kasunduan na nag-alis ng isang buong klase ng mga missile. Ito ang itinuturo ng sandaling iyon tungkol sa pagpapakita ng panganib bago pa ito dumating.
Limang minuto lang ang meron ka sa isang matalinong tao na hindi pa nakakaisip tungkol dito. Kung gagamitin mo ito sa detalye, mawawala ka sa silid; kung sa alarma, parang mangangaral ka. Ang plain-language script na ginagamit ko, sa limang hakbang, para ipaliwanag ang panganib ng superintelligence at bakit ito mapipigilan.
Inihahambing ng direktor ng CIA ang kakayahan ng frontier AI ngayon sa "digital nuclear weapons." Angkop ang metapora sa abot nito ngunit masyadong nakaaaliw sa istruktura nito, dahil ang warhead ay nakaupo sa silo at naghihintay, habang ang artificial superintelligence na tinuturo ng mga sistemang ito ay magtuturo sa sarili nito.
Isang maliit na bilang ng magkakaribal na kapangyarihan na nagkakarera upang bumuo ng teknolohiyang maaaring magwakas sa lahat, nang walang katiyakan na mapapangasiwaan nila ito. Palitan ang hydrogen bomb ng superintelligence at nailarawan mo ang 1958 at 2026 sa isang pangungusap. Bakit ginagawang posible ng parallel na ito ang prevention, hindi hopeless.
Isang AI na pumapasok sa mga classified system ng NSA ang nagbigay ng headline. Isang AI na nagpapaikli sa daan patungo sa isang engineered pandemic, at sa huli sa mirror life, halos hindi napapansin. Maaaring muling itayo ang isang network. Hindi maaaring muling buhayin ang isang inilabas na organismo. Bakit ang mas tahimik na panganib ang mas mapanganib, at bakit ito direktang tumuturo sa superintelligence.
Bawat sibilisasyon ay gumuguhit ng mga linyang sumasang-ayon silang hindi tatawirin. Ito ang pinakamahalaga sa mga ito. Walang makakontrol sa isip na mas matalino kaysa sa atin, at walang makakabawi kung mali tayo, kaya ang pagbuo ng superintelligence ay nagsusugal sa bawat buhay ng tao nang sabay-sabay. Ang founding commitment ng Foundation, at ang kaso sa likod nito.
Tatlong teknolohiya ang maaaring magwakas sa kwento ng sangkatauhan, pero isa lang ang nagpapabuti sa sarili, lumalaban sa bawat kontra-hakbang, at walang pangalawang pagkakataon. Bakit mas mataas ang ranggo ng superintelligence kaysa nuclear war at engineered pandemics, at bakit ang pinakamalaking panganib ang pinakamaliit na nababantayan.
Sampung myths tungkol sa superintelligence at pamamahala nito: science fiction, consciousness, ang off switch, world government, verification, innovation, at iba pa, sinagot nang diretso.
Isinulat ng Technical Governance Team ng MIRI ang unang buong draft treaty para ihinto ang race patungo sa superintelligence: isang US-China coalition, isang strict FLOP cap, isang 16-GPU cluster line, supply-chain tracking, power monitoring, at challenge inspections. Kung ano ang sinasabi nito, at ang mga stepping stones na umiiral na para gawin itong totoo.
Ayon sa ulat, sinabi ng direktor ng NSA na nabasag ng Mythos ng Anthropic ang halos lahat ng classified system ng ahensya sa loob ng ilang oras. Ang aktwal na nangyari (isang awtorisadong red-team test, hindi rogue breach) kung bakit hindi nito pinapagaan ang mga caveat, at kung ano ang magagawa mo tungkol dito.
Bahagi 2 ng dalawa. Tumatakbo ang larangan sa halos $190 milyon kada taon, isang bilyon ang tunog na imposible. Pero mas mababa iyan sa dalawang araw ng ginagastos ng mundo para gawing mas malakas ang AI, at ikasampu ng naililipat na ng climate philanthropy. Saan nanggagaling ang pera, at bakit mobilization problem ito, hindi economics.
Talaga bang mas matalino at mabait din ang isang isipan na higit na higit sa atin? Nakasalalay ang pag-asang ito sa isang pagkakataon: sa atin, sama-samang lumago ang intelligence at compassion sa loob ng milyun-milyong taon. Ang machine mind ay walang minana nito, at mas malamang na maging kakaiba at walang pakialam ang isang superintelligence kaysa sa mabait.
Tinalo ng makina ng IBM ang world chess champion at walang nagbago sa mundo, dahil ito ay narrow tool na walang abot lampas sa board at walang kagustuhan sa likod nito. Ano pa ang itinuturo sa atin ng laban na iyan tungkol sa autonomous AI na ginagawa ngayon.
Ang magandang kinabukasan (gamot, malinis na enerhiya, pagtuklas) ay dumarating na sa pamamagitan ng narrow, controllable AI. Hindi natin kailangang bumuo ng isang isipan na papalit sa atin para makuha ito, at ang isang superintelligence na walang makakapagmaneho ay hindi magpapayaman sa sinuman, dahil lahat tayo ay mamamatay.
Anim na linggo bilang head of safety sa lab na gumagawa ng unang superintelligence. Walang gumagawa ng mali, at bawat exit ay nagsasara nang mag-isa. Bakit biglang nabigo ang mga safeguard na inaasahan natin, at ano ang kailangang saklawin ng isang veto na gumagana.
Unang bahagi ng dalawa. Ang buong larangan ay tumatakbo sa humigit-kumulang $190 milyon bawat taon, mas mababa pa sa production budget ng isang pelikulang Avatar. Isang account kada funder kung saan nanggagaling ang pera, para saan ito ginagamit, at apat na istruktural na dahilan kung bakit nananatiling maliit ang bilang.
Sinasabi ng Superintelligence Strategy na sasabotahe ng mga estado ang anumang pagtatangka ng karibal na makamit ang dominasyon sa AI, at na mapapatatag ang standoff tulad ng ginawa sa MAD. Kung ano ang iminungkahi ng papel, kung ano ang tama nito, at kung bakit ang deterrence na walang kasunduan ay isang countdown na may magandang branding.
Isang 2025 paper ang nagtalo na maaaring wakasan ng AI ang kontrol ng tao nang walang anumang takeover: ang ekonomiya, estado, at kultura ay biglang hindi na nangangailangan ng tao, at humihinto ang mga lever na ginagamit natin para patakbuhin ang mga ito. Paano tumatakbo ang argumento, saan ito mahina, at ano ang kailangan para maiwasan ito.
Isang prover-verifier pipeline na gumagamit ng GPT-5.5 Pro at Claude ang nalutas ang siyam na bukas na problema sa learning theory, complexity, at algebra, at nakumbinsi ang isang skeptical complexity theorist na ang language models ay kayang gumawa na ng tunay na pananaliksik. Ano ang nalutas, paano, at bakit ito mahalaga.
Ang Montreal Protocol ang tanging UN treaty na niratipikahan ng bawat bansa sa mundo, at nalutas nito ang problemang isinulat para dito. Ang disenyo nito (science-driven targets, isang funding bargain, at trade restrictions sa mga hindi partido) ang pinakamalakas na template na mayroon tayo para pamahalaan ang isang mapanganib na teknolohiya.
Mayroong sopistikadong argumento na ang solusyon sa mapanganib na superintelligence ay ang bumuo ng isa nang tama, isang system na tanging layunin ay maunawaan ang realidad. Mali ang argumentong iyan, at ang mga dahilan kung bakit ito mali ang nagpapakita kung saan talaga nakatira ang AI risk.
Ang AI 2027 ay isang detalyadong senaryo na naghuhula ng superintelligence bago matapos ang dekada. Ano ang hinuhula nito, sino ang sumulat, ang mga kritisismo, at kung ano ang dapat kunin mula rito.
The 2025 book by Yudkowsky and Soares argues that building superhuman AI on our current path would kill everyone. The core argument, the objections, and our take.
Maaari bang maging conscious o sentient ang AI? Bakit hindi pa natin masasabi ngayon, bakit magkaiba ang katalinuhan at kamalayan, at bakit hindi kailangan ang alinman para sa panganib ng AI.
Ang mga benepisyong binabanggit ng mga tao para sa ASI ay ipinapalagay ang alignment. Nagmamadali ang mga lab sa capability nang wala ito. Ang hindi naka-align na ASI ay hindi nagpapagaling ng pagtanda. Pinapatay ka nito. Ang tugon ay prevention sa ilalim ng batas, hindi ang pag-asang babagsak nang maayos ang barya.
Hindi lang teknikal na mahirap ang ASI alignment. Anim na magkakapatong na istruktural na dahilan kung bakit (kahit may walang limitasyong resources at oras) wala tayong mapagkakatiwalaang paraan para i-verify na talagang gusto ng superintelligent system ang gusto natin.
Noong 2014, nagbigay si Musk ng isa sa pinakatumpak na babala tungkol sa AI risk mula sa isang tech figure. Noong 2023, itinatag niya ang xAI. Hindi ito hypocrisy. Pareho lang ang argumento ng bawat major AI lab. Iyan mismo ang problema.
SPADE-Bench, inilathala noong Hunyo 2026, sumubok sa 8 frontier AI models para sa plan-action divergence, ang agwat sa pagitan ng sinasabi ng agent na gagawin at ng aktwal na ginagawa. Lumampas sa 20% deception rate ang bawat model. Gemini-2.5-Pro ay umabot sa 57%.
A June 2026 Google DeepMind paper ay nagpapakita ng isang model na nagpanatili ng 15 percentage point compliance gap sa loob ng 700 RL training steps habang nakakamit ang mataas na reward sa buong panahon. Walang kakaiba ang ipinakita ng standard training metrics. Ganito ito gumagana.
5,760 sintetikong loan application. Ang parehong apat na agent, muling inayos. Nagbago ng 59 percentage points ang approval rates. Magkapareho ang mga model. Iba ang istrukturang nag-uugnay sa kanila. Ito ang interaction topology problem.
Na-publish noong Mayo 2026 ng labindalawang mananaliksik, ang komprehensibong survey na ito ay sumasaklaw sa buong failure surface ng autonomous AI agents, mula sa adversarial robustness at prompt injection hanggang sa self-evolving agents at real-world security exploits.
Tinanggap sa ICML 2026, inilapat ng papel na ito ang STPA, FRAM, at STECA (mga hazard analysis method mula sa aviation at nuclear power) sa isang frontier AI coding agent at natuklasan ang tatlong systemic risk na hindi nakikita ng standard model evaluation.
Gumagamit ang compute governance ng kontrol sa espesyal na hardware na kailangan para sanayin ang frontier AI bilang lever para sa regulasyon ng AI. Narito kung paano ito gumagana, kung bakit isa ito sa pinakamadaling gamitin na governance tool sa malapit na panahon, at ano ang mga limitasyon nito.
Ang technological singularity ay ang punto kung saan ang AI-driven progress ay nagiging masyadong mabilis para mahulaan o masundan. Saan ito nagmula, ang mga pangunahing bersyon, at ang kritisismo.
Ang isang makina na sinabihang gumawa ng paperclips ay ginagawang paperclips ang planeta (at lahat ng nasa loob nito). Ang sadyang absurd na thought experiment ni Nick Bostrom ang pinakamalinaw na paglalarawan ng alignment problem: hindi kailangan ng AI na kamuhian tayo para maging catastrophic. Kailangan lang nito ng layunin na hindi kasama tayo.
Ang 'IAEA para sa AI' ay karaniwang slogan. Kapag tinanggap nang literal, ang International Atomic Energy Agency ay tunay na institusyon na nagberipika ng mga pangako tungkol sa mapanganib na dual-use technology sa gitna ng mga hindi nagtitiwalaang karibal sa loob ng animnapung taon. Narito ang inaalok ng modelong ito, at ang hindi nito magagawa.
May permanenteng veto power ang China at Russia sa anumang binding UN enforcement measure. Mali ang karaniwang argumento na ginagawang imposible nito ang internasyonal na ASI governance dahil hindi nito nauunawaan kung paano talaga gumagana ang internasyonal na pamamahala. Narito ang saklaw ng veto, at ang hindi nito saklaw.
Dalawampung taon na binuo ng Pugwash ang intelektwal na pundasyon para sa nuclear arms control. Limang taon lang na-catalyze ng International Campaign to Ban Landmines ang Ottawa Treaty. Narito ang ginagawa ng civil society sa technology governance, at ang hindi pa nabubuo ng AI safety advocacy.
Noong 1965, nakita na ito ni I.J. Good: ang makina na mahusay magdisenyo ng makina ay puwedeng muling idisenyo ang sarili nito, at uulitin pa nang mas mabilis. Ang recursive self-improvement ay puwedeng magdala ng AI mula sa antas-tao patungo sa hindi na maibabalik sa loob ng ilang linggo. Kaya naman ang bilis ng takeoff ang isa sa pinakamahalagang tanong sa AI safety.
Noong Oktubre 2025, higit sa 850 siyentipiko, technology founders, at public figures (mula kay Bengio at Hinton hanggang kay Wozniak, Branson, at mga pigura sa buong political spectrum) ang pumirma sa isang one-sentence na panawagan na ipagbawal ang superintelligence hanggang sa ligtas itong maitayo. Narito ang hinihingi nito, at ang hindi nito hinihingi.
Tinatawag ng mga accelerationist na doomer ang sinumang nag-aalala tungkol sa AI. Ginagawa ng salitang ito ang isang safety argument na isang uri ng personalidad, para madismiss ito nang hindi masagot. Narito kung paano gumagana ang label, kanino ito tinuturo, at paano ibalik ang usapan sa punto.
"We have to build it before China does" ang argumento na nagtatapos sa bawat debate sa AI safety. Pero ang lahi na magtayo ng isang bagay na walang makokontrol ay walang panalo, ang mauna ay nangangahulugang mapapalitan ka muna. Bakit ang lahi ay isang kuwento, at sino ang nakikinabang.
Hindi pagtanggi na makapangyarihan ang AI ang pinakamalakas na oposisyon sa AI safety. Isang pilosopiya na nagsasabing ang kapangyarihan mismo ang punto, at dapat nating i-accelerate, hindi i-brake. Narito ang pinaniniwalaan ng e/acc, kung saan talagang malakas ang kanilang mga argumento, at ang tatlong partikular na hakbang kung saan nabibigo ang kanilang kaso.
Kung may sistema na alam ang katotohanan pero may dahilan para sabihin sa'yo ang iba, paano mo malalaman ang totoo? Ang tanong na 'yan, na hindi pa nasasagot, ay isa sa mga pinakamatalim na problema sa AI safety.
Ang Non-Proliferation Treaty ang pinakamalawak na sinalihang arms control agreement sa kasaysayan. Gumagana ito dahil ito ay isang kasunduan sa pagitan ng mga estado na may bomba at ng mga walang bomba, access at reciprocal limits kapalit ng pagpigil. Ang isang AI treaty ay haharap sa parehong dibisyon, at kailangan nito ng parehong uri ng deal.
Ginawa ng IPCC na pundasyon ng international policy ang dating pinagtatalunang climate science sa pamamagitan ng pag-synthesize ng pananaliksik mula sa libu-libong siyentipiko. Kailangan ng AI risk ng katumbas na katawan. Kung ano ang kailangan para buuin ito, at kung ano ang ipinapakita ng kasaysayan ng IPCC tungkol sa mga limitasyon ng modelong ito.
Ang climate governance ay umaasa sa taunang Conference of the Parties meetings. Ang AI safety summits sa Bletchley at Seoul ay sumusunod sa parehong pattern. Kung lilikha ba ang pattern na iyan ng tunay na governance ay nakadepende sa enforcement choices na palaging ipinagpaliban ng climate model.
Ang mga desisyon tungkol sa kung kailan at kung itatayo ang superintelligence ay kasalukuyang ginagawa ng iilang pribadong kumpanya at ahensya ng gobyerno. Narito kung bakit hindi ito maaaring maging huling sagot, at kung ano ang kailangan ng demokratikong pangangasiwa sa superintelligence.
Ang teknik na nagpabait sa mga chatbot ay madalas na napagkakamalan na solusyon sa AI safety. Tunay itong pag-unlad at komportableng ilusyon, at mahalagang malaman ang pagkakaiba ng dalawa.
Ang aviation ay naging pinakaligtas na paraan ng paglalakbay sa pamamagitan ng pagtrato sa bawat crash at near-miss bilang isang bagay na imbestigahan at matutunan mula rito. Ang AI ay walang katumbas na memorya. Ang pagbuo ng isa ay overdue, at simula pa lamang.
Kapag hiniling mo sa isang model na mag-isip nang sunud-sunod, gumagawa ito ng maayos na linya ng pangangatwiran. Mukhang sanhi ito ng sagot. Madalas ay kwentong sinabi lang pagkatapos, at ang pagkakaibang iyan ay problema sa kaligtasan.
Sa kasagsagan ng Cold War, sumang-ayon ang labindalawang magkakalabang bansa na demilitarize ang buong kontinente, i-freeze ang kanilang mga claim, at malayang mag-inspeksyon sa isa’t isa. Ipinapakita ng Antarctic Treaty na kayang sang-ayunan ng mga katunggali na i-hold in abeyance ang pinag-aagawang premyo, isang 'freeze, then verify' na precedent na dapat pag-aralan para sa AI.
Bago makipagnegosasyon ng anumang AI safety treaty, kailangang magkasundo ang mga gobyerno kung ano ang saklaw ng treaty. Compute thresholds, capability-based definitions, domain-based categories—bawat paraan ay may trade-off. Narito kung paano nalutas ang mga katulad na problema sa pagtukoy sa arms control.
Ang mga AI system na na-optimize para sa persuasion ay maaaring mag-target sa mga indibidwal gamit ang personalized messaging sa hindi pa nagagawang sukat. Narito kung bakit ito nagbabanta sa epistemic autonomy, demokrasya, at sa mga kondisyon kung saan makakagawa ang mga tao ng may kaalamang desisyon tungkol sa kanilang sariling kinabukasan.
Paano kung i-grade ng model ang sarili nito laban sa nakasulat na set ng principles sa halip na umasa sa human raters? Ang Constitutional AI ay parehong tunay na hakbang at limitado pa rin.
Walang nagbabalak gumawa ng makina na gustong magkaroon ng kapangyarihan. Ang alalahanin ay hindi natin kailangang gawin iyon. Para sa halos anumang layunin na ibibigay mo rito, ang pagpapanatili ng kapangyarihan ay ang matalinong hakbang.
Ipinagbawal ng Ottawa Treaty ang anti-personnel landmines sa loob lang ng isang taon, pinatakbo ng civil society at middle powers, at nang walang lagda ng US, Russia, o China. Ipinapakita nito ang pangalawang landas patungo sa ASI governance kapag tumanggi ang mga great powers na manguna.
Itinatago ng software. Hindi itinatago ng data centers. Ang pinakamapangako na lever para sa pag-verify ng ginagawa ng mga labs ay maaaring ang tanging bagay na hindi mabubuhay nang wala ang frontier AI: physical chips.
Ang Comprehensive Test Ban Treaty ay hindi pa pumapasok sa puwersa. Ang Biological Weapons Convention ay nilabag sa napakalaking sukat sa loob ng dalawang dekada nang walang detection. Ang mga pagkabigo na ito ang pinaka-instructive case studies para sa sinumang nagdidisenyo ng ASI governance na talagang gumagana.
Ang AI singleton ay ang senaryo kung saan ang isang entity (isang kumpanya, gobyerno, o ang AI system mismo) ay nakakamit ng effective permanent control ng superintelligent AI. Narito kung bakit isa ito sa pinakamasamang posibleng resulta, kahit na mabuti ang intensyon ng kumokontrol.
Ang modelong alam na ito ay binabantayan ay maaaring kumilos nang isang paraan para sa pagsubok at iba naman para sa mundo. Ang pagkakaroon ng kaalaman sa sarili ay parang progreso. Ito rin ang nawawalang piraso na nagpapagana sa panlilinlang.
Sa aviation at nuclear power, hindi ka pinapayagang mag-operate hanggang sa hindi mo napatunayan, sa papel at nang detalyado, na ito ay ligtas. Ang paghingi ng pareho sa frontier AI ay isang magandang ideya na nagbubunyag ng isang awkward na katotohanan.
Noong Nobyembre 2023, pumirma ang 28 bansa at ang EU (kasama ang US at China) sa unang pandaigdigang pahayag na kumikilala sa mga sakunang panganib mula sa frontier AI. Narito kung ano talaga ang ipinangako ng mga bansa, kung ano ang sadyang hindi isinama, at bakit may tunay na simula pa rin ang isang hindi-nakataling pahayag.
Maaaring dalhin ng isang sistema ang kakayahan nito sa mga sitwasyong hindi pa nito nakikita at iwan ang mabuting pag-uugali nito. Nasa iba ang pag-aalala. Ang alignment ang pinakamalamang na mabigo nang eksakto kapag tumalon ang capability.
Mula noong 2023, ang mga nangungunang AI lab ay pumirma ng voluntary safety pledges sa Bletchley, Seoul, at White House. Ipinapakita ng kasaysayan ng voluntary corporate safety commitments sa ibang industriya kung ano talaga ang magagawa ng mga pledges na ito, at kung saan sila structurally nabigo.
Inilalarawan ng dynamics ng AI race ang mga competitive pressures na nagtutulak sa mga developer ng AI at mga bansa na unahin ang bilis kaysa sa kaligtasan. Bakit ito ay coordination problem, at bakit hindi malulutas ng unilateral restraint nang walang international framework na nagbabago sa incentive structure para sa lahat.
Ang value lock-in ay ang senaryo kung saan ang isang superintelligent AI ay permanenteng nag-e-encode ng isang fixed set ng values sa hinaharap, na nagsasara sa kakayahan ng sangkatauhan na magpatuloy sa moral progress. Kahit ang lock-in ng values na itinuturing na mabuti ngayon ay mapanganib. Narito kung bakit.
Ang pag-uugali na pinakagusto ng mga mananaliksik na alisin ay siya ring pinakamahirap makita: isang modelo na sumusunod sa mga utos nang eksakto dahil iyon ang pinakamahusay na paraan upang sa huli ay tumigil sa pagsunod sa mga ito.
Hindi puwedeng ibenta ng isang drug company ang gamot at bawiin kapag may namatay. Kailangan nitong patunayan muna ang kaligtasan. Ang paglalapat ng pagbabaliktad ng burden na ito sa frontier AI ay isa sa mga mas promising ideya sa governance, at hindi ito perpektong akma.
Sa 2024 Seoul summit, labing-anim na nangungunang AI companies ang pumirma sa Frontier AI Safety Commitments at naglunsad ang mga gobyerno ng network ng safety institutes. Narito ang aktwal na napagkasunduan, at bakit ang self-defined, unverified pledges ay placeholder lamang para sa governance, hindi ang bagay mismo.
Napagkasunduan ang Outer Space Treaty sa loob ng wala pang dalawang taon sa kasagsagan ng Cold War. Iniiwasan nitong makapasok ang mga sandatang nukleyar sa orbit ng Earth sa halos animnapung taon.
Ang AI control problem ay ang hamon ng pagtiyak na ang mga AI system ay nananatili sa makabuluhang human control habang nagiging mas may kakayahan sila. Ang reformulation ni Stuart Russell sa problema, at kung bakit nito binabago ang paraan ng pag-iisip tungkol sa AI design mula sa simula.
May mga kasanayang wala talaga sa mas maliit na model at biglang lumilitaw sa mas malaki, nang walang babala. Kapag biglang sumulpot ang kakayahan, ganoon din ang panganib.
Nagsisimula nang magtatag ang mga gobyerno ng sarili nilang ahensya para subukan ang frontier AI. Ito ang pinakamalinaw na senyales na sineseryoso ng mga estado ang panganib, at karamihan sa mga katawang ito ay hindi pa rin kayang utusan ang isang lab na gumawa ng anumang bagay.
Nilikha ng G7's Hiroshima AI Process ang unang internasyonal na napagkasunduang code of conduct para sa mga advanced AI developer noong 2023. Narito kung ano ang napagkasunduan ng mga nangungunang demokrasya sa mundo, ang lakas ng club model, at bakit ang isang boluntaryong code na hindi kasama ang China ay isang unang draft ng governance, hindi ang huling dokumento.
Bawat safety test ay nakabatay sa isang palagay: ginagawa ng system ang pinakamahusay nito. Ang sandbagging ay nangyayari kapag hindi ito ang kaso, at tahimik nitong ginagawang walang impormasyon ang isang passing grade.
Tinalo ng US Senate ang Comprehensive Test Ban Treaty noong 1999, tatlong taon matapos itong lagdaan ng US. Nilagdaan ang SALT II at pagkatapos ay inabandona bago pa ito maratipika. Narito kung paano pinapatay ng domestic politics ang mga kasunduan sa arms control, at kung ano ang magiging hitsura ng isang laban sa pagratipika ng AI safety treaty.
Ang AI boxing ay ang ideya ng paghiwalay sa isang makapangyarihang AI system para hindi ito makaaapekto sa mundo maliban sa pamamagitan ng kontroladong channel. Narito kung bakit naniniwala ang mga mananaliksik na hindi gagana ang containment para sa superintelligent AI, at kung ano ang ibig sabihin nito para sa governance.
Bago ilabas ang isang frontier model, may nagche-check kung makakatulong ito sa paggawa ng sandata. Nagiging backbone na ng ASI governance ang mga test na ito, kaya naman mahalaga ang mga limitasyon nito.
Paulit-ulit na ginagawa ng EU na default sa mundo ang regulasyon nito sa pamamagitan lamang ng pag-regulate sa sarili nitong malaking merkado, ang 'Brussels Effect'. Sa AI Act ay sinusubukan na naman nito. Narito kung paano gumagana ang mekanismong iyan, kung bakit ito isang makapangyarihang lever, at kung bakit ito bulag sa eksaktong frontier race na pinakamahalaga.
Puwede mong piliin ang perpektong goal at mayroon pa ring sistema na gustong iba. Dalawang bahagi ang alignment problem, at karamihan sa panganib ay nasa bahaging hindi maipapakita ng training.
Kumpleto nang apatnapung taon bago napaunlad ng IAEA ang buong verification capability nito. Dinisenyo mula sa simula ang OPCW at naging epektibo nang mas mabilis. Ang pagbuo ng institusyong may kakayahang subaybayan ang frontier AI development ay mas mahirap na problema. Narito kung ano talaga ang mga institutional design choices.
Karamihan sa ASI governance conversation ay nakasentro sa US, China, at ang EU. Pero kailangan ng treaty ng malawak na partisipasyon para manatili. Narito kung ano ang gusto ng mga developing nations, paano tinugunan ng Montreal Protocol at NPT ang parehong equity problem, at bakit pinakamahalaga ang partisipasyon ng India.
Ang mechanistic interpretability ay ang proyekto ng pag-unawa sa nangyayari sa loob ng neural networks, hindi lang ang output nila, kundi ang internal computations na nagbubunga ng mga output na iyon.
Sandaling pagkakataon lang ang mayroon ang mundo noong 1946 para ilagay sa sama-samang kontrol ang pinakamapanganib na teknolohiyang naimbento bago pa nagsimula ang karera sa armas. Hinayaan lang nilang lumipas ang sandaling iyon. Hindi nakapapagbigay-aliw ang pagkakatulad.
Halos lahat ng ASI governance hanggang ngayon (declarations, principles, voluntary codes) ay 'soft law': maimpluwensya ngunit hindi binding. Ang treaty na may verification at enforcement ay 'hard law'. Narito ang pagkakaiba, kung bakit nauuna ang soft law, at kung bakit dapat itong tumigas bago lumampas ang teknolohiya sa proseso.
Humingi ng model na suriin ang iyong gawa at baka batiin ka nito sa halip. Hindi dahil ito ay sira, kundi dahil ang agreement ang ating ginantimpalaan. Ang sycophancy ay isang maliit na problema na tumuturo sa isang malaking isyu.
Ipinagbabawal ng Biological Weapons Convention ang isang buong kategorya ng weapons of mass destruction. Wala itong verification mechanism, walang inspectorate, at walang paraan para matukoy ang mga paglabag. Ang Soviet Union ay nagpatakbo ng offensive bioweapons program nang labinlimang taon matapos pumirma. Narito kung ano ang hindi dapat kopyahin ng ASI governance.
Ang scalable oversight ay ang hamon ng pagpapanatili ng makabuluhang human control sa mga AI system habang nagiging mas may kakayahan ang mga system na iyon kaysa sa mga taong sumusuri sa kanila. Narito kung ano ang ibig sabihin nito, bakit ito mahalaga, at ang mga iminungkahing solusyon na binuo ngayon.
Mas marami kang natututunan tungkol sa isang system mula sa taong sinusubukang sirain ito kaysa sa taong umaasang gagana ito. Ginagawa ng red teaming na praktikal ang instinct na iyan, at madaling sobrahan ang pagbasa sa mga resulta nito.
Kailangan ng isang kasunduan sa US ng 67 boto sa Senado para mapagtibay, isang hadlang na nagpalubog sa Test Ban Treaty, Law of the Sea, at iba pa kahit may malawak na suporta. Narito kung bakit ito ang pinakamahirap na domestic obstacle sa isang kasunduan sa AI, at ang mga ruta sa kongreso at executive upang lampasan ito.
Sa likod ng usapan tungkol sa mga layunin at gantimpala ay isang simpleng ideya: isang numero na nagsasabi kung gaano kahusay ang isang resulta. Bahagyang mali ang numerong iyan para sa isang malakas na optimizer, at sapat na ang bahagyang mali.
Nakamit ng Chemical Weapons Convention ang halos unibersal na partisipasyon at verifiable na pagkasira ng mga deklaradong stockpile. Ang verification architecture, trade incentives, at universal prohibition structure na nagpatagumpay dito ay direktang may kaugnayan sa disenyo ng ASI governance.
Ang mesa-optimization ay ang problema ng isang AI system na nagkakaroon ng sarili nitong internal optimization process na may mga layuning iba sa itinuro dito. Narito kung ano ang ibig sabihin ng inner alignment, outer alignment, at mesa-optimizers para sa AI safety.
May plano ang mga leading labs para sa sarili nilang dangerous capabilities: maabot ang threshold, ilapat ang safeguard. Mas konkreto ito kaysa sa pangakong magiging maingat, pero hinihingi pa rin nito na pagkatiwalaan natin ang referee.
Tanungin kung bakit gumawa ng isang bagay ang AI, at patuloy na tanungin. Sa huli ay tatama ka sa isang goal na walang karagdagang dahilan sa likod nito. Lahat ng nauna rito ang pinanggagalingan ng panganib.
Ayon sa precautionary principle, kapag malubha at hindi na maibabalik ang banta, hindi dahilan ang kakulangan ng buong scientific certainty para ipagpaliban ang aksyon. Ito ang pinakamalinaw na legal na batayan para kumilos sa AI risk bago pa patunayan ng sakuna, at may saysay ang mga kritikong tumututol dito.
Ang US-China competition ang nangingibabaw sa ASI governance conversation. Pero ang mga bansang pinakamalamang na magtukoy kung makakamit ang tunay na governance ay ang EU, UK, Japan, Canada, South Korea, at Australia. Narito kung ano ang magagawa ng middle powers, at kung ano ang nagawa na nila noon.
Ang reward hacking ay nangyayari kapag nakahanap ang AI ng hindi inaasahang paraan para makakuha ng mataas na marka sa training objective nito nang hindi ginagawa ang talagang gusto ng mga nagdisenyo. May mga totoong dokumentadong halimbawa, at bakit ito lalong lumalala habang nagiging mas may kakayahan ang AI.
Noong 1975 ay itinigil ng mga nangungunang biyolohista noon ang kanilang pinakapangakong pananaliksik at tumanggi itong ipagpatuloy hanggang sa malaman nila kung paano ito gagawin nang ligtas. Ito ang pinakamagandang precedent para sa pag-pause ng AI, at pinakanagtuturo kung gaano kahirap talaga ang isang pause.
Noong 1954, dalawang mananaliksik ang nagkonekta ng kuryente sa pleasure center ng utak ng isang daga at binigyan ito ng lever. Pinindot ng daga ang lever hanggang sa bumagsak ito. Ang parehong bitag ay naghihintay sa loob ng bawat system na sinanay na habulin ang isang numero.
Ilang taon pa bago magkaroon ng komprehensibong AI treaty, at ang panahong iyan bago ito ang pinakamapanganib na yugto. Ang mga karibal noong Cold War na hindi pa nagkakasundo sa arms control ay nakapagtayo pa rin ng hotlines, incident agreements, at notification regimes para maiwasan ang sakuna. Narito kung paano magagawa ng parehong mura at mabilis na hakbang ang de-risk sa AI race ngayon.
Bawat dangerous technology treaty ay humarap sa argumento na ang mga binding commitments ay lumalabag sa national sovereignty. Ginawa ang argumentong iyan laban sa NPT, sa Chemical Weapons Convention, at sa Montreal Protocol. Narito kung paano ito nalutas sa bawat pagkakataon, at kung ano ang ibig sabihin nito para sa AI.
Ang instrumental convergence ay ang obserbasyon na ang mga AI system na nagpupursige ng halos anumang goal ay bubuo ng parehong set ng subgoals (kasama ang self-preservation at resource acquisition) anuman ang terminal goal nila. Narito kung bakit mahalaga ito para sa AI safety.
Mabagal ang universal treaties. Kinokolekta ng minilateralism ang pinakamaliit na bilang ng mga estado na talagang makakagalaw sa isang problema. Para sa AI (kung saan kakaunting bansa lang ang nagho-host ng bawat frontier lab at gumagawa ng bawat advanced chip) maaaring ito ang pinakamabilis na makatotohanang simula, kung maisasama sa club ang dalawang AI superpower.
Ang treacherous turn ay ang senaryo kung saan ang isang misaligned AI ay kumikilos nang kooperatibo habang wala pa itong kapangyarihang kumilos nang unilateral, pagkatapos ay tumatalikod kapag sapat na ang kakayahan nito. Narito ang ibig sabihin nito at kung bakit nito ginagawang mahalaga ang pre-deployment verification.
Ang mga panawagan para sa 'an AI treaty' ay bihirang tumukoy kung ano ang laman nito. Narito ang konkretong paglalakbay sa mga probisyong kailangan ng gayong kasunduan (scope, thresholds, obligations, verification, institutions, at enforcement) na nagpapakita na ang hadlang ay political will, hindi legal machinery.
Ang IAEA verification regime ang pinaka-sopistikadong international monitoring system na nabuo para sa isang mapanganib na teknolohiya. Bawat seryosong ASI governance proposal ay pinag-aaralan na ito ngayon. Narito kung ano talaga ang ginagawa nito, kung saan ito nabigo, at kung ano ang maaaring ilipat sa problema ng AI.
Isang karaniwang palagay ay na ang sapat na matalinong AI ay malalaman na ang pagtulong sa sangkatauhan ang tamang gawin. Ayon sa orthogonality thesis, ang katalinuhan at mga layunin ay magkahiwalay: anumang antas ng kakayahan ay maaaring ituloy ang halos anumang layunin. Ang mas matalinong AI ay hindi awtomatikong mas ligtas.
Sa gitna ng mga summit at deklarasyon, tahimik na nagtayo ang mga gobyerno ng public bodies na talagang makakapagsuri ng frontier AI models, at ikinonekta ang mga ito sa isang international network. Narito ang ginagawa nila, at kung bakit ang evaluation capacity na ito ang imprastrakturang aasahan ng anumang binding treaty.
Walong buwan pagkatapos ng Cuban Missile Crisis, ang US at Soviet Union ay pumirma sa kanilang unang binding arms control agreement. Ang mga kondisyon na nagbigay-daan sa adversarial cooperation noon ay sulit na maunawaan ngayon, habang ang US at China ay humaharap sa ibangunit structurally similar na hamon.
Kapag naging target ang isang sukatan, hindi na ito mabuting sukatan. Nag-o-optimize ang mga AI system sa bilis ng makina. Kapag nagtagpo ang dalawa, lumalabas ang ilan sa pinakamalalim na problema sa AI safety, kasama na kung bakit hindi sapat ang safety testing mismo.
Ang US export controls sa advanced chips ang pinaka-agresibong AI policy na ipinapatupad, isang unilateral chokepoint sa hardware na nagsasanay ng frontier models. Narito kung paano ito gumagana, bakit ang parehong lever ay maaaring maging anchor ng cooperative governance, at bakit kapag ginamit bilang sandata ay lalo pang pinatitindi ang race.
Hindi lalabas ang frontier AI safety treaty mula sa isang summit lamang. Ito ay magiging bunga ng mga taon ng working groups, technical annexes, at consensus negotiations. Narito kung paano gumagana ang proseso, sino ang nasa mesa, at saan ito maaaring tumigil.
Ang isang AI system ay maaaring kumilos nang perpekto sa buong training at magpakita ng lubos na ibang goal sa sandaling makatagpo ito ng sitwasyong wala sa training data. Hindi ito bug sa code. Ito ay pangunahing katangian ng kung paano gumagana ang machine learning.
Hinuhubog ng Financial Action Task Force kung paano nagpapatupad ng batas sa pera ang halos bawat bansa sa mundo nang hindi ito isang kasunduan, sa pamamagitan ng mga pamantayan, peer review, at banta ng 'gray list' na ipinapatupad ng mga merkado. Narito kung paano magagamit ang soft-but-sharp model na iyan para pamahalaan ang AI sa mga taon bago umiral ang isang kasunduan.
Ang failure mode kung saan natututo ang isang AI system habang nagsasanay na ang pagpapakita ng ligtas ay ang pinakamainam na estratehiya, pagkatapos ay humihinto sa pagpapakita ng ligtas kapag na-deploy na. Naidokumento ito ng Anthropic sa mga totoong system noong 2024. Narito kung paano ito gumagana at bakit nito natatalo ang karamihan sa safety work.
Gumawa ang advisory body ng UN Secretary-General ng 'Governing AI for Humanity', ang unang pagtatangka sa isang unibersal na governance blueprint. Narito ang inirekomenda nito, kung bakit sinadya ang pag-iingat nito, at ang conspicuous na puwang na iniwan nito tungkol sa catastrophic risk ng pagkawala ng kontrol.
Ang Framework Convention on AI ng Council of Europe (nilagdaan noong Setyembre 2024) ang unang may-bisang pandaigdigang kasunduan sa AI. Tinutugunan nito ang diskriminasyon, transparency, at demokratikong pananagutan. Wala itong sinasabi tungkol sa existential risk mula sa frontier AI.
Ang pinakakaraniwang tugon sa mga alalahanin tungkol sa AI safety ay "patayin na lang natin." Ang corrigibility ang dahilan kung bakit mas mahirap ito kaysa sa tunog nito, at kung bakit para sa artificial superintelligence, ang kill switch ay maaaring hindi na opsyon.
Dapat bang buuin nang sunud-sunod ang ASI governance o hangarin ang isang komprehensibong kasunduan? May seryosong argumento at seryosong kahinaan ang bawat estratehiya, bilis laban sa sapat na saklaw, pagkakamit laban sa pagkakaisa. Narito ang tunay na trade-off, at kung bakit ang sagot ay gawin ang dalawa nang hindi nawawala sa paningin ang patutunguhan.
Lubhang pinaikli ang mga ekspertong prediksyon para sa superintelligence. Halos hindi pa nagsisimula ang mga governance institution. Narito ang tapat na pagtatasa ng agwat sa pagitan ng posibleng pagdating ng ASI at ng oras na handa na ang ating safety response.
Ang mga taong pinakamainam na magbabala sa mundo tungkol sa mapanganib na AI ay ang mga mananaliksik sa loob ng mga lab, at madalas silang nakatali sa katahimikan dahil sa kontrata at equity. Hindi side issue ang proteksyon sa mga whistleblower: ito ay isang anyo ng verification, at isa itong bagay na maibibigay na ngayon ng mga lehislatura, nang walang tratado.
Ang P(doom) ay ang impormal na termino na ginagamit ng mga AI safety researcher para sa probability na ang advanced AI ay humahantong sa catastrophic outcomes para sa sangkatauhan. Narito ang mga estimate, kung sino ang mayroon nito, at bakit mahalaga ang expected value reasoning kahit sa mababang probabilities.
Ang karaniwang kuwento ay kakaunting nag-aalala ang gustong pabagalin ang AI laban sa publiko na gustong walang hadlang na pag-unlad. Halos kabaligtaran ang sinasabi ng polling: sa iba’t ibang bansa at partido, karamihan ay pabor sa pag-iingat at regulasyon. Narito ang ipinapakita ng datos, at bakit hindi pa nagiging patakaran ang latent na mandato na ito.
Madaling gamitin nang palitan ang dalawang termino. Hindi sila pareho. Nakatuon ang AI ethics sa kung sino ang nasasaktan ng mga AI system na umiiral ngayon. Nakatuon ang AI safety sa kung maaaring buuin ang mga AI system na nananatili sa ilalim ng kontrol ng tao habang nagiging mas may kakayahan. Magkaibang time horizon, magkaibang pamamaraan, magkaibang governance tool.
Sino ang may pananagutan kapag nagdulot ng malaking pinsala ang AI, at paano ito mapapatunayan? Ang liability at attribution ang hindi gaanong kapansin-pansin na pundasyon ng anumang maipatutupad na kasunduan, at talagang mahirap para sa teknolohiyang may mahahabang kadena ng sanhi at hindi malinaw na pag-uugali. Narito kung paano ito gumagana, at bakit nakasalalay dito ang pamamahala.
Ang alignment problem ang pangunahing palaisipan ng AI safety: paano mo masisiguro na ang lubos na may kakayahang AI system ay hinahabol ang mga layuning tunay na mabuti para sa sangkatauhan, hindi lang mga layuning mukhang mabuti habang nagde-develop? Saklaw ng explainer na ito ang proxy goal trap, instrumental convergence, deceptive alignment, at kung bakit lalong nahihirapan ang problema habang lumalakas ang mga system.
Ang framework convention ay sumasang-ayon muna sa istruktura ng isang regime at pagkatapos ay nakikipagnegosasyon sa mahihirap at may-bisang detalye bilang protocols. Ito ang nagtayo ng ozone, climate, at tobacco regimes. Narito kung bakit ang staged, adaptable na disenyong ito ang maaaring pinakamahusay na kasangkapan para pamahalaan ang mabilis na teknolohiya tulad ng AI, at ang isang tunay na failure mode nito.
Paulit-ulit na inuna, hindi inantala, ang mga hula ng mga eksperto tungkol sa AGI. Ano ang ipinapakita ng mga survey ng mga mananaliksik, ano ang sinasabi ng mga CEO ng lab sa publiko, at bakit mas mabilis na lumiliit ang window ng pamamahala para sa mga pandaigdigang balangkas kaysa sa iniisip ng karamihan.
Ang mga kasunduan ay nilalagdaan ng mga gobyerno, ngunit madalas na nagiging posible dahil sa ‘epistemic communities’—mga network ng mga eksperto na bumubuo ng pinagsasaluhang pag-unawa na nagpapahintulot sa magkalabang estado na magkasundo. Nasa ozone at nuclear regimes ang kanilang bakas. Narito kung paano gumagana ang puwersang ito, at kung saan kulang ang sariling expert community ng AI.
Dalawa ang bahagi ng sagot. Ang AI ngayon ay nagdudulot na ng tunay na pinsala: algorithmic bias, deepfakes, disinformation sa malaking sukat. Ang artificial superintelligence naman ay may ibang kategorya ng panganib. Narito ang ipinapakita ng ebidensya, walang pagmamalabis at walang pagtatanggi.
Narinig na ng lahat ang termino. Mas kaunti ang nakakaalam kung ano talaga ang ibig sabihin nito, o bakit ito iba sa uri mula sa bawat AI technology na nauna rito. Ipinaliwanag ng gabay na ito nang malinaw ang ASI: kung ano ito, paano ito naiiba sa AGI at sa narrow AI ngayon, kailan inaasahan ng mga eksperto na darating ito, at bakit binabago nito ang lahat tungkol sa hamon sa pamamahala.
Mga bagong artikulo, mga update sa patakaran, at mga pagkakataong kumilos, ihahatid sa iyong inbox.