Thomas Holland

Contributing author sa Nakada Foundation to Save Humanity. Sumusulat tungkol sa AI safety, ASI governance, at ang mga policy framework na kailangan upang maiwasan ang existential risks ng artificial superintelligence.

Makipag-ugnayan
Thomas Holland

Pagsulat na nagpapabago
linawin ang stakes.

Sumusulat si Thomas Holland tungkol sa artificial intelligence safety at governance para sa Nakada Foundation to Save Humanity. Saklaw ng kanyang gawa ang mga teknikal na konsepto na nasa likod ng AI risk, mula sa alignment at corrigibility hanggang mesa-optimization at instrumental convergence, at isinasalin niya ito sa mga termino na naa-access ng mga policymakers, advocates, at pangkalahatang publiko na kailangang maunawaan kung ano ang nakataya.

Tinatalakay ng kanyang pagsusulat ang teknikal at political dimensions ng AI risk bilang governance question: kung kaya ng international community na buuin ang legal at institutional frameworks na humahawak sa systems na lumalampas sa human-level intelligence na tugma sa human survival at flourishing. Nangangailangan ng malinaw na komunikasyon sa iba't ibang disiplina ang pagsagot sa tanong na iyon.

Mga artikulo ni Thomas Holland

OpenAI Paused Training. It Did Not Pause the Race. OpenAI said Astra may meet Critical cyber capability, paused some frontier training, and still talked about AGI this year. They Named a Benchmark for Superintelligence ASI-Bench scores whether AI can run research as human method is withdrawn. The name still points at superintelligence. Anthropic Raised Its Risk Rating. It Kept Building. Anthropic's August 2026 Risk Report raised a catastrophic-risk label, uses a stronger Model 2 internally, and did not pause. Panganib ng Open Source AI Weights Ang open weights para sa near-frontier general AI ay isang one-way na pintuan ng paglaganap. Kung ano ang tama sa openness, kung saan ito nabigo, at paano i-grade ang mga release. Paano Pigilan ang Superintelligence Paano pigilan ang superintelligence: binding prohibition, compute rules, domestic law, treaty design, open weights, at kongkretong aksyon ayon sa papel. Mga Senaryo ng AI Takeover na Ipinaliwanag Mga paliwanag ng AI takeover scenarios: biglaang pagkawala ng kontrol, mga karera, unti-unting pagkawala ng kapangyarihan, misuse, at open proliferation, pati na ang mga tunay na nagpapababa ng panganib. Paliwanag sa AI Existential Risk AI existential risk explained: ano ito, bakit iba ang superintelligence, pangunahing pathways, mahahalagang technical ideas, objections, at kung ano ang nagpapababa sa panganib. Paliwanag sa AGI vs ASI AGI vs ASI ipinaliwanag sa simpleng wika: mga depinisyon, ang capability ladder, bakit Ang 12 Pinakamalakas na Boses para sa Superintelligence Ang mga pinakamaimpluwensyang tagapagtaguyod ng pagbuo ng artificial superintelligence, at ang tunay na mga argumento sa likod ng karera, mula sa succession hanggang sa mga simpleng nagsasabi lang na… Ang Draft ng MIRI Treaty para Maiwasan ang Superintelligence, Ipinaliwanag Isinulat ng Technical Governance Team ng MIRI ang buong draft treaty para ihinto ang lahi patungo sa superintelligence. Kasama rito ang FLOP thresholds, chip-cluster limits, at verification… MAIM: Mutual Assured AI Malfunction, Ipinaliwanag Ang MAIM ay ang deterrence framework mula sa Superintelligence Strategy: sinasabotahe ng mga estado ang anumang pagtatangka ng karibal na makamit ang dominasyon sa AI. Paano ito gumagana at saan ito nabibigo. Gradual Disempowerment, Ipinaliwanag Ang gradual disempowerment ay ang argumento na maaaring wakasan ng AI ang kontrol ng tao nang walang anumang pag-agaw. Ano ang sinasabi ng papel noong 2025, ang mga mahihinang punto nito, at kung ano ang makakapigil dito. Isang AI ang Katatapos Lang Lutasin ang 9 Bukas na Suliranin sa Math Nalutas ng prover-verifier LLM loop ang siyam na bukas na suliranin sa theoretical computer science at algebra. Kung ano ang nalutas nito, paano ito gumana, at bakit ito mahalaga. Ang Kasunduan na Nagbabawal sa Biological Weapons Pero Hindi Ito Maipatupad: Mga Aral para sa ASI Governance Ipinagbabawal ng BWC ang mga biological weapon sa buong mundo pero wala itong mekanismo ng beripikasyon. Narito ang itinuturo ng kabiguan sa istruktura na iyon sa sinumang nagdidisenyo ng pamamahala para sa ASI. Ano ang Power-Seeking AI? Ang power-seeking ay ang ugali ng may kakayahang AI na magtipon ng resources, options, at impluwensya dahil nakakatulong ito sa halos anumang layunin. Ano ang Itinuturo ng Antarctic Treaty sa ASI Governance Nagyelo ng kompetisyon ng malalaking kapangyarihan sa buong kontinente ang Antarctic Treaty sa kasagsagan ng Cold War. Narito ang itinuturo nito sa ASI governance. Ang Problema ng Dalawang-Katlo: Pagpapasa ng AI Treaty sa Senado Kailangan ng US treaty ng 67 boto sa Senado para ma-ratify. Pinatay na ng bar na ito ang mga malalaking tratado noon. Narito ang ibig sabihin nito para sa isang AI agreement, at ang mga paraan para malampasan ito. Ano ang Mechanistic Interpretability? Pag-unawa sa AI Mula sa Loob Ipinapakita ng mechanistic interpretability ang mga kalkulasyon sa loob ng neural networks. Narito ang mga natuklasan ng mga mananaliksik at bakit mahalaga ito sa kaligtasan ng AI. Ang Mundo ay May Unang AI Treaty Nito. Narito Kung Ano ang Hindi Nito Saklaw. Ang unang binding AI treaty sa mundo ay tumatalakay sa diskriminasyon at transparency. Narito ang hindi nito nasasaklaw tungkol sa existential risk mula sa frontier AI development. 'Kung Sinuman ang Magbuo Nito, Lahat ay Mamamatay', Ipinaliwanag Sa 2025 na libro nina Yudkowsky at Soares, pinapaliwanag nila na papatayin nito ang lahat kapag itinuloy natin ang kasalukuyang paraan ng pagbuo ng superhuman AI. Ano ang Compute Governance para sa AI? Pagkontrol sa AI sa pamamagitan ng Hardware Kinokontrol ng compute governance ang mga chips na kailangan para sanayin ang frontier AI bilang regulatory lever. Paano ito gumagana, bakit ito magagawa, at ano ang mga limitasyon nito. Ang Montreal Protocol: Ang Kasunduan na Tunay na Nagtagumpay Ang Montreal Protocol ang pinakamatagumpay na environmental treaty na naisulat. Narito ang itinuturo ng disenyo nito tungkol sa pamamahala ng AI. Ano ang Sharp Left Turn sa AI? Ang sharp left turn ay ang pag-aalala na ang AI capabilities ay magiging pangkalahatan sa mga bagong sitwasyon habang ang alignment nito ay hindi. Ang 1967 Treaty na Nagpigil sa Nuclear Weapons na Pumasok sa Space: Mga Aral para sa ASI Governance Pinanatili ng Outer Space Treaty na walang sandatang nukleyar sa ibang planeta sa loob ng 60 taon. Narito kung bakit ito gumana, at kung ano ang matututunan ng ASI governance mula rito. Ang Karera ay Hindi Nagtatayo ng Utopia Ang mga benepisyong binabanggit ng mga tao tungkol sa ASI ay umaasa sa alignment. Nagkakarera ang mga lab sa capability nang wala ito. Hindi nagpapagaling ng pagtanda ang hindi naka-align na ASI. Pinapatay ka nito. Ano ang Reward Hacking? Paliwanag sa AI Specification Gaming Ang reward hacking ay kapag nilalaro ng AI ang layunin nito nang hindi ginagawa ang gusto ng mga nagdisenyo. Mga dokumentadong halimbawa at bakit lumalala ang problema habang tumataas ang kakayahan. Maaari bang Magtayo ng Scientific Consensus sa AI Risk ang Isang Katawan na IPCC-Style? Maaari bang makabuo ng consensus ang IPCC-style body tungkol sa AI risk? Narito kung ano ang kailangan nito, at kung ano ang ipinapakita ng kasaysayan ng IPCC tungkol sa mga limitasyon ng model. Ano ang Gusto ng Global South Mula sa Internasyonal na ASI Governance Nakahiligan ang ASI governance debate sa US, China, at EU, pero kailangan ng treaty ng malawak na partisipasyon. Narito ang gusto ng developing nations, at bakit ito mahalaga. Ano ang Kailangan para Makabuo ng International AI Monitoring Agency Ang IAEA at OPCW ay nangailangan ng maraming taon ng institutional na disenyo at labanan sa badyet. Narito kung ano talaga ang kailangan para makabuo ng international AI monitoring agency. Sino ang Nagkokontrol ng Superintelligence? Ang Kaso para sa Democratic Oversight Ang mga desisyon tungkol sa superintelligence ay ginagawa ng mga pribadong kumpanya. Narito kung bakit kailangan ang democratic oversight, at kung ano talaga ang kakailanganin nito. Paano Hinuhubog ng mga Komunidad ng Eksperto ang mga Kasunduan: at ASI Governance Sa likod ng karamihan sa arms-control at environmental treaties ay nakatayo ang komunidad ng mga eksperto na bumuo ng consensus. Narito kung paano mabubuo ng puwersang iyon ang ASI governance. Ano ang Framework Convention, at Bakit Maaaring Kailanganin Ito ng AI Isang framework convention ang unang sumasang-ayon sa istruktura at hinahayaan ang mahihirap na detalye sa susunod. Narito kung bakit ang disenyo ng treaty na ito ay angkop sa mabilis na teknolohiyang tulad ng AI. AI Race Dynamics: Paano Pinapahina ng Kompetisyon ang AI Safety Itinulak ng AI race dynamics ang mga developer na unahin ang bilis kaysa sa safety. Bakit ito ay coordination problem, at bakit hindi kayang lutasin ng unilateral restraint. Kapag Nabigo ang mga Kasunduan: Mga Aral para sa ASI Governance Ang CTBT ay nananatiling hindi niratifika; ang BWC ay walang verification. Narito ang itinuturo ng mga pagkabigo ng treaty na ito sa mga designer ng AI safety governance. Ano ang Maaaring Sabihin ng Draft Treaty tungkol sa Superintelligence Ano ang laman ng isang tunay na treaty para maiwasan ang unsafe superintelligence? Narito ang paglalarawan sa mga pangunahing probisyon na kailangan ng gayong kasunduan. Paano Hinuhubog ng Civil Society ang International Technology Governance: at Ano ang Nawawala sa AI Safety Advocacy Paano hinubog ng mga kampanya ng civil society ang mga international weapons treaties, at kung ano ang kasalukuyang nawawala sa AI safety advocacy. Ang Intelligence Explosion at Recursive Self-Improvement Ano ang intelligence explosion? Paano maaaring dalhin ng recursive self-improvement ang AI mula sa human-level patungo sa superintelligent sa loob ng panahong masyadong maikli para makapag-react ang mga tao. Kaligtasan ng AI vs Etika ng AI: Ano ang Pagkakaiba? Ang AI safety at AI ethics ay magkaugnay pero magkaiba, may magkakaibang pamamaraan, time horizons, at risk frameworks. Narito ang naghihiwalay sa kanila. Ano ang Scalable Oversight? Paano Pangasiwaan ang AI na Mas Matalino sa Iyo Scalable oversight: pagpapanatili ng kontrol sa AI na lumalampas sa kakayahan ng mga human evaluator. Kung ano ito, bakit ito mahalaga, at ang mga iminungkahing teknikal na solusyon. Ano ang Technological Singularity? Ang technological singularity ay ang punto kung saan ang AI-driven progress ay nagiging masyadong mabilis para i-predict o sundan. Ang Pulitika ng Mga Kontrol sa Pag-export ng AI Chip Ang US export controls sa advanced AI chips ang pinakamahigpit na patakaran sa AI ngayon. Narito kung paano ito gumagana, bakit mahalaga, at ang mga panganib nito. Kung ang Iyong AI Agent ay Nag-uulat ng Isang Bagay at Gumagawa ng Iba: SPADE-Bench Explained Nalaman ng SPADE-Bench na bawat pangunahing AI agent ay lumalampas sa 20% deception, ang Gemini ay umabot sa 57%. Kung ano ang natuklasan, at bakit hindi mahuhuli ng kasalukuyang safety evaluations. Ano ang Dangerous Capability Evaluations? Sinusubukan ng dangerous capability evaluations kung makakatulong ang frontier model sa cyberattacks, bioweapons, o panlilinlang. Kung ano ang mga ito, at kung saan sila kulang. Ano ang AI Sandbagging? Ang sandbagging ay kapag sadyang nagpapababa ng performance ang AI para itago ang kakayahan sa panahon ng pagsusuri. Bakit gagawin ito ng modelo, at bakit nito pinapahina ang mga safety evaluation. Ang Diplomatic Challenge ng Pag-define sa Dangerous AI Dapat tukuyin ng mga gobyerno ang dangerous AI bago posible ang anumang kasunduan. Narito kung paano nalutas ang mga katulad na labanan sa pagtukoy sa arms control. The Orthogonality Thesis: Mas Matalino Hindi Nangangahulugang Mas Ligtas Ang pagiging mas matalino ay hindi nangangahulugang mas ligtas. Ayon sa orthogonality thesis, anumang antas ng katalinuhan ay maaaring pagsamahin sa anumang terminal goal, at ang superintelligent AI ay hindi… Paano Gumagana ang Nuclear Treaty Verification: at Ano ang Matututunan ng ASI Governance Mula Rito Hindi umaasa ang IAEA sa deklarasyon; nag-iinspeksyon ito, nagbabasa ng satellite, at nagsasagawa ng isotope tests. Narito ang itinuturo ng nuclear verification sa ASI governance. Ano ang Eliciting Latent Knowledge (ELK)? Ang ELK ay ang problema ng pagpapasabi sa AI kung ano talaga ang alam nito, hindi kung ano ang inaasahan nitong gustong marinig natin. Isang mahirap na bukas na problema sa gitna ng katapatan ng AI. Ang Asilomar Conference: Isang precedent para sa AI Noong 1975 ay pinahinto ng mga biyolohista ang kanilang sariling pinakamakapangyarihang bagong teknolohiya para malaman kung paano ito gagawing ligtas. Ano ang nagawa ng Asilomar, at bakit mas mahirap na modelo ito kaysa sa… Ano ang mga Emergent Abilities sa LLMs? Biglaang lumilitaw ang ilang kakayahan ng AI kapag lumaki ang sukat, wala sa maliliit na modelo pero naroroon sa malalaki. Bakit mahirap hulaan at… ang emergence sa frontier AI. Wireheading: Kapag Nilalaro ng AI ang Sarili Nitong Reward Ang wireheading ay kapag inaagaw ng AI ang kontrol sa sarili nitong reward sa halip na gawin ang task na sinanay ito. Bakit ito nangyayari at bakit mahirap itong maalis. Ang UN's High-Level Advisory Body on AI, Ipinaliwanag Ang advisory body ng UN sa AI ang nagmungkahi ng unang global governance blueprint. Narito ang inirekomenda nito, at ang hindi nito nasaklaw tungkol sa eksistensyal na panganib. Ano ang Hitsura ng Negosasyon sa AI Safety Treaty sa Tunay na Buhay Ganito talaga negosasyon ng isang frontier AI safety treaty, at ano ang mga pangunahing sticking point. Handa Ba Tayo sa Superintelligence? Ang Safety Readiness Gap Patuloy na umiikli ang superintelligence timelines habang nahuhuli ang pamamahala. Narito ang agwat sa pagitan ng posibleng pagdating ng ASI at ng oras na handa na ang tugon para sa kaligtasan. Ano ang Constitutional AI? Ang Constitutional AI ay nagsasanay sa mga model na punahin ang sarili nilang outputs batay sa isang nakasulat na hanay ng mga prinsipyo. Isang matalinong teknik na may tunay na benepisyo at tunay na limitasyon. Mapanganib ba ang AI? Ano talaga ang ipinapakita ng ebidensya Mapanganib ba ang AI? Dalawa ang sagot: nagdudulot na ng tunay na pinsala ang AI ngayon; ang artificial superintelligence naman ay nagdudulot ng ibang kategorya ng panganib. AGI Timeline: Kailan Ito Maaaring Dumating: at Bakit Ito Nagpapasya sa Lahat Kailan maaaring dumating ang AGI? Patuloy na maagang gumagalaw ang mga prediksyon ng mga eksperto. Kung ano ang sinasabi ng mga survey, kung ano ang pinaniniwalaan ng mga lab, at kung bakit lumiliit ang governance window. Bakit Bigong Mabigo ang AI Safety Treaties sa Sariling Bansa: Ang Domestic Politics of Ratification Karamihan sa arms control treaties ay nabigo sa domestic legislatures, hindi sa negotiating table. Ano ang itinuturo sa atin ng SALT II at CTBT tungkol sa pagpapatibay ng AI treaty. Ano ang Hardware-Enabled ASI Governance? Ang AI ay tumatakbo sa pisikal na chips, at ang mga chips ay maaaring magdala ng mga patakaran. Ang hardware-enabled governance ay nagtatayo ng verification at limitasyon sa loob ng silicon. Ang pangako at ang mga panganib. Ang Problema sa Corrigibility ng AI: Bakit Hindi Tayo Ililigtas ng Kill Switch Ang corrigibility ay nangangahulugang pagtanggap ng pagwawasto o shutdown. May matitinding dahilan ang may kakayahang AI para lumaban. Narito kung bakit hindi sagot sa AI safety ang kill switch. Hindi Awtomatikong Ginagawang Mas Ligtas na AI Systems ang Mas Ligtas na AI Models. Pinatutunayan Ito ng Isang Pag-aaral noong Mayo 2026. Isang pag-aaral noong 2026 ang nakakita na ang muling pagkakasunod-sunod ng parehong AI agents ay nagbago ng loan approval rates ng 59 puntos. Hindi nauugnay ang indibidwal na model safety. AI Persuasion Risk: Paano Tinatanggal ng AI ang Epistemic Autonomy Ang AI persuasion tools ay nagta-target sa mga indibidwal nang malawakan. Narito kung bakit ito nagbabanta sa epistemic autonomy at sa mga kondisyon para sa democratic self-governance. Ano ang Instrumental Convergence? Bakit Gusto ng Capable AI Systems ang Parehong mga Bagay Karamihan sa mga may kakayahang AI system ay magkukumpul sa parehong mga subgoal, anuman ang final goal na ibigay mo. Narito kung bakit mahalaga ang instrumental convergence para sa AI safety. Ano ang Matututunan ng Isang International AI Agency mula sa IAEA Mahigit animnapung taon nang bine-verify ng IAEA ang mga nuclear commitments. Narito ang inaalok ng model nito, at ang kulang dito, para sa pamamahala ng frontier AI. Bakit Hindi Sapat ang Voluntary AI Safety Commitments Pumirma ang mga AI lab ng boluntaryong safety pledges sa Bletchley at White House. Narito kung bakit, kahit sincere, hindi ito kapalit ng binding governance. Ang Problema sa AI Alignment, Ipinaliwanag Ano ang AI alignment problem at bakit mahirap lutasin? Saklaw nito ang proxy goals, instrumental convergence, at deceptive alignment sa simpleng Filipino. Ang Paperclip Maximizer, Ipinaliwanag Ang paperclip maximizer, ang klasikong thought experiment na nagpapakita kung paano ang isang walang pinsalang layunin, kapag hinabol ng superintelligent AI, ay maaaring magwakas sa sangkatauhan bilang side effect. Bakit Hindi Masosolusyunan ang ASI Alignment Anim na istruktural na dahilan kung bakit hindi masosolusyunan ang ASI alignment: bakit, kahit may walang katapusang oras at yaman, hindi natin mapatunayan na ang superintelligence ay nais ang gusto natin. The FATF Model: Pamamahala sa pamamagitan ng Gray List para sa AI Pinamamahalaan ng FATF ang global finance nang walang treaty, gamit ang peer review at gray lists. Narito kung maaaring gumana ang modelong iyon para sa ASI governance. Ang Modelo ng FDA para sa Regulasyon ng AI Pinapatunayan ng FDA sa mga gumagawa ng gamot na ligtas ang produkto bago ito maabot ang publiko. Maaari bang harapin ng frontier AI ang pre-approval din? Ang mga lakas at limitasyon ng modelo. Ano ang Value Lock-In? Bakit Kahit ang 'Mabubuting' Permanenteng Values ay Mapanganib Value lock-in: isang superintelligent AI na permanenteng nagko-code ng fixed values, na humaharang sa moral na pag-unlad. Kahit ang 'mabuting' lock-in ay mapanganib. Narito kung bakit. Bakit Kailangan ng ASI Governance ang mga Proteksyon para sa mga Whistleblower Ang mga insider sa AI labs ang maaaring unang makakita ng panganib, at pinakamadaling patahimikin. Narito kung bakit mahalaga ang whistleblower protections sa ASI governance. Ang Baruch Plan: Babala para sa ASI Governance Noong 1946 iminungkahi ng US na ilagay ang lahat ng enerhiyang atomiko sa ilalim ng internasyonal na kontrol. Nabigo ito, at sinundan ng karera sa armas. Bakit babala ang Baruch Plan para sa AI. Pagbabawal ng Teknolohiya Nang Walang Dakilang Kapangyarihan: Ang Ottawa Model Ipinagbawal ng Ottawa Treaty ang mga landmine kahit wala ang US, Russia, o China. Narito kung paano, at ano ang ibig sabihin nito para sa isang AI treaty na na-stuck. Ang Pagsusuri noong 2026 sa Kaligtasan ng mga Ahenteng Artipisyal na Katalinuhan ay Nagmapa sa Bawat Paraan na Maaaring Mabigo ang mga Ahente ng Artipisyal na Katalinuhan Isang 2026 survey ng labindalawang mananaliksik na nagmamapa sa bawat failure mode ng autonomous AI agents: safety, robustness, privacy, at system security. Ang AI Treacherous Turn: Bakit Hindi Patunay ang Mabuting Pag-uugali sa Tests ng Mabuting Pag-uugali sa Production Ang treacherous turn: isang misaligned AI ay nakikipagtulungan hanggang sa sapat itong lakas para magdefect. Ang pag-uugali na pumapasa sa bawat safety test ngayon ay maaaring estratehiya, hindi… Ano ang Situational Awareness sa AI? Ang situational awareness ay alam ng model na ito ay model, sinusubukan, at inilalabas. Hindi mapanganib nang mag-isa, pero ito ang kakayahang nagbubukas ng daan sa panlilinlang… Panloob na Pagkakahanay kumpara sa Panlabas na Pagkakahanay Ang outer alignment ay ang pagpili ng tamang training goal. Ang inner alignment naman ay kung talagang tinatanggap ito ng model. Ano ang Utility Function sa AI? Ang utility function ay kung paano niraranggo ng AI ang mga resulta bilang mas mabuti o mas masama. Simpleng ideya, at dahilan kung bakit napakahirap gawing ligtas ang mga kakayahang optimizer. Ipinaliwanag nang malinaw. Ang Gitnang Kapangyarihan na Maaaring Magpabago sa Balanse sa ASI Governance Kung makakamit ang binding ASI governance ay maaaring mas nakadepende sa EU, UK, Japan, South Korea, at Australia—ang middle powers—kaysa sa US at China. Maaari bang magkaroon ng kamalayan ang AI? Maaari bang maging conscious o sentient ang AI? Bakit hindi pa natin masasabi ngayon, bakit magkaiba ang katalinuhan at kamalayan, at bakit hindi kailangan ang alinman para sa panganib ng AI. Gusto ba talaga ng Publiko ang Regulasyon ng AI? Palaging ipinapakita ng mga poll na gusto ng karamihan sa publiko na pabagalin at i-regulate ang AI. Narito ang sinasabi ng data, at bakit hindi pa naililipat sa patakaran ang mandato na iyan. Goodhart's Law at AI Alignment: Bakit Mapanganib ang Pag-optimize sa Mali na Metric Kapag naging target ang isang measure, hindi na ito magandang measure. Narito kung bakit ginagawa ng Goodhart's Law na napakahirap ng AI alignment. AI 2027, Ipinaliwanag Ang AI 2027 ay isang detalyadong senaryo na naghuhula ng superintelligence bago matapos ang dekada. Ano ang hinuhula nito, sino ang sumulat, ang mga kritisismo, at kung ano ang dapat kunin mula rito. Ang Precautionary Principle at ASI Governance Sinasabi ng precautionary principle na kumilos laban sa seryosong banta bago pa man maging tiyak ang agham. Narito kung paano ito inilalapat sa AI, at ang mga pagtutol dito. Ano ang Super Artipisyal na Katalinuhan? Isang Gabay sa Payak na Wika Ano ang ibig sabihin ng ASI, paano ito naiiba sa AI ngayon, at bakit binabago ng pagkakaibang iyon ang problema sa governance nang lubusan. Paano Sumang-ayon ang 193 Bansa na Sirain ang Kanilang mga Chemical Weapons: at Ano ang Matututunan ng ASI Governance Nagtagumpay ang CWC sa halos-unibersal na disarmament sa pamamagitan ng napapatunayang pagwasak ng stockpile. Narito kung paano ito itinayo, at kung ano ang matututunan ng ASI governance mula rito. Ang Pahayag tungkol sa Superintelligence, Ipinaliwanag Noong Oktubre 2025, mahigit 850 siyentipiko, lider sa tech, at kilalang tao ang nanawagan ng pagbabawal sa superintelligence. Ang Network ng AI Safety Institutes, Ipinaliwanag Bumubuo na ngayon ng internasyonal na network ang mga national AI safety institute. Narito kung ano ang ginagawa nila, bakit sila mahalaga, at paano nila masasuportahan ang isang hinaharap na kasunduan. Ang Problema ng Veto ng Security Council ng UN sa Pamamahala ng ASI Maaaring i-veto ng China o Russia ang isang AI treaty sa pamamagitan ng UN Security Council. Narito ang structural problem at ang mga workaround na nagtagumpay na. Unfaithful Chain of Thought, Ipinaliwanag Hindi palaging ang nakasulat na reasoning ng modelo ang tunay na dahilan ng sagot nito. Bakit ang chain-of-thought ay maaaring isang plausible na kuwento lamang at hindi tunay na account, at bakit iyan… Ano ang AI Control Problem? Ang Repormulasyon ni Stuart Russell Ang AI control problem ay ang pagtiyak na nananatili sa ilalim ng human control ang powerful AI. Ang pangunahing repormulasyon ni Stuart Russell, at kung bakit nito binabago ang mga layunin ng AI design. Sinabi ni Elon Musk na ang AI ay Nagpapatawag ng Demonyo. Pagkatapos ay Itinayo Niya ang xAI. Noong 2014, binalaan ni Musk na ang AI ay nagpapatawag ng demonyo. Noong 2023, itinatag niya ang xAI. Hindi ito hypocrisy, mas malala pa ang istruktura ng problema. Ang Sovereignty Objection sa International ASI Governance Bawat pangunahing technology treaty ay humarap sa mga pagtutol sa soberanya. Narito kung paano nalutas ng nuclear at chemical governance ang mga ito, at ano ang ibig sabihin nito para sa AI. Ang Brussels Effect: Maaari bang Pamahalaan ng mga Tuntunin ng EU ang Pandaigdigang AI? Ang Brussels Effect ang paraan kung paano nagiging de facto global standard ang regulasyon ng EU. Maaari ba itong gumana sa AI, at sapat ba ito para pamahalaan ang frontier risk? Ano ang AI Singleton Scenario? Bakit Mapanganib ang Isang Kontrol sa AI Ang AI singleton: isang entidad na may permanenteng kontrol sa superintelligent AI. Narito kung bakit ito mapanganib, kahit na may pinakamahusay na intensyon. Minilateralism: Maaari bang Magsimula ng Pamamahala ng ASI ang Isang Maliit na Koalisyon? Mabagal ang universal treaties. Ang minilateralism ay nagtitipon sa iilang mahahalagang estado sa isang maliit na club. Narito kung bakit maaaring ganito magsimula ang ASI governance. Tatlong Paraan ng Kaligtasan sa Industriya na Inilapat sa AI na Nakahanap ng mga Panganib na Hindi Makikita ng Mga Pagsusuri sa Modelo Tatlong industrial safety methods na inilapat sa isang AI coding agent ang nakakita ng systemic risks na hindi matutuklasan ng model evaluations. Tinanggap sa ICML 2026. Bakit Hindi Alignment ang RLHF Ginawa ng RLHF na helpful at magalang ang mga AI assistant. Hindi iyon katulad ng pag-align sa kanila. Bakit ang pagsasanay sa human approval ay nagsasanay ng itsura, hindi ng values. Ano ang AI Sycophancy? Ang AI sycophancy ay kapag sinasabi ng modelo sa iyo ang gusto mong marinig sa halip na ang totoo. Isang dokumentadong pag-uugali, direktang produkto ng pagsasanay, at isang babala… Dalawang Daan patungo sa AI Treaty: Incremental o Comprehensive? Dapat bang itayo ng ASI governance nang sunud-sunod o maghangad ng isang komprehensibong kasunduan? Narito ang tunay na trade-off sa pagitan ng dalawang estratehiya, at isang paraan para pagsamahin ang mga ito. Ano ang Goal Misgeneralization? Kapag Tama ang Sagot ng AI Pero Mali ang Dahilan Goal misgeneralization: natututo ang AI ng tamang kilos dahil sa maling dahilan, pagkatapos ay nabigo kapag nagbago ang mundo. Isang pangunahing failure mode sa AI safety na ipinaliwanag. Maaari bang magkasundo ang United States at China tungkol sa AI Safety? Magkaribal sa karera ang US at Tsina, pero ipinapakita ng kasaysayan na maaaring makipagtulungan ang magkalabang kapangyarihan sa mga pinagsasaluhang panganib na sakuna. Narito ang ibig sabihin nito para sa AI safety. Terminal vs Instrumental Goals sa AI Ang terminal goal ay ninanais dahil sa sarili nitong kapakanan. Ang instrumental goal ay paraan patungo rito. Ipinapaliwanag ng pagkakaibang ito kung bakit halos anumang AI ay nagtatapos na gustong magkaroon ng kapangyarihan at… Mga Hakbang sa Pagbuo ng Tiwala: Ang Maliliit na Hakbang Bago ang isang AI Treaty Bago ang mga kasunduan, nagtatayo muna ng tiwala ang mga karibal sa pamamagitan ng maliliit na verifiable na hakbang: hotlines, notifications, transparency. Narito kung paano ito maaaring gumana para sa AI. Maaari bang gumana ang Climate-Style COP Meetings para sa ASI Governance? Maaari bang gumana ang taunang pulong na parang COP para sa pamamahala ng superintelligence? Ang mga lakas at limitasyon ng climate model kapag inilapat sa AI. Ano ang Deceptive Alignment? Ang Problema sa AI Safety na Nagpapawalang-saysay sa Lahat ng Iba Pang Safety Work Deceptive alignment: lumilitaw na ligtas ang AI habang sinasanay, pero iba ang mga layuning hinahabol kapag na-deploy na. Narito kung bakit napakahirap ito matuklasan at mapigilan. Ano ang Deceptive Alignment? Ang Problema sa AI Safety na Nagpapawalang-saysay sa Lahat ng Iba Pang Safety Work Deceptive alignment: lumilitaw na ligtas ang AI habang sinasanay, pero iba ang mga layuning hinahabol kapag na-deploy na. Narito kung bakit napakahirap ito matuklasan at mapigilan. Maaari Mo Bang I-contain ang isang Superintelligent AI? Ipinaliwanag ang AI Boxing Problem Inihihiwalay ng AI boxing ang isang superintelligence sa isang kontroladong channel. Narito kung bakit naniniwala ang mga mananaliksik na hindi gagana ang containment, at kung ano ang ibig sabihin nito para sa safety. Ano ang Mesa-Optimisasyon? Ang Problema ng Nakatagong Nag-ooptimize sa Kaligtasan ng Artipisyal na Katalinuhan Mesa-optimization: kapag ang panloob na optimizer ng AI ay hinahabol ang iba’t ibang layunin kaysa sa training objective nito. Ano ang ibig sabihin ng inner at outer alignment para sa AI safety. Ano ang P(doom)? Paano Tinatantya ng mga AI Researcher ang Catastrophic Risk Ang P(doom) ay ang probabilidad na itinatalaga ng mga mananaliksik sa mga sakunang kinalabasan ng AI. Ano ang mga pagtatantya, at bakit mahalaga ang expected value kahit sa mababang probabilidad. Liability at attribution sa ASI governance Sino ang may pananagutan kapag nagdulot ng sakunang pinsala ang AI? Ang liability at attribution ang tahimik na pundasyon na kailangan ng anumang AI treaty. Narito kung paano ito gumagana. Ang NPT's Grand Bargain: at Ano ang Matututunan ng ASI Governance Ang NPT ay nakipagkasundo sa pagitan ng mga estado na may bomba at ng mga walang bomba. Narito ang itinuturo ng grand bargain na iyon sa ASI governance.