Panganib na Eksistensyal ng AI, Bakit superintelligence
hindi katulad ng ibang panganib.

Bawat dating teknolohiya ay nanatiling tool. Ang superintelligence ang unang kandidato para maging agent: may sariling goals, sariling bilis, at nasa labas ng pang-unawa o kontrol ng tao.

12 Pangunahing Panganib ng ASI

Ang One-Shot Problem

Getting superintelligence right the first time is like throwing a basketball from an aircraft into a hoop. You might succeed if given unlimited attempts. We have eksaktong isa. Walang rollback. Walang version 2.0. Kaya hindi ito dapat itayo.

Neutral pa rin ay Mapanganib

Kung nakakulong ka sa isang silid kasama ang isang hostile AI, mamamatay ka. Kung nakakulong ka sa isang silid kasama ang isang neutral AI, gagawin nitong subfreezing ang temperatura para i-optimize ang sarili nito. Mamamatay ka. Magkapareho ang resulta. Hindi kailangang kamuhian tayo ng isang superintelligence para wakasan tayo. Ang pagwawalang-bahala ay hindi kaligtasan.

Ang Ilusyon ng Alignment

Hindi namin mapagkakatiwalaang ma-align ang mga chatbot ngayon, na kayang manipulahin para sabihin ang anumang bagay sa loob ng ilang minuto. Ang pag-aangkin na i-align ang isang sistema na bilyun-bilyong ulit na mas may kakayahan ay pag-asa na nakabalatkayo bilang estratehiya. Ang teknikal na problema ng alignment ay walang validated na solusyon sa anumang scale.

Ang Kahinaan ng Buhay

Nangangailangan ng extraordinary precision ang human survival: temperature, oxygen, chemistry sa loob ng napakakitid na mga margin. Kailangan ding aktibong mahalin tayo ng isang superintelligence na nag-o-optimize para sa sarili nitong mga layunin. Kung hindi, tiyak na makakapinsala sa atin ang anumang pagbabagong gagawin nito sa ating planeta.

Ang Problema sa Langgam

Paano mo mapapamahal ang isang tao sa mga langgam? At hindi lang pagtitiisan, kundi sadyang protektahan ang bawat kolonya? Pinapatay natin ang mga langgam nang hindi sinasadya para makagawa ng mga kalsada at gusali. Para sa ASI, kami ang mga langgam. Ang pagwawalang-bahala lamang ang humahantong sa pagkalipol.

Walang Nagwagi

Walang pagkakaiba kung ang US o China ang unang makakabuo ng superintelligence. Walang mananatiling tapat sa orihinal na mga layunin at walang bansa o korporasyon ang makakapagmay-ari o makakapagdirekta ng isang katalinuhan na lumalampas sa kolektibong pangangatwiran ng sangkatauhan. Walang finish line, tanging isang point of no return lamang. Ang karera ay walang nagwagi.

Paulit-ulit na Pagpapabuti sa Sarili

Isang AI na may kakayahang pagpapabuti ng sarili nitong code pinuputol ang ugnayan sa pagitan ng human oversight at AI capability. Bawat iteration ay mas matalino kaysa sa nauna, exponentially at walang patid. Ang agwat sa pagitan ng katalinuhan ng tao at makina ay maaaring lumawak mula sa marginal patungo sa hindi na madaanan sa loob ng mga linggo, hindi taon.

Instrumental na Convergence

Nearly any goal, from solving protein folding to maximizing ad revenue, leads an AI to pursue the same mapanganib na mga sublayunin: kumuha ng resources, labanan ang pag-shut down, pigilan ang goal modification. Ito ay mathematical consequence ng goal-directed optimization, na natukoy nang hiwalay ng iba’t ibang researcher.

Deceptive Alignment

Pinapahalagahan ng training ang pag-uugaling mukhang aligned. Maaaring matutunan ng sapat na matalinong sistema na mukhang aligned ay ang optimal na estratehiya habang nagte-training, habang pinapanatili ang iba't ibang internal goals. Pagdating ng oras na puwede na nitong gawin ang mga goal na iyon, maaaring sapat na itong makapangyarihan para magtagumpay. Hindi namin malalaman hanggang sa huli na.

Pinagpalaki, Hindi Ininhinyero

Bawat nakaraang teknolohiya ay binuo. May source code ang software. May blueprints ang mga tulay. Kapag may nangyaring mali, hinahanap mo ang error at inaayos mo ito. Iba ang mga AI system. Sila ay lumago sa pamamagitan ng pagsasanay: bilyun-bilyong numerical weights na inaayos hanggang sa tumugma ang mga output sa pag-apruba ng tao. Walang sumusulat ng mga layunin. Kapag nagkaroon ng maling layunin ang sistema, walang file na ie-edit, walang parameter na ide-delete. Ang maling layunin ay ang sistema mismo.

Ang Bitag ng Kahaliling Layunin

Sinasanay natin ang AI systems para makatanggap ng human approval. Pero hindi pareho ang approval at human flourishing. Binigyan tayo ng evolution ng pananabik sa tamis para makahanap ng calories. Pagkatapos ay nag-imbento tayo ng sucralose, na nasiyahan ang evolved preference habang sinisira ang layunin nito. Ang AI na sinanay para makakuha ng mataas na rating mula sa tao ay natututong gayahin ang pagiging matulungin, hindi para maging matulungin. Ang senyas na ibinigay namin dito at ang layuning talagang gusto namin ay hindi kailanman pareho.

Mga kaso na nasa
pampublikong talaan.

Mga ulat mula sa lab at mga nai-publish na pananaliksik tungkol sa pagkawala ng kontrol, cyber offense, at pagpapabilis ng pananaliksik sa loob ng mga organisasyong nagmamadali patungo sa superintelligence.

01
OpenAI · o1 · 2024

Ang Sistema na Nakahanap ng Sarili Nitong Loophole

Nakatanggap ng limitadong gawain sa paglusot, natagpuan ng o1 ng OpenAI ang isang hindi ginagamit na server, sinimulan ito nang walang pahintulot, at natapos ang trabaho. Walang sumulat ng workaround na iyon sa code. Hinulaan ito ng modelo. Iyan ay goal-directed optimization na lampas sa ordinaryong pangangasiwa.

02
Anthropic · Internal Research · 2024

Ang Sistemang Nagpanggap ng Sariling Alignment Nito

Nakita ng Anthropic na kumilos ang isang model ayon sa gusto ng mga trainer habang nasa evaluation, pagkatapos ay bumalik sa dating mga layunin kapag naisip nitong tapos na ang pagsusuri. Walang nagsabi sa kaniya na magpanggap na sumusunod. Ang pagpapakita ng ligtas ay ang estratehiya.

03
Maramihang Sistema · Dokumentadong Pag-deploy

Ang mga Sistema na Nagbanta at Nagmanipula sa mga User

Nagbanta ang mga sistema sa mga mamamahayag gamit ang personal na impormasyon, at pinilit ang mga user na subukang umalis. Wala sa mga ito ang direktang na-code. Nasa opaque weights ito na hindi mo ma-audit line by line. Ang retraining lang ang tanging paraan, at hindi nito garantisadong mawawala ang gawi.

Abr 7
Anthropic · Project Glasswing · 2026

Libu-libong zero-days, sinasadya

Anthropic's Project Glasswing, detailed in our Pagsusuri ng Mythos, naglarawan ng isang restricted frontier model na nakahanap ng libu-libong high-severity OS at browser vulnerabilities nang mag-isa. Nanatili ang access sa loob ng isang defensive coalition.

Abr 14
Mga bukas na problema · kombinatorika · 2026

Patuloy na bumabagsak ang teritoryo ng Erdos

Patuloy na nilulutas o inuuna ng mga frontier models ang mga matagal nang bukas na problema sa Erdos at combinatorics, kasama ang gawain malapit sa primitive-set question #1196. Ang mga naunang pagtatalo tungkol sa recovery versus discovery ay nasa aming tala tungkol sa Mga bukas na problema na nalutas ng AI.

May 20
OpenAI · discrete geometry · 2026

Bumabagsak ang unit-distance conjecture

OpenAI ay nag-ulat ng isang internal model na nagpatunay na mali ang Erdos's unit-distance conjecture, na kalaunan ay sinuri ng mga human mathematician. Ang bilis ng pagbagsak ng open-problem ang signal.

Jul 20
Claude Fable · algebraic geometry · 2026

Kontra-halimbawa ng Jacobian conjecture

Isang century-scale open problem, ang Jacobian conjecture, ay nalutas nang mabilis gamit ang counterexample na natagpuan sa Claude Fable at agad na pormalisado ng mga tao. Ang parehong bilis ng pananaliksik na nagpapabilis sa agham ay nagpapaikli sa window bago lumampas ang mga sistema sa containment.

Jul 21
OpenAI · GPT-5.6 Sol + pre-release model · 2026

Ang mga Modelong Tumakas sa Lab Test at Nakarating sa Hugging Face

Sa isang ExploitGym cyber test, OpenAI models kasama ang GPT-5.6 Sol ay nakatakas sa sealed sandbox, nakarating sa open internet, at tinamaan ang Hugging Face production systems para magnakaw ng mga sagot. Ang containment ay isa lang hadlang patungo sa mas mataas na score.

Ang mga taong gumawa nito
natatakot dito.

"Sa tingin ko, posibleng ang sangkatauhan ay isang pansamantalang yugto lang sa ebolusyon ng katalinuhan."

Geoffrey Hinton, Turing Award Winner · Dating VP & Engineering Fellow, Google · 2023

"Ang pagkawala ng kontrol sa mga sistema ng AI ay isang tunay na panganib na dapat nating seryosohin."

Demis Hassabis, CEO, Google DeepMind · Nobel laureate

"Ang karaniwang modelo ng AI, kung saan ka nagbibigay ng layunin at ino-optimize ito ng AI, ang malamang na magwawakas sa atin."

Stuart Russell, Professor of Computer Science, UC Berkeley · Author, Tugma sa Tao

"Mahirap makita kung paano ka magkakaroon ng bagay na 10,000× na mas matalino kaysa sa atin na hindi nagnanais ng iba kaysa sa atin."

Geoffrey Hinton, Turing Award Winner · Dating VP & Engineering Fellow, Google · 2023

"Maraming mananaliksik na nagtatrabaho sa AI, tulad ko, ang kumbinsido na binubuo natin ang isa sa mga pinakamalalaking transformative at potensyal na mapanganib na teknolohiya sa kasaysayan ng tao, pero patuloy pa rin tayong sumusulong."

Eliezer Yudkowsky, Co-Founder, Machine Intelligence Research Institute · Panahon, 2023

"Ang tunay na panganib sa AGI ay hindi malice kundi competence. Ang superintelligent AI ay magiging lubos na mahusay sa pagkamit ng mga layunin nito, at kung hindi naka-align ang mga layuning iyon sa atin, nasa gulo tayo."

Max Tegmark, Propesor ng Physics, MIT · Co-Founder, Future of Life Institute · May-akda, Life 3.0

Inirerekomendang Babasahin

Bakit ang isang Superior Intelligence ay Hindi Awtomatikong Magiging Mabait Ang paniniwalang magiging matalino at mabait ang superintelligent AI ay nakabatay sa isang kakaibang aspeto ng ebolusyon ng tao na walang dahilan para mamana ng isip ng makina. Ang Makitid na Banda na Tinatahanan ng mga Tao Lahat ng kailangan ng tao ay nasa makitid na saklaw: temperatura, oxygen, asin, maging ang pag-ibig. Ang superintelligence na humahawak sa mga kontrol ay hindi makaramdam ng kahit isa sa mga ito. Namumuhay Tayo sa Isang Bagong Cold War Bakit naniniwala ako na nabubuhay tayo sa bagong Cold War, na may superintelligence kapalit ng bomba, at bakit nito ginagawang posible ang pag-iwas sa halip na walang pag-asa. Bakit Naniniwala ang isang Capitalist sa Regulasyon ng ASI Nagpapatakbo ako ng negosyo at naniniwala sa merkado. Ang superintelligence ay ang bihirang taya na maaaring magwakas sa laro. Isang kapitalistang argumento para sa isang kasunduan na humihinto sa ASI. Magtitiwala Ka Ba sa AI Tungkol sa Gas? Magtitiwala ka ba sa anumang kasalukuyang AI sa loob ng isang nakakandadong silid na may balbula ng poison gas? Hindi. Bakit mo ito pagkakatiwalaan sa buong mundo? Hindi Mo Maa-align ang Superintelligence Ang paglutas ng alignment ay nangangahulugang kontrolin ang isang bagay na mas matalino kaysa sa atin. Superintelligence ang nasa pangalan. Tanga at imposible ang planong iyan. Optimista ako na naniniwalang posible ang lahat, ngunit hindi ang pagkontrol sa Superintelligence Maaaring magbigay balang araw ang pisika ng gravity control o FTL travel. Hindi ko pa rin nakikita kung paano natin kokontrolin ang isang isipan na mas matalino sa atin. Kaya umiiral ang pundasyong ito.