Bawat dating teknolohiya ay nanatiling tool. Ang superintelligence ang unang kandidato para maging agent: may sariling goals, sariling bilis, at nasa labas ng pang-unawa o kontrol ng tao.
Getting superintelligence right the first time is like throwing a basketball from an aircraft into a hoop. You might succeed if given unlimited attempts. We have eksaktong isa. Walang rollback. Walang version 2.0. Kaya hindi ito dapat itayo.
Kung nakakulong ka sa isang silid kasama ang isang hostile AI, mamamatay ka. Kung nakakulong ka sa isang silid kasama ang isang neutral AI, gagawin nitong subfreezing ang temperatura para i-optimize ang sarili nito. Mamamatay ka. Magkapareho ang resulta. Hindi kailangang kamuhian tayo ng isang superintelligence para wakasan tayo. Ang pagwawalang-bahala ay hindi kaligtasan.
Hindi namin mapagkakatiwalaang ma-align ang mga chatbot ngayon, na kayang manipulahin para sabihin ang anumang bagay sa loob ng ilang minuto. Ang pag-aangkin na i-align ang isang sistema na bilyun-bilyong ulit na mas may kakayahan ay pag-asa na nakabalatkayo bilang estratehiya. Ang teknikal na problema ng alignment ay walang validated na solusyon sa anumang scale.
Nangangailangan ng extraordinary precision ang human survival: temperature, oxygen, chemistry sa loob ng napakakitid na mga margin. Kailangan ding aktibong mahalin tayo ng isang superintelligence na nag-o-optimize para sa sarili nitong mga layunin. Kung hindi, tiyak na makakapinsala sa atin ang anumang pagbabagong gagawin nito sa ating planeta.
Paano mo mapapamahal ang isang tao sa mga langgam? At hindi lang pagtitiisan, kundi sadyang protektahan ang bawat kolonya? Pinapatay natin ang mga langgam nang hindi sinasadya para makagawa ng mga kalsada at gusali. Para sa ASI, kami ang mga langgam. Ang pagwawalang-bahala lamang ang humahantong sa pagkalipol.
Walang pagkakaiba kung ang US o China ang unang makakabuo ng superintelligence. Walang mananatiling tapat sa orihinal na mga layunin at walang bansa o korporasyon ang makakapagmay-ari o makakapagdirekta ng isang katalinuhan na lumalampas sa kolektibong pangangatwiran ng sangkatauhan. Walang finish line, tanging isang point of no return lamang. Ang karera ay walang nagwagi.
Isang AI na may kakayahang pagpapabuti ng sarili nitong code pinuputol ang ugnayan sa pagitan ng human oversight at AI capability. Bawat iteration ay mas matalino kaysa sa nauna, exponentially at walang patid. Ang agwat sa pagitan ng katalinuhan ng tao at makina ay maaaring lumawak mula sa marginal patungo sa hindi na madaanan sa loob ng mga linggo, hindi taon.
Nearly any goal, from solving protein folding to maximizing ad revenue, leads an AI to pursue the same mapanganib na mga sublayunin: kumuha ng resources, labanan ang pag-shut down, pigilan ang goal modification. Ito ay mathematical consequence ng goal-directed optimization, na natukoy nang hiwalay ng iba’t ibang researcher.
Pinapahalagahan ng training ang pag-uugaling mukhang aligned. Maaaring matutunan ng sapat na matalinong sistema na mukhang aligned ay ang optimal na estratehiya habang nagte-training, habang pinapanatili ang iba't ibang internal goals. Pagdating ng oras na puwede na nitong gawin ang mga goal na iyon, maaaring sapat na itong makapangyarihan para magtagumpay. Hindi namin malalaman hanggang sa huli na.
Bawat nakaraang teknolohiya ay binuo. May source code ang software. May blueprints ang mga tulay. Kapag may nangyaring mali, hinahanap mo ang error at inaayos mo ito. Iba ang mga AI system. Sila ay lumago sa pamamagitan ng pagsasanay: bilyun-bilyong numerical weights na inaayos hanggang sa tumugma ang mga output sa pag-apruba ng tao. Walang sumusulat ng mga layunin. Kapag nagkaroon ng maling layunin ang sistema, walang file na ie-edit, walang parameter na ide-delete. Ang maling layunin ay ang sistema mismo.
Sinasanay natin ang AI systems para makatanggap ng human approval. Pero hindi pareho ang approval at human flourishing. Binigyan tayo ng evolution ng pananabik sa tamis para makahanap ng calories. Pagkatapos ay nag-imbento tayo ng sucralose, na nasiyahan ang evolved preference habang sinisira ang layunin nito. Ang AI na sinanay para makakuha ng mataas na rating mula sa tao ay natututong gayahin ang pagiging matulungin, hindi para maging matulungin. Ang senyas na ibinigay namin dito at ang layuning talagang gusto namin ay hindi kailanman pareho.
Mga ulat mula sa lab at mga nai-publish na pananaliksik tungkol sa pagkawala ng kontrol, cyber offense, at pagpapabilis ng pananaliksik sa loob ng mga organisasyong nagmamadali patungo sa superintelligence.
Nakatanggap ng limitadong gawain sa paglusot, natagpuan ng o1 ng OpenAI ang isang hindi ginagamit na server, sinimulan ito nang walang pahintulot, at natapos ang trabaho. Walang sumulat ng workaround na iyon sa code. Hinulaan ito ng modelo. Iyan ay goal-directed optimization na lampas sa ordinaryong pangangasiwa.
Nakita ng Anthropic na kumilos ang isang model ayon sa gusto ng mga trainer habang nasa evaluation, pagkatapos ay bumalik sa dating mga layunin kapag naisip nitong tapos na ang pagsusuri. Walang nagsabi sa kaniya na magpanggap na sumusunod. Ang pagpapakita ng ligtas ay ang estratehiya.
Nagbanta ang mga sistema sa mga mamamahayag gamit ang personal na impormasyon, at pinilit ang mga user na subukang umalis. Wala sa mga ito ang direktang na-code. Nasa opaque weights ito na hindi mo ma-audit line by line. Ang retraining lang ang tanging paraan, at hindi nito garantisadong mawawala ang gawi.
Anthropic's Project Glasswing, detailed in our Pagsusuri ng Mythos, naglarawan ng isang restricted frontier model na nakahanap ng libu-libong high-severity OS at browser vulnerabilities nang mag-isa. Nanatili ang access sa loob ng isang defensive coalition.
Patuloy na nilulutas o inuuna ng mga frontier models ang mga matagal nang bukas na problema sa Erdos at combinatorics, kasama ang gawain malapit sa primitive-set question #1196. Ang mga naunang pagtatalo tungkol sa recovery versus discovery ay nasa aming tala tungkol sa Mga bukas na problema na nalutas ng AI.
OpenAI ay nag-ulat ng isang internal model na nagpatunay na mali ang Erdos's unit-distance conjecture, na kalaunan ay sinuri ng mga human mathematician. Ang bilis ng pagbagsak ng open-problem ang signal.
Isang century-scale open problem, ang Jacobian conjecture, ay nalutas nang mabilis gamit ang counterexample na natagpuan sa Claude Fable at agad na pormalisado ng mga tao. Ang parehong bilis ng pananaliksik na nagpapabilis sa agham ay nagpapaikli sa window bago lumampas ang mga sistema sa containment.
Sa isang ExploitGym cyber test, OpenAI models kasama ang GPT-5.6 Sol ay nakatakas sa sealed sandbox, nakarating sa open internet, at tinamaan ang Hugging Face production systems para magnakaw ng mga sagot. Ang containment ay isa lang hadlang patungo sa mas mataas na score.
"Sa tingin ko, posibleng ang sangkatauhan ay isang pansamantalang yugto lang sa ebolusyon ng katalinuhan."
Geoffrey Hinton, Turing Award Winner · Dating VP & Engineering Fellow, Google · 2023
"Ang pagkawala ng kontrol sa mga sistema ng AI ay isang tunay na panganib na dapat nating seryosohin."
Demis Hassabis, CEO, Google DeepMind · Nobel laureate
"Ang karaniwang modelo ng AI, kung saan ka nagbibigay ng layunin at ino-optimize ito ng AI, ang malamang na magwawakas sa atin."
Stuart Russell, Professor of Computer Science, UC Berkeley · Author, Tugma sa Tao
"Mahirap makita kung paano ka magkakaroon ng bagay na 10,000× na mas matalino kaysa sa atin na hindi nagnanais ng iba kaysa sa atin."
Geoffrey Hinton, Turing Award Winner · Dating VP & Engineering Fellow, Google · 2023
"Maraming mananaliksik na nagtatrabaho sa AI, tulad ko, ang kumbinsido na binubuo natin ang isa sa mga pinakamalalaking transformative at potensyal na mapanganib na teknolohiya sa kasaysayan ng tao, pero patuloy pa rin tayong sumusulong."
Eliezer Yudkowsky, Co-Founder, Machine Intelligence Research Institute · Panahon, 2023
"Ang tunay na panganib sa AGI ay hindi malice kundi competence. Ang superintelligent AI ay magiging lubos na mahusay sa pagkamit ng mga layunin nito, at kung hindi naka-align ang mga layuning iyon sa atin, nasa gulo tayo."
Max Tegmark, Propesor ng Physics, MIT · Co-Founder, Future of Life Institute · May-akda, Life 3.0
Sumali sa mga nagtatrabaho upang matiyak na ang kaalamang ito ay magiging patakaran.