Si Omri Weinstein ay isang theoretical computer scientist, ang uri na gumugugol ng mga taon sa isang tanong at karaniwang masasabi agad kung totoo o wishful ang isang patunay sa larangan niya. Isinulat niya ngayong linggo na nagbago ang isip niya tungkol sa isang bagay na hindi niya inasahan.

"Kahit ang kamakailang Erdős breakthrough ng OpenAI ay hindi nakumbinsi sa akin na kaya ng mga LLM ang general math research," ang kanyang post. "Binago nito ang isip ko."

Ang nagpabago rito ay isang maikli, halos hindi kapansin-pansin na pipeline na itinayo ng dating collaborator niya sa Columbia na si Binghui Peng, kasama sina Runzhou Tao, Steven Wang, at Hantao Yu. Itinuro sa siyam na bukas na problema, nalutas nito ang mga iyon. Hindi mga ehersisyo na ginawang parang research, kundi mga nai-publish na bukas na tanong, ang ilan ay higit sa isang dekada na, kinuha mula sa mga listahan ng problema ng mga pangunahing conference sa larangan. Isa sa mga iyon, sabi ni Weinstein, ay nagpuyat sa kanya nang dalawang taon.

Paano gumagana ang pipeline

Tanggalin ang framing at ang method ay halos ordinaryo, na bahagi ng dahilan kung bakit ito kapansin-pansin. Isang stage ang gumaganap bilang prover: binigyan ng open problem, nagsusulat ito ng buong argument. Isang pangalawang stage ang gumaganap bilang verifier, binabasa ang argumentong iyon tulad ng isang referee, hinahanap ang hakbang na hindi sumusunod, ang case na nilaktawan, ang lemma na tahimik na ipinagpalagay sa halip na napatunayan, at ibinabalik ang mga objections. Binabago ng prover. Paulit-ulit ang loop. Kapag tumigil na ang verifier sa paghahanap ng mga butas, ang tao na ang pumapasok.

Ang mga patunay ay ginawa ng GPT-5.5 Pro. Ang mga writeup ay inayos gamit ang Claude Code, na tumatakbo sa Claude Opus 4.8, pagkatapos ay binasa, itinama, at pinirmahan ng mga may-akda. Para sa mga resulta sa algebra, mas lalo pang pormalisado ng team ang mga patunay sa Lean 4 gamit ang sarili nilang automated pipeline, para ang isang proof assistant (hindi language model, at hindi overburdened na referee) ang nagpapatunay na bawat linya ay tama. Mas mabigat ang huling hakbang na ito kaysa sa tila. Ang formalized na patunay ay usapin ng compilation, hindi ng panlasa. Nag-compile ito o hindi.

Ang siyam na problema

Ang mga detalye ang punto, kaya narito ang buong listahan.

ProblemaPinagmulan
Pinaghalong SGD at ang mga hindi pagkakapantay-pantay ng SS-RS-GDCOLT 2021 bukas na suliranin
Pag-aaral ng measured-output quantum circuits (bahagi)COLT 2015 bukas na suliranin
Pagpili ng data na walang timbang para sa linear regressionCOLT 2025 bukas na suliranin
Matatag na pagtataya ng conditional probabilityCOLT 2010 bukas na suliranin
Adversarial robustness ng online leverage-score samplingFOCS 2023
Mga singsing na may hangganang konduktor laban sa quasi-coherentTeorya ng commutative ring
Ang Cahen-Fontana-Frisch-Glaz conjectureTeorya ng commutative ring
Mga polynomial na may integer values sa mga algebraTeorya ng commutative ring
Isang tanong na komplemento sa tilingProblema 477 ni Erdős

Ilang honest caveats ang nararapat sa tabi ng talahanayang iyan. Ang quantum-learning result ay partial solution sa halip na complete one. Ito ay specialized questions, legible sa ilang dosenang mananaliksik na nagtatrabaho sa bawat isa, hindi ang Riemann Hypothesis. At isang tao ang nag-polish sa bawat writeup bago ito na-post. Wala sa mga iyan ang nakatago; lahat ay nasa sariling account ng mga authors. Hindi rin nito pinapagaan ang central fact, na ang isang makina ang gumawa ng mathematical ideas na nagsara ng mga problema na sinubukan at nabigo ng mga maingat na tao.

Bakit nagbago ng isip ang isang skeptic

Kahit ang kamakailang Erdős breakthrough ng @OpenAI ay hindi ako nakumbinsi na ang LLMs ay makakagawa ng general math research. Binago nito ang isip ko. Gamit ang clever 'prover-verifier' LLM loop, nalutas ng harness na ito ang 9 substantial open problems sa Theoretical CS, kasama ang isa na nagpuyat sa akin nang dalawang taon.

Omri Weinstein

Ang endorsement mula sa mga taong nagbebenta ng teknolohiya ay mura. Hindi ito isa sa mga iyon. Hindi nagtatrabaho si Weinstein para sa mga lab, tiningnan na niya ang pinakapublicized na kamakailang resulta at natagpuan itong kulang, at may personal na stake siya sa resulta. Isa sa siyam ay isang tanong mula sa kanyang sariling sulok ng larangan. Ang FOCS 2023 problem sa adversarial robustness ng online leverage-score sampling ay nasa lugar mismo kung saan siya nagtatrabaho, ang uri ng tanong na agad na nakikilala ng isang espesyalista at alam ang kahirapan nito mula sa loob.

Sulit unawain ang contrast na ginawa niya sa OpenAI's Erdős episode. Noong huling bahagi ng 2025, sinabi ng OpenAI staff na nalutas ng kanilang mga model ang isang batch ng problema mula sa sikat na listahan ni Paul Erdős. Karamihan nito ay lumabas na simpleng pagkuha ng mga model sa mga solusyong umiiral na sa literatura, na isang popular na tracking site lang ang naglista bilang open. Kahanga-hangang retrieval, pero hindi bagong matematika, at ang "breakthrough" framing ay nakatanggap ng matinding public correction mula sa mga working mathematicians. Maaaring ilagay ito ng maingat na tao sa ilalim ng good search. Ang hindi kayang ilagay ni Weinstein sa ganoong paraan ay isang sariwang patunay, sa kanyang sariling subfield, ng isang tanong na personal niyang hindi nasagot.

Ano ang bago, at ano ang hindi

Madaling sobrahan ang pagbasa sa resulta na ganito, at madali ring kulangin ang pagbasa rito. Parehong dapat labanan.

Ang maling pagbasa ay na automated na ngayon ang matematika. Hindi. Pinili ng mga tao ang mga problema, ginabayan ang proseso, sinuri ang output, at isinulat ang mga huling papel. Hindi nagising ang mga model isang umaga at nagdesisyong magtrabaho sa shuffled SGD. Ang pipeline ay isang kasangkapan, itinutok ng mga taong alam na kung aling mga tanong ang hinog na.

Mas nakakaakit ang underread para sa sinumang nakasaksi kung paano nagpalaki at nagpaliliit ng mga claim tungkol sa AI sa loob ng isang dekada. Sinasabi nito: maayos na demo, makitid na larangan, lumipat na. Hindi nito nakikita ang tunay na nangyari. Mula sa mga modelo nagmula ang mga ideya na nagdadala ng mga patunay na ito, ang mga konstruksyon at case analysis at inequalities. Kinukumpirma ng pagpapatunay gamit ang Lean at ng mga eksperto ng tao na tama ang mga ideya. Ito ay isang language model na nag-aambag sa pinakamahalagang bahagi ng resulta ng pananaliksik, paulit-ulit, sa mga problemang pinili nang eksakto dahil walang nakalutas sa mga ito, hindi isang chatbot na nagpapanggap sa oral exam.

Bakit ito nasa site tungkol sa panganib ng AI

Ang distansya sa pagitan ng "AI can pass a hard exam" at "AI can produce mathematics that experts could not" ay ang distansyang ginugol ng Foundation na ito sa bawat artikulo para iparamdam sa mga tao. Ang mathematics at theoretical computer science ang substrate kung saan ito itinayo, hindi lang isa pang domain na paparatingan ng teknolohiya. Ang optimization, learning theory, at complexity ang raw materials ng susunod na model.

Ang sistema na makakapag-ambag nang makabuluhan sa mga open problems sa mga larangang iyon ay, sa prinsipyo, sistema ring makakapag-ambag sa disenyo ng sarili nitong kahalili. Ang parirala ay paulit-ulit na pagpapabuti sa sarili. Ang research na nagpapabilis sa research ang pagkakaiba sa pagitan ng steady climb at sprint, at sinabi na ng mga may-akda na ang kanilang plano ay iangat ang parehong pipeline sa bawat larangan ng agham.

Kung gumagana ito sa lahat ng dako ay halos hindi na mahalaga. Naitakda na ang direksyon, at dumarating ito nang mas mabilis kaysa sa mga forecast na aggressive na nga noong inilathala. Ang takdang panahon ay patuloy na lumiliit, at ang mga resulta tulad nito ang dahilan. Ang senaryo ng AI 2027 inilalagay ang automated AI research sa gitna ng kuwento dahil mismo dito: kapag ang mga makina na ang gumagawa ng siyensiya, bumibilis ang orasan.

Ang mga taong bumubuo ng mga sistemang ito ay paulit-ulit na nagsasabi sa publiko na malapit na ang susunod na kakayahan, at saka ito dumarating,patuloy na itinatanong ng Foundation ang tanging bagay na sumasabay sa kakayahan: sino ang magpapasya kung gaano kabilis ito, at sa anong mga termino. Sa ngayon, walang sumasagot, at kasing bilis ng posible.