오므리 와인스타인은 이론 컴퓨터 과학자로, 한 가지 질문에 수년을 바치며 자신의 분야에서 증명이 진짜인지 희망 사항인지 한눈에 판단할 수 있는 사람입니다. 이번 주 그는 예상하지 못했던 일에 대해 생각을 바꿨다고 썼습니다.
"OpenAI의 최근 에르되시 돌파조차 LLM이 일반 수학 연구를 할 수 있다고 확신시키지 못했다"고 그는 게시했습니다. "이번에 생각이 바뀌었다."
이를 바꾼 것은 그의 전 컬럼비아 동료 빙후이 펑이 런저우 타오, 스티븐 왕, 한타오 위와 함께 만든 짧고 거의 평범해 보이는 파이프라인이었다. 아홉 개의 미해결 문제에 초점을 맞춰 그것을 풀었다. 연구처럼 꾸민 연습이 아니라, 분야 주요 학회의 문제 목록에서 가져온, 일부는 10년 이상 된 공개 질문이었다. 그중 하나는 와인스타인이 2년 동안 밤잠을 설치게 한 문제였다.
파이프라인이 작동하는 방식
틀을 벗기면 방법은 거의 평범해 보이는데, 그 점이 오히려 인상적이다. 한 단계는 증명자 역할을 한다. 열린 문제를 받으면 완전한 논증을 작성한다. 두 번째 단계는 검증자 역할을 하며, 심사위원처럼 그 논증을 읽고 논리가 이어지지 않는 단계, 생략된 사례, 증명 없이 조용히 가정된 보조정리를 찾아 반론을 돌려준다. 증명자가 수정한다. 순환이 반복된다. 검증자가 더 이상 구멍을 찾지 못하면 사람이 개입한다.
증명 자체는 GPT-5.5 Pro가 생성했다. 해설은 Claude Code로 Claude Opus 4.8을 실행해 조립한 뒤, 저자들이 읽고 수정하고 승인했다. 대수 결과의 경우 팀은 더 나아가 자체 자동화 파이프라인을 사용해 Lean 4로 증명을 형식화했으며, 따라서 증명 보조기(언어 모델도, 과로한 심사위원도 아닌)가 모든 줄이 성립함을 인증한다. 마지막 단계는 생각보다 무겁다. 형식화된 증명은 취향의 문제가 아니라 컴파일의 문제다. 컴파일되거나 되지 않거나다.
아홉 가지 문제
구체적인 내용이 핵심이므로 전체 목록은 다음과 같습니다.
| 문제 | 출처 |
|---|---|
| 셔플된 SGD와 SS-RS-GD 부등식 | COLT 2021 공개 문제 |
| 측정된 출력 양자 회로 학습 (부분) | COLT 2015 공개 문제 |
| 선형 회귀를 위한 가중치 없는 데이터 선택 | COLT 2025 공개 문제 |
| 강건한 조건부 확률 추정 | COLT 2010 공개 문제 |
| 온라인 레버리지 스코어 샘플링의 적대적 강건성 | FOCS 2023 |
| 유한 도체 대 준일관 고리 | 가환환 이론 |
| 카헨-폰타나-프리슈-글라즈 추측 | 가환환 이론 |
| 대수 위의 정수값 다항식 | 가환환 이론 |
| 반복 배치 보완 질문 | Erdős Problem 477 |
그 표 옆에 몇 가지 솔직한 유의 사항을 두어야 합니다. 양자 학습 결과는 완전한 해결책이 아니라 부분적 해결책입니다. 이는 각 분야에서 일하는 수십 명의 연구자에게만 읽히는 전문 질문이지 리만 가설이 아닙니다. 그리고 게시 전에 한 사람이 모든 요약문을 다듬었습니다. 그 사실은 숨겨져 있지 않으며 저자들의 자체 설명에 모두 나와 있습니다. 또한 신중한 사람들이 시도했다가 실패한 문제를 기계가 수학적 아이디어로 해결했다는 핵심 사실을 누그러뜨리지도 않습니다.
회의론자가 마음을 바꾼 이유
심지어 @OpenAI의 최근 에르되시 돌파구조차 나를 설득하지 못했다. 대규모 언어 모델이 일반 수학 연구를 할 수 있다는 점에서. 이것이 내 생각을 바꿨다. 영리한 '증명자-검증자' 대규모 언어 모델 루프를 사용해 이 장치는 이론 컴퓨터 과학에서 상당한 미해결 문제 아홉 개를 풀었으며, 그중 하나는 내가 이 년 동안 밤잠을 설치게 한 문제였다.
오므리 와인스타인
기술을 판매하는 사람들의 지지는 값싸다. 이것은 그런 경우가 아니었다. 와인스타인은 연구소에서 일하지 않았고 이미 가장 널리 알려진 최근 결과를 검토해 부족함을 발견했으며 결과에 개인적 이해관계가 있었다. 아홉 문제 중 하나는 그의 분야에서 나온 질문이었다. FOCS 2023의 온라인 레버리지 스코어 샘플링의 적대적 강건성 문제는 그가 연구하는 영역에 정확히 속하며, 전문가가 한눈에 알아보고 내부에서 그 난이도를 아는 종류의 질문이다.
그가 OpenAI의 에르되시 사례와 대비해 지적한 점은 이해할 가치가 있다. 2025년 말 OpenAI 직원들은 자사 모델이 폴 에르되시의 유명 문제 목록 중 일부를 풀었다고 밝혔다. 상당 부분은 대중 추적 사이트가 미해결로만 나열했던 기존 문헌 속 해법을 모델이 찾아낸 것이었다. 인상적인 검색이었지만 새로운 수학이 아니었고, ‘획기적 성과’라는 표현은 현직 수학자들로부터 날카로운 공개 비판을 받았다. 신중한 사람은 이를 훌륭한 검색으로 분류할 수 있었다. 와인스타인이 그렇게 분류할 수 없었던 것은 자신이 직접 풀지 못했던 문제에 대한, 자신의 하위 분야에서 나온 새로운 증명이었다.
새로운 것은 무엇이고, 그렇지 않은 것은 무엇인가
이런 결과를 과대해석하기도 쉽고 과소해석하기도 쉽습니다. 둘 다 경계할 필요가 있습니다.
과장 해석은 수학이 이제 자동화되었다는 것입니다. 그렇지 않습니다. 인간이 문제를 선택하고, 과정을 안내하고, 결과를 확인하고, 최종 논문을 썼습니다. 모델은 어느 날 아침 깨어나 섞인 확률적 경사 하강법을 작업하기로 결정하지 않았습니다. 파이프라인은 이미 어떤 질문이 무르익었는지 아는 사람들이 조준한 도구입니다.
과소평가는 10년 동안 AI 주장의 팽창과 수축을 지켜본 사람에게 더 매력적이다. ‘깔끔한 데모, 좁은 영역, 다음으로’라고 말한다. 실제로 일어난 일을 놓친다. 이 증명들을 뒷받침하는 아이디어, 구성, 사례 분석, 부등식은 모델에서 나왔다. Lean과 인간 전문가의 검증은 아이디어가 정확함을 확인한다. 이는 언어 모델이 아무도 풀지 못한 문제로 선정된 과제에서 반복적으로 연구 결과의 핵심 부분을 기여한 것이지, 챗봇이 구두 시험을 둘러대는 것이 아니다.
이 글이 인공지능 위험 사이트에 있는 이유
"AI가 어려운 시험을 통과할 수 있다"와 "AI가 전문가들이 할 수 없는 수학을 생산할 수 있다" 사이의 거리는 이 재단이 모든 기사에서 사람들에게 느끼게 하려 애써온 거리입니다. 수학과 이론 컴퓨터 과학은 그것이 구축된 기반이지, 기술이 다가오는 또 다른 영역이 아닙니다. 최적화, 학습 이론, 복잡성은 다음 모델의 원자재입니다.
해당 분야의 미해결 문제에 의미 있게 기여할 수 있는 시스템은 원칙적으로 후속 시스템 설계에도 기여할 수 있습니다. 그 표현은 재귀적 자기 개선. 연구를 가속하는 연구는 꾸준한 상승과 전력 질주의 차이이며, 저자들은 이미 모든 과학 분야에 동일한 파이프라인을 적용할 계획이라고 밝혔습니다.
어디서나 작동하는지는 거의 중요하지 않습니다. 방향은 정해졌고, 이미 공격적으로 느껴지던 예측보다 더 빠르게 다가오고 있습니다 일정 점점 더 짧아지고 있으며, 이런 결과가 그 이유입니다 인공지능 2027 시나리오 자동화된 인공지능 연구를 이야기의 중심에 둔 이유가 바로 여기에 있습니다. 기계가 과학을 수행하기 시작하면 시계는 빨라집니다.
이것은 미해결 문제를 해결하는 것에 반대하는 주장이 아닙니다. 속도에 관한 주장입니다. 이 시스템을 만드는 사람들은 공개적으로 다음 능력이 가까웠다고 말하고, 그러면 그것이 도착하며, 다시 가까워집니다. 대학원생이 주말에 실행할 수 있는 파이프라인이 이제는 한 분야가 존경을 바치는 일을 합니다. 질문은 재단은 계속해서 묻고 있습니다 는 능력에 따라 확장되는 유일한 요소입니다. 누가 속도를 결정하고 어떤 조건으로 진행할지. 현재 답은 아무도 없으며 가능한 한 빠르게입니다.