Omri Weinstein là nhà khoa học máy tính lý thuyết, kiểu người bỏ nhiều năm cho một câu hỏi và thường chỉ cần liếc qua đã biết chứng minh trong ngành mình là thật hay chỉ là ảo tưởng. Tuần này ông viết rằng mình đã thay đổi quan điểm về một vấn đề mà ông không ngờ tới.

"Ngay cả đột phá Erdős gần đây của OpenAI cũng chưa thuyết phục tôi rằng LLM có thể làm nghiên cứu toán học tổng quát," anh ấy đăng. "Điều này đã thay đổi suy nghĩ của tôi."

Điều thay đổi tình hình là một đường ống ngắn, gần như không mấy hào nhoáng do cộng sự cũ tại Columbia của ông, Binghui Peng, xây dựng cùng Runzhou Tao, Steven Wang và Hantao Yu. Hướng đến chín bài toán mở, nó đã giải quyết chúng. Không phải bài tập cải trang thành nghiên cứu, mà là những câu hỏi mở đã công bố, một số hơn mười năm tuổi, lấy từ danh sách vấn đề của các hội nghị chính trong lĩnh vực. Một trong số đó, Weinstein nói, đã khiến ông mất ngủ hai năm liền.

Cách pipeline hoạt động

Bỏ qua cách đóng khung và phương pháp gần như tầm thường, điều này một phần khiến nó nổi bật. Một giai đoạn đóng vai prover: được giao một vấn đề mở, nó viết ra một lập luận đầy đủ. Giai đoạn thứ hai đóng vai verifier, đọc lập luận đó như một người phản biện, tìm bước không theo logic, trường hợp bị bỏ qua, bổ đề được giả định thầm lặng thay vì chứng minh, rồi đưa các phản biện trở lại. Prover sửa đổi. Vòng lặp chạy lại. Khi verifier ngừng tìm thấy lỗ hổng, con người tiếp quản.

Các chứng minh được tạo ra bởi GPT-5.5 Pro. Các bài viết được biên soạn bằng Claude Code, chạy Claude Opus 4.8, sau đó được đọc, sửa và ký duyệt bởi các tác giả. Với các kết quả đại số, nhóm còn đi xa hơn khi hình thức hóa các chứng minh trong Lean 4, sử dụng một đường ống tự động do chính họ xây dựng, để một trợ lý chứng minh (không phải mô hình ngôn ngữ, cũng không phải một trọng tài quá tải) chứng nhận mọi dòng đều đúng. Bước cuối cùng này mang ý nghĩa lớn hơn vẻ ngoài. Một chứng minh đã hình thức hóa là vấn đề biên dịch, không phải vấn đề khẩu vị. Nó biên dịch hoặc không biên dịch.

Chín vấn đề

Chi tiết chính là điểm mấu chốt, vậy đây là danh sách đầy đủ.

Vấn đềNguồn
Shuffled SGD và các bất đẳng thức SS-RS-GDVấn đề mở COLT 2021
Học các mạch lượng tử có đầu ra đo được (một phần)Vấn đề mở COLT 2015
Lựa chọn dữ liệu không trọng số cho hồi quy tuyến tínhVấn đề mở COLT 2025
Ước lượng xác suất có điều kiện mạnh mẽVấn đề mở COLT 2010
Độ bền vững trước tấn công của phương pháp lấy mẫu điểm đòn bẩy trực tuyếnFOCS 2023
Vành dẫn hữu hạn so với vành quasi-coherentLý thuyết vành giao hoán
Giả thuyết Cahen-Fontana-Frisch-GlazLý thuyết vành giao hoán
Đa thức giá trị nguyên trên đại sốLý thuyết vành giao hoán
Một câu hỏi bổ sung về tilingErdős Problem 477

Một vài lưu ý trung thực cần đặt bên cạnh bảng đó. Kết quả quantum-learning là giải pháp một phần chứ không phải giải pháp hoàn chỉnh. Đây là những câu hỏi chuyên biệt, chỉ rõ ràng với vài chục nhà nghiên cứu làm việc trong từng lĩnh vực, chứ không phải Giả thuyết Riemann. Và một con người đã chỉnh sửa mọi bài viết trước khi đăng. Không có điều nào trong số đó bị che giấu; tất cả đều nằm trong chính tài khoản của các tác giả. Nó cũng không làm dịu đi sự kiện trung tâm, đó là một cỗ máy đã tạo ra những ý tưởng toán học giải quyết các vấn đề mà những người cẩn thận đã thử và thất bại.

Tại sao một người hoài nghi đã thay đổi suy nghĩ

Ngay cả đột phá Erdős gần đây của OpenAI cũng chưa thuyết phục tôi rằng LLM có thể làm nghiên cứu toán học tổng quát. Điều này đã thay đổi suy nghĩ của tôi. Sử dụng vòng lặp LLM 'người chứng minh-người xác minh' thông minh, hệ thống này đã giải được 9 bài toán mở đáng kể trong Khoa học Máy tính Lý thuyết, trong đó có một bài khiến tôi mất ngủ hai năm.

Omri Weinstein

Sự chứng thực từ những người bán công nghệ là rẻ. Đây không phải một trong số đó. Weinstein không làm việc cho các phòng thí nghiệm, ông đã xem xét kết quả được công bố rộng rãi gần đây nhất và thấy nó thiếu sót, và ông có lợi ích cá nhân trong kết quả. Một trong chín là một câu hỏi từ chính lĩnh vực của ông. Vấn đề FOCS 2023 về độ bền vững đối nghịch của lấy mẫu điểm đòn bẩy trực tuyến nằm ngay trong lĩnh vực ông làm việc, loại câu hỏi mà một chuyên gia nhận ra ngay lập tức và biết độ khó từ bên trong.

Sự tương phản ông ấy vẽ ra với vụ Erdős của OpenAI đáng được hiểu rõ. Cuối năm 2025, nhân viên OpenAI tuyên bố mô hình của họ đã giải được một loạt vấn đề trong danh sách nổi tiếng của Paul Erdős. Phần lớn hóa ra là mô hình chỉ tìm lại các lời giải đã tồn tại trong tài liệu, vốn chỉ được một trang theo dõi phổ biến liệt kê là chưa giải. Việc truy xuất ấn tượng, nhưng không phải toán học mới, và cách đóng khung “đột phá” đã bị các nhà toán học đang làm việc công khai sửa sai gay gắt. Một người cẩn thận có thể xếp sự kiện ấy vào mục tìm kiếm tốt. Điều Weinstein không thể xếp theo cách đó là một chứng minh mới, trong lĩnh vực con của ông, cho một câu hỏi mà chính ông đã từng thất bại trong việc trả lời.

Điều gì mới, và điều gì không

Dễ dàng đọc quá một kết quả như thế này, và dễ dàng đọc thiếu nó. Cả hai đều đáng kháng cự.

Cách hiểu sai là toán học đã được tự động hóa hoàn toàn. Không phải vậy. Con người chọn vấn đề, hướng dẫn quy trình, kiểm tra kết quả và viết bài báo cuối cùng. Các mô hình không tự dưng tỉnh dậy một buổi sáng và quyết định nghiên cứu SGD xáo trộn. Đường ống này là công cụ, do những người đã biết câu hỏi nào đang chín muồi nhắm vào.

Cách đọc ít được chú ý hơn lại hấp dẫn hơn với bất kỳ ai đã chứng kiến những lời tuyên bố về AI phồng lên rồi xẹp xuống suốt một thập kỷ. Nó nói: bản demo đẹp mắt, lĩnh vực hẹp, chuyển sang cái khác đi. Điều đó bỏ lỡ những gì thực sự đã xảy ra. Những ý tưởng mang theo các bằng chứng này, các cấu trúc, phân tích tình huống và bất đẳng thức, đều đến từ các mô hình. Việc xác minh bằng Lean và bởi các chuyên gia con người xác nhận các ý tưởng là đúng. Đây là một mô hình ngôn ngữ đóng góp phần cốt lõi của một kết quả nghiên cứu, lặp lại nhiều lần, qua các vấn đề được chọn chính vì chưa ai giải quyết được, chứ không phải chatbot đang lúng búng qua một bài thi vấn đáp.

Tại sao điều này lại có trên trang web về rủi ro AI

Khoảng cách giữa "AI có thể vượt một kỳ thi khó" và "AI có thể tạo ra toán học mà các chuyên gia không thể làm được" là khoảng cách mà Foundation này đã dành mọi bài viết để khiến mọi người cảm nhận. Toán học và khoa học máy tính lý thuyết là chất nền mà nó được xây dựng từ đó, không chỉ là một lĩnh vực khác mà công nghệ đang nhắm tới. Tối ưu hóa, lý thuyết học và độ phức tạp là nguyên liệu thô của mô hình tiếp theo.

Một hệ thống có thể đóng góp có ý nghĩa vào các vấn đề mở trong những lĩnh vực đó, về nguyên tắc, là hệ thống có thể đóng góp vào thiết kế người kế nhiệm của chính nó. Cụm từ là cải thiện bản thân đệ quy. Nghiên cứu thúc đẩy nghiên cứu là sự khác biệt giữa một cuộc leo dốc đều đặn và một cuộc chạy nước rút, và các tác giả đã nói rõ kế hoạch của họ là nhắm cùng một quy trình vào mọi lĩnh vực khoa học.

Việc nó có hoạt động ở mọi nơi hay không gần như không còn là vấn đề. Hướng đi đã được định hình, và nó đang đến nhanh hơn cả những dự báo vốn đã bị coi là quá lạc quan khi công bố mốc thời gian tiếp tục ngắn lại, và những kết quả như thế này là lý do kịch bản AI 2027 đặt nghiên cứu AI tự động vào trung tâm câu chuyện vì chính lý do này: một khi máy móc làm khoa học, đồng hồ sẽ chạy nhanh hơn.

Không có gì trong số này là lập luận chống lại việc giải quyết các vấn đề mở. Đó là lập luận về tốc độ. Những người xây dựng các hệ thống này liên tục nói với chúng ta, công khai, rằng khả năng tiếp theo đang đến gần, rồi nó xuất hiện, và nó lại gần. Một quy trình mà một sinh viên sau đại học có thể chạy qua một cuối tuần nay làm được công việc mà một lĩnh vực dành sự tôn trọng cho nó. Câu hỏi Quỹ vẫn tiếp tục hỏi là thứ duy nhất mở rộng theo năng lực: ai quyết định tốc độ này diễn ra nhanh như thế nào, và theo những điều khoản nào. Hiện tại câu trả lời là không ai cả, và nhanh nhất có thể.