Omri Weinstein es un científico teórico de la computación, de los que pasan años en una sola pregunta y suelen saber de un vistazo si una demostración de su campo es real o solo un deseo. Esta semana escribió que había cambiado de opinión sobre algo que no esperaba.

"Ni siquiera el reciente avance de OpenAI en Erdős me convenció de que los LLM puedan hacer investigación matemática general", publicó. "Esto me hizo cambiar de opinión."

Lo que lo cambió fue un conducto corto y casi sin glamour construido por su antiguo colaborador de Columbia, Binghui Peng, junto con Runzhou Tao, Steven Wang y Hantao Yu. Apuntado a nueve problemas abiertos, los resolvió. No eran ejercicios disfrazados de investigación, sino preguntas abiertas publicadas, algunas de más de una década, tomadas de las listas de problemas de las principales conferencias del campo. Una de ellas, dijo Weinstein, lo había mantenido despierto por la noche durante dos años.

Cómo funciona el flujo

Si se quita el marco, el método es casi cotidiano, y eso es parte de lo que lo hace llamativo. Una etapa actúa como demostrador: recibe un problema abierto y escribe un argumento completo. Una segunda etapa actúa como verificador, lee ese argumento como lo haría un revisor, busca el paso que no sigue, el caso que se saltó, el lema que se asumió sin demostrar, y devuelve las objeciones. El demostrador revisa. El ciclo se repite. Cuando el verificador deja de encontrar fallos, interviene un humano.

Las pruebas en sí fueron generadas por GPT-5.5 Pro. Los textos se armaron con Claude Code, ejecutando Claude Opus 4.8, y luego fueron leídos, corregidos y aprobados por los autores. Para los resultados de álgebra el equipo fue más allá y formalizó las pruebas en Lean 4, usando un pipeline automatizado propio, de modo que un asistente de pruebas (no un modelo de lenguaje ni un árbitro sobrecargado) certifica que cada línea se sostiene. Ese último paso tiene más peso de lo que parece. Una prueba formalizada es cuestión de compilación, no de gusto. Compila o no compila.

Los nueve problemas

Los detalles son el punto, así que aquí está la lista completa.

ProblemaFuente
SGD aleatorizado y las desigualdades SS-RS-GDCOLT 2021 problema abierto
Aprendiendo circuitos cuánticos de salida medida (parcial)COLT 2015 problema abierto
Selección de datos sin ponderar para regresión linealCOLT 2025 problema abierto
Estimación robusta de probabilidad condicionalCOLT 2010 problema abierto
Robustez adversarial del muestreo por puntuación de apalancamiento en líneaFOCS 2023
Anillos de conductor finito vs. anillos cuasi-coherentesTeoría de anillos conmutativos
La conjetura Cahen-Fontana-Frisch-GlazTeoría de anillos conmutativos
Polinomios de valores enteros sobre álgebrasTeoría de anillos conmutativos
Una pregunta complementaria sobre el teseladoProblema 477 de Erdős

Unas cuantas advertencias honestas merecen estar junto a esa tabla. El resultado de aprendizaje cuántico es una solución parcial más que completa. Se trata de preguntas especializadas, legibles solo para las pocas docenas de investigadores que trabajan en cada una, no la Hipótesis de Riemann. Y una persona pulió cada informe antes de publicarlo. Nada de eso está oculto; todo está en el propio relato de los autores. Tampoco suaviza el hecho central: una máquina produjo las ideas matemáticas que cerraron problemas que personas cuidadosas habían intentado y no habían logrado cerrar.

Por qué un escéptico cambió de opinión

Ni siquiera el reciente avance de Erdős de @OpenAI me convenció de que los LLM puedan hacer investigación matemática general. Esto me hizo cambiar de opinión. Usando un ingenioso bucle LLM de "probador-verificador", este sistema resolvió 9 problemas abiertos sustanciales en Ciencias de la Computación Teórica, incluido uno que me tuvo despierto por la noche durante 2 años.

Omri Weinstein

Los respaldos de personas que venden la tecnología son baratos. Este no era uno de esos. Weinstein no trabaja para los laboratorios, ya había examinado el resultado reciente más publicitado y lo había encontrado insuficiente, y tenía un interés personal en el resultado. Una de las nueve era una pregunta de su propio rincón del campo. El problema de FOCS 2023 sobre la robustez adversarial del muestreo de leverage-score en línea se sitúa justo en el área en la que él trabaja, el tipo de pregunta que un especialista reconoce a primera vista y sabe lo difícil que es desde dentro.

El contraste que trazó con el episodio de Erdős del OpenAI merece entenderse. A finales de 2025, el personal del OpenAI afirmó que sus modelos habían resuelto un lote de problemas de la famosa lista de Paul Erdős. Gran parte de eso resultó ser que el modelo recuperaba soluciones que ya existían en la literatura, que un sitio de seguimiento popular simplemente había listado como abiertas. Una recuperación impresionante, pero no matemáticas nuevas, y el encuadre de «avance» recibió una corrección pública tajante de matemáticos en activo. Una persona cuidadosa podría archivar eso como una buena búsqueda. Lo que Weinstein no pudo archivar de esa manera fue una prueba fresca, en su propio subcampo, de una pregunta que él mismo había fracasado en responder.

¿Qué es nuevo, y qué no?

Es fácil sobreinterpretar un resultado como este, y fácil subinterpretarlo. Ambos valen la pena resistirlos.

La sobreinterpretación es que las matemáticas ya están automatizadas. No es así. Los humanos eligieron los problemas, guiaron el proceso, revisaron el resultado y escribieron los artículos finales. Los modelos no despertaron una mañana y decidieron trabajar en SGD barajado. La cadena es una herramienta, apuntada por personas que ya sabían qué preguntas estaban maduras.

La subestimación resulta más tentadora para cualquiera que haya visto inflarse y desinflarse las afirmaciones sobre IA durante una década. Dice: demo interesante, dominio estrecho, sigamos adelante. Eso pasa por alto lo que realmente ocurrió. Las ideas que sustentan estas pruebas, las construcciones, los análisis de casos y las desigualdades, provinieron de los modelos. La verificación mediante Lean y por expertos humanos confirma que las ideas son correctas. Es un modelo de lenguaje que aporta la parte estructural de un resultado de investigación, repetidamente, en problemas elegidos precisamente porque nadie los había resuelto, no un chatbot que se las arregla en un examen oral.

Por qué esto está en un sitio sobre el riesgo de IA

La distancia entre «la IA puede aprobar un examen difícil» y «la IA puede producir matemáticas que los expertos no podrían» es la distancia que esta Fundación ha intentado que la gente sienta en cada artículo. Las matemáticas y la ciencia teórica de la computación son el sustrato sobre el que está construida, no solo otro dominio al que la tecnología va a llegar. La optimización, la teoría del aprendizaje y la complejidad son las materias primas del próximo modelo.

Un sistema que pueda contribuir de forma significativa a problemas abiertos en esos campos es, en principio, un sistema que puede contribuir al diseño de su sucesor. La frase es automejora recursiva. La investigación que acelera la investigación marca la diferencia entre una escalada constante y una carrera, y los autores ya han dicho que su plan es aplicar la misma cadena a todos los campos de la ciencia.

Si funciona en todas partes es casi irrelevante. La dirección ya está fijada y llega más rápido que los pronósticos que ya parecían agresivos cuando se publicaron. El cronograma sigue acortándose, y resultados como este son la razón. El Escenario de IA 2027 pone la investigación automatizada de IA en el centro de su narrativa precisamente por esta razón: una vez que las máquinas realizan la ciencia, el tiempo se acelera.

Nada de esto es un argumento en contra de resolver problemas abiertos. Es un argumento sobre el ritmo. Quienes construyen estos sistemas siguen diciendo en público que la próxima capacidad está cerca, luego llega y vuelve a estar cerca. Un flujo de trabajo que un estudiante de posgrado puede ejecutar en un fin de semana ahora realiza tareas que antes merecían el respeto de todo un campo. La pregunta la Fundación sigue preguntando es el único que escala con la capacidad: quién decide qué tan rápido va esto, y en qué términos. Por ahora la respuesta es nadie, y lo más rápido posible.