P(doom) no es un término técnico de un artículo formal. Surgió en discusiones en línea sobre seguridad de la IA como abreviatura de una estimación de probabilidad a la que la mayoría de los investigadores antes de 2020 no le habrían puesto un número. La disposición a cuantificarla (a tratar el riesgo catastrófico de la IA como una probabilidad que se estima en lugar de una posibilidad a la que se alude vagamente) es uno de los cambios significativos en la forma en que las personas más cercanas al desarrollo de la IA piensan sobre el problema.
Las estimaciones van desde unos pocos puntos porcentuales hasta más del 50 %, según el investigador y cómo evalúe la dificultad de la alineación y la velocidad de la gobernanza. Esto es lo que nos dice el rango, y por qué incluso las probabilidades bajas exigen atención seria.
El «doom» en P(doom) está deliberadamente sin especificar. Distintos investigadores lo usan para referirse a la extinción humana, la pérdida permanente de la autonomía humana, la concentración permanente de poder en un solo actor o alguna otra catástrofe civilizacional. Se reconoce la imprecisión; el objetivo del término es obligar a un razonamiento cuantificado explícito sobre el riesgo en lugar de depender de intuiciones sobre si es «real» o «especulativo».
¿Cómo se ven las estimaciones?
El rango entre estos investigadores es llamativo. Hinton y Yudkowsky están separados por decenas de puntos porcentuales. La descomposición formal de Carlsmith produjo un rango amplio en lugar de una estimación puntual, reflejando la incertidumbre genuina en cada paso intermedio. Lo que comparten las estimaciones es que son no triviales; ninguno de los investigadores centrados en seguridad que han abordado seriamente el problema y le han puesto un número ha quedado por debajo de aproximadamente el 5%.
Establece tu propia opinión sobre cada uno de los puntos clave a continuación y observa cómo se multiplican en una sola estimación.
Por qué existe esa amplia gama
P(doom) como número es el producto de varias preguntas intermedias inciertas multiplicadas entre sí. ¿Qué tan rápido avanzarán las capacidades de IA? ¿Qué tan difícil es el problema de alineación en niveles de capacidad superiores a los que hemos probado? ¿Qué tan probable es que una IA desalineada de un nivel de capacidad dado cause daño catastrófico en lugar de contenido? ¿Qué tan probable es que la gobernanza responda de forma efectiva antes de alcanzar el umbral crítico de capacidad?
Los distintos investigadores tienen distribuciones diferentes sobre estas preguntas, y las estimaciones se acumulan. Un investigador que considere que el problema de la alineación es tratable, que las capacidades avanzarán con relativa lentitud y que la gobernanza responderá a tiempo producirá una estimación general mucho más baja que otro que crea lo contrario en cada cuestión. El amplio rango refleja la incertidumbre genuina sobre cada factor, no un desacuerdo que se resolverá examinando la misma evidencia con más cuidado.
El argumento del valor esperado
Una respuesta común a las estimaciones no triviales de P(doom) es: "Incluso un 10% parece demasiado bajo para reestructurar la sociedad en torno a ello." Esta respuesta se basa en un fallo del razonamiento de valor esperado que no se aceptaría en otros contextos de riesgo.
La probabilidad anual de una pandemia importante capaz de matar a millones se estima por debajo del 1 % en cualquier año, sin embargo la preparación para pandemias recibe una inversión y atención política global sustanciales. La probabilidad a lo largo de la vida de morir en un accidente de coche en el US es de aproximadamente el 1 %, y la regulación de seguridad vial se considera totalmente normal. El argumento de que una probabilidad del 10 % (o incluso del 5 %) de catástrofe civilizacional no justifica una inversión precautoria seria no es una aplicación coherente de cómo manejamos el riesgo en otros ámbitos.
El valor esperado es probabilidad por magnitud. Para riesgos irreversibles y de escala civilizacional (donde no hay recuperación del resultado negativo y este cierra todo valor futuro) el valor esperado de la precaución sigue siendo muy grande incluso con probabilidades muy inferiores al 10 %. Una probabilidad del 1 % de perderlo todo es un problema cuyo costo esperado es el 1 % de todo, lo cual, a la escala de lo que contiene el futuro a largo plazo, es una cifra enorme, no un problema del 1 %.
Qué bajaría P(doom)
Los investigadores que expresan estimaciones altas de P(doom) están diagnosticando dónde debe concentrarse el trabajo más crítico, no resignándose a malos resultados. Los factores que reducirían P(doom) en la mayoría de las estimaciones de los investigadores están bien entendidos: progreso demostrado en herramientas de interpretabilidad capaces de verificar la alineación en sistemas de frontera; enfoques de supervisión escalable que funcionen en niveles de capacidad superiores a los expertos humanos; marcos de gobernanza internacional vinculantes con aplicación real; y desarrollo de capacidades que avance más lento que la investigación de alineación para que la seguridad se establezca antes de alcanzar niveles de capacidad peligrosos.
Por eso la Fundación se centra en los marcos de gobernanza y la investigación de alineación como palancas principales, en lugar de descartar el riesgo o tratar una estimación concreta de P(doom) como la respuesta autorizada. La incertidumbre en P(doom) no es razón para esperar más información; el resultado malo llega en umbrales de capacidad específicos, no en un cronograma que permita posponer la precaución indefinidamente.