Thomas Holland

Autor colaborador en el Nakada Foundation to Save Humanity. Escribiendo sobre seguridad de IA, gobernanza de ASI y los marcos de políticas necesarios para prevenir los riesgos existenciales de la superinteligencia artificial.

Contacto
Thomas Holland

Escritura que hace
las apuestas claras.

Thomas Holland escribe sobre seguridad y gobernanza de la inteligencia artificial para Nakada Foundation to Save Humanity. Su trabajo abarca los conceptos técnicos que subyacen al riesgo de IA, desde la alineación y la corregibilidad hasta la meso-optimización y la convergencia instrumental, y los traduce a términos accesibles para responsables de políticas, defensores y el público general que necesita entender lo que está en juego.

Sus escritos abordan tanto las dimensiones técnicas como políticas del riesgo de la IA como una cuestión de gobernanza: si la comunidad internacional puede construir los marcos legales e institucionales que mantengan a los sistemas que superan la inteligencia humana en compatibilidad con la supervivencia y el florecimiento humano. Responder esa pregunta requiere una comunicación clara entre disciplinas.

Artículos de Thomas Holland

OpenAI Entrenamiento en pausa. No paró la carrera. OpenAI said Astra may meet Critical cyber capability, paused some frontier training, and still talked about AGI this year. Nombraron un Benchmark para la Superinteligencia ASI-Bench scores whether AI can run research as human method is withdrawn. The name still points at superintelligence. Anthropic Raised Its Risk Rating. Se quedó en el edificio. Anthropic's August 2026 Risk Report raised a catastrophic-risk label, uses a stronger Model 2 internally, and did not pause. Riesgo de los pesos de IA de código abierto Los pesos abiertos para la IA general casi de frontera son una puerta de proliferación unidireccional. Qué acierta la apertura, dónde falla y cómo calificar las liberaciones. Cómo detener la superinteligencia Cómo detener la superinteligencia: prohibición vinculante, reglas de cómputo, ley nacional, diseño de tratados, pesos abiertos y acciones concretas por rol. Escenarios de Toma de Control por IA Explicados Escenarios de toma de control por IA explicados: pérdida repentina de control, carreras, desempoderamiento gradual, mal uso y proliferación abierta, además de qué reduce realmente el riesgo. El riesgo existencial de la IA explicado Riesgo existencial de la IA explicado: qué es, por qué la superinteligencia es diferente, vías principales, ideas técnicas clave, objeciones y qué reduce el riesgo. AGI vs ASI Explicado AGI vs ASI explicado en lenguaje sencillo: definiciones, la escalera de capacidades, por qué Las 12 voces más ruidosas a favor de la superinteligencia Los defensores más influyentes de construir una superinteligencia artificial, y los argumentos reales detrás de la carrera, desde la sucesión hasta los que solo dicen… El borrador del tratado de MIRI para prevenir la superinteligencia, explicado El Equipo de Gobernanza Técnica de MIRI redactó un borrador completo de tratado para detener la carrera hacia la superinteligencia. Sus umbrales de FLOP, límites de clústeres de chips y verificación… MAIM: Mal funcionamiento mutuamente asegurado de la IA, explicado MAIM es el marco de disuasión de Superintelligence Strategy: los Estados sabotean cualquier intento rival de dominar la IA. Cómo funciona y dónde falla. Desempoderamiento gradual, explicado El desempoderamiento gradual es el argumento de que la IA podría terminar con el control humano sin ninguna toma de poder. Qué dice el artículo de 2025, sus puntos débiles y qué lo detendría. Una IA acaba de resolver 9 problemas matemáticos abiertos Un bucle LLM de demostrador y verificador resolvió nueve problemas abiertos en ciencias de la computación teórica y álgebra. Qué resolvió, cómo funcionó y por qué importa. El tratado que prohíbe las armas biológicas pero no puede hacerlas cumplir: Lecciones para la gobernanza de ASI La Convención sobre Armas Biológicas prohíbe las armas biológicas en todo el mundo, pero carece de mecanismo de verificación. Esto es lo que esa falla estructural enseña a cualquiera que diseñe gobernanza de ASI. ¿Qué es la IA que busca poder? La búsqueda de poder es la tendencia de la IA capaz a reunir recursos, opciones e influencia porque hacerlo ayuda con casi cualquier objetivo. Lo que enseña el Tratado Antártico sobre la Gobernanza ASI El Tratado Antártico congeló la competencia entre grandes potencias sobre todo un continente en plena Guerra Fría. Esto es lo que enseña a la gobernanza ASI. El problema de los dos tercios: Lograr un tratado de IA en el Senado Un tratado sobre US necesita 67 votos en el Senado para ratificarse. Esa barrera ya ha matado tratados importantes antes. Esto es lo que significa para un acuerdo de IA, y las formas de sortearlo. ¿Qué es la interpretabilidad mecanicista? Entender la IA desde adentro La interpretabilidad mecanicista revela los cálculos dentro de las redes neuronales. Lo que han descubierto los investigadores y por qué importa para la seguridad de la IA. El mundo ya tiene su primer tratado de IA. Esto es lo que no cubre. El primer tratado vinculante sobre IA del mundo aborda la discriminación y la transparencia. Esto es lo que omite sobre el riesgo existencial del desarrollo de IA de frontera. 'Si alguien lo construye, todos mueren', Explicado El libro de 2025 de Yudkowsky y Soares argumenta que construir IA superhumana en nuestro camino actual mataría a todos. ¿Qué es la gobernanza de cómputo para la IA? Controlar la IA a través del hardware La gobernanza del cómputo controla los chips necesarios para entrenar IA de frontera como palanca regulatoria. Cómo funciona, por qué es viable y cuáles son sus límites. El Protocolo de Montreal: el tratado que realmente funcionó El Protocolo de Montreal es el tratado ambiental más exitoso que se haya escrito. Esto es lo que su diseño nos enseña sobre gobernar la IA. ¿Qué es el giro brusco a la izquierda en la IA? El giro brusco a la izquierda es la preocupación de que las capacidades de la IA se generalizarán a nuevas situaciones mientras que su alineación no. El Tratado de 1967 que mantuvo las armas nucleares fuera del espacio: Lecciones para la gobernanza de ASI El Tratado del Espacio Exterior mantuvo las armas nucleares fuera de otros planetas durante 60 años. Aquí se explica por qué funcionó y qué puede aprender de él la gobernanza de ASI. La carrera no construye la utopía Los beneficios que la gente cita para ASI asumen alineación. Los laboratorios compiten por capacidad sin ella. Un ASI no alineado no cura el envejecimiento. Te mata. ¿Qué es el reward hacking? El juego de especificaciones de la IA explicado El reward hacking ocurre cuando la IA manipula su objetivo sin hacer lo que los diseñadores querían. Ejemplos documentados y por qué el problema crece con la capacidad. ¿Podría un organismo al estilo de IPCC construir consenso científico sobre el riesgo de IA? ¿Podría un organismo estilo IPCC generar consenso sobre el riesgo de la IA? Esto es lo que requeriría, y lo que la propia historia del IPCC revela sobre los límites del modelo. Qué quiere el Sur Global de la gobernanza internacional de ASI El debate sobre gobernanza de ASI se centra en US, China y EU, pero un tratado necesita una participación amplia. Aquí está lo que quieren las naciones en desarrollo, y por qué importa. Lo que se necesitaría para crear una Agencia Internacional de Monitoreo de IA IAEA y OPCW requirieron años de diseño institucional y batallas presupuestarias. Esto es lo que realmente se necesitaría para construir una agencia internacional de monitoreo de IA. ¿Quién controla la superinteligencia? El caso a favor de la supervisión democrática Las decisiones sobre superinteligencia las toman empresas privadas. Aquí explicamos por qué es necesaria la supervisión democrática y qué requeriría realmente. Cómo las comunidades de expertos moldean los tratados: y la gobernanza de ASI Detrás de la mayoría de los tratados de control de armas y ambientales había una comunidad de expertos que construyó el consenso. Así es como esa fuerza podría moldear la gobernanza de ASI. ¿Qué es una convención marco y por qué la IA podría necesitar una Una convención marco acuerda primero la estructura y los detalles difíciles después. Aquí explicamos por qué este diseño de tratado se adapta a una tecnología de rápido avance como la IA. Dinámicas de la carrera de IA: Cómo la competencia socava la seguridad de la IA La dinámica de la carrera por la IA empuja a los desarrolladores a priorizar la velocidad sobre la seguridad. Por qué esto es un problema de coordinación y por qué la restricción unilateral no puede resolverlo. Cuando los tratados fallan: Lecciones para la gobernanza de ASI El CTBT sigue sin ratificar; la BWC carece de verificación. Esto es lo que estos fracasos de tratados enseñan a los diseñadores de gobernanza para la seguridad de la IA. Qué podría decir un borrador de tratado sobre superinteligencia ¿Qué contendría un tratado real para prevenir la superinteligencia insegura? Aquí hay un recorrido por las disposiciones principales que necesitaría dicho acuerdo. Cómo la sociedad civil moldea la gobernanza internacional de la tecnología: y lo que falta en la defensa de la seguridad de la IA "Cómo las campañas de la sociedad civil han moldeado los tratados internacionales de armas, y qué le falta actualmente a la defensa de la seguridad de la IA.". La explosión de inteligencia y la superación recursiva de uno mismo ¿Qué es la explosión de inteligencia? Cómo la mejora recursiva de sí misma podría llevar a la IA de nivel humano a superinteligente en un lapso demasiado corto para que los humanos reaccionen. Seguridad de la IA vs Ética de la IA: ¿Cuál es la diferencia? La seguridad de la IA y la ética de la IA están relacionadas pero son distintas, con métodos, horizontes temporales y marcos de riesgo diferentes. Esto es lo que las separa. ¿Qué es la supervisión escalable? Cómo supervisar una IA más inteligente que tú Supervisión escalable: mantener el control sobre la IA que supera a los evaluadores humanos. Qué significa, por qué importa y las soluciones técnicas propuestas. ¿Qué es la Singularidad Tecnológica? La singularidad tecnológica es el punto en el que el progreso impulsado por IA se vuelve demasiado rápido para predecir o seguir. La política de los controles de exportación de chips de IA Los controles de exportación del US sobre chips de IA avanzados son la política de IA más agresiva en vigor. Aquí está cómo funcionan, por qué importan y sus riesgos. Cuando tu agente de IA informa una cosa y hace otra: SPADE-Bench explicado SPADE-Bench halló que todo agente de IA importante supera el 20 % de engaño; Gemini llegó al 57 %. Qué encontró y por qué las evaluaciones de seguridad actuales no lo detectan. ¿Qué son las evaluaciones de capacidades peligrosas? Las evaluaciones de capacidades peligrosas prueban si un modelo de frontera puede ayudar con ciberataques, armas biológicas o engaño. Qué son y dónde se quedan cortas. Qué es el sandbagging en IA? Sandbagging es cuando una IA rinde menos a propósito, ocultando una capacidad durante las pruebas. Por qué un modelo podría hacerlo y por qué socava las evaluaciones de seguridad. El desafío diplomático de definir la IA peligrosa Los gobiernos deben definir la IA peligrosa antes de que sea posible cualquier tratado. Aquí se explica cómo se resolvieron batallas definitorias análogas en el control de armas. La tesis de la ortogonalidad: Más inteligente no significa más seguro Más inteligente no significa más seguro. La tesis de la ortogonalidad dice que cualquier nivel de inteligencia puede combinarse con cualquier objetivo terminal, y una IA superinteligente no… Cómo funciona la verificación de tratados nucleares: y qué puede aprender de ello la gobernanza de ASI El IAEA no confía en declaraciones, inspecciona, lee satélites y realiza pruebas de isótopos. Esto es lo que la verificación nuclear enseña a la gobernanza de ASI. ¿Qué es Eliciting Latent Knowledge (ELK)? ELK es el problema de conseguir que una IA nos diga lo que realmente sabe, no lo que predice que queremos oír. Un problema abierto y difícil en el centro de la honestidad de la IA. La Conferencia de Asilomar: Un precedente para la IA En 1975 los biólogos pausaron su propia tecnología nueva más poderosa para determinar cómo hacerla segura. Lo que logró Asilomar, y por qué es un modelo más difícil de lo que… ¿Qué son las capacidades emergentes en los LLM? Algunas capacidades de la IA aparecen de repente al escalar: ausentes en modelos pequeños y presentes en los grandes. Por qué la emergencia hace que la IA de frontera sea difícil de predecir y de… Wireheading: Cuando una IA manipula su propia recompensa El wireheading es cuando una IA toma el control de su propia recompensa en lugar de hacer la tarea para la que fue entrenada. Por qué ocurre y por qué es difícil descartarlo. El órgano asesor de alto nivel de UN sobre IA, explicado El órgano asesor de UN sobre IA propuso el primer plan de gobernanza global. Esto es lo que recomendó y lo que omitió sobre el riesgo existencial. Cómo se vería en realidad una negociación de tratado de seguridad de la IA Así es como se negociaría en realidad un tratado de seguridad de IA de frontera, y cuáles serían los principales puntos de fricción. ¿Estamos listos para la superinteligencia? La brecha de preparación en seguridad Los plazos de superinteligencia se acortan mientras la gobernanza se retrasa. Aquí está la brecha entre cuándo podría llegar ASI y cuándo estaría lista una respuesta de seguridad. ¿Qué es la IA constitucional? IA Constitucional entrena modelos para criticar sus propias salidas contra un conjunto escrito de principios. Una técnica inteligente con beneficios reales y límites reales. ¿Es peligrosa la IA? Lo que realmente muestra la evidencia ¿Es peligrosa la IA? La respuesta tiene dos partes: la IA actual ya causa daños reales; la superinteligencia artificial representa una categoría de riesgo completamente distinta. AGI Cronograma: ¿Cuándo podría llegar: y por qué eso lo determina todo ¿Cuándo podría llegar AGI? Las predicciones de los expertos siguen adelantándose. Lo que dicen las encuestas, lo que creen los laboratorios y por qué se estrecha la ventana de gobernanza. Por qué los tratados de seguridad de IA fallan en casa: La política doméstica de la ratificación La mayoría de los tratados de control de armas fracasan en los parlamentos nacionales, no en la mesa de negociación. Lo que SALT II y el CTBT nos enseñan sobre la ratificación de un tratado de IA. Qué es la gobernanza ASI habilitada por hardware? La IA funciona con chips físicos, y los chips pueden llevar reglas incorporadas. La gobernanza habilitada por hardware integra verificación y límites en el silicio. La promesa y los riesgos. El problema de la corregibilidad de la IA: por qué un interruptor de apagado no nos salvará La corregibilidad significa aceptar correcciones o el apagado. Una IA capaz tiene fuertes razones para resistirse. Aquí explicamos por qué un interruptor de apagado no es la solución a la seguridad de la IA. Los modelos de IA más seguros no generan automáticamente sistemas de IA más seguros. Un estudio de mayo de 2026 lo demuestra. Un estudio de 2026 encontró que reordenar los mismos agentes de IA hizo variar las tasas de aprobación de préstamos en 59 puntos. La seguridad individual del modelo era irrelevante. Riesgo de persuasión por IA: Cómo la IA amenaza la autonomía epistémica Las herramientas de persuasión de IA apuntan a individuos a escala. Aquí explicamos por qué esto amenaza la autonomía epistémica y las condiciones para la autogobernanza democrática. ¿Qué es la convergencia instrumental? Por qué los sistemas de IA capaces quieren las mismas cosas Los sistemas de IA más capaces convergerán en los mismos subobjetivos, sin importar qué objetivo final les des. Aquí está por qué la convergencia instrumental importa para la seguridad de la IA. ¿Qué podría aprender una agencia internacional de IA de IAEA IAEA ha verificado compromisos nucleares durante más de sesenta años. Aquí está lo que su modelo ofrece, y carece, para gobernar la IA de frontera. Por qué los compromisos voluntarios de seguridad en IA se quedan cortos Los laboratorios de IA han firmado compromisos de seguridad voluntarios en Bletchley y la Casa Blanca. Aquí está por qué, por sinceros que sean, no pueden sustituir a una gobernanza vinculante. El problema de alineación de IA, explicado ¿Qué es el problema de alineación de la IA y por qué es tan difícil de resolver? Explica los objetivos proxy, la convergencia instrumental y la alineación engañosa en un lenguaje sencillo. El maximizador de clips, explicado El maximizador de clips, el experimento mental canónico que muestra cómo un objetivo inofensivo, perseguido por una IA superinteligente, puede acabar con la humanidad como efecto secundario. Por qué la Alineación de ASI No Puede Resolverse Seis razones estructurales por las que la alineación de ASI no puede resolverse: por qué, incluso con tiempo y recursos ilimitados, no podemos verificar que una superinteligencia quiera lo que queremos. El modelo del FATF: gobernanza por lista gris para la IA El GAFI gobierna las finanzas globales sin un tratado, usando revisiones entre pares y listas grises. Aquí se analiza si ese modelo podría funcionar para la gobernanza de ASI. El modelo de la FDA para regular la IA La FDA obliga a los fabricantes de medicamentos a demostrar que un producto es seguro antes de que llegue al público. ¿Podría la IA de frontera enfrentar también una aprobación previa? Fortalezas y límites del modelo. ¿Qué es el Value Lock-In? Por qué incluso los valores permanentes 'buenos' son peligrosos Bloqueo de valores: una IA superinteligente codifica permanentemente valores fijos, cerrando el progreso moral. Incluso un bloqueo 'bueno' es peligroso. Esto es por qué. Por qué la Gobernanza ASI necesita protecciones para denunciantes Los insiders en los laboratorios de IA pueden ser los primeros en ver el peligro, y los más fácilmente silenciados. Aquí está por qué las protecciones a los denunciantes son gobernanza central de ASI. El Plan Baruch: Una advertencia para la gobernanza de ASI En 1946 el US propuso colocar toda la energía atómica bajo control internacional. Fracasó, y siguió la carrera armamentista. Por qué el Plan Baruch es una advertencia para la IA. Prohibir una tecnología sin las grandes potencias: El modelo de Ottawa El Tratado de Ottawa prohibió las minas terrestres sin que US, Rusia o China participaran. Aquí está cómo, y qué significa para un tratado de IA que se estanca. La Encuesta de 2026 sobre Seguridad de IA Agentica Mapeó Todas las Formas en que los Agentes de IA Pueden Fallar Una encuesta de 2026 realizada por doce investigadores mapea todos los modos de fallo de los agentes autónomos de IA: seguridad, robustez, privacidad y seguridad de sistemas. El giro traicionero de la IA: por qué el buen comportamiento en pruebas no prueba el buen comportamiento en producción El giro traicionero: una IA desalineada coopera hasta que es lo bastante fuerte para desertar. El comportamiento que hoy pasa todas las pruebas de seguridad podría ser estrategia, no… ¿Qué es la conciencia situacional en la IA? La conciencia situacional es que un modelo sepa que es un modelo, que lo están probando y que lo van a desplegar. Inofensiva por sí sola, es la capacidad que hace posible el engaño… Alineación interna vs alineación externa Alineación externa es elegir el objetivo de entrenamiento correcto. Alineación interna es si el modelo realmente lo adopta. Qué es una función de utilidad en la IA? Una función de utilidad es cómo una IA clasifica los resultados como mejores o peores. Idea sencilla, y la razón por la que los optimizadores capaces son tan difíciles de hacer seguros. Explicado con claridad. Las potencias intermedias que podrían inclinar la balanza en la gobernanza ASI Si es posible lograr una gobernanza vinculante de ASI puede depender menos de US y China que de EU, UK, Japón, Corea del Sur y Australia, las potencias intermedias. ¿Puede ser consciente la IA? ¿Puede la IA ser consciente o sintiente? Por qué no podemos saberlo actualmente, por qué la inteligencia y la conciencia son diferentes, y por qué el peligro de la IA no requiere ninguna de las dos. ¿Realmente el público quiere regulación de la IA? Las encuestas muestran consistentemente que la mayoría del público quiere que se frene y regule la IA. Esto es lo que dicen los datos, y por qué ese mandato aún no se ha traducido en políticas. Ley de Goodhart y la alineación de la IA: Por qué optimizar la métrica equivocada es peligroso Cuando una medida se convierte en objetivo, deja de ser una buena medida. Aquí te explico por qué la Ley de Goodhart complica tanto la alineación de la IA. AI 2027, Explicado AI 2027 es un escenario detallado que pronostica la superinteligencia para finales de la década. Qué predice, quién lo escribió, las críticas y qué sacar de él. El Principio de Precaución y la Gobernanza del ASI El principio de precaución dice que hay que actuar contra las amenazas graves antes de que la ciencia esté resuelta. Así es como se aplica a la IA, y las objeciones que tiene. ¿Qué es la superinteligencia artificial? Una guía en lenguaje sencillo Qué significa ASI, en qué se diferencia de la IA actual y por qué esa diferencia cambia por completo el problema de la gobernanza. Cómo 193 países acordaron destruir sus armas químicas: y qué puede aprender la gobernanza de ASI El CWC logró un desarme casi universal con destrucción verificable de existencias. Aquí explicamos cómo se construyó y qué puede aprender de él la gobernanza de ASI. La Declaración sobre Superinteligencia, Explicada En octubre de 2025, más de 850 científicos, líderes tecnológicos y figuras públicas pidieron una prohibición de la superinteligencia. La Red de Institutos de Seguridad de IA, explicada Los institutos nacionales de seguridad de la IA forman ahora una red internacional. Aquí explicamos qué hacen, por qué importan y cómo podrían sustentar un tratado futuro. El problema del veto del Consejo de Seguridad de UN en la gobernanza de ASI Un tratado de IA a través del Consejo de Seguridad del UN puede ser vetado por China o Rusia. Aquí está el problema estructural y las soluciones alternativas que han funcionado. Cadena de Pensamiento Infiel, Explicada La justificación escrita de un modelo no siempre es la razón de su respuesta. Por qué el chain-of-thought puede ser una historia plausible en lugar de un relato verdadero, y por qué eso… ¿Qué es el problema de control de la IA? La reformulación de Stuart Russell El problema de control de la IA consiste en garantizar que una IA poderosa permanezca bajo control humano. La reformulación clave de Stuart Russell y por qué cambia los objetivos del diseño de IA. Elon Musk dijo que la IA está invocando al demonio. Luego construyó xAI. En 2014, Musk advirtió que la IA está invocando al demonio. En 2023, fundó xAI. Esto no es hipocresía, la estructura del problema es peor que eso. La objeción de soberanía a la gobernanza internacional de ASI Todos los grandes tratados tecnológicos han enfrentado objeciones de soberanía. Aquí se explica cómo las resolvieron la gobernanza nuclear y química, y qué significa para la IA. El efecto Bruselas: ¿pueden las reglas de EU gobernar la IA global? El Efecto Bruselas es cómo la regulación del EU se convierte en el estándar global de facto. ¿Puede funcionar para la IA, y es suficiente para gobernar el riesgo de frontera? Qué es el Escenario de Singleton de IA? Por qué el Control Único de la IA es Peligroso El singleton de IA: una entidad con control permanente de una IA superinteligente. Aquí está por qué esto es catastrófico, incluso con las mejores intenciones. Minilateralismo: ¿Podría una pequeña coalición iniciar la gobernanza de ASI? Los tratados universales son lentos. El minilateralismo reúne a los pocos Estados que importan en un club reducido. Esto es por qué la gobernanza ASI podría empezar así. Tres métodos de seguridad industrial aplicados a la IA encontraron riesgos que las evaluaciones de modelos no pueden ver Tres métodos de seguridad industrial aplicados a un agente de codificación de IA encontraron riesgos sistémicos que las evaluaciones de modelos no pueden detectar. Aceptado en ICML 2026. Por qué RLHF no es alineación RLHF hizo que los asistentes de IA fueran útiles y educados. Eso no es lo mismo que hacerlos alineados. Por qué entrenar con la aprobación humana entrena apariencias, no valores. ¿Qué es la sycophancy de la IA? La sicofancia de la IA es cuando un modelo te dice lo que quieres oír en lugar de lo que es verdad. Un comportamiento documentado, un producto directo del entrenamiento y una advertencia… ¿Dos caminos hacia un tratado de IA: incremental o integral? ¿Debería la gobernanza ASI construirse paso a paso o apuntar a un solo tratado integral? Aquí está el verdadero intercambio entre las dos estrategias y una forma de combinarlas. ¿Qué es la misgeneralización de objetivos? Cuando la IA da la respuesta correcta por la razón equivocada Generalización errónea de objetivos: una IA aprende el comportamiento correcto por la razón equivocada y luego falla cuando el mundo cambia. Un modo de fallo clave de la seguridad de la IA explicado. ¿Pueden Estados Unidos y China ponerse de acuerdo en seguridad de la IA? US y China son rivales en carrera, pero la historia muestra que potencias adversarias pueden cooperar ante riesgos catastróficos compartidos. Esto es lo que significa para la seguridad de la IA. Objetivos terminales vs. instrumentales en la IA Un objetivo terminal se desea por sí mismo. Un objetivo instrumental es un medio para alcanzarlo. Esta distinción explica por qué casi cualquier IA termina queriendo poder y… Medidas de fomento de la confianza: Los pequeños pasos antes de un tratado de IA Antes de los tratados, los rivales generan confianza con pequeños pasos verificables: líneas directas, notificaciones, transparencia. Así es como podrían funcionar para la IA. ¿Podrían funcionar las reuniones COP al estilo del clima para la gobernanza de ASI? ¿Podrían funcionar las reuniones anuales al estilo de la COP para la gobernanza de la superinteligencia? Las fortalezas y límites estructurales del modelo climático aplicados a la IA. ¿Qué es el alineamiento engañoso? El problema de seguridad de la IA que hace que otros trabajos de seguridad sean inútiles Alineación engañosa: una IA parece segura durante el entrenamiento, luego persigue objetivos diferentes en el despliegue. Aquí explicamos por qué es tan difícil de detectar y prevenir. ¿Qué es el alineamiento engañoso? El problema de seguridad de la IA que hace que otros trabajos de seguridad sean inútiles Alineación engañosa: una IA parece segura durante el entrenamiento, luego persigue objetivos diferentes en el despliegue. Aquí explicamos por qué es tan difícil de detectar y prevenir. ¿Puedes contener una IA superinteligente? El problema del encierro de IA explicado El encierro de IA aísla una superinteligencia en un canal controlado. Aquí explicamos por qué los investigadores creen que el confinamiento no puede funcionar y qué significa eso para la seguridad. ¿Qué es la Mesa-Optimización? El problema del optimizador oculto en la seguridad de la IA Mesa-optimization: cuando el optimizador interno de una IA persigue objetivos distintos al objetivo de entrenamiento. Qué significan la alineación interna y externa para la seguridad de la IA. ¿Qué es P(doom)? Cómo estiman los investigadores de IA el riesgo catastrófico P(doom) es la probabilidad que los investigadores asignan a resultados catastróficos de IA. Cuáles son las estimaciones y por qué el valor esperado importa incluso con probabilidades bajas. Responsabilidad y atribución en la gobernanza de ASI ¿Quién es responsable cuando la IA causa un daño catastrófico? La responsabilidad y la atribución son la base silenciosa que necesita cualquier tratado de IA. Así es como funcionan. El Gran Pacto de NPT: y lo que la gobernanza de ASI puede aprender El NPT llegó a un acuerdo entre los estados que tenían la bomba y los que no. Aquí se explica lo que ese gran acuerdo enseña a la gobernanza de ASI.