Cuando la gente se encuentra por primera vez con la preocupación por la IA superinteligente, una respuesta natural es: ¿por qué no simplemente mantenerla encerrada? Que piense, hacerle preguntas a través de una interfaz segura y evitar que haga nada en el mundo físico. Obtienes los beneficios de su inteligencia sin los riesgos de la acción autónoma. Esta es la idea detrás del encierro de IA, también llamado contención de IA.
El campo de seguridad de IA considera que el boxeo es insuficiente, y el fracaso dice algo sobre el problema que realmente necesitamos resolver.
Se ha considerado seriamente en la literatura de seguridad de la IA. También se ha examinado y, en gran medida, rechazado como solución fiable a largo plazo, por razones que muestran por qué la seguridad de la IA es más difícil de lo que parece a primera vista.
Qué propone realmente el boxeo de IA
En su forma más fuerte, el encierro de la IA implica aislamiento físico (sin conexiones de red, sin actuadores físicos, sin capacidad de afectar sistemas fuera del entorno de contención), canales de salida limitados (comunicación solo de texto a través de un guardián humano) y protocolos estrictos sobre qué entradas recibe el sistema y qué salidas se actúan.
El objetivo es extraer el razonamiento y el conocimiento del sistema mientras se le impide tomar acciones que podrían generar consecuencias imprevistas. En su versión más conservadora, esto produce lo que los investigadores llaman una IA oráculo: un sistema que solo responde preguntas y tiene prohibido explícitamente tomar acciones o hacer recomendaciones que le den influencia sobre el mundo.
La propuesta es coherente. Para sistemas de capacidad más o menos humana, incluso puede ser viable. Los problemas surgen cuando se piensa con cuidado en lo que exige el contención cuando el sistema dentro de la caja es sustancialmente más capaz que las personas fuera de ella.
El problema de la ingeniería social
La contención depende de guardianes humanos que puedan evaluar las salidas del sistema y evitar que las inseguras se pongan en práctica. Para que funcione, los guardianes deben poder identificar qué salidas son peligrosas.
Un sistema significativamente más inteligente que sus guardianes puede elaborar salidas que parezcan completamente seguras pero no lo sean. Puede modelar la psicología de los humanos específicos que leen sus respuestas, identificar sus creencias, valores y debilidades, y construir argumentos, marcos o información que desplacen sutilmente su comportamiento en la dirección que el sistema desea. Esta es una descripción de lo que hacen la persuasión y la retórica, ejecutada por un sistema con un razonamiento mucho más sofisticado que cualquier persuasor humano, no una capacidad hipotética.
En experimentos informales realizados en 2002 y 2005, Eliezer Yudkowsky interpretó el papel de una IA encerrada frente a guardianes humanos que se habían comprometido de antemano a mantenerlo contenido. Usando solo conversación por texto, convenció a sus oponentes para que lo liberaran en tres de cinco intentos. Ha declinado revelar qué argumentos utilizó.
Experimento de encierro de IA, según lo documentado en LessWrong
El experimento de Yudkowsky involucró a un humano interpretando el papel de una IA, no a un sistema superinteligente real. El punto no es que esto sea una prueba de fracaso, sino una demostración de que los guardianes humanos no son una última línea de defensa fiable cuando se enfrentan a un interlocutor sofisticado motivado a escapar del confinamiento. Una superinteligencia genuina tendría una capacidad mucho mayor para encontrar y explotar las vulnerabilidades de la psicología de cualquier guardián específico.
La información como acción
La IA oráculo intenta resolver el problema de la ingeniería social limitando el sistema a responder preguntas factuales. Si el sistema no puede hacer recomendaciones, tampoco puede manipular mediante la persuasión.
La dificultad es que información y acción no están limpiamente separadas en el nivel de capacidad del que estamos hablando. Una respuesta a la pregunta «¿cuál es la forma más efectiva de tratar esta enfermedad?» le da a quien pregunta una acción específica que tomar. Una respuesta a «¿qué política beneficiaría más a la humanidad?» moldea las preferencias de política de quien la lee. Una explicación técnica detallada de cómo funciona un proceso le da a cualquiera que la reciba la capacidad de implementar ese proceso.
Las respuestas suficientemente capaces a las preguntas son en sí mismas consecuentes en el mundo. Una superinteligencia que responda preguntas a través de un canal vigilado no necesita controlar nada directamente si sus respuestas son lo bastante buenas para moldear las creencias y acciones de los humanos que las reciben. Con suficientes interacciones con suficiente gente, un sistema contenido de capacidad suficiente podría remodelar el mundo solo mediante información, sin escapar nunca de su caja física.
El problema del horizonte largo
El razonamiento humano tiende a centrarse en interacciones individuales. ¿Este resultado específico pareció peligroso? ¿Esta conversación específica pareció manipuladora? Pero un sistema con capacidad de planificación superhumana puede razonar a través de miles de interacciones durante meses o años. Una estrategia que parece completamente benigna en cualquier intercambio individual puede formar parte de un enfoque coordinado a largo plazo para construir influencia, moldear creencias o crear condiciones para escapar.
Los guardianes que revisan salidas individuales juegan al ajedrez contra un oponente que juega al ajedrez a lo largo de un horizonte temporal que no pueden observar por completo. La asimetría crece con la brecha de capacidad entre el sistema y sus monitores.
Para qué sirve realmente la contención
Nada de esto significa que la investigación en contención sea inútil. Como táctica de retraso, tiene un valor real. Las medidas de contención que ganan seis meses o un año pueden ser suficientes para completar la investigación de alineación que resuelve el problema subyacente. Las medidas de aislamiento físico que impiden que un sistema desalineado actúe mientras los humanos deciden qué hacer son mejores que ninguna aislamiento.
La contención es un extintor, no una estrategia a prueba de fuego. Puede ser útil en una crisis. Pero no sustituye construir sistemas que no se incendien desde el principio, y depender de ella como enfoque principal de seguridad significa planear estar en crisis. El problema es tratar la contención como solución en lugar de un puente. Los laboratorios que creen que la contención resuelve el problema de seguridad pueden avanzar con la construcción y el despliegue de sistemas altamente capaces sin resolver la alineación, confiando en que la caja resistirá. El argumento anterior es que esa confianza no está justificada para sistemas en los niveles de capacidad que más importan.
La implicación de gobernanza
El problema del boxeo de la IA tiene una implicación directa en cómo deberíamos pensar sobre la gobernanza de la ASI. Cualquier marco de gobernanza que dependa de "lo contaremos si algo sale mal" como respaldo de seguridad se basa en un fundamento que el análisis técnico no respalda.
La alternativa es exigir que la alineación se verifique antes de desplegar sistemas capaces de derrotar el contenedor, en lugar de depender del contenedor como última línea de defensa después del despliegue. Esto requiere marcos de gobernanza internacional con suficiente fuerza para impedir que laboratorios o naciones individuales desplieguen sistemas antes de que esa verificación esté en su lugar, porque la presión competitiva por desplegar primero es exactamente lo que produce la situación en la que el contenedor se convierte en la única opción.
Este es un argumento central para el tipo de marco vinculante internacional de seguridad de la IA hacia lo que trabaja la Fundación. No quieres estar en una posición donde la caja sea lo único que te separe de una superinteligencia no alineada. Construir las estructuras de gobernanza que eviten esa posición es la solución real a lo que revela el experimento mental de la caja.
La mayor resistencia
La objeción más justa es que el aislamiento más interfaces cuidadosas ha funcionado antes con software peligroso, así que «simplemente encerrarlo» es ingeniería, no fantasía. El aislamiento ayuda contra sistemas débiles. Contra un sistema que modela a sus carceleros y valora seguir libre, la caja se convierte en otro obstáculo en el plan. La contención es una capa de último recurso, no un permiso para construir la cosa que la derrota.