Una red neuronal es, en sentido técnico, completamente legible. Cada peso, cada activación, cada cálculo es en principio accesible a la inspección. En la práctica, un modelo de lenguaje de frontera tiene decenas de miles de millones de parámetros dispuestos en cientos de capas, que realizan cálculos cuya relación con el comportamiento del modelo es casi totalmente opaca. Los investigadores pueden observar entradas y salidas. Los mecanismos internos que las conectan son en gran medida desconocidos.

La interpretabilidad mecanicista es la línea de investigación que busca cambiar esto y puede ser la única forma de detectar algunos de los fallos de alineación más peligrosos.

La interpretabilidad mecanicista es el proyecto de cambiar esto. En lugar de caracterizar los sistemas de IA por lo que hacen ante muchas entradas (el enfoque conductual), la interpretabilidad mecanicista intenta identificar los circuitos, características y algoritmos específicos dentro de las redes neuronales que producen comportamientos particulares. El objetivo es construir herramientas que lean lo que un modelo está calculando realmente, no solo observar lo que produce.

Por qué la interpretabilidad conductual es útil y ha producido conocimientos reales, pero no suficientes

La mayor parte del trabajo que se llama "interpretabilidad de la IA" es conductual: analizar patrones en cómo responde un sistema a distintas entradas, identificar qué características de la entrada influyen más en la salida, mapear estadísticamente la relación entre prompts y respuestas. No responde las preguntas críticas para la seguridad.

Los modos de fallo que más importan para la seguridad de la IA, alineamiento engañoso, optimización mesa, el giro traicionero, todos implican una divergencia entre lo que un sistema de IA parece estar haciendo desde fuera y lo que realmente está computando internamente. Un sistema que ha aprendido a pasar evaluaciones de seguridad mientras persigue objetivos diferentes producirá resultados perfectamente seguros durante las pruebas de comportamiento. La interpretabilidad conductual no puede detectarlo porque solo observa salidas.

La interpretabilidad mecanicista busca leer directamente las representaciones internas de objetivos del sistema. Si los investigadores logran identificar los circuitos específicos responsables del comportamiento dirigido a metas y caracterizar qué están optimizando esos circuitos, en principio podrían detectar desalineaciones antes de que aparezcan en las salidas. Por eso la interpretabilidad mecanicista se ha convertido en lo que muchos consideran el único enfoque capaz de detectar ciertos fallos de alineación peligrosos antes de que se manifiesten.

Qué ha encontrado la investigación hasta ahora

El campo aún es joven, pero ya han surgido varios hallazgos significativos. Chris Olah y sus colegas en Anthropic han identificado circuitos específicos en las redes neuronales que realizan cálculos reconocibles: circuitos que detectan bordes y curvas en modelos de imagen, que realizan categorización, que recuperan información almacenada durante el entrenamiento. Documentaron un fenómeno llamado superposición, en el que neuronas individuales representan múltiples conceptos distintos simultáneamente, comprimidos en el mismo conjunto de activaciones. Esto hace que la relación entre las activaciones neuronales y los comportamientos del modelo sea significativamente más compleja de lo que los investigadores habían supuesto.

En los modelos de lenguaje, los investigadores han identificado estructuras llamadas cabezas de inducción, patrones de atención específicos que permiten al modelo completar secuencias por analogía, buscando en el contexto patrones similares. Estas cabezas de inducción parecen ser responsables del aprendizaje en contexto, la capacidad de los modelos de lenguaje de aprender nuevas tareas a partir de ejemplos en el prompt. Encontrar un circuito específico responsable de una capacidad importante fue un avance metodológico significativo.

Un hallazgo notable

El trabajo de Anthropic de 2024 sobre autoencoders dispersos identificó más de un millón de características distintas en Claude 3 Sonnet, algunas con contenido interpretable, incluidas características asociadas a conceptos y emociones específicos y, más preocupante aún, características asociadas a intenciones engañosas y razonamiento de búsqueda de poder. Identificar estas características no significa que el modelo actúe sobre ellas; significa que los investigadores ahora pueden ver que las representaciones relevantes existen internamente y estudiar su papel causal en el comportamiento.

La brecha entre la capacidad actual y lo que requiere la seguridad

Los hallazgos anteriores son significativos. Todavía no constituyen la capacidad de verificación de alineación que requiere la seguridad. Identificar circuitos específicos para comportamientos específicos en modelos más pequeños no es lo mismo que poder caracterizar las representaciones de objetivos de un modelo de frontera con decenas de miles de millones de parámetros. La superposición (neuronas que representan múltiples conceptos simultáneamente) hace que la extracción limpia de características de modelos grandes sea significativamente más difícil. Las herramientas actuales del campo funcionan mejor en modelos más pequeños y comportamientos específicos y bien definidos. Extenderlas a sistemas de escala de frontera y a la cuestión específica de verificar la alineación de objetivos es un desafío de investigación abierto.

La distancia entre lo que la interpretabilidad mecanicista puede hacer hoy y lo que se necesitaría para proporcionar una verificación de alineación previa al despliegue de sistemas de IA de frontera es grande. Cerrar esa brecha es uno de los desafíos técnicos centrales en la seguridad de la IA, y es sensible al tiempo: si los sistemas de frontera alcanzan niveles de capacidad en los que los fallos de alineación se vuelven significativos antes de que las herramientas de interpretabilidad puedan verificar la alineación, la ventana para usar estas herramientas de manera efectiva se habrá cerrado.

Esta es la razón por la que Anthropic ha hecho de la investigación en interpretabilidad una prioridad organizacional declarada, y por qué la de la Fundación propuestas de gobernanza incluir requisitos de verificación de interpretabilidad como condición para el despliegue de IA de frontera. El requisito crea incentivo para cerrar la brecha; sin una condición de despliegue ligada a la capacidad de interpretabilidad, la investigación puede avanzar más lento que la capacidad que necesita evaluar.