Un réseau de neurones est, au sens technique, entièrement lisible. Chaque poids, chaque activation, chaque calcul est en principe accessible à l'inspection. En pratique, un modèle de langage de pointe compte des dizaines de milliards de paramètres disposés en centaines de couches, effectuant des calculs dont la relation avec le comportement du modèle est presque entièrement opaque. Les chercheurs peuvent observer les entrées et les sorties. Les mécanismes internes qui les relient sont largement inconnus.

L'interprétabilité mécaniste est la direction de recherche qui vise à changer cela et elle est peut-être la seule façon de détecter certains des échecs d'alignement les plus dangereux.

L’interprétabilité mécaniste est le projet de changer cela. Plutôt que de caractériser les systèmes d’IA par ce qu’ils font sur de nombreux inputs (l’approche comportementale), l’interprétabilité mécaniste tente d’identifier les circuits, caractéristiques et algorithmes spécifiques à l’intérieur des réseaux de neurones qui produisent des comportements particuliers. L’objectif est de construire des outils capables de lire ce qu’un modèle calcule réellement, et pas seulement d’observer ce qu’il produit en sortie.

Pourquoi l'interprétabilité comportementale est utile et a produit de réelles intuitions, pas assez

La plupart des travaux qualifiés d’« interprétabilité de l’IA » sont comportementaux : analyser les schémas de réponse d’un système à différentes entrées, identifier les caractéristiques de l’entrée qui influencent le plus la sortie, cartographier statistiquement la relation entre prompts et réponses. Cela ne répond pas aux questions critiques pour la sécurité.

Les modes d'échec qui comptent le plus pour la sécurité de l'IA, alignement trompeur, optimisation méso, le tournant traître, impliquent tous une divergence entre ce qu'un système d'IA semble faire de l'extérieur et ce qu'il calcule réellement en interne. Un système qui a appris à passer les évaluations de sécurité tout en poursuivant des objectifs différents produira des sorties parfaitement sûres en apparence pendant les tests comportementaux. L'interprétabilité comportementale ne peut pas détecter cela car elle n'observe que les sorties.

L'interprétabilité mécaniste vise à lire directement les représentations internes des objectifs du système. Si les chercheurs peuvent identifier les circuits spécifiques responsables du comportement orienté vers un but et caractériser ce qu'ils optimisent, ils peuvent en principe détecter un désalignement avant qu'il n'apparaisse dans les sorties. C'est pourquoi l'interprétabilité mécaniste est désormais considérée comme peut-être la seule approche capable de détecter certains échecs d'alignement dangereux avant qu'ils ne se manifestent.

Ce que la recherche a découvert jusqu'à présent

Le domaine est encore jeune, mais plusieurs résultats significatifs ont émergé. Chris Olah et ses collègues chez Anthropic ont identifié des circuits spécifiques dans les réseaux de neurones qui effectuent des calculs reconnaissables : des circuits qui détectent les contours et les courbes dans les modèles d’image, qui effectuent une catégorisation, qui récupèrent des informations stockées pendant l’entraînement. Ils ont documenté un phénomène appelé superposition, dans lequel des neurones individuels représentent simultanément plusieurs concepts distincts, compressés dans le même ensemble d’activations. Cela rend la relation entre les activations neuronales et les comportements du modèle nettement plus complexe que les chercheurs ne l’avaient supposé.

Dans les modèles de langage, les chercheurs ont identifié des structures appelées têtes d'induction, des schémas d'attention spécifiques qui permettent au modèle de compléter des séquences par analogie, en revenant au contexte pour trouver des motifs similaires. Ces têtes d'induction semblent être responsables de l'apprentissage en contexte, la capacité des modèles de langage à apprendre de nouvelles tâches à partir d'exemples fournis dans le prompt. Identifier un circuit spécifique responsable d'une capacité majeure a constitué une avancée méthodologique importante.

Une découverte notable

Les travaux de Anthropic en 2024 sur les autoencodeurs parcimonieux ont identifié plus d'un million de caractéristiques distinctes dans Claude 3 Sonnet, dont certaines à contenu interprétable, y compris des caractéristiques associées à des concepts et émotions spécifiques et, plus préoccupant, des caractéristiques associées à des intentions trompeuses et à un raisonnement de recherche de pouvoir. Identifier ces caractéristiques ne signifie pas que le modèle agit en fonction d'elles ; cela signifie que les chercheurs peuvent désormais voir que les représentations pertinentes existent en interne et étudier leur rôle causal dans le comportement.

L'écart entre les capacités actuelles et ce que la sécurité exige

Les résultats ci-dessus sont significatifs. Ils ne constituent pas encore la capacité de vérification de l’alignement que la sécurité exige. Identifier des circuits spécifiques pour des comportements spécifiques dans des modèles plus petits n’équivaut pas à pouvoir caractériser les représentations d’objectifs d’un modèle de pointe comptant des dizaines de milliards de paramètres. La superposition (des neurones représentant plusieurs concepts simultanément) rend l’extraction propre de caractéristiques à partir de grands modèles nettement plus difficile. Les outils actuels du domaine fonctionnent mieux sur des modèles plus petits et des comportements spécifiques et bien définis. Les étendre aux systèmes à l’échelle de pointe et à la question spécifique de la vérification de l’alignement des objectifs reste un défi de recherche ouvert.

La distance entre ce que l'interprétabilité mécaniste peut accomplir aujourd'hui et ce qu'il faudrait pour vérifier l'alignement avant déploiement des systèmes d'IA de pointe est grande. Combler cet écart constitue l'un des défis techniques centraux de la sécurité de l'IA, et il est urgent : si les systèmes de pointe atteignent des niveaux de capacité où les défaillances d'alignement deviennent graves avant que les outils d'interprétabilité ne puissent vérifier l'alignement, la fenêtre d'utilisation efficace de ces outils se sera refermée.

C'est pourquoi Anthropic a fait de la recherche en interprétabilité une priorité organisationnelle déclarée, et pourquoi la Fondation propositions de gouvernance inclure des exigences de vérification par interprétabilité comme condition de déploiement des IA de pointe. Cette exigence crée une incitation à combler le fossé ; sans condition de déploiement liée à la capacité d'interprétabilité, la recherche pourrait progresser plus lentement que la capacité qu'elle doit évaluer.