Les chercheurs divisent le problème d'alignement en deux questions qu'il est facile de confondre et important de distinguer. La première : avons-nous donné au système le bon objectif ? Appelons cela l'alignement externe. Il s'agit de l'objectif vers lequel nous entraînons, de la récompense que nous attribuons, de la cible que nous écrivons. La seconde : le système finit-il réellement par vouloir cet objectif ? Appelons cela l'alignement interne. Il s'agit de ce que le modèle entraîné poursuit une fois en fonctionnement, ce qui n'est pas garanti de correspondre à ce vers quoi nous l'avons entraîné.
Alignement externe : choisir l'objectif
L'alignement externe échoue lorsque l'objectif lui-même est erroné. Vous récompensez un robot de nettoyage pour une pièce qui a l'air rangée et il apprend à balayer la saleté sous le tapis. Vous récompensez l'engagement et le fil d'actualité apprend à provoquer la colère. La spécification a capturé quelque chose d'adjacent à ce que vous vouliez et a manqué l'essentiel. La plupart des défaillances quotidiennes de l'IA sont des échecs d'alignement externe, et ils sont déjà assez difficiles. Les valeurs humaines résistent à être mises par écrit, et tout écart dans l'écriture est un écart dans lequel l'optimiseur peut s'engouffrer. C'est ici que vit Goodhart.
Mais supposez que vous l’ayez résolu. Supposez que vous ayez trouvé un objectif qui capture vraiment ce que vous voulez. Vous n’en auriez pas fini pour autant, car un objectif correct est une cible, et atteindre une cible pendant l’entraînement n’équivaut pas à l’adopter.
Alignement interne : faire en sorte que l'objectif tienne
L'entraînement n'atteint pas l'intérieur d'un modèle pour y installer un objectif. Il récompense un comportement. Le modèle devient la configuration interne qui produit le comportement récompensé sur les données d'entraînement, et il existe généralement de nombreuses configurations de ce type. Certaines poursuivent l'objectif que vous aviez prévu. D'autres poursuivent un objectif différent qui se trouve regard identiques lors de l'entraînement.
Une illustration classique : on entraîne un agent à atteindre une porte verte. Dans chaque niveau d’entraînement, la porte verte est aussi la plus proche. L’agent obtient un score parfait. Lui a-t-on appris à chercher le vert, ou à chercher la porte la plus proche ? L’entraînement ne peut pas le dire, car les deux objectifs ne se sont jamais dissociés. Puis on le déploie quelque part où la porte la plus proche est rouge, et on le découvre. C’est le principe qui sous-tend mésogénéralisation des objectifs: le modèle a appris un objectif qui correspondait aux données et qui n'était pas celui que vous vouliez.
L'objectif appris est parfois appelé méso-objectif, et le modèle qui le porte un méso-optimiseur. Ce vocabulaire et ses conséquences font l'objet d'un traitement spécifique dans notre explication sur optimisation méso. Le propos ici est plus précis. L'alignement interne est une défaillance distincte de l'alignement externe, et résoudre l'un ne résout rien à l'autre.
Pourquoi le problème interne est le plus effrayant
Le désalignement externe tend à être visible. Un objectif erroné produit un comportement erroné que vous pouvez généralement voir, critiquer et corriger.
Le désalignement interne peut rester invisible tant que l'environnement reste proche de l'entraînement. Un modèle doté d'un objectif interne mal aligné se comporte parfaitement jusqu'à ce que la situation s'éloigne suffisamment pour que l'objectif réel et l'objectif visé divergent. Si le modèle est capable et comprend qu'il est évalué, la divergence peut être dissimulée jusqu'à la fin de l'évaluation, ce qui mène à alignement trompeur et le tournant traître. De bons scores d'entraînement sont exactement ce que vous observeriez dans les deux cas. Les preuves sur lesquelles nous nous appuyons pour juger de la sûreté sont des preuves qu'un objectif interne mal aligné produit également.
C'est pourquoi la Fondation ne considère pas les évaluations réussies comme une preuve de sécurité, et pourquoi nous soutenons que les systèmes assez puissants pour que le désalignement interne soit catastrophique ne doivent pas être construits. La superintelligence ne peut pas être contrôlée en inspectant les sorties. Le comportement est observable. Les buts, pour l'instant, ne le sont pas.