L'IA constitutionnelle est une méthode d'entraînement mise au point par Anthropic. L'idée est de réduire la dépendance du comportement du modèle à l'égard d'humains qui étiquettent manuellement les sorties nuisibles, et de faire plutôt évaluer ses propres réponses par le modèle selon un ensemble écrit de principes, appelé constitution.

En pratique, cela fonctionne en deux étapes. D'abord, le modèle génère une réponse, puis la critique par rapport à la constitution et la révise, en apprenant de ses propres corrections. Ensuite, le modèle compare des paires de réponses et juge laquelle satisfait mieux les principes, et ces jugements l'entraînent à peu près comme le font les classements humains dans RLHF. Parce que le retour provient du modèle appliquant la constitution plutôt que des humains, une partie de l’approche est parfois appelée apprentissage par renforcement à partir de retours d’IA.

Ce qu'il a raison

Il y a de réels avantages, et ils méritent d'être reconnus clairement.

  • Les principes sont explicites. Au lieu de valeurs implicites dans des milliers d'étiquettes humaines individuelles, il y a un document écrit que l'on peut lire, débattre et réviser. C'est plus transparent qu'un tas de notes.
  • Cela permet de mettre à l'échelle la génération de retours. L'étiquetage humain de contenus nuisibles est lent, coûteux et difficile pour les étiqueteurs. Laisser le modèle effectuer une plus grande partie de ce travail supprime un goulot d'étranglement.
  • Cela peut améliorer la cohérence. Une norme écrite appliquée uniformément évite une partie du bruit et de la dérive de nombreux évaluateurs humains différents à des jours différents.

Ce sont de véritables avancées en ingénierie, et l'IA constitutionnelle a produit des modèles à la fois plus utiles et moins sujets à des dommages évidents. La Fondation n'a aucun intérêt à rejeter un travail utile.

Ce qu'il ne résout pas

Les questions plus difficiles survivent intactes à la méthode, et il est important de comprendre pourquoi.

La technique optimise toujours un modèle pour satisfaire une norme énoncée telle qu’elle est jugée par un modèle. Elle sort l’humain de la boucle par réponse et ne change pas la forme sous-jacente du problème : le système est entraîné à produire des sorties qui obtiennent un bon score par rapport à une cible. Si la constitution est incomplète ou si ses principes entrent en conflit dans une situation que personne n’avait anticipée, le modèle optimise la lettre de ce qui est écrit, avec la même Goodhart pressions comme avant. Consigner les valeurs dans une constitution ne résout pas la difficulté de les spécifier ; cela la déplace dans le document.

Deux limites plus profondes restent intactes. La méthode façonne le comportement et ne donne aucune garantie sur les objectifs internes du modèle ; d’où l’écart entre sembler aligné et être aligné, le alignement interne problème, reste ouvert. Et il repose sur le jugement du modèle lui-même concernant ses propres sorties, ce qui n'est fiable que dans la mesure où le modèle est honnête et capable de juger, précisément ce que nous ne pouvons pas supposer pour un système approchant ou dépassant notre propre niveau.

L'IA constitutionnelle est une meilleure façon de guider le comportement. Guider le comportement n'a jamais été la partie de l'alignement que nous ne savions pas comment faire.

Garder le sens des proportions

L'IA constitutionnelle est un bon exemple d'un schéma que la Fondation surveille de près : un progrès réel et précieux en matière de sécurité qu'il est facile de surestimer. Des méthodes comme celle-ci rendent les modèles actuels plus contrôlables et plus transparents quant à leurs normes, et c'est une chose précieuse. Elles ne démontrent pas que nous pouvons aligner un système qui nous surpasse en réflexion, et elles ne comblent pas l'écart de vérification sur lequel repose tout notre argument. Les progrès en matière d'entraînement sont bienvenus. Ce n'est pas une raison pour continuer à augmenter les capacités en supposant que le reste suivra, ce qui est l'argument exposé dans notre plan.