Jason Wei et ses coauteurs chez Google et ailleurs ont catalogué des tâches où les performances restaient proches du hasard jusqu’à ce que l’échelle du modèle franchisse un seuil, puis ont augmenté brusquement. L’arithmétique multi-étapes, les questions de domaines spécialisés, les instructions dans des langues à peine présentes dans l’entraînement, les chaînes d’étapes de raisonnement : aucune de ces tâches n’avait été conçue comme une fonctionnalité. Elles sont apparues à mesure que les modèles grandissaient. L’article les a appelées capacités émergentes.
Une capacité émergente, dans cet usage, est une compétence qu'un modèle plus petit n'a pas et qu'un plus grand possède, où la transition ressemble moins à une rampe régulière qu'à un interrupteur. En dessous d'une certaine échelle, le modèle ne peut pas accomplir la tâche. Au-delà, il le peut. La capacité n'était pas lisible à partir de la tendance des systèmes plus petits seuls.
Un vrai débat qui mérite d'être signalé
L'émergence n'est pas une science établie. Certains chercheurs soutiennent qu'une part des sauts signalés est en partie un artefact de mesure : une métrique stricte tout-ou-rien fait paraître soudain un progrès sous-jacent régulier, tandis qu'une métrique plus lisse montre une amélioration progressive. Cette critique porte sur des cas spécifiques et mérite une audition équitable.
Cela ne résout pas le problème pratique. Qu'une capacité arrive sous la forme d'une véritable discontinuité ou d'une courbe abrupte remarquée seulement après avoir franchi un seuil, la situation de gouvernance reste la même. Nous apprenons qu'un modèle peut faire quelque chose de nouveau après qu'il en soit capable, et non avant. Pour un décideur politique qui doit déterminer si le prochain entraînement est sûr à autoriser, la distinction entre une émergence authentique et une courbe abrupte est académique. Dans les deux cas, la surprise se trouve de l'autre côté de la décision.
Pourquoi l'imprévisibilité est le problème central
Nous ne pouvons pas prédire de façon fiable, avant d’entraîner un modèle plus grand, la liste complète de ce qu’il sera capable de faire. Les lois d’échelle prévoient raisonnablement bien des mesures de performance globales comme la perte. Elles ne nomment pas les capacités spécifiques qui apparaîtront, ni quand. La capacité est plus prévisible en agrégat qu’en détail.
Pour la plupart des capacités, c'est simplement intéressant. Pour celles qui touchent à la sécurité, c'est alarmant. La même imprévisibilité qui produit un talent surprenant pour la traduction peut produire un talent surprenant pour les tâches abordées dans évaluations des capacités dangereuses: assistance cyber, aide aux armes biologiques, manipulation à grande échelle. Une capacité que personne n'a anticipée est une capacité pour laquelle personne n'a testé et contre laquelle personne n'a construit de protections.
Nous pouvons prévoir à peu près les performances du prochain modèle sur les métriques moyennes. Nous ne pouvons pas prévoir tout ce qu’il sera capable de faire. C’est dans cet écart que réside le risque.
Ce que cela signifie pour notre mise à l'échelle
L'émergence transforme chaque grand saut d'échelle en un pas dans une obscurité partielle. Vous construisez un système dont vous ne découvrez le profil complet de capacités qu'après son existence. À ce moment-là, si une capacité dangereuse l'accompagnait, le système la possède déjà. C'est un risque différent d'un danger connu que l'on peut mesurer et atténuer à l'avance.
L'argument de la Fondation en découle directement. Le scaling à la frontière ne doit pas avancer plus vite que la capacité à comprendre ce qui est créé. La charge de la preuve doit porter sur la démonstration qu'un grand nouveau système est sûr avant qu'il ne soit entraîné et déployé, et non sur la découverte de ses dangers après coup. Quand les capacités peuvent arriver sans prévenir, la prudence avant le saut est la seule qui aide. Ce cadre figure dans notre plan. Les délais qui se raccourcissent et qui augmentent les enjeux sont abordés dans le AGI chronologie.