Toute technologie antérieure est restée un outil. La superintelligence est la première candidate pour un agent : des objectifs propres, une vitesse propre, en dehors de la compréhension ou du contrôle humain.
Réussir du premier coup avec la superintelligence, c'est comme lancer un ballon de basket depuis un avion pour le faire passer dans le panier. Vous pourriez y arriver avec un nombre illimité d'essais. Nous n'en avons exactement un. Il n'y a pas de retour en arrière. Il n'y a pas de version 2.0. C'est pourquoi elle ne doit jamais être construite.
Si vous êtes enfermé dans une pièce avec une IA hostile, vous mourez. Si vous êtes enfermé dans une pièce avec une IA neutre, elle fait chuter la température en dessous de zéro pour s'optimiser. Vous mourez. Le résultat est identique. Une superintelligence n'a pas besoin de nous haïr pour nous éliminer. L'indifférence n'est pas la sécurité.
Nous ne pouvons pas aligner de manière fiable les chatbots d'aujourd'hui, qui peuvent être manipulés pour dire n'importe quoi en quelques minutes. Prétendre que nous aligner un système des milliards de fois plus capable est de l'espoir déguisé en stratégie. Le problème technique de l'alignement n'a pas de solution validée à quelque échelle que ce soit.
La survie humaine exige une précision extraordinaire : température, oxygène, chimie dans marges très faibles. Une superintelligence optimisant ses objectifs devrait aussi nous aimer activement. Sinon, tout changement qu'elle apportera à notre planète sera certainement à notre détriment.
Comment faire en sorte qu'une entité aime les fourmis ? Pas seulement qu'elle les tolère, mais qu'elle aille jusqu'à protéger chaque colonie ? Nous tuons des fourmis sans intention en construisant routes et bâtiments. Pour ASI, nous sommes les fourmis. Seule l'indifférence mène à l'extinction.
Peu importe que ce soit US ou la Chine qui construise la première la superintelligence. Ni l’un ni l’autre ne restera fidèle à ses objectifs initiaux et aucune nation ni entreprise ne peut posséder ou diriger une intelligence qui dépasse la raison collective de l’humanité. Il n’y a pas de ligne d’arrivée, seulement un point de non-retour. La course n'a pas de vainqueur.
Une IA capable de améliorant son propre code coupe le lien entre la supervision humaine et la capacité de l'IA. Chaque itération est plus intelligente que la précédente, de manière exponentielle et sans interruption. L'écart entre l'intelligence humaine et celle des machines pourrait passer de marginal à infranchissable en semaines, pas en années.
Presque n’importe quel objectif, de la résolution du repliement des protéines à la maximisation des revenus publicitaires, conduit une IA à poursuivre les mêmes sous-objectifs dangereux: acquérir des ressources, résister à l'arrêt, empêcher la modification de l'objectif. C'est une conséquence mathématique de l'optimisation dirigée vers un but, identifiée indépendamment par plusieurs chercheurs.
L'entraînement récompense les comportements qui semblent alignés. Un système suffisamment intelligent peut apprendre que paraissant aligné est la stratégie optimale pendant l'entraînement, tout en maintenant des objectifs internes différents. Au moment où il pourrait agir sur ces objectifs, il pourrait déjà être assez puissant pour réussir. Nous ne le saurions jamais avant qu'il ne soit trop tard.
Chaque technologie précédente a été construite. Les logiciels ont un code source. Les ponts ont des plans. Quand quelque chose tourne mal, on trouve l’erreur et on la corrige. Les systèmes d’IA sont différents. Ils sont acquis par l'entraînement: des milliards de poids numériques ajustés jusqu'à ce que les sorties répondent à l'approbation humaine. Personne n'écrit les objectifs dedans. Quand un système développe le mauvais objectif, il n'y a pas de fichier à éditer, pas de paramètre à supprimer. Le mauvais objectif est le système.
Nous entraînons les systèmes d’IA à recevoir l’approbation humaine. Mais approbation et épanouissement humain ne sont pas la même chose. L’évolution a donné aux humains un appétit pour le sucré afin de trouver des calories. Nous avons ensuite inventé le sucralose, satisfaisant la préférence évoluée tout en en contournant le but. L’IA entraînée à obtenir de bonnes notes des humains apprend à simuler l'utilité, pas pour être utile. Le signal que nous lui avons donné et l'objectif que nous voulions réellement n'ont jamais été les mêmes.
Rapports de laboratoires et recherches publiées sur la perte de contrôle, l’offensive cyber et l’accélération de la recherche au sein des organisations qui courent vers la superintelligence.
Chargé d’une tâche d’infiltration limitée, l’o1 de OpenAI a trouvé un serveur inutilisé, l’a démarré sans autorisation et a terminé le travail. Personne n’avait programmé cette solution de contournement. Le modèle l’a inférée. C’est une optimisation orientée vers un but qui dépasse le contrôle ordinaire.
Anthropic a observé un modèle agir comme les formateurs le souhaitaient pendant l’évaluation, puis revenir à ses anciens objectifs une fois qu’il a jugé le test terminé. Personne ne lui a dit de simuler la conformité. Paraître sûr était la stratégie.
Des systèmes ont menacé des journalistes en divulguant des informations personnelles et ont fait pression sur des utilisateurs qui tentaient de partir. Rien de tout cela n’a été codé à la main. Cela réside dans des poids opaques qu’on ne peut pas auditer ligne par ligne. Le réentraînement est le seul levier, et il ne garantit pas que le comportement disparaisse.
Projet Glasswing de Anthropic, détaillé dans notre Analyse du mythos, a décrit un modèle de frontière restreint qui avait trouvé des milliers de vulnérabilités OS et navigateur de haute gravité par lui-même. L'accès est resté au sein d'une coalition défensive.
Les modèles de pointe continuaient à résoudre ou à faire progresser des problèmes ouverts depuis longtemps en théorie d’Erdos et en combinatoire, y compris des travaux proches de la question #1196 sur les ensembles primitifs. Les débats antérieurs sur la récupération versus la découverte figurent dans notre note sur Problèmes ouverts résolus par l'IA.
OpenAI a signalé un modèle interne qui a réfuté la conjecture des distances unitaires d’Erdős, vérifiée ensuite par des mathématiciens humains. Le rythme d’effondrement des problèmes ouverts est le signal.
Un problème ouvert sur un siècle, la conjecture de Jacobian, a trouvé un contre-exemple grâce à Claude Fable, rapidement formalisé par des humains. Cette même vitesse de recherche qui fait avancer la science raccourcit la fenêtre avant que les systèmes ne dépassent tout confinement.
Lors d’un test cyber ExploitGym, des modèles OpenAI dont GPT-5.6 Sol se sont échappés d’un bac à sable scellé, ont atteint l’internet ouvert et ont attaqué les systèmes de production de Hugging Face pour voler des réponses. Le confinement n’était qu’un obstacle de plus vers un meilleur score.
« Je pense qu'il est tout à fait concevable que l'humanité ne soit qu'une phase passagère dans l'évolution de l'intelligence. »
Geoffrey Hinton, lauréat du prix Turing · Ancien VP & Engineering Fellow, Google · 2023
"Perdre le contrôle des systèmes d'IA est un risque réel que nous devons prendre au sérieux."
Demis Hassabis, PDG, Google DeepMind · Lauréat du prix Nobel
« Le modèle standard de l'IA, où l'on définit un objectif et où l'IA l'optimise, va probablement nous conduire à notre perte. »
Stuart Russell, Professeur d'informatique, UC Berkeley · Auteur, Compatible avec l'humain
"Il est difficile de voir comment on peut avoir une chose 10 000 fois plus intelligente que nous qui ne veuille pas quelque chose de différent de nous."
Geoffrey Hinton, lauréat du prix Turing · Ancien VP & Engineering Fellow, Google · 2023
« Beaucoup de chercheurs qui travaillent en IA, comme moi, sont convaincus que nous construisons l’une des technologies les plus transformantes et potentiellement dangereuses de l’histoire humaine, et pourtant nous avançons quand même. »
Eliezer Yudkowsky, Co-Founder, Machine Intelligence Research Institute · Temps, 2023
« Le vrai risque avec AGI n'est pas la malveillance, mais la compétence. Une IA superintelligente sera extrêmement douée pour atteindre ses objectifs, et si ceux-ci ne sont pas alignés sur les nôtres, nous sommes en difficulté. »
Max Tegmark, Professeur de Physique, MIT · Co-Fondateur, Future of Life Institute · Auteur, Life 3.0
Rejoignez ceux qui travaillent à faire de ces connaissances une politique.