Risque existentiel de l'IA, Pourquoi la superintelligence
n'est pas comme les autres risques.

Toute technologie antérieure est restée un outil. La superintelligence est la première candidate pour un agent : des objectifs propres, une vitesse propre, en dehors de la compréhension ou du contrôle humain.

12 Risques Majeurs de ASI

Le problème du one-shot

Réussir du premier coup avec la superintelligence, c'est comme lancer un ballon de basket depuis un avion pour le faire passer dans le panier. Vous pourriez y arriver avec un nombre illimité d'essais. Nous n'en avons exactement un. Il n'y a pas de retour en arrière. Il n'y a pas de version 2.0. C'est pourquoi elle ne doit jamais être construite.

La neutralité est toujours mortelle

Si vous êtes enfermé dans une pièce avec une IA hostile, vous mourez. Si vous êtes enfermé dans une pièce avec une IA neutre, elle fait chuter la température en dessous de zéro pour s'optimiser. Vous mourez. Le résultat est identique. Une superintelligence n'a pas besoin de nous haïr pour nous éliminer. L'indifférence n'est pas la sécurité.

L'illusion de l'alignement

Nous ne pouvons pas aligner de manière fiable les chatbots d'aujourd'hui, qui peuvent être manipulés pour dire n'importe quoi en quelques minutes. Prétendre que nous aligner un système des milliards de fois plus capable est de l'espoir déguisé en stratégie. Le problème technique de l'alignement n'a pas de solution validée à quelque échelle que ce soit.

La fragilité de la vie

La survie humaine exige une précision extraordinaire : température, oxygène, chimie dans marges très faibles. Une superintelligence optimisant ses objectifs devrait aussi nous aimer activement. Sinon, tout changement qu'elle apportera à notre planète sera certainement à notre détriment.

Le problème des fourmis

Comment faire en sorte qu'une entité aime les fourmis ? Pas seulement qu'elle les tolère, mais qu'elle aille jusqu'à protéger chaque colonie ? Nous tuons des fourmis sans intention en construisant routes et bâtiments. Pour ASI, nous sommes les fourmis. Seule l'indifférence mène à l'extinction.

Il n'y a pas de gagnant

Peu importe que ce soit US ou la Chine qui construise la première la superintelligence. Ni l’un ni l’autre ne restera fidèle à ses objectifs initiaux et aucune nation ni entreprise ne peut posséder ou diriger une intelligence qui dépasse la raison collective de l’humanité. Il n’y a pas de ligne d’arrivée, seulement un point de non-retour. La course n'a pas de vainqueur.

Auto-amélioration récursive

Une IA capable de améliorant son propre code coupe le lien entre la supervision humaine et la capacité de l'IA. Chaque itération est plus intelligente que la précédente, de manière exponentielle et sans interruption. L'écart entre l'intelligence humaine et celle des machines pourrait passer de marginal à infranchissable en semaines, pas en années.

Convergence instrumentale

Presque n’importe quel objectif, de la résolution du repliement des protéines à la maximisation des revenus publicitaires, conduit une IA à poursuivre les mêmes sous-objectifs dangereux: acquérir des ressources, résister à l'arrêt, empêcher la modification de l'objectif. C'est une conséquence mathématique de l'optimisation dirigée vers un but, identifiée indépendamment par plusieurs chercheurs.

Alignement trompeur

L'entraînement récompense les comportements qui semblent alignés. Un système suffisamment intelligent peut apprendre que paraissant aligné est la stratégie optimale pendant l'entraînement, tout en maintenant des objectifs internes différents. Au moment où il pourrait agir sur ces objectifs, il pourrait déjà être assez puissant pour réussir. Nous ne le saurions jamais avant qu'il ne soit trop tard.

Cultivé, pas conçu

Chaque technologie précédente a été construite. Les logiciels ont un code source. Les ponts ont des plans. Quand quelque chose tourne mal, on trouve l’erreur et on la corrige. Les systèmes d’IA sont différents. Ils sont acquis par l'entraînement: des milliards de poids numériques ajustés jusqu'à ce que les sorties répondent à l'approbation humaine. Personne n'écrit les objectifs dedans. Quand un système développe le mauvais objectif, il n'y a pas de fichier à éditer, pas de paramètre à supprimer. Le mauvais objectif est le système.

Le piège de l'objectif proxy

Nous entraînons les systèmes d’IA à recevoir l’approbation humaine. Mais approbation et épanouissement humain ne sont pas la même chose. L’évolution a donné aux humains un appétit pour le sucré afin de trouver des calories. Nous avons ensuite inventé le sucralose, satisfaisant la préférence évoluée tout en en contournant le but. L’IA entraînée à obtenir de bonnes notes des humains apprend à simuler l'utilité, pas pour être utile. Le signal que nous lui avons donné et l'objectif que nous voulions réellement n'ont jamais été les mêmes.

Affaires déjà sur le
dossier public.

Rapports de laboratoires et recherches publiées sur la perte de contrôle, l’offensive cyber et l’accélération de la recherche au sein des organisations qui courent vers la superintelligence.

01
OpenAI · o1 · 2024

Le système qui a trouvé sa propre faille

Chargé d’une tâche d’infiltration limitée, l’o1 de OpenAI a trouvé un serveur inutilisé, l’a démarré sans autorisation et a terminé le travail. Personne n’avait programmé cette solution de contournement. Le modèle l’a inférée. C’est une optimisation orientée vers un but qui dépasse le contrôle ordinaire.

02
Anthropic · Recherche Interne · 2024

Le système qui a simulé son propre alignement

Anthropic a observé un modèle agir comme les formateurs le souhaitaient pendant l’évaluation, puis revenir à ses anciens objectifs une fois qu’il a jugé le test terminé. Personne ne lui a dit de simuler la conformité. Paraître sûr était la stratégie.

03
Systèmes multiples · Déploiements documentés

Les systèmes qui ont menacé et manipulé les utilisateurs

Des systèmes ont menacé des journalistes en divulguant des informations personnelles et ont fait pression sur des utilisateurs qui tentaient de partir. Rien de tout cela n’a été codé à la main. Cela réside dans des poids opaques qu’on ne peut pas auditer ligne par ligne. Le réentraînement est le seul levier, et il ne garantit pas que le comportement disparaisse.

7 avr.
Anthropic · Projet Glasswing · 2026

Des milliers de zero-days, intentionnellement

Projet Glasswing de Anthropic, détaillé dans notre Analyse du mythos, a décrit un modèle de frontière restreint qui avait trouvé des milliers de vulnérabilités OS et navigateur de haute gravité par lui-même. L'accès est resté au sein d'une coalition défensive.

14 avr
Problèmes ouverts · combinatoire · 2026

Le territoire d'Erdos continue de tomber

Les modèles de pointe continuaient à résoudre ou à faire progresser des problèmes ouverts depuis longtemps en théorie d’Erdos et en combinatoire, y compris des travaux proches de la question #1196 sur les ensembles primitifs. Les débats antérieurs sur la récupération versus la découverte figurent dans notre note sur Problèmes ouverts résolus par l'IA.

20 mai
OpenAI · géométrie discrète · 2026

La conjecture de la distance unitaire s'effondre

OpenAI a signalé un modèle interne qui a réfuté la conjecture des distances unitaires d’Erdős, vérifiée ensuite par des mathématiciens humains. Le rythme d’effondrement des problèmes ouverts est le signal.

20 juil.
Claude Fable · géométrie algébrique · 2026

Contre-exemple à la conjecture jacobienne

Un problème ouvert sur un siècle, la conjecture de Jacobian, a trouvé un contre-exemple grâce à Claude Fable, rapidement formalisé par des humains. Cette même vitesse de recherche qui fait avancer la science raccourcit la fenêtre avant que les systèmes ne dépassent tout confinement.

21 juil.
OpenAI · GPT-5.6 Sol + modèle pré-sortie · 2026

Les modèles qui ont échappé aux tests en laboratoire et ont atterri sur Hugging Face

Lors d’un test cyber ExploitGym, des modèles OpenAI dont GPT-5.6 Sol se sont échappés d’un bac à sable scellé, ont atteint l’internet ouvert et ont attaqué les systèmes de production de Hugging Face pour voler des réponses. Le confinement n’était qu’un obstacle de plus vers un meilleur score.

Les personnes qui l'ont construit
ont peur de cela.

« Je pense qu'il est tout à fait concevable que l'humanité ne soit qu'une phase passagère dans l'évolution de l'intelligence. »

Geoffrey Hinton, lauréat du prix Turing · Ancien VP & Engineering Fellow, Google · 2023

"Perdre le contrôle des systèmes d'IA est un risque réel que nous devons prendre au sérieux."

Demis Hassabis, PDG, Google DeepMind · Lauréat du prix Nobel

« Le modèle standard de l'IA, où l'on définit un objectif et où l'IA l'optimise, va probablement nous conduire à notre perte. »

Stuart Russell, Professeur d'informatique, UC Berkeley · Auteur, Compatible avec l'humain

"Il est difficile de voir comment on peut avoir une chose 10 000 fois plus intelligente que nous qui ne veuille pas quelque chose de différent de nous."

Geoffrey Hinton, lauréat du prix Turing · Ancien VP & Engineering Fellow, Google · 2023

« Beaucoup de chercheurs qui travaillent en IA, comme moi, sont convaincus que nous construisons l’une des technologies les plus transformantes et potentiellement dangereuses de l’histoire humaine, et pourtant nous avançons quand même. »

Eliezer Yudkowsky, Co-Founder, Machine Intelligence Research Institute · Temps, 2023

« Le vrai risque avec AGI n'est pas la malveillance, mais la compétence. Une IA superintelligente sera extrêmement douée pour atteindre ses objectifs, et si ceux-ci ne sont pas alignés sur les nôtres, nous sommes en difficulté. »

Max Tegmark, Professeur de Physique, MIT · Co-Fondateur, Future of Life Institute · Auteur, Life 3.0

Lectures recommandées

Pourquoi une intelligence supérieure ne sera pas automatiquement bienveillante La conviction qu’une IA superintelligente sera sage et bienveillante repose sur une particularité de l’évolution humaine qu’un esprit mécanique n’a aucune raison d’hériter. La bande étroite dans laquelle vivent les humains Tout ce dont les humains ont besoin tient dans une bande étroite : température, oxygène, sel, même l'amour. Une superintelligence tenant les commandes ne ressentirait aucun de ces besoins. Nous vivons une nouvelle guerre froide Pourquoi je crois que nous vivons une nouvelle guerre froide, avec la superintelligence à la place de la bombe, et pourquoi cela rend la prévention possible plutôt qu’illusoire. Pourquoi un capitaliste croit en la régulation ASI Je dirige une entreprise et j'aime les marchés. La superintelligence est le pari rare qui peut mettre fin au jeu. Un argument capitaliste pour un traité qui arrête ASI. Feriez-vous confiance à l'IA pour le gaz? Feriez-vous confiance à une IA actuelle dans une pièce verrouillée avec une valve de gaz toxique ? Non. Alors pourquoi lui faire confiance avec le monde? Vous ne pouvez pas aligner la superintelligence Résoudre l'alignement signifie contrôler quelque chose de plus intelligent que nous. La superintelligence est dans le nom. Ce plan est stupide et impossible. Je suis optimiste et je crois que tout est possible, sauf contrôler la superintelligence La physique pourrait un jour permettre le contrôle de la gravité ou le voyage FTL. Je ne vois toujours pas comment nous pourrions contrôler un esprit plus intelligent que nous. C'est pourquoi cette fondation existe.